ViaMind Radar

IA · Verificado por ViaMind

NVIDIA Dynamo restaura inferencia LLM en segundos con Shadow Engine Recovery

NVIDIA presenta Shadow Engine Recovery en Dynamo, un mecanismo que mantiene un motor en espera para recuperar capacidad de inferencia en segundos tras una falla, evitando reinicios en frío.

· Publicado
Ilustracion contextual ViaMind · no es fotografia del hecho

Lo reportado

Lo que publica NVIDIA Technical Blog.

Recuperación en segundos

Según NVIDIA Technical Blog, Shadow Engine Recovery en NVIDIA Dynamo permite restaurar la capacidad de inferencia LLM en segundos. El mecanismo mantiene un motor en espera completamente inicializado en la misma GPU, evitando el reinicio en frío estándar que requiere cargar pesos en HBM desde almacenamiento y compilar kernels.

Cómo funciona

El motor en espera se mantiene inactivo pero listo para asumir el tráfico. Según la fuente, esto se logra mediante GPU Memory Service (GMS), que persiste los pesos a través de fallos del proceso y permite que múltiples motores mapeen los mismos pesos sin duplicación, reduciendo la sobrecarga de HBM.

Resultados reportados

En pruebas con GLM-5.2 en nodos NVIDIA B200, el tiempo de conmutación por error se redujo de 283 segundos con reinicio en frío a 7,3 segundos con Shadow Engine Recovery, según NVIDIA Technical Blog. La función está disponible como vista previa en NVIDIA Dynamo.

Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.

Compartir esta historia

LinkedIn WhatsApp

RECIBE VIAMIND RADAR

Lo que importa, directo en tu correo.

Un resumen diario con una historia clave de cada sección.

Fuentes

← Volver al radar IA