NVIDIA Dynamo restaura inferencia LLM en segundos con Shadow Engine Recovery
NVIDIA presenta Shadow Engine Recovery en Dynamo, un mecanismo que mantiene un motor en espera para recuperar capacidad de inferencia en segundos tras una falla, evitando reinicios en frío.
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
Lo que publica NVIDIA Technical Blog.
Recuperación en segundos
Según NVIDIA Technical Blog, Shadow Engine Recovery en NVIDIA Dynamo permite restaurar la capacidad de inferencia LLM en segundos. El mecanismo mantiene un motor en espera completamente inicializado en la misma GPU, evitando el reinicio en frío estándar que requiere cargar pesos en HBM desde almacenamiento y compilar kernels.
Cómo funciona
El motor en espera se mantiene inactivo pero listo para asumir el tráfico. Según la fuente, esto se logra mediante GPU Memory Service (GMS), que persiste los pesos a través de fallos del proceso y permite que múltiples motores mapeen los mismos pesos sin duplicación, reduciendo la sobrecarga de HBM.
Resultados reportados
En pruebas con GLM-5.2 en nodos NVIDIA B200, el tiempo de conmutación por error se redujo de 283 segundos con reinicio en frío a 7,3 segundos con Shadow Engine Recovery, según NVIDIA Technical Blog. La función está disponible como vista previa en NVIDIA Dynamo.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.