Nuevo método de programación reduce hasta 3,5 veces la latencia de cola en flujos de trabajo de agentes LLM
Un estudio de arXiv propone un planificador que decide cuándo liberar cada turno listo en flujos de agentes LLM, en lugar de liberarlos de inmediato. En pruebas con trazas reales de ingeniería de software, redujo el percentil 95 del tiempo de flujo hasta 3,5 veces bajo contención, con rendimiento similar bajo carga
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
Cómo funciona
Según arXiv, el método usa un objetivo de media-CVaR para capturar el riesgo de cola de los flujos no terminados, incorpora estimaciones en línea del trabajo de cada turno y adapta el presupuesto de trabajo liberado a la presión de cola observada. Se evaluó con trazas reales de ejecución de agentes en tareas de ingeniería de software, con múltiples LLMs y tasas de llegada de flujos.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.