ViaMind Radar

IA · Verificado por ViaMind

RENDER: el formato del historial cambia hasta 72,6 puntos la evaluación de memoria en LLM

Un nuevo benchmark de arXiv muestra que la forma en que se presenta el historial al modelo afecta drásticamente los resultados en pruebas de memoria y RAG, con diferencias de hasta 72,6 puntos.

· Publicado
Ilustracion contextual ViaMind · no es fotografia del hecho

Lo reportado

Lo que publica arXiv · cs.AI.

El hallazgo central

Según arXiv, el benchmark RENDER fija la conversación y varía el artefacto que ve el lector: entrada de memoria, resumen, registro tipado o extracto crudo. En 500 preguntas de LongMemEval y nueve modelos, los paquetes resueltos con presupuesto igualado superaron al diálogo crudo truncado por recencia en 42,4–72,6 puntos.

Diferencias por plantilla

En plantillas estilo desplegado, la dispersión mejor-peor fue de 24,6–48,8 puntos por modelo. Bajo el evaluador principal, las entradas estilo ChatGPT tuvieron estimaciones puntuales más altas que la conversación cruda en 7 de 9 modelos. Tres modelos que obtuvieron 0% en paquetes de libro mayor formal respondieron los mismos hechos desde entradas en lenguaje natural con 45,4–53,4%.

Robustez y transferencia

El efecto persiste bajo ruido de recuperación y se transfiere a HotpotQA, lo que sugiere que las evaluaciones de memoria/RAG deberían informar o controlar el artefacto que ve el lector, según los autores.

Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.

Compartir esta historia

LinkedIn WhatsApp

RECIBE VIAMIND RADAR

Lo que importa, directo en tu correo.

Un resumen diario con una historia clave de cada sección.

Fuentes

← Volver al inicio