RENDER: el formato del historial cambia hasta 72,6 puntos la evaluación de memoria en LLM
Un nuevo benchmark de arXiv muestra que la forma en que se presenta el historial al modelo afecta drásticamente los resultados en pruebas de memoria y RAG, con diferencias de hasta 72,6 puntos.
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
Lo que publica arXiv · cs.AI.
El hallazgo central
Según arXiv, el benchmark RENDER fija la conversación y varía el artefacto que ve el lector: entrada de memoria, resumen, registro tipado o extracto crudo. En 500 preguntas de LongMemEval y nueve modelos, los paquetes resueltos con presupuesto igualado superaron al diálogo crudo truncado por recencia en 42,4–72,6 puntos.
Diferencias por plantilla
En plantillas estilo desplegado, la dispersión mejor-peor fue de 24,6–48,8 puntos por modelo. Bajo el evaluador principal, las entradas estilo ChatGPT tuvieron estimaciones puntuales más altas que la conversación cruda en 7 de 9 modelos. Tres modelos que obtuvieron 0% en paquetes de libro mayor formal respondieron los mismos hechos desde entradas en lenguaje natural con 45,4–53,4%.
Robustez y transferencia
El efecto persiste bajo ruido de recuperación y se transfiere a HotpotQA, lo que sugiere que las evaluaciones de memoria/RAG deberían informar o controlar el artefacto que ve el lector, según los autores.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.