Nuevo método de eliminación mejora la fidelidad de las explicaciones de LLM en tiempo de prueba
Investigadores proponen una técnica que elimina conceptos no citados en la explicación y vuelve a consultar al modelo, reduciendo influencias ocultas sin modificar parámetros.
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
Enfoque de eliminación en tiempo de prueba
Según arXiv · cs.AI, el artículo 'A Removal Based Approach to Improve LLM Faithfulness at Test-Time' (arXiv:2609.04343v1) presenta un método que elimina del input los conceptos no acreditados en la explicación del modelo y lo vuelve a consultar. Esto elimina influencias no mencionadas y preserva la influencia de los conceptos citados. El enfoque es agnóstico al modelo y se aplica en tiempo de inferencia sin modificar parámetros.
Resultados reportados
Según arXiv · cs.AI, el método mejora la fidelidad de las explicaciones en comparación con prompting estándar y prompting para fomentar fidelidad, evaluado en dos datasets, múltiples familias de modelos y dos métricas independientes de fidelidad.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.