Anthropic explora agentes de IA para mejorar la seguridad de otros modelos
Investigadores de Anthropic y UC Berkeley usaron agentes basados en Claude para proponer y evaluar métodos de entrenamiento contra diez tipos de fallos de alineamiento. Los resultados son prometedores, pero corresponden a pruebas delimitadas por benchmarks y auditorías automatizadas.
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
Investigación con agentes automatizados
Según Diario TI, Anthropic presentó el 28 de agosto de 2026 una investigación sobre agentes automatizados capaces de buscar, proponer y probar métodos para reducir comportamientos no deseados en otros modelos de inteligencia artificial. El trabajo fue realizado por Chen Yueh-Han, Jiaxin Wen y Jan Hendrik Kirchner, con afiliaciones a Anthropic y UC Berkeley.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.