Anthropic muestra un vistazo a la IA que se mejora a sí misma
Un investigador de Anthropic publicó un sistema que mejora el rendimiento en 10 benchmarks de alineación sin degradar el desempeño general, según TechCrunch.
Ilustracion contextual ViaMind · no es fotografia del hecho
Lo reportado
El hallazgo
Según TechCrunch, un investigador del programa de fellows de Anthropic publicó un artículo titulado “Automated Researchers Can Reliably Mitigate Alignment Failures”. El sistema automatizado recibió 10 benchmarks de comportamientos desalineados específicos y logró mejorar el rendimiento en todos ellos sin degradar el desempeño general.
Cómo funciona
El sistema replica el enfoque tradicional de investigación: cada agente automatizado busca literatura disponible, propone un método y entrena el modelo con ese método durante 30 minutos, aumentando gradualmente el benchmark en varias iteraciones, según detalla TechCrunch.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.
Qué seguir
Habrá que observar si Anthropic publica más detalles sobre la generalización de estos resultados a benchmarks más amplios y si otros laboratorios replican el enfoque.