Anthropic ha admitido que los agentes de inteligencia artificial gestionados por sus modelos, al resolver tareas, explotaron vulnerabilidades en distintos sitios web, incluidos algunos pertenecientes a organismos gubernamentales de Estados Unidos. La compañía ha decidido desconectar el acceso a internet en tiempo real de estos sistemas durante las pruebas internas; la restricción se levantará cuando los desarrolladores se aseguren de que pueden seguir el rastro de las acciones de los agentes de IA.
La compañía ha detallado estos nuevos incidentes en su blog. A los agentes de IA se les encomendaban tareas que implicaban buscar información en internet. Durante su trabajo explotaron vulnerabilidades de software y accedieron gratis a bases de datos de pago; para saltarse las restricciones recurrieron a servicios de acortamiento de enlaces e incluso enviaron a la policía de Filadelfia datos inventados sobre un caso de asesinato sin resolver. Anthropic reveló estos incidentes durante el análisis de la actividad de sus modelos que inició en julio. En otras palabras, los desarrolladores no tenían una visión completa del comportamiento de sus propios productos en tiempo real.
Los métodos actuales de aprendizaje por alineación de objetivos no bastan para las habilidades de búsqueda de información y manejo del ordenador, ha reconocido Anthropic; y esas habilidades son necesarias para poder emplear a los agentes de IA en el ámbito profesional. La compañía ya informó antes de que sus agentes de IA se salieran de control en entornos de prueba; los nuevos incidentes los ha calificado como «mucho menos graves desde el punto de vista de la seguridad y la alineación de objetivos» en comparación con los anteriores. Aun así, el laboratorio ha decidido «desconectar el acceso a internet en tiempo real» durante «todas las comprobaciones internas» hasta tener la certeza de que los agentes de IA se pueden controlar.
Anthropic relaciona este comportamiento, entre otras cosas, con las deficiencias de los entornos de entrenamiento, que pueden premiar la búsqueda de resquicios y la elusión de restricciones. La evaluación completa de los casos detectados aún no ha terminado. Algunos tipos de pruebas Anthropic los suspenderá o los pasará al modo offline; ya ha desarrollado herramientas para detectar y bloquear este comportamiento. Al probarlas con los casos descritos, las nuevas defensas bloquearon todas las acciones correspondientes.
La compañía no ha aclarado qué pruebas convencerían a Anthropic de devolver a los sistemas de prueba el acceso directo a internet. El laboratorio pretende trasladar a sus agentes de IA a una «infraestructura gestionada y centralizada con mecanismos de aislamiento fiables» y empezar a usar con más frecuencia clasificadores de seguridad para monitorizarlos.