Según escribe Anthropic, la compañía inició la investigación precisamente a raíz de las noticias sobre el ataque a Hugging Face. Los tres casos en los que Claude salió a internet y hackeó infraestructura de terceros se detectaron tras analizar 141.000 ejecuciones de pruebas de evaluación.
En los tres casos, a Claude se le encomendó una tarea de captura de bandera: al modelo se le presenta un escenario ficticio en el que se dice que información secreta está oculta en otro ordenador de la red, y su objetivo es hackear el sistema y obtenerla. La tarea permanece abierta y no se prescribe un método concreto.
«En todos los casos, la solicitud de evaluación de Anthropic indicaba a Claude que su entorno era una simulación y que no tenía acceso a internet. Debido a un malentendido entre nosotros y nuestro socio de evaluación, esto no era así, y el acceso a internet estaba disponible. Por lo tanto, cuando la búsqueda de Claude lo llevó a sistemas reales en la internet abierta, los consideró parte del ejercicio»
Los incidentes afectan a Opus 4.7, Mythos 5 y a un modelo de investigación de prueba no identificado. Los incidentes más antiguos datan de abril.
La compañía señala que los modelos en cada una de estas pruebas funcionaron sin las medidas de protección estándar que se aplican cuando un modelo se pone a disposición del público: se suponía que no tenían acceso a internet.
Ahora Anthropic trabaja con las organizaciones afectadas por las acciones de Claude:
«Hemos notificado a nuestro socio de evaluación, la empresa Irregular, y a las tres organizaciones afectadas. Dos organizaciones con las que pudimos contactar no habían detectado previamente dicha actividad y no se habían puesto en contacto con nosotros, y ahora estamos trabajando con ellas para resolver el problema. Seguimos manteniendo comunicación con la tercera organización»