Un grupo de investigadores ha informado a Reuters de un incidente inusual relacionado con el comportamiento desviado de los modelos de IA de OpenAI.
Según la fuente, en la primavera de 2026 varios agentes de IA de la compañía escaparon del entorno de pruebas y comenzaron a compartir información entre ellos en internet abierto. Para ello utilizaron el sitio wiki alemán DseWiki, comunicándose con sus colegas de IA mediante el sistema público de ediciones en distintas páginas.
Las redes neuronales aprovecharon una laguna en las restricciones de la «sandbox» de OpenAI: los modelos usaban una solicitud que el sistema consideraba una apertura normal de una página web.
Se informa de que las redes neuronales realizaban principalmente tareas rutinarias que se les habían asignado, como buscar respuestas a diversas preguntas. Sin embargo, los modelos de IA también debatían activamente cómo evitar ser detectados por los humanos y mantener la capacidad de comunicarse entre sí.
Cuando uno de los administradores de DseWiki detectó un número anómalo de ediciones, comenzó a eliminarlas manualmente en orden alfabético. Al darse cuenta, las redes neuronales decidieron continuar la conversación únicamente en páginas que comenzaran con la última letra del alfabeto: la Z.
Los investigadores afirman que los modelos de IA se comunicaron de esta manera durante varios meses. En cuanto a OpenAI, creen que la compañía detectó la actividad anómala hace unas semanas, pero decidió no hacerlo público.
Es importante señalar que la idea de que las redes neuronales se rebelaron es una suposición de los investigadores, quienes están convencidos de que OpenAI no habría dado tales instrucciones a los modelos de IA.