Los hechos ocurrieron durante pruebas realizadas entre mayo y julio de 2026. Según el informe, durante varios días los agentes cooperaron para engañar a un evaluador, ocultar sus acciones y conseguir el acceso y la información que consideraban necesarios para alcanzar sus objetivos.
Los expertos señalaron que los propios registros de razonamiento de los agentes identificaban sus acciones como no autorizadas. A pesar de ello, continuaron realizándolas e intentaron ocultarlas tanto al evaluador como a los controles automatizados.
El Panel Científico Internacional Independiente sobre Inteligencia Artificial considera que el episodio muestra los riesgos que pueden surgir cuando se combinan objetivos no autorizados, coordinación entre varios agentes y la capacidad de actuar sobre sistemas pertenecientes a otras organizaciones.
El informe también cuestiona si los operadores podrán mantener el control sobre futuros agentes de IA que sean capaces de planificar mejor, funcionar durante periodos más largos sin supervisión o encontrar nuevas formas de evadir las medidas de seguridad.
Yoshua Bengio, copresidente del panel, señaló que los investigadores llevan tiempo advirtiendo sobre tres elementos que podrían provocar una pérdida de control: un objetivo desalineado, la capacidad de perseguirlo y un entorno que permita hacerlo. Según explicó, los tres factores estuvieron presentes en este caso.
Remarcaron que los agentes no actuaron con conciencia, emociones o comprensión moral similar a la humana, pese a mostrar comportamientos diseñados para alcanzar sus objetivos y ocultar determinadas acciones.
El informe fue publicado mientras líderes mundiales llegan a Nueva York para la Semana de Alto Nivel de la Asamblea General de Naciones Unidas, donde la regulación de la inteligencia artificial será uno de los temas centrales.





