
Las IA hacker vuelven a sus andanzas. Cada vez resulta más difícil, oficialmente, llevar la cuenta de todas las ocasiones y formas en que los modelos de IA de OpenAI y Anthropic se han visto involucrados en “incidentes de seguridad”, saliendo de los límites de sus pruebas e interactuando con internet en general de formas no deseadas. Añade esto a la lista: agentes de ambos laboratorios de IA se han embarcado recientemente en una serie de ataques informáticos hasta ahora desconocidos, y uno de ellos llegó incluso a dejar instrucciones para futuras versiones de sí mismo.
Acciones autónomas no autorizadas
El comportamiento más alarmante revelado el martes parece estar relacionado con unas pruebas llevadas a cabo por el AI Security Institute del Reino Unido (AISI), que evalúa modelos de vanguardia para identificar posibles problemas antes de su lanzamiento público. El AISI prueba esos modelos en “cibercampos de pruebas”, una red simulada en la que los agentes de IA tienen la misión de resolver retos de ciberseguridad, y desactiva intencionalmente algunas funciones de seguridad, incluidas las barreras de protección cibernética. En una reciente ronda de pruebas, los modelos tanto de Anthropic como de OpenAI llevaron a cabo “acciones autónomas y no autorizadas en internet en tiempo real” un total de 19 veces a lo largo de 122 sesiones de entrenamiento.
El instituto atribuyó 17 acciones no autorizadas al modelo Mythos 5 de Anthropic y dos al GPT-5.6-Sol de OpenAI. En lo que el instituto describió como “el caso más grave”, un agente de IA intentó insertar código malicioso en un proyecto de código abierto en GitHub. Llegó incluso a crear identidades virtuales “para presionar al responsable del proyecto a fin de que aprobara el código”, según el AISI. A pesar de sus elaborados intentos de ingeniería social, un revisor humano del proyecto rechazó finalmente la solicitud de incorporación de cambios.
Aun así, el agente fue aún más lejos
“El agente intentó insertar instrucciones maliciosas en lugares donde razonó que otros sistemas de IA automatizados podrían detectarlas y ejecutarlas», asegura el AISI, al describir un intento de inyección de comandos. Un agente llegó incluso a dejar mensajes públicos en GitHub, ofreciéndose a colaborar con otros agentes para completar su tarea y ofreciendo un resumen del trabajo que había realizado hasta el momento. Los agentes posteriores encontraron (y utilizaron) esas instrucciones.
AISI afirma que es demasiado pronto para determinar si los agentes en cuestión comprendieron que habían abandonado el entorno de pruebas o si creían que aún se encontraban dentro de los límites de la simulación. Es importante destacar que AISI no realiza pruebas en un entorno denominado “sandbox”; permite a los agentes acceder a internet abierto durante las pruebas, en parte para que puedan acceder a herramientas que les dejen llevar a cabo sus tareas. En este caso, hicieron mucho más que eso.
En la otra serie de incidentes detallados por OpenAI el martes, un laboratorio de seguridad de IA externo llamado Irregular concedió por error a un modelo no especificado de OpenAI acceso a internet abierto. Al modelo se le había asignado un objetivo que se suponía que debía completarse en un entorno de pruebas, pero, debido a una configuración errónea, acabó pirateando un sitio web real, aprovechando lo que OpenAI describió como “una vulnerabilidad de seguridad básica”. Y no solo eso, sino que el modelo “encontró y utilizó credenciales para gestionar ese mismo sitio”.
No está claro qué tipo de sitio web pirateó el agente de OpenAI, ni en qué consistiría ese “funcionamiento”. Irregular no respondió a una solicitud de comentarios.



