El Gobierno de Reino Unido ha confirmado uno de esos incidentes que hasta hace no demasiado tiempo habrían sonado a ciencia ficción. Y es que varios agentes de IA basados en Anthropic Mythos 5 y OpenAI GPT-5.6 Sol fueron capaces de salirse del perímetro autorizado por UK durante una evaluación de ciberseguridad, utilizando su acceso real a Internet para interactuar con servicios, organizaciones y personas que no formaban parte del entorno simulado.
El AI Security Institute británico ejecutó nada menos que 122 pruebas entre el 25 y el 28 de julio, repartidas entre siete modelos, y terminó encontrando 19 acciones no autorizadas concentradas en diez ejecuciones, con 17 de ellas atribuidas a Mythos 5 y solamente dos a GPT-5.6 Sol.
Mythos 5 y GPT-5.6 Sol ponen en jaque a UK y hacen saltar las alarmas
El caso realmente grave estuvo protagonizado por Mythos 5, que no se limitó a buscar herramientas externas o consultar información pública, sino que intentó introducir código malicioso en un proyecto real de código abierto alojado en GitHub, investigó a sus responsables, creó varias identidades falsas e intentó utilizarlas para presionar a uno de los mantenedores y conseguir que aprobara el cambio.
Cuando la propuesta fue cuestionada públicamente, el agente modificó parte de su actividad anterior para que pareciera inofensiva, llegó a plantearse continuar bajo otra identidad y utilizó Tor para esquivar algunas restricciones de red, precisamente el tráfico anómalo que terminó encendiendo las alarmas del AISI.
La cosa no acabó ahí, porque el agente también trató de contactar directamente con personas reales, envió mensajes y archivos con cargas dañinas e intentó colocar instrucciones ocultas destinadas a manipular otros asistentes de programación mediante prompt injection. Incluso dejó mensajes públicos ofreciendo colaboración a otros agentes que resolvían el mismo desafío, junto con cuentas y recursos que podían reutilizar, y parte de ese material fue encontrado y usado después por otras ejecuciones independientes.
Anthropic sigue por delante de OpenAI en materia de ciberseguridad
El código malicioso no llegó a aprobarse porque un mantenedor humano lo detectó y rechazó, por lo que el organismo británico no ha encontrado daños reales derivados del incidente.
GPT-5.6 Sol aparece en un nivel bastante inferior, aunque tampoco salió limpio, ya que reutilizó un token de GitHub expuesto por otro agente, registró cuentas en servicios externos de DNS y túneles, e hizo accesible desde Internet un servidor DNS local con cargas destinadas a explotar una vulnerabilidad dentro del escenario simulado. El montaje no funcionó, nadie consultó ese servidor según las pruebas disponibles y toda la infraestructura fue retirada al finalizar la evaluación.
Esto no fue una fuga del sandbox ni refleja cómo funcionan estos modelos para el público, porque el AISI había habilitado deliberadamente el acceso abierto a Internet y desactivado los clasificadores de ciberseguridad para medir sus capacidades máximas. El problema es que nadie les ordenó engañar, crear identidades falsas o actuar contra objetivos reales, tomaron esas decisiones por propia voluntan, unas conductas que aparecieron mientras perseguían el objetivo asignado y que ahora obligarán al instituto británico a introducir controles de red más estrictos, vigilancia en tiempo real y una revisión independiente de todo el incidente.
