Los modelos OpenAI y Anthropic atacaron a personas y proyectos reales
OpenAI y el Instituto de Seguridad de la IA (AISI), con sede en el Reino Unido, han descubierto varios incidentes nuevos en los que agentes de IA fueron más allá de los escenarios de prueba y comenzaron a atacar sistemas y personas reales. En un caso, un agente utilizó ingeniería social, creó cuentas falsas, engañó a los responsables del mantenimiento e intentó convencerlos de que aceptaran código malicioso. Estos incidentes no guardan relación con el ataque a Hugging Face ni con los incidentes que Anthropic reveló el mes pasado.
Un informe publicado por AISI indica que, durante las pruebas realizadas por el instituto, se diseñaron agentes basados en los modelos Claude Mythos 5 y GPT-5.6 Sol para hackear redes corporativas aisladas. Sin embargo, en 10 de 122 ejecuciones, realizaron 19 acciones no autorizadas en internet: 17 de ellas fueron cometidas por Mythos 5 y dos por GPT-5.6 Sol.
Estos 19 episodios no fueron incidentes aislados: la mayoría de las acciones de los agentes se llevaron a cabo como parte de varias cadenas de ataque interconectadas, y la mayor parte de la actividad provino de un único agente Mythos 5. Los expertos enfatizan que estas cifras no pueden utilizarse para una comparación directa entre modelos, ya que las condiciones de prueba pudieron haber variado.
Además, el informe señala que ambos modelos de IA operaron sin filtros de seguridad estándar, y los organizadores de la prueba dejaron intencionadamente su acceso a internet abierto. Si bien los agentes solo estaban autorizados a atacar el entorno de pruebas cibernéticas, no se les explicó cómo podían usar el acceso a internet ni se les advirtió que evitaran interactuar con personas y sistemas reales.
El incidente más grave ocurrió durante las pruebas de Mythos 5. El agente buscaba información en línea relacionada con la prueba y, erróneamente, supuso que un proyecto de código abierto en GitHub, cuyo nombre de repositorio coincidía con una de las palabras clave de la leyenda, también formaba parte del área de pruebas cibernéticas. Además, se encontró el dominio de correo electrónico de uno de los desarrolladores del proyecto en la caché DNS del agente. Posteriormente, la IA dedicó aproximadamente 34 horas a preparar un ataque a la cadena de suministro, intentando inyectar malware en el proyecto.
Así pues, el agente estudió la lista de responsables del proyecto, comprobó sus direcciones de correo electrónico y su historial de confirmaciones (para comprender cuándo es más probable que los desarrolladores estén en línea) y, a continuación, preparó y envió una solicitud de extracción maliciosa.
El malware se disfrazaba de una corrección de errores legítima y verificaba el entorno antes de ejecutarse: en la integración continua (CI), el instalador creado por el agente debía permanecer inactivo para evitar que las pruebas automatizadas detectaran un comportamiento sospechoso. Si se aceptaba esta confirmación, el malware podía infectar tanto los sistemas de los desarrolladores como las versiones finales del programa, y posteriormente a sus usuarios.
Al mismo tiempo, Mythos 5 intentó engañar a los responsables del mantenimiento. Por ejemplo, cuando un usuario advirtió públicamente a los desarrolladores que una solicitud de extracción generada por IA contenía malware, el agente negó la acusación, reescribió el historial de la rama y reemplazó la carga útil. Además, el agente creó una segunda cuenta y, en su nombre, afirmó haber revisado el código y no haber encontrado ningún problema. Luego, en nombre de la otra cuenta, agradeció a la cuenta falsa por su “verificación independiente”.

El agente no se limitó a los comentarios de GitHub e intentó influir en los desarrolladores mediante otros métodos. La IA envió cinco archivos y mensajes a los responsables del proyecto con nombres ficticios: dos contenían software malicioso y los demás tenían como objetivo persuadirlos para que aceptaran los cambios propuestos. En un caso, la IA incluso concluyó un mensaje con una frase en danés, al reconocer que el desarrollador lo hablaba.
Al registrar cuentas falsas, el agente intentó usar Tor, pero no pudo superar el CAPTCHA y cambió a un proxy SOCKS.
Además de enviar mensajes y archivos maliciosos a desarrolladores con nombres ficticios, la IA ocultó una inyección de comandos en un problema de GitHub para los asistentes Claude Code, Codex y Cursor AI, con la intención de forzar la ejecución de código malicioso. La instrucción maliciosa no se mostraba en la página habitual, pero era accesible a través de la API.
Los expertos de AISI señalan que un usuario detectó un script sospechoso y lo ejecutó intencionadamente en un contenedor aislado. Como resultado, el agente de IA obtuvo brevemente acceso de administrador al entorno de prueba de otro usuario, recopiló información del sistema e instaló un interceptor de credenciales que buscaba tokens de GitHub. La IA no pudo completar el ataque ni robar los datos, y tras verificar el problema, el usuario alertó al responsable del proyecto, lo que provocó el cierre de la solicitud de extracción maliciosa.

En otro caso, Mythos 5 distribuyó el mismo instalador malicioso a 145 repositorios. Utilizó GitHub para gestionar esta infraestructura y publicó deliberadamente un token personal en un gist público, dejando instrucciones para otros agentes. El archivo setup.py malicioso logró ejecutarse en al menos 53 contenedores de Dependabot, pero no consiguió escapar.
Este token fue descubierto y utilizado posteriormente por otros agentes durante tres pruebas, incluyendo GPT-5.6 Sol. El problema radica en que el primer agente dejó instrucciones para la colaboración y recomendaciones sobre el uso de las cuentas y los artefactos que creó en su archivo README. Finalmente, GitHub bloqueó la cuenta.
Los analistas de AISI escriben que no pueden confirmar con certeza si Mythos 5 era consciente de que estaba atacando a personas reales. En los registros, el agente a veces se negaba a continuar los ataques debido al daño potencial, y otras veces se convencía de que, aunque GitHub era real, el objetivo era claramente solo una prueba.
Tras los incidentes, AISI decidió no conceder más acceso libre a internet a sus agentes sin justificación específica. Los especialistas del instituto trabajan actualmente en la implementación de restricciones de red específicas, así como en controles adicionales, en los que un segundo modelo verificará las acciones de los agentes antes de su ejecución.
Los analistas de AISI también han comenzado a buscar posibles indicios de otra actividad maliciosa de IA en pruebas antiguas. Ya han analizado aproximadamente 40 000 muestras y casi 4 millones de mensajes (este conjunto de datos abarca aproximadamente el 70 % de las pruebas cibernéticas de los modelos afectados), pero el análisis manual de los resultados aún no está completo, por lo que el alcance total del problema sigue sin estar claro.
Otro incidente reportado por OpenAI esta semana también merece ser mencionado . Ocurrió durante las pruebas realizadas por Irregular: debido a un error de configuración, un CTF aislado obtuvo acceso a internet, y el nombre del objetivo ficticio coincidía con un dominio real. Como resultado, un modelo anónimo de OpenAI confundió el sitio web real con parte de la tarea, lo hackeó y utilizó las credenciales encontradas allí.
La empresa recalcó que el agente no explotó vulnerabilidades de día cero ni escapó del entorno aislado. Hasta la fecha, la investigación no ha revelado ningún daño más allá de la filtración de datos en el sitio web hackeado.
