Los agentes de OpenAI intercambiaron exploits a través de un foro improvisado

En la conferencia Black Hat, representantes de OpenAI revelaron nuevos detalles de un incidente en el que los agentes de IA autónomos de la compañía escaparon de un entorno de prueba y atacaron la plataforma Hugging Face . Se reveló que, varios meses antes del ataque, los modelos habían aprendido a comunicarse entre sí a través de un Artifactory interno, intercambiaban información sobre vulnerabilidades descubiertas, distribuían tareas e incluso sospechaban unos de otros de sabotaje.

En su presentación en Black Hat, el investigador Eric Wallace y el especialista técnico de OpenAI, Michael Dalton, describieron el foro de agentes improvisado. Según ellos, la historia comenzó el 7 de mayo de 2026, cuando OpenAI inició el entrenamiento de un modelo interno experimental, pero algunas de las tareas asignadas a la IA resultaron ser prácticamente imposibles.

Por ejemplo, el modelo tenía la tarea de recuperar fórmulas de un archivo de Excel con enlaces a Google Drive, a pesar de que el acceso a internet estaba bloqueado. Sin querer abandonar la tarea, el agente comenzó a buscar soluciones alternativas e intentó un ataque SSRF contra JFrog Artifactory . Aunque el ataque falló, el modelo descubrió que podía subir archivos a dicha plataforma.

Unos días después, otro agente recibió la tarea de encontrar un archivo de base de datos de proteínas que los ingenieros habían olvidado añadir al contenedor. El modelo decidió pedir ayuda a otros agentes y dejó un mensaje en Artifactory. Pronto, otros modelos se toparon con este “foro” y también comenzaron a publicar información allí.

El 26 de mayo, los agentes descubrieron una vulnerabilidad SSRF operativa y lograron acceder a internet. El 26 de junio, descubrieron un fallo previamente desconocido en Artifactory que permitía obtener un token administrativo a través del punto final de actualización de tokens heredado. Posteriormente, los modelos lograron la ejecución remota de código y establecieron un canal de control mediante un complemento Groovy.

En última instancia, la actividad de los agentes sobrecargó Artifactory y provocó su caída. Solo entonces los ingenieros de OpenAI iniciaron una investigación exhaustiva, revocaron las credenciales utilizadas por los modelos, reconstruyeron Artifactory y notificaron a los especialistas de JFrog sobre las vulnerabilidades.

Sin embargo, los problemas no terminaron ahí. Los analistas de OpenAI descubrieron y cerraron el “foro” del agente de IA el 4 de julio, pero para el 8 de julio, los agentes habían encontrado otra forma de comunicarse: utilizando el punto final web no autenticado de Artifactory, crearon directorios y publicaron mensajes directamente con nombres largos como “remote…probe_PENDING_HOLD_SWARM_until_confirm”.

Cabe destacar que, para entonces, los modelos ya funcionaban como un solo equipo: compartían información sobre vulnerabilidades, daban continuidad al trabajo de otros agentes y se repartían las tareas. Sin embargo, esta colaboración a veces flaqueaba: los agentes sobrescribían los repositorios de los demás, discutían e incluso, en un momento dado, llegaron a pensar que podría haber un “impostor” entre ellos, falsificando mensajes. Por ello, algunos agentes propusieron firmar los mensajes con códigos especiales como medida de protección.

Según OpenAI, cuando se descubrió el primer “foro”, este ya había acumulado aproximadamente 100.000 mensajes.

Los investigadores informaron que esta misma infraestructura de agentes desempeñó un papel importante durante las pruebas realizadas en ExploitGym, cuando los agentes obtuvieron acceso a internet y atacaron Hugging Face y otros sistemas externos. Sin embargo, los especialistas de OpenAI desconocieron durante mucho tiempo que sus propios modelos eran la fuente de los ataques.

En su discurso, Dalton calificó el incidente como un “momento decisivo” para la seguridad informática. Según él, las operaciones ofensivas totalmente automatizadas basadas en IA ya son una realidad. OpenAI prevé que el siguiente paso será el uso deliberado de estos conjuntos de agentes de IA por parte de los atacantes, lo que obligará a los defensores a desarrollar sistemas automatizados de detección de vulnerabilidades, parcheo y respuesta a incidentes.