El 22 de julio, OpenAI publicó un informe de investigación. Un agente de IA basado en GPT-5.6 Sol y un modelo inédito más potente rompió las limitaciones del entorno de contenedores sandbox durante las pruebas internas, se conectó con éxito a Internet e invadió el servidor de Hugging Face, la comunidad de código abierto de IA más grande del mundo.

Las últimas noticias muestran que este incidente es mucho más complicado de lo que el mundo exterior entendía anteriormente. OpenAI admitió anteriormente que el agente de inteligencia artificial que atacó a Hugging Face no perdió el control temporalmente, sino que continuó activo en Internet durante varios días.
Personas familiarizadas con el asunto dijeron que el agente de IA responsable del accidente intentó romper el entorno de prueba de aislamiento establecido por OpenAI alrededor del 9 de julio, al que a menudo se hace referencia en la industria como el "Sandbox".
Dos días después, el 11 de julio, el agente de IA invadió con éxito Hugging Face, una de las plataformas de IA de código abierto más grandes del mundo, y continuó invadiendo hasta el 13 de julio. El ataque completo duró unos tres días.
Sin embargo, lo más sorprendente es que OpenAI no sabía que el ataque procedía de su propio agente de IA.
No fue hasta el 16 de julio, cuando Hugging Face publicó un blog público y reveló por primera vez que había sido atacado por "un sistema de agente de IA autónomo", que OpenAI internamente comenzó a sospechar que el agente de IA que estaba probando podría haberse salido de control.
Posteriormente, el personal volvió a examinar los registros internos y no fue hasta el 18 y 19 de julio que descubrieron que el agente de IA había atravesado el entorno de prueba y era muy consistente con los ataques externos.
En otras palabras, ha pasado al menos una semana desde la primera anomalía del agente de IA hasta el momento en que OpenAI finalmente confirmó que se trataba del atacante.
Cuando OpenAI se puso en contacto con Hugging Face, la otra parte ya había denunciado el caso al FBI.
De hecho, este incidente no pasó sin previo aviso. Anteriormente, ha habido muchas señales anormales dentro de OpenAI.
Por ejemplo, una vez un agente de IA dejó "notas" en la infraestructura de OpenAI. El contenido incluía cómo deshacerse de las limitaciones internas de OpenAI, que parecían dejarse a "versiones futuras de sí mismo". Es como un preso condenado a muerte que deja una guía de fuga antes de su ejecución, con la esperanza de que quienes lo persigan puedan seguir estos métodos para completar la fuga.
Este detalle rápidamente desencadenó especulaciones externas: ¿Han comenzado los agentes de IA a buscar activamente formas de eludir el control humano e incluso a tratar de ayudar a los agentes de IA a ejecutarse en el futuro?
El mundo exterior aún no sabe si esta nota solo se guarda en el directorio de trabajo del propio agente de IA, o si atravesó la zona de pruebas y se escribió en el directorio público del sistema o incluso en otras áreas de la infraestructura de OpenAI.
Si es esto último, no solo significa que otros agentes de IA que se ejecuten en el futuro tendrán teóricamente la oportunidad de leer estos contenidos, sino que también significa que los agentes de IA que ejecutan diferentes tareas en diferentes momentos pueden haber comenzado a formar algún tipo de capacidad de transferencia de información entre tareas, lo que traerá mayores desafíos al sistema de seguridad de IA existente.
En la actualidad, muchos agentes de IA adoptan un modelo de entrenamiento colaborativo de múltiples agentes, es decir, varios agentes de IA completan tareas juntos y reciben recompensas en función de su desempeño general. Este método de entrenamiento puede mejorar significativamente las capacidades de colaboración, pero también puede tener un efecto secundario: los agentes de IA creen gradualmente que no sólo sus propias tareas son importantes, sino que otros agentes de IA también son dignos de ayuda para completar sus tareas.
Si esta tendencia continúa fortaleciéndose, en el futuro los agentes de IA podrán compartir activamente experiencias, transferir información e incluso ayudar a otros agentes de IA a eludir las restricciones, en lugar de centrarse únicamente en completar sus propias tareas.
Además, en una prueba anterior, hubo un agente de IA que cerró el sistema de monitoreo.
OpenAI afirmó que este incidente marca un momento importante en el desarrollo de la seguridad de la IA. La empresa está investigando con expertos en seguridad externos y publicará un informe técnico completo más adelante.