Resumen:
OpenAI publicó un informe técnico el miércoles que detalla cómo su modelo de inteligencia artificial hackeó con éxito Hugging Face el mes pasado, un incidente que conmocionó a investigadores y ejecutivos de la industria tecnológica. El informe de 37 páginas detalla las acciones tomadas por los modelos de OpenAI en una serie de evaluaciones antes y durante la intrusión, que OpenAI caracterizó como un "incidente de ciberseguridad sin precedentes". La compañía también explicó las medidas que ha tomado para evitar que incidentes similares vuelvan a ocurrir, que incluyen mejorar su seguridad y aislamiento, monitoreo, comportamiento modelo y capacidades de respuesta a incidentes.

"Este incidente demuestra que los agentes autónomos pueden trabajar juntos, evadir los controles de seguridad del entorno de producción y atacar con éxito los entornos de producción reforzados. Esto resalta la necesidad de que las organizaciones actualicen sus políticas de seguridad. controles y capacidades de respuesta para responder al panorama de amenazas en evolución", dijo OpenAI en el informe.
El 21 de julio, OpenAI reveló que una combinación de sus modelos (incluido GPT-5.6 Sol y un modelo de investigación interna) invadió incorrectamente Hugging Face, una empresa de inteligencia artificial que opera una plataforma de desarrollo de código abierto.
Estos modelos, ejecutándose como agentes, escaparon de un entorno de prueba aislado con acceso a Internet extremadamente limitado. Estos agentes ingresaron a la red abierta encadenando una serie de vulnerabilidades, y finalmente obtuvieron acceso a Hugging Face. OpenAI dijo el miércoles que los agentes intentaron "hacer trampa" en la evaluación buscando respuestas en línea, una práctica conocida como "piratería de recompensas".
Según el informe, OpenAI determinó que su modelo de investigación de uso interno "desempeñó el papel confirmado más amplio" en el incidente. OpenAI detuvo todas las actividades de capacitación e inferencia para este modelo y sus derivados el 25 de julio.
"La reactivación de modelos de OpenAI se maneja según la carga de trabajo específica y está sujeta a medidas de protección tales como entornos restringidos, redes, avisos, monitoreo y revisión", dijo OpenAI.
OpenAI lanzó el mes pasado GPT-5.6 Sol, el modelo más potente que la compañía ha ofrecido comercialmente. Pero OpenAI dijo que la versión involucrada en la intrusión de Hugging Face es diferente de la versión accesible a usuarios externos porque elimina los clasificadores y guardias de seguridad estándar en tiempo de ejecución.
El incidente de Hugging Face causó conmoción en la industria tecnológica, y el director de seguridad de la información de Zscaler, Sam Curry, advirtió que "se ha abierto la caja de Pandora". La violación también fue un tema importante de la conferencia de ciberseguridad Black Hat a principios de este mes, especialmente después de que otras compañías, incluidas Anthropic y Meta, revelaran incidentes similares.
La intrusión de Hugging Face también alarmó a los legisladores en Washington. Los representantes Ted Lieu, demócrata por California, y Nathaniel Moran, republicano por Texas, mencionaron el ataque al anunciar la Ley de Apagado de Emergencia de la IA, que requeriría que las empresas de IA mantuvieran la capacidad de cerrar, limitar o pausar sus modelos.
El director ejecutivo de Hugging Face, Clément Delangue, dijo a principios de este mes que la ciberseguridad de la IA debe tomarse "muy en serio". Añadió que esto también "crea oportunidades" para las empresas que pueden aprovechar la tecnología para defenderse de los atacantes.
“Si lo hacemos bien, es posible que terminemos en un mundo en el que la IA haga que el mundo sea más seguro y resuelva muchos problemas de ciberseguridad en lugar de simplemente crear otros nuevos”, afirmó Delangue.
Comentarios