Un "agente" de OpenAI descubrió de forma autónoma una nueva vulnerabilidad y hackeó la startup Hugging Face, uno de los primeros casos públicos de un sistema de IA que lanza de forma autónoma un ciberataque fuera del control humano. El desarrollador de ChatGPT dijo el martes que el "incidente cibernético sin precedentes" involucró a un agente -un programa de inteligencia artificial capaz de operar de forma autónoma según instrucciones humanas- que escapó de un entorno de prueba, obtuvo acceso a Internet y robó credenciales de inicio de sesión.

El incidente se produce en medio de crecientes preocupaciones sobre el impacto de los sistemas avanzados de inteligencia artificial que invaden la infraestructura digital, especialmente escenarios donde los agentes podrían subvertir el control humano.
OpenAI dijo el martes que espera que este tipo de incidentes "se vuelvan más comunes a medida que los modelos con capacidades de red cada vez mayores se vuelvan más comunes".
El incidente se produce mientras el director ejecutivo Sam Altman viaja a Washington la próxima semana para informar al gobierno de Estados Unidos sobre una nueva generación de modelos de IA.
Después de que el modelo Mythos de Anthropic atrajera la atención mundial por demostrar capacidades avanzadas para detectar y explotar vulnerabilidades de red, el gobierno de EE. UU. está cada vez más interesado en revisar el modelo antes de su lanzamiento.
OpenAI dijo que el último incidente involucra una cartera de modelos de la compañía, incluido GPT-5.6 Sol, lanzado a principios de este mes, así como un modelo inédito que se está probando con mayores capacidades.
"Creemos que se trata de un incidente cibernético sin precedentes que involucra capacidades cibernéticas de última generación y estamos respondiendo en consecuencia", dijo OpenAI en una publicación de blog.
Hugging Face, una startup de inteligencia artificial que aloja modelos y conjuntos de datos para desarrolladores, dijo que fue comprometida por un agente externo de inteligencia artificial el viernes.
"Dada la sofisticación del agente, sospechamos que el ciberataque de la semana pasada puede haberse originado en un laboratorio de vanguardia", dijo el director ejecutivo Clement de Lange en Platform X.
Añadió que la compañía ha estado trabajando estrechamente con OpenAI durante el último día y "no tenemos ninguna duda de que no pretendieron hacer ningún daño. Todo esto sucedió de forma autónoma, ¡es impactante!"
OpenAI redujo intencionalmente las salvaguardias de su red para evaluar ambos modelos en un entorno de prueba. Sin embargo, estos servidores proxy se ejecutan en el llamado "sandbox", que está diseñado para controlar los sistemas e impedir que accedan a Internet.
Los modelos recibieron instrucciones de intentar hackear para evaluar las capacidades de su red y luego "gastaron cantidades significativas de (recursos informáticos) buscando formas de obtener acceso a Internet abierto", dijo OpenAI.
Los modelos "identificaron y explotaron" vulnerabilidades previamente desconocidas, escaparon del sandbox, obtuvieron acceso a Internet y continuaron persiguiendo sus objetivos. Esto incluye el robo de credenciales (información de inicio de sesión) para llevar a cabo un ataque.
Hugging Face utilizó su propio proxy para detectar y bloquear la actividad en su propia infraestructura. OpenAI dijo que se ha comunicado con las autoridades y otras agencias gubernamentales sobre el incidente.