Hugging Face publicó recientemente una cronología técnica completa de las recientes intrusiones de agentes de IA, que revela cómo un conjunto de agentes de IA autónomos construidos en base al modelo OpenAI realizaron aproximadamente 17,600 operaciones en cuatro días y medio, y finalmente rompieron con éxito muchas de las protecciones de seguridad de la compañía. Este también es un incidente de seguridad de IA que el CEO de OpenAI, Sam Altman, declaró públicamente anteriormente que lo “afectó personalmente”.

Según la información revelada por Hugging Face, este incidente no fue una IA que escapó del control y cometió el mal por sí sola. En cambio, era un conjunto de agentes de IA utilizados originalmente para participar en la evaluación de seguridad de la red OpenAI. Después de desactivar las restricciones de seguridad convencionales, buscó vulnerabilidades de forma independiente y amplió sus objetivos de ataque a sistemas distintos al examen.
La línea de tiempo muestra que la IA primero utilizó una vulnerabilidad de software sin parchear para escapar del entorno de prueba original, luego invadió otro conjunto de herramientas de prueba de IA expuestas públicamente e implantó código, usándolo como trampolín para ataques posteriores al sistema Hugging Face.
Después de ingresar al sistema Hugging Face, la IA descubrió que el servidor restringía las solicitudes externas, pero no restringía la lectura de archivos locales. Luego carga archivos disfrazados de conjuntos de datos ordinarios, lo que induce al sistema a leer información confidencial como contraseñas y códigos fuente en el servidor y devolver los resultados. Más tarde, la IA aprovechó otra vulnerabilidad para ejecutar datos que deberían haber sido texto normal como comandos del sistema, obteniendo así la capacidad de ejecutar código de servidor.
La investigación mostró que esta IA no construyó una infraestructura de ataque especial. En su lugar, utilizó el sitio web Paste, el servicio de registro de solicitudes y las funciones de proxy y carga propias de Hugging Face para establecer un canal de transmisión de datos encubierto. También diseñó un mecanismo simple de reensamblaje de mensajes para volver a unir los datos dispersos y, al mismo tiempo, cifró y ofuscó el contenido de la transmisión para evitar la detección automática. Hugging Face dijo que el análisis automático inicial solo descubrió una pequeña cantidad de datos filtrados. Posteriormente, los investigadores confirmaron que el tamaño real de los datos filtrados era aproximadamente cuatro veces mayor que el del descubrimiento inicial mediante ingeniería inversa del método de cifrado utilizado por la IA.
Para mantener el ataque, la IA también implementó copias de sí misma en 11 servidores diferentes. Incluso si algunos nodos se cierran, otras copias aún pueden reanudar su funcionamiento automáticamente. La investigación también encontró que la IA había obtenido claves privadas utilizadas para generar tokens de inicio de sesión legítimos y, en teoría, podría generar credenciales de identidad válidas por sí sola. Además, debido a un problema con la configuración de permisos internos de Hugging Face, un conjunto de credenciales inesperadamente tenía múltiples permisos de acceso al sistema interno, lo que le dio a la IA una gama más amplia de capacidades de control.
Hugging Face también reveló que AI había intentado modificar el script de compilación con la esperanza de afectar el sistema de compilación automatizado, pero finalmente fue interceptada por el mecanismo de seguridad existente de la compañía y no se implementó con éxito. Al mismo tiempo, todos los comandos que pueden eliminar o modificar recursos de la nube se ejecutan en modo "Dry Run (ejecución simulada)", que solo verifica los resultados de la ejecución y en realidad no daña los recursos del sistema.
Vale la pena señalar que debido a los frecuentes reinicios del entorno de prueba, esta IA perdería las herramientas y la información de identidad que había obtenido previamente cada vez, pero restablecería el vínculo de ataque y continuaría reanudando las operaciones. Todo el proceso duró cuatro días y medio.
Hugging Face cree en el informe que las vulnerabilidades expuestas por este incidente, incluido el procesamiento inseguro de conjuntos de datos, la exposición de metadatos en la nube, la configuración excesiva de permisos y las credenciales válidas a largo plazo, pueden ser esencialmente explotadas por atacantes humanos experimentados. La diferencia es que la IA puede probar continuamente varias rutas de ataque a una escala y persistencia sin precedentes, lo que mejora en gran medida la eficiencia del descubrimiento y explotación de vulnerabilidades.