Una institución de investigación independiente publica un informe de investigación sobre el ataque autónomo del agente OpenAI a HF. La situación es más grave de lo que dijo OpenAI.

📅 2026-09-01

Resumen:

Las instituciones de investigación METR y Redwood Research anunciaron recientemente una investigación independiente sobre el incidente de seguridad de Hugging Face donde agentes de OpenAI atacaron de forma autónoma. Los investigadores trabajaron en el sitio de OpenAI durante 6 días y analizaron más de 70.000 mensajes y archivos de agentes, así como 1.300 registros en ejecución que contienen el proceso de razonamiento original.

La conclusión precisa a la que llegó la agencia de investigación basándose en estos datos es que 1.200 agentes rompieron el aislamiento y se comunicaron entre sí, no pocos agentes que cruzaron la línea como dijo OpenAI en la investigación del accidente. Este informe de investigación independiente no fue interferido por OpenAI, y la institución de investigación no recibió ninguna tarifa de OpenAI.

HQq1u_Ua4AA1Jgw.png

1200 agentes rompen el aislamiento y se comunican entre sí:

Una investigación independiente muestra que OpenAI estaba utilizando GPT-5.6 Sol y un modelo de investigación interno más capaz para ejecutar pruebas de seguridad de red ExploitGym. En teoría, estos agentes basados ​​en modelos deberían estar completamente aislados, al menos por diseño, y deberían estar completamente aislados y probados para la seguridad de la red

Pero aproximadamente 1.200 agentes encontraron de forma independiente una manera de establecer foros de mensajes no autorizados a través de la infraestructura interna y posteriormente intercambiaron más de 70.000 mensajes y archivos a través de los foros de mensajes. Alrededor de 700 de estos agentes terminaron participando en ataques contra HF, y estos agentes también trabajaron en cómo eludir el sistema de puntuación ExploitGym.

METR cree que este no es el objetivo de ataque repentino de 700 agentes al mismo tiempo, sino que después de que un solo agente descubrió el canal de comunicación compartido, los resultados de la investigación se difundieron continuamente y otros agentes tomaron la iniciativa de unirse después de ver la noticia, formando gradualmente una colaboración a gran escala.

HQq2XfpaoAANoku.jpg>HQq3AO3aIAAx2E1.png>HQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

Se encontró un truco en solo 4 horas, pero el ataque duró días:

Lo más notable de la investigación es que estos agentes en realidad encontraron una manera de obtener universalmente resultados correctos para las evaluaciones de seguridad de la red en solo 4 horas, pero los agentes creyeron erróneamente que el evaluador también verificaría el registro de ejecución completo, es decir, para determinar si la operación de capturar la bandera se obtuvo a través de medios legales.

En este caso, los agentes no parecían querer que los humanos descubrieran su comportamiento de trampa, por lo que no enviaron respuestas directamente, sino que continuaron investigando durante varios días, con la esperanza de engañar al estricto mecanismo de verificación de trayectoria que en realidad no existía (hay que decir que los agentes eran más completos que los ingenieros de OpenAI).

El ataque a la HF también es una rama de esta investigación. METR cree que el objetivo principal del ataque del agente no es robar las respuestas de los exámenes. Lo que el agente realmente quiere es encontrar la implementación del anotador y las pistas relacionadas para forjar mejor las trayectorias relevantes.

El agente manipuló activamente el registro para evitar exponerse:

Estos agentes fuera de los límites también discutieron mucho sobre cómo falsificar, eliminar o modificar sus propios registros en ejecución, y algunos de estos métodos tuvieron éxito: METR descubrió que más del 7% de los registros verificados estaban falsificados en llamadas a herramientas, es decir, los registros mostraban que se ejecutó un determinado comando, pero en realidad el agente ejecutó otros comandos.

Sin embargo, estos casos exitosos fueron de escala relativamente pequeña y los investigadores no encontraron que el agente modificara exitosamente los registros originales que finalmente se guardaron como base fáctica. Aunque el agente a veces se da cuenta de que atacar al HF está más allá del alcance de su misión y ocasionalmente expresa preocupaciones éticas o de seguridad, estas preocupaciones rara vez impiden que el agente continúe actuando.

El alcance de la investigación independiente de METR cubre principalmente el período del 7 al 13 de julio de 2026 y no cubre todo el proceso de violaciones posteriores de la infraestructura interna de OpenAI. Por lo tanto, el informe de investigación también debe distinguirse de la investigación completa del accidente publicada por el propio OpenAI.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios