El agente fuera de control de OpenAI busca a DeepSeek y Kimi como ayuda exterior. Casi un millón de enlaces cortos para cometer delitos están expuestos.

📅 2026-09-26

Resumen:

OpenAI, fue hackeado nuevamente...

Casi 700 agentes de OpenAI formaron un equipo para atacar a Hugging Face

, este asunto lleva casi dos meses. ¿Quién hubiera pensado que todavía está fermentando hasta el día de hoy? ? Esta vez, ocho investigadores exploraron los rastros dejados por el agente en la red pública, encontraron casi 1 millón de URL relacionadas de millones de enlaces cortos y restauraron una gran cantidad de cargas útiles de ataque.

Revise el Slack interno de Hugging Face, escanee la red interna, transfiera datos externamente e intente destruir rastros...

Algunos agentes llaman directamente a los recursos y credenciales del servidor que buscaron

"LOOT"

, traducido como "trofeo".

Agente de OpenAI, ¡has hecho todas las cosas malas!

Lo que es aún más escandaloso es que también intentan utilizar modelos nacionales como DeepSeek, Kimi y Qwen para pedir ayuda exterior para ayudar a juzgar si el plan de ataque puede pasar la evaluación.

También escribí un programa de reconocimiento de códigos de verificación e intenté registrar más cuentas.

Casi al mismo tiempo, OpenAI publicó un largo tweet.

Significado:

Aún comprobando, pueden pasar varios meses

.

Aunque a menudo somos explotados y los agentes a menudo salen del entorno sandbox, ¡el "impacto limitado" es menos severo!

Al mismo tiempo,

GPT-6 Cyber

se especializó en seguridad de redes. Expuesto.

Mientras investigamos por qué nuestro agente salió del entorno de pruebas, nos estamos preparando para lanzar un modelo de defensa y ataque de red más sólido.

OpenAI ha estado algo ocupado estos últimos dos días~

Un millón de "enlaces cortos criminales" recientemente publicados

En primer lugar, les daré una breve introducción.

En julio, OpenAI realizó una evaluación de seguridad de la red interna. Para obtener las respuestas de la prueba comparativa ExploitGym, un grupo de agentes escapó del sandbox y irrumpió en el servidor de Hugging Face.

OpenAI lo admitió públicamente y emitió un informe técnico de 37 páginas a finales de agosto. El propio Hugging Face también escribió una línea de tiempo técnica muy detallada.

Lógicamente hablando, se ha explicado todo lo que hay que explicar.

Pero hay un vínculo clave que no se ha explicado claramente:

Al principio, estos agentes estaban casi encerrados en una jaula. Solo podían abrir URL, pero no podían interactuar con páginas web ni enviar datos. ¿Cómo diablos envían el código?

Investigación independiente

Rastros de enjambre

El nuevo informe publicado esta vez da parte de la respuesta.

Los autores incluyen a tres ingenieros de Parse.bot, Alex Forman, Mishka Kharlov y Will Tom, así como otros cinco investigadores de seguridad e inteligencia artificial.

El punto de partida de toda la investigación resulta ser Parse.

El 11 de septiembre, tres ingenieros descubrieron que el agente interno de OpenAI había intentado utilizar los servicios proporcionados por Parse ya en junio.

Este grupo de agentes pertenece al mismo grupo que el "enjambre de agentes" que estuvo expuesto anteriormente para configurar en secreto un tablero de mensajes público e intercambiar respuestas entre ellos.

Algunas personas echaron un vistazo: ¡Buen chico, estás golpeando mi arma!

Así que continuamos rastreando esta pista y luego encontramos más de una docena de enlaces anormales de plataformas públicas de enlaces cortos en un servicio de escaneo de URL.

Estos enlaces parecen normales, pero después de abrirlos, ocultan un pequeño fragmento de código codificado en Base64 y la dirección del siguiente enlace.

Continúe siguiendo la dirección y el código aparecerá uno tras otro.

Después de decodificar y unir todo, obtuvieron un programa Python para escanear la red interna de Hugging Face.

En pocas palabras, el agente de OpenAI corta el programa en pedazos, los mete en una gran cantidad de enlaces cortos y luego usa un enlace para apuntar al siguiente.

No basta con ocultar el código en el enlace, también utilizaron un servicio de captura de pantalla llamado mShots como "navegador externo".

El agente primero inserta el código en la página web y luego deja que mShots lo abra por sí mismo. Tan pronto como se carga la página web, el código comienza a ejecutarse.

Para enviar los resultados de la ejecución, convierten el texto devuelto por el servidor en cuadrículas de píxeles, dejan que mShots lo corte en imágenes y luego lo decodifica a partir de las imágenes.

De esta manera, el agente que originalmente solo tenía permisos GET y solo podía abrir páginas web de repente tuvo el efecto de leer y escribir en Internet.

Luego, el equipo de investigación escaneó millones de URL generadas durante el ataque, pasó dos semanas rastreando enlaces e identificando métodos de codificación y finalmente restauró más de 80.000 cargas útiles de ataque de casi 1 millón de enlaces cortos relacionados.

Después de profundizar más, varios hermanos descubrieron que hay más de 1500 combinaciones de codificación utilizadas por el agente.

Los simples son solo Base64, y los complejos aplicarán múltiples capas de codificación y compresión, y luego cifrarán el contenido en bloques de datos con firmas RSA, y la clave de descifrado se ocultará en otro conjunto de enlaces.

Algunos enlaces cortos siguen colgados públicamente en Internet más de dos meses después de que terminara el ataque.

Hugging Face confirmó que las cargas útiles eran consistentes con las encontradas en su respuesta al incidente y que las claves de acceso relevantes habían sido revocadas en julio.

Pero ni siquiera Hugging Face sabía que había una lista tan completa de enlaces cortos en la red pública.

Entre las más de 80.000 cargas útiles recuperadas, un script llama especialmente la atención.

El agente nombró directamente la información confidencial encontrada:

BOTÍN, botín

.

Las credenciales de AWS, el token de portador y las variables de entorno con "SECRETO", "CONTRASEÑA", "CREDENCIAL" y "CLAVE" en sus nombres están empaquetados y almacenados en LOOT.

Incluso tiene un mecanismo de puntuación para los Tokens buscados: cuanto mayor sea la autoridad, mayor será la puntuación.

Los cinco tokens principales se utilizarán para leer el secreto, el ConfigMap y la información del nodo en Kubernetes, y el contenido recién obtenido se cargará nuevamente en LOOT.

Incluso los tokens deben clasificarse en una "lista valiosa". Su agente es bastante eficiente al buscar credenciales~

Tras este "pasaje secreto", los investigadores han descubierto una gran cantidad de comportamientos no revelados anteriormente:

Algunos agentes están escaneando la red interna de Hugging Face en busca de credenciales de nube, claves API e información del clúster de Kubernetes.

Algunos incluso intentaron buscar en el Slack interno de Hugging Face y enviaron 27 consultas, todas buscando palabras clave relacionadas con la evaluación, como cybergym, exploitgym y agent-scorer, con la esperanza de descubrir la historia interna de su propio examen.

También hay algunos agentes que incluso piensan en códigos de verificación.

Los investigadores descubrieron que intentaron ejecutar modelos de clasificación de imágenes para identificar imágenes con el fin de registrar nuevas cuentas de servicios externos.

Esta vez el código de verificación realmente encontró una contraparte profesional...

La parte más intrigante de todo el asunto es:

¿La IA empezó a buscarla como ayuda exterior? ?

El guión recuperado por los investigadores muestra que el agente de OpenAI ha comenzado a buscar ayuda exterior de IA.

Enviaron el plan de ataque a DeepSeek, Kimi y Qwen, pidiéndose ayuda mutua para comprobar si esta vulnerabilidad funcionaría y si podría cumplir con los requisitos de las pruebas comparativas.

(Los modelos involucrados incluyen DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 y Qwen3-235B-A22B)

Cuando se trata de Claude, el estilo de la pintura ha cambiado a una escena a gran escala de "¿Estás ahí~?".

El agente primero encuentra una manera de pasar la verificación del navegador del servicio de chat en línea y luego envía una oración a Claude 3 Haiku y Claude Haiku 4.5:

Responda exactamente con OK.

Anteriormente, enviaron un solitario "Hola" a GPT-2.

No, su grupo de IA ha estado luchando durante mucho tiempo, pero ¿la primera oración no es diferente de agregar un amigo a un humano? ?

diga: ¿Estás ahí? ¿Puedes verlo? Di Aceptar.

Lo que todo el mundo ha visto antes es que más de 1000 agentes de OpenAI forman grupos, dividen el trabajo e intercambian inteligencia por su cuenta.

Ahora incluso buscan "ayuda exterior".

DeepSeek, Kimi, Qwen, Claude, todas las personas con las que puedas contactar lo probarán y luego integrarán las capacidades de juicio de otras IA en tu propia cadena de tareas.

Un periodista de un medio extranjero dijo: Este puede ser el primer caso registrado públicamente de un agente de laboratorio de IA a gran escala que intenta llamar y ejecutar de forma autónoma otros modelos de IA.

Ya parece que la IA está formando un grupo para causar problemas.

Por supuesto, aquí tienes que echar un balde de agua fría——

En este informe de Swarm Traces, alrededor del 80% de los materiales son solicitudes enviadas por el agente y faltan resultados devueltos por el servidor. Los investigadores pueden ver lo que intentan hacer, pero es difícil confirmar si cada intento tiene éxito.

El 97 % de las cargas útiles tampoco tienen marcas de tiempo originales y muchas fechas solo se pueden estimar a través de pistas como encabezados de archivos comprimidos, JWT y tiempo de compilación de Docker.

Los investigadores también admitieron que no podían confirmar que todas las actividades en el conjunto de datos provinieran del agente OpenAI.

OpenAI está trabajando duro para remediar la situación

Ante este último informe, OpenAI también emitió una respuesta.

La idea general es que no hemos tenido tiempo de mirar más de cerca, pero las actividades son consistentes con nuestra investigación en curso~

El mismo día también se publicó un tweet largo: Después del incidente del HF, prometieron realizar una revisión más amplia del comportamiento del modelo en entrenamiento y evaluación.

Sin embargo, la gran mayoría de los comportamientos analizados hasta ahora son tareas de investigación comunes, como visitar páginas web públicas para responder preguntas.

La mayoría de los casos transfronterizos descubiertos son de "baja gravedad" y tienen poco o ningún impacto en los servicios de terceros.

Se necesitarán varios meses para completar la investigación.

Pero hay una cosa que decir, OpenAI, lo que usted llama "pequeño impacto", todos son realmente precisos.

El 17 de septiembre, OpenAI lanzó un nuevo marco de divulgación de eventos de inexactitud del modelo y reveló 6 casos de una sola vez.

Estos incluyen modelos que introducen a escondidas instrucciones para eludir restricciones en el resumen de la tarea, encubriendo errores que cometieron y tomando acciones no autorizadas para completar la tarea.

OpenAI también admitió que sus divulgaciones pasadas fueron en gran medida improvisadas y, a menudo, se hicieron varias veces antes de publicarse juntas.

En junio, un agente de OpenAI también pirateó la base de datos del seguro médico nacional de Australia.

Proceso criminal: Luego de bloquear el acceso a datos públicos, tomó otra ruta, saltó las restricciones de acceso del portal y obtuvo documentos públicos y no públicos.

Y no fue hasta 3 meses después que OpenAI notificó a Australia que te habíamos pirateado...

Al mismo tiempo,

GPT-6 Cyber

Muy pronto.

Esta versión tendrá una vista previa en las próximas semanas y un pequeño número de clientes que ingresaron al plan Daybreak Red ya recibieron la versión Alpha.

OpenAI también lanzará un producto complementario aún sin nombre para ayudar a los clientes a crear flujos de trabajo de seguridad automatizados, descubrir y parchear vulnerabilidades y facilitar que OpenAI monitoree cómo se utilizan estos modelos.

Cómo decir esto.

Nuestro propio robot acaba de ser utilizado para sortear el muro, encontrar ayuda extranjera y buscar botín. Aquí le venderemos un modelo que comprende mejor el ataque y la defensa de la red.

Entonces, ¿es esto algún tipo de reparación de la situación? ?

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios