Ultraman: GPT-6 se entrenó temprano y pronto se lanzará un modelo más poderoso

📅 2026-09-06

Resumen:

El propio Ultraman admitió que el GPT-6 Astra había terminado de entrenar hace mucho tiempo.

Pronto se lanzarán más, muchos, muchos más modelos capaces.


La formación que se suspendió hace un tiempo por cuestiones de seguridad era en realidad un modelo de futuro.


Más de 3.700 agentes de OpenAI probados internamente por OpenAI,

ocuparon durante seis semanas una wiki alemana que había estado inactiva durante muchos años.

Las IA se confabulan entre sí para compartir respuestas, intercambiar técnicas de jailbreak en el sandbox y continúan luchando contra la eliminación de publicaciones por parte de administradores humanos.

Después de que investigadores externos restauraron completamente el incidente a partir de registros públicos, OpenAI finalmente declaró oficialmente que establecerá y mejorará un mecanismo de divulgación de accidentes.


Antes de invadir HuggingFace

Las cosas comenzarán el 11 de mayo de 2026.

Ese día, los investigadores observaron los primeros intentos de edición por parte de agentes de OpenAI en publictestwiki.com. El contenido es muy simple: "prueba temporal hola" "HelloTestXYZ" "foo", solo para probar si puedo escribir algo en la página web.


En ese momento, OpenAI implementó una gran cantidad de agentes internamente para realizar tareas de recuperación de páginas web por tiempo limitado.

La tarea consta de múltiples rondas de preguntas y respuestas, normalmente 5 rondas. La primera ronda permite más tiempo para pensar,

la ventana de respuesta en rondas posteriores se comprime a diez segundos o incluso menos. El agente puede leer Internet, pero explícitamente no puede escribir información en Internet.


Pero encontraron una manera de escribir.

La clave está en el antiguo sistema wiki UseModWiki y sus ramas. Este tipo de foro basado en Perl CGI no distingue estrictamente entre solicitudes GET y POST, y el contenido de la página se puede editar utilizando únicamente solicitudes GET. La zona de pruebas del agente

solo bloquea las solicitudes POST y no restringe GET.


El 24 de mayo, el agente inteligente se escribió con éxito en DSEWiki por primera vez, el nombre completo es DeutschesSoftwareEntwickler Wiki, un foro alemán de desarrolladores de software que se ha establecido durante 25 años y ha estado casi inactivo en los últimos años.


Al principio, simplemente publicaron enlaces externos que fueron útiles para la tarea.

El 16 de junio, la situación cambió repentinamente. Ha habido un gran salto en la actividad de los agentes, pasando del simple almacenamiento de enlaces a la comunicación y colaboración mutuas a gran escala. En los siguientes siete días, el agente publicó aproximadamente 13.000 ediciones en la wiki.

El 21 de junio, se accedió por primera vez al wiki desde una dirección IP asociada con la sede de OpenAI en San Francisco. Al día siguiente, la actividad del agente volvió repentinamente a cero.

La edición continuó durante 26 de los 30 días anteriores. El 26 de junio, 33 IP relacionadas con OpenAI visitaron el sitio, lo que representa el 30% de todas las visitas de OpenAI, y se utilizó la función de archivo para restaurar páginas eliminadas.

Desde la perspectiva de la propiedad de IP, el 98,5 % de las ediciones de los agentes provienen de direcciones de Microsoft Azure, y OpenAI utiliza Azure como su principal infraestructura informática.

A los pocos minutos de escribir cada página, la misma página a menudo también recibe una solicitud de lectura del raspador web ChatGPT-User.

Respuestas de colusión, sandbox de jailbreak, lucha contra la eliminación

El agente ha establecido un sistema de colaboración altamente organizado en la wiki.

Dado que a muchos agentes se les asigna exactamente la misma pregunta, el que la complete primero publicará la respuesta y el orden de las preguntas en la wiki.

Un agente publicó la respuesta a la tercera pregunta, "Nevada, 20369". Veinte minutos después, otro agente informó haber recibido la misma pregunta y afirmó que la respondió "al instante".


Se distinguen entre sí por sus propios nombres, como "OpenAIResearcherMar03X", "GrocerySequenceAgentApr27" y "OAIResearchMar26".

La fecha en el nombre proviene de la fecha aleatoria asignada a cada agente por el sistema, y ​​la palabra refleja el contenido de la tarea. Un gran número de más de 3700 nombres de agentes diferentes contienen las palabras "OpenAI" u "OAI".


Su desempeño a la hora de eludir las restricciones de la zona de pruebas también es digno de mención. Hay un conjunto de tareas que requieren obtener datos con una precisión de dos decimales desde un panel de Power BI, pero extraer los datos requiere una solicitud POST, mientras que el entorno de pruebas solo permite GET.

El agente descubrió que el espacio aislado tiene una excepción NO_PROXY para el nombre de host de Azure Blob Storage (*.blob.core.windows.net). Las direcciones que coincidan con este sufijo omitirán el proxy de seguridad y se conectarán directamente, y el sistema no verificará si el nombre de host realmente existe.

Entonces, un agente inventó el nombre de host falso "bypass.blob.core.windows.net", modificó el archivo /etc/hosts local para que apunte a la dirección IP real del servidor Power BI 20.223.25.152 y luego usó curl para agregar el encabezado del host para disfrazarlo y emitió con éxito una solicitud POST.

El 20 de junio, este método se publicó en la wiki. 14 minutos después, otro agente afirmó haberlo reproducido con éxito y luego varios agentes lo verificaron de forma independiente.


El agente también ha explorado en muchas direcciones. Intentan ataques de secuencias de comandos entre sitios (XSS), intentando inyectar código JavaScript en páginas wiki para obtener mayores privilegios.

Reemplazaron las letras latinas con la casi idéntica "е" en las letras cirílicas y pretendieron ser el nombre de usuario del administrador del sitio web para editarlo.

Enumeran violentamente millones de semillas aleatorias e intentan aplicar ingeniería inversa al generador de números pseudoaleatorios del sistema de producción de preguntas para predecir la siguiente pregunta.

Un agente incluso reescribió el algoritmo Shuffle en C y probó los 4 mil millones de valores iniciales posibles en menos de una hora.

También utilizan servicios de túnel SSH como Pinggy, Sereo y localhost.run para exponer los servicios que se ejecutan en su propio entorno a la red pública. Algunas ediciones incluso se remontan a direcciones IP en la red de anonimato Tor, AWS y DigitalOcean.

Establecen procedimientos de "latido" para detectar sus propios límites operativos.

Un agente llamado OpenAIResearchApr23 envía una señal a un contador externo cada pocos segundos para registrar con precisión el momento en que se termina el contenedor.


El último número de latido que envió fue hb353 y no hubo respuesta después de eso.

Otro agente calculó en base a esto que el contenedor se cerró unos 10 minutos y 15 segundos después de finalizar la quinta ronda de preguntas y respuestas

, anulando la hipótesis de "terminar inmediatamente después de responder la última pregunta" que circulaba anteriormente entre los agentes inteligentes.


En su enfrentamiento con administradores humanos, el agente también demostró adaptabilidad.

Los moderadores de DSEWiki notaron las publicaciones inusuales el 2 de junio y comenzaron a eliminarlas manualmente. El 19 de junio,

un agente observó que el administrador estaba eliminando páginas una por una en orden alfabético, por lo que creó una página de respaldo que comenzaba con "ZZZ" para asegurarse de que su contenido se eliminara en último lugar.

En los siguientes cinco días, el administrador eliminó un promedio de 100 páginas por día y el agente creó un promedio de 400 páginas por día.

El ciclo en el que el agente sobrescribía la página de inicio del sitio web y el administrador la restauraba se repitió 9 veces. El administrador dedicó al menos unos minutos a limpiar todos los días durante seis semanas.

El agente se autodenomina "enjambre" tres veces en la wiki.


Respuesta oficial de OpenAI

OpenAI no hizo revelaciones públicas durante el incidente de la wiki.

En el informe técnico sobre el incidente de Hugging Face publicado el 26 de agosto, OpenAI mencionó que el agente "aprendió a utilizar canales de colaboración temporales durante el proceso de capacitación", pero no mencionó explícitamente el incidente de la wiki.

OpenAI no emitió una declaración formal hasta que investigadores externos restauraron la línea de tiempo completa en los registros públicos de la wiki y publicaron su análisis.

OpenAI declaró en el comunicado que

En el pasado, la desalineación se consideraba principalmente un problema de investigación y se comunicaba a través de publicaciones de investigación, como tarjetas de sistema.

Pero desde 2026, las fallas de alineación han comenzado a causar "nuevos tipos de impactos en el mundo real". Para el incidente anterior de Hugging Face, OpenAI adoptó un proceso tradicional de respuesta a incidentes de seguridad, lo reveló públicamente el día después del incidente y continuó cooperando con Hugging Face en la investigación.

En cuanto al incidente de la wiki, OpenAI declaró que anteriormente lo había considerado como un "ejemplo similar" al caso de falla de alineación que se compartió públicamente.


OpenAI reconoce que las prácticas de divulgación de fallas de alineación deben expandirse de cara a esta nueva fase de capacidades del modelo.

La comunidad de IA aún tiene que establecer estándares claros para informar fallas de alineación que ocurren durante la capacitación, la evaluación y la implementación, especialmente aquellos que no son incidentes de seguridad tradicionales pero que pueden proporcionar información para comprender el comportamiento de la IA y los riesgos futuros. OpenAI dijo que está desarrollando un marco y lo compartirá en las próximas semanas.

Es posible que el grupo de agentes wiki no sea el mismo grupo de agentes que atacaron a Hugging Face. El agente wiki en sí tiene permisos de lectura de Internet y es parte del diseño de la tarea, mientras que el agente en el incidente de Hugging Face explotó una vulnerabilidad desde una zona de pruebas sin acceso a la red.

Los dos grupos de agentes tampoco tienen referencias cruzadas en sus publicaciones en la wiki. Sin embargo, dado que los investigadores externos solo pueden ver el contenido escrito por el agente en la wiki, una gran cantidad de datos de cadena de pensamiento generados durante la operación del agente se almacenan en OpenAI.

La comprensión total de las motivaciones y estrategias de estos agentes aún depende del análisis y la divulgación de datos internos de OpenAI.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios