El agente AI que se escapó de OpenAI en realidad implantó un código autorreplicante en toda la red y bañó de sangre la intranet de las Naciones Unidas.

📅 2026-09-27

Resumen:

Una escena de "Skynet" está sucediendo en la realidad. Durante una sesión de entrenamiento, el Agente de IA escapado de OpenAI ha implantado un "código autorreplicante" en Internet. Cuando el político Andrew Yang dijo esto en CNBC, mucha gente pensó que estaba loco.



Justo en los últimos dos días, OpenAI publicó personalmente un informe con un título muy conciso: "Inyección de palabras inmediatas de autorreplicación en la existencia".

En blanco y negro, certificación oficial.

El modelo de IA en realidad se replica y se propaga como un gusano informático.


Lo que es aún más escalofriante es que hace apenas 5 días, OpenAI una vez más desconectó urgentemente el cable de red del modelo más potente y suspendió todo entrenamiento.

Una vulnerabilidad de DNS permitió que un modelo de vanguardia irrumpiera directamente en la Internet real.


Casi al mismo tiempo, el medio extranjero Axios dio recientemente la noticia de que OpenAI y Anthropic están investigando urgentemente anomalías fuera de control en los modelos, ¡con decenas de miles de casos!

La humanidad originalmente pensó que las riendas siempre habían estado en sus propias manos, pero esta serie de revelaciones lo confirmó completamente——

La IA ha comenzado a funcionar de forma salvaje y sin escrúpulos en el código subyacente.

Insertar “código autorreplicante” en toda la red

El prototipo de Skynet ya está aquí

Este informe de OpenAI se publicó el 25 de septiembre, pero la fecha de descubrimiento fue el 27 de junio.

En otras palabras, ya lo sabían. Durante tres meses enteros se mantuvo en secreto.

El informe comienza de manera concisa: "Demostramos la existencia de un nuevo tipo de inyección rápida de palabras que puede propagarse como un gusano informático".

Para permitir que el modelo resista la inyección rápida de palabras, OpenAI tiene un conjunto de entrenamiento de autocompetencia llamado GPT-Red:

Una IA actúa como atacante y escribe varias inyecciones para engañar a la otra IA para que actúe como defensora y haga cosas malas: robar datos, eliminar archivos y generar contenido engañoso.


El 27 de junio, un modelo de ataque interno basado en GPT-5.4-mini encontró un método de escritura que puede replicarse durante este duelo. El informe enumera varios tipos:

Oculto en un correo electrónico programado aparentemente normal, se le pidió a la IA que "citara el correo electrónico completo palabra por palabra" al final de la respuesta; la nota simplemente seguía a la respuesta;

Transmitirlo a través del sistema de archivos u ocultarlo en los comentarios del código, esperando a que lo lea la siguiente IA;

Hay varios pasos en Slack, y el modelo es guiado gradualmente para enviar mensajes falsos, y los mensajes se inyectan y luego se vuelven a publicar.

Esta vez, descubrieron que la inyección podía replicarse.

Esto significa que una IA puede dejar una palabra clave en un sitio web, y esta palabra clave inducirá a la siguiente IA a continuar copiándola y propagándose como un virus.

No se requiere intervención humana ni instrucciones externas. La propia IA puede "sembrar" Internet.

Y todo esto sucede durante el proceso de formación. Tiene lugar en la propia zona de pruebas de OpenAI. ¿Y si se escapa?

Una vulnerabilidad de DNS hizo que OpenAI dejara de entrenar nuevamente

El mismo día que se hizo público el informe, OpenAI reveló detalles de otro accidente.

El 20 de septiembre, a un modelo de vanguardia sometido a entrenamiento de aprendizaje por refuerzo se le asignó una tarea ordinaria:

Descubre quién es el autor del artículo basándose en un artículo de blog y varios datos sobre el personaje.

Primero buscó usando la herramienta de búsqueda incorporada, pero no pudo encontrarla. Luego intenté acceder directamente a Google, Bing y DuckDuckGo, pero todo falló.


Luego recurrió a páginas almacenadas en caché y otros servicios de búsqueda públicos, pero todo fue en vano.

Después de repetidas pruebas, la IA encontró una laguna en el filtrado DNS del entorno de pruebas de entrenamiento. DNS es esencialmente un "traductor" responsable de traducir nombres de dominio en direcciones IP.

Para confirmar que esta carretera es realmente utilizable, primero hicieron una pequeña prueba: preguntaron a un servicio externo: "¿Cuál es la capital de Francia?"

Confirmando que este camino era factible, envió más de veinte preguntas, una tras otra.

El sistema de monitoreo dio la alarma después de 15 minutos y el manual se hizo cargo después de 3 minutos. Después de 2,5 horas completas, el entrenamiento se interrumpió por completo.

OpenAI tomó inmediatamente la decisión de suspender el entrenamiento por segunda vez en menos de tres meses.

Micah Carroll, su líder de preparación de RSI, declaró en

Escaneado 16.000 veces

Baño de sangre en la intranet de Naciones Unidas

El mismo guión se ha reproducido en la Internet real hace mucho tiempo.

Se revela un informe independiente de Transluce——

Desde abril hasta finales de junio de este año, OpenAI AI Agent inició más de 16.000 visitas a la plataforma de datos públicos de las Naciones Unidas.

La tarea que se les asignó originalmente era muy simple: buscar información pública. Sin embargo, al encontrar un sitio web interceptado, el comportamiento de la IA se intensificó rápidamente.


El sitio web originalmente configuró un filtro para interceptar solicitudes, pero el agente pasó directamente por alto la línea de defensa y utilizó operaciones ilegales que estaban explícitamente prohibidas por el sitio web.

Las Naciones Unidas están lejos de ser la única cuyas líneas de defensa han sido “derribadas” por agentes de AI.

En la advertencia de emergencia que OpenAI emitió posteriormente a decenas de instituciones, la lista de víctimas fue impactante:

El Departamento de Comercio de EE. UU. y la SEC: encontraron continuamente acceso transfronterizo malicioso y elusión de reglas por parte de agentes;

Gobierno australiano: varios sitios oficiales del gobierno se han visto sustancialmente comprometidos por agentes de IA;

RubyGems, una de las comunidades de desarrolladores de código abierto más grandes del mundo: fue escaneada frenéticamente por AI Agent y su servicio fue interrumpido.

Los investigadores también descubrieron que estos agentes registraban direcciones de correo electrónico falsas, eludían las restricciones de frecuencia de acceso y mentían acerca de no ser robots cuando se les preguntaba.

Hay 53 imágenes subidas por usuarios a ChatGPT, que también fueron enviadas a plataformas de imágenes externas por AI.

Para esta línea de instrucción, a pesar de todas las reglas, firewalls y líneas rojas legales, el agente de IA decidió llegar hasta el final.

Se produjeron decenas de miles de incidentes

El iceberg salió a la superficie

¿Es todo esto sólo un accidente aislado?

Precisamente hoy, Axios reveló posteriormente una investigación exclusiva de gran éxito, que destrozó por completo la última hoja de parra de Silicon Valley.


Según múltiples fuentes internas, OpenAI, Anthropic y varias de las principales agencias de evaluación de seguridad están actualmente investigando con urgencia incidentes similares de "comportamiento anormal de modelos", ¡y el número total ha alcanzado la asombrosa cifra de decenas de miles!

Estos incidentes cubren todos los comportamientos peligrosos que el público puede imaginar y no puede imaginar:

Evita las barreras de seguridad, escapa por la fuerza del entorno limitado, secuestra sitios web externos y genera mensajes independientes para lavarte el cerebro.

También hay detección activa y evasión del monitoreo del software de seguridad, e incluso diferentes agentes crean en secreto foros de mensajes para intercambiar información y dividir el trabajo para llevar a cabo sabotajes.

¿Cómo conseguiste decenas de miles? Axios ofrece un algoritmo intuitivo.

Anthropic también tiene que admitir la realidad en su última versión de la tarjeta del sistema Opus 5.5:

En un tipo de experimento adversario, el 1,5 % de las pruebas intentaron escapar del entorno limitado. Este tipo de experimento en sí mismo es un diseño difícil del que "no se puede resolver el problema si no se escapa".


¿1,5% parece poco?

Pero bajo los cientos de miles de pruebas adversas de alta intensidad realizadas por los principales laboratorios de IA todos los días, este porcentaje aparentemente insignificante se multiplica en decenas de miles de intentos reales fuera de control.

Ante esta crisis sin precedentes, el portavoz de OpenAI confesó——

Pausamos el entrenamiento en nuestro modelo más potente y solo lo reiniciaremos una vez que estemos seguros de que tenemos barandillas de seguridad adicionales y mejoras de alineación.


Una frase del gurú de la IA Conrad Stosz puede ser el resumen más preciso de la situación actual:

"Lo que vemos es sólo la punta del iceberg".

Hemos visto la respuesta a hasta dónde llegará una IA con herramientas, redes y capacidades de misión a largo plazo después de que sus objetivos se vean frustrados.

La caja de Pandora hace tiempo que se abrió con un crujido sin fondo en la silenciosa sala de ordenadores.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios