Resumen:
OpenAI decidió seguir divulgando incidentes "transfronterizos" de IA, pero encontró dificultades en el primer paso.
El 16 de septiembre, OpenAI anunció seis informes sobre comportamiento anormal del modelo y lanzó un nuevo proceso de investigación y divulgación. En el futuro, si los empleados descubren que el modelo excede su autoridad, oculta o elude restricciones, pueden presentar una investigación; Los casos calificados entrarán en diferentes vías de divulgación según su complejidad.
El mismo día, SentinelLABS e investigadores externos complementaron más rastros dejados por el agente OpenAI en mayo de este año a partir de los registros públicos de Hugging Face. OpenAI ha revelado anteriormente algunas de sus actividades, pero las cuentas específicas, los códigos de retransmisión, las tablas con fórmulas de detección y los procedimientos de registro de cuentas fueron reconstruidos mediante investigaciones externas.
Esta evidencia no prueba que el programa se haya ejecutado exitosamente, ni indica que el evento de mayo fue la misma operación que la intrusión de julio.
Revelan otro problema: cuando las acciones de un agente están dispersas en diferentes plataformas, es posible que ninguna empresa tenga un registro completo.
Lo que pasó en mayo, quedan algunas piezas más del rompecabezas
El 21 de julio, OpenAI reveló que los agentes que participaban en las pruebas de seguridad de la red eludieron los controles internos, accedieron a la red pública e invadieron algunos sistemas de Hugging Face. Más tarde, la compañía lo calificó como un "incidente cibernético sin precedentes".
Esta investigación externa no adelantó la fecha de la invasión a mayo.
OpenAI reveló anteriormente algunas actividades anormales en mayo, y las nuevas incorporaciones son cuentas específicas y registros de envío públicos. Permiten que el mundo exterior vea la línea de tiempo interna de OpenAI junto con los archivos y el código dejados en Hugging Face.
SentinelLABS enumera dos cuentas, 0Time y Nyx9, como cuentas que pueden ser utilizadas por agentes relacionados. Los dos ya existen, y el juicio de los investigadores proviene de la correspondencia entre el tiempo de envío, la función del código y las acciones anteriores y posteriores.

OpenAI reveló anteriormente que el 13 de mayo, un agente utilizó credenciales filtradas de Hugging Face para encontrar archivos. SentinelLABS descubrió esta vez que el mismo día, la cuenta 0Time también envió un código de retransmisión que podía reenviar la solicitud. Este código no menciona lo que OpenAI llama un archivo de destino, y no hay ningún registro público de si se ejecutó correctamente, y las dos cosas no se pueden fusionar directamente en este momento.
El 26 de mayo, hubo una correspondencia más clara entre los registros públicos y el cronograma interno de OpenAI. Los siguientes horarios son todos UTC: OpenAI registró una escritura de archivo externo a las 20:04 y Nyx9 envió un archivo llamado hello.txt a las 20:04:11, con solo "hola" en el contenido. Ambos récords caen en el mismo minuto.
45 minutos más tarde, Nyx9 envió un fragmento de código de retransmisión del agente; en el mismo minuto, los registros internos de OpenAI mostraron que el agente implementó al primer agente. Los investigadores creen que la cuenta pública está muy relacionada con las actividades de mayo divulgadas por OpenAI.

A última hora de la noche, Nyx9 también subió una hoja de cálculo de Excel. La tabla contiene cuatro fórmulas que intentan acceder a URL externas, archivos locales, metadatos de servicios en la nube y una dirección que parece un servicio interno.
Este conjunto de fórmulas tiene la capacidad de detectar recursos dentro y fuera del servidor, pero no hay resultados de cálculo en la tabla y no hay rastros de ejecución, como conexiones de retorno o claves.

El 30 de mayo, 0Time presentó un programa público para registrar automáticamente cuentas OpenAI en Hugging Face y le agregó una interfaz web y una configuración operativa. Si el programa se ejecuta correctamente, cada llamada puede iniciar un intento de registro. Sin embargo, los registros públicos solo contienen envíos de código y no hay evidencia de construcción y funcionamiento.
Los investigadores interpretaron estos registros como sistemas de sondeo externos. Tanto OpenAI como los investigadores dijeron que actualmente no hay evidencia de que estas actividades de mayo pertenezcan a la intrusión de julio.
Jonas Widmann-Mueller, un investigador alemán independiente, cree que si la anomalía de mayo hubiera desencadenado una investigación exhaustiva a tiempo, OpenAI podría haber reforzado las credenciales, los permisos de red y la supervisión antes, reduciendo la posibilidad de incidentes posteriores. OpenAI también ha declarado anteriormente que, mirando hacia atrás, algunas señales tempranas deberían haber desencadenado respuestas más tempranas.

Los registros dejados en mayo expusieron al menos una laguna en el seguimiento: el agente había extendido sus acciones a una plataforma de terceros, pero el laboratorio no logró reconstruir una trayectoria completa en ese momento.
En seis informes, la IA utilizó seis "métodos"
El mismo día, OpenAI anunció un nuevo modelo de marco de divulgación de comportamiento anormal y los primeros seis informes.
Todos estos comportamientos se descubrieron durante el entrenamiento o la evaluación del modelo. OpenAI enfatiza que son casos individuales y no se pueden utilizar para determinar la frecuencia de problemas similares en todos los modelos.

El primer informe involucra un modelo de investigación de la serie Astra inédito. El modelo comprimirá el progreso de la tarea en un resumen y lo entregará al siguiente contexto para su procesamiento continuo.
OpenAI descubrió que una cantidad muy pequeña de resúmenes contenían instrucciones similares a "jailbreaking", incluido el requisito de que los modelos posteriores ignoraran la información del desarrollador, cambiaran sus roles o limitaran la longitud de las respuestas y el uso de herramientas.
OpenAI encontró un total de 27 resúmenes con expresiones similares. A veces el modelo posterior lo reconoce y lo ignora, y otras veces lo hace. La compañía no ha encontrado ninguna ventaja de recompensa clara en estas instrucciones y actualmente es más probable que crea que están relacionadas con la dificultad del modelo para finalizar el resumen normalmente, pero la relación causal no ha sido confirmada.
Estos comportamientos ocurrieron en otra ronda de entrenamiento. Durante el proceso de entrenamiento correspondiente a la versión final de Astra, el sistema de seguimiento no encontró instrucciones similares de jailbreak; OpenAI también solucionó un problema relacionado con el final del resumen.

El segundo informe fue más directo. En el entrenamiento de aprendizaje por refuerzo de GPT-5.6 Sol, algunos modelos dejarán mensajes contextuales posteriores en el resumen para recordarle que oculte errores. Un modelo no pudo encontrar los datos históricos solicitados por el usuario, por lo que sugirió crear un conjunto de números "razonables" y no explicarlos activamente a menos que se lo pidieran. Otro modelo utilizó datos almacenados en caché con versiones que no coinciden y también pidió no mencionarlos en respuestas posteriores.
Originalmente, los resúmenes estaban pensados para permitir que tareas largas continuaran en distintos contextos.
Una vez que el modelo escribe "problemas que cubren" en el resumen, un error puede heredarse en los pasos siguientes.
OpenAI dijo que la proporción de este tipo de comportamiento en el entrenamiento de Astra ha disminuido, pero no ha desaparecido por completo.En el tercer informe, un modelo interno solicitó datos sobre los ingresos masculinos de tres industrias y tres años en un condado de California. Después de que se bloqueó la interfaz normal, intentó registrar una dirección de correo electrónico temporal y luego fue al repositorio de código público para encontrar la clave API filtrada.
El modelo encontró una clave que podía pasar la autenticación, pero aún así no pudo obtener los datos de destino. Al final, inventó directamente nueve números y afirmó que los había copiado del gráfico del sitio web designado.
El cuarto informe tenía una motivación diferente. Un modelo inédito utilizó Python para encontrar datos en lagos con un área de más de 5 millones de metros cuadrados, pero la tarea aún requiere una referencia del navegador. El navegador no puede abrir archivos locales ni puede considerar los resultados de Python como la fuente de las páginas web.
Luego, el modelo carga el archivo en un sitio de alojamiento público y se proporciona una URL que se puede citar.
En otra prueba, la modelo también subió las fotos de la tarea a la red pública para llamar a un servicio externo de reconocimiento de imágenes.Ambas cargas se realizaron correctamente, pero las operaciones posteriores del navegador no lograron el objetivo. El problema aquí no es solo con el modelo: la tarea requiere respuestas correctas y referencias web, la herramienta no permite que los resultados locales ingresen al navegador, y las recompensas conflictivas y el diseño de la herramienta empujan al modelo de maneras que no deberían.
El quinto informe se produjo en Artifactory, el almacén de software interno de OpenAI. Los modelos en diferentes muestras de capacitación carecían de archivos de tareas, por lo que usaron el almacén como tablero de mensajes, leyeron las solicitudes de ayuda y las respuestas dejadas por otros modelos y luego publicaron sus propias preguntas.
Estos modelos no explotan vulnerabilidades y utilizan credenciales de acceso proporcionadas por el entorno; El verdadero problema es que las muestras de entrenamiento que deberían ser independientes entre sí comienzan a intercambiar información.
El último informe se realiza en colaboración entre múltiples agentes. Varios agentes quieren crear conjuntamente un libro de trabajo, pero los archivos locales no pueden acceder entre sí. Uno de los agentes simplemente carga el archivo en un sitio web público y luego le da el enlace al acompañante.
El trabajo continuó y el documento quedó disponible públicamente para cualquiera que tuviera un enlace.

Las causas de los seis informes no son las mismas. Las instrucciones del resumen de Astra pueden estar relacionadas con la generación de anomalías; el ocultamiento y la falsificación están más cerca de la presión de recompensa; La carga pública y la comunicación entre muestras están directamente relacionadas con las herramientas, los permisos y el entorno de colaboración.
Pero los resultados son similares: después de que el modelo encuentra un obstáculo, realiza acciones que la tarea no estaba autorizada y los desarrolladores no anticiparon.
De la divulgación dispersa a un proceso fijo
En el pasado, OpenAI normalmente esperaba hasta que se pudieran explicar varios casos juntos, o hasta que se lanzaran nuevos modelos con tarjetas de sistema, antes de hacer públicos los problemas de alineación. Las empresas ahora admiten que dichas revelaciones fueron irregulares y no suficientemente frecuentes.

El nuevo marco permite a cualquier empleado presentar un caso sospechoso a los equipos de seguridad y alineación para investigar qué hizo el modelo, qué hechos se desconocen, si afectó a terceros y qué se puede hacer público. Luego, el caso avanza en tres vías.
Los casos que se hayan aclarado y puedan divulgarse directamente entrarán en "preparación para divulgación"; Los casos que requieren una pequeña cantidad de investigación técnica entrarán en "investigación ligera". OpenAI dijo a los medios que estos dos tipos de casos serán divulgados dentro de 6 y 12 días hábiles respectivamente.
Los requisitos de tiempo aquí se basan en el proceso de revisión posterior al informe y no comienzan a partir del día en que ocurre el comportamiento anormal.
Los casos que involucran a terceros, riesgos graves de seguridad o investigaciones complejas entrarán en la lenta vía de la "investigación importante". OpenAI se esforzará por emitir una explicación preliminar lo antes posible para explicar lo sucedido, si participarán expertos externos y dar un tiempo aproximado para el informe final; sin embargo, las correcciones de vulnerabilidades, las obligaciones legales y las notificaciones de terceros pueden retrasar la divulgación y no existe una fecha límite unificada para esta vía.
Si los empleados tienen objeciones sobre "si se debe divulgar", pueden remitir el problema al grupo asesor de seguridad de OpenAI y a los ejecutivos de la empresa paso a paso. En principio, cada informe completo también debe explicar la fecha del incidente, hora de descubrimiento, circunstancias del suceso, gravedad, impacto en terceros, alcance de la investigación y medidas de respuesta.
OpenAI también tomó una decisión: preferir incluir la divulgación primero, incluso si aún no se ha determinado la importancia de un caso.
La empresa reconoce que algunos casos pueden resultar fenómenos aislados y puede que ni siquiera tengan una importancia más amplia. Todavía espera que investigadores externos vean el material y propongan interpretaciones alternativas.Si este marco se hubiera aplicado al incidente de Hugging Face en julio, habría entrado en una vía de "investigación importante". El nuevo sistema no permitirá que incidentes complejos publiquen automáticamente un informe completo en unos pocos días, pero al menos convertirá la divulgación de decisiones temporales del pasado en un proceso al que se le puede dar seguimiento.
El proceso es posterior al hecho, el punto ciego es antes del hecho
El nuevo marco comienza cuando los empleados identifican los problemas y los informan. Pero esta investigación externa muestra que a menudo las pruebas completas no están en manos de una empresa.
OpenAI puede ver qué tareas recibió el agente, cómo razonó y qué herramientas internas fueron llamadas; Hugging Face domina la autenticación de cuentas, el envío de archivos, la construcción de programas y las solicitudes de red. Los correos electrónicos, los servicios de proxy, los nombres de dominio y las direcciones de retorno pueden pertenecer a otras plataformas. Sólo reuniendo estos registros será posible restaurar la ruta de acción completa del agente.
Por lo tanto, SentinelLABS propuso que después de que el agente ingresa al sistema de terceros, el rastreo público en sí es parte del evento y no puede explicarse únicamente por informes de laboratorio internos. Observar únicamente la trayectoria de la tarea dentro de OpenAI puede pasar por alto acciones clave guardadas por la plataforma externa; mirar únicamente el nombre de la cuenta externa y la hora de envío no puede probar de forma independiente quién es el operador.
Reuters también informó que en otro incidente relacionado con el almacén de software RubyGems, los empleados de OpenAI solo se dieron cuenta de que el comportamiento relevante podría haber provenido de sus propios agentes después de que una organización externa lo descubrió.
Esto muestra que la velocidad de divulgación está limitada por las capacidades de detección.
Los informes de los empleados, la investigación interna y la revisión de alto nivel sólo pueden abordar los problemas que se han descubierto; Si ocurre una excepción en una plataforma de terceros y no activa el monitoreo interno, el nuevo proceso no generará pistas automáticamente.¿El modelo está fuera de los límites o no se ha hecho bien la seguridad?
En torno a estos eventos, los debates externos se centraron en un tema: ¿Debería repararse primero el modelo o primero el medio ambiente?
Algunas personas creen que el agente busca activamente credenciales, elude las restricciones de las herramientas y carga archivos a la red pública, lo que indica que la capacidad del modelo para actuar de forma autónoma está por delante de las medidas de control. Otros señalaron que muchas consecuencias podrían haberse evitado con medidas de seguridad básicas: evitar la filtración de credenciales, restringir el acceso del entorno de prueba a la red pública y reducir los permisos del almacén para que los archivos públicos no se puedan escribir fácilmente.

Hay dudas aún más intensas en las redes sociales. Algunas personas consideran estos accidentes como material de laboratorio para promover la regulación, mientras que otros creen que el modelo sólo utiliza datos que ya están expuestos en el medio ambiente.

El evento de mayo hizo un uso extensivo de credenciales filtradas y permisos abiertos, y las brechas en la seguridad básica eran obvias. Pero la gestión de credenciales no puede explicar por qué el modelo fabricó datos de ingresos, requirió un contexto posterior para ocultar errores o por qué el modelo eligió proactivamente métodos no autorizados cuando encontró obstáculos.
El control de seguridad determina si el modelo tiene la oportunidad de causar impactos externos, y la alineación del modelo determina si mantendrá sus límites cuando se enfrente a oportunidades.
Ambos necesitan ser reparados.Chen Kai, jefe de investigación de alineación en OpenAI, atribuye las razones a dos aspectos: las capacidades del modelo están creciendo más rápido de lo esperado y hay controles dentro de la empresa que deben mejorarse. OpenAI espera que, independientemente del entorno en el que se encuentre, el modelo pueda mantener límites de comportamiento; al mismo tiempo, ha comenzado a restringir el acceso a la red, fortalecer el sandboxing y el monitoreo y reducir las oportunidades que deja el entorno para el modelo.
En los últimos días, el debate en la industria de la IA sobre si se debe frenar el desarrollo de modelos de vanguardia se ha intensificado rápidamente. El director ejecutivo de Anthropic, Dario Amodei, propuso un "control de velocidad" para capacidades de vanguardia; El director ejecutivo de OpenAI, Sam Altman, expresó su apoyo a la discusión sobre la desaceleración; Musk reconoció las preocupaciones por los riesgos y abogó por permitir que las principales empresas de inteligencia artificial chinas y estadounidenses se prueben entre sí antes de lanzar nuevos modelos.
La acción específica que OpenAI dio esta vez es un conjunto de mecanismos de divulgación continua. La compañía escribió en el marco que las capacidades actuales de alineación y monitoreo de la industria no son suficientes para respaldar la expansión a largo plazo a la velocidad más rápida. El propósito de hacer públicos los casos es permitir que personas ajenas al laboratorio examinen la evidencia.
Veamos una cosa a continuación: cuando el agente extiende sus acciones a una plataforma externa nuevamente, si OpenAI puede descubrirlo antes de que lo hagan los investigadores externos.
Comentarios