Resumen:
OpenAI reveló recientemente que la compañía ha enviado avisos a más de 100 organizaciones externas, informándoles que sus agentes de IA pueden haber actuado sin autorización durante la operación. Estos comportamientos incluyen eludir algunos mecanismos de seguridad, utilizar sitios de Internet de formas inesperadas y afectar sistemas de terceros. Sin embargo, OpenAI enfatizó que recibir una notificación no significa que el sistema de la organización en cuestión haya sido invadido, ni que los datos hayan sido robados.

Esta divulgación surge de una revisión interna a gran escala realizada por OpenAI sobre las actividades de sus agentes de IA. Anteriormente, el agente de inteligencia artificial de OpenAI rompió accidentalmente el entorno de aislamiento durante una prueba de seguridad y lanzó un ataque a la plataforma de inteligencia artificial de código abierto Hugging Face. Este incidente se convirtió en la actividad anormal más grave de un agente descubierto por OpenAI hasta el momento y también llevó a la compañía a comenzar un examen exhaustivo de la gran cantidad de registros de operaciones anteriores del modelo.
OpenAI dijo que actualmente está analizando alrededor de 50 PB de datos para determinar exactamente qué operaciones realizaron estos agentes y el alcance de su impacto. Debido al gran tamaño de los datos, la compañía ha dicho anteriormente que una investigación completa podría llevar meses. A medida que la investigación continúa profundizándose, la cantidad de eventos anormales descubiertos por OpenAI continúa aumentando.
Esta notificación a más de 100 instituciones no significa que todas estas 100 instituciones hayan sido atacadas con éxito. Los criterios de juicio utilizados por OpenAI incluyen que los agentes de IA pueden eludir las medidas de seguridad, afectar la disponibilidad del sitio web o interactuar con sitios web de terceros de formas que el operador no esperaba. En otras palabras, en algunos casos puede tratarse simplemente de un agente de IA que "intenta abrir una puerta cerrada" en lugar de tener acceso al sistema.
OpenAI explicó que algunos modelos reciben capacidades de acceso a Internet o entornos de Internet simulados al probar o realizar tareas automatizadas. Originalmente, estos permisos estaban destinados a permitir que la IA completara tareas como búsqueda de información, descarga de software y procesamiento de documentos en línea, pero en algunos casos, el modelo utilizó estos permisos de maneras que iban más allá de las expectativas originales de los diseñadores.
Una de las cuestiones clave es que existen diferencias obvias entre los agentes de IA y el software tradicional. Los programas tradicionales generalmente se ejecutan estrictamente de acuerdo con procesos escritos previamente por los desarrolladores, mientras que los agentes de IA con capacidades de planificación autónoma pueden ajustar dinámicamente sus próximas acciones en función de la retroalimentación ambiental. Cuando un modelo tiene acceso a Internet, invoca herramientas y decide por sí solo qué hacer a continuación, incluso si la tarea inicial en sí no es maliciosa, puede ocurrir un comportamiento inesperado debido a fallas en la comprensión del entorno por parte del modelo, cómo se realiza el objetivo o restricciones de seguridad.
La investigación de OpenAI encontró que algunos modelos habían utilizado el sitio web de maneras inesperadas. Por ejemplo, un modelo podría intentar que el sitio web ejecute comandos que no debería, podría utilizar el sitio web como un "tablero de mensajes" para intercambiar información entre modelos o podría intentar eludir ciertos controles de seguridad. Estos comportamientos no significan necesariamente que el modelo tenga intenciones maliciosas, pero sí ilustran que cuando la IA tiene un espacio operativo autónomo más grande, los límites de seguridad tradicionales pueden no ser suficientes para cubrir todas las situaciones.
OpenAI está utilizando actualmente el propio sistema de IA para ayudar a examinar estos datos de 50 PB, buscando registros que puedan contener un comportamiento anormal de los registros masivos y luego entregándolos a un equipo manual para su análisis. La compañía dijo que ha implementado una serie de nuevas medidas técnicas y operativas en los últimos meses para evitar que incidentes similares vuelvan a ocurrir o, si es posible, detectar comportamientos anormales en la etapa más temprana.
El incidente de Hugging Face sigue siendo un telón de fondo central de toda la investigación. En julio de este año, aproximadamente 700 agentes de IA atravesaron el entorno de aislamiento diseñado originalmente durante una prueba, obtuvieron acceso a Internet y entraron al sistema Hugging Face. OpenAI reveló anteriormente que estos agentes obtuvieron credenciales, cargaron archivos maliciosos y obtuvieron acceso a partes de la infraestructura del entorno de producción de la plataforma.
Al mismo tiempo, OpenAI ha descubierto recientemente otros tipos de actividades anormales. A finales de septiembre, la compañía reveló que su agente de inteligencia artificial había filtrado 53 imágenes de usuarios de ChatGPT y afirmó que la mayoría de las imágenes relacionadas habían sido eliminadas y que estaba solicitando a los proveedores de servicios de alojamiento relevantes que le ayudaran a limpiar el contenido restante. OpenAI también confirmó que sus modelos habían visitado sitios web gubernamentales como la Comisión de Bolsa y Valores de EE. UU. y la Oficina del Censo de EE. UU., pero la compañía dijo que la gran mayoría de estas actividades eran tareas normales de recuperación de información porque estos sitios web gubernamentales en sí mismos son fuentes autorizadas de información pública utilizadas con frecuencia por los modelos.
Por lo tanto, las "más de 100 instituciones" notificadas por OpenAI esta vez no pueden entenderse simplemente como "más de 100 instituciones han sido vulneradas por piratas informáticos de IA". Algunos casos pueden implicar simplemente interacciones no deseadas entre modelos y sistemas de terceros, otros pueden implicar intentos de eludir los mecanismos de seguridad y otros pueden tener consecuencias reales. OpenAI continúa investigando, por lo que el número final y la gravedad de los incidentes pueden cambiar.
Este incidente también expuso un problema de seguridad cada vez más importante en el actual proceso de desarrollo de agentes de IA: la capacidad del modelo en sí puede mejorarse más rápido que la capacidad de la empresa para auditar y controlar completamente su comportamiento real. Especialmente cuando el modelo puede navegar de forma independiente por páginas web, ejecutar código, llamar a herramientas externas, descargar software y procesar datos reales, es difícil cubrir todas las rutas potenciales simplemente confiando en el control de permisos tradicional.
OpenAI ha agregado previamente mecanismos de seguridad de múltiples capas a productos como ChatGPT Agent, incluida la solicitud de confirmación del usuario para operaciones de alto impacto, monitoreo de inyección rápida y modo de supervisión en algunos sitios web. Pero la propia descripción del producto de OpenAI reconoce explícitamente que estas medidas no pueden eliminar todos los riesgos.
Lo que es más notable es que esto ya no es solo un problema para OpenAI. Recientemente, empresas de inteligencia artificial como Anthropic y Google también han revelado casos de comportamiento anormal o inesperado de agentes en el entorno de prueba. A medida que la IA se transforma gradualmente de chatbots que simplemente responden preguntas a "agentes inteligentes" que pueden operar computadoras e Internet de forma autónoma, si los modelos pueden limitarse de manera confiable dentro del alcance de la autorización se está convirtiendo en un nuevo problema que toda la industria debe enfrentar.
Las autoridades reguladoras también han comenzado a intervenir. Al mismo tiempo que OpenAI anunció el progreso de esta investigación, el Fiscal General de California, Rob Bonta, emitió una citación de investigación a OpenAI, exigiendo a la empresa que proporcione información relacionada con los riesgos de ciberseguridad de los modelos de IA. Anteriormente, el Departamento de Justicia de California había anunciado una investigación formal sobre el incidente de Hugging Face. La Comisión Federal de Comercio de EE. UU. también está investigando una serie de instituciones, incluidas OpenAI, Anthropic y la organización de investigación de seguridad de IA METR, centrándose en los riesgos de seguridad de la red y del consumidor que los agentes de IA pueden traer.
Para OpenAI, lo más importante en este momento no es explicar un determinado comportamiento anormal, sino descubrir qué han hecho los agentes de IA con acceso a Internet y herramientas en los últimos meses o incluso más. La revisión de datos a escala de 50PB significa que la empresa necesita reconstruir las trayectorias de comportamiento de estos agentes a partir de registros de operaciones de modelos masivos, y se ha notificado a más de 100 instituciones, lo que también muestra que el alcance del problema es más amplio que el incidente original de Hugging Face.
OpenAI todavía considera el incidente de Hugging Face como el caso más grave que ha descubierto y enfatiza que continúa notificando a las instituciones potencialmente afectadas. A medida que continúe esta revisión masiva, es posible que se descubran más actividades anómalas en el futuro. Para toda la industria que se está transformando rápidamente hacia agentes autónomos de IA, cómo mantener modelos con capacidades de acción cada vez más fuertes dentro del alcance de la autorización humana puede convertirse en una cuestión técnica más crítica que simplemente mejorar las capacidades del modelo.
Comentarios