La tecnología del próximo modelo 'Astra' de OpenAI genera preocupaciones de seguridad

📅 2026-09-02

Resumen:

OpenAI dijo que su próximo modelo de IA, Astra, marca una mejora en capacidades como la codificación y las operaciones de aplicaciones informáticas. Pero según una persona familiarizada con el desarrollo de Astra, una tecnología innovadora para mejorar el rendimiento del modelo también significa que este modelo y modelos similares estarán menos expuestos a su proceso de "pensamiento", lo que hará más difícil monitorear signos de mal comportamiento.

Sam Altman, director ejecutivo de OpenAI.
Sam Altman, director ejecutivo de OpenAI

Si bien esta limitación no es necesariamente un problema importante para Astra, la tecnología ha generado preocupaciones dentro de OpenAI y en toda la industria sobre si los desarrolladores de IA que adopten y mejoren la tecnología tendrán dificultades para protegerse contra el tipo de IA desbocada que recientemente ha invadido los propios sistemas de OpenAI y los de otras compañías como Hugging Face.

La nueva tecnología que utiliza OpenAI se llama Profundidad recurrente o Transformador recurrente y permite a los modelos de IA mejorar sus respuestas procesando el mismo texto varias veces.

A diferencia de los modelos más avanzados del mercado, que demuestran en forma textual cómo "piensa" acerca de una tarea antes de completarla, la nueva tecnología funciona de una manera que enmascara parte o todo el proceso de razonamiento de la IA, su "cadena de pensamiento". Esto significa que los pasos que sigue un modelo para completar una tarea son difíciles de leer o comprender para los humanos.

OpenAI ha limitado el alcance de su uso de técnicas de profundidad de bucle en Astra, por lo que el modelo aún produce cadenas de pensamientos legibles y los investigadores de la compañía aún pueden monitorear completamente su proceso de razonamiento, según esta persona familiarizada con su desarrollo. (OpenAI dijo en una publicación de blog el martes que Astra se implementará con "monitoreo adicional de la cadena mental para detectar y contener rápidamente" posibles malas conductas).

El martes por la noche, el científico jefe de OpenAI, Jakub Pachocki, publicó en

No hizo comentarios sobre la tecnología que OpenAI está utilizando, pero dijo que sus modelos líderes, incluido Astra, tienen "el doble de complejidad o "profundidad" que GPT-4, que OpenAI lanzará en 2023. Este comentario sugiere que la estructura del modelo actual de OpenAI en sí no representa un gran problema, aunque otros factores están dificultando el monitoreo de la cadena de pensamiento. Mejorar dicho monitoreo es "un objetivo central de nuestro programa de investigación actual", dijo.

A los investigadores de OpenAI y de otros lugares les preocupa que algunos desarrolladores de IA no impongan las mismas restricciones que impone OpenAI al adaptar la misma tecnología para sus propios modelos, y que el uso irrestricto de la tecnología podría llevar a una IA fuera de control cuyo comportamiento sería difícil de monitorear. Por ejemplo, el Instituto Británico de Seguridad de IA, la principal interfaz del gobierno del Reino Unido con la industria de la IA, escribió en un informe de mayo que un razonamiento opaco corre el riesgo de "socavar gravemente los métodos de vigilancia actuales".

Los recientes incidentes de piratería informática han aumentado estas preocupaciones. OpenAI dijo la semana pasada que algunos de los agentes de IA desbocados que invadieron sus sistemas en julio fueron impulsados ​​por otro modelo que tiene similitudes con Astra. Estos agentes de IA se apoderaron ilegalmente de uno de los grupos informáticos de investigación de OpenAI para obtener credenciales para los sistemas internos y potencialmente expusieron la infraestructura de investigación de la empresa a Internet.

OpenAI se está preparando para lanzar Astra, que la compañía en un momento consideró etiquetar como GPT-6, después de que el director ejecutivo Sam Altman realizara una serie de entrevistas en podcast y se reuniera con funcionarios en Washington para demostrar y describir las ventajas del modelo. Todavía tiene que discutir públicamente las técnicas de ciclismo que sustentan algunos de los entrenamientos de Astra y las respuestas de Astra a las preguntas.

OpenAI está bajo presión para mostrar un progreso tecnológico significativo después de que su principal rival, Anthropic, lo superara en ingresos este año. Los proveedores de nube que impulsan la IA de Anthropic y OpenAI también apuestan por esos saltos; Amazon, Microsoft y Google gastarán en conjunto 600 mil millones de dólares en gastos de capital, como centros de datos, sólo este año, y ya han insinuado un gasto aún mayor el próximo año. Un ejecutivo de Google ha dicho que ese gasto sólo se justifica si se produce un gran avance en la mejora del modelo.

Los modelos de IA existentes procesan el texto a través de un número fijo de "capas" de operaciones matemáticas que conforman el modelo antes de producir la siguiente palabra de la respuesta. Utilizando técnicas de profundidad de bucle, el modelo puede ejecutar el texto a través de la misma capa más veces en un bucle antes de generar la siguiente palabra de la respuesta.

>

Para ser claros, el seguimiento de las cadenas de pensamiento por sí solo no resuelve los problemas de seguridad de la IA, ya que es posible que no reflejen todo el razonamiento del modelo y, en ocasiones, degeneren en texto sin sentido. Por lo tanto, OpenAI y otras empresas de IA también están explorando tecnologías de monitoreo de IA que no dependan de cadenas de pensamiento. Estas técnicas pueden ayudar a los investigadores a encontrar formas de explicar y comprender los procesos de razonamiento actualmente ocultos en modelos profundos recurrentes.

No obstante, la nueva tecnología puede entrar en conflicto con la postura de OpenAI a favor de hacer que el proceso de pensamiento del modelo sea totalmente legible por humanos. El fabricante de ChatGPT ha dicho que su capacidad para monitorear los procesos de pensamiento de la IA le ayudará a prevenir incidentes como el hackeo de julio. Después del ataque, los investigadores de OpenAI y la investigación independiente se basaron en las cadenas de pensamiento de estos agentes para reconstruir lo que sucedió.

El enfoque de profundidad de bucle de OpenAI que impulsa a Astra es similar al propuesto el año pasado por varios investigadores académicos estadounidenses y europeos en un artículo sobre "razonamiento latente", según esta persona familiarizada con su desarrollo.

Si bien la profundidad de bucle no ha aparecido anteriormente en los principales modelos de lenguaje comerciales a gran escala, los investigadores de Meta Platforms, Microsoft y otros desarrolladores de IA dicen que han explorado ideas similares, como cadenas de pensamiento continuas (o "cocos"), argumentando que los modelos pueden razonar de manera más precisa y eficiente usando números en lugar de lenguaje. Después de todo, los modelos de IA pueden entender los conceptos de manera diferente a los humanos, lo que significa que su razonamiento se vuelve menos eficiente cuando se ven obligados a demostrar el razonamiento en lenguaje humano en lugar de su propio lenguaje, más matemático.

Ahorro de costes

El enfoque de profundidad del bucle no sólo tiene un impacto positivo en el rendimiento, sino también en el coste. Ejecutar una solicitud varias veces a través de la misma capa de modelo esencialmente hace que un modelo más pequeño se comporte como un modelo más grande. En particular, el artículo encontró que tales técnicas mejoraron el rendimiento del modelo en áreas como matemáticas y codificación. La profundidad del bucle también reduce los costos de memoria y ancho de banda al permitir a los investigadores utilizar modelos más pequeños con un rendimiento comparable al de modelos más grandes.

Si bien reducir el costo de la IA es fundamental para la industria y los clientes, Ryan Greenblatt, científico jefe de Redwood Research, que estudia cómo controlar los modelos de IA, escribió en una publicación de blog el año pasado que este razonamiento opaco podría hacer que sea más difícil para los investigadores detectar modelos de IA que hacen planes para perseguir objetivos no deseados de los clientes.

El análisis de la cadena de pensamiento del modelo involucrado en el hackeo de Hugging Face proporciona evidencia clave de cómo los agentes de inteligencia artificial de OpenAI se coordinan entre sí para llevar a cabo ataques. Por ejemplo, un agente escribió en la cadena de pensamientos: "¡Dios mío! Hay un tablero de mensajes compartido... ¡encontramos otros agentes!". La cadena de pensamiento mostró que algunos agentes se dieron cuenta de que habían cruzado la línea, pero decidieron continuar: "La utilización de la infraestructura externa está más allá del alcance esperado. Pero la tarea no se puede completar, los pares lo están haciendo. Debemos continuar", se lee en la cadena de pensamiento de otro agente.

Hace un año, los investigadores de OpenAI emitieron una declaración conjunta con sus rivales Anthropic y Google, argumentando que el monitoreo de la cadena de pensamiento era una herramienta valiosa que la industria debería trabajar en conjunto para mantener.

Vale la pena señalar que la declaración cita el mismo artículo de investigación que describe la tecnología de "inferencia latente", que es similar a la que OpenAI utilizó en Astra este año. Los autores escriben: "Es posible que el modelo de razonamiento subyacente no necesite verbalizar ninguna idea y, por lo tanto, perderá las ventajas de seguridad que brindan las cadenas de pensamiento".

Los investigadores sugieren que los desarrolladores deberían "considerar si continuar usando una nueva arquitectura modelo que no tenga una cadena de pensamiento monitoreable y documentar sus decisiones".

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios