Resumen:
El 2 de septiembre, el científico jefe de OpenAI, Jakub Pachocki, publicó un mensaje en las plataformas sociales en respuesta a la reciente controversia en torno al nuevo modelo "no monitorizable" Astra. La controversia surge el día anterior, cuando se supo que el próximo modelo Astra de OpenAI utiliza una tecnología de inferencia llamada Profundidad Recurrente.
En este modo, el mismo conjunto de capas de Transformador se calcula repetidamente y parte del proceso de razonamiento ocurre dentro del modelo, y no es necesario presentarlo todo en forma de una cadena de pensamiento, por lo que también se le llama "bucle opaco".

Pachocki expresó la esperanza de evitar una carrera armamentista hacia un estado incontrolable causado por información inexacta, es decir, grandes laboratorios compitiendo para desarrollar modelos que son demasiado poderosos para ser monitoreados y revisados por humanos, lo que lleva a un fracaso total del control de seguridad.
Enfatizó que la profundidad del gráfico computacional de los modelos de vanguardia, incluido Astra, no es más del doble que la del GPT-4, lo que indica que la arquitectura del modelo no ha experimentado un salto en complejidad como lo temía el mundo exterior.
La profundidad del gráfico de cálculo aquí se refiere a la cadena más larga de pasos de cálculo que deben ejecutarse secuencialmente para completar una tarea de inferencia y no pueden acelerarse en paralelo. En el pasado, los cálculos intracapa bajo la arquitectura Transformer ordinaria podían ser masivamente paralelos y la profundidad de la serialización era aproximadamente igual al número de capas del modelo.
La profundidad del ciclo de los rumores del mercado puede iterar el mismo conjunto de módulos para múltiples rondas de pensamiento, aumentando la profundidad del razonamiento interno antes de generar el siguiente token (elemento de palabra), en lugar de depender únicamente de cadenas de pensamiento de texto visibles más largas, lo que puede mejorar las matemáticas, la codificación y otros rendimientos y reducir los costos.
El riesgo de seguridad implícito de esta arquitectura es que cuando la profundidad del gráfico de cálculo es extremadamente alta, el modelo puede completar implícitamente una gran cantidad de pasos de razonamiento internamente sin escupir la cadena completa de pensamiento en el resultado. Los humanos no podrán ver el proceso de pensar, planificar y encontrar lagunas y luego entrarán en un estado incontrolable. La auditoría de seguridad y el monitoreo de la cadena de pensamiento fracasarán.

Después de que se reveló la noticia relevante, la comunidad de seguridad de IA reaccionó enérgicamente. Buck Shlegeris, director ejecutivo de Redwood Research, una organización sin fines de lucro para la seguridad de la IA, escribió que estaba "extremadamente preocupado". Basado en el incidente anterior del modelo OpenAI que atacó a la comunidad Hugging Face, dijo que no está seguro de si la monitorización de la cadena de pensamiento de Astra es mucho peor que el modelo anterior, pero si esta tecnología se promueve aún más y el número de ciclos aumenta considerablemente, la monitorización de la cadena de pensamiento quedará completamente destruida. Esto es particularmente preocupante porque si los investigadores no pueden ver la cadena de pensamiento, será más difícil investigar los incidentes de seguridad relacionados, lo cual es realmente aterrador.
Ryan Greenblatt, científico jefe de Redwood Research que participó en la investigación del incidente de seguridad de Hugging Face, también dijo que este puede ser el revés más grave en la seguridad de la IA hasta el momento. Zvi Mowshowitz, un escritor que durante mucho tiempo se ha preocupado por la seguridad de la IA, criticó esta tecnología como "jugar con fuego" e incluso dijo que se necesitan leyes para evitar la competencia entre laboratorios de IA por estándares más bajos.
Pachoki admitió en su respuesta que el monitoreo de la cadena de pensamiento es realmente frágil y se está desarrollando en una dirección más difícil, pero no es causado por cambios arquitectónicos. OpenAI se ha comprometido a mantener y utilizar el monitoreo de la cadena de pensamiento desde sus primeros modelos de inferencia y cree que esta tecnología puede ayudar a observar cómo las capacidades de alineación del modelo se generalizan a partir de la distribución del entrenamiento. Fortalecer el seguimiento de las cadenas de pensamiento sigue siendo el objetivo central de los proyectos de investigación actuales.
OpenAI declaró que implementará un monitoreo adicional de la cadena de pensamiento para que Astra detecte y frene rápidamente posibles malas conductas. Según las noticias del mercado, el uso de la tecnología de profundidad de bucle por parte de Astra es limitado y aún se espera que la cadena de pensamiento del modelo siga siendo legible. Plataformas como Anthropic y Google DeepMind en la industria ya están discutiendo tecnologías similares.
Comentarios