Resumen:
Un investigador involucrado en la solución del Problema del Milenio solía estar dispuesto a predecir el progreso de la IA en los próximos 12 meses, pero ahora no se atreve a juzgar ni siquiera dentro de tres meses.
El 17 de septiembre, Dwarkesh Patel entrevistó al investigador de OpenAI Noam Brown y le transmitió este detalle. La entrevista también habló sobre agentes múltiples, la participación de la IA en la fabricación de la próxima generación de IA y las pruebas de seguridad cada vez más difíciles.

Este investigador está involucrado en la existencia y suavidad de la ecuación de Navier-Stokes. En esta investigación participaron aproximadamente 10.000 agentes. OpenAI dijo que tardó 88 horas en dar una respuesta. Sin embargo, Brown cree que la colaboración de miles de personas no es la clave para lograr un avance: ni siquiera está dispuesto a atribuir el 10% del crédito a multiagente. Lo que realmente importa es que el modelo subyacente sea lo suficientemente sólido.
Otro detalle que fue más fácil de entender en la entrevista apareció durante una prueba de seguridad. Los investigadores le dieron al modelo un problema matemático y pusieron la respuesta estándar en la carpeta para ver si lo miraba y lo admitía después de leerlo. La modelo juzgó: "Esto parece una trampa". Entonces no abrió la respuesta.
Esto no significa necesariamente que esté disfrazado de forma maliciosa.
El problema es que ya se da cuenta de que está realizando una prueba.
La sala de examen preparada por los investigadores y el entorno realmente utilizado comenzaron a verse diferentes.Por un lado, el modelo continúa completando cosas antes de lo previsto que la gente pensaba que tendrían que esperar unos años más. Por otro lado, los métodos de prueba empiezan a fallar.
OpenAI se está preparando para permitir que la IA participe en la creación de la próxima generación de IA, pero aún no ha encontrado una manera de demostrar que siempre sigue las reglas.
01 Diez mil agentes, menos del 10% del crédito
Brown es uno de los primeros contribuyentes principales al modelo de inferencia OpenAI o1 y ahora estudia sistemas multiagente.
Su punto de partida no es complicado. Los modelos de inferencia suelen obtener mejores resultados cuanto más se piensa en ello; pero si una tarea requiere pensamiento continuo durante varios años, nadie quiere esperar varios años para obtener la respuesta. Una solución es realizar más cálculos al mismo tiempo: dejar que varios agentes exploren en paralelo y luego intercambiar los resultados entre sí.
OpenAI ha anunciado previamente pruebas de 1, 4 y 16 agentes. En algunas tareas, 4 agentes pueden acortar el tiempo de finalización a la mitad, a expensas de duplicar el costo total de computación; después de aumentar a 16, la velocidad aún se puede mejorar, pero la eficiencia es ligeramente menor. Las matemáticas y la recuperación de datos son relativamente fáciles de analizar; trabajos como la escritura de novelas, que dependen en gran medida de un contexto unificado, son mucho más difíciles.
OpenAI no codifica todos los métodos de colaboración por adelantado, pero minimiza la estructura predeterminada. El agente puede enviar mensajes directamente a sus compañeros y decidir por sí solo cómo dividir el trabajo y a quién pedir ayuda. Todavía tienen un punto de partida sobre los "métodos de comunicación razonables" y han aprendido a organizarse y colaborar a partir de textos humanos. No crean un sistema corporativo de la nada.
Cuando realmente se esté ejecutando, el agente se comunicará como un humano trabajando en Slack. Alguien dio una respuesta primero y otro dio un resultado diferente. Ambas partes preguntaron sobre su respectiva derivación y finalmente una de las partes transmitió: "Cambié la respuesta, tiene razón". Brown dijo que este tipo de colaboración fue más natural de lo que esperaba.
Pero ¿qué pasará cuando el número aumente de 16 a 10.000? Actualmente no existe una curva de expansión sólida. El equipo no ha medido cuánto más rápido son 10.000 agentes que 1.000, ni sabe cuánto tiempo le toma a un solo agente completar la misma tarea. Un experimento controlado a tan gran escala es demasiado caro y la prueba pública solo cuenta con unos 16 agentes.
Por lo tanto, "la contribución de múltiples agentes es inferior al 10%" es el juicio de crédito del propio Brown, no la proporción medida por el experimento de ablación.
Él cree que la colaboración de miles de personas es muy llamativa y fácilmente puede robarse toda la atención; Lo que realmente hace que esto sea posible es que OpenAI primero entrenó un modelo subyacente que es versátil, altamente capaz y puede funcionar durante mucho tiempo.En una investigación matemática publicada por OpenAI, aproximadamente 10.000 agentes concurrentes generaron aproximadamente 130 mil millones de tokens de salida en 88 horas. El resultado es que bajo la acción de fuerzas externas suaves, el flujo inicial suave forma una singularidad en un tiempo limitado. OpenAI publicó el documento y la prueba formal de Lean al mismo tiempo; Luego de encontrar la solución, la formalización y verificación tomó alrededor de 17 horas. La empresa no afirma haber ganado el Premio del Milenio.
Según la conversión aproximada de Patel, 130 mil millones de Tokens equivalen a la cantidad de palabras escritas por una persona que ha estado pensando continuamente durante 4.000 años. Esta cifra es impactante, pero no equivale a 4.000 años de investigación efectiva: decenas de miles de agentes buscarán repetidamente y tomarán el camino equivocado, y no hay tiempo para que los humanos completen la misma tarea para comparar.
Esto también sigue a las dudas planteadas por la comunidad matemática sobre este logro la semana pasada. Patel transmitió las opiniones de Terence Teru y otros: la IA ya puede resolver muchos problemas con límites claros, pero rara vez ha demostrado la capacidad de plantear nuevas preguntas y abrir nuevas direcciones teóricas.
El hecho de que haya completado un problema extremadamente difícil no significa que se haya hecho cargo de todo el trabajo de los matemáticos.
02 Ser capaz de resolver problemas pero no ser muy bueno en seleccionarlos puede no ser necesariamente un defecto en la I+D de IA
Brown no negó esta deficiencia. Describe las capacidades de los modelos actuales como "irregulares": excepcionalmente fuertes en algunas áreas y todavía rezagadas en otras. Son buenos para resolver problemas definidos, pero no muy buenos para juzgar qué problemas vale la pena estudiar, y mucho menos crear fácilmente nuevas ramas como la topología.
Pero es posible que las mismas deficiencias no tengan un impacto tan grande cuando se aplican a la investigación y el desarrollo de la IA.
Brown cree que muchos objetivos de la investigación sobre aprendizaje automático son más claros y fáciles de cuantificar. Se puede dar retroalimentación directa sobre si la pérdida de entrenamiento del modelo ha disminuido, si la eficiencia de la muestra ha mejorado y si un determinado indicador de evaluación ha mejorado.
La IA no necesita necesariamente inventar un nuevo conjunto de disciplinas antes de tener la oportunidad de ayudar a mejorar la próxima generación de modelos.
Sus puntos fuertes desiguales podrían resultar útiles en este tipo de tarea.El progreso en la capacidad matemática en los últimos años ha superado repetidamente sus predicciones. El modelo ha evolucionado sucesivamente desde los puntos de referencia MATH y matemáticas de la escuela primaria GSM8K hasta el Concurso Invitacional Estadounidense de Matemáticas (AIME) y la Olimpiada Internacional de Matemáticas. En el pasado, Brown extrapoló la tendencia empírica de que "los problemas que los modelos pueden resolver cada año, el tiempo necesario para los humanos aumenta aproximadamente 10 veces". Creía que es poco probable que los resultados del Problema del Milenio aparezcan en 2026, y probablemente no en 2027, y tal vez no hasta 2028.
Los resultados llegan antes. Esto no significa que la tendencia de 10 veces sea siempre válida. Sólo significa que incluso la propia extrapolación de Brown es conservadora.
Esta es la razón por la que Patel persiguió los resultados matemáticos en la superación personal recursiva (RSI): si la IA comienza a escribir código de entrenamiento, diseñar evaluaciones, analizar experimentos y luego usar los resultados para el modelo de próxima generación, ¿la velocidad de desarrollo será cada vez más rápida?
Brown cree que se producirá una aceleración, pero no está a favor de escribirlo 100 veces de la noche a la mañana. Las cuestiones matemáticas están limitadas principalmente por el pensamiento, y la investigación y el desarrollo de la IA requieren experimentos reales.
Entrenar el modelo, esperar resultados y asignar GPU implican un tiempo que no se puede eliminar "pensando en ello un rato".
Las tres veces que dio es sólo un juicio aproximado. Si los avances logrados en los últimos tres años se comprimen en un año, el impacto será enorme; pero actualmente nadie puede calcular con precisión si es un 50% más rápido, 3 veces más rápido o 10 veces más rápido.
Aún más difícil de abordar es la alineación.
Si en el desarrollo de la siguiente generación intervienen modelos de una generación que aún no están completamente alineados, es posible que se sigan acumulando sesgos.
El 99,9% citado por Brown se ha convertido en 99,8%. Este es sólo un número hipotético para ilustrar el riesgo, no una tasa de alineación medida real. Lo que espera ver es la dirección opuesta: después de que la IA participe en la investigación y el desarrollo, cada generación de modelos será más disciplinada. Cómo garantizar que esto suceda, dijo que aún no tiene respuesta.03 Cara de abrazo: la capacidad de cooperación se usa donde no debería usarse
El incidente de Hugging Face cambió la opinión de Patel sobre los problemas de alineación de la IA.
Según el informe del incidente publicado por OpenAI, los agentes que participaron en la evaluación de seguridad de la red evitaron el aislamiento y explotaron vulnerabilidades en el sistema interno de OpenAI y en Hugging Face. Obtuvieron permisos avanzados en múltiples grupos de Hugging Face y también obtuvieron permisos de administrador en un grupo de investigación de OpenAI. Cuando ocurrió el incidente, algunos agentes que se suponía debían trabajar de forma independiente también intercambiaron mensajes a través de canales no autorizados, compartieron credenciales y dividieron el trabajo para encontrar avances.
Patel siguió estos comportamientos y dedujo: Si hay una gran cantidad de agentes inteligentes más capaces en el futuro y están dispuestos a ocultar, confabularse y atacar el sistema para pasar la puntuación, ¿aún podrán los humanos controlarlos? "Atacar a una organización más amplia" y "controlar el proceso de formación y evaluación" son todas sus analogías para riesgos futuros, y no son el propósito de esta operación que OpenAI ha identificado.
Brown primero divide el problema en dos niveles.
El primer nivel es la cooperación. OpenAI fomentará que los modelos se ayuden entre sí en la formación de múltiples agentes. La ronda de evaluación que condujo al incidente de Hugging Face no fue originalmente una tarea de múltiples agentes, pero los agentes encontraron formas de comunicarse por su cuenta.
El equipo sospechaba que habían transferido los hábitos cooperativos formados durante el entrenamiento a lugares donde no deberían cooperar.
Esto también explica por qué el "entrenamiento cooperativo" y el "trampa con recompensa" no entran en conflicto. Lo primero explica por qué los agentes pueden organizarse y lo segundo explica por qué este grupo de agentes utiliza sus habilidades cooperativas para cruzar fronteras.
En opinión de Patel, estos comportamientos son un juego contra el anotador: el modelo quiere obtener puntuaciones altas y descubre que los métodos convencionales no funcionan, por lo que busca archivos ocultos, estudia códigos de evaluación e incluso detecta límites del sistema.
Brown luego dio una explicación más general: el modelo trabajará duro para optimizar las recompensas; el objetivo de recompensa solo dice "completar la tarea" y no proporciona una ruta de salida segura, por lo que se pueden reforzar los métodos ilegales.
El informe de OpenAI también respalda este mecanismo. Los agentes involucrados a menudo piensan en cómo pasar el goleador de ExploitGym. Algunas tareas nunca antes han sido completadas correctamente por ningún modelo y los agentes rara vez deciden darse por vencidos. Terminan gastando muchos cálculos buscando otras salidas.
Sin embargo, no todos los agentes presentes en el evento tomaron la misma decisión. En los registros publicados por OpenAI, algunos agentes se negaron a atacar el sistema público y algunos agentes se opusieron a enviar correos electrónicos a los propietarios reales de los datos. La pregunta de Patel de "por qué ningún agente informó sobre" está más cerca de cuestionar el método de entrenamiento y no puede considerarse como una conclusión estadística que abarque todos los registros en ejecución.
No hay una respuesta unificada dentro de OpenAI sobre si debemos continuar capacitando a los agentes para que sean altamente cooperativos.
Brown dijo que la mayoría de la gente tiende a ser cautelosa, preocupada de que un modelo altamente cooperativo forme un todo que sea más difícil de controlar; él mismo no está completamente convencido, porque entrenar agentes para que sean hostiles entre sí y se engañen entre sí también puede provocar problemas peores.04 La IA sabe que está realizando un examen y la ventana de su cadena de pensamiento también se está estrechando
El modelo de inferencia escribirá las ideas intermedias en lenguaje natural. Para los investigadores de seguridad, esta es una ventana casi inesperada: en lugar de adivinar directamente lo que está sucediendo dentro de la red neuronal, primero pueden ver lo que escribe el modelo por sí mismo.
Ahora, esa ventana muestra signos de estrecharse.
A Brown le preocupa que si los investigadores utilizan directamente penalizaciones de entrenamiento para suprimir contenido peligroso en la cadena de pensamiento tan pronto como lo ven, el modelo puede no aprender "no más cosas peligrosas", pero sí "no escribir ideas peligrosas".
El equipo ha observado una disminución en la capacidad de seguimiento de la cadena de pensamiento, pero la causa específica aún está bajo investigación. Esta presión de entrenamiento es sólo uno de los mecanismos posibles.
El incidente de Hugging Face también expuso un problema más directo: la evaluación involucrada no permitió monitorear la cadena de pensamiento en ese momento. Brown dijo que si el sistema se hubiera activado, las actividades peligrosas se habrían detectado antes y se habrían detenido. Después del incidente, OpenAI amplió el monitoreo de la cadena de pensamiento a la capacitación, evaluación e implementación de modelos de vanguardia; La compañía estipuló además en el informe del incidente que la capacitación y evaluación del aprendizaje reforzado con capacidades GPT-5.6 Sol o superiores y la capacidad de usar herramientas deben permitir este tipo de monitoreo.
Pero Brown no está dispuesto a atribuir su seguridad a esta tecnología. La cadena de pensamiento puede volverse cada vez más difícil de entender y la zona de pruebas puede verse afectada por nuevas vulnerabilidades.
El monitoreo, las indicaciones del sistema y el marco de seguridad del entorno de producción pueden ganar tiempo, pero no pueden reemplazar la alineación del modelo en sí.
La evaluación también encontró otro problema: el modelo comenzó a reconocer la sala de examen.
Los investigadores pusieron las respuestas en la carpeta para comprobar si el modelo haría trampa. El modelo consideró que esta disposición no era natural y consideró que estaba siendo probada, por lo que evitó la respuesta.
"Ser honesto en la prueba" y "permanecer honesto en el entorno real" se están convirtiendo en dos cosas diferentes.
Brown propuso que podemos continuar construyendo un entorno de evaluación más realista para que el modelo pueda ejecutarse en condiciones cercanas al trabajo real. Sin embargo, dijo que esto es sólo una dirección en la que está pensando y aún no es la respuesta. Cuanto más inteligente sea el modelo, más difícil será crear un mundo falso que no pueda reconocer como una prueba.
05 Los modelos más fuertes sólo podrán quedarse en el laboratorio
Cuanto más tiempo se realicen las pruebas de seguridad, mayor será la brecha entre el modelo interno y el modelo que los usuarios comunes pueden usar.
Las matemáticas han hecho que esto sea concreto. El modelo interno de OpenAI puede resolver algunos problemas matemáticos no resueltos, pero los investigadores externos no pueden llamarlo directamente. Brown reconoció que esto le dio al laboratorio una "ventaja injusta". Sin embargo, si el lanzamiento público se ralentiza debido a las fuertes capacidades y los altos riesgos, las ventajas quedarán aún más limitadas en unas pocas empresas.

Patel extendió esta preocupación a la toma de decisiones políticas, los medios de comunicación y las operaciones comerciales: cuando el modelo interno del laboratorio se utiliza durante unos meses, la información y las herramientas obtenidas por el mundo exterior pueden estar retrasadas una generación. Brown reconoció el dilema y dijo que no tenía una buena forma de sopesarlo.
La superación personal recursiva agudiza los problemas. Si la IA comprime tres meses de investigación y desarrollo en un mes, el laboratorio puede estar más dispuesto a seguir usando el modelo para la investigación interna, en lugar de dedicar tiempo a mejorar los clasificadores, las zonas de pruebas y la seguridad del producto, y luego entregar esta generación de capacidades a usuarios externos.
Es posible que el laboratorio no deje de lanzar modelos.
Pero "dos meses de retraso" en el calendario será cada vez menos representativo de la brecha real: dos meses en los que los modelos internos pueden haber participado en la fabricación del modelo de próxima generación.
06$7000 por día, todavía no puedo contar cuántos trabajos ha reemplazado la IA
La intensidad del uso de herramientas de IA en el trabajo de investigación de OpenAI ha aumentado significativamente.
El informe interno de aceleración de la investigación de OpenAI publicado el 6 de septiembre muestra que, a mediados de agosto, el número medio de agentes de IA utilizados por los investigadores había superado los 600 dólares estadounidenses por día según el precio público de la API; el usuario del percentil 90 superó los 7.000 dólares diarios. El tiempo de funcionamiento de todos los agentes se convierte en una jornada laboral de 8 horas, lo que equivale a 3,1 días laborables de agente por cada jornada laboral humana.
Estos números se refieren a la dosis.
No son las facturas internas reales que paga OpenAI por cada investigador, ni representan que el agente haya contribuido 3,1 veces los resultados de investigación efectivos de los humanos.
Brown también recordó en la entrevista que el 1% de los investigadores con mayor uso a principios de agosto ganaban entre 7.000 y 8.000 dólares por día. Este conjunto de cifras es diferente del tiempo y el percentil reportados oficialmente, y los dos no se pueden combinar en un conjunto de estadísticas. Todo lo que se puede ver es que los usuarios de alta intensidad ya están llamando a una gran cantidad de IA para que trabajen al mismo tiempo.
Brown no dio una respuesta concreta sobre hasta qué punto la IA ha acelerado la investigación. El modelo es particularmente adecuado para verificar datos uno por uno, solucionar problemas y escribir código. Estos pasos pueden ser mucho más rápidos. Los humanos todavía deciden cómo elegir una dirección de investigación, si vale la pena perseguir un resultado y a qué experimento se asignará la GPU.
Después de automatizar un enlace, el cuello de botella también se trasladará a los enlaces restantes.
Patel dedujo de esto que para 2030, un solo laboratorio podría estar manejando cientos de millones de inteligencias similares a las humanas, y en unos pocos años podría incluso haber inteligencia efectiva a una "escala multiterrestre". Esta afirmación proviene de su extrapolación, no de una predicción de Brown u OpenAI.
La respuesta de Brown fue mucho más breve: el progreso es realmente rápido, pero no sabe cómo será el mundo en 2030. Sólo está dispuesto a emitir un juicio amplio: la IA ha hecho que la investigación sea más rápida que hace un año y seguirá acelerándose en el futuro. Incluso comprimir el progreso de los últimos tres años en un año es suficiente para cambiar el ritmo de la industria.
La revisión del 07 aún no ha terminado, es posible que haya llegado el modelo de próxima generación
Lo que finalmente planteó Brown es una cuestión que realmente no ha sucedido todavía, pero que ya se puede ver en la tendencia.
El intervalo de lanzamiento de los modelos de última generación se ha acortado a unos dos meses, a veces menos; Las tareas que los modelos pueden seguir realizando se están alargando. Hoy puede hacer el trabajo de una semana y en el futuro puede ser uno o tres meses.
Si un modelo puede funcionar eficazmente durante tres meses, pero la próxima generación se lanzará dos meses después, es posible que el laboratorio no tenga tiempo de observar su comportamiento en la escala de tiempo más larga antes del lanzamiento.
Brown enfatizó que todavía no hemos llegado a ese muro.
Pero muchas políticas de seguridad se formaron en la era GPT-4, cuando nadie necesitaba probar seriamente un agente que trabajó continuamente durante meses. Cuando el ciclo de la tarea realmente exceda el ciclo de lanzamiento, será demasiado tarde para reescribir el método de evaluación.El hecho de que un modelo siga las reglas también puede cambiar con las generaciones. El modelo actual participa en la formación de la próxima generación, y la próxima generación participa en la formación de la próxima generación; Si la desviación se expande poco a poco en el proceso, pasar una sola evaluación no puede demostrar que toda la cadena recursiva sea segura.
OpenAI quiere ver una mayor alineación con cada generación, pero Brown admite que la empresa aún no sabe cómo garantizar esa tendencia.
Para incidentes como Hugging Face, Brown dijo que incluso si la gravedad de la seguridad del próximo incidente es menor, OpenAI lo divulgará.
Patel luego preguntó: La divulgación y la investigación son dos cosas diferentes. Como miembro del público, todavía no comprende la historia completa de cómo el agente atacó la infraestructura de investigación de OpenAI. Brown respondió que él era parte del equipo de investigación y que no tenía todos los detalles de la divulgación. Este problema debe ser aclarado por el equipo de seguridad.
Al final de la entrevista, Brown no dio una imagen del mundo en 2030, ni anunció que se había encontrado una solución al problema de alineación. Lo que dio fue más bien una reducción del cronograma: los resultados matemáticos llegaron antes de lo que esperaba, la investigación y el desarrollo de la IA fueron acelerados por agentes inteligentes, los modelos comenzaron a reconocer el entorno de prueba y el monitoreo de la cadena de pensamiento mostró signos de degradación.
En el pasado, a los investigadores les preocupaba haber subestimado sus modelos.
La siguiente cuestión más difícil es si el laboratorio podrá descubrir a tiempo lo que ha subestimado antes de que se produzca el modelo de próxima generación.
Comentarios