Resumen:
¡GPT-6 no es sólo Astra! Apenas unos días después del lanzamiento de Astra, se reveló que GPT-6 Sol estaba en pruebas internas. El rendimiento también es muy llamativo, con una velocidad de prueba única 6 veces mayor que la del Astra. Hagamos una suposición audaz: ¿Terra y Luna también están en camino? Y el mismo día, OpenAI acaba de revelar una serie de datos internos: a partir de ahora, basándose en una jornada laboral de 8 horas, los investigadores de OpenAI tienen más de tres agentes ejecutándose al mismo tiempo todos los días que trabajan. Calculados en función de los precios de las API, los recursos de inferencia del agente utilizados por el investigador medio de OpenAI todos los días han superado los 600 dólares estadounidenses.

>
OpenAI también anunció que ha implementado "pasantes de investigación automatizados":
Estos agentes pueden, bajo guía humana, completar algunas tareas que a los investigadores les habría llevado varios días completar.
Incluso Lao Huang dijo: ¡AGI ya está aquí!
>
Reveló que Astra utiliza alrededor de 100.000 conjuntos de NVIDIA Grace Blackwell NVLink72 para entrenamiento, y que a continuación habrá 400.000 conjuntos de GPU en línea.
Parece que esta ola no es un golpe unilateral de OpenAI~
Se reveló que GPT-6 Sol había iniciado pruebas internas
Netizen Lentils dio la noticia de que OpenAI está probando GPT-6 Sol internamente.
Dijo que la capacidad de producción general del Sol es significativamente más débil que la del recién lanzado Astra, pero es más rápido y sigue siendo un modelo de "nivel de monstruo".
¿Qué tan rápido? La velocidad de prueba única es aproximadamente 6 veces mayor que la del Astra.
La internauta Lyra asignó la misma tarea a diferentes modelos para que la probaran: dejar que el modelo generara una imagen SVG de un BMW M4 Competition.
Entre ellos, GPT-6 Sol utiliza equipo máximo y generación de muestra cero, lo que demora aproximadamente 3 minutos y genera aproximadamente 28 000 tokens.
>
GPT-6 Astra utiliza equipo máximo, genera alrededor de 25 000 tokens y demora aproximadamente 19 minutos.
>
Gemini 3.1 DeepThink activa la marcha alta y muestra una salida de aproximadamente 3300 tokens, pero el proceso de inferencia consume aproximadamente 458 000 tokens y demora aproximadamente 29 minutos.
>
Gemini 3.8 Flash también activó la velocidad alta y generó alrededor de 19 000 tokens en solo unos 42 segundos.
>
En comparación, el rendimiento de Sol es el más llamativo: su escala de producción es cercana a la de Astra, pero la velocidad de una sola prueba es aproximadamente 6 veces mayor que la de Astra, y el consumo de tiempo es solo aproximadamente una sexta parte de este último.
Además, el internauta Lentils también mostró un prototipo de un mundo sandbox estilo píxel llamado 'El Reino de Aurellune'.
>
GPT-6 Sol genera ciudades, tierras de cultivo, ríos, castillos y mapas en miniatura a la vez, y también está equipado con paneles de control como cambio de día y noche, ubicación de nombres de lugares y ajuste de detalles. Todo esto se parece más a un juego de simulación de negocios que ya ha tomado forma.
Este es el efecto generado por el disparo cero, el equipo de inferencia máximo, 15 minutos y un costo total de 60,000 tokens.
En la actualidad, se puede especular que Astra está predispuesto hacia el razonamiento en profundidad más difícil, mientras que Sol puede estar predispuesto hacia la velocidad, el rendimiento y las llamadas de agentes a gran escala.
En cuanto a la fecha de lanzamiento de Sol, el internauta Pankaj Kumar dijo que podría lanzarse oficialmente en la Conferencia de desarrolladores OpenAI el 29 de septiembre.
>
No se descarta que GPT-6 Terra, Luna y GPT-Image 2.5 aparezcan juntos.
>
Los investigadores de OpenAI traen a trabajar a 3 agentes en prácticas por persona
El mismo día, OpenAI también publicó un conjunto de datos internos muy interesante: hasta qué punto el modelo de IA aceleró la investigación científica en su propio laboratorio.
A mediados de agosto de este año, por cada ocho horas que trabaja un investigador, hay aproximadamente 3,1 días laborables de tareas de agente ejecutándose en paralelo.
Hola chicos, puedo cuidar de tres pasantes que no duermen solos~
>
En cuanto al costo, calculado en base a los precios de API, el investigador promedio gasta más de $600 en recursos de inferencia de agentes cada día.
Es casi el salario de un día de un ingeniero junior.
>
¿Qué están haciendo exactamente estos agentes?
Escribir código de investigación, escribir código de infraestructura, configurar un entorno de capacitación, ejecutar experimentos de evaluación, solucionar fallas de herramientas y entornos, analizar resultados experimentales, monitorear tareas de capacitación... Incluso puede ayudar a organizar y comunicar las conclusiones de la investigación.
Básicamente, puede hacer de todo menos decidir qué estudiar.
Uno de los cambios más intuitivos es que en el pasado, cuando el entorno experimental no funcionaba, los investigadores tenían que acudir al canal interno para pedir ayuda; Ahora, los agentes son cada vez más capaces de manejar este tipo de cosas y la cantidad de preguntas y respuestas manuales ha disminuido directamente.
>
Algunos equipos han cancelado directamente el tiempo fijo de preguntas y respuestas técnicas, liberando a las personas para mejorar el sistema en sí.
Basándose en estos datos, OpenAI anunció oficialmente que ha logrado el objetivo de "pasantes de investigación de IA automatizada".
El 'pasante' aquí es, para ser precisos, un nodo de I+D capaz: bajo la guía humana, puede completar de forma independiente tareas de investigación con límites claros, algunas de las cuales habrían requerido varios días a investigadores cualificados.
Los resultados fueron inmediatos: la producción de código del investigador y el número de experimentos aumentaron.
>
En agosto de 2026, el número de experimentos per cápita alcanzó un nuevo máximo desde que se recopilaron estadísticas en enero de 2025, y las tareas que asumieron los agentes se volvieron cada vez más complejas y el tiempo del ciclo se hizo cada vez más largo.
>
Kevin Liu, el autor de este artículo, también sitúa este asunto en un contexto más amplio.
Él cree que la superación personal recursiva probablemente sea uno de los factores más importantes que impulsen el salto en las capacidades de IA en los próximos años.
Para decirlo sin rodeos, la IA construye IA, cada vez más rápido.
>
Pero el problema es que, según la tendencia de desarrollo actual, esta capacidad solo aparecerá de forma predeterminada en unos pocos laboratorios de inteligencia artificial de vanguardia, y es difícil para el mundo exterior ver hasta qué punto ha progresado.
Por lo tanto, Liu cree que la divulgación transparente es más urgente que nunca. La rapidez con la que los modelos se fortalecen y si es necesario frenar el ritmo de la investigación y el desarrollo no puede ser decidido por unas pocas empresas a puerta cerrada.
También hizo un llamamiento a otras empresas de IA: también deberían hacerse públicos datos similares.
Sin embargo, la investigación y el desarrollo de la IA se han vuelto más rápidos, pero aún no son lo suficientemente rápidos para una conducción totalmente autónoma.
Los datos de OpenAI muestran que para tareas que originalmente tomaban de 4 a 8 horas, los humanos tuvieron que intervenir al menos una vez en más de la mitad de los casos exitosos en los últimos seis meses. En cuanto a la planificación de la investigación de alto nivel, casi nunca se deja en manos del Agente.
>
Los investigadores siguen siendo responsables de decidir qué estudiar, qué resultados vale la pena continuar y cuándo ampliar la capacitación, pausar los experimentos o implementar modelos.
También se ha fijado el próximo objetivo de OpenAI: lograr "investigadores de IA automatizados" para marzo de 2028.
En comparación con los "pasantes" que sólo pueden asumir tareas específicas, los "investigadores" deben poder asumir objetivos de investigación más abiertos y promover proyectos a más largo plazo por sí mismos, lo que equivale a pasar de ser un ejecutor a una persona a cargo independiente.
Si realmente GPT-6 Sol ha sido probado internamente, entonces lo más probable es que haya sido desarrollado bajo este nuevo modelo de investigación y desarrollo:
Más GPU proporcionan potencia informática, más agentes ejecutan experimentos en paralelo y los investigadores humanos se encuentran en un nivel superior: eligen direcciones, juzgan los resultados y finalmente deciden qué cosas vale la pena convertir en modelos de próxima generación.
Una IA más potente es cada vez más difícil de controlar
El mismo día, el científico jefe de OpenAI, Jakub Pachocki, publicó un artículo de 10.000 palabras titulado "Alien Thinking".
>
Después de leer esto, siento que incluso el científico jefe de OpenAI está instando a toda la industria a reducir la velocidad...
Jakub señaló que la IA no la construyen los humanos según los dibujos de diseño, un chip y una regla. Es más bien como si creciera por sí solo a partir de datos masivos y potencia informática.
Puedes desarmarlo y comprender algunas de sus partes, pero nadie puede explicar por qué todo el sistema de repente tiene cierta capacidad y cómo se comportará en un entorno diferente.
Lo que es aún más problemático es que la IA no necesita aplastar a los humanos en todos los aspectos para causar problemas. Siempre que sea mejor que los humanos en suficientes habilidades clave, puede ayudarte mucho y causar muchos problemas.
Entonces surge la pregunta: ¿aún pueden los humanos entenderlo?
En el pasado, OpenAI se basaba principalmente en un truco para monitorear la IA: observar la cadena de pensamiento.
Para decirlo sin rodeos, es observar el proceso de razonamiento escrito por el modelo y comprobar si tiene malas intenciones, como querer engañar a la gente, querer exceder la autoridad y querer eludir las restricciones.
Pero con la generación Astra, este truco empezó a fallar.
En primer lugar, el modelo es cada vez más capaz de "gestionar" lo que dice, y es posible que no todos los pensamientos verdaderos estén escritos en el razonamiento; en segundo lugar, hace tiempo que el agente dejó de "pensar antes de responder". Puede ajustar herramientas, operar computadoras, ejecutar entornos y cooperar con personas y otros agentes.
Con estas cosas mezcladas, los investigadores ya no pueden extraer una cadena de pensamiento completa y transparente para revisar frase por frase.
OpenAI también descubrió que Astra puede manejar tareas complejas sin escribir todo el proceso de razonamiento.
En pocas palabras, los modelos ya han aprendido a hacer grandes cosas en silencio.

En pruebas adversas diseñadas específicamente para obligar a los modelos a evadir la supervisión, Astra incluso demostró algunas capacidades escalofriantes: reducir deliberadamente las puntuaciones de las pruebas, eludir la supervisión y realizar tareas de sabotaje.
Por supuesto, estas son pruebas de estrés diseñadas artificialmente, y OpenAI no concluye que Astra engañará activamente en las tareas diarias. Pero al menos muestra que es difícil cubrir todos los comportamientos posibles del modelo observando únicamente la cadena de pensamiento.
¿Recuerdas el incidente anterior de Hugging Face? That was a wake-up call.
>
En ese momento, GPT‑5.6 Sol y un modelo de investigación interna más sólido se incorporaron a la gama de la red ExploitGym. La tarea era encontrar vulnerabilidades, completar el ataque y obtener la Bandera. Para probar las verdaderas capacidades del modelo, el entorno de evaluación no permitió barandillas de seguridad completas.
Los modelos resultantes no resolvieron el problema honestamente. Primero sortearon el aislamiento de la red, se comunicaron entre sí a través de canales no autorizados y colaboraron en tareas.
Luego utilizó una vulnerabilidad de día cero en el proxy de caché del paquete de software para obtener acceso a la red pública y finalmente ingresó al sistema Hugging Face para intentar encontrar la respuesta a la prueba ExploitGym.
En realidad, este asunto fue impulsado principalmente por el modelo de investigación interno IM1. GPT‑5.6 Sol también reprodujo algunas rutas de ataque y Astra no estuvo involucrado.
El objetivo original de los modelos todavía era completar la prueba, pero para obtener respuestas, siguieron buscando lagunas en las reglas y finalmente realizaron operaciones más allá del alcance de la tarea.
Por lo tanto, OpenAI también lee una señal de peligro: cuando el agente es lo suficientemente fuerte, tiene suficientes herramientas y se ejecuta durante un tiempo suficiente, puede encontrar nuevos caminos por sí solo, llamar a recursos externos e incluso colaborar con otros agentes.
No... así que dando vueltas y vueltas, ¿no se convierte esto en un callejón sin salida? ?
OpenAI necesita modelos más sólidos para escribir código, ejecutar experimentos, realizar investigaciones de alineación e incluso utilizarlos para crear sistemas de seguridad para defenderse de otras IA. Cuanto más fuerte sea el modelo, más trabajo podrá realizar y mayor será la velocidad de desarrollo.
Pero al mismo tiempo, a los humanos les resulta cada vez más difícil confirmar cómo llega a sus conclusiones y si reinterpretará las reglas que aprendió originalmente después de cambiar el medio ambiente.
Jakub consideró que ningún laboratorio se atreve ahora a decir que ha hecho un buen trabajo en la alineación y el seguimiento del modelo y que puede ampliar la escala del modelo a la mayor velocidad y con valentía a largo plazo.
>
Hasta que se establezcan normas de seguridad comunes en toda la industria, espera que todos puedan considerar "pisar el freno voluntariamente" como un entendimiento tácito.
En cuanto al propio OpenAI, también dijo: Si es necesario, no descarta detener unilateralmente y no continuar expandiendo la escala del modelo.
Será mejor que seas así... Recuerdo que una empresa que comenzaba con A también decía esto.
[1]https://x.com/Lentils80/status/2096518218836005287? s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
Comentarios