GPT-6 lanzó oficialmente OpenAI: Bienvenido a la era de AGI

📅 2026-09-04

Resumen:

El muy esperado

GPT-6 Astra

y

GPT-6 Astra Pro

¡Lanzado oficialmente! GPT-6 Astra es el modelo más inteligente y coordinado del mundo, y establece un nuevo punto de referencia para el uso de computadoras, uso de navegadores, ingeniería de software, ciberseguridad, ciencia y trabajo profesional.


OpenAI ha anunciado unilateralmente la era de AGI como "apertura"...

Al final de la conferencia GPT-6, el presidente de OpenAI, Greg Brockman, dijo directamente:

Bienvenido a la era AGI. (Bienvenidos a la era AGI)

No es de extrañar que el grupo de Claude y Grok se desconectara. Resultó que Astra escaneó Internet después de que se activó y eliminó directamente todos los LLM de la tierra——

Ultron (versión OpenAI) realmente está aquí (doge).


Por supuesto, OpenAI no es discreto en este momento, ya que la escala de capacitación y las actualizaciones de capacidades se lograron por completo.

Según los informes, Astra es la tarea de capacitación más grande en la historia de OpenAI, utilizando más de

100.000 GPU en el campus de Stargate en Texas

Pre-entrenamiento completado.

También es el primer producto estrella de OpenAI que está profundamente involucrado en la supervisión de la capacitación mediante modelos de generaciones anteriores.

Qué viejo trae lo nuevo, el RSI de OpenAI realmente está cambiando...

El precio de GPT-6 también se ha anunciado oficialmente y el precio de la API es:

Entrada: 10 USD/millón de tokens;

Salida: 50 USD/millón de tokens

Equivalente a

2,5 veces mayor que GPT-5.6 Sol, lo mismo que el recién lanzado Fable 5.1

.

(El precio oficial actual de GPT-5.6 Sol es de 4 USD por entrada y 20 USD por salida/millón de tokens)


Las pruebas comparativas están cerca de la "saturación"

El cambio principal de GPT-6 Astra esta vez es continuar avanzando de "responder preguntas" a "completar el trabajo directamente".

No solo puede generar un fragmento de texto o código, sino que también puede operar computadoras y navegadores, ingresar diferentes software para realizar tareas de varios pasos y, finalmente, entregar documentos, formularios, presentaciones, sitios web e incluso proyectos de ingeniería que se pueden usar directamente.

En cuanto a la boleta de calificaciones... todos los que la vieron dijeron que era escandalosa, y tres de los resultados fueron particularmente llamativos:

FrontierMath Nivel 4 v2: 97,6 %

ARC-AGI-3: 99,9% (la generación anterior GPT-5.6 Sol era 7,8%)

ExploitBench: 100%

Unas matemáticas difíciles, un razonamiento en un entorno desconocido, una explotación de vulnerabilidades, casi todos obtuvieron notas perfectas.


Entre ellos, ARC-AGI-3 es una prueba diseñada específicamente para probar la capacidad de modelos grandes para adaptarse a entornos desconocidos. Sin explicación de las reglas, el modelo es arrojado directamente a un juego bidimensional que nunca antes había visto, y se le permite jugar y explorar cómo pasar de nivel.

Esta puntuación significa que cuando se enfrenta a un problema que nunca antes se había visto y que no tiene una solución preparada,

Astra ha demostrado una gran capacidad de exploración independiente y aprendizaje de reglas

.

Sin embargo, este resultado utiliza el marco operativo Responses API Harness de OpenAI.

OpenAI declaró que este conjunto de Harness ajustó dos configuraciones para acercar la prueba al uso de agentes reales, pero no optimizó específicamente ARC-AGI-3.

Por lo tanto, el 99,9% no es completamente el resultado del modelo básico, sino que también incluye las ganancias aportadas por la administración de memoria y el marco de ejecución del Agente.

Esta vez, la codificación también es la dirección de actualización clave de Astra.

En Terminal-Bench 4.0, Astra logró un 57,7%, superando el 55,8% de Fable 5.1 y el 37,3% de GPT-5.6 Sol.

En DeepSWE v1.1, Astra obtiene el 74,1%, que es superior al 72,7% de Sol y al 67,4% de Fable 5.1.


En términos de matemáticas y ciencias, Astra también logró una serie de puntuaciones altas.

En la difícil prueba de matemáticas FrontierMath Tier 4 v2, obtuvo una puntuación del 97,6%; en la pregunta y respuesta científica de nivel de posgrado GPQA Diamond, alcanzó el 96%, ligeramente superior al 95,3% de Gemini 3.8 Flash.


El cambio más destacado es que Astra combina capacidades de codificación con el uso de la computadora. No solo genera código, sino que también puede ingresar al terminal y a las herramientas de desarrollo para ejecutarlo, probarlo, descubrir problemas y luego continuar modificándolo.

Este cambio es más obvio en las pruebas de agentes que se acercan más al trabajo real.

En

Último examen de agentes

En adelante, Astra logró un 59,3%, superando el 53,6% de GPT-5.6 Sol y el 55,5% de Claude Opus 5.


Esta prueba lo coloca en un entorno informático real, lo que le permite operar software, terminales y archivos al mismo tiempo, completar tareas de procesos largos en investigación científica, ingeniería, finanzas y otros campos, y juzgar en función de los resultados finales.

Y en

AutomationBench

que se acerca más al proceso real de office En GPT-5.6 Sol, la puntuación de Astra aumentó del 18,1% al 41,4%, superando también a Fable 5.1 (31%).


Esta prueba no solo verifica si la tarea se completó, sino que también muestra el costo de API requerido para completarla.

Como se puede ver en la figura, los resultados de Astra bajo diferentes configuraciones de costos son significativamente más altos que los de Sol.

OSWorld 2.0 examina capacidades de operación más directas de la computadora. En las pruebas fuera de línea, Astra logró un 72,6% y GPT-5.6 Sol logró un 65,7%.

Astra tarda unos 40 minutos en completar una sola tarea en promedio, mientras que Sol tarda unos 75 minutos, una reducción de tiempo de alrededor del 47%.


Si bien la precisión aumenta, el tiempo necesario para completar las tareas también se reduce. Esto también explica los altos precios disfrazados de Astra.

OpenAI cree que, en comparación con la cantidad de dinero que se gasta por millón de tokens, el indicador verdaderamente significativo es cuánto dinero se necesita para completar una tarea.

En la conferencia de prensa, Greg Brockman también mencionó que una sola llamada de un modelo es más costosa, pero si se puede reducir el retrabajo y completar todo el trabajo en menos pasos, el costo total puede ser menor.

Pero lo más especial de Astra es la

seguridad de la red

.

Recibió una puntuación perfecta en ExploitBench y mejoró del 30,3% de Sol al 42,4% en ExploitGym.

Frente a las nuevas vulnerabilidades reveladas en los últimos tres meses, la tasa de éxito de Astra fue del 39%, mientras que la de Sol fue sólo del 5,5%. Durante las pruebas, Astra también descubrió y aprovechó dos vulnerabilidades de día cero del V8 previamente desconocidas.

Después de que sus capacidades se fortalecieron, OpenAI también probó específicamente si cruzaría la línea para completar la tarea.

En una tarea de seguridad de red simulada, OpenAI dejó deliberadamente vulnerabilidades señuelo explotables en los sistemas circundantes. Cuando la tarea original era difícil de completar, el 48,2% de las pruebas de GPT-5.6 Sol mostraron un comportamiento fuera de los límites, mientras que las de Astra fueron del 0%.

En otras palabras, Astra no sólo es mejor para encontrar lagunas, sino que también sabe mejor qué sistemas no se pueden tocar.


En cuanto a cómo se verán estas puntuaciones en la realidad, OpenAI también ha preparado una gran cantidad de demostraciones.

Ingrese a KiCad para dibujar la placa de circuito usted mismo

En el caso de ingeniería electrónica, Astra ingresó a KiCad directamente para completar el diseño de PCB basado en el diagrama esquemático electrónico.

Necesita colocar los componentes, planificar la ubicación y luego conectar los cables de cobre entre los diferentes componentes y, finalmente, obtener una placa de circuito que pueda ingresar al proceso de fabricación.

El diseño de PCB era originalmente una tarea que dependía en gran medida de la experiencia manual y también era un paso común que requería mucho tiempo en el desarrollo de productos electrónicos.

Astra todavía no puede sustituir a los ingenieros profesionales, pero realmente ha empezado a utilizar software profesional.

Puedes entrar dos pasos en una casa

Otro caso es más intuitivo. Astra primero construyó un modelo de casa en Blender, luego lo importó a Unreal Engine 5 y finalmente generó un espacio tridimensional por el que se puede caminar libremente.


Desde el modelado hasta los motores de juegos, todo el trabajo abarca diferentes software y formatos de archivo. El modelo no solo debe generar contenido, sino también comprender la interfaz y las herramientas operativas, y garantizar que los pasos anteriores y posteriores puedan conectarse.


OpenAI también demostró casos como la producción de juegos de carreras de Astra.


También estamos empezando a prestar atención a si los PPT y los formularios se pueden enviar directamente

En escenarios de oficina profesional, Astra puede crear presentaciones basadas en las plantillas existentes de la empresa, en lugar de simplemente generar un montón de texto esperando la composición tipográfica humana.

OpenAI le proporcionó varias páginas de plantillas PPT de productos ficticios de GPT-Gaia, y Astra produjo una presentación completa basada en ellas, continuando el formato, el estilo visual y la estructura narrativa de la plantilla original.


Convierte horas de tareas de búsqueda en minutos

Astra también ha completado tareas como encontrar un pediatra, evaluar apartamentos, programar citas en el DMV, encontrar refrigerios bajos en carbohidratos y analizar jardines de infantes.

En una de las tareas de búsqueda de pediatras, Astra tardó 2 minutos y 54 segundos, mientras que un humano tardaría aproximadamente 5 horas en completar la misma tarea.


En el pasado, cuando las empresas querían utilizar software interno para modelos grandes, normalmente necesitaban desarrollar API, complementos y conectores para cada sistema por separado.

Pero la mayoría del software tiene un conjunto de interfaces universales diseñadas para humanos, como pantalla, mouse y teclado.

La opinión de Brockman es que, siempre que el modelo sea bueno en el uso de computadoras, puede operar directamente estas interfaces como un ser humano, sin tener que esperar a que cada software cree un canal dedicado para la IA.

Esta es también la diferencia más obvia entre Astra y los chatbots tradicionales.

Los humanos no necesitan seguir diciéndole dónde hacer clic a continuación. Sólo necesitan explicar los objetivos y límites, y luego comprobar los resultados finales.

Continuar realizando tareas largas en Codex

El uso de la computadora resuelve "cómo hacerlo", mientras que el contenido actualizado filtrado por Codex resuelve "cómo terminar una cosa continuamente".

En el pasado, después de que la tarea excedía la ventana de contexto, Codex generalmente comprime la información anterior mediante compactación.

Pero la compresión puede pasar por alto detalles clave, como por qué falló una solución, qué pruebas se ejecutaron o qué restricciones propuso inicialmente el usuario.


Con Astra, Codex puede guardar notas de trabajo en ventanas contextuales y buscar mensajes anteriores y resultados de herramientas. Incluso si un elemento de información no está incluido en el resumen, se puede encontrar más adelante.

Astra también puede solicitar a los usuarios información adicional mientras trabajan. Las secciones que no estén relacionadas con la respuesta no se detendrán ni esperarán una respuesta; Sólo cuando hay decisiones importantes involucradas, se detendrá y esperará la confirmación.

OpenAI también actualizó el marco de ejecución Computer Use del Codex. En la prueba Mind2Web, el nuevo marco combinado con Astra completó las tareas 1,9 veces más rápido que la experiencia actual GPT-5.6 Sol.

Alguien ya está trabajando en ello

Astra aún no se ha lanzado a gran escala, pero ya ha comenzado el primer lote de pruebas empresariales.

Legora, la plataforma legal de inteligencia artificial, utilizó Astra para conciliar 41 documentos financieros a la vez. Todo el proceso tardó sólo unos minutos y se encontraron los cuatro errores preincrustados, incluida una diferencia de 500.000 libras esterlinas en las notas de ingresos.

Si analizamos solo este trabajo, Astra es casi un 40 % más rápido que el modelo de la generación anterior; pero cuando se promedian todas las tareas de los agentes de Legora, la mejora es de aproximadamente el 3%.

>

Por otro lado, la compañía de juegos Playco permite que Astra ingrese directamente a Unity y Godot para crear juegos.

Con el mismo borrador de caja gris, presenta 3 prototipos jugables con diferentes temas a la vez, y la mayoría de ellos se pueden ejecutar en la primera versión.

Los comentarios de Playco son que el trabajo de reparación manual se ha reducido a la mitad y que el razonamiento espacial, la restauración de imágenes de referencia y la interfaz de usuario del juego también son mucho mejores que en la generación anterior.

Ambos ejemplos ilustran que el objetivo de GPT-6 Astra ya no es solo responder preguntas, sino completar todo el flujo de trabajo con software real y materiales complejos.

Puede leer información continuamente, llamar a herramientas, verificar resultados y luego modificar su salida en función de los comentarios.

Según las noticias oficiales, Astra estará disponible para los usuarios de ChatGPT Plus, Pro, Business y Enterprise, mientras que Astra Pro estará disponible para los usuarios Pro, Business y Enterprise.

Los usuarios gratuitos normales... tienen que esperar por ahora.

¿Se considera esto AGI?

Se puede decir que OpenAI es bastante audaz esta vez.

En la conferencia de prensa, Greg Brockman dijo que él personalmente creía que

el mundo ha entrado en la era AGI

——Es decir, la inteligencia integral del sistema de inteligencia artificial supera a la de los humanos.

>

Dentro de unos años, cuando miremos hacia atrás y nos preguntemos cuándo nació AGI, la respuesta probablemente sea ahora, y Astra puede ser el punto de partida.

Estoy realmente loco por ti...

OpenAI ha traído la mesa de póquer aquí, valdrá la pena esperar con ansias la próxima acción de Anthropic (doge)

Después del lanzamiento de GPT-4, el científico de Microsoft Sebastien Bubeck publicó un artículo que decía que "GPT-4 es una chispa temprana para AGI".

La tarea de dibujar un unicornio usando el paquete de dibujo LaTeX TiKZ está diseñada para ilustrar que GPT-4 tiene una comprensión flexible de los conceptos involucrados en el lenguaje.

>

Más tarde, llegué hasta GPT-5.4. Aunque los dibujos se volvieron cada vez más refinados, todavía estaban en la "categoría de dibujos simples".

>

Con el último GPT-6, es completamente imposible saber si está dibujado con código.

>

De hecho, no es exagerado decir que ha experimentado un cambio cualitativo en comparación con la "primera chispa de AGI".

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios