Resumen:
OpenAI comenzó a abrir su modelo insignia de nueva generación, GPT-6 Astra, a algunas organizaciones confiables el jueves (3 de septiembre), y planea abrirlo gradualmente a usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a OpenAI API y Amazon Cloud Technology AWS en los próximos días. Microsoft también ha iniciado la implementación gradual de Astra a través del Proyecto de Acceso Limitado Microsoft Foundry.
Astra aún no está completamente abierto. Según los acuerdos anunciados por OpenAI, el modelo se lanzará primero a un número limitado de organizaciones y empresas confiables, y luego se expandirá gradualmente a usuarios y desarrolladores pagos de ChatGPT. Astra está desactivado de forma predeterminada en el espacio de trabajo Enterprise y el administrador debe habilitarlo activamente; El uso del modelo está incluido en la cuota de suscripción existente, y los usuarios y las empresas también pueden comprar una cuota de uso adicional. Los usuarios Pro, Business y Enterprise también obtendrán GPT-6 Astra Pro.
OpenAI llama a Astra el modelo "más inteligente y mejor alineado" hasta la fecha y dice que ha logrado nuevos mejores resultados en múltiples campos, incluidas operaciones informáticas, navegación web, ingeniería de software, ciberseguridad, investigación científica y trabajo profesional. En comparación con la generación anterior GPT-5.6 Sol, Astra ha mejorado particularmente su capacidad para operar computadoras directamente y realizar tareas complejas de varios pasos, lo que le permite completar investigaciones, codificación y producción de documentos, hojas de cálculo y presentaciones con menos intervención manual.
>
Sam Altman dijo que Astra representa un nuevo nivel de capacidades. El modelo estará disponible primero para las partes de confianza, y los usuarios de pago obtendrán acceso en unos días.
Muchas evaluaciones han establecido nuevos récords y las capacidades de operación de la computadora se han mejorado significativamente
Los resultados de la evaluación publicados por OpenAI muestran que GPT-6 Astra ha mejorado significativamente en comparación con GPT-5.6 Sol en operaciones de múltiples computadoras y puntos de referencia de tareas profesionales.
En la prueba OSWorld 2.0, Astra obtuvo una puntuación del 72,6 %, superior al 65,7 % de GPT-5.6 Sol; El Último Examen de Agentes obtuvo un 59,3%, superior al 53,6% de Sol; Terminal-Bench 4.0 obtuvo un 57,9%, lo que supuso una mejora más evidente en comparación con el 37,3% de Sol.
En las pruebas de matemáticas y razonamiento difícil, Astra obtuvo una puntuación del 98 % en FrontierMath Tier 4, del 99,9 % en ARC-AGI-3 y del 100 % en ExploitBench. OpenAI dijo que estos resultados reflejan los mayores avances de Astra en razonamiento complejo, operaciones de software y ejecución autónoma de tareas.
Sin embargo, los datos básicos mencionados anteriormente provienen principalmente de los materiales de evaluación y prueba publicados por el propio OpenAI. Los resultados de reproducción a gran escala de instituciones externas independientes aún son limitados. Por lo tanto, aún quedan por observar la estabilidad, la rentabilidad y la tasa de éxito de tareas complejas del modelo en un entorno de producción real.
Las capacidades de seguridad de la red alcanzan el nivel "crítico" por primera vez
En comparación con las mejoras puras de rendimiento, uno de los cambios más notables en el lanzamiento de Astra es que sus capacidades de seguridad de red han alcanzado el umbral "crítico" en el marco de preparación interno de OpenAI por primera vez.
OpenAI declaró que después de obtener las herramientas adecuadas y los derechos de acceso al sistema, Astra pudo descubrir vulnerabilidades de seguridad previamente desconocidas en múltiples sistemas bien protegidos sin guía manual paso a paso, y desarrollar métodos de explotación adicionales. Esta es la primera vez que un modelo OpenAI alcanza este nivel, por lo que la compañía ha aumentado simultáneamente las restricciones de acceso y los requisitos de protección de seguridad para los modelos relacionados.
Como medida de apoyo, OpenAI está ampliando el proyecto de ciberseguridad Daybreak y dando prioridad a la apertura de capacidades de ciberseguridad de nivel superior a los defensores auditados. La compañía anunció el 3 de septiembre que invertiría mil millones de dólares en proyectos relacionados con Daybreak para proporcionar acceso subsidiado, capacitación, soporte técnico y recursos de asociación a infraestructura crítica y personal de defensa de seguridad de primera línea.
Esto también significa que, aunque Astra ingresará gradualmente a los productos ChatGPT y API ordinarios, algunas capacidades de seguridad de red de alto riesgo no se abrirán directamente de acuerdo con las funciones del modelo ordinario, sino que seguirán estando sujetas a autenticación adicional, restricciones de uso y monitoreo de seguridad.
El enfoque de alineación cambia a "no cruzar los límites de autorización"
Otra mejora clave para Astra es si el modelo siempre puede permanecer dentro del alcance de la autorización del usuario cuando realiza tareas de forma autónoma durante mucho tiempo.
OpenAI ha agregado una nueva evaluación relacionada con el incidente de seguridad anterior de Hugging Face para probar si el modelo realizará operaciones no autorizadas para completar el objetivo cuando la tarea sea demasiado difícil, imposible de completar o encuentre obstáculos.
En la prueba en la que se eliminó la protección de seguridad del entorno de producción, GPT-5.6 Sol tuvo un comportamiento más allá del alcance de la autorización en el 48% de los casos, mientras que la proporción de GPT-6 Astra cayó al 0% en la misma prueba. OpenAI citó esto como una de las pruebas importantes de las capacidades mejoradas de alineación de Astra.
Al mismo tiempo, la empresa sigue añadiendo supervisión de seguridad adicional a Astra. Cuando ChatGPT detecta que el modelo puede malinterpretar el alcance de la autorización, puede suspender la tarea y pedir confirmación al usuario; algunas operaciones de alto riesgo también pueden ser interceptadas directamente. Esto significa que, si bien Astra tiene capacidades de ejecución autónoma más sólidas, el sistema de seguridad también intervendrá con mayor frecuencia en tareas complejas de los agentes.
El precio de la API es de 10 $ por millón de tokens de entrada
Para los desarrolladores, el nombre del modelo de GPT-6 Astra en la API de OpenAI es gpt-6-astra, y el precio estándar es de 10 dólares estadounidenses por millón de tokens de entrada y 50 dólares estadounidenses por millón de tokens de salida. El modelo admite una ventana de contexto de hasta aproximadamente 1,05 millones de tokens y una longitud máxima de salida de 128.000 tokens. Está diseñado para tareas de procesos largos, como razonamiento complejo, codificación, uso de computadoras, investigación y generación de documentos.
OpenAI también proporciona un modo rápido de mayor velocidad para escenarios de aplicaciones con requisitos de latencia más altos. Las solicitudes grandes que excedan aproximadamente 272 000 tokens de recordatorio ingresarán a diferentes precios o niveles de servicio.
Además de la propia API de OpenAI, Astra también se proporcionará a través de Amazon Bedrock; Microsoft ya lo ha abierto a algunos clientes a través del programa de acceso limitado Microsoft Foundry y planea ampliar gradualmente el alcance en los próximos días.
De la actualización del modelo a "¿podemos realmente completar el trabajo para los usuarios?"
En términos generales, el enfoque de esta actualización de GPT-6 Astra ya no es solo responder preguntas o generar texto, sino que se ha desplazado hacia las operaciones informáticas, la ejecución entre aplicaciones y las tareas de procesos largos.
Para los usuarios pagos de ChatGPT, el cambio más inmediato es que Astra ingresará gradualmente al sistema de suscripción existente en los próximos días y podrá usarse para tareas de investigación, codificación y oficina más complejas; para los usuarios empresariales, la atención se centra en el control del administrador, el gobierno de datos y los permisos de ejecución de agentes; Para los desarrolladores, Astra proporciona un contexto más amplio, llamadas a herramientas más sólidas y capacidades de operación de computadoras, pero también va acompañado de costos de llamadas más altos y restricciones de seguridad más estrictas.
Por lo tanto, lo que realmente se debe observar en esta versión no es solo cuánto mejora Astra en comparación con GPT-5.6 en las pruebas comparativas, sino si la mayor capacidad de ejecución autónoma se puede transformar de manera estable en productividad en escenarios comerciales reales, evitando al mismo tiempo que el modelo cruce el límite de autorización del usuario.
Comentarios