Resumen:
En los últimos dos días, creo que todo el mundo ha quedado impresionado con los increíbles modelos de juego 3D de GPT-6 Astra: completa el modelado en 3D en una frase, crea un juego completo desde cero, desmantela miles de piezas de un vistazo e incluso úsalo para controlar robots... En resumen, es increíblemente poderoso. Los internautas tienen un dicho exagerado: mientras aprendas lentamente, no es necesario que aprendas. Pero GPT-6 Astra le da a la gente la sensación de que tan pronto como salga, la complejidad que originalmente plagaba muchos campos parecerá resuelta de repente.
Esta tendencia no debe subestimarse, pero tampoco se deben exagerar demasiado las capacidades actuales del modelo. En este artículo, haremos un balance de las increíbles jugabilidades de GPT-6 Astra y sus limitaciones actuales.
Modelado 3D,
¿De repente se está volviendo más fácil?
La capacidad de deslizamiento de pantalla más intensiva de Astra en los últimos dos días es probablemente 3D.
Alguien lo usó para generar trenes 3D directamente:

>
Ambos trenes son generados directamente por Astra usando código TypeScript y Three.js cuando se ejecutan en el navegador. El tamaño del cuerpo, el contorno y diversas estructuras geométricas provienen de los parámetros de tamaño, el perfil y la función de geometría en el código; el movimiento de la rueda es el código, y la animación de todo el tren explotando, las piezas desmoronándose y reensamblándose también es todo código.
Además, estos modelos se pueden desmontar en piezas una vez fabricados. Una cámara se puede desmontar en 122 grupos de componentes y 1877 piezas modeladas individualmente. La tarea completa tardó aproximadamente 3 horas en ejecutarse. El autor dijo que nunca se había dado cuenta de que Three.js (una biblioteca de JavaScript utilizada para crear y mostrar gráficos 3D en el navegador) podría usarse de esta manera.
![]()
La cámara se puede desmontar, al igual que el Tesla. Alguien lo desmontó en 334 piezas de modelado, y los nombres, números y estructuras básicas de estas 334 piezas son oficiales y no fabricados por IA. Por supuesto, es sólo un desmontaje muy aproximado a nivel de fotograma, ni cerca del nivel de detalle requerido para un desmontaje en 3D.
>

Curiosamente, este autor no quedó satisfecho después de desmantelar Tesla, e incluso creó un sitio web para "desmantelar a un hombre (hombre)": las 2234 partes modeladas de todo el cuerpo se pueden ver una por una y se pueden asignar a los archivos fuente.
![]()
Al ver estos casos, algunas personas gritaron: "El cielo se está cayendo para los estudiantes de modelado 3D".

Pero algunas personas dicen que los resultados directos actuales de la IA aún no están disponibles comercialmente.

Además, la estabilidad también es un gran problema. Después de todo, todavía necesita gente para corregir errores.

La importancia de estas demostraciones no es sólo demostrar que Astra puede modelar. Más importante aún, demuestra una nueva forma de interacción: las personas ya no necesitan aprender software 3D complejo, sino describir directamente el mundo que desean y dejar que la IA sea responsable de traducir las ideas en estructuras espaciales.
En el pasado, el modelado 3D era el umbral para ingresar al mundo digital; en el futuro, puede convertirse en una capacidad básica para que la IA comprenda y genere el mundo real. Por supuesto, todavía queda un largo camino por recorrer antes de lograr aplicaciones verdaderamente de nivel industrial, pero el camino es cada vez más claro.
¿No es necesario aprender software?
Astra, entra tú mismo
En el posicionamiento oficial de OpenAI, el uso de la computadora y el uso del navegador son las capacidades de triunfo del GPT-6 Astra. En un ejemplo de pintura de Canva, vemos esto en acción.
En este caso, el internauta le pidió a Astra que lo dibujara en Canva (replicando el retrato de una foto de referencia). Durante el proceso de dibujo, Astra puede controlar directamente la interfaz de Canva en el navegador: seleccionar herramientas, hacer clic/arrastrar con precisión, dibujar capa por capa (desde el fondo hasta el cuerpo, los brazos y los detalles faciales) y, finalmente, completar un retrato semirealista de estilo píxel muy similar.
![]()
Esto también implica operaciones de varios pasos a largo plazo (los comentarios del autor duran aproximadamente 1 hora), cambio de herramientas (Chrome cambia al modo de uso de computadora después de que ocurre un problema a mitad de camino), así como una comprensión de la interfaz extremadamente alta y una precisión de control fina.


Fable 5.1 de al lado también recibió el mismo mensaje, pero el resultado decepcionó a los internautas:

Él no es el único que hace este experimento. Otro internauta también tomó la misma foto y pidió a dos IA que la dibujaran, y los resultados fueron similares: Astra es más realista, Fable 5.1 es más gratuito y fácil...


Enlace del vídeo: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
Sin embargo, algunos internautas señalaron que los efectos visuales finales de estas cosas no son el foco. Lo importante es que los agentes compatibles con Astra ya pueden operar Blender, Unreal Engine y navegadores por sí mismos, y convertir mensajes directamente en archivos de proyecto.


En los últimos días, "Astra usa Blender para reconstruir el Palacio de Bellas Artes de San Francisco", "Un viejo dibujo de un tren de vapor convertido en 3295 objetos editables en Blender" y "600 agentes de Astra que viven en el mismo mundo irreal" son todos casos típicos en esta dirección.


Enlace del vídeo: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
Otro caso interesante es el de "tocar el piano". Víctor E. Núñez, empleado de OpenAI, le pidió a Astra que buscara un piano en línea y tocara "River Flows in You" usando la computadora. Durante el proceso de ejecución, Astra buscó y abrió un sitio web de piano virtual en línea por sí mismo, y luego usó Computer Use para controlar directamente la interfaz de la computadora: haga clic con el mouse como la "mano derecha" y haga clic en las teclas del piano. El control del teclado se trata como "mano izquierda + párrafo rápido". Los dos actuaron al mismo tiempo, controlando con precisión el ritmo y la duración de las notas, e interpretaron por completo la canción "River Flows in You".

Enlace del vídeo: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
Lo que es más interesante es que Astra grabó la pantalla y editó este vídeo de demostración. Todo el proceso es de principio a fin: desde comprender la tarea → encontrar el sitio web → cargar el instrumento → tocar en tiempo real, sin intervención manual en los pasos intermedios.
Estos casos muestran que GPT-6 Astra ha alcanzado una nueva altura en el uso de computadoras agentes, con velocidad, precisión, paralelismo de múltiples herramientas y capacidades de retroalimentación en tiempo real, todos alcanzando un nivel muy alto.
Quizás, en el futuro, la gente pueda dejar de pensar en cómo recrear las capacidades de un determinado software profesional en funciones de IA y simplemente entregar el software a la IA. Poder operar cualquier software diseñado para humanos amplía enormemente los escenarios de aplicación de la IA.
Fuera de la pantalla,
Astra comienza a controlar el robot
No importa cuán escandalosas fueran las demostraciones anteriores, básicamente todas tuvieron lugar en la computadora.
La prueba realizada por el internauta Jay Chooi fue diferente: en realidad conectaron Astra al brazo robótico.
![]()
Una de las tareas es hacer que el brazo robótico coloque bloques en un recipiente. GPT-6 Astra se realizó 20 veces y la tasa de éxito alcanzó el 95%; el control Fable 5.1 fue del 40%. Al mismo tiempo, su número de tokens de salida es sólo alrededor del 16% de este último, y su costo es sólo alrededor del 43% de este último.
Más importante aún, no existe ninguna demostración ni ajuste de Astra para esta tarea. Jay Chooi añadió más tarde específicamente que se trataba de una prueba de tiro cero. El modelo es responsable de dar la posición y actitud del efector final del brazo robótico y luego convertirlo en movimiento del brazo robótico a través del solucionador automático de cinemática inversa.
A medida que se acelera la velocidad de producción de tokens modelo grandes, Jay Chooi predice con optimismo que LLM podrá controlar el brazo robótico en tiempo real a finales de este año y hasta 2029.

Yu Xiang, ex investigador científico de NVIDIA, señaló además que la próxima frontera de la robótica puede ser cómo utilizar verdaderamente modelos avanzados de IA para el control. No basta con utilizarlos simplemente como agentes para invocar módulos de percepción y planificación. Necesitamos nuevas formas de conectar estos modelos con el mundo físico.
![]()
Estos resultados también despiertan la curiosidad de la gente. ¿Qué añadió OpenAI después del entrenamiento para que el modelo fuera tan versátil? ¿O hay un gran avance en la preformación?
![]()
¿Sigues estudiando?
Después de leer esto, algunas personas lamentaron que la IA ya no se contenta con generar una imagen, sino que ha comenzado a intentar "reconstruir el mundo".
![]()
Naturalmente surge una pregunta: cuando la IA pueda modelar, escribir códigos, operar software e incluso comenzar a tocar el mundo físico, ¿cuántas de las habilidades que hemos aprendido con tanto esfuerzo hoy seguirán existiendo en su forma actual?
![]()
Ciertamente no hay respuesta a esta pregunta ahora. Todavía hay muchas cosas en Astra que son inestables, toscas o incluso inutilizables en absoluto, pero lo que es realmente inquietante y emocionante estos dos días puede ser exactamente esto: por primera vez, muchas operaciones complejas que deben ser dominadas por humanos de forma predeterminada se han vuelto posibles de empaquetar como un todo para la IA.
En cuanto a "¿debería aprenderlo en el futuro?", la respuesta es definitivamente que todavía tengo que aprenderlo. Lo que pasa es que tal vez tengamos que repensar qué es lo que vale la pena aprender.
Comentarios