Resumen:
Mientras OpenAI y Anthropic continúan lanzando nuevas generaciones de modelos de vanguardia, Google lanzó oficialmente el nuevo modelo emblemático de inteligencia artificial Gemini 4 Argon, con la esperanza de volver a ingresar a la competencia del mercado de modelos de alta gama con capacidades de razonamiento de largo alcance más sólidas y precios más competitivos.

Google posiciona Gemini 4 Argon como un modelo de vanguardia para tareas complejas y de largo plazo, centrándose en áreas como el desarrollo de software, el trabajo de conocimiento empresarial y la defensa de la seguridad de la red. Sin embargo, el modelo aún no está completamente abierto al público. En cambio, se le dará prioridad a algunas organizaciones de defensa de la seguridad de la red que participan en el programa Google Fairwind para realizar pruebas, mientras continúa el trabajo adicional de evaluación de seguridad.
En comparación con la serie Gemini anterior, una de las mejoras más importantes de Argon es el aumento sustancial en la capacidad de producción. Google ha aumentado la longitud máxima de salida de una sola transacción de los 64.000 tokens anteriores a 1 millón de tokens. Esto significa que el modelo puede completar procesos de inferencia más largos en una sola ronda de tareas, realizar proyectos complejos de ingeniería de software, tareas de investigación y procesamiento de flujo de trabajo a gran escala sin interrupciones ni reinicios frecuentes de tareas.
En términos de rendimiento, múltiples resultados de pruebas comparativas publicados por Google muestran que Gemini 4 Argon supera al GPT-6 Astra de OpenAI y al Claude Opus 5.5 de Anthropic en múltiples áreas clave. Entre ellos, Argon logró una puntuación del 77,9% en la prueba DeepSWE v1.1 que mide las capacidades de ingeniería de software a largo plazo; una puntuación del 51,3% en el punto de referencia de tareas automatizadas de Zapier AutomationBench; y una puntuación del 91,7% en la prueba de capacidad de comprensión de vídeos largos LVBench.

Google también afirmó que Argon también ocupó el primer lugar en la prueba del Índice Vals que evalúa la capacidad de actividades económicas reales como las finanzas, el derecho, los impuestos y el desarrollo de software. Según datos oficiales, el modelo superó al GPT-6 Astra y al Claude Opus 5.5 en una serie de pruebas importantes de IA.
Además de los resultados de las pruebas externas, Google reveló que Argon se ha puesto en uso real dentro de la empresa. Miles de empleados utilizan el modelo para completar tareas como programación, investigación y documentación. Los casos de aplicación citados por Google incluyen proyectos de ingeniería como la optimización de algoritmos cuánticos, la optimización de recursos de memoria del centro de datos y la migración de grandes bases de código C y C++ al lenguaje Rust.
La ciberseguridad es una de las áreas clave de fortalecimiento de Argon. Google dijo que el modelo puede identificar, verificar y corregir de forma autónoma vulnerabilidades de software. El equipo de seguridad Wiz de Google ha utilizado Argon para realizar tareas de investigación de seguridad a través del programa "Scan for Good". En la prueba CWE-bench v1, que se utiliza para evaluar las capacidades de remediación de vulnerabilidades, Argon logró una puntuación del 68 %, empatado con los mejores de la industria.
Para mejorar la competitividad del mercado, esta vez Google ha adoptado una estrategia de precios significativamente más agresiva. El precio inicial de Gemini 4 Argon es de 2 dólares por 1 millón de tokens de entrada y 10 dólares por 1 millón de tokens de salida. Google también ofrece un descuento del 95 % en el almacenamiento en caché de contenido de entrada. En comparación, el precio es significativamente más bajo que el que cobran actualmente algunos modelos de la competencia de alta gama.
Aunque el rendimiento y el precio han demostrado una fuerte competitividad, esta vez Google optó por proceder con cautela con el ritmo de implementación. La compañía declaró que Gemini 4 Argon continuará brindando servicios de manera limitada hasta que se completen más pruebas y verificaciones de seguridad, y aún no se ha anunciado un cronograma posterior para una apertura más amplia.
Comentarios