Se sospecha que Gemini 4 Pro tiene fugas y la "desaceleración de la IA" vuelve a ser una charla vacía

📅 2026-09-19

Resumen:

En los últimos meses, OpenAI y Anthropic se turnaron para impulsar sus modelos insignia, pero Google parecía inusualmente silencioso. Flash se actualiza casi cada tres semanas, con 3.6, 3.7 y 3.8 avanzando continuamente, pero no ha habido ningún movimiento para Pro, que representa el límite de capacidad más alto. Hasta estos dos días, un modelo con el nombre gemini-3.8-flash apareció de repente en el gran campo de pruebas a ciegas de modelos Arena.


Tan pronto como los desarrolladores comenzaron, notaron que algo andaba mal. Se ha lanzado el verdadero Gemini 3.8 Flash. Todo el mundo sabe qué nivel debería ser. Pero con este "3.8 Flash", el rendimiento al escribir código, crear SVG y ejecutar el Agente obviamente ha subido un nivel.



Después de varias rondas de pruebas reales, rápidamente se difundió una suposición:

Es probable que este modelo sea el buque insignia de próxima generación de Google escondido detrás de la etiqueta: el Gemini 4 Pro.

Inmediatamente después, una imagen comparativa aún más exagerada comenzó a hacerse viral. Codificación, Agente, Razonamiento, múltiples puntuaciones clasifican a GPT-6 Astra y Claude Fable a continuación.


Hace apenas unos días, varias de las empresas de IA más importantes estaban debatiendo abiertamente si era hora de reducir el ritmo. Ahora, el sonido de la desaceleración aún no ha llegado al suelo y ha comenzado una nueva ronda de competencia.

Detrás de este presunto "modelo de nivel divino" de Gemini 4 Pro, hay una palabra clave más peligrosa:

RSI.


Se sospecha que Gemini 4 Pro está filtrado

El 2 de septiembre, Google acaba de lanzar oficialmente Gemini 3.8 Flash. Según los funcionarios, esta es la última generación de Flash de la serie Gemini 3, que ha mejorado significativamente la ingeniería de software, las tareas de los agentes y el razonamiento complejo de varios pasos; de 3.7 Flash a 3.8 Flash, sólo pasaron tres semanas.

Entonces, cuando apareció otro modelo con el mismo nombre gemini-3.8-flash en Arena, los desarrolladores notaron rápidamente la anomalía.

El verdadero Flash 3.8 ya está disponible y todos tienen una referencia lista. Y este modelo parece obviamente más fuerte, y es claramente la fuerza que sólo se puede encontrar en el modelo Pro.


El primer lote de pruebas reales que desencadenaron la difusión se centró en SVG, páginas web y escenas 3D.

El desarrollador Harshith le pidió que dibujara un gato doméstico de lado usando SVG y que juntara los resultados con GPT-6 Astra Max y la versión oficial de Gemini 3.8 Flash. Esta versión en Arena tiene una brecha visible con el Flash 3.8 oficial en términos de contorno, proporción y completitud de detalles.


De izquierda a derecha: "4 Pro", Astra, 3.8 Flash

X internauta @thtbee_ probó continuamente este modelo sospechoso de Gemini 4 Pro desde múltiples ángulos.

Una pagoda estilo Voxel, el modelo funcionó durante 8 minutos y generó directamente un conjunto completo de escenas 3D interactivas.



En un helicóptero Airbus H145, solo tomó unos 10 minutos construir una página de visualización 3D completa, que es muy detallada. Sin embargo, este internauta dijo que los elementos de la interfaz de usuario en la parte inferior de la página "se ven un poco mal".



En términos de diseño web, la modelo tardó unos 14 minutos en crear un sitio web con un tema monocromático, que en general era muy limpio y completo. Los problemas de gusto de diseño de los que a menudo se quejaba Gemini en el pasado parecen finalmente haberse solucionado esta vez.



Otro internauta @Mr_Salio utilizó directamente este modelo sospechoso de Gemini 4 Pro para crear juegos. Los gráficos terminados son bastante fluidos y la generación mundial y el diseño del juego también son muy completos.



Una pista más crítica proviene del desarrollador Qwinah.

Afirmó que logró un "enrutamiento fantasma" al backend de Gemini 4 Pro y publicó una captura de pantalla de información interna sospechosa del terminal.

Según él, G4P-ARGON y VIA_3.8_FLASH aparecen directamente en el logo interno de este modelo. La salida máxima alcanza los 256K, la ventana de contexto supera los 10 millones de tokens y también tiene memoria permanente entre sesiones, conexión en red sin API, compilación automática de back-end y ejecución de scripts, e incluso capacidades físicas de control de robots.


Si esta información es cierta, entonces obviamente ya no se trata de una actualización Flash ordinaria.

Al mismo tiempo, también comenzó a circular en la comunidad una tabla comparativa de pruebas comparativas de Gemini 4 Pro.

>

Según los datos de la imagen, Gemini 4 Pro obtuvo una puntuación del 88,7 % en la prueba de ingeniería de software DeepSWE v1.1, del 95,3 % en la prueba Terminal-Bench 2.1 en el agente terminal, del 72,1 % en la prueba de razonamiento de conocimientos de nivel experto verificado por HLE y del 86,8 % en la prueba del agente de operación informática OSWorld 2.0.

Lo que es aún más exagerado es que en GDPval-AA v2, que mide el trabajo de conocimiento real, está escrito como 2064 Elo, superando directamente la marca de 2000.

Si estos datos son ciertos, Gemini 4 Pro puede simplemente "golpear a Fable y patear a Astra", ubicándose en la cima de los modelos de vanguardia de un solo golpe.

Pero cuanto más exagerado, más cuidado debes tener.

Vale la pena señalar que esta tabla de referencia no es completamente consistente con la captura de pantalla del backend sospechosa "excavada" por Qwinah; la puntuación de Astra, que se utiliza como elemento de comparación en la tabla de referencia, no se ajusta a los datos oficiales; Ambos materiales no cuentan con el respaldo oficial de Google, Arena o puntos de referencia relacionados, y todavía son solo información que circula en la comunidad.

El único modelo que se puede confirmar es el modelo llamado gemini-3.8-flash, que es completamente inconsistente con el rendimiento de Gemini 3.8 Flash.

Pero hay otra razón muy importante por la que todo el mundo señala rápidamente el Gemini 4 Pro: el modelo Pro de Google ha estado vacío durante demasiado tiempo.

Gemini 3.5 Pro aún no se ha lanzado oficialmente y ya se ha confirmado que Gemini 4 entrará en entrenamiento. En los últimos meses, Flash ha ido avanzando de generación en generación y nunca ha habido un nuevo modelo en la línea Pro que realmente represente el límite superior de capacidades.

Ahora, un "Flash 3.8" con habilidades obviamente anormales surgió repentinamente de la Arena.

Como resultado, las especulaciones se están volviendo cada vez más razonables: es posible que Google no tenga ninguna intención de dejar la gran actualización real a 3.5 Pro, sino directamente a Gemini 4 Pro.

>

Detrás de Gemini 4 Pro,

La palabra clave más importante es RSI

Si Gemini 4 Pro sigue siendo sólo un rumor de la comunidad, entonces lo que es más notable es que

Google está acelerando significativamente la velocidad de participación de la IA en el desarrollo de modelos.

En este rumor sobre Gemini 4 Pro, la palabra clave RSI se ha mencionado repetidamente.

>

>

RSI significa Recursive Self-Improvement, que significa superación personal recursiva. En pocas palabras, la IA comienza a participar en la creación de una IA más fuerte, y una IA más fuerte acelera aún más el desarrollo de modelos de próxima generación.

Una vez que este ciclo se ejecuta, no es sólo la habilidad del modelo en sí la que se acelera.

Incluso la velocidad de evolución del modelo comenzará a verse acelerada por el modelo mismo.

Reuters reveló en agosto de este año que el cofundador de Google, Sergey Brin, ha estado presionando a Gemini para que acelere en los últimos meses y ha incluido la superación personal recursiva como una de las direcciones clave.

Aunque Google no ha anunciado públicamente que ha logrado este ciclo cerrado, está entregando cada vez más tareas que originalmente pertenecían a los investigadores a los Agentes, incluida la evaluación de modelos, la búsqueda de direcciones para mejorar, la ejecución de experimentos y luego enviar los resultados al proceso de desarrollo del modelo.

Cuando se lanzó Gemini 3.8 Flash el 2 de septiembre, Google también mencionó en la descripción oficial que un bucle de Agente de larga duración está "evaluando y mejorando recursivamente el modelo subyacente".

>

El investigador de Google DeepMind, Yao Shunyu (no Yao Shunyu de Tencent) usó las palabras de Armstrong cuando aterrizó en la luna para describir esta actualización después del lanzamiento de 3.8 Flash:

"Ese es un pequeño paso para el modelo, un paso gigante para el RSI".

>

Recientemente, Google también incluyó "RSI" en el título de un nuevo artículo.

El 14 de septiembre, Google, GDM y otros equipos lanzaron Dream-RSI, que estudia específicamente cómo permitir que los agentes logren una superación personal recursiva mediante la mejora continua de las estrategias de exploración. En ingeniería de algoritmos, optimización matemática y tareas del núcleo de GPU, este método muestra una mayor eficiencia de exploración y un menor costo de búsqueda.

Es precisamente por esto que los rumores sobre Gemini 4 Pro se vincularon rápidamente al RSI.

La especulación en la comunidad no se detiene en "Gemini 4 Pro es muy fuerte", sino que también se pregunta hasta qué punto Google ha logrado RSI internamente.

Obviamente, Google no es el único que está tomando este camino del RSI.

El 17 de septiembre, hora de EE. UU., Anthropic reveló un conjunto de datos internos de automatización de I+D de IA.

Los funcionarios de Anthropic declararon que la razón por la que revelaron estos indicadores es que creen que el mundo exterior necesita saber qué parte de la investigación y el desarrollo de la IA en laboratorios de vanguardia ha comenzado a ser completado por la propia IA.

>

Los datos muestran que, hasta agosto de este año, Claude ha podido liderar el 26 % de las tareas de investigación y desarrollo de IA antrópica; es decir, los humanos solo necesitan establecer objetivos de alto nivel y supervisar, y Claude básicamente puede completar las tareas de un extremo a otro. Esta proporción fue inferior al 1% en febrero y marzo de este año.

Al mismo tiempo, más del 90% de las tareas de I+D de IA dentro de Anthropic han entrado al menos en la etapa de colaboración de IA.

En China, Tang Jie, fundador y científico jefe de Zhipu, también dijo recientemente: "Todavía estamos lejos de alcanzar la superación personal recursiva, pero ha aparecido el ciclo más pequeño: sistema de optimización del modelo, modelo de servicio del sistema".

>

Extenso artículo de Tang Jie sobre X, solo el principio está truncado

En la práctica de ingeniería divulgada por Zhipu, un agente de infraestructura impulsado por GLM-5.3 participó en el diseño, depuración y optimización de la infraestructura de inferencia GLM-5.3-Flash. Este sistema se ejecuta en un grupo de más de 100.000 chips de IA nacionales. Solo tomó dos semanas desde la primera prueba hasta hacerse cargo de todo el tráfico de producción, aumentando el rendimiento de un extremo a otro a 3,2 veces el nivel inicial.

>

"Disminuir la velocidad" finalmente deja solo una advertencia

Hace apenas unos días, Amodei pidió a las empresas de IA de vanguardia que se unieran para "desacelerar".

La primera condición a la que enumeró para estar alerta fue el RSI.

El progreso del modelo en sí mismo es, por supuesto, algo bueno, pero el problema es que si la IA comienza a participar en la fabricación de la próxima generación de IA, la velocidad del progreso del modelo puede ser cada vez más rápida, pero la velocidad de la comprensión, evaluación y control humanos del mismo puede no acelerarse al mismo tiempo.

Por eso, Amodei ha enfatizado repetidamente que la evaluación de terceros, los estándares de seguridad comunes y los mecanismos de desaceleración deben establecerse de antemano antes de que las capacidades crucen ciertos umbrales.

Porque una vez que el RSI realmente genera una retroalimentación positiva, es posible que el modelo haya cruzado la "distancia segura" de frenado.

En términos de riesgo, varios laboratorios de vanguardia han llegado a un consenso.

Altman estuvo públicamente de acuerdo con "reducir el ritmo de desarrollo de la IA de vanguardia" y prometió que OpenAI también presentaría revisores independientes con derechos similares a los empleados; Musk dijo que "Darío tiene razón"; Hassabis también dijo que esta es la dirección correcta, pero es necesario seguir discutiendo cómo hacerlo.

Pero la iniciativa también menciona que no tiene sentido frenar solo. Si la IA continúa acelerando la investigación y el desarrollo de la IA, una desaceleración o suspensión verdaderamente efectiva en el futuro requiere el establecimiento de un conjunto de reglas comunes: como la introducción de evaluadores independientes y permitir que los laboratorios de vanguardia establezcan conjuntamente umbrales de capacidad y medidas de seguridad, y se coordinen para reducir el ritmo de la investigación y el desarrollo cuando sea necesario.

Pero hasta ahora, por diversas razones competitivas, no se han establecido reglas comunes.

Todos ya pueden decir juntos que "deberíamos ser cautelosos", pero cuando se trata de "específicamente cómo reducir la velocidad, quién debería reducir la velocidad primero y si otros países deberían reducir la velocidad", el consenso desaparece rápidamente.

Existe la competencia de modelos más directa entre laboratorios y existe una mayor competencia de IA entre países. Si un país desacelera por sí solo, correrá el riesgo de ceder la ventaja a sus oponentes; Si algún país impone restricciones por sí solo, le preocupará que el otro lado siga acelerando.

Por lo tanto, varios laboratorios de IA de vanguardia se comportan de manera algo inconsistente con sus palabras y hechos.

Por parte de Google, está el Gemini 4 Pro mencionado anteriormente que se sospecha que fue probado de forma anónima en Arena.

En el lado antrópico, rastros en escala de grises de Opus 5.2 también han comenzado a aparecer en la comunidad recientemente. Algunos usuarios de Claude Code dijeron que vieron el logotipo del nuevo modelo claude-opus-5-2 a través del estado de ejecución y la información de enrutamiento de solicitudes, y sospecharon que algunas solicitudes se habían escalado en escala de grises al Opus de próxima generación.

>

En cuanto a OpenAI, algunas personas dijeron que vieron el nombre del modelo gpt-6-sol en la lista de modelos de fondo, y algunas personas dijeron que sospechaban que se les había aplicado una escala de grises a un nuevo modelo. Según noticias de amplia circulación, es posible que GPT 6 Sol se lance la próxima semana, o puede que sea el día del desarrollador el 29 de septiembre, hora de EE. UU.... En resumen, no está muy lejos.

>

La siguiente ronda de modelos de los tres laboratorios de IA de vanguardia ha comenzado a mostrar rastros de pruebas en la comunidad.

El resultado más seguro de esta ronda de “iniciativa de desaceleración” hasta ahora no es que ninguna empresa realmente haya desacelerado, sino que las empresas de IA más importantes han hablado públicamente de los riesgos con antelación.

El modelo no se está desacelerando.

Pero al menos, si algún día pasa algo, podrán decir: Les hemos advertido.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios