Google lanza Gemini 3.5 Transcribe para mejorar aún más la precisión de la conversión de voz a texto

📅 2026-08-27

Resumen:

Google lanzó recientemente Gemini 3.5 Transcribe, el último modelo de conversión de voz a texto de la serie Gemini, calificándolo como el modelo de reconocimiento de voz más preciso de la serie. Este modelo está abierto a desarrolladores, empresas y usuarios comunes y se centra en mejorar las capacidades de transliteración en entornos ruidosos, términos profesionales complejos y expresiones habladas naturales.

Según los informes, Gemini 3.5 Transcribe puede manejar mejor el ruido de fondo y el vocabulario complejo en campos profesionales. Google dijo que el nuevo modelo trajo mejoras de rendimiento a la aplicación Gemini en la plataforma macOS y a la función Rambler del teclado Gboard en la plataforma Android. Los desarrolladores pueden utilizar este modelo para crear aplicaciones como agentes de voz, herramientas de subtítulos en tiempo real y procesos de análisis posteriores a la llamada.

Google dijo que Gemini 3.5 Transcribe está diseñado para capturar los patrones naturales de habla de los usuarios para comprender con mayor precisión la intención semántica, identificar vocabulario personalizado y ayudar a los usuarios a completar tareas a través de la voz.

A nivel funcional, el nuevo modelo añade una serie de capacidades de optimización, incluida la autocorrección automática, la eliminación de palabras de relleno habladas como "um" y "ah", y el formato automático del texto de salida. Al mismo tiempo, también puede delegar tareas más complejas, como el análisis de archivos y la generación de imágenes, a otros modelos Gemini para formar una experiencia de colaboración multimodelo más completa.

En términos de precisión, Google señaló que la tasa promedio de error de palabras de Gemini 3.5 Transcribe es del 4,0 % en escenarios de reconocimiento de voz en streaming y se puede reducir al 2,6 % en escenarios sin streaming. El modelo tiene un mejor rendimiento de transcripción en entornos ruidosos y puede identificar con mayor precisión información clave compuesta de letras y números, como números de pedido y códigos postales.

En términos de soporte de idiomas, Gemini 3.5 Transcribe cubre actualmente 85 idiomas y admite acentos regionales y diferentes dialectos. Para audio pregrabado, puede realizar un reconocimiento de atribución de voz con marca de tiempo para hasta tres hablantes; Además, el modelo puede adaptarse a vocabularios definidos por el usuario para identificar términos profesionales, ortografías especiales y nombres industriales.

Gemini 3.5 Transcribe está actualmente disponible en versión preliminar pública a través de la API de Gemini en Google AI Studio y Google Antigravity. Los usuarios comunes pueden experimentar funciones relacionadas en las plataformas Android y macOS. Google también planea introducirlo en el navegador Chrome, donde los usuarios pueden ingresar texto directamente mediante la voz en el cuadro de entrada de cualquier página web.

Recientemente, Google ha seguido acelerando el avance de la línea de productos Gemini. La compañía lanzó anteriormente Gemini 3.7 Flash para unirse a la competencia de precios cada vez más feroz por los modelos de IA; Gemini en Chrome para Android también se ha abierto a todos los usuarios de Estados Unidos, y Gemini Assistant también ha entrado en la nueva generación de taxis autónomos de Waymo.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
验证码
Sin comentarios