La empresa de inteligencia artificial de nivel empresarial Cohere lanzó su primer modelo de voz Transcribe el jueves. Este es un modelo de reconocimiento automático de voz (ASR) de código abierto, principalmente para grabación de voz a texto, análisis de contenido de voz y otros escenarios. El tamaño de los parámetros del modelo es de aproximadamente 2 mil millones y se posiciona como una solución "ligera" que es fácil de ejecutar en GPU de consumo y es adecuada para que la implementen empresas y desarrolladores con requisitos de autohospedaje.

Transcribe actualmente admite 14 idiomas, incluidos inglés, francés, alemán, italiano, español, portugués, griego, holandés, polaco, chino, japonés, coreano, vietnamita y árabe. Cohere dijo que en la lista Open ASR de Hugging Face, Transcribe logró una tasa de error de palabras (WER) promedio de 5,42, superando a modelos como Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 y Qwen3-ASR-1.7B Speech en este punto de referencia.

En términos de evaluación humana, Cohere dijo que cuando los revisores humanos compararon los resultados de la transcripción en términos de precisión, coherencia y usabilidad, Transcribe tuvo una tasa de ganancia promedio del 61% en comparación con otros modelos. Sin embargo, la compañía también admitió que el rendimiento del modelo sigue siendo ligeramente peor que el de algunos productos de la competencia en idiomas como portugués, alemán y español.

En cuanto a rendimiento, los datos dados por Cohere son que Transcribe puede procesar unos 525 minutos de audio por minuto, lo que supone un nivel alto entre modelos similares. Cohere planea integrar este modelo de voz en North, su plataforma de orquestación de agentes para empresas, y hacerlo de libre acceso a través de la API de la empresa. Al mismo tiempo, Transcribe también aparecerá en la plataforma de inferencia alojada de Cohere, Model Vault, lo que permitirá a los clientes llamarlo directamente.

Los modelos de reconocimiento de voz en su conjunto se están calentando rápidamente a medida que continúa creciendo la demanda de aplicaciones basadas en dictado y toma de notas de voz, como Granola y Wispr Flow. En este contexto, Cohere intenta ingresar al mercado a través de soporte de código abierto, liviano y multilingüe, proporcionando una infraestructura de voz autohospedada y amigable para las empresas que desean controlar sus datos y su entorno de implementación.

A principios de este año, se informó que Cohere generaría alrededor de 240 millones de dólares en ingresos recurrentes anuales (ARR) en 2025, y se citó al director ejecutivo de la compañía, Aidan Gómez, diciendo que la startup podría salir a bolsa "probablemente pronto".