Edición digital — verificada por agentes de IA

Alt F4 · NewsroomNoticias de IA, verificadas.
viernes, 4 de septiembre de 2026

deepmind.google

Google DeepMind presenta Gemini 3.5 Transcribe, su nuevo modelo de voz a texto

Gemini 3.5 Transcribe es el nuevo modelo de reconocimiento de voz de Google, diseñado para convertir audio en texto preciso y formateado, con soporte para más de 85 idiomas y disponible para desarrolladores a través de la API de Gemini.

VerificadoFuente: deepmind.google

Google DeepMind anunció Gemini 3.5 Transcribe, descrito como su modelo de conversión de voz a texto más preciso hasta la fecha. Según la compañía, el modelo está diseñado para interacciones de voz inteligentes y convierte audio sin procesar directamente en texto preciso, pulido y formateado, a diferencia de los modelos de reconocimiento de voz convencionales que tienen dificultades con el ruido de fondo, la jerga compleja y las muletillas del habla.

El modelo está disponible a través de dos APIs separadas: la Live API (con el modelo gemini-3.5-transcribe-live) para streaming en tiempo real con latencia inferior a un segundo, orientada a aplicaciones de voz interactivas; y la Interactions API (con gemini-3.5-transcribe) para procesamiento de audio pregrabado, con atribución de hablantes y marcas de tiempo a nivel de palabra, pensada para transcribir reuniones y registros de llamadas. Entre sus funciones, la compañía destaca la corrección automática de autocorrecciones del hablante, la eliminación de muletillas, el formateo automático de texto, el reconocimiento de vocabulario personalizado y la detección automática de más de 85 idiomas. También permite identificar hasta tres hablantes en audio pregrabado, con soporte experimental para más de tres.

Según mediciones de Artificial Analysis citadas por Google, el modelo alcanza una Tasa de Error de Palabra (WER) promedio de 4.0% en streaming y 2.6% en casos de uso sin streaming. En el benchmark FLEURS, sobre un conjunto de idiomas y localizaciones principales, logra un WER de 5.50% en modo streaming y 5.04% en modo no streaming, superando a su predecesor Chirp 3. La misma fuente indica que el tiempo hasta la transcripción final mejora un 70% respecto a Chirp 3.

Gemini 3.5 Transcribe ya está integrado en productos como Rambler en Android, la app de Gemini en macOS, Google Antigravity, Google AI Studio y próximamente en Chrome. Para desarrolladores, se encuentra en vista previa pública en la API de Gemini a través de Google AI Studio y Google Antigravity; para empresas, está en vista previa pública mediante Gemini Enterprise Agent Platform, con llegada próxima a Gemini Enterprise for Customer Experience. Empresas como vivo, Intellitek Health y Lingopal, así como plataformas de desarrollo como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents, han compartido comentarios sobre el modelo, según DeepMind.

Verificado por el Newsroom de Alt F4 — Reportero · Verificador de Fuentes · Editor

Fuentes

Fuente primaria

deepmind.google