Última actualización: 26/08/2026
Gemini 3.5 Transcribe es el nuevo modelo de Google para convertir voz en texto con mayor precisión, menor latencia y herramientas de edición automática. La compañía lo presentó el 26 de agosto de 2026 como una pieza de su estrategia de Gemini Audio y lo puso en vista previa pública para desarrolladores.
El lanzamiento apunta a un problema concreto: una transcripción útil no consiste solamente en reconocer palabras. También tiene que soportar ruido, acentos, vocabulario técnico, cambios de idioma y correcciones hechas mientras una persona habla. Google busca resolver parte de esas dificultades con un modelo que entiende el contexto del audio y puede entregar un texto ya limpio y estructurado.
Qué es Gemini 3.5 Transcribe
Gemini 3.5 Transcribe es un modelo especializado en transcripción con IA dentro de la familia de modelos de audio de Google. La compañía afirma que está diseñado para convertir audio sin procesar en texto preciso y con formato, en lugar de limitarse a generar una transcripción palabra por palabra.
Google lo ofrece mediante dos vías principales. Para audio en tiempo real utiliza la Live API con el modelo gemini-3.5-transcribe-live, mientras que para archivos grabados utiliza la Interactions API con gemini-3.5-transcribe. Esto permite cubrir desde asistentes de voz y subtitulado hasta reuniones, llamadas y análisis posteriores.
El lanzamiento también amplía el uso de Gemini dentro de productos de Google. La tecnología ya aparece en funciones como la dictación inteligente de Gemini para macOS y Rambler en Android, donde el sistema puede transformar una intervención hablada en texto más limpio.
Más de 85 idiomas y reconocimiento de acentos
Uno de los puntos más importantes de Gemini 3.5 Transcribe es su capacidad multilingüe. Google indica que el modelo puede detectar y transcribir más de 85 idiomas y trabajar con diferentes acentos y dialectos.
La detección automática también permite cambiar de idioma durante una conversación. Esto resulta especialmente útil en reuniones internacionales o en conversaciones donde las personas alternan entre español, inglés y términos técnicos sin detenerse para configurar manualmente el idioma.
Para Argentina, esta capacidad tiene un interés concreto. Una herramienta de voz que pueda reconocer diferentes variantes del español y nombres propios puede resultar más práctica para reuniones, entrevistas, clases, podcasts y atención al cliente que un sistema que dependa de una configuración rígida.
El modelo no solo transcribe: también limpia el texto
La principal diferencia frente a una transcripción convencional está en el tratamiento posterior del lenguaje. Gemini 3.5 Transcribe puede eliminar muletillas como “eh” o “este”, corregir determinadas autocorrecciones y organizar el contenido para que sea más fácil de leer.
Google pone como ejemplo una frase en la que una persona dice que una reunión será el martes y se corrige inmediatamente para decir que será el miércoles. En lugar de conservar toda la secuencia como una transcripción literal, el modo inteligente puede interpretar la corrección y entregar una versión más limpia.
El sistema también aplica puntuación, mayúsculas y formatos adecuados para fechas, números y monedas. Esto reduce una tarea que normalmente queda en manos del usuario después de obtener la transcripción.
Vocabulario personalizado para términos técnicos
Otra función importante es el vocabulario personalizado. Los desarrolladores pueden proporcionar términos específicos para mejorar el reconocimiento de nombres, acrónimos, marcas o palabras propias de una industria.
Google permite incorporar hasta 1.000 frases en el vocabulario personalizado, aunque recomienda que la lista sea más pequeña para obtener mejores resultados. Esto puede ser relevante para sectores como medicina, ingeniería, programación, finanzas o medios de comunicación, donde una palabra mal reconocida puede cambiar por completo el significado de una frase.
También identifica quién habla
Gemini 3.5 Transcribe incorpora identificación de hablantes en audio pregrabado. El modelo puede atribuir segmentos de una conversación a diferentes participantes y asociarlos con marcas de tiempo.
Google indica que la atribución de hasta tres hablantes forma parte de las capacidades destacadas del lanzamiento, mientras que el soporte para tres o más participantes continúa en fase experimental según el contexto de uso.
Esta función puede ser especialmente útil para periodistas que trabajan con entrevistas, equipos que necesitan analizar llamadas comerciales y empresas que quieren convertir reuniones en documentos consultables. En lugar de recibir un bloque de texto sin identificar, el resultado puede conservar información sobre quién dijo cada parte.
Menos latencia para conversaciones en tiempo real
La versión orientada a tiempo real busca reducir el retraso entre la voz y el texto. Google afirma que Gemini 3.5 Transcribe ofrece transmisión bidireccional continua con latencia inferior a un segundo mediante la Live API.
La baja latencia abre la puerta a aplicaciones donde esperar varios segundos para obtener una transcripción ya no resulta práctico. Entre ellas aparecen asistentes de voz, subtitulado en vivo, interfaces conversacionales y herramientas que necesitan convertir una conversación en datos mientras está sucediendo.
Google también asegura que el tiempo hasta obtener la transcripción final mejora un 70 % frente a su modelo anterior Chirp 3, según mediciones de Artificial Analysis. La compañía cita un Word Error Rate promedio del 4 % para el uso en streaming y del 2,6 % para los casos sin streaming medidos por esa organización. Estas cifras deben interpretarse como resultados de pruebas y no como una garantía de precisión idéntica para todos los audios.
Qué cambia para los desarrolladores
Gemini 3.5 Transcribe está disponible en vista previa pública a través de Gemini API en Google AI Studio y Google Antigravity. También puede utilizarse desde Gemini Enterprise Agent Platform, mientras que Google anunció una futura llegada a Gemini Enterprise para Customer Experience.
La disponibilidad mediante API es importante porque convierte la tecnología en una pieza que otras aplicaciones pueden incorporar. Un desarrollador puede utilizarla para crear un asistente de voz, un sistema de subtitulado, una herramienta para analizar llamadas o una aplicación que transforme reuniones en documentos.
La documentación de Google también distingue entre el modelo para archivos y el modelo de transcripción en vivo. El primero puede procesar audio de hasta una hora por solicitud, aunque el límite baja a 30 minutos cuando se utilizan simultáneamente funciones como identificación de hablantes o marcas de tiempo por palabra.
La función de voz se integra cada vez más en Gemini
El lanzamiento de Gemini 3.5 Transcribe llega acompañado por una expansión más amplia de las funciones de voz de Google. La compañía también anunció nuevas capacidades de Gemini Live para ejecutar tareas mediante comandos hablados y utilizar aplicaciones conectadas.
En paralelo, las herramientas de estudio de Gemini muestran cómo Google está llevando sus modelos hacia usos cotidianos más concretos. La transcripción especializada encaja en esa misma estrategia, pero con un foco más definido en convertir conversaciones y audio en información utilizable.
La diferencia es importante: un asistente conversacional necesita comprender una petición para responder, mientras que una herramienta de voz a texto tiene que preservar con precisión la información que una persona dijo. Gemini 3.5 Transcribe intenta combinar ambas necesidades mediante comprensión contextual y procesamiento específico del habla.
Qué aplicaciones puede tener en Argentina
El impacto potencial en Argentina está más relacionado con servicios y aplicaciones que con la llegada de un nuevo dispositivo. La transcripción automática puede reducir el trabajo necesario para pasar a texto entrevistas, reuniones, clases, podcasts o llamadas de atención al cliente.
En medios de comunicación, por ejemplo, una entrevista grabada podría convertirse rápidamente en un primer documento de trabajo. El periodista todavía tendría que revisar nombres, cifras y citas, pero partiría de un texto estructurado en lugar de tener que transcribir manualmente todo el audio.
También puede ser útil para empresas que trabajan con equipos distribuidos. Las reuniones en español pueden convertirse en registros consultables y, si el audio incluye términos propios de la compañía, el vocabulario personalizado puede ayudar a mantener una mayor consistencia.
La disponibilidad final de cada función puede variar según el producto, la región, el idioma y el tipo de cuenta. Por eso, que el modelo sea accesible mediante las APIs de Google no significa que todas sus funciones estén disponibles de inmediato para cualquier usuario argentino.
Cuándo se puede usar Gemini 3.5 Transcribe
Google anunció Gemini 3.5 Transcribe el 26 de agosto de 2026. Para desarrolladores, el modelo está disponible en vista previa pública mediante Gemini API, Google AI Studio y las herramientas de Google orientadas a agentes. En el ámbito empresarial, también aparece en la plataforma Gemini Enterprise Agent Platform.
En productos para consumidores, algunas capacidades basadas en el modelo ya se encuentran integradas en la aplicación Gemini para macOS y en Rambler para Android en determinados países e idiomas. Google también indicó que la función de dictado llegará próximamente a Chrome.
Para quienes quieran entender la evolución de Gemini, el lanzamiento también se relaciona con la evolución de los modelos Gemini 3.5, aunque Gemini 3.5 Transcribe tiene un objetivo diferente: está optimizado específicamente para convertir habla en texto y hacerlo con información contextual.
Qué significa este lanzamiento
Gemini 3.5 Transcribe muestra que Google está separando cada vez más las tareas de audio en modelos especializados. En lugar de utilizar una única herramienta general para entender cualquier tipo de contenido, la compañía está desarrollando sistemas específicos para transcribir, conversar y ejecutar acciones a partir de la voz.
El desafío ahora será comprobar cómo se comporta el modelo con conversaciones reales, ruido de fondo, distintos acentos y vocabulario muy específico. Los resultados publicados por Google y las mediciones externas son una referencia inicial, pero el rendimiento cotidiano dependerá del audio, la aplicación y la configuración.
Si la tecnología mantiene la precisión prometida en escenarios reales, la transcripción puede convertirse en una capa habitual de muchas aplicaciones de IA. Para el usuario final, la diferencia más visible será sencilla: hablar y obtener directamente un texto ordenado, sin tener que limpiar manualmente cada pausa, corrección o palabra de relleno.
Fuentes
Google Blog — Gemini 3.5 Transcribe
Google AI for Developers — Audio transcription
The Verge — Gemini 3.5 Transcribe
Soy Enzo Ramírez, co-fundador y editor de tecno.ar. Tengo formación técnica en Informática, Seguridad Informática y Ciberseguridad, con background en desarrollo full stack. Me interesa especialmente todo lo que cruza tecnología, hardware, empresas, inteligencia artificial, entre otras, y su impacto en el mercado argentino
