Publicado: agosto 28, 2026, 3:28 am
Google ha presentado el nuevo modelo de conversión de texto a voz Gemini 3.5 Transcribe. Dicha innovación está diseñada para hacer que las interacciones de voz sean más inteligentes y con capacidad para capturar el estilo de habla natural, reconocer vocabulario personalizado y realizar tareas a partir de la voz.
La compañÃa de Mountain View afirma en una publicación de su blog oficial que Gemini 3.5 Transcribe es su modelo «más preciso hasta la fecha» porque entiende el habla de los usuarios a la perfección, transcribe en más de 85 idiomas y elimina expresiones de relleno como «ums» o «ahs» para capturar la intención natural y estilo de las personas. Además, captura audio con precisión en entornos ruidosos, distingue hasta tres hablantes distintos y detecta acentos regionales o dialectos.
También, en la publicación, Google explica que este modelo es capaz de transformar el audio sin procesar directamente en un texto preciso y estructurado. Además, puede interpretar las autocorrecciones que realiza el usuario mientras habla y adaptar el resultado para reflejar su intención final.
Por otro lado, Gemini 3.5 Transcribe ofrece una menor tasa de errores y una latencia inferior respecto a su predecesor, ya que el tiempo necesario para obtener la transcripción final se ha reducido un 70%.
Asà se podrá usar Gemini 3.5 Transcribe en cada aplicación
Google detalla en su blog oficial que este modelo de voz a texto pretende hacer que determinadas tareas sean más naturales y sencillas. Para ello, Gemini 3.5 Transcribe incorpora comprensión contextual en servicios como Gboard, Antigravity y la aplicación Gemini, además de su próxima integración en Chrome.
En Gboard para Android, por ejemplo, el modelo puede convertir las ideas que el usuario expresa en voz alta en texto, eliminando palabras de relleno y mejorando el resultado final. En Google Antigravity, también puede tener en cuenta el contenido que aparece en pantalla y el historial de conversaciones para generar transcripciones más precisas.
Por su parte, Google AI Studio permite utilizar Gemini 3.5 Transcribe para escribir código mediante comandos de voz, aunque esta función está limitada al modo Build.
En la aplicación Gemini para macOS, el modelo puede combinar las órdenes habladas con el contexto de lo que aparece en pantalla. De esta forma, es posible realizar acciones como resumir archivos, reutilizar texto entre distintas aplicaciones o generar imágenes mediante instrucciones de voz.
Y por último, Google también está preparando su llegada a Chrome, donde permitirá dictar texto directamente en cualquier campo de una página web para facilitar tareas como escribir respuestas, publicar contenido o interactuar con Gemini utilizando únicamente la voz.
Disponibilidad
Gemini 3.5 Transcribe ya está disponible para todos los usuarios de la aplicación Gemini para macOS en inglés y de Rambler para Android. En el caso de los desarrolladores, Google ha lanzado el modelo en versión preliminar pública a través de la API de Gemini, disponible en Google AI Studio y Google Antigravity.
Además, la innovación puede probarse en versión preliminar dentro de Gemini Enterprise Agent Platform.
