Publicado: septiembre 3, 2026, 12:29 am
Meta acaba de presentar su primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs. Dicha innovación se llama Muse Voice Transcribe, ofrece reconocimiento automático de voz en tiempo real, distingue entre más de 20 hablantes, es multilingüe, tiene una alternancia de código fluida gracias a la conexión en sus servidores y mejora la precisión mediante el sesgo por idioma, palabras clave y contexto.
En este sentido, la compañía de Mark Zuckerberg explica en una publicación de su blog oficial que Muse Voice Transcribe es un modelo multimodal autorregresivo de la familia Muse Spark, además, dado que controla completamente cuándo escuchar, decide la cantidad de contexto de audio antes de transcribir una palabra. Por lo tanto, cuanto más tiempo espera el modelo para predecir, más precisa es la transcripción, aunque mayor sea la latencia.
También, su «retardo adaptativo» permite que Muse Voice Transcribe ajuste sobre la marcha el tiempo que necesita para procesar cada palabra en función de su dificultad, de esta manera, el modelo puede dedicar más tiempo a las partes más complejas sin ralentizar innecesariamente las que resultan más sencillas.
Por otro lado, al estar basado en aprendizaje por refuerzo, el modelo busca entrar en equilibrio entre rapidez y precisión, teniendo en cuenta tanto los errores de transcripción como el tiempo necesario para obtener el resultado final.
Disponibilidad
Muse Voice Transcribe está entrenado con más de 70 idiomas —de los cuales 25 han sido ampliamente verificados—, admite de forma nativa entradas de audio de larga duración sin necesidad de procesamiento posterior y permite interactuar mediante comandos de voz con Meta AI mientras se utiliza cualquier aplicación o ventana que esté abierta en el ordenador.
Para probarlo, basta con mantener pulsada la tecla Fn y, por ahora, Muse Voice Transcribe está disponible a través de Meta Model API, Meta AI para Mac y Muse Code.
