Publicado en el blog de MAI.
Junto con el lanzamiento de hoy de nuestro MAI-Transcribe-2-Streaming de primer nivel, también anunciamos dos nuevos modelos de voz: MAIVoice2.1 y nuestra variante rapidísima, MAIVoice2.1Flash.
Juntos, proporcionan a los usuarios los bloques de construcción rápidos y fluidos para crear experiencias conversacionales, sin comprometer la precisión ni la calidad de la voz.
Análisis Artificial – Tabla de clasificación de tasa de error de palabras
% de palabras transcritas de manera incorrecta en la transcripción final y en la primera transcripción parcial tras detectar el fin del habla

Nota: Las barras muestran la transcripción final AA-WER, ordenada como la más baja primero. La superposición marca el primer AA-WER parcial del mismo modelo, por lo que la diferencia es cuánto mejora la transcripción tras el primer parcial. El gráfico muestra los 28 modelos de streaming en o por debajo del 10% del primer AA-WER parcial.
Fuente: Clasificación de Análisis Artificial Speech to Text (Streaming), 28 de septiembre de 2026.
Conozcan MAI-Transcribe-2-Streaming: Transcripciones en tiempo real. Muy rápidas.
MAI-Transcribe-2-Streaming ofrece transcripciones en tiempo real y baja latencia en 60 idiomas, todo ello mientras soporta la detección automática y continua del idioma.
Ocupa el primer puesto en precisión tanto en transcripciones finales como parciales en Análisis Artificial. Y en su evaluación de precisión frente a latencia, nos situamos en la frontera de Pareto, para mostrar que una mayor precisión no tiene por qué venir acompañada de un gran equilibrio de latencia.
En lugar de esperar a que alguien termine de hablar antes de responder al texto, produce sus primeras hipótesis (conocidas como «parciales») en poco más de 100 ms de recepción de audio. Luego las revisa a medida que llega más contexto y compromete una transcripción estable de inmediato. Estos parciales permiten que las aplicaciones con voz activen el habla antes incluso de que el hablante termine.
Por ejemplo, los agentes de voz pueden empezar a razonar o llamar herramientas a mitad de frase, y transcripciones en directo pueden aparecer mientras la gente habla. En casos de uso como dictado o subtítulos en tiempo real, nuestras evaluaciones internas muestran que las palabras aparecen en la transcripción el doble de rápido que con nuestro competidor más cercano.
Análisis artificial – Índice de transmisión de tasa de error de palabra vs. tiempo hasta la transcripción final
Precisión de transcripción final frente a la latencia post-habla · Menor es mejor en ambos ejes

Fuente: Clasificación de Análisis Artificial Speech to Text (Streaming), 28 de septiembre de 2026.
MAI-Transcribe-2-Streaming está disponible a un precio introductorio de $0,54 USD la hora de audio hasta final de año.
MAI-Voice-2.1: Soporte sin interrupciones para experiencias multilingües
Con el lanzamiento de MAI-Voice-2.1, ofrecemos nuestro modelo de texto a voz multilingüe más sólido hasta la fecha.
Hemos ampliado el modelo para soportar 23 idiomas y 26 lugares, para permitir que una sola «voz» use todos los idiomas con un acento en verdad nativo. Solo tienen que pedirle que hable inglés… luego mandarín… luego alemán… y el hablante permanece igual, para adoptar de manera natural el lenguaje local, en lugar de arrastrar un acento entre idiomas.
Eso significa que su marca puede mantener una sola voz en todas partes: una app de tutoría puede cambiar de idioma a mitad de clase sin cambiar de profesor, y un asistente multilingüe puede responder en el idioma en el que se le dirige, todo ello mientras suena como la misma voz.
Y tiene un precio de 22 dólares por cada 1 millón de personajes.
MAI-Voice-2.1-Flash: Diseñado para volumen
MAI-Voice-2.1-Flash soporta los mismos idiomas y hablantes multilingüísticos que MAI-Voice-2.1. Pero ha sido mejorado para cargas de trabajo de alto volumen y sensibles a la latencia. Puede generar 45 segundos de audio, con una latencia de extremo a extremo, de apenas 150 ms.
Ofrece una inferencia de modelos un 55% más rápida y es ~60% más barata que modelos comparables, con un precio de 15 dólares por 1 millón de caracteres.
Esa combinación de latencia, calidad y eficiencia de costes convierte a Flash en un socio natural para MAI-Transcribe-2-Streaming a la hora de crear experiencias naturales y de baja latencia con agentes de voz.
Ambos modelos de voz soportan clonación en todos los idiomas compatibles y utilizan solo unos segundos de audio de referencia, lo que facilita que los clientes utilicen las voces de sus marcas. Al mismo tiempo, cuentan con barreras de consentimiento integradas que evitan el uso indebido.
En una prueba de Turing con 4,000 oyentes, el 50.3% calificó a MAI-Voice como igual o más similar a la humana que las grabaciones humanas

Los resultados combinan MAI-Voice-2.1 y MAI-Voice-2.1 Flash.
Cerrar el bucle
Un agente de voz es un bucle. Tiene que oír, entender, decidir y hablar. Y hacerlo todo dentro de la ventana donde un humano aún experimenta la interacción como una conversación. Cada componente o bien les da tiempo en esa ventana… o lo gasta.
Combinar MAI-Transcribe-2-Streaming con MAI-Voice-2.1-Flash les da tiempo en ambos extremos. El tiempo ahorrado le da a su agente más margen para razonar, usar herramientas y comprobar su respuesta. Todo ello mientras mantiene la conversación a una velocidad humana y conversacional.
Agentes de voz impulsados por MAI, puestos a trabajar
Las aplicaciones siguen expandiéndose, pero los desarrolladores pueden construir estas hoy en día:
- Los agentes de atención al cliente que transcriben las solicitudes tal como se pronuncian, comienzan a actuar antes de que termine el llamante y responden en lenguaje natural
- Asistentes multilingües que detectan en automático el idioma hablado y responden en cualquiera de los 23 idiomas MAI-Voice soportados, con la misma voz y con acento nativo
- Aprendizaje interactivo y medios que utilizan altavoces distintos para tutorías, juegos de rol, simulaciones, narración y contenido conversacional en todos los idiomas soportados
Empiecen a construir ahora
Para mostrar a estos modelos juntos en acción en un agente en vivo, construimos Chatter, una nueva demo en el MAI Playground.
Pueden trabajar con MAI-Voice-2.1 y MAI-Voice-2.1-Flash a través de OpenRouter, y los tres modelos a través de:
- Microsoft Foundry
- MAI Playground
- Vercel
- LiveKit (más adelante)
- Azure Voice Live