2 · MODÈLES
Microsoft lance trois modèles de voix pour agents conversationnels : transcription en direct et synthèse vocale
Dimanche 4 octobre 2026 · 3 sources · 10 min de lecture
60
langues pour la transcription en direct
0,54 $
par heure d'audio (prix de lancement)
23
langues pour la synthèse vocale
CE QUI S'EST PASSÉ
Le 1er octobre, Microsoft AI a présenté trois modèles : MAI-Transcribe-2-Streaming, qui transforme la parole en texte au fur et à mesure qu'on parle, et MAI-Voice-2.1 et MAI-Voice-2.1-Flash, qui produisent de la parole à partir de texte. Selon l'entreprise, la transcription couvre 60 langues avec détection automatique de la langue. Les premiers mots apparaissent après un peu plus de 100 millisecondes selon Microsoft, et en moyenne 320 millisecondes selon SiliconANGLE, qui précise que l'entreprise ne garantit pas ce délai dans tous les cas. Le prix de lancement est de 0,54 dollar par heure d'audio jusqu'à la fin de l'année. Les deux modèles de voix gèrent 23 langues, à 22 dollars (version standard) et 15 dollars (version « Flash », plus rapide) par million de caractères. Microsoft indique que la transcription est en préversion publique, donc sans garantie de service. Microsoft affirme que son modèle de transcription est classé premier de l'évaluation Artificial Analysis pour la justesse ; nous n'avons pas consulté ce classement.
Que signifie « en continu » pour une transcription, et pourquoi la latence compte-t-elle ?
Une transcription classique attend la fin de la phrase. Une transcription en continu (streaming) renvoie un texte provisoire pendant que la personne parle, puis le corrige. La latence est le délai entre la parole et le texte, en millisecondes : plus elle est courte, plus un assistant vocal peut répondre sans blanc gênant. Un agent vocal enchaîne trois étapes : écouter (transcription), décider (modèle de langage), parler (synthèse vocale). Les chiffres de rapidité et de précision sont ici des annonces de l'entreprise ; seul un classement tiers, non consulté, est cité.
LES POINTS DE VUE
Présente les trois modèles comme une chaîne complète pour des agents qui doivent écouter, raisonner, utiliser des outils et parler dans un délai naturel.
annonce du 1er octobre · TestingCatalog
« We pay a lot of money to Anthropic, so our goal is to reduce and ultimately eliminate that cost », a-t-il dit à Bloomberg (cité par SiliconANGLE).
directeur de Microsoft AI · SiliconANGLE
CE QUE ÇA CHANGE
Pour un développeur ou une entreprise, ces modèles s'ajoutent aux offres de voix existantes, avec un prix de lancement valable jusqu'à fin 2026. Pour un utilisateur, ils pourraient se retrouver dans des assistants vocaux, sans calendrier annoncé. Les deux…
ET APRÈS ?
- 1
Le prix de lancement court jusqu'au 31 décembre 2026
- 2
LiveKit doit ajouter la prise en charge prochainement, selon TestingCatalog
