← IA & Tech du dimanche 4 octobre 2026Éclairage IA & TechSujet 2 sur 3

2 · MODÈLES

Microsoft lance trois modèles de voix pour agents conversationnels : transcription en direct et synthèse vocale

Dimanche 4 octobre 2026 · 3 sources · 10 min de lecture

Microphones in SPNN Podcast studio-01
Microphones in SPNN Podcast studio-01© Myotus · CC BY 4.0

60

langues pour la transcription en direct

0,54 $

par heure d'audio (prix de lancement)

23

langues pour la synthèse vocale

CE QUI S'EST PASSÉ

Le 1er octobre, Microsoft AI a présenté trois modèles : MAI-Transcribe-2-Streaming, qui transforme la parole en texte au fur et à mesure qu'on parle, et MAI-Voice-2.1 et MAI-Voice-2.1-Flash, qui produisent de la parole à partir de texte. Selon l'entreprise, la transcription couvre 60 langues avec détection automatique de la langue. Les premiers mots apparaissent après un peu plus de 100 millisecondes selon Microsoft, et en moyenne 320 millisecondes selon SiliconANGLE, qui précise que l'entreprise ne garantit pas ce délai dans tous les cas. Le prix de lancement est de 0,54 dollar par heure d'audio jusqu'à la fin de l'année. Les deux modèles de voix gèrent 23 langues, à 22 dollars (version standard) et 15 dollars (version « Flash », plus rapide) par million de caractères. Microsoft indique que la transcription est en préversion publique, donc sans garantie de service. Microsoft affirme que son modèle de transcription est classé premier de l'évaluation Artificial Analysis pour la justesse ; nous n'avons pas consulté ce classement.

L'ÉCLAIRAGE

Que signifie « en continu » pour une transcription, et pourquoi la latence compte-t-elle ?

Une transcription classique attend la fin de la phrase. Une transcription en continu (streaming) renvoie un texte provisoire pendant que la personne parle, puis le corrige. La latence est le délai entre la parole et le texte, en millisecondes : plus elle est courte, plus un assistant vocal peut répondre sans blanc gênant. Un agent vocal enchaîne trois étapes : écouter (transcription), décider (modèle de langage), parler (synthèse vocale). Les chiffres de rapidité et de précision sont ici des annonces de l'entreprise ; seul un classement tiers, non consulté, est cité.

LES POINTS DE VUE

CE QUE ÇA CHANGE

Pour un développeur ou une entreprise, ces modèles s'ajoutent aux offres de voix existantes, avec un prix de lancement valable jusqu'à fin 2026. Pour un utilisateur, ils pourraient se retrouver dans des assistants vocaux, sans calendrier annoncé. Les deux…

ET APRÈS ?

  1. 1

    Le prix de lancement court jusqu'au 31 décembre 2026

  2. 2

    LiveKit doit ajouter la prise en charge prochainement, selon TestingCatalog

Sujets complémentaires

ÉGALEMENT DANS L'ÉDITION IA & TECH DU JOUR

Vous avez décroché de l'actualité ? On reprend depuis le début.

Un sujet, son contexte, les faits et les différentes positions. Chaque matin, gratuitement, dans votre boîte mail.