Annonce et contexte
Le 1er octobre 2026, Microsoft a dévoilé MAI-Transcribe-2-Streaming, son premier modèle de transcription vocale en temps réel, via un billet du blog Microsoft AI intitulé « Our first streaming transcription model debuts at no. 1 on Artificial Analysis ». Dans la même annonce, l’éditeur présente deux nouveaux modèles de synthèse vocale, MAI-Voice-2.1 et MAI-Voice-2.1-Flash : ensemble, les trois modèles forment la pile complète d’un agent vocal conversationnel — écouter, puis parler.
C’est le deuxième lancement audio majeur en une semaine, après Eleven v4 d’ElevenLabs (28/09/2026). MAI-Transcribe-2-Streaming répond directement à Grok Voice Transcribe 2.0 de xAI, précédent no 1 du classement transcription d’Artificial Analysis. La promesse officielle, selon Microsoft : « les briques rapides et fluides pour créer des expériences conversationnelles, sans compromis sur l’exactitude ni sur la qualité vocale ».
Découvrir MAI-Transcribe-2-Streaming
Lien officiel
Fiche technique
| Caractéristique | Valeur |
|---|---|
| Éditeur | Microsoft (Microsoft AI) |
| Date d’annonce | 01/10/2026 |
| Date de disponibilité | 01/10/2026, en préversion publique (public preview) |
| Famille / gamme | MAI (modèles maison Microsoft), série MAI-Transcribe |
| Type | Transcription parole → texte en streaming (temps réel) |
| Langues prises en charge | 60 langues, avec détection automatique et continue de la langue |
| Latence des premiers résultats | Premières hypothèses (« partials ») en un peu plus de 100 ms |
| Fenêtre de contexte (entrée) | Non communiqué |
| Tokens max en sortie | Non communiqué |
| Cutoff des connaissances | Non communiqué |
| Modalités d’entrée / sortie | Audio continu (streaming WebSocket, selon la presse) → texte |
| ID API | Non communiqué |
| Disponibilités | MAI Playground (démo « Chatter »), Microsoft Foundry, Vercel AI Gateway — canaux rapportés par la presse tech |
Nouveautés vs MAI-Transcribe-2
| Critère | MAI-Transcribe-2-Streaming | MAI-Transcribe-2 |
|---|---|---|
| Mode de traitement | Streaming temps réel (résultats partiels pendant la parole) | Batch (audio enregistré) |
| Latence | Partials en ~100 ms, transcription révisée au fil de l’audio | Attente de la fin de l’énoncé |
| Tarif de lancement | 0,54 $/heure d’audio (jusqu’à fin 2026) | 0,10 $/heure (tarif promotionnel, selon Neowin) |
| Positionnement benchmark | No 1 Artificial Analysis (exactitude finale et partielle, selon Microsoft) | Devant OpenAI et Google en tests internes Microsoft (selon Neowin) |
| Cas d’usage visés | Agents vocaux temps réel, dictée, sous-titrage en direct | Transcription de fichiers |
| Sources : | blog Microsoft AI (01/10/2026) ; Neowin (01/10/2026) | |
Le changement n’est pas incrémental : passer du batch au streaming transforme le modèle en composant d’agent vocal, là où la version précédente restait un outil de post-traitement. Le prix, lui, est multiplié par plus de 5 (0,54 $ contre 0,10 $/heure) : c’est le tarif de la latence, et Microsoft l’assume en visant explicitement les agents conversationnels plutôt que la transcription de masse.
À noter : les deux modèles coexistent. MAI-Transcribe-2 reste l’option économique pour la transcription de fichiers enregistrés ; la version Streaming s’adresse aux interactions en direct où chaque centaine de millisecondes compte.
Benchmarks
| Benchmark | MAI-Transcribe-2-Streaming | MAI-Transcribe-2 | Meilleur concurrent |
|---|---|---|---|
| Artificial Analysis — transcription (WER final, 38 modèles) | 2,5 % (1er, selon la presse citant Artificial Analysis) | Non communiqué | Grok Voice Transcribe 2.0 (xAI) : 2,7 % |
| Artificial Analysis — latence de transcription | 0,13 s (selon la presse citant Artificial Analysis) | Non communiqué | Grok Voice Transcribe 2.0 : 0,49 s |
| Exactitude transcriptions finales et partielles | No 1 (selon Microsoft) | Non communiqué | Non communiqué |
| Évaluation exactitude vs latence | Frontière de Pareto (selon Microsoft) | Non communiqué | Non communiqué |
| Vitesse d’apparition des mots (dictée, sous-titrage) | 2× plus rapide que le concurrent le plus proche (test interne Microsoft) | Non communiqué | Non communiqué |
| Sources : | blog Microsoft AI (01/10/2026, chiffres constructeur) ; AI Daily Digest (03/10/2026, citant Artificial Analysis) ; Neowin (01/10/2026) | ||
Lecture critique : les chiffres Artificial Analysis (2,5 % de WER, 0,13 s) sont rapportés par la presse, pas publiés par Microsoft lui-même dans le billet d’annonce — ils restent à vérifier sur le classement public. Le « 2× plus rapide » est une mesure interne du constructeur, par nature non reproductible. Surtout, aucun score n’est communiqué sur des jeux de données publics standards (type LibriSpeech) : c’est une information en soi.
Le point le plus solide reste le différentiel de latence mesuré par Artificial Analysis (0,13 s contre 0,49 s pour Grok Voice Transcribe 2.0) : sur le temps réel, c’est l’écart qui change l’expérience utilisateur.
Comparatif vs concurrents
| Modèle | Éditeur | Prix | Latence mesurée | Point fort |
|---|---|---|---|---|
| MAI-Transcribe-2-Streaming | Microsoft | 0,54 $/heure (~9 $/1 000 minutes, promo fin 2026) | 0,13 s (selon presse/AA) | No 1 exactitude + latence |
| Grok Voice Transcribe 2.0 | xAI | Non communiqué | 0,49 s (selon presse/AA) | Précédent no 1 (WER 2,7 %) |
| Scribe v2 Realtime | ElevenLabs | ~6,50 $/1 000 min (selon la presse) | Non communiqué | Écosystème voix complet |
| Flux | Deepgram | ~6,50 $/1 000 min (selon la presse) | Non communiqué | Positionnement prix agressif |
| Sources : | blog Microsoft AI (01/10/2026) ; AI Daily Digest (03/10/2026, citant Artificial Analysis) | |||
Microsoft ne joue pas la carte du prix : à ~9 $/1 000 minutes, le streaming maison coûte environ 40 % plus cher qu’ElevenLabs Scribe v2 Realtime ou Deepgram Flux (~6,50 $). Le pari est explicite — qualité, latence et déploiement entreprise plutôt que le moins-disant — et il est cohérent avec la stratégie MAI : une pile vocale 100 % Microsoft (Foundry, Copilot, Teams) pour les développeurs déjà dans l’écosystème.
Cas d’usage
- Agents vocaux de service client : l’agent commence à raisonner et à appeler des outils en pleine phrase, avant même la fin de l’énoncé du client.
- Dictée en temps réel : le texte apparaît à l’écran pendant que l’utilisateur parle, avec correction continue des hypothèses.
- Sous-titrage en direct : réunions, webinaires et médias en direct, avec détection automatique de la langue.
- Assistants multilingues : 60 langues avec changement de langue détecté en cours de conversation, sans réglage manuel.
- Apprentissage interactif et médias : tutorat, jeux de rôle et narration conversationnelle multilingue.
- Boucle agentique complète : combiné à MAI-Voice-2.1-Flash, un tour de parole complet (écoute + raisonnement + réponse vocale) passe sous la seconde.
Tarifs et accès
| Offre | Tarif | Notes |
|---|---|---|
| Streaming (lancement) | 0,54 $/heure d’audio | Tarif promotionnel jusqu’à fin 2026 ; tarif standard ensuite non communiqué |
| Batch (MAI-Transcribe-2) | 0,10 $/heure d’audio | Tarif promotionnel (selon Neowin) ; option économique pour les fichiers |
Voir les tarifs officiels
Lien officiel
Accès : Microsoft Foundry, MAI Playground (avec la démo d’agent vocal « Chatter »), Vercel AI Gateway. Les trois modèles sont en préversion publique : selon la presse tech, sans engagement de disponibilité (SLA) et déconseillés pour la production tant que la disponibilité générale n’est pas prononcée. La disponibilité via d’autres canaux (OpenRouter, LiveKit) n’est confirmée par Microsoft que pour les modèles vocaux, pas pour la transcription.
FAQ
Quand MAI-Transcribe-2-Streaming a-t-il été annoncé ?
Le 1er octobre 2026, via un billet du blog Microsoft AI intitulé « Our first streaming transcription model debuts at no. 1 on Artificial Analysis ».
Combien coûte MAI-Transcribe-2-Streaming ?
0,54 $/heure d’audio, un tarif de lancement valable jusqu’à fin 2026. Le tarif standard ultérieur n’est pas communiqué.
Quelles langues le modèle prend-il en charge ?
60 langues, avec détection automatique et continue de la langue — y compris un changement de langue en cours de conversation, sans réglage manuel.
Quelle est sa latence ?
Selon Microsoft, les premières hypothèses de transcription (« partials ») arrivent en un peu plus de 100 ms après réception de l’audio. La presse rapporte 0,13 s de latence mesurée par Artificial Analysis, contre 0,49 s pour Grok Voice Transcribe 2.0.
En quoi diffère-t-il de MAI-Transcribe-2 ?
MAI-Transcribe-2 traite des fichiers audio enregistrés (batch) à 0,10 $/heure en tarif promotionnel. La version Streaming travaille en temps réel sur de l’audio continu, avec des résultats partiels pendant la parole — au prix d’un tarif 5× supérieur.
Où peut-on l’utiliser ?
Via Microsoft Foundry, le MAI Playground (démo « Chatter ») et Vercel AI Gateway. Il s’agit d’une préversion publique, sans SLA, déconseillée pour la production par Microsoft selon la presse tech.
Est-il vraiment le no 1 de la transcription ?
C’est ce qu’affirme Microsoft : no 1 d’Artificial Analysis pour l’exactitude des transcriptions finales et partielles, avec un WER final de 2,5 % selon la presse citant le classement — devant Grok Voice Transcribe 2.0 (2,7 %). Ces chiffres restent des données constructeur et de presse, à vérifier sur le classement public.
Verdict
OUI si : vous construisez un agent vocal temps réel dans l’écosystème Microsoft ; vous avez besoin de la meilleure latence/exactitude du marché pour de la dictée ou du sous-titrage en direct multilingue.
NON si : vous transcrivez des fichiers en masse (MAI-Transcribe-2 batch coûte 5× moins cher) ; vous exigez un SLA de production (préversion publique) ; le prix au volume est votre critère no 1 (ElevenLabs et Deepgram sont ~40 % moins chers).
Note de la rédaction : 8,5/10 — la référence technique du streaming STT à son lancement (exactitude et latence en tête), pénalisée par un tarif premium et un statut de préversion qui interdit la production critique.
Découvrir MAI-Transcribe-2-Streaming
Lien officiel