Microsoft cible les agents vocaux ultra-réalistes avec son premier modèle de transcription en streaming

Microsoft Corp. a élargi aujourd'hui sa famille de modèles d'intelligence artificielle MAI avec son premier modèle de transcription en streaming, faisant ses débuts aux côtés de deux autres axés sur la synthèse vocale.

Ils sont conçus pour les développeurs qui souhaitent créer des agents vocaux capables d'écouter la voix des gens et de répondre instantanément, de la même manière que les humains se parlent.

Le plus important des trois est MAI-Transcribe-2-Streaming, qui, selon la société, accepte la parole humaine via un WebSocket, la transformant en une transcription continuellement mise à jour à mesure que la personne continue de parler. Une fois que la personne aura fini de parler, cela confirmera que la transcription est définitive. De cette manière, le modèle peut alimenter des applications qui affichent des sous-titres en direct ou commencent à traiter la demande d'un utilisateur avant qu'il ait fini de la prononcer, a déclaré Microsoft.

MAI-Transcribe-2-Streaming est répertorié sur Vercel AI Gateway de Microsoft et coûte 54 cents par heure audio, a indiqué la société. Il prend en charge plus de 60 langues et peut détecter automatiquement celle que quelqu'un parle. Il fournit ses premières hypothèses de transcription en 320 millisecondes en moyenne, bien que Microsoft ait déclaré qu'il ne pouvait pas garantir ce type de performance dans tous les scénarios, car la vitesse de réponse est également déterminée par la connexion réseau et le système d'IA qui génère la réponse.

Microsoft n'est pas nouveau dans les modèles de transcription. Le mois dernier, il a lancé le modèle MAI-Transcribe-2 avec un prix de 10 cents par heure audio, soit plus de cinq fois moins cher que la variante Streaming. C'est principalement parce que le modèle Streaming effectue beaucoup plus de traitement, renvoyant continuellement des résultats provisoires pendant que l'audio arrive toujours. Le modèle MAI-Transcribe-2 standard attend simplement que l'orateur termine ce qu'il dit avant de commencer le traitement.

S'éloignant de la transcription, il existe deux modèles axés sur la génération de parole à partir de texte, qui sont tout aussi importants pour les agents d'IA conversationnels. Ils incluent MAI-Voice-2.1, qui est considéré comme le meilleur choix pour des sorties plus expressives et plus fidèles, et MAI-Voice-2.1-Flash, qui atténue ces attributs en faveur d'une réponse plus rapide et d'un coût inférieur.

Selon les listes de Vercel AI Gateway, MAI-Voice-2.1 coûte 22 $ par million de caractères, tandis que la version Flash coûte 15 $ par million de caractères. Les deux modèles de synthèse vocale prennent en charge 23 langues, a indiqué Microsoft.

Les nouvelles versions démontrent que Microsoft accélère sa transition vers des fournisseurs de modèles tels que OpenAI Group PBC et Anthropic PBC, bien qu'il soit un investisseur majeur dans ces deux sociétés. En juillet, il a été rapporté que Mustafa Suleyman, directeur général de Microsoft AI, était de plus en plus préoccupé par les coûts associés aux puissants modèles frontières d'OpenAI et d'Anthropic.

En réponse, il a demandé aux chercheurs en IA de Microsoft de doubler la famille de modèles MAI, dans le but d'utiliser à terme ces modèles pour alimenter ses agents Copilot dans des plateformes telles qu'Excel et Outlook. « Nous payons beaucoup d'argent à Anthropic, notre objectif est donc de réduire et, à terme, d'éliminer ce coût », a déclaré Suleyman à Bloomberg dans une interview.

Avec le lancement des nouveaux modèles, Microsoft a tout ce dont il a besoin pour créer de puissants agents d'IA vocale capables de converser avec leurs utilisateurs humains de manière naturelle et humaine. Les agents vocaux doivent être capables de faire trois choses pour fonctionner : ils doivent être capables de reconnaître et de comprendre ce que quelqu'un leur dit, puis de décider quoi faire en fonction de ce qui a été dit, et enfin de générer une réponse audible.

MAI-Transcribe-2-Streaming résout le premier problème et les modèles MAI-Voice résolvent le troisième. Au milieu se trouve le puissant modèle de raisonnement de Microsoft, Mai-Thinking-1, qui est un grand modèle de langage standard qui lit les transcriptions de ce qui a été dit pour décider ce que l'agent doit faire. En utilisant trois modèles distincts, les développeurs ont beaucoup plus de contrôle sur la qualité, la latence et les coûts de leurs agents vocaux.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine