PolyAI lance un nouveau modèle de conversation vocale en temps réel pour rendre les appels basés sur l'IA plus humains

PolyAI Ltd., développeur d'assistants vocaux et d'agents d'IA conversationnels, a annoncé aujourd'hui la sortie de Dialog-RSN-1, un modèle d'intelligence artificielle de dialogue vocal capable de percevoir et de répondre directement à l'audio.

Les entreprises d’IA vocale se sont efforcées de réduire les délais et d’augmenter la précision des agents d’IA vocale, leur permettant ainsi de paraître plus humains lors des appels téléphoniques. Dans de nombreux cas, la chaîne logicielle nécessaire pour y parvenir commence généralement par la reconnaissance et le traitement de la parole, puis par le grand modèle de langage pour la génération de texte et enfin par la sortie vocale.

Le nouveau LLM de la société effectue la reconnaissance et le traitement de la parole au sein du modèle, mais la sortie vocale est divisée. Cela permet au modèle d'IA d'« entendre » et de comprendre complètement la conversation vocale d'un seul coup, sans qu'un autre modèle devant lui ne puisse capter le ton, la cadence ou comprendre le contexte complet de la conversation.

Selon PolyAI, ce nouveau modèle offre une expérience plus proche d'un autre humain écoutant l'appel. L’audio étant directement analysé par l’IA, celle-ci peut détecter des signaux non vocaux susceptibles de modifier le cours de la conversation.

Cela permet également aux utilisateurs d'inviter le modèle à réagir à ce qu'il entend dans l'accent, l'humeur ou le bruit de l'appelant dans l'environnement. Au lieu de travailler à partir d'une transcription, qui perd tout cela, le modèle peut détecter des mots mal prononcés rendus évidents par le contexte, un appelant épelant à voix haute « Matthieu avec deux T » ou un nom de marque comme Audibel, qui n'est pas le mot « audible ».

L'un des avantages de cette solution est que Dialog-RSN peut réagir rapidement et détecter les retards potentiels sur la ligne. Cela signifie que le modèle peut réagir rapidement, exécuter des outils sous le capot et construire en fonction de l'ensemble du contexte de la conversation. Cela réduit également la probabilité que le modèle interrompe l'utilisateur, car il peut capter la cadence et le timing du discours de l'utilisateur, lui donnant ainsi un aperçu similaire de la façon dont les humains normaux se relaient lors d'une conversation.

Selon la société, Dialog-RSN a une latence comprise entre 280 et 500 millisecondes, ce qui signifie qu'il répond de manière fiable en moins de 300 ms. En comparaison, GPT-realtime-2.1 d'OpenAI GPT répond souvent entre 860 et 1900 ms.

Le délai naturel entre les locuteurs dans une conversation humaine normale est d'environ 200 à 300 ms, soit environ 2 dixièmes de seconde. Ce retard est presque universel et remarquablement cohérent dans les différentes langues, cultures et régions géographiques. Les humains détectent les écarts par rapport au rythme de la conversation ; ce timing est important non seulement pour la conversation mais aussi pour créer une compréhension. Les réponses lentes d’un agent IA peuvent le rendre frustrant ou gênant. Bien que ce ne soit pas toujours un problème majeur avec les systèmes automatisés – la plupart des gens ne s'attendent pas à ce qu'un ordinateur en ligne réponde comme un humain – cela entraîne un problème lorsqu'un appelant veut l'interrompre.

Si un agent IA parle de quelque chose que l'utilisateur n'a pas l'impression d'avoir compris correctement (ou même un autre humain), la plupart des gens l'interrompront afin qu'il ne prenne pas encore une minute ou plus pour continuer une conversation qui est erronée ou prend du temps où ils pourraient clarifier ou passer à autre chose.

La société s'est également concentrée sur la séparation du module de synthèse vocale du LLM lui-même ; cela permet aux utilisateurs de contrôler plus facilement les poids et la production. Le fait que Dialog-RSN fournisse ses sorties à un modèle TTS signifie que l'utilisateur final peut facilement ajuster ses sorties vocales avec la voix, l'émotivité et la cadence qu'il souhaite sans avoir besoin d'ajuster le modèle conversationnel, ce qui nécessiterait une formation supplémentaire et coûteuse.

Selon PolyAI, garder la génération séparée donne un contrôle total sur la voix de sortie. Cela signifie que changer de voix, changer son intonation, son accent, sa résonance émotionnelle et d'autres personnalisations peut se produire sans ajuster le modèle sous-jacent.

La comparaison s'effectue avec des modèles de voix tels que GPT realtime et Gemini Live, où la voix de sortie est intégrée au modèle lui-même. Cela rend les voix alternatives difficiles à contrôler à grande échelle et plus coûteuses à diffuser. Étant donné que le TTS est distinct, les entreprises contrôlent également le montant des dépenses qu'elles souhaitent consacrer à la génération vocale, l'exécutent sur son propre matériel et le rendent aussi efficace que possible, réduisant ainsi la facture globale de calcul.

PolyAI a déclaré avoir construit le modèle grâce à la post-formation de modèles multimodaux à poids ouvert en utilisant un réglage fin supervisé et un réglage de renforcement à l'aide de données de formation internes. La société a déclaré que son pipeline de formation était largement indépendant du modèle et a donc évalué Gemma, GPT-OSS, Qwen et Mistral. L'objectif était d'atteindre le délai inférieur à 300 ms lorsqu'il était servi sur des unités de traitement graphique A100 en utilisant un modèle dense 8B ou un modèle clairsemé 30B.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine