Nuance Labs, une startup basée à Seattle qui tente d'améliorer les modèles d'intelligence artificielle lors des conversations en face à face, a annoncé aujourd'hui avoir clôturé un cycle de financement initial de 50 millions de dollars pour y parvenir.
Nuance tente de construire un « modèle de base humaine » pour alimenter des avatars capables d'engager une conversation avec des humains sans le décalage et la gêne associés aux chatbots existants. Pour ce faire, il leur donne plus d'intelligence émotionnelle, a déclaré le co-fondateur et directeur général Fangchang Ma dans une interview avec Business Insider.
Ma, ancien chercheur en IA chez Apple Inc., a expliqué que les robots vocaux et les avatars IA existants sont construits de manière détournée, les développeurs scotchant efficacement divers modèles, comme le modèle de génération voix-texte, un grand modèle de langage qui répond à ces textes, puis un modèle texte-voix qui transforme ces réponses en audio. C'est pourquoi les chatbots existants ont tendance à avoir des réponses tardives, car ils doivent tout traiter étape par étape. Dans le cas des avatars IA, il y a une quatrième étape, car le modèle doit également animer un visage pour qu'il corresponde à ce que dit l'avatar.
Selon Ma, ces transferts suppriment tout sentiment d'interaction avec un humain, ce qui donne lieu à des avatars qui semblent figés lorsque quelqu'un leur parle. « Si vous utilisez des avatars IA existants, lorsqu'ils écoutent, ils ne réagissent pas ou font simplement des choses aléatoires », a déclaré Ma.
Nuance Labs veut changer cela et rendre les avatars de l'IA plus réalistes, c'est pourquoi il a développé un modèle capable de percevoir et de générer des réponses et des réactions via un système full-duplex. Le système intègre la perception audiovisuelle du flux de l'utilisateur pour comprendre ce que fait et dit la personne avec laquelle il est en contact, et en même temps, renvoie une réponse audiovisuelle. Cela permet au modèle de réagir aux signaux verbaux et non verbaux de l'humain pendant qu'il parle.
Ma a déclaré que le modèle de Nuance peut percevoir les mots, le regard, les gestes, le ton et le timing, et répondre à ces entrées en temps réel avec des expressions faciales et vocales. Il apprend à mieux le faire au fil du temps en étudiant le comportement des gens lors de ses conversations. En conséquence, il peut démontrer sa compréhension sur le moment, même lorsque l’utilisateur parle encore, tout comme le font les humains ordinaires. « Nous avons décidé de construire cela sur un seul système, sur un seul modèle », a déclaré Ma. « Il y a une entrée audio/vidéo et une sortie audio/vidéo. »
La société a publié une démo de son modèle, et bien qu'il s'agisse encore d'un travail en cours, ces progrès semblent avoir été assez loin :
Selon Ma, les modèles de Nuance permettent aux avatars de l'IA d'engager des conversations avec des humains qui semblent plus naturelles et plus productives, avec de meilleurs résultats dans des scénarios où les expressions peuvent aider à obtenir des résultats. Il cible des cas d'utilisation tels que la vente et le service client, le coaching, la formation professionnelle et l'éducation. Ainsi, quelqu’un pourrait participer à un appel vidéo pour apprendre une nouvelle langue ou s’entraîner à un entretien.
Nuance n'a encore lancé aucun produit car elle est encore en train de peaufiner son modèle pour rendre les conversations encore plus fluides, mais elle espère que son premier aperçu de recherche sera prêt à être rendu public plus tard cette année. En attendant, les fonds issus du cycle d'aujourd'hui contribueront à accélérer ces efforts de développement, a indiqué M. Ma. Nuance embauchera également davantage de chercheurs.