Wispr lève 280 millions de dollars pour améliorer la synthèse vocale naturelle grâce à l'IA

Wispr AI Inc.le développeur d'une plateforme de dictée multiplateforme alimentée par l'IA, annoncé aujourd'hui il a levé 280 millions de dollars dans le cadre d'un financement de série B pour une valorisation de 2 milliards de dollars.

Le produit principal de Wispr est Flow, un produit de synthèse vocale qui s'intègre aux applications et permet aux utilisateurs de parler naturellement dans n'importe quel champ de texte à dicter. Il prend le langage parlé, corrige la grammaire, les fautes de langage, les mots de remplissage tels que « ums » et « ahs » et les trébuchements, et produit une prose claire et lisible pour les e-mails, les mémos et les documents. Cela rend l'outil extrêmement utile pour les environnements mobiles, de bureau et autres dans lesquels quelqu'un souhaite simplement s'asseoir et parler à son ordinateur au lieu d'utiliser un clavier.

Parallèlement au financement, la société annonce un aperçu de son premier modèle d'IA propriétaire, Canto.

Contrairement à la plupart des modèles vocaux, Canto a été formé pour détecter la parole dans une grande variété de variations vocales, dans des environnements bruyants, avec du bruit, des interruptions, des aboiements de chiens, d'autres voix, des bruits de fond et le bruit de la vie en arrière-plan. La société a déclaré que la plupart des modèles vocaux sont formés sur des ressources vocales extrêmement claires afin de fournir des sons vocaux humains purs. Canto a reçu des exemples lui permettant d'isoler rapidement les voix humaines des bruits environnementaux, afin que les utilisateurs puissent utiliser leurs applications là où ils vivent, dans leur voiture, à proximité du bruit de la circulation ou au bureau.

Lorsque Canto est intégré à Flow, l'outil de dictée de l'entreprise, Wispr a déclaré que le taux d'erreur dans les environnements bruyants passe de 30 % à près de 5 % à 10 %.

Dans une pièce calme, la transcription de l’IA la plus moderne peut être extrêmement fluide, avec des erreurs mineures survenant. Dans un environnement bruyant, cela peut être catastrophique. Au cours des 10 dernières années, la plupart des applications de synthèse vocale ont été utilisées en déplacement pour des tâches simples telles que vérifier la météo, demander l'heure ou de simples recherches sur le Web, car cela ne représente que quelques mots et très peu de choses peuvent mal tourner.

Avec un système soutenu par Canto, cela ouvre une toute nouvelle opportunité de s'asseoir dans une voiture, même à proximité d'un lieu bruyant, et de parler d'idées et le modèle obtiendra la plupart des mots sur papier numérique. Quelque chose avec lequel, il y a un an, un modèle de synthèse vocale aurait eu du mal.

« J'utilise Flow tous les jours », a déclaré Domantas Sabonis, trois fois NBA All-Star. « J'ai grandi en alternant entre l'anglais, l'espagnol et le lituanien, et cela me suit, peu importe celui que je parle. »

Les joueurs de la NBA et les hommes d'affaires ne sont pas les seuls utilisateurs d'applications de transcription qui bénéficieront des progrès technologiques. La communauté des sourds et des malentendants utilise également la transcription par l'IA sur les appareils mobiles, où les conversations à plusieurs participants et les environnements bruyants conduisent à intéressant des erreurs dans le texte transcrit ; même si beaucoup s’appuient principalement sur la transcription sur appareil, l’évolution des modèles cloud fait avancer le secteur.

Wispr a déclaré que les gens ont écrit plus de 60 milliards de mots sur Flow. Son produit a également été utilisé par presque toutes les sociétés Fortune 500 et plus de 10 000 entreprises, prouvant ainsi son utilisation dans tous les secteurs.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine