Google lance SL2T, un modèle d'IA conçu pour comprendre la langue des signes

Google DeepMind a déclaré aujourd'hui vouloir apporter la révolution de l'intelligence artificielle aux 70 millions de personnes sourdes ou malentendantes dans le monde, avec le lancement de la langue des signes en texte ou SL2T.

Dans un article de blog, les chercheurs en IA de Google ont déclaré que SL2T est un modèle de traduction multilingue qui fait ses débuts sur le smartphone Pixel 11, où il alimente une nouvelle fonctionnalité de dictée « signer en texte » sur Gboard et Live Transcribe. Le modèle est initialement capable de traduire la langue des signes américaine ou ASL en texte anglais, et est le premier du genre à être disponible dans un produit de consommation réel, a indiqué la société.

La capacité de l'IA à traiter la parole humaine a énormément progressé ces dernières années, au point que n'importe qui peut dicter ce qu'il veut dans des dizaines de langues du monde sur un smartphone, une tablette ou un ordinateur personnel. Mais il n’en va pas de même pour ceux qui dépendent de l’une des plus de 200 langues des signes distinctes en raison de leur déficience auditive. Selon Google, il s’agit d’un public qui a été complètement ignoré par l’industrie de l’IA jusqu’à présent.

Le modèle SL2T offre aux utilisateurs sourds et malentendants la possibilité d'interagir avec leur smartphone en utilisant leur langue maternelle. Tout comme l'IA vocale permet aux utilisateurs de parler à leur appareil au lieu de taper, SL2T permet aux utilisateurs de se connecter directement à l'appareil photo de leur smartphone plutôt que de taper du texte.

Cela signifie que les utilisateurs peuvent désormais utiliser la langue des signes pour effectuer des dizaines de tâches différentes, notamment des recherches sur le Web, la rédaction d'e-mails et de messages texte, l'édition de documents, etc. Ils peuvent également utiliser SL2T pour inviter Gemini à répondre à des requêtes et à effectuer des actions en leur nom. Le modèle est également disponible dans l'application Live Transcribe de Google, permettant aux utilisateurs de signer leurs réponses directement lors d'appels en face à face.

Google a déclaré que SL2T avait été formé sur plus de 100 000 heures de données en langue des signes couvrant plus de 50 langues, dont environ un quart était constitué de communications ASL. Bien que la version initiale ne puisse comprendre que l'ASL, Google a déclaré avoir décidé d'entraîner le modèle sur plusieurs langues des signes afin d'apprendre les modèles structurels partagés entre elles. De cette manière, il peut largement surpasser les modèles antérieurs de langue des signes.

Pour répondre aux préoccupations des utilisateurs en matière de confidentialité, SL2T est alimenté par un modèle de vision par ordinateur intégré appelé MediaPipe Holistic, qui suit les emplacements de pose géométrique sur les visages, les mains, les bras et le torse du signataire. Il envoie ensuite les coordonnées de ces emplacements à son serveur basé sur le cloud, évitant ainsi d'avoir à télécharger une vidéo réelle, la rendant plus rapide et plus sécurisée pour les utilisateurs.

Le modèle traduit les séquences directement en texte, en contournant les annotations de texte intermédiaires appelées « gloses ». En faisant cela, SL2T est mieux à même de capturer les expressions non manuelles et les structures de grammaire spatiale caractéristiques de l'ASL, a déclaré Google. Les autres fonctionnalités incluent des optimisations pour réduire la latence, des mécanismes de prévention des hallucinations pour les mouvements sans signature et la prise en charge des signataires gauchers et de la signature à une main, afin que les utilisateurs puissent interagir avec celui-ci tout en tenant leur smartphone dans une main.

Les allégations de performances de Google sont étayées par des données solides. SL2T a obtenu un score de 70 BLEURT au benchmark FLEURS-ASL.

La sortie de SL2T est un développement clé pour les communautés sourdes du monde entier, a déclaré Google. Le développement de modèles d’IA capables de comprendre les langues des signes a été lent en raison des défis uniques qu’elles présentent et également de certaines idées fausses courantes. Contrairement aux langues parlées, qui mappent des sons séquentiels directement sur du texte, les langues des signes ont leurs propres lexiques et grammaires qui doivent être traduites d'une manière entièrement nouvelle.

Une autre difficulté réside dans le fait que les langues des signes transmettent un sens à travers des mouvements simultanés non seulement des mains, mais aussi de la tête, du visage, des bras et du torse. Mais les premières tentatives de développement des langues des signes se sont concentrées uniquement sur les gestes de la main, plutôt que de les traiter comme des langages visuels complets du corps.

Google a signalé aux communautés sourdes et malentendantes qu'il ne les laisserait plus derrière lui. En plus de lancer SL2T, la société a également créé le comité consultatif de la langue des signes AI en partenariat avec un certain nombre d'organisations de personnes sourdes et d'experts en langue des signes pour aider à guider le déploiement responsable de la technologie. Le comité co-rédigera également un rapport aux côtés de Google décrivant les capacités de SL2T et ses limites actuelles.

À l'avenir, Google prévoit d'étendre le modèle pour couvrir d'autres langues des signes et également de développer des modèles pour la génération de langues des signes.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine