Google lance deux modèles de génération vocale de référence

Google LLC a lancé aujourd'hui deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, disponibles via sa plate-forme cloud.

Les algorithmes ont des interfaces de programmation d’applications très similaires, ce qui rend leur utilisation côte à côte relativement simple pour les développeurs. Flash-Lite TTS est optimisé pour la rentabilité et la vitesse d'inférence. Flash TTS offre une meilleure qualité audio pour un prix plus élevé. Google envisage que les clients l'utilisent pour des tâches telles que la création de livres audio.

Il existe également d'autres différences entre les modèles. Plus particulièrement, Flash TTS peut générer de la parole dans 130 langues au lancement, tandis que Flash-Lite TTS en prend en charge 101.

Les deux modèles offrent accès à une bibliothèque de plus de 2 000 voix préemballées. Les développeurs peuvent créer des voix personnalisées avec des invites en langage naturel. Google permet de personnaliser des paramètres tels que le timbre vocal, l'accent et le rythme d'un locuteur IA.

La deuxième façon de personnaliser les nouveaux modèles consiste à générer une voix synthétique basée sur un échantillon audio de 30 secondes. Google demande aux développeurs d'obtenir le consentement de l'orateur avant de générer une réplique vocale. Plus tard, la société prévoit d'ajouter une troisième option de personnalisation qui permettra de créer une nouvelle voix en modifiant l'une des options préemballées.

Flash TTS et Flash-Lite TTS permettent également de personnaliser la diffusion d'un haut-parleur IA. Les développeurs peuvent ajouter des indices oratoires à chaque ligne du script que les modèles lisent à haute voix. Ces signaux génèrent des éléments audio tels que des vocalisations non lexicales et des changements de rythme.

Google utilise une technologie appelée SynthID pour intégrer un filigrane audio dans le discours généré par l'IA. Le filigrane est inaudible pour les humains mais peut être détecté par les outils de détection de l’IA. Pour plus de mesure, la société joint un enregistrement dit C2PA à chaque fichier audio qu'elle génère. Ces enregistrements précisent quand un fichier a été généré, s'il a été modifié depuis et les détails associés.

La société a évalué ses nouveaux modèles à l'aide d'un test de qualité audio développé par la startup Hume AI Inc. Flash TTS et Flash-Lite TTS ont remporté respectivement la première et la deuxième place. De plus, ils ont surpassé plusieurs modèles concurrents sur plusieurs versions linguistiques spécifiques de Voice Arena. Il s'agit d'une référence qui mesure la qualité de sortie des algorithmes de synthèse vocale sur la base des commentaires humains.

« Ces modèles permettent aux créateurs, aux développeurs et aux entreprises de créer des expériences audio plus riches et plus expressives, tout en permettant des expériences utilisateur améliorées dans des produits comme Gemini Notebook et Google Vids », ont écrit Leland Rechis et Alan Cowen, membres du personnel de Google, dans un communiqué. article de blog.

Flash TTS et Flash-Lite TTS font partie d'une gamme plus large de modèles de traitement audio. Google a précédemment publié des algorithmes optimisés pour les agents vocaux, la transcription et la traduction.

Image: Google

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine