Accueil / Tech News / Google lance Gemini 3.8 Flash TTS, une IA capable de cloner une voix en 30 secondes

Google lance Gemini 3.8 Flash TTS, une IA capable de cloner une voix en 30 secondes

Google a présenté ce mercredi 23 septembre deux nouveaux outils, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS.

Gemini 3.8 Flash TTS vise plutôt les usages créatifs, comme les jeux vidéo, les livres audio, les podcasts ou les médias interactifs. Gemini 3.8 Flash-Lite TTS reprend la même idée mais avec un objectif plus industriel : produire beaucoup d’audio, pour du doublage, des contenus en volume ou des agents vocaux expressifs.

Dans la famille Gemini, Google continue donc de séparer les modèles les plus riches de versions plus légères.

Ces deux modèles succèdent à Gemini 3.1 Flash TTS, lancé en avril 2026. Google revendique des progrès nets sur les contenus longs et la gestion de dialogues à deux voix par rapport à cette génération, et ajoute surtout un palier Flash-Lite, moins cher, pensé pour produire de l’audio en grande quantité.

La promesse la plus spectaculaire concerne Gemini 3.8 Flash TTS. Google promet que vous pourrez créer une voix inédite à partir de zéro, sans échantillon audio de départ, avec une simple consigne en langage naturel. Il est possible de créer une voix de narrateur avec une cadence précise, ou un personnage beaucoup plus théâtral, puis ajuster ligne par ligne l’intonation, le débit, l’accent et les signaux d’écoute (les « mhm », « oui » qui ponctuent une conversation).

La bibliothèque de départ compte aussi plus de 2 000 voix prêtes à l’emploi, avec plus de 100 langues et dialectes. Google cite même des variantes régionales comme l’espagnol mexicain, le français québécois ou l’anglais écossais.

La génération d’une voix sur une longue durée est pensée pour garder un timbre stable pendant plusieurs heures d’enregistrement continu, utile pour les podcasts et livres audio. Google évoque aussi une mise en scène à deux interlocuteurs, capable de garder deux voix séparées dans un même script et de se donner la parole de la manière la plus naturelle possible.

SynthID joue ici le rôle de filigrane invisible. Chaque clip audio généré par les modèles Gemini Audio doit embarquer cette marque directement dans le fichier, afin de rendre la parole générée par IA détectable. C’est rassurant sur le papier, mais ça ne règle pas tout : la détection dépend toujours des outils utilisés en face, et un fichier audio peut être réencodé, découpé ou republié dans des conditions moins propres.

Google prévoit aussi du remixage vocal, annoncé pour plus tard. L’idée sera de partir d’une voix existante et de modifier le timbre, la hauteur, le débit ou l’accent avec une instruction textuelle.

Les deux modèles sont disponibles dès ce mercredi 23 septembre dans l’API Gemini et Google AI Studio. Gemini 3.8 Flash TTS doit ensuite arriver dans Gemini Enterprise et Gemini Notebook, tandis que Flash-Lite TTS est annoncé pour Google Vids.

Votre café et votre dose de tech vous attendent sur WhatsApp chaque matin avec Frandroid.

Journaliste et chef de rubrique vélos électriques et trottinettes électriques

Journaliste, responsable coordination & présentateur. Véritable couteau suisse de la rédaction, Grégoire décortique l'actualité tech et mobilité avec un regard toujours tourné vers l'usage quotidien. Des tests de vélos électriques urbains aux analyses des dernières mises à jour de nos applications préférées, il a à cœur de vous livrer une information claire et accessible. Vous le connaissez d'ailleurs sûrement "en chair et en os" : il est l'animateur incontournable des émissions Unlock et Survoltés sur Twitch, où il juge, débat et classe les derniers produits tech avec la rédaction et la communauté, dans la bonne humeur et sans langue de bois.

C'est enregistré ! Surveillez votre boîte aux lettres, vous allez entendre parler de nous !

Origine de l’article : lire l’article original

Traduction