Gemini 3.8 Flash TTS : voix IA, mais pas de clonage en Europe

Le 23 septembre 2026, Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles qui transforment un texte en voix : plus de 2 000 voix prêtes à l’emploi, des voix créées à partir d’une simple description et le clonage d’une voix à partir de 30 secondes d’enregistrement, une fonction que Google ne propose pas dans AI Studio en Suisse, dans l’Espace économique européen ni au Royaume-Uni

Le 23 septembre 2026, Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles qui lisent un texte à voix haute avec plus de 2 000 voix prêtes à l’emploi, des voix créées sur simple description et le clonage d’une voix à partir de 30 secondes d’enregistrement. Ce clonage n’est pas proposé dans AI Studio en Suisse, dans l’Espace économique européen ni au Royaume-Uni. Le reste est accessible dès aujourd’hui, pour moins d’un dollar l’heure d’audio générée.

Ce que Google a lancé

Les deux modèles sont présentés sur le blog officiel de Google. Flash TTS vise la direction artistique (podcasts, livres audio, jeux), Flash-Lite TTS les gros volumes à moindre coût, comme le doublage et les agents vocaux. Ce qu’ils savent faire :

  • Créer une voix à partir d’une description en langage courant, sans enregistrement.
  • Reproduire une voix à partir de 30 secondes d’audio, à condition que le propriétaire de la voix enregistre son consentement à l’oral ; Google vérifie que les deux voix correspondent.
  • Puiser dans plus de 2 000 voix, dont des variantes régionales comme le français québécois. La documentation technique annonce 130 langues pour Flash TTS et 101 pour Flash-Lite.
  • Diriger le texte ligne par ligne, avec deux interlocuteurs dans une même scène, des rires ou des soupirs insérés dans le texte.
  • Tenir plusieurs heures d’audio sans que la voix ne dérive, selon Google.

Sur le classement de qualité globale de Hume AI, Flash TTS arrive premier et Flash-Lite deuxième. Chaque fichier produit porte un filigrane invisible SynthID, et les voix clonées reçoivent en plus des identifiants de contenu C2PA, qui signalent l’origine synthétique de l’audio.

Un petit bureau en fin d’après-midi : un casque audio posé sur un ordinateur portable qui affiche une forme d’onde, à côté d’un script imprimé annoté au crayon
Un script, une voix choisie ou décrite, et la version audio est prête : la voix off n’exige plus de studio.

Combien ça coûte

Les deux modèles sont disponibles dans l’API Gemini et dans Google AI Studio, et arriveront bientôt dans Gemini Enterprise. Google les intègre aussi à ses propres outils : Flash TTS à Gemini Notebook, Flash-Lite TTS à l’éditeur vidéo Google Vids. Les tarifs publiés sur la page de prix de l’API Gemini :

  • Flash TTS : 0,50 $ par million de tokens de texte en entrée et 9 $ par million de tokens audio en sortie jusqu’au 31 décembre 2026.
  • Flash-Lite TTS : 0,50 $ en entrée et 6 $ en sortie.
  • Prix doublés au 1er janvier 2027 : 18 $ pour l’audio de Flash TTS, 12 $ pour Flash-Lite.
  • Un niveau gratuit dans AI Studio, mais vos contenus servent alors à améliorer les produits de Google, ce qui n’est pas le cas au niveau payant.

Une seconde d’audio vaut 25 tokens. Une heure de voix générée par Flash TTS coûte donc environ 0,81 $ cette année, puis 1,62 $ en 2027, comme le calcule eesel AI.

Infographie : Gemini 3.8 Flash TTS en quatre chiffres — 30 secondes d’enregistrement suffisent pour reproduire une voix, avec le consentement de son propriétaire ; plus de 2 000 voix prêtes à l’emploi, dont le français québécois ; 130 langues pour Flash TTS et 101 pour Flash-Lite ; environ 0,81 dollar l’heure d’audio générée en 2026, soit 9 dollars le million de tokens audio, prix doublé au 1er janvier 2027
Le coût de production d’une voix off tombe sous le dollar de l’heure : le temps d’écriture et de relecture du script devient le vrai poste de dépense.

Pourquoi le clonage s’arrête à la frontière

Google l’écrit en une phrase : la reproduction de voix dans AI Studio n’est pas disponible dans l’Illinois, au Texas, dans l’Espace économique européen, au Royaume-Uni, en Suisse et en Inde. L’entreprise ne donne pas de raison. Plusieurs de ces territoires encadrent strictement les données biométriques : l’Illinois et le Texas ont chacun une loi dédiée, le RGPD classe ces données parmi les catégories particulières, et la loi suisse sur la protection des données (nLPD) les range parmi les données sensibles. Or une voix clonée repose sur l’empreinte vocale d’une personne.

Concrètement, depuis Genève, Lyon ou Bruxelles, vous pouvez utiliser les voix du catalogue, en créer une sur description et diriger vos textes. Vous ne pouvez pas faire lire vos vidéos par votre propre voix clonée via AI Studio.

Ce que ça change pour vous

Pour une PME ou un indépendant, la voix de synthèse devient un outil de production courant, au même titre que la génération d’images. Quelques usages immédiats :

  • Des voix off pour vos vidéos produit, tutoriels ou publicités, sans studio ni comédien pour chaque version.
  • La version audio de vos contenus : articles, newsletters, modules de formation à écouter en déplacement.
  • Plusieurs langues à partir d’un même script, utile pour une entreprise suisse qui s’adresse aux Romands et aux Alémaniques.
  • Un agent vocal pour l’accueil téléphonique, avec Flash-Lite pour les gros volumes.

Trois précautions. Créez une voix de marque sur description plutôt que de chercher à contourner la restriction régionale. Ne reproduisez jamais la voix de quelqu’un sans son accord écrit, même là où la fonction existe. Et signalez l’audio généré quand il pourrait passer pour une vraie personne : c’est ce qu’exige l’article 50 de l’AI Act, détaillé dans notre guide pour créer du contenu avec l’IA.

Infographie : ce que Gemini 3.8 Flash TTS permet depuis la Suisse et l’Espace économique européen — disponible : plus de 2 000 voix prêtes à l’emploi, la création d’une voix sur description, la direction ligne par ligne avec deux voix, des rires et des soupirs ; non disponible dans AI Studio : la reproduction d’une voix à partir de 30 secondes d’enregistrement, également bloquée au Royaume-Uni, en Inde, dans l’Illinois et au Texas ; l’alternative est une voix de marque créée sur description
Une voix conçue sur description couvre l’essentiel des besoins d’une marque, sans toucher aux données biométriques de quiconque.

Ces modèles vocaux complètent Gemini 3.8 Flash, lancé début septembre : Google décline désormais la même génération pour le texte et pour la voix.

Peut-on cloner sa voix avec Gemini depuis la Suisse ?

Non, pas dans AI Studio pour l’instant : Google exclut la Suisse, l’Espace économique européen et le Royaume-Uni de cette fonction. Les voix du catalogue et la création de voix sur description restent accessibles.

Faut-il indiquer qu’une voix off est générée par IA ?

Dans l’Union européenne, oui dès qu’elle pourrait passer pour une personne réelle. Une voix clairement présentée comme celle d’un assistant ou d’un narrateur de synthèse pose moins de difficulté, mais le signaler reste la pratique la plus sûre.

Écrire un bon script, choisir une voix cohérente avec sa marque et respecter les règles de transparence s’apprend vite quand on pratique sur ses propres contenus. Les formations IA de Vincent Lévi couvrent la création de contenus texte, image, vidéo et audio avec les outils du moment. Pour une session adaptée à votre équipe, contactez l’équipe.

Examine more articles