Gemini 3.8 Flash TTS : voix IA, mais pas de clonage en Europe
Le 23 septembre 2026, Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles qui lisent un texte à voix haute avec plus de 2 000 voix prêtes à l’emploi, des voix créées sur simple description et le clonage d’une voix à partir de 30 secondes d’enregistrement. Ce clonage n’est pas proposé dans AI Studio en Suisse, dans l’Espace économique européen ni au Royaume-Uni. Le reste est accessible dès aujourd’hui, pour moins d’un dollar l’heure d’audio générée.
Ce que Google a lancé
Les deux modèles sont présentés sur le blog officiel de Google. Flash TTS vise la direction artistique (podcasts, livres audio, jeux), Flash-Lite TTS les gros volumes à moindre coût, comme le doublage et les agents vocaux. Ce qu’ils savent faire :
- Créer une voix à partir d’une description en langage courant, sans enregistrement.
- Reproduire une voix à partir de 30 secondes d’audio, à condition que le propriétaire de la voix enregistre son consentement à l’oral ; Google vérifie que les deux voix correspondent.
- Puiser dans plus de 2 000 voix, dont des variantes régionales comme le français québécois. La documentation technique annonce 130 langues pour Flash TTS et 101 pour Flash-Lite.
- Diriger le texte ligne par ligne, avec deux interlocuteurs dans une même scène, des rires ou des soupirs insérés dans le texte.
- Tenir plusieurs heures d’audio sans que la voix ne dérive, selon Google.
Sur le classement de qualité globale de Hume AI, Flash TTS arrive premier et Flash-Lite deuxième. Chaque fichier produit porte un filigrane invisible SynthID, et les voix clonées reçoivent en plus des identifiants de contenu C2PA, qui signalent l’origine synthétique de l’audio.
Combien ça coûte
Les deux modèles sont disponibles dans l’API Gemini et dans Google AI Studio, et arriveront bientôt dans Gemini Enterprise. Google les intègre aussi à ses propres outils : Flash TTS à Gemini Notebook, Flash-Lite TTS à l’éditeur vidéo Google Vids. Les tarifs publiés sur la page de prix de l’API Gemini :
- Flash TTS : 0,50 $ par million de tokens de texte en entrée et 9 $ par million de tokens audio en sortie jusqu’au 31 décembre 2026.
- Flash-Lite TTS : 0,50 $ en entrée et 6 $ en sortie.
- Prix doublés au 1er janvier 2027 : 18 $ pour l’audio de Flash TTS, 12 $ pour Flash-Lite.
- Un niveau gratuit dans AI Studio, mais vos contenus servent alors à améliorer les produits de Google, ce qui n’est pas le cas au niveau payant.
Une seconde d’audio vaut 25 tokens. Une heure de voix générée par Flash TTS coûte donc environ 0,81 $ cette année, puis 1,62 $ en 2027, comme le calcule eesel AI.
Pourquoi le clonage s’arrête à la frontière
Google l’écrit en une phrase : la reproduction de voix dans AI Studio n’est pas disponible dans l’Illinois, au Texas, dans l’Espace économique européen, au Royaume-Uni, en Suisse et en Inde. L’entreprise ne donne pas de raison. Plusieurs de ces territoires encadrent strictement les données biométriques : l’Illinois et le Texas ont chacun une loi dédiée, le RGPD classe ces données parmi les catégories particulières, et la loi suisse sur la protection des données (nLPD) les range parmi les données sensibles. Or une voix clonée repose sur l’empreinte vocale d’une personne.
Concrètement, depuis Genève, Lyon ou Bruxelles, vous pouvez utiliser les voix du catalogue, en créer une sur description et diriger vos textes. Vous ne pouvez pas faire lire vos vidéos par votre propre voix clonée via AI Studio.
Ce que ça change pour vous
Pour une PME ou un indépendant, la voix de synthèse devient un outil de production courant, au même titre que la génération d’images. Quelques usages immédiats :
- Des voix off pour vos vidéos produit, tutoriels ou publicités, sans studio ni comédien pour chaque version.
- La version audio de vos contenus : articles, newsletters, modules de formation à écouter en déplacement.
- Plusieurs langues à partir d’un même script, utile pour une entreprise suisse qui s’adresse aux Romands et aux Alémaniques.
- Un agent vocal pour l’accueil téléphonique, avec Flash-Lite pour les gros volumes.
Trois précautions. Créez une voix de marque sur description plutôt que de chercher à contourner la restriction régionale. Ne reproduisez jamais la voix de quelqu’un sans son accord écrit, même là où la fonction existe. Et signalez l’audio généré quand il pourrait passer pour une vraie personne : c’est ce qu’exige l’article 50 de l’AI Act, détaillé dans notre guide pour créer du contenu avec l’IA.
Ces modèles vocaux complètent Gemini 3.8 Flash, lancé début septembre : Google décline désormais la même génération pour le texte et pour la voix.
Peut-on cloner sa voix avec Gemini depuis la Suisse ?
Non, pas dans AI Studio pour l’instant : Google exclut la Suisse, l’Espace économique européen et le Royaume-Uni de cette fonction. Les voix du catalogue et la création de voix sur description restent accessibles.
Faut-il indiquer qu’une voix off est générée par IA ?
Dans l’Union européenne, oui dès qu’elle pourrait passer pour une personne réelle. Une voix clairement présentée comme celle d’un assistant ou d’un narrateur de synthèse pose moins de difficulté, mais le signaler reste la pratique la plus sûre.
Écrire un bon script, choisir une voix cohérente avec sa marque et respecter les règles de transparence s’apprend vite quand on pratique sur ses propres contenus. Les formations IA de Vincent Lévi couvrent la création de contenus texte, image, vidéo et audio avec les outils du moment. Pour une session adaptée à votre équipe, contactez l’équipe.



