Google vient de lancer deux nouveaux modèles de synthèse vocale basés sur Gemini , et le progrès par rapport aux versions précédentes est à la fois considérable et quelque peu inquiétant. Avec Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS , n'importe qui peut créer une voix entièrement nouvelle en décrivant par écrit le rendu souhaité, ou reproduire une voix existante à partir de seulement 30 secondes d'enregistrement audio de référence. Le résultat ressemble beaucoup à un studio d'enregistrement vocal virtuel , accessible via une API ou directement depuis Gemini Notebook . Et les premiers résultats sont éloquents : le modèle Flash TTS arrive en tête de l'indice de qualité global de Hume AI , suivi de près par Flash-Lite en deuxième position. Un doublé qui est à la fois un gage de qualité et un signal d'alarme.Le plus intéressant n'est pas la qualité audio en elle-même, mais le niveau de contrôle offert par ces modèles. Avec Gemini 3.8 Flash TTS, vous pouvez diriger chaque réplique comme un réalisateur : préciser le rythme , l’émotion , l’accent , et même ajouter des sons non verbaux comme des rires , des soupirs ou des interjections (comme « euh » ou « ouais ») grâce à des balises spéciales dans le texte. En clair, vous écrivez un script et le modèle l’ interprète , au lieu de simplement le lire. La prise en charge native des voix doubles est également disponible : vous pouvez écrire des dialogues entre deux personnages, et le modèle gère les tours de parole de manière naturelle, en préservant la distinction entre les deux voix. Utile pour les podcasts, les livres audio ou toute production audio narrative. Le modèle Flash-Lite, quant à lui, est conçu pour ceux qui ont besoin de volumes importants à moindre coût : doublage à grande échelle, agents vocaux, localisation de contenu multimédia. Il offre moins de flexibilité créative, mais est optimisé pour la production sans faire exploser les coûts.
La bibliothèque initiale contient plus de 2 000 entrées prêtes à l'emploi , avec une couverture linguistique incluant des variétés régionales telles que l'espagnol mexicain, le français québécois et l'anglais écossais. Mais son véritable atout réside dans sa capacité à créer des voix originales à partir de zéro grâce à des instructions en langage naturel : vous voulez un DJ à l’énergie explosive avec un accent australien ? Un robot monotone et métallique ? Un dragon japonais ? Il suffit de le décrire. La réplication vocale fonctionne à partir d'un échantillon audio de 30 secondes, mais Google a mis en place un système de vérification du consentement : avant toute réplication, le propriétaire doit enregistrer un message de consentement explicite . Chaque fichier audio généré est ensuite marqué avec SynthID , le filigrane invisible de Google qui permet d'identifier les contenus générés par l'IA même après modification, afin de lutter contre la désinformation. Une fonction de remixage vocal sera également disponible : vous pourrez partir d'une voix existante et modifier son timbre, son ton, son rythme et son accent via des instructions, avec des exemples comme « ajouter un léger accent du Sud » ou « adoucir l'intonation ».
Gemini 3.8 Flash TTS est disponible dès aujourd'hui pour les développeurs via l'API Gemini et Google AI Studio , qui propose un environnement de conception vocale complet : création, test et importation de voix dans un éditeur de script avec contrôle ligne par ligne. Pour les entreprises, il sera bientôt disponible sur Gemini Enterprise . Le modèle est déjà intégré à Gemini Notebook pour tous les utilisateurs. Flash-Lite suit la même voie : son API et Google AI Studio sont déjà disponibles, et Gemini Enterprise le sera prochainement. Parmi les partenaires déjà annoncés figurent Figma, HeyGen et d’autres plateformes qui l’utiliseront pour les voix off automatisées, la localisation et les agents vocaux conversationnels . Lors des tests de préférence humaine sur Voice Arena, les deux modèles se sont classés en tête pour des langues telles que le japonais, le portugais brésilien, le vietnamien, l'arabe standard, l'espagnol mexicain et l'hindi, avec une prise en charge globale de plus de 100 langues et dialectes .
Envoyer une nouvelle à un ami