Google a annoncé Gemini 3.5 Transcribe , son nouveau modèle de transcription vocale qui ambitionne de révolutionner les systèmes de reconnaissance vocale traditionnels. Il ne s'agit pas simplement de convertir l'audio en texte : le modèle nettoie automatiquement la parole , en éliminant les hésitations, les corrections automatiques et les mots de remplissage comme « euh » et « ah », et met en forme le résultat pour une lecture facile, sans intervention de l'utilisateur. Ce modèle est déjà disponible pour les développeurs via l'API Google AI Studio et la plateforme Gemini Enterprise Agent, mais il arrive également directement sur certaines interfaces grand public que beaucoup d'entre nous utilisons quotidiennement. Côté performances, Google cite des données mesurées par Artificial Analysis : un taux d’erreur moyen de 4 % pour le streaming et de 2,6 % pour l’audio préenregistré. Par rapport au modèle Chirp 3 précédent, le temps de transcription est réduit de 70 % , une amélioration significative pour les utilisateurs de la dictée en temps réel.Parmi les fonctionnalités les plus utiles figurent la reconnaissance automatique de plus de 85 langues avec gestion des accents régionaux, l'identification de plusieurs locuteurs dans des enregistrements préexistants (jusqu'à trois, avec une prise en charge expérimentale d'un nombre plus élevé), et la possibilité de fournir au modèle un vocabulaire personnalisé pour les termes techniques ou les noms propres particuliers. Il prend également en charge la transcription d'entités alphanumériques telles que les codes postaux et les numéros de commande, que les systèmes traditionnels saisissent souvent mal. Il existe également un mode d'appel de fonction : le modèle peut déléguer des tâches complexes à d'autres modèles Gemini, comme la génération d'images ou l'analyse de fichiers, actuellement disponibles dans l'application Gemini pour macOS.
Sur Android, grâce à la fonctionnalité Rambler de Gboard , le modèle transforme la parole en texte formaté et clair, en éliminant les mots superflus. Ce service est déjà disponible dans certains pays et certaines langues. Nous en avons également parlé dans un article dédié : Rambler sur Gboard et la dictée IA du Pixel 11 . Sur macOS, dans l'application Gemini , le modèle ne se contente pas de transcrire : il permet d'utiliser des commandes vocales pour résumer des fichiers locaux, déplacer du texte entre applications ou générer des images en exploitant le contexte de l'écran. Sur Google Antigravity , la plateforme d'agent IA de Google, le modèle utilise l'historique des conversations et le contexte des documents ouverts pour améliorer la précision de la transcription. Bientôt disponible sur Chrome : Google a annoncé qu’il sera bientôt possible de dicter du texte dans n’importe quel champ web du navigateur, des réponses aux e-mails aux messages des chatbots. Aucune date de déploiement précise n’a encore été communiquée.
Envoyer une nouvelle à un ami