Google DeepMind dévoile Gemini 3.1 Flash TTS avec balises audio
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
Google DeepMind annonce Gemini 3.1 Flash TTS, un nouveau modèle de synthèse vocale offrant un contrôle granulaire via des balises audio en langage naturel. Le modèle atteint un score Elo de 1 211 sur le classement TTS d'Artificial Analysis, prend en charge plus de 70 langues et le dialogue multi-locuteurs natif. Il est déployé en preview pour les développeurs via l'API Gemini et Google AI Studio, pour les entreprises sur Vertex AI, et pour les utilisateurs Workspace via Google Vids. Tous les audios générés sont marqués par SynthID.
Le nouveau modèle de synthèse vocale introduit des balises audio en langage naturel et un support de plus de 70 langues, avec un déploiement en preview via l'API Gemini et Vertex AI.
Source :Google DeepMind · deepmind.google