Motif de la recommandation :L'original détaille les capacités visuelles temps réel, l'exécution asynchrone d'outils et la prise en charge de 97 langues, ce qui aide à évaluer l'usage en entreprise.
Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale générative disponibles dans Google AI Studio.
Motif de la recommandation :Google DeepMind détaille les capacités vocales et les garde-fous des deux modèles TTS, utile pour évaluer les usages en doublage et agents vocaux.
Ringg résout jusqu'à 65 % des appels clients avec des agents IA propulsés par GPT-5.6, déployés sur la voix, le chat, WhatsApp et le web. Le coût est réduit de 90 % par rapport à GPT-4.1.
Motif de la recommandation :Les deux modèles de dialogue en temps réel de Google DeepMind sont présentés avec leurs scores sur plusieurs benchmarks vocaux et agentiques, ce qui permet de situer leurs capacités et leur positionnement prix.
Motif de la recommandation :L'original présente les capacités vocales et le support téléphonique de GPT-Live-1, ce qui permet de juger des scénarios de voix en temps réel dans l'API.
OpenAI lance OpenAI Presence, une plateforme d'agents IA d'entreprise éprouvée qui permet aux organisations de déployer des agents vocaux et de chat fiables pour les workflows clients et internes.
Cars24 s'appuie sur les agents vocaux et de chat propulsés par OpenAI pour traiter plus de 1M de minutes de conversation par mois et récupérer 12 % des leads perdus. Le spécialiste indien de la voiture d'occasion déploie ces workflows agentiques auprès de ses équipes à travers l'entreprise.
OpenAI présente GPT-Live, une nouvelle génération de modèles vocaux destinés à l'interaction naturelle entre l'humain et l'IA, désormais utilisés par ChatGPT Voice.
Motif de la recommandation :L'original présente les nouvelles capacités des modèles vocaux en temps réel dans l'API OpenAI, ce qui permet de juger de leur impact sur les applications vocales existantes.
Uber s'appuie sur OpenAI pour alimenter des assistants IA et des fonctionnalités vocales destinés à aider les conducteurs à mieux gagner et les passagers à réserver plus rapidement sur une place de marché mondiale en temps réel.
Descript s'appuie sur les modèles de raisonnement d'OpenAI pour automatiser la localisation de vastes bibliothèques de contenus sans perdre le timing ni le sens. L'ingénierie décrite permet un doublage multilingue à grande échelle des vidéos.
Motif de la recommandation :L'original présente les capacités de génération vidéo et audio de Sora 2, permettant de situer les changements par rapport à la version précédente.
Motif de la recommandation :OpenAI publie un modèle vocal speech-to-speech plus avancé et étend la Realtime API au support MCP, à l'entrée d'images et à la téléphonie SIP.
OpenAI annonce le lancement d'une nouvelle génération de modèles audio dans l'API. Les développeurs peuvent pour la première fois demander au modèle de synthèse vocale de parler d'une manière spécifique, par exemple « parler comme un agent de service client compatissant », ce qui ouvre de nouvelles possibilités de personnalisation pour les agents vocaux.
Motif de la recommandation :L'original indique que le modèle TTS de l'API accepte des instructions de style en langage naturel, ce qui permet aux développeurs de contrôler le ton de la voix.
OpenAI lance o1, ainsi que des améliorations de la Realtime API, une nouvelle méthode de fine-tuning et d'autres nouveautés destinées aux développeurs.
Motif de la recommandation :L'API Realtime d'OpenAI permet aux développeurs d'intégrer des expériences vocales de bout en bout dans leurs applications.
OpenAI détaille le fonctionnement de Voice Engine, son modèle de synthèse vocale, et les recherches de sécurité associées. Le contenu explore la technologie sous-jacente à ce modèle text-to-speech.
OpenAI lance l'application ChatGPT pour iOS, qui synchronise les conversations, prend en charge la saisie vocale et intègre les dernières améliorations du modèle.
OpenAI annonce avoir entraîné et publié en open source un réseau de neurones nommé Whisper, dont la robustesse et la précision en reconnaissance de la parole en anglais s'approchent du niveau humain.
Motif de la recommandation :Un modèle de reconnaissance vocale open source qui atteint une robustesse et une précision proches du niveau humain en anglais.