Aller au contenu
  1. Google DeepMind74

    Google DeepMind lance Gemini 3.8 Live avec Live Avatar

    Google DeepMind lance Gemini 3.8 Live with Live Avatar.

    Motif de la recommandation :L'original détaille les capacités visuelles temps réel, l'exécution asynchrone d'outils et la prise en charge de 97 langues, ce qui aide à évaluer l'usage en entreprise.

  1. Google DeepMind78

    Google DeepMind lance Gemini 3.8 Flash TTS et Flash-Lite TTS

    Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale générative disponibles dans Google AI Studio.

    Motif de la recommandation :Google DeepMind détaille les capacités vocales et les garde-fous des deux modèles TTS, utile pour évaluer les usages en doublage et agents vocaux.

  1. Google DeepMind88

    Google DeepMind lance Gemini 3.8 Live et 3.8 Live Extended Thinking

    Google DeepMind lance Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking.

    Motif de la recommandation :Les deux modèles de dialogue en temps réel de Google DeepMind sont présentés avec leurs scores sur plusieurs benchmarks vocaux et agentiques, ce qui permet de situer leurs capacités et leur positionnement prix.

  1. Google DeepMind76

    Google DeepMind lance Gemini 3.5 Transcribe, son modèle de transcription vocale

    Google DeepMind présente Gemini 3.5 Transcribe, son modèle de synthèse vocale le plus précis。

    Motif de la recommandation :Le modèle de transcription vocale de Google expose les taux d'erreur, la latence et les API, ce qui permet de juger son intégration dans les flux vocaux existants.

  1. Hugging Face Blog65

    Hugging Face mesure l'optimisation aux benchmarks en reconnaissance vocale

    Hugging Face publie une recherche qui introduit trois tests pour quantifier l'optimisation aux benchmarks en reconnaissance vocale。

    Motif de la recommandation :Trois sondes quantifient l'optimisation aux benchmarks en ASR et montrent que les meilleurs scores WER ne garantissent pas la fidélité au signal audio.

  1. OpenAI News65

    OpenAI lance de nouveaux modèles vocaux en temps réel dans l'API

    OpenAI a publié de nouveaux modèles vocaux en temps réel dans l'API, capables de raisonner。

    Motif de la recommandation :L'original présente les nouvelles capacités des modèles vocaux en temps réel dans l'API OpenAI, ce qui permet de juger de leur impact sur les applications vocales existantes.

  1. Mistral AI76

    Mistral AI lance Voxtral TTS, modèle vocal 4B en 9 langues

    Mistral AI publie Voxtral TTS, son premier modèle de synthèse vocale, léger avec 4B de paramètres et disponible via API à 0。

    Motif de la recommandation :Mistral publie son premier modèle TTS avec architecture, latence et tarification détaillées, utile pour évaluer les briques vocales d'un agent.

  1. Mistral AI78

    Mistral AI publie Voxtral Transcribe 2, avec Voxtral Realtime en open weights

    Mistral AI publie Voxtral Transcribe 2, une famille de deux modèles de transcription vocale 。

    Motif de la recommandation :Deux modèles de transcription vocale sont publiés, dont un en open weights sous Apache 2.0, avec des chiffres de latence et de prix permettant de comparer les options existantes.

  1. OpenAI News82

    OpenAI publie Sora 2, un modèle de génération vidéo et audio

    OpenAI publie Sora 2, un nouveau modèle de génération vidéo et audio. Selon OpenAI。

    Motif de la recommandation :L'original présente les capacités de génération vidéo et audio de Sora 2, permettant de situer les changements par rapport à la version précédente.

  1. OpenAI News78

    OpenAI publie gpt-realtime et met à jour la Realtime API

    OpenAI publie gpt-realtime, un modèle speech-to-speech plus avancé, accompagné de nouvelles capacités de la Realtime API 。

    Motif de la recommandation :OpenAI publie un modèle vocal speech-to-speech plus avancé et étend la Realtime API au support MCP, à l'entrée d'images et à la téléphonie SIP.

  1. OpenAI News62

    OpenAI lance une nouvelle génération de modèles audio dans l'API

    OpenAI annonce le lancement d'une nouvelle génération de modèles audio dans l'API. Les développeurs peuvent pour la première fois demander au modèle de synthèse vocale de parler d'une manière spécifique, par exemple « parler comme un agent de service client compatissant », ce qui ouvre de nouvelles possibilités de personnalisation pour les agents vocaux.

    Motif de la recommandation :L'original indique que le modèle TTS de l'API accepte des instructions de style en langage naturel, ce qui permet aux développeurs de contrôler le ton de la voix.

  1. OpenAI News80

    OpenAI lance l'API Realtime pour des expériences vocales de bout en bout

    OpenAI annonce le lancement de l'API Realtime, permettant aux développeurs d'intégrer des expériences vocales de bout en bout dans leurs applications.

    Motif de la recommandation :L'API Realtime d'OpenAI permet aux développeurs d'intégrer des expériences vocales de bout en bout dans leurs applications.

  1. OpenAI News78

    OpenAI lance l'application ChatGPT pour iOS

    OpenAI lance l'application ChatGPT pour iOS, qui synchronise les conversations, prend en charge la saisie vocale et intègre les dernières améliorations du modèle.

  1. OpenAI News85

    OpenAI présente Whisper, un modèle de reconnaissance vocale open source

    OpenAI annonce avoir entraîné et publié en open source un réseau de neurones nommé Whisper, dont la robustesse et la précision en reconnaissance de la parole en anglais s'approchent du niveau humain.

    Motif de la recommandation :Un modèle de reconnaissance vocale open source qui atteint une robustesse et une précision proches du niveau humain en anglais.

Fin de la liste