Aller au contenu
  1. Google DeepMind78

    Google DeepMind lance Gemini 3.8 Flash TTS et Flash-Lite TTS

    Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale générative disponibles dans Google AI Studio.

    Motif de la recommandation :Google DeepMind détaille les capacités vocales et les garde-fous des deux modèles TTS, utile pour évaluer les usages en doublage et agents vocaux.

  1. Google DeepMind88

    Google DeepMind lance Gemini 3.8 Live et 3.8 Live Extended Thinking

    Google DeepMind lance Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking.

    Motif de la recommandation :Les deux modèles de dialogue en temps réel de Google DeepMind sont présentés avec leurs scores sur plusieurs benchmarks vocaux et agentiques, ce qui permet de situer leurs capacités et leur positionnement prix.

  1. Google DeepMind76

    Google DeepMind lance Gemini 3.5 Transcribe, son modèle de transcription vocale

    Google DeepMind présente Gemini 3.5 Transcribe, son modèle de synthèse vocale le plus précis。

    Motif de la recommandation :Le modèle de transcription vocale de Google expose les taux d'erreur, la latence et les API, ce qui permet de juger son intégration dans les flux vocaux existants.

  1. OpenAI News82

    OpenAI publie Sora 2, un modèle de génération vidéo et audio

    OpenAI publie Sora 2, un nouveau modèle de génération vidéo et audio. Selon OpenAI。

    Motif de la recommandation :L'original présente les capacités de génération vidéo et audio de Sora 2, permettant de situer les changements par rapport à la version précédente.

  1. OpenAI News78

    OpenAI publie gpt-realtime et met à jour la Realtime API

    OpenAI publie gpt-realtime, un modèle speech-to-speech plus avancé, accompagné de nouvelles capacités de la Realtime API 。

    Motif de la recommandation :OpenAI publie un modèle vocal speech-to-speech plus avancé et étend la Realtime API au support MCP, à l'entrée d'images et à la téléphonie SIP.

  1. OpenAI News85

    OpenAI présente Whisper, un modèle de reconnaissance vocale open source

    OpenAI annonce avoir entraîné et publié en open source un réseau de neurones nommé Whisper, dont la robustesse et la précision en reconnaissance de la parole en anglais s'approchent du niveau humain.

    Motif de la recommandation :Un modèle de reconnaissance vocale open source qui atteint une robustesse et une précision proches du niveau humain en anglais.

Fin de la liste