Aller au contenu

Orientations techniques

Voix et audio Dernières actualités

Les avancées de la voix et de l'audio : modèles et produits de synthèse vocale, de dialogue en temps réel, de génération musicale et de compréhension audio.

31 sélections30 derniers jours 5 entréesTotal : 53 entrées

mise à jour

Archives de la sélection · page 2

14 janviermer.21–31 entrées
5 janvierlun.
13 décembresam.
  1. Google DeepMind78

    Google DeepMind publie Gemini 2.5 Flash Native Audio mis à jour

    Google DeepMind publie une mise à jour de Gemini 2.5 Flash Native Audio destinée aux agents vocaux en direct.

    Motif de la recommandation :L'original expose les améliorations de l'appel de fonctions, du suivi d'instructions et du dialogue multi-tours, ainsi que les points d'accès ouverts, ce qui permet de juger de l'impact sur les agents vocaux.

19 novembremer.
  1. Google Research78

    Google Research présente un modèle de traduction vocale de bout en bout en temps réel avec 2 secondes de délai

    Google Research décrit un modèle de traduction parole-à-parole de bout en bout qui génère directement l'audio traduit dans la voix de l'orateur d'origine avec seulement 2 secondes de délai.

    Motif de la recommandation :L'article expose l'architecture de bout en bout et le pipeline de données qui ramènent la traduction vocale à 2 secondes de délai, avec un déploiement produit concret.

17 juilletjeu.
15 juilletmar.
27 févriermar.
20 décembremer.
  1. Hugging Face Blog60

    Décodage spéculatif pour une inférence Whisper 2x plus rapide

    Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.

    Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.

8 févriermer.
  1. Hugging Face Blog62

    SpeechT5 est désormais disponible dans Transformers

    Hugging Face annonce l'intégration du modèle SpeechT5 de Microsoft Research Asia dans la bibliothèque open source Transformers. Ce modèle unique gère la synthèse vocale.

    Motif de la recommandation :Le billet détaille l'intégration de SpeechT5 dans Transformers et fournit des exemples de code pour la synthèse vocale, la conversion de voix et la reconnaissance automatique de la parole.

3 novembrejeu.
1 févriermar.
  1. Hugging Face Blog62

    Faire fonctionner la reconnaissance vocale sur de grands fichiers avec Wav2Vec2 dans Transformers

    Hugging Face explique comment utiliser les spécificités de l'architecture CTC pour obtenir une reconnaissance vocale de bonne qualité sur des fichiers arbitrairement longs ou en inférence en direct avec Wav2Vec2. Le pipeline Transformers plante par manque de mémoire sur un fichier d'une heure, mais l'ajout de chunk_length_s=10 permet de traiter le fichier. La technique du chunking avec stride, qui exploite la correspondance CTC entre trames audio et prédictions de lettres, découpe l'audio en segments chevauchants, supprime les logits des bords et enchaîne les résultats pour se rapprocher de l'inférence sur le fichier complet. Elle fonctionne aussi sans modification sur les modèles Wav2Vec2 augmentés d'un LM, et peut être adaptée à l'inférence en direct en alimentant le pipeline au fil de l'arrivée des données.

    Motif de la recommandation :L'article détaille le chunking avec stride pour Wav2Vec2, une méthode directement réutilisable pour l'ASR sur fichiers longs et en direct.