Les avancées de la voix et de l'audio : modèles et produits de synthèse vocale, de dialogue en temps réel, de génération musicale et de compréhension audio.
31 sélections30 derniers jours 5 entréesTotal : 53 entrées
Motif de la recommandation :L'original détaille les nouvelles capacités d'imagerie médicale 3D et les benchmarks de MedGemma 1.5 4B, ainsi que le modèle vocal MedASR, ce qui permet de situer les progrès sur l'imagerie médicale de haute dimension.
Motif de la recommandation :Un guide pas à pas pour assembler un assistant de bureau avec DGX Spark et Reachy Mini, utile à ceux qui veulent reproduire un agent multimodal local.
Motif de la recommandation :L'original expose les améliorations de l'appel de fonctions, du suivi d'instructions et du dialogue multi-tours, ainsi que les points d'accès ouverts, ce qui permet de juger de l'impact sur les agents vocaux.
Google Research décrit un modèle de traduction parole-à-parole de bout en bout qui génère directement l'audio traduit dans la voix de l'orateur d'origine avec seulement 2 secondes de délai.
Motif de la recommandation :L'article expose l'architecture de bout en bout et le pipeline de données qui ramènent la traduction vocale à 2 secondes de délai, avec un déploiement produit concret.
Motif de la recommandation :Mistral détaille les nouvelles capacités de Le Chat, du mode Deep Research à l'édition d'images, ce qui aide à situer l'offre face aux assistants concurrents.
Motif de la recommandation :Mistral ouvre deux tailles de modèles vocaux sous Apache 2.0, avec des chiffres de prix et de contexte qui permettent de comparer aux API fermées.
Hugging Face annonce TTS Arena, un outil inspiré de Chatbot Arena qui permet de comparer côte à côte des modèles de synthèse vocale en soumettant un texte.
Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.
Hugging Face annonce l'intégration du modèle SpeechT5 de Microsoft Research Asia dans la bibliothèque open source Transformers. Ce modèle unique gère la synthèse vocale.
Motif de la recommandation :Le billet détaille l'intégration de SpeechT5 dans Transformers et fournit des exemples de code pour la synthèse vocale, la conversion de voix et la reconnaissance automatique de la parole.
Hugging Face explique comment utiliser les spécificités de l'architecture CTC pour obtenir une reconnaissance vocale de bonne qualité sur des fichiers arbitrairement longs ou en inférence en direct avec Wav2Vec2. Le pipeline Transformers plante par manque de mémoire sur un fichier d'une heure, mais l'ajout de chunk_length_s=10 permet de traiter le fichier. La technique du chunking avec stride, qui exploite la correspondance CTC entre trames audio et prédictions de lettres, découpe l'audio en segments chevauchants, supprime les logits des bords et enchaîne les résultats pour se rapprocher de l'inférence sur le fichier complet. Elle fonctionne aussi sans modification sur les modèles Wav2Vec2 augmentés d'un LM, et peut être adaptée à l'inférence en direct en alimentant le pipeline au fil de l'arrivée des données.
Motif de la recommandation :L'article détaille le chunking avec stride pour Wav2Vec2, une méthode directement réutilisable pour l'ASR sur fichiers longs et en direct.