Aller au contenu
Hugging Face Blog·· 2022-02-01sélectionAI Score62

Faire fonctionner la reconnaissance vocale sur de grands fichiers avec Wav2Vec2 dans Transformers

Making automatic speech recognition work on large files with Wav2Vec2 in 🤗 Transformers

AI Introduction

Hugging Face explique comment utiliser les spécificités de l'architecture CTC pour obtenir une reconnaissance vocale de bonne qualité sur des fichiers arbitrairement longs ou en inférence en direct avec Wav2Vec2. Le pipeline Transformers plante par manque de mémoire sur un fichier d'une heure, mais l'ajout de chunk_length_s=10 permet de traiter le fichier. La technique du chunking avec stride, qui exploite la correspondance CTC entre trames audio et prédictions de lettres, découpe l'audio en segments chevauchants, supprime les logits des bords et enchaîne les résultats pour se rapprocher de l'inférence sur le fichier complet. Elle fonctionne aussi sans modification sur les modèles Wav2Vec2 augmentés d'un LM, et peut être adaptée à l'inférence en direct en alimentant le pipeline au fil de l'arrivée des données.

Raison de la recommandation

L'article détaille le chunking avec stride pour Wav2Vec2, une méthode directement réutilisable pour l'ASR sur fichiers longs et en direct.

Source :Hugging Face Blog · huggingface.co