Directeur du Machine Learning Insights [Partie 3 : Édition Finance]
Hugging Face publie la troisième partie de sa série « Director of Machine Learning Insights ».
Hugging Face publie la troisième partie de sa série « Director of Machine Learning Insights ».
Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.
Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.
Le cours de Deep Reinforcement Learning de Hugging Face consacre sa troisième unité à Deep Q-Learning.
Graphcore et Hugging Face élargissent Hugging Face Optimum avec 10 modèles Transformer prêts pour l'IPU.
Hugging Face Hub met en ligne les pull requests et les discussions dans l'onglet Community.
Motif de la recommandation :L'original détaille le mécanisme des PR sans fork et la refonte de l'onglet Community, ce qui aide à juger l'impact sur les flux de collaboration existants.
Hugging Face publie la deuxième partie de son cours sur le Deep Reinforcement Learning consacrée au Q-Learning.
Le groupe de recherche multimodal de Hugging Face a formalisé une charte éthique pour son projet multimodal.
Sempre Health a déployé un pipeline NLP qui traite automatiquement près de 20 % des messages entrants.
Hugging Face publie la première partie de l'unité 2 de son cours gratuit de Deep Reinforcement Learning consacrée au Q-Learning. Ce chapitre couvre les méthodes basées sur la valeur.
Hugging Face lance le Fellowship Program, un réseau de contributeurs exceptionnels de tous horizons œuvrant pour l'écosystème open source du Machine Learning. Les Fellows.
Hugging Face annonce Gradio 3.0, une refonte complète de la bibliothèque de démos ML.
Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Hugging Face ouvre les candidatures à son premier Student Ambassador Program.
Hugging Face publie la deuxième partie de sa série d'entretiens avec des directeurs Machine Learning.
Hugging Face ajoute le support de l'inférence et des pipelines Transformers à Optimum avec la version 1.2.
Hugging Face annonce une levée de 100 millions de dollars en série C menée par Lux Capital.
Motif de la recommandation :Hugging Face détaille les montants, les investisseurs et l'usage de la plateforme, ce qui éclaire le financement de l'écosystème open source.
Hugging Face annonce l'intégration de fastai au Hugging Face Hub.
Hugging Face publie le premier chapitre de son cours gratuit Deep Reinforcement Learning.
Hugging Face montre comment entraîner de grands modèles via Accelerate en exploitant PyTorch FullyShardedDataParallel (FSDP).
HuggingFace AutoTrain et Kili permettent de construire un pipeline d'active learning pour la classification de texte.
Hugging Face publie une série d'articles donnant la parole à des Directeurs du Machine Learning sur l'impact du ML dans des secteurs allant de la santé à la finance.
Hugging Face et Habana Labs ont publié un guide pratique pour fine-tuner des modèles Transformers sur les accélérateurs Habana Gaudi via des instances Amazon EC2 DL1. Le tutoriel détaille le lancement d'une instance dl1.24xlarge équipée de 8 processeurs Gaudi, l'utilisation de l'AMI Habana Deep Learning et du conteneur PyTorch, puis le fine-tuning de bert-large-uncased-whole-word-masking sur la tâche MRPC du benchmark GLUE avec Optimum Habana. Le job atteint un score F1 de 0.8968 en 2 minutes et 12 secondes, pour un coût de $3.93 par heure en Spot Instance contre $13.11 en tarif standard, soit 70% d'économie.
Hugging Face montre comment automatiser le filtrage des messages clients mécontents en modélisant le problème comme une classification de texte à 5 classes (very unsatisfied à very satisfied). Le dataset Amazon reviews multi est retenu pour ses labels de sentiment de 1 à 5 étoiles, jugé plus adapté que GLUE, Amazon polarity ou Tweet eval. L'approche vise à répondre à 100 % des messages des clients les plus insatisfaits, supposés minoritaires parmi l'ensemble des retours.
Hugging Face annonce Hugging Face for Education, un ensemble de ressources gratuites pour démocratiser le machine learning.
Hugging Face ajoute à sa bibliothèque huggingface_hub un paramètre emissions_threshold permettant de filtrer les modèles du Hub selon les émissions de CO2 générées lors de leur entraînement. L'intégration de codecarbon dans transformers enregistre automatiquement ces émissions via CodeCarbonCallback et les consigne dans un fichier emissions.csv, que l'utilisateur peut reporter dans la fiche du modèle. Une recherche avec un seuil maximal de 100 grammes renvoie 191 modèles, tandis qu'un seuil minimal de 500 grammes n'en retourne que 10.
Habana Labs et Hugging Face annoncent un partenariat intégrant la suite logicielle SynapseAI de Habana à la bibliothèque open source Optimum de Hugging Face.
Hugging Face explique que sa bibliothèque Transformers applique volontairement une « single model file policy » plutôt que le principe DRY.
Hugging Face annonce l'intégration du Decision Transformer, une méthode d'apprentissage par renforcement hors ligne.
Margaret Mitchell, fondatrice et co-responsable du groupe Ethical AI de Google, a rejoint Hugging Face après quatre ans chez Google pour y créer des protocoles de recherche en IA éthique.
Hugging Face lance le AI Research Residency Program, un programme de 9 mois à temps plein destiné à lancer ou accélérer une carrière en recherche en machine learning.
Ce guide montre comment fine-tuner SegFormer, un modèle de segmentation sémantique SOTA introduit par Xie et al. en 2021.
Hugging Face et AWS proposent un tutoriel de bout en bout pour accélérer l'inférence de BERT en texte avec Transformers.
Hugging Face montre comment construire une application de recherche d'images en combinant la bibliothèque datasets.
BERT (Bidirectional Encoder Representations from Transformers), développé en 2018 par Google AI Language.
Hugging Face détaille le fine-tuning du Vision Transformer (ViT) pour la classification d'images via les bibliothèques 🤗 datasets et transformers. Le tutoriel s'appuie sur le modèle google/vit-base-patch16-224-in21k et le jeu de données beans (3 classes : angular_leaf_spot, bean_rust, healthy), en utilisant ViTImageProcessor pour redimensionner les images en 224×224 et les normaliser avec mean/std de 0,5. L'installation se fait via `pip install datasets transformers`.
Hugging Face publie un guide de démarrage de l'analyse de sentiment en Python.
Hugging Face explique comment utiliser les spécificités de l'architecture CTC pour obtenir une reconnaissance vocale de bonne qualité sur des fichiers arbitrairement longs ou en inférence en direct avec Wav2Vec2. Le pipeline Transformers plante par manque de mémoire sur un fichier d'une heure, mais l'ajout de chunk_length_s=10 permet de traiter le fichier. La technique du chunking avec stride, qui exploite la correspondance CTC entre trames audio et prédictions de lettres, découpe l'audio en segments chevauchants, supprime les logits des bords et enchaîne les résultats pour se rapprocher de l'inférence sur le fichier complet. Elle fonctionne aussi sans modification sur les modèles Wav2Vec2 augmentés d'un LM, et peut être adaptée à l'inférence en direct en alimentant le pipeline au fil de l'arrivée des données.
Motif de la recommandation :L'article détaille le chunking avec stride pour Wav2Vec2, une méthode directement réutilisable pour l'ASR sur fichiers longs et en direct.
La bibliothèque huggingface_hub introduit les classes ModelSearchArguments.
Hugging Face a publié une étude de cas montrant que son conteneur Infinity, optimisé pour les processeurs Intel Xeon Ice Lake de 3e génération sur les instances Amazon EC2 C6i.
🤗 Transformers intègre désormais pyctcdecode de Kensho Technologies.
Hugging Face explique comment déployer GPT-J 6B, le modèle open source de 6 milliards de paramètres d'EleutherAI.