OpenRAIL : vers des cadres de licence IA ouverts et responsables
Hugging Face soutient OpenRAIL, une famille de licences spécifiques à l'IA qui permettent l'accès.
Hugging Face soutient OpenRAIL, une famille de licences spécifiques à l'IA qui permettent l'accès.
Hugging Face présente comment utiliser Stable Diffusion, un modèle de diffusion latent texte-image créé par CompVis.
Motif de la recommandation :L'article détaille l'utilisation de Stable Diffusion avec la bibliothèque Diffusers, du code d'inférence de base à la construction d'un pipeline personnalisé, avec des explications sur les composants du modèle.
Hugging Face intègre LLM.int8() dans transformers et accelerate.
Motif de la recommandation :L'article détaille l'intégration de LLM.int8() dans transformers et accelerate, avec les pièges de chargement et les compromis de vitesse.
Hugging Face détaille sa philosophie d'intégration de TensorFlow dans la bibliothèque transformers.
Hugging Face lance le Private Hub (PH), une plateforme unifiée d'outils ML couvrant de la recherche à la production.
L'équipe BigScience de Hugging Face détaille l'infrastructure matérielle et logicielle utilisée pour entraîner le modèle multilingue BLOOM de 176 milliards de paramètres. L'entraînement a mobilisé 384 GPU NVIDIA A100 80GB répartis sur 48 nœuds, avec une architecture GPT-3 enrichie, un jeu de données de 350 milliards de tokens couvrant 46 langues, et une durée d'environ 3,5 mois sur le supercalculateur Jean Zay. Le framework Megatron-DeepSpeed combine le parallélisme de données ZeRO, le parallélisme tensoriel de Megatron-LM et le parallélisme de pipeline pour répartir l'entraînement, tandis que le format BF16 et des kernels CUDA fusionnés ont permis de stabiliser et d'accélérer le processus.
Hugging Face publie un guide pour débutants qui utilise Sentence Transformers (ST) comme exemple pour passer de zéro à un premier projet ML autonome. ST transforme des phrases en embeddings vectoriels et fournit la fonction util.cos_sim pour calculer la similarité cosinus (score de -1 à 1), avec le modèle msmarco-MiniLM-L-6-v3 chargé dans un Jupyter notebook. La bibliothèque compte près de 8 000 étoiles sur GitHub et plus de 3 000 projets et packages qui en dépendent, et sert à la recherche sémantique, au clustering, à la distillation de modèles ou à CLIP.
Hugging Face annonce Evaluation on the Hub, un outil propulsé par AutoTrain qui permet d'évaluer n'importe quel modèle sur n'importe quel jeu de données du Hub sans écrire une ligne de code. Les résultats sont encodés dans les métadonnées des fiches de modèles et une pull request est ouverte automatiquement, avec des classements par jeu de données et par métrique. L'équipe a déjà évalué des centaines de modèles sur plusieurs jeux de données clés et cite trois cas d'usage principaux : trouver le meilleur modèle pour une tâche, évaluer des modèles sur un nouveau jeu de données et tester un modèle sur de nombreux jeux de données liés.
Motif de la recommandation :Hugging Face ouvre l'évaluation de modèles sur le Hub sans code, avec résultats intégrés aux fiches de modèles et classements consultables.
Intel rejoint le Hardware Partner Program de Hugging Face et les deux entreprises collaborent via la bibliothèque open source Optimum pour accélérer l'entraînement.
Graphcore et Hugging Face élargissent Hugging Face Optimum avec 10 modèles Transformer prêts pour l'IPU.
Hugging Face Hub met en ligne les pull requests et les discussions dans l'onglet Community.
Motif de la recommandation :L'original détaille le mécanisme des PR sans fork et la refonte de l'onglet Community, ce qui aide à juger l'impact sur les flux de collaboration existants.
Le groupe de recherche multimodal de Hugging Face a formalisé une charte éthique pour son projet multimodal.
Hugging Face lance le Fellowship Program, un réseau de contributeurs exceptionnels de tous horizons œuvrant pour l'écosystème open source du Machine Learning. Les Fellows.
Hugging Face annonce Gradio 3.0, une refonte complète de la bibliothèque de démos ML.
Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Hugging Face ouvre les candidatures à son premier Student Ambassador Program.
Hugging Face ajoute le support de l'inférence et des pipelines Transformers à Optimum avec la version 1.2.
Hugging Face annonce une levée de 100 millions de dollars en série C menée par Lux Capital.
Motif de la recommandation :Hugging Face détaille les montants, les investisseurs et l'usage de la plateforme, ce qui éclaire le financement de l'écosystème open source.
Hugging Face annonce l'intégration de fastai au Hugging Face Hub.
Hugging Face annonce Hugging Face for Education, un ensemble de ressources gratuites pour démocratiser le machine learning.
Hugging Face explique que sa bibliothèque Transformers applique volontairement une « single model file policy » plutôt que le principe DRY.
Hugging Face annonce l'intégration du Decision Transformer, une méthode d'apprentissage par renforcement hors ligne.
Hugging Face lance le AI Research Residency Program, un programme de 9 mois à temps plein destiné à lancer ou accélérer une carrière en recherche en machine learning.
BERT (Bidirectional Encoder Representations from Transformers), développé en 2018 par Google AI Language.
La bibliothèque huggingface_hub introduit les classes ModelSearchArguments.
Hugging Face explique comment combiner AutoNLP et Prodigy pour construire un pipeline d'apprentissage actif. AutoNLP.
Hugging Face annonce l'acquisition de Gradio, la bibliothèque open source de démonstration de modèles de machine learning. L'un des fondateurs de Gradio.
Motif de la recommandation :L'annonce de l'acquisition de Gradio par Hugging Face et le rappel des 300 000 démos construites permettent de situer l'évolution de l'outillage de démonstration ML.
Hugging Face a ajouté Perceiver IO à sa bibliothèque Transformers, un modèle Transformer capable de traiter texte.
Motif de la recommandation :Présente l'implémentation de Perceiver IO dans Transformers et détaille le traitement de texte, image, flux optique et autoencodage multimodal.
Hugging Face a mis en ligne le Data Measurements Tool (DMT).
Microsoft et NVIDIA ont présenté Megatron-Turing NLG 530B.
Hugging Face publie le 15 novembre la partie 2 de son cours, consacrée aux tâches NLP courantes (classification de tokens.
Le rapport State of AI 2021 et l'enquête Kaggle ML & Data Science confirment que l'architecture Transformer s'impose comme architecture générale du Machine Learning.
Hugging Face intègre Gradio au Hub pour permettre de démontrer un modèle en quelques lignes de code via l'Inference API.
Hugging Face intègre spaCy au Hub, permettant de téléverser et partager des pipelines spaCy en une seule commande.
Hugging Face annonce l'intégration de Sentence Transformers au Hub avec la sortie de la v2.
Gradio 2.0 permet de charger et d'utiliser presque n'importe quel modèle Hugging Face avec une interface graphique en une seule ligne de code.
Motif de la recommandation :Gradio 2.0 permet de charger et combiner des modèles Hugging Face en une ligne, avec un exemple de traduction et résumé en trois lignes.
Hugging Face présente Accelerate, une bibliothèque qui permet d'exécuter un script d'entraînement PyTorch brut sur n'importe quel type de dispositif distribué (multi-GPU sur un ou plusieurs nœuds, TPU) et avec ou sans précision mixte, en ajoutant cinq lignes de code. Elle fournit une API unifiée qui abstrait le code répétitif et une commande de lancement pour exécuter les scripts sur différentes configurations. Les plans futurs incluent le support de fairscale, deepseed, ainsi que du parallélisme de données et de modèle spécifique à AWS SageMaker. L'installation se fait via pip install accelerate.
Motif de la recommandation :L'article détaille les cinq lignes à ajouter à un script PyTorch pour exécuter l'entraînement distribué et la précision mixte, avec le lanceur CLI et la configuration.
Hugging Face consacre son reading group de février 2021 aux Transformers à longue portée.
Le système de traduction fairseq wmt19 de Facebook FAIR a été porté vers la bibliothèque transformers de Hugging Face.
Hugging Face détaille l'entraînement from scratch d'EsperBERTo, un modèle de 84M de paramètres (6 couches.