Red-Teaming des grands modèles de langage
Le red-teaming des LLM consiste à concevoir des prompts déclenchant des comportements nuisibles — divulgation d'informations personnelles.
Le red-teaming des LLM consiste à concevoir des prompts déclenchant des comportements nuisibles — divulgation d'informations personnelles.
Hugging Face consacre un article aux modèles conjoints vision-langage, qui traitent images et texte via un encodeur d'images.
La génération d'assets 3D par texte (text-to-3D) n'est pas encore exploitable en production pour le développement de jeux.
Hugging Face publie une introduction au machine learning sur graphes couvrant les fondamentaux.
Habana Gaudi2 est environ deux fois plus rapide que le Nvidia A100 80GB en entraînement et en inférence.
Hugging Face publie un article pédagogique « Deep Learning with Proteins » destiné aux biologistes et aux spécialistes du ML.
Hugging Face présente le Time Series Transformer, un modèle probabiliste de prévision de séries temporelles intégré à la bibliothèque 🤗 Transformers. Ce modèle encodeur-décodeur.
Hugging Face détaille une méthode d'analyse de sentiment sur données chiffrées via la bibliothèque Concrete-ML et le chiffrement homomorphe (FHE).
Hugging Face a intégré Spaces à arXivLabs via un onglet Demos permettant d'accéder aux démos open source des articles. Depuis son lancement en octobre 2021.
Hugging Face annonce l'intégration de Contrastive Search dans la bibliothèque transformers.
Hugging Face présente MTEB, un benchmark massif destiné à mesurer les performances des modèles d'embedding de texte sur des tâches variées. Il regroupe 56 jeux de données répartis en 8 tâches, jusqu'à 112 langues, et un classement public de plus de 2000 résultats. La bibliothèque MTEB permet d'évaluer n'importe quel modèle produisant des embeddings et de soumettre ses résultats au classement.
Motif de la recommandation :Le MTEB couvre 56 jeux de données et 8 tâches, avec un classement public et une bibliothèque réutilisable pour évaluer les modèles d'embedding.
Hugging Face, avec Intel Labs et le UKP Lab, présente SetFit, un framework d'apprentissage en few-shot pour les Sentence Transformers. Sur le jeu de données CR.
Motif de la recommandation :L'article présente la méthode d'entraînement en deux étapes de SetFit et les résultats comparatifs sur RAFT, permettant de comprendre pourquoi un petit modèle peut atteindre les performances de T-Few.
Hugging Face publie un tutoriel pour entraîner de zéro un Decision Transformer offline dans l'environnement Gym HalfCheetah.
Hugging Face publie un guide pas à pas pour fine-tuner des modèles Transformer pré-entraînés sur les IPU de Graphcore via la bibliothèque Optimum. L'exemple entraîne un modèle ViT pré-entraîné sur ImageNet-21k sur le jeu de données ChestX-ray14, en s'appuyant sur les checkpoints et fichiers de configuration IPU déjà disponibles dans Optimum Graphcore. Les IPU sont présentés comme particulièrement adaptés aux ViT grâce au parallélisme de données et de modèle, au pipeline et à l'architecture MIMD avec IPU-Fabric.
Ce guide Hugging Face, désormais obsolète, couvre l'API SentenceTransformer.fit des versions antérieures à la v3.0.
Hugging Face consacre l'unité 8 de son cours gratuit de Deep Reinforcement Learning à Proximal Policy Optimization (PPO).
Nyströmformer approxime l'auto-attention standard avec une complexité O(n) en temps et en mémoire.
Le cours de Deep Reinforcement Learning de Hugging Face consacre son unité 7 à l'algorithme Advantage Actor Critic (A2C).
Un développeur a construit un générateur de playlists basé sur Sentence Transformers et Gradio.
Hugging Face publie l'unité 5 de son cours gratuit de Deep Reinforcement Learning.
Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.
Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.
Le cours de Deep Reinforcement Learning de Hugging Face consacre sa troisième unité à Deep Q-Learning.
Microsoft présente TAPEX, une méthode de pré-entraînement de tables qui apprend un exécuteur SQL neuronal sur un corpus synthétique généré en échantillonnant des requêtes SQL exécutables et leurs résultats, sans recourir à des données réelles. Intégré à Transformers 4.19.0, TAPEX atteint de nouveaux résultats SOTA sur quatre benchmarks : 89,6 % sur WikiSQL (+2,3 %), 84,2 % sur TabFact (+3,2 %), 74,5 % sur SQA (+3,5 %) et 57,5 % sur WikiTableQuestions (+4,8 %).
Hugging Face publie la deuxième partie de son cours sur le Deep Reinforcement Learning consacrée au Q-Learning.
Hugging Face publie la première partie de l'unité 2 de son cours gratuit de Deep Reinforcement Learning consacrée au Q-Learning. Ce chapitre couvre les méthodes basées sur la valeur.
Hugging Face publie le premier chapitre de son cours gratuit Deep Reinforcement Learning.
Hugging Face annonce l'intégration du Decision Transformer, une méthode d'apprentissage par renforcement hors ligne.
Margaret Mitchell, fondatrice et co-responsable du groupe Ethical AI de Google, a rejoint Hugging Face après quatre ans chez Google pour y créer des protocoles de recherche en IA éthique.
Hugging Face lance le AI Research Residency Program, un programme de 9 mois à temps plein destiné à lancer ou accélérer une carrière en recherche en machine learning.
Ce guide montre comment fine-tuner SegFormer, un modèle de segmentation sémantique SOTA introduit par Xie et al. en 2021.
BERT (Bidirectional Encoder Representations from Transformers), développé en 2018 par Google AI Language.
La bibliothèque huggingface_hub introduit les classes ModelSearchArguments.
Hugging Face a ajouté Perceiver IO à sa bibliothèque Transformers, un modèle Transformer capable de traiter texte.
Motif de la recommandation :Présente l'implémentation de Perceiver IO dans Transformers et détaille le traitement de texte, image, flux optique et autoencodage multimodal.
Hugging Face a entraîné 20 modèles Sentence Transformers à usage général, dont Mini-LM.
Motif de la recommandation :L'article détaille la méthode d'entraînement contrastif, la composition des lots et l'infrastructure TPU, utile pour reproduire un modèle d'embedding de phrases.
Une équipe distribuée sur 12 fuseaux horaires a fine-tuné le réseau CLIP d'OpenAI avec des images satellite et légendes issues des datasets RSICD.
BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.
Hugging Face consacre son reading group de février 2021 aux Transformers à longue portée.
Le notebook Hugging Face détaille comment initialiser à chaud (warm-start) des modèles encodeur-décodeur à partir de checkpoints pré-entraînés de type BERT ou GPT2.
Le blog Hugging Face détaille les quatre optimisations mémoire du Reformer, un modèle Transformer capable de traiter jusqu'à un demi-million de tokens en une seule passe.