Meta a publié Muse Glimmer, un modèle multimodal de 30B paramètres sous licence Apache 2.0。
Motif de la recommandation :Meta publie un modèle multimodal de 30B sous Apache 2.0 avec support day-0 dans transformers, llama.cpp et vLLM, ce qui permet d'évaluer son usage local pour le codage et l'analyse de documents.
OpenEnv, outil de création d'environnements d'exécution agentiques, est désormais coordonné par un comité incluant Meta-PyTorch。
Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.
Hugging Face et Meta présentent OpenEnv, un framework open source qui évalue les agents IA contre de vrais systèmes plutôt que des simulations。
Motif de la recommandation :L'article détaille le framework OpenEnv et le benchmark Calendar Gym, avec des chiffres concrets sur les limites des agents et des cas d'erreur d'appel d'outils réutilisables.
Meta publie la famille Llama 3.1 en trois tailles (8B, 70B, 405B), chacune en version base et instruct。
Motif de la recommandation :Détaille les exigences mémoire, les intégrations et les recettes de quantification de Llama 3.1, utile pour planifier le déploiement et le fine-tuning.
Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B。
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Hugging Face explique comment fine-tuner Llama 2 70B avec PyTorch FSDP sur 2 nœuds de 8 GPU A100 80GB。
Motif de la recommandation :Le guide détaille les trois obstacles du fine-tuning de Llama 2 70B sous FSDP et les solutions concrètes apportées par Transformers et Accelerate.
Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code。
Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.
Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.
Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.
Meta publie Llama 2, une famille de grands modèles de langage open access de 7B à 70B paramètres。
Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.
Hugging Face publie StackLLaMA, un modèle LLaMA 7B entraîné avec RLHF pour répondre aux questions de Stack Exchange。
Motif de la recommandation :Le guide détaille tout le pipeline RLHF de StackLLaMA, du jeu de données à l'entraînement PPO, avec des configurations LoRA et des commandes réutilisables.