Aller au contenu

Orientations techniques

Écosystème open source Dernières actualités

L'actualité des modèles, frameworks et dépôts open source : ouverture des poids, succès fulgurants des projets communautaires, rapport de force entre open source et modèles fermés.

228 sélections30 derniers jours 15 entréesTotal : 438 entrées

mise à jour

Archives de la sélection · page 10

11 décembrelun.181–200 entrées
  1. Hugging Face Blog85

    Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA

    Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.

    Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.

  2. Hugging Face Blog60

    Mixture of Experts expliqué : briques, entraînement et compromis de service

    Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.

    Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.

5 décembremar.
  1. Hugging Face Blog62

    Hugging Face : comment accélérer l'inférence LoRA de 300 % en gardant le modèle de base chaud

    Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.

    Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.

9 novembrejeu.
27 octobreven.
  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

19 octobrejeu.
  1. Hugging Face Blog60

    Gradio-Lite : exécuter Gradio entièrement dans le navigateur sans serveur

    Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.

    Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.

3 octobremar.
27 septembremer.
13 septembremer.
  1. Hugging Face Blog72

    Würstchen : un modèle de diffusion rapide pour la génération d'images

    Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.

    Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.

8 septembreven.
  1. Hugging Face Blog62

    Génération contrôlable efficace pour SDXL avec T2I-Adapters

    L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.

    Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.

6 septembremer.
  1. Hugging Face Blog83

    Hugging Face accueille Falcon 180B, le plus grand modèle ouvert avec 180 milliards de paramètres

    Le Falcon 180B de TII rejoint Hugging Face Hub, avec 180 milliards de paramètres entraînés sur 3.

    Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.

25 aoûtven.
  1. Hugging Face Blog88

    Code Llama : Llama 2 apprend à coder

    Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code.

    Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.

23 aoûtmer.
22 aoûtmar.
8 aoûtmar.
  1. Hugging Face Blog62

    Hugging Face publie swift-transformers pour exécuter des LLM sur les appareils Apple

    Hugging Face publie swift-transformers, un package Swift en développement qui implémente une API de type transformers pour la génération de texte.

    Motif de la recommandation :Présente les outils et le guide de conversion Core ML pour exécuter Llama 2 sur Mac, avec les limites de performances et les optimisations prévues.

  2. Hugging Face Blog62

    Fine-tuner Llama 2 avec DPO dans la bibliothèque TRL

    Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.

    Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.

1 aoûtmar.
27 juilletjeu.
  1. Hugging Face Blog62

    Stable Diffusion XL sur Mac avec quantification Core ML avancée

    Hugging Face et Apple publient des modèles Core ML de Stable Diffusion XL, dont une version avec quantification mixed-bit réduisant l'UNet de 4.

    Motif de la recommandation :Présente la quantification mixed-bit et des recettes prêtes à l'emploi pour exécuter Stable Diffusion XL sur Mac, avec des chiffres de taille et de latence.