Aller au contenu
21 maimar.
16 maijeu.
14 maimar.
  1. Hugging Face Blog73

    Google publie PaliGemma, une famille de modèles vision-langage open source

    Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.

    Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.

13 mailun.
  1. Hugging Face Blog67

    Hugging Face lance Transformers Agents 2.0, avec un agent Llama-3-70B surpassant les agents basés sur GPT-4 sur GAIA

    Hugging Face publie Transformers Agents 2.0, qui introduit deux nouveaux agents capables d'itérer à partir d'observations passées pour résoudre des tâches complexes.

    Motif de la recommandation :Le cadre d'agents open source expose la séparation entre moteur LLM et type d'agent, ainsi que les résultats comparés de Llama-3-70B et GPT-4 sur GAIA.

9 maijeu.
5 maidim.
3 maiven.
1 maimer.
30 avrilmar.
29 avrillun.
  1. Hugging Face Blog65

    StarCoder2-15B-Instruct : un modèle de code auto-aligné entièrement transparent et permissif

    Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.

    Motif de la recommandation :Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.

23 avrilmar.
  1. Hugging Face Blog38

    Hugging Face lance le classement Open Chain of Thought

    Hugging Face présente l'Open CoT Leaderboard, un classement qui mesure le gain de précision apporté par le chain-of-thought (Δ = précision avec CoT – précision sans CoT) plutôt que la précision absolue des LLM. Il évalue les tâches LogiQA, LSAT et AGIEval/logikon-bench, en rendant les modèles plus robustes à la contamination des données d'entraînement. Deux stratégies de génération de traces de raisonnement sont implémentées : Classic (« Let's think step by step ») et Reflect.

22 avrillun.
  1. Hugging Face Blog60

    JAT : un agent Transformer polyvalent open source pour jeux vidéo, robotique et navigation

    Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari.

    Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.

19 avrilven.
18 avriljeu.
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B.

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

16 avrilmar.
15 avrillun.
  1. Hugging Face Blog72

    Hugging Face publie Idefics2, un modèle multimodal ouvert de 8B paramètres

    Hugging Face publie Idefics2, un modèle multimodal généraliste de 8B paramètres sous licence Apache 2.0.

    Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.

11 avriljeu.
10 avrilmer.
9 avrilmar.
4 avriljeu.
3 avrilmer.
2 avrilmar.
25 marslun.
22 marsven.
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

21 marsjeu.
20 marsmer.
  1. Hugging Face Blog62

    Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM

    Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.

    Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.

  2. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

18 marslun.
15 marsven.
  1. Hugging Face Blog55

    Hugging Face publie le dataset WebSight et le modèle Sightseer pour convertir les captures d'écran web en code HTML

    Hugging Face présente WebSight, un dataset synthétique de paires capture d'écran et code HTML destiné à entraîner des systèmes d'IA capables de transformer des maquettes web en code HTML fonctionnel. Après la version v0.1 de janvier 2024 contenant 823 000 paires, la mise à jour v0.2 introduit des images réelles dans les captures d'écran, passe à Tailwind CSS et porte le dataset à 2 millions d'exemples. En s'appuyant sur WebSight, Hugging Face a fine-tuné son futur modèle de fondation vision-langage pour obtenir Sightseer, capable de convertir des captures d'écran de pages web en HTML fonctionnel et d'y intégrer des images proches de celles de l'original. Le dataset, le rapport technique et un notebook Colab sont disponibles en open source.

5 marsmar.