Aller au contenu
6mois25jourmardi
6mois24jourlundi
6mois19jourmercredi
6mois13jourjeudi
6mois12jourmercredi
6mois7jourvendredi
6mois5jourmercredi
6mois4jourmardi
5mois29jourmercredi
5mois22jourmercredi
5mois21jourmardi
5mois16jourjeudi
5mois14jourmardi
5mois9jourjeudi
5mois1jourmercredi
4mois30jourmardi
4mois18jourjeudi
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B。

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

4mois16jourmardi
4mois11jourjeudi
4mois10jourmercredi
4mois3jourmercredi
4mois2jourmardi
3mois25jourlundi
3mois22jourvendredi
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

3mois20jourmercredi
  1. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82。

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

3mois18jourlundi
3mois15jourvendredi
2mois29jourjeudi
2mois26jourlundi
2mois23jourvendredi