Aller au contenu
21 maimar.
16 maijeu.
14 maimar.
9 maijeu.
6 mailun.
  1. OpenAI News42

    OpenAI et Stack Overflow annoncent un partenariat API

    OpenAI et Stack Overflow annoncent un partenariat API associant la plateforme de connaissances techniques de Stack Overflow aux modèles LLM d'OpenAI pour l'IA. L'objectif affiché est de doter les développeurs des forces combinées de la principale plateforme de contenus hautement techniques et des modèles LLM les plus populaires pour le développement d'IA.

1 maimer.
30 avrilmar.
23 avrilmar.
18 avriljeu.
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B.

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

16 avrilmar.
14 avrildim.
11 avriljeu.
10 avrilmer.
5 avrilven.
4 avriljeu.
3 avrilmer.
2 avrilmar.
1 avrillun.
25 marslun.
22 marsven.
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

21 marsjeu.
20 marsmer.
  1. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

18 marslun.
13 marsmer.
6 marsmer.