Aller au contenu
7mois18jourjeudi
7mois16jourmardi
  1. Hugging Face Blog34

    Comment utiliser distilabel pour créer un chatbot Argilla 2.0

    Hugging Face détaille la création d'un chatbot pour Argilla 2.0 en s'appuyant sur distilabel pour générer un dataset synthétique et fine-tuner un modèle d'embedding spécialisé. Le processus couvre le chunking de la documentation technique (environ 256 tokens par chunk), la génération de questions synthétiques et d'exemples négatifs difficiles, la création d'une base vectorielle et le déploiement du chatbot sur Hugging Face Spaces. Les interactions sont stockées dans Argilla pour une évaluation et une amélioration continues.

7mois10jourmercredi
  1. Hugging Face Blog60

    Hugging Face et KerasHub annoncent une intégration : les modèles Transformers peuvent être chargés directement dans KerasHub

    Hugging Face et KerasHub annoncent une intégration : Transformers et KerasHub partagent désormais un format de sauvegarde de modèles。

    Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.

7mois9jourmardi
  1. Hugging Face Blog22

    Banque des Territoires (groupe CDC) x Polyconseil x Hugging Face : une solution data souveraine pour le programme environnemental EduRénov

    Banque des Territoires (groupe CDC), Polyconseil et Hugging Face ont achevé la première phase d'une solution RAG souveraine destinée à optimiser l'accompagnement du programme EduRénov de rénovation écologique de 10 000 bâtiments scolaires publics. Le dispositif vise 40 % d'économies d'énergie en 5 ans, avec 2 milliards d'euros de prêts et 50 millions d'euros d'ingénierie préparatoire. Après un an, près de 2 000 projets ont été signés, et le CDC a imposé la souveraineté des services de calcul et des modèles, en s'appuyant notamment sur Text Generation Inference, Transformers, Sentence Transformers et Tokenizers de Hugging Face.

7mois3jourmercredi
6mois27jourjeudi
6mois25jourmardi
6mois24jourlundi
6mois19jourmercredi
6mois13jourjeudi
6mois12jourmercredi
6mois7jourvendredi
6mois5jourmercredi
6mois4jourmardi
5mois29jourmercredi
5mois22jourmercredi
5mois21jourmardi
5mois16jourjeudi
5mois14jourmardi
5mois9jourjeudi
5mois1jourmercredi
4mois30jourmardi
4mois18jourjeudi
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B。

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

4mois16jourmardi
4mois11jourjeudi
4mois10jourmercredi
4mois3jourmercredi
4mois2jourmardi
3mois25jourlundi
3mois22jourvendredi
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

3mois20jourmercredi