Nouveautés fonctionnelles, refontes et dynamique de monétisation des produits et applications — quels produits sont devenus plus performants, plus chers, utilisables.
141 sélections30 derniers jours 19 entréesTotal : 284 entrées
Motif de la recommandation :L'intégration d'AutoGPTQ dans Transformers permet de quantifier et exécuter des LLM en 4, 3 ou 2 bits avec une perte de précision négligeable et une latence proche du fp16.
Motif de la recommandation :Hugging Face détaille une solution d'assistant code auto-hébergée pour l'entreprise, avec les contraintes de conformité et le choix des modèles open source.
Motif de la recommandation :Présente les outils et le guide de conversion Core ML pour exécuter Llama 2 sur Mac, avec les limites de performances et les optimisations prévues.
Motif de la recommandation :Présente la quantification mixed-bit et des recettes prêtes à l'emploi pour exécuter Stable Diffusion XL sur Mac, avec des chiffres de taille et de latence.
Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.
Motif de la recommandation :L'intégration de la quantification 4 bits et de QLoRA dans transformers permet d'entraîner des modèles 65B sur un seul GPU 48GB, avec les benchmarks T4 fournis.
Motif de la recommandation :L'article détaille l'intégration de l'architecture RWKV dans transformers et fournit des exemples de code exécutables, ce qui permet de reproduire directement le flux de génération de texte.
Motif de la recommandation :Présente une méthode concrète pour exécuter un fine-tuning RLHF de modèle 20B sur un seul GPU 24GB, avec les étapes et les bibliothèques utilisées.
Motif de la recommandation :Le guide détaille l'intégration de ControlNet dans Diffusers avec des exemples de code exécutables et des optimisations de vitesse et de mémoire.
Hugging Face annonce la bibliothèque PEFT, qui regroupe des techniques de fine-tuning économe en paramètres intégrées à Transformers et Accelerate. Elle prend en charge LoRA.
Motif de la recommandation :La bibliothèque PEFT de Hugging Face permet de fine-tuner des LLM avec une fraction des paramètres, ce qui réduit fortement les coûts de calcul et de stockage.
Hugging Face annonce l'intégration du modèle SpeechT5 de Microsoft Research Asia dans la bibliothèque open source Transformers. Ce modèle unique gère la synthèse vocale.
Motif de la recommandation :Le billet détaille l'intégration de SpeechT5 dans Transformers et fournit des exemples de code pour la synthèse vocale, la conversion de voix et la reconnaissance automatique de la parole.
Motif de la recommandation :L'original détaille l'intégration d'ONNX Runtime dans Optimum et les gains d'entraînement mesurés, ce qui aide à évaluer l'impact sur les coûts de fine-tuning.
Motif de la recommandation :L'original détaille les nouvelles fonctionnalités de diffusers 0.3 et les optimisations de VRAM, ce qui permet de juger des flux de génération d'images à mettre en place.
Hugging Face annonce Evaluation on the Hub, un outil propulsé par AutoTrain qui permet d'évaluer n'importe quel modèle sur n'importe quel jeu de données du Hub sans écrire une ligne de code. Les résultats sont encodés dans les métadonnées des fiches de modèles et une pull request est ouverte automatiquement, avec des classements par jeu de données et par métrique. L'équipe a déjà évalué des centaines de modèles sur plusieurs jeux de données clés et cite trois cas d'usage principaux : trouver le meilleur modèle pour une tâche, évaluer des modèles sur un nouveau jeu de données et tester un modèle sur de nombreux jeux de données liés.
Motif de la recommandation :Hugging Face ouvre l'évaluation de modèles sur le Hub sans code, avec résultats intégrés aux fiches de modèles et classements consultables.
Motif de la recommandation :L'original détaille le mécanisme des PR sans fork et la refonte de l'onglet Community, ce qui aide à juger l'impact sur les flux de collaboration existants.
Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Motif de la recommandation :Présente l'implémentation de Perceiver IO dans Transformers et détaille le traitement de texte, image, flux optique et autoencodage multimodal.
Hugging Face annonce la sortie d'Optimum, une bibliothèque open source dédiée à l'optimisation des performances des Transformers en production. Elle vise à abstraire la complexité de l'accélération matérielle, en commençant par la quantification des modèles pour les CPU Intel Xeon via Intel Neural Compressor. Optimum s'appuie sur un programme de partenaires matériels et prévoit de publier des configurations et artefacts de modèles optimisés sur le Hugging Face Model Hub.
Motif de la recommandation :Hugging Face présente Optimum, une bibliothèque open source qui simplifie la quantification et l'accélération des Transformers sur du matériel dédié, avec Intel comme premier partenaire.
Motif de la recommandation :Gradio 2.0 permet de charger et combiner des modèles Hugging Face en une ligne, avec un exemple de traduction et résumé en trois lignes.
Hugging Face présente Accelerate, une bibliothèque qui permet d'exécuter un script d'entraînement PyTorch brut sur n'importe quel type de dispositif distribué (multi-GPU sur un ou plusieurs nœuds, TPU) et avec ou sans précision mixte, en ajoutant cinq lignes de code. Elle fournit une API unifiée qui abstrait le code répétitif et une commande de lancement pour exécuter les scripts sur différentes configurations. Les plans futurs incluent le support de fairscale, deepseed, ainsi que du parallélisme de données et de modèle spécifique à AWS SageMaker. L'installation se fait via pip install accelerate.
Motif de la recommandation :L'article détaille les cinq lignes à ajouter à un script PyTorch pour exécuter l'entraînement distribué et la précision mixte, avec le lanceur CLI et la configuration.