Optimiser Bark avec 🤗 Transformers
Hugging Face montre comment accélérer Bark, le modèle TTS de Suno AI disponible dans Transformers depuis la v4.31.0.
Hugging Face montre comment accélérer Bark, le modèle TTS de Suno AI disponible dans Transformers depuis la v4.31.0.
Hugging Face publie swift-transformers, un package Swift en développement qui implémente une API de type transformers pour la génération de texte.
Motif de la recommandation :Présente les outils et le guide de conversion Core ML pour exécuter Llama 2 sur Mac, avec les limites de performances et les optimisations prévues.
Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.
Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.
Hugging Face explique comment déployer MusicGen, le modèle de génération musicale texte-vers-audio.
Hugging Face déploie Huggy Lingo, un système qui détecte automatiquement la langue des datasets du Hub dépourvus de métadonnées linguistiques et ouvre des pull requests via librarian-bots pour les ajouter. Le modèle fastText de Meta (facebook/fasttext-language-identification), issu des travaux No Language Left Behind, identifie 217 langues à partir de 20 lignes de texte récupérées via l'API dataset viewer. Environ 87 % des quelque 50 000 datasets publics ne précisent pas leur langue, contre 13 % qui le font, l'anglais représentant à lui seul près de 19 % des tags déclarés.
Zama démontre qu'il est possible d'exécuter une partie de l'inférence d'un LLM sur des données chiffrées grâce au chiffrement homomorphe complet (FHE).
Segmind a mis en open source le code d'entraînement et les poids de ses modèles SD-Small et SD-Tiny.
Motif de la recommandation :L'article détaille la méthode de distillation par suppression de blocs et publie le code et les poids, ce qui permet de reproduire et d'adapter ces modèles compressés.
Ce tutoriel détaille un workflow de génération d'assets 3D assisté par IA, du texte à l'intégration dans Unity.
Hugging Face et Apple publient des modèles Core ML de Stable Diffusion XL, dont une version avec quantification mixed-bit réduisant l'UNet de 4.
Motif de la recommandation :Présente la quantification mixed-bit et des recettes prêtes à l'emploi pour exécuter Stable Diffusion XL sur Mac, avec des chiffres de taille et de latence.
Hugging Face a publié Agents.js, une bibliothèque JavaScript permettant de donner accès à des outils aux LLM dans le navigateur ou sur le serveur. Elle s'installe via npm install @huggingface/agents et expose l'objet HfAgent, qui accepte une commande en langage naturel puis génère du code appelant des outils multimodaux. La bibliothèque utilise par défaut OpenAssistant/oasst-sft-4-pythia-12b-epoch-3.5 via l'Inference API, mais accepte tout LLM personnalisé ainsi que des outils ajoutés par l'utilisateur, comme un outil de traduction anglais-allemand basé sur t5-base. Elle peut aussi recevoir des fichiers en entrée, par exemple une image à légender puis à lire à voix haute. Les auteurs recommandent d'utiliser generateCode et evaluateCode plutôt que run, car l'exécution directe évalue du code arbitraire dans un environnement non fiable.
Hugging Face a couronné « Snip It » d'ohmlet vainqueur de son premier Open Source AI Game Jam.
Hugging Face célèbre le premier anniversaire de sa bibliothèque Diffusers.
Meta publie Llama 2, une famille de grands modèles de langage open access de 7B à 70B paramètres.
Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.
Hugging Face présente son écosystème open source pour la génération de texte et les LLM.
Hugging Face publie un tutoriel détaillant l'AI WebTV.
Hugging Face détaille le fine-tuning d'un modèle Stable Diffusion sur un cluster de quatre serveurs Intel Sapphire Rapids.
Transformers.js permet de faire tourner des modèles ML directement dans le navigateur, sans serveur, comme le démontre le jeu Doodle Dash inspiré de Quick, Draw!
Hugging Face montre comment déployer des LLM open source comme Falcon 40B instruct via Inference Endpoints.
Hugging Face détaille un tutoriel pour construire un générateur d'applications web combinant Node.js et le modèle WizardCoder-15B servi via l'API Inference Endpoints. Le serveur Express diffuse en streaming le HTML généré token par token directement au navigateur, avec un prompt guidant le modèle vers TailwindCSS et une logique JS encapsulée. Une alternative gratuite via l'Inference API est proposée pour les modèles plus petits, tandis que les modèles performants nécessitent 32 Go de mémoire ou plus et une accélération matérielle pour une latence correcte.
Optimum Habana v1.7 sur Habana Gaudi2 atteint des accélérations de x2,5 par rapport à l'A100 et x1.
Hugging Face consacre le quatrième numéro de sa newsletter Ethics and Society aux sources de biais dans les modèles text-to-image.
Le classement Open LLM, qui s'appuie sur la bibliothèque EleutherAI LM Evaluation Harness.
Motif de la recommandation :L'article détaille pourquoi un même benchmark MMLU donne des scores et classements différents selon l'implémentation, un point clé pour interpréter les classements de modèles.
Panel et Hugging Face annoncent une collaboration intégrant un template Panel dans Hugging Face Spaces.
Le blog Hugging Face explique comment le fine-tuning des couches Adapter de MMS atteint un taux d'erreur de mots très faible après seulement 10 à 20 minutes d'entraînement.
Le modèle Autoformer, publié à NeurIPS 2021, est désormais disponible dans 🤗 Transformers. Sur les trois jeux de données du papier AAAI 2023 « Are Transformers Effective for Time Series Forecasting? », Autoformer obtient un MASE de 0.910 sur Traffic, 1.087 sur Exchange-Rate et 0.751 sur Electricity, contre respectivement 0.965, 1.690 et 0.831 pour le modèle linéaire DLinear, qui utilise pourtant la couche de décomposition d'Autoformer. Autoformer introduit une couche de décomposition et un mécanisme d'auto-corrélation remplaçant l'auto-attention classique.
Hugging Face présente les optimisations Core ML de WWDC'23 pour exécuter Stable Diffusion plus rapidement et avec moins de mémoire sur iPhone.
Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.
Hugging Face a publié une mise à jour de sa Content Policy.
Livebook, l'outil open source de notebooks interactifs en Elixir.
Hugging Face annonce qu'AMD rejoint son Hardware Partner Program.
Le Hugging Face Hub héberge plus de 190 000 modèles de machine learning, 33 000 datasets et plus de 100 000 applications et démos.
Hugging Face étend l'Open LLM Leaderboard avec des annotations humaines et des évaluations GPT-4 sur un jeu de test aveugle de 327 prompts.
Motif de la recommandation :L'étude compare les annotations humaines et GPT-4 sur un même jeu de prompts et quantifie le biais positionnel ainsi que les écarts de corrélation par catégorie de tâche.
Hugging Face a intégré DuckDB au Hub pour exécuter des requêtes SQL sur n'importe quel dataset public.
Hugging Face détaille l'intégration des modèles Falcon de TII, publiés sous licence Apache 2.0.
Motif de la recommandation :L'article détaille l'intégration de Falcon dans l'écosystème Hugging Face, avec des exemples d'inférence, de quantification et de fine-tuning directement réutilisables.
Hugging Face organise le premier Open Source AI Game Jam, du 7 au 9 juillet.
Hugging Face Hub intègre désormais BERTopic, un outil de modélisation de topics qui rejoint la catégorie « topic models » aux côtés de LDA sur la plateforme. Cette intégration s'inscrit dans un écosystème couvrant plus de 50 catégories de tâches NLP, de la génération de texte à la reconnaissance d'entités nommées, en passant par la traduction automatique et l'analyse de sentiments. Les modèles BERTopic peuvent être publiés et partagés directement via le Hub.
Hugging Face met à disposition un nouveau conteneur d'inférence LLM (DLC) pour Amazon SageMaker.
Hugging Face détaille un workflow d'optimisation de Stable Diffusion pour CPU Intel combinant Quantization-Aware Training (QAT) via NNCF.
Hugging Face et Microsoft lancent le Hugging Face Model Catalog.
Hugging Face annonce l'intégration de la quantification 4 bits via bitsandbytes dans transformers.
Motif de la recommandation :L'intégration de la quantification 4 bits et de QLoRA dans transformers permet d'entraîner des modèles 65B sur un seul GPU 48GB, avec les benchmarks T4 fournis.
Hugging Face annonce un partenariat avec IBM sur watsonx.ai, la plateforme d'entreprise destinée aux développeurs d'IA pour entraîner.