Cactus Compute présente Needle 2, un modèle de function calling de 14 Mo qui transforme des instructions en anglais en actions locales sur un Raspberry Pi 5.
Motif de la recommandation :Un exemple concret de modèle de function calling de 14 Mo exécuté en local sur Raspberry Pi 5, avec latences et consommation mémoire mesurées.
TRL v1.14 prend en charge l'entraînement d'un adaptateur LoRA dans AsyncGRPOTrainer et ne synchronise que cet adaptateur vers vLLM.
Motif de la recommandation :L'article détaille une architecture concrète pour entraîner un adaptateur LoRA avec Async GRPO sur des Jobs séparés, avec des chiffres de bout en bout et un diagnostic du goulot d'étranglement.
L'auteur reproduit en open source l'idée de Surya Narreddi, dont la vidéo de peintures à l'aquarelle générées par un modèle écrivant du JavaScript via p5.brush a dépassé 1.
Motif de la recommandation :L'auteur reproduit en open source l'entraînement RL d'un modèle de code pour peindre à l'aquarelle, avec pool, environnement et scripts publiés.
Sentence Transformers v6.0 ajoute un quatrième type de modèle, MultiVectorEncoder.
Motif de la recommandation :Sentence Transformers v6.0 ajoute un quatrième type de modèle pour la recherche à interaction tardive, avec prise en charge des checkpoints PyLate et ColBERT et des modèles de documents visuels.
Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode.
Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.
L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.
Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.
Hugging Face publie une analyse comparative des techniques de fine-tuning paramétrique efficace (PEFT) et conclut que LoRA.
Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes.
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces.
Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.
Hugging Face explique comment faire tourner les jobs GitHub Actions sur Hugging Face Jobs via le pont huggingface/jobs-actions.
Motif de la recommandation :Un guide pas à pas pour déplacer la CI GitHub vers Hugging Face Jobs, avec les chiffres de temps d'exécution obtenus sur Trackio.
Hugging Face détaille comment faire tourner entièrement en local la conversation vocale de Reachy Mini.
Motif de la recommandation :Guide pas à pas pour exécuter localement toute la chaîne vocale de Reachy Mini, avec composants recommandés et options de déploiement interchangeables.
Hugging Face détaille comment séparer les charges CPU et GPU pour accélérer l'inférence LLM.
Motif de la recommandation :Décrypte le pipeline asynchrone du continuous batching avec streams, événements et carry-over, et documente un gain mesuré de 22 % sur un cas reproductible.
Photoroom publie le troisième volet de sa série PRX, consacré à un speedrun d'entraînement d'un modèle text-to-image en 24 heures sur 32 H200.
Motif de la recommandation :L'article détaille la recette complète d'un entraînement text-to-image en 24h sur 32 H200 pour environ 1500 dollars, avec code open source.
Hugging Face détaille dans un article de blog les évolutions de la bibliothèque transformers pour prendre en charge les modèles Mixture of Experts (MoE).
Motif de la recommandation :L'article détaille les modifications d'ingénierie de transformers pour les MoE, avec des benchmarks de chargement et des API concrètes pour le déploiement.
Hugging Face présente upskill, un outil qui génère et évalue des skills d'agents à partir de traces d'exécution de grands modèles.
Motif de la recommandation :L'article détaille une méthode pour générer et évaluer des skills d'agents avec un grand modèle, puis les transférer vers des modèles plus petits ou locaux.
NVIDIA publie un tutoriel pas à pas pour construire un assistant personnel de bureau combinant DGX Spark et Reachy Mini.
Motif de la recommandation :Un guide pas à pas pour assembler un assistant de bureau avec DGX Spark et Reachy Mini, utile à ceux qui veulent reproduire un agent multimodal local.
Hugging Face présente comment quantifier les pipelines de diffusion basés sur Transformer avec les utilitaires Quanto de la bibliothèque Diffusers.
Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.