Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.
210 sélections30 derniers jours 21 entréesTotal : 635 entrées
mise à jour
Archives de la sélection · page 3
7mois7jourmardi41–60 entrées · Au total 210 entrées
Motif de la recommandation :Le montage hf:// et l'absence de frais de sortie permettent de lancer l'entraînement sur n'importe quel cloud sans copier les données.
Motif de la recommandation :Le billet détaille le nouveau type de dépôt kernel, la signature de code et les CLI repensées, ce qui aide à juger comment distribuer et sécuriser des kernels personnalisés.
Motif de la recommandation :Leanstral 1.5 est publié sous licence Apache-2.0 avec 6B de paramètres actifs, des scores sur miniF2F, PutnamBench et FATE, et la découverte de bugs inédits.
Motif de la recommandation :L'original expose une architecture vocale ouverte et modulaire avec les composants et le point d'accès au code, ce qui permet de juger comment assembler un pipeline speech-to-speech temps réel.
Motif de la recommandation :L'article détaille comment greffer la prédiction multi-token sur un Gemini Nano v3 gelé, avec une architecture zéro copie et des gains mesurés sur Pixel.
Motif de la recommandation :Le texte détaille les optimisations d'entraînement MoE et les gains mesurés, utile pour évaluer le coût de mise à l'échelle des modèles à experts.
Motif de la recommandation :Mistral OCR 4 ajoute boîtes englobantes, classification de blocs et scores de confiance, avec auto-hébergement en un conteneur et tarification à la page.
Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode。
Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.
L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.
Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.
Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.
Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
Motif de la recommandation :Le prototype d'IA de planification au Royaume-Uni montre comment un agent assiste les décisions administratives tout en gardant l'humain décideur.
Motif de la recommandation :L'article détaille la transformation de téléphones recyclés en plateforme de calcul cloud et les défis techniques associés, offrant un cas concret de réduction du carbone incorporé.
Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.
Motif de la recommandation :Un guide pas à pas pour déplacer la CI GitHub vers Hugging Face Jobs, avec les chiffres de temps d'exécution obtenus sur Trackio.
Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.
Motif de la recommandation :L'article détaille la refonte du CLI hf pour les agents et publie un benchmark comparant consommation de tokens et taux de réussite face à curl et au SDK Python.
Motif de la recommandation :Le cadre d'hydrologie open source et le pipeline d'entraînement permettent aux agences météorologiques de reprendre le modèle Flood Hub et d'y intégrer leurs données locales.