Aller au contenu
  1. AWS Machine Learning Blog62

    Construire un pipeline multi-agents de production musicale sur Amazon Bedrock AgentCore Runtime Instances

    L'article explique comment déployer un pipeline de production musicale à trois agents sur Amazon Bedrock AgentCore Runtime Instances. L'agent de composition utilise Claude Sonnet 4.6 et le modèle ACE-Step sur le GPU NVIDIA L4 de l'instance pour générer un fichier.wav, l'agent de livraison lit ce fichier depuis le volume partagé et applique une chaîne DSP, puis l'agent de conformité revérifie indépendamment le résultat et peut demander une nouvelle composition. Les trois agents partagent la même session via un runtimeSessionId commun, ce qui les place sur une même instance EC2 avec un système de fichiers partagé, et les sessions peuvent persister jusqu'à 14 jours. L'article détaille la création du capacity provider, le déploiement des runtimes et l'orchestration, avec un exemple complet disponible dans le dépôt AgentCore samples sur GitHub.

    Motif de la recommandation :Présente une architecture multi-agents avec sessions partagées, GPU et volumes persistants, et détaille les étapes de déploiement sur AgentCore Runtime Instances.

  1. GitHub Blog · AI & ML83

    GitHub Copilot migre son runtime d'agent vers Rust avec l'aide de Copilot

    GitHub a réécrit le runtime de l'agent Copilot, initialement en TypeScript sur Node.js.

    Motif de la recommandation :Le récit détaillé d'une migration de runtime de 430 000 lignes de TypeScript vers Rust menée par des agents, avec les chiffres de cache, de compaction et de répartition des rôles.

  1. Hugging Face Blog62

    Async GRPO avec LoRA sur HF Jobs : un bucket, un proxy, sans NCCL

    TRL v1.14 prend en charge l'entraînement d'un adaptateur LoRA dans AsyncGRPOTrainer et ne synchronise que cet adaptateur vers vLLM。

    Motif de la recommandation :L'article détaille une architecture concrète pour entraîner un adaptateur LoRA avec Async GRPO sur des Jobs séparés, avec des chiffres de bout en bout et un diagnostic du goulot d'étranglement.

  1. Mistral AI62

    Mistral AI : moderniser un code legacy complexe avec des agents IA

    Mistral AI a migré 40 000 lignes de Fortran 77 vers C++ pour un opérateur énergétique européen.

    Motif de la recommandation :L'article détaille un workflow d'agents structuré avec harnais de parité et documentation préalable, directement transposable à d'autres migrations de code legacy.

  1. Hugging Face Blog62

    Entraîner un modèle de code à peindre à l'aquarelle avec TRL et OpenEnv

    L'auteur reproduit en open source l'idée de Surya Narreddi, dont la vidéo de peintures à l'aquarelle générées par un modèle écrivant du JavaScript via p5.brush a dépassé 1。

    Motif de la recommandation :L'auteur reproduit en open source l'entraînement RL d'un modèle de code pour peindre à l'aquarelle, avec pool, environnement et scripts publiés.

  1. Hugging Face Blog62

    Hugging Face publie huggingface_hub chaque semaine avec l'IA et des outils ouverts

    Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode。

    Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.

  1. Hugging Face Blog62

    Comment trier les PR et issues d'OpenClaw avec des modèles locaux Gemma et Qwen

    L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.

    Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.

  1. Hugging Face Blog60

    Hugging Face : au-delà de LoRA, quelle technique de fine-tuning choisir ?

    Hugging Face publie une analyse comparative des techniques de fine-tuning paramétrique efficace (PEFT) et conclut que LoRA。

    Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.

  1. Hugging Face Blog62

    AWS Strands Robots : du Hub Hugging Face au robot physique avec LeRobot

    AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。

    Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.

  1. Hugging Face Blog62

    Comment un agent a construit une galerie 3D de Paris en enchaînant deux Hugging Face Spaces

    Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces。

    Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.

  2. Hugging Face Blog62

    Comment migrer votre CI GitHub vers Hugging Face Jobs

    Hugging Face explique comment faire tourner les jobs GitHub Actions sur Hugging Face Jobs via le pont huggingface/jobs-actions。

    Motif de la recommandation :Un guide pas à pas pour déplacer la CI GitHub vers Hugging Face Jobs, avec les chiffres de temps d'exécution obtenus sur Trackio.

  1. Hugging Face Blog60

    Reachy Mini passe en mode entièrement local : guide de la chaîne vocale

    Hugging Face détaille comment faire tourner entièrement en local la conversation vocale de Reachy Mini。

    Motif de la recommandation :Guide pas à pas pour exécuter localement toute la chaîne vocale de Reachy Mini, avec composants recommandés et options de déploiement interchangeables.

  1. Hugging Face Blog62

    Hugging Face explique comment débloquer l'asynchronie dans le continuous batching

    Hugging Face détaille comment séparer les charges CPU et GPU pour accélérer l'inférence LLM。

    Motif de la recommandation :Décrypte le pipeline asynchrone du continuous batching avec streams, événements et carry-over, et documente un gain mesuré de 22 % sur un cas reproductible.

  1. Hugging Face Blog78

    Construire un modèle d'embedding spécialisé en moins d'une journée

    NVIDIA détaille un pipeline en six étapes pour transformer un modèle d'embedding généraliste (Llama-Nemotron-Embed-1B-v2) en modèle spécialisé à un domaine。

    Motif de la recommandation :Présente un pipeline complet de fine-tuning d'embedding pour RAG, avec commandes, hyperparamètres et résultats mesurés sur un GPU unique.

  1. Hugging Face Blog60

    Hugging Face transformers : prise en charge des architectures MoE, du chargement des poids à l'entraînement

    Hugging Face détaille dans un article de blog les évolutions de la bibliothèque transformers pour prendre en charge les modèles Mixture of Experts (MoE)。

    Motif de la recommandation :L'article détaille les modifications d'ingénierie de transformers pour les MoE, avec des benchmarks de chargement et des API concrètes pour le déploiement.

  1. OpenAI News62

    OpenAI fait évoluer PostgreSQL pour supporter 800 millions d'utilisateurs de ChatGPT

    OpenAI explique comment elle a fait évoluer PostgreSQL pour absorber des millions de requêtes par seconde afin de supporter 800 millions d'utilisateurs de ChatGPT. L'article détaille le recours à des réplicas, à la mise en cache, à la limitation de débit et à l'isolation des charges de travail.

    Motif de la recommandation :L'article détaille comment OpenAI fait évoluer PostgreSQL pour des millions de requêtes par seconde, une méthode d'ingénierie transférable aux équipes qui exploitent des bases de données à grande échelle.

  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face。

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

  1. Hugging Face Blog62

    Comment fine-tuner Llama 2 70B avec PyTorch FSDP

    Hugging Face explique comment fine-tuner Llama 2 70B avec PyTorch FSDP sur 2 nœuds de 8 GPU A100 80GB。

    Motif de la recommandation :Le guide détaille les trois obstacles du fine-tuning de Llama 2 70B sous FSDP et les solutions concrètes apportées par Transformers et Accelerate.