Aller au contenu

Orientations techniques

ingénierie de déploiement Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

210 sélections30 derniers jours 21 entréesTotal : 635 entrées

mise à jour

Archives de la sélection · page 3

7mois7jourmardi41–60 entrées
  1. Hugging Face Blog67

    Hugging Face et SkyPilot permettent d'exécuter des charges IA sur n'importe quel cloud avec un stockage sans frais de sortie

    Hugging Face et SkyPilot lancent une intégration qui monte un Bucket Hugging Face ou tout dépôt du Hub dans une tâche SkyPilot via une URL hf。

    Motif de la recommandation :Le montage hf:// et l'absence de frais de sortie permettent de lancer l'entraînement sur n'importe quel cloud sans copier les données.

7mois6jourlundi
  1. Hugging Face Blog62

    Hugging Face Kernels : nouveau type de dépôt, signature de code et CLI repensées

    Hugging Face a publié une mise à jour majeure de son projet Kernels, qui standardise l'empaquetage。

    Motif de la recommandation :Le billet détaille le nouveau type de dépôt kernel, la signature de code et les CLI repensées, ce qui aide à juger comment distribuer et sécuriser des kernels personnalisés.

7mois2jourjeudi
7mois1jourmercredi
  1. Hugging Face Blog62

    Hugging Face et Cerebras lancent une démo d'IA vocale temps réel avec Gemma 4

    Hugging Face et Cerebras présentent une démo de speech-to-speech temps réel construite sur une architecture ouverte et modulaire 。

    Motif de la recommandation :L'original expose une architecture vocale ouverte et modulaire avec les composants et le point d'accès au code, ce qui permet de juger comment assembler un pipeline speech-to-speech temps réel.

6mois27joursamedi
  1. Google Research62

    Google Research accélère Gemini Nano sur Pixel grâce à la prédiction multi-token gelée

    Google Research présente une architecture qui greffe la prédiction multi-token (MTP) sur des modèles Gemini Nano v3 gelés。

    Motif de la recommandation :L'article détaille comment greffer la prédiction multi-token sur un Gemini Nano v3 gelé, avec une architecture zéro copie et des gains mesurés sur Pixel.

6mois26jourvendredi
6mois25jourjeudi
6mois23jourmardi
  1. Hugging Face Blog62

    Hugging Face publie huggingface_hub chaque semaine avec l'IA et des outils ouverts

    Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode。

    Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.

6mois22jourlundi
  1. Hugging Face Blog62

    Comment trier les PR et issues d'OpenClaw avec des modèles locaux Gemma et Qwen

    L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.

    Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.

6mois18jourjeudi
  1. Hugging Face Blog62

    Hugging Face propose agent-eval pour évaluer l'usage agentique des bibliothèques open source

    Hugging Face publie agent-eval, un harnais d'évaluation qui mesure non seulement la réponse finale d'un agent mais aussi le nombre de tours。

    Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.

  2. Hugging Face Blog60

    Hugging Face : au-delà de LoRA, quelle technique de fine-tuning choisir ?

    Hugging Face publie une analyse comparative des techniques de fine-tuning paramétrique efficace (PEFT) et conclut que LoRA。

    Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.

6mois17jourmercredi
  1. Hugging Face Blog62

    AWS Strands Robots : du Hub Hugging Face au robot physique avec LeRobot

    AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。

    Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.

  2. Google DeepMind62

    Google DeepMind et le gouvernement britannique déploient un prototype de planification assistée par Gemini

    Google DeepMind collabore avec le gouvernement britannique, Google Cloud, Faculty et les autorités locales de Barnet。

    Motif de la recommandation :Le prototype d'IA de planification au Royaume-Uni montre comment un agent assiste les décisions administratives tout en gardant l'humain décideur.

6mois13joursamedi
  1. Google Research60

    Google soutient un projet de datacenter à partir de 2 000 smartphones Pixel recyclés

    Des chercheurs de l'Université de Californie à San Diego construisent, avec le soutien de Google。

    Motif de la recommandation :L'article détaille la transformation de téléphones recyclés en plateforme de calcul cloud et les défis techniques associés, offrant un cas concret de réduction du carbone incorporé.

6mois9jourmardi
  1. Hugging Face Blog62

    Comment un agent a construit une galerie 3D de Paris en enchaînant deux Hugging Face Spaces

    Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces。

    Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.

6mois8jourlundi
  1. Hugging Face Blog76

    Hugging Face place OpenEnv sous gouvernance communautaire pour le RL agentique open source

    OpenEnv, outil de création d'environnements d'exécution agentiques, est désormais coordonné par un comité incluant Meta-PyTorch。

    Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.

6mois4jourjeudi
  1. Hugging Face Blog62

    Hugging Face refond le CLI hf pour les agents de codage et le benchmarke

    Hugging Face a reconstruit son CLI officiel hf pour qu'il serve à la fois les humains et les agents de codage comme Claude Code。

    Motif de la recommandation :L'article détaille la refonte du CLI hf pour les agents et publie un benchmark comparant consommation de tokens et taux de réussite face à curl et au SDK Python.

  2. Google Research62

    Google Research ouvre son framework d'hydrologie pour la prévision des crues

    Google Research a mis en open source sur GitHub, sous licence Apache 2.0, son framework de modélisation hydrologique。

    Motif de la recommandation :Le cadre d'hydrologie open source et le pipeline d'entraînement permettent aux agences météorologiques de reprendre le modèle Flood Hub et d'y intégrer leurs données locales.