Aller au contenu

Orientations techniques

Déploiement et ingénierie Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

171 sélections30 derniers jours 21 entréesTotal : 450 entrées

mise à jour

Archives de la sélection · page 4

28 maijeu.61–80 entrées
  1. Mistral AI70

    Mistral AI lance Search Toolkit, un cadre open source pour les pipelines de recherche IA

    Mistral AI publie en aperçu public Search Toolkit, un cadre composable et open source pour construire des pipelines de recherche destinés aux applications IA.

    Motif de la recommandation :Un cadre unifié d'ingestion, de récupération et d'évaluation, open source et déployable sur site, qui permet de comparer les configurations de recherche sur ses propres données.

27 maimer.
  1. Mistral AI62

    Mistral intègre Emmi AI et lance une capacité d'IA physique pour l'ingénierie industrielle

    Mistral annonce l'intégration d'Emmi AI et le lancement d'une nouvelle capacité d'IA physique au sein de ses solutions d'entreprise pour l'ingénierie industrielle native en IA. Cette approche apprend des sorties de solveurs physiques pour prédire le comportement physique directement à partir de la géométrie et des conditions aux limites, en un seul passage avant sur un GPU, de l'ordre de la seconde, contre des heures à des semaines de calcul par variante de conception avec les méthodes traditionnelles. Mistral cite comme partenaires ASML, Airbus, Safran et Siemens Energy, et indique que cette capacité s'applique à l'aérospatiale, l'automobile, l'électronique et les semi-conducteurs, l'énergie et les équipements industriels.

    Motif de la recommandation :Mistral intègre Emmi AI et présente l'IA physique comme une capacité d'ingénierie industrielle au sein de sa plateforme d'entreprise.

  2. Hugging Face Blog78

    Hugging Face TRL : synchronisation de poids par deltas sparse via Hub Buckets pour l'RL asynchrone

    Hugging Face a fusionné une PR dans TRL qui encode uniquement les éléments modifiés des poids bf16 sous forme de fichier safetensors sparse.

    Motif de la recommandation :Le texte détaille un protocole de synchronisation de poids par deltas sparse via HF Buckets, avec code et architecture, utile pour réduire les coûts de l'RL asynchrone.

22 maiven.
20 maimer.
  1. Google Research78

    Google présente ERA, un outil basé sur Gemini pour écrire et optimiser du code scientifique

    Google Research présente Empirical Research Assistance (ERA), un outil de recherche basé sur Gemini qui écrit et optimise du code scientifique.

    Motif de la recommandation :L'article détaille les performances d'ERA sur plusieurs benchmarks et huit cas d'application scientifique, permettant de juger de l'apport de l'outil à la recherche computationnelle.

17 maidim.
  1. Google DeepMind75

    Google DeepMind présente Gemini for Science et ses outils expérimentaux

    Google DeepMind annonce Gemini for Science, un ensemble d'outils et d'expériences scientifiques comprenant trois prototypes sur Google Labs.

    Motif de la recommandation :Présentation des outils expérimentaux et des compétences scientifiques de Gemini, avec les partenaires et les cas d'usage déjà en test, ce qui permet de situer les capacités agentiques appliquées à la recherche.

14 maijeu.
6 maimer.
  1. Google DeepMind78

    AlphaEvolve : l'agent de codage de Google DeepMind étend son impact à la génomique, l'énergie et les TPU

    Google DeepMind publie un bilan d'un an d'AlphaEvolve, son agent de codage propulsé par Gemini.

    Motif de la recommandation :L'article détaille les applications concrètes d'AlphaEvolve dans la génomique, les réseaux électriques, les TPU et la logistique, avec des chiffres vérifiables.

29 avrilmer.
27 avrillun.
22 avrilmer.
  1. Google DeepMind67

    Google DeepMind présente Decoupled DiLoCo, une architecture d'entraînement distribué résiliente

    Google DeepMind publie un article sur Decoupled DiLoCo, une architecture distribuée qui divise les entraînements LLM en îlots de calcul découplés avec flux de données asynchrone.

    Motif de la recommandation :L'article détaille l'architecture Decoupled DiLoCo et ses résultats sur Gemma 4, permettant de comprendre comment l'entraînement distribué gagne en résilience et en efficacité.

16 avriljeu.
  1. Hugging Face Blog62

    Hugging Face publie un Skill et un harnais de test pour porter les modèles transformers vers mlx-lm

    Hugging Face publie un Skill et un harnais de test pour aider les contributeurs à porter les modèles de transformers vers mlx-lm.

    Motif de la recommandation :Le Skill et le harnais de test transforment le portage de modèles transformers vers mlx-lm en un processus reproductible, avec des règles concrètes pour des PR de qualité.

2 avriljeu.
  1. Hugging Face Blog88

    Google DeepMind publie la famille Gemma 4 de modèles multimodaux ouverts sur Hugging Face

    Google DeepMind publie sur Hugging Face la famille Gemma 4, des modèles multimodaux sous licence Apache 2.0 capables de traiter texte.

    Motif de la recommandation :L'article détaille l'architecture, les tailles et les benchmarks de Gemma 4, ainsi que son intégration dans les principaux moteurs d'inférence et outils de fine-tuning.

1 avrilmer.
  1. Hugging Face Blog62

    Hugging Face lance gradio.Server pour associer n'importe quel frontend au backend Gradio

    Hugging Face présente gradio.Server, une extension de FastAPI qui ajoute le moteur d'API de Gradio (file d'attente.

    Motif de la recommandation :gradio.Server permet de conserver la file d'attente et le support ZeroGPU de Gradio tout en apportant son propre frontend, ce qui change la façon de construire sur Spaces.

31 marsmar.
  1. Hugging Face Blog62

    Hugging Face publie TRL v1.0, bibliothèque de post-entraînement couvrant plus de 75 méthodes

    Hugging Face a publié TRL v1.0, une bibliothèque de post-entraînement qui passe d'une base de code de recherche à une bibliothèque stable avec un contrat de versioning sémantique. Elle implémente plus de 75 méthodes de post-entraînement et adopte une structure où le noyau stable (SFT, DPO, Reward modeling, RLOO, GRPO) et la couche expérimentale (ORPO, etc.) coexistent avec des contrats distincts. La bibliothèque est téléchargée 3 millions de fois par mois et sert d'infrastructure à des projets comme Unsloth et Axolotl. Les prochaines étapes incluent un GRPO asynchrone, la stabilisation de KTO et de formateurs de distillation, ainsi que des avertissements structurés pour rendre l'entraînement lisible par les agents.

    Motif de la recommandation :L'article détaille la conception de stabilité de TRL v1.0 et sa couverture de plus de 75 méthodes de post-entraînement, utile pour comprendre l'évolution des bibliothèques d'entraînement.

25 marsmer.
  1. Google Research62

    Google lance Vibe Coding XR avec XR Blocks et Gemini

    Google annonce Vibe Coding XR, un flux de travail qui associe Gemini au framework web XR Blocks pour transformer des descriptions en langage naturel en applications Android XR fonctionnelles et sensibles à la physique en moins de 60 secondes. Le système s'appuie sur des prompts système spécialisés et des modèles de code pour gérer la logique spatiale, avec des exemples allant d'un tuteur de mathématiques à une expérience de chimie immersive. Une évaluation préliminaire sur le jeu de données VCXR60, issu de quatre ateliers internes et comptant 60 prompts fournis par 20 participants, indique un taux de réussite d'environ 70 % lors des premières itérations, avant 11 versions majeures et la publication de XR Blocks Gem v0.11.0 comme référence de base. Le framework open source est accessible sur Android XR et une démonstration est prévue au stand Google à ACM CHI 2026.

    Motif de la recommandation :Google détaille un flux de prototypage XR piloté par Gemini, avec des exemples concrets et une évaluation préliminaire sur 60 prompts.

21 marssam.
  1. Hugging Face Blog78

    Construire un modèle d'embedding spécialisé en moins d'une journée

    NVIDIA détaille un pipeline en six étapes pour transformer un modèle d'embedding généraliste (Llama-Nemotron-Embed-1B-v2) en modèle spécialisé à un domaine.

    Motif de la recommandation :Présente un pipeline complet de fine-tuning d'embedding pour RAG, avec commandes, hyperparamètres et résultats mesurés sur un GPU unique.