Aller au contenu

Orientations techniques

Déploiement et ingénierie Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

171 sélections30 derniers jours 21 entréesTotal : 450 entrées

mise à jour

Archives de la sélection · page 5

18 marsmer.81–100 entrées
  1. Mistral AI62

    Mistral AI lance Forge, un système pour entraîner des modèles d'IA sur les connaissances internes des entreprises

    Mistral AI a annoncé Forge, un système destiné aux entreprises pour construire des modèles d'IA de niveau frontière ancrés dans leurs connaissances propriétaires. Forge prend en charge le pré-entraînement, le post-entraînement et l'apprentissage par renforcement sur des documents internes, des bases de code et des données opérationnelles, avec des architectures denses et MoE ainsi que des entrées multimodales. Mistral AI indique avoir déjà collaboré avec ASML, DSO National Laboratories Singapore, Ericsson, l'Agence spatiale européenne, HTX Singapore et Reply. Le système est conçu pour les agents de codage comme Mistral Vibe, qui peuvent l'utiliser pour affiner des modèles, trouver des hyperparamètres optimaux et générer des données synthétiques.

    Motif de la recommandation :Mistral AI présente Forge, un système permettant aux entreprises d'entraîner des modèles sur leurs données internes, avec prise en charge des architectures denses et MoE et des agents autonomes.

12 marsjeu.
11 marsmer.
10 marsmar.
9 marslun.
  1. Hugging Face Blog75

    LeRobot v0.5.0 est publié, avec le support du robot humanoïde Unitree G1 et de nouvelles politiques VLA

    LeRobot v0.5.0 est publié, avec plus de 200 PR fusionnées et plus de 50 nouveaux contributeurs depuis la v0.4.0. Cette version ajoute le support complet du robot humanoïde Unitree G1 (locomotion, manipulation, téléopération et contrôle corps entier), de nouvelles politiques comme Pi0-FAST (VLA autorégressif basé sur Gemma 300M) et Real-Time Chunking (RTC), ainsi que l'encodage vidéo en streaming qui supprime l'attente entre les épisodes d'enregistrement. La version introduit aussi EnvHub pour charger des environnements de simulation depuis le Hugging Face Hub, l'intégration de NVIDIA IsaacLab-Arena, et modernise la base de code avec Python 3.12+ et Transformers v5.

    Motif de la recommandation :LeRobot v0.5.0 détaille l'ajout du support du robot humanoïde Unitree G1 et de nouvelles politiques VLA, utile pour suivre l'évolution des frameworks robotiques open source.

5 marsjeu.
  1. Hugging Face Blog62

    Hugging Face lance Modular Diffusers, des blocs composables pour les pipelines de diffusion

    Hugging Face présente Modular Diffusers, une nouvelle façon de construire des pipelines de diffusion en composant des blocs réutilisables.

    Motif de la recommandation :L'article détaille la composition par blocs des pipelines de diffusion et l'intégration avec Mellon, ce qui permet de juger de la flexibilité offerte pour construire des workflows personnalisés.

26 févrierjeu.
  1. Hugging Face Blog60

    Hugging Face transformers : prise en charge des architectures MoE, du chargement des poids à l'entraînement

    Hugging Face détaille dans un article de blog les évolutions de la bibliothèque transformers pour prendre en charge les modèles Mixture of Experts (MoE).

    Motif de la recommandation :L'article détaille les modifications d'ingénierie de transformers pour les MoE, avec des benchmarks de chargement et des API concrètes pour le déploiement.

13 févrierven.
10 févriermar.
  1. Google DeepMind78

    Google DeepMind : Gemini Deep Think accélère la découverte mathématique et scientifique

    Google DeepMind publie deux articles détaillant l'utilisation du mode Gemini Deep Think pour résoudre des problèmes de recherche professionnels en mathématiques.

    Motif de la recommandation :L'article détaille l'agent de recherche mathématique Aletheia et les recettes de collaboration humain-IA, avec des cas concrets en mathématiques, physique et informatique.

9 févrierlun.
  1. Hugging Face Blog78

    Transformers.js v4 disponible sur NPM avec un nouveau runtime WebGPU

    Transformers.js v4 est disponible sur NPM après un an de développement. La version adopte un nouveau runtime WebGPU réécrit en C++ avec l'équipe ONNX Runtime.

    Motif de la recommandation :Transformers.js v4 détaille le nouveau runtime WebGPU en C++, les gains de performance et la restructuration du dépôt, utile pour évaluer le déploiement d'inférence dans le navigateur.

29 janvierjeu.
  1. Hugging Face Blog62

    Hugging Face lance Daggr, une bibliothèque Python open source pour enchaîner des apps IA avec inspection visuelle

    L'équipe Gradio de Hugging Face publie Daggr, une bibliothèque Python open source permettant de construire des workflows IA reliant des apps Gradio.

    Motif de la recommandation :L'équipe Gradio présente une bibliothèque Python open source qui transforme du code de workflow en canvas visuel inspectable, avec des exemples de chaînage d'apps Gradio et de modèles.

28 janviermer.
17 décembremer.
16 décembremar.
  1. Google Research62

    Google Research présente Paper Assistant Tool, un outil d'évaluation automatique par Gemini pour les articles de STOC 2026

    Google Research a créé un programme expérimental pour le STOC 2026.

    Motif de la recommandation :L'original expose le fonctionnement et les retours d'utilisation d'un outil d'évaluation par IA sur des articles de théorie informatique, avec des données de satisfaction concrètes.

3 décembremer.
24 novembrelun.
19 novembremer.
  1. Google Research78

    Google Research présente un modèle de traduction vocale de bout en bout en temps réel avec 2 secondes de délai

    Google Research décrit un modèle de traduction parole-à-parole de bout en bout qui génère directement l'audio traduit dans la voix de l'orateur d'origine avec seulement 2 secondes de délai.

    Motif de la recommandation :L'article expose l'architecture de bout en bout et le pipeline de données qui ramènent la traduction vocale à 2 secondes de délai, avec un déploiement produit concret.

17 novembrelun.
12 novembremer.