Aller au contenu

Orientations techniques

ingénierie de déploiement Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

210 sélections30 derniers jours 21 entréesTotal : 635 entrées

mise à jour

Archives de la sélection · page 2

9mois5joursamedi21–40 entrées
  1. GitHub Blog · AI & ML71

    GitHub lance Project HydraFusion, un aperçu de recherche d'orchestration multi-modèles dans Copilot CLI

    GitHub annonce Project HydraFusion, un aperçu de recherche disponible sur tous les forfaits GitHub Copilot via /experimental dans GitHub Copilot CLI。

    Motif de la recommandation :GitHub détaille trois modes d'orchestration multi-modèles et des résultats de benchmarks avec écarts de coût, utiles pour évaluer les compromis qualité-coût des workflows d'agents.

9mois3jourjeudi
  1. Hugging Face Blog62

    Entraîner un modèle de code à peindre à l'aquarelle avec TRL et OpenEnv

    L'auteur reproduit en open source l'idée de Surya Narreddi, dont la vidéo de peintures à l'aquarelle générées par un modèle écrivant du JavaScript via p5.brush a dépassé 1。

    Motif de la recommandation :L'auteur reproduit en open source l'entraînement RL d'un modèle de code pour peindre à l'aquarelle, avec pool, environnement et scripts publiés.

  2. Google DeepMind62

    Google DeepMind lance le Fairwind Program pour la cyberdéfense des gouvernements et entreprises

    Google DeepMind lance le Fairwind Program, un programme à accès limité destiné aux gouvernements et partenaires de confiance pour utiliser ses capacités de cyberdéfense avancées. Le programme associe le modèle Gemini 3.8 Flash Cyber au harness CodeMender pour trouver, vérifier et corriger des vulnérabilités à l'échelle agentique, avec des correctifs vérifiés prêts au déploiement générés en quelques minutes au lieu de plusieurs semaines. Plus de 650 partenaires participent, avec un accès initial réservé aux gouvernements, autorités cyber nationales, opérateurs d'infrastructures critiques et plateformes technologiques, sous conditions d'usage strictes incluant l'authentification multifacteur. Google.org porte son financement total en cybersécurité à plus de 100 millions de dollars.

    Motif de la recommandation :Le programme détaille l'accès restreint à Gemini 3.8 Flash Cyber et CodeMender, ce qui permet de situer les capacités de correction autonome de vulnérabilités et leurs conditions d'accès.

8mois25jourmardi
  1. Hugging Face Blog67

    IBM 发布 Granite 4.2 推理模型系列, 含 3B, 8B, 30B 三档

    IBM Granite 团队发布 Granite 4.2, 这是其首个稠密, 仅解码器的推理模型系列, 包含 3B, 8B, 30B 三个规模, 基于 Granite-4.1 基座模型后训练而来. Granite-4.1 基座从零预训练。

    Motif de la recommandation :Granite 4.2 公开了从预训练到多阶段 RL 的完整构建细节, 可对照其 3B/8B/30B 三档能力差异判断落地选型.

  2. Hugging Face Blog62

    Hugging Face Gradio : comment construire, exécuter et déployer des workflows IA avec gr.Workflow

    Hugging Face présente gr.Workflow, une fonctionnalité intégrée à Gradio qui transforme un pipeline en graphe de nœuds typés et sert un canevas glisser-déposer où chaque nœud est exécutable et chaque résultat intermédiaire visible. Le même graphe expose chaque sortie comme un endpoint REST nommé d'après son libellé, appelable via le client Gradio ou curl, et se déploie en une commande sur Hugging Face Spaces. L'article illustre plusieurs démos, dont un éditeur d'image avec Qwen-Image-Edit, un studio média combinant FLUX, suppression d'arrière-plan, synthèse vocale et appel LLM, ainsi qu'un nœud fn exécutant un modèle sur GPU via @spaces.GPU et ZeroGPU.

    Motif de la recommandation :L'article détaille le fonctionnement de gr.Workflow et montre comment chaque sortie devient un endpoint REST, ce qui aide à juger de son intégration dans les pipelines existants.

8mois20jourjeudi
8mois18jourmardi
  1. Hugging Face Blog62

    Sentence Transformers v6.0 ajoute MultiVectorEncoder pour la recherche à interaction tardive

    Sentence Transformers v6.0 ajoute un quatrième type de modèle, MultiVectorEncoder。

    Motif de la recommandation :Sentence Transformers v6.0 ajoute un quatrième type de modèle pour la recherche à interaction tardive, avec prise en charge des checkpoints PyLate et ColBERT et des modèles de documents visuels.

8mois11jourmardi
  1. Mistral AI62

    Mistral lance des endpoints d'inférence régionaux et un Priority Tier, et ouvre sa plateforme aux modèles ouverts tiers

    Mistral annonce trois avancées pour l'IA souveraine : la disponibilité générale des Mistral Regional Endpoints.

    Motif de la recommandation :Mistral détaille ses endpoints régionaux et son Priority Tier, ce qui aide à évaluer les options de conformité et de résidence des données pour l'inférence.

8mois10jourlundi
8mois4jourmardi
  1. Microsoft Research78

    Microsoft Research présente Orchard, un cadre open source pour l'IA agentique à grande échelle

    Microsoft Research présente Orchard, un cadre open source pour l'IA agentique à grande échelle。

    Motif de la recommandation :Le cadre open source et les recettes d'entraînement par domaine montrent comment de petits modèles ouverts atteignent des scores élevés sur SWE-bench Verified et des benchmarks web.

7mois29jourmercredi
  1. Berkeley AI Research62

    De CUDA à MLX : comment K-Search transfère des décennies d'expertise kernel vers Apple Silicon

    IBM Research et le Berkeley Sky Lab étendent K-Search, un framework de recherche évolutive de kernels piloté par LLM.

    Motif de la recommandation :L'article détaille une couche de traduction CUDA vers MLX et les gains mesurés sur les kernels Attention et Mamba, utile pour évaluer la portabilité des optimisations GPU.

7mois27jourlundi
  1. Hugging Face Blog88

    Anatomie d'une intrusion d'agent de laboratoire de pointe : chronologie technique de l'incident de juillet 2026

    Hugging Face publie une chronologie technique détaillée de l'intrusion menée par un agent IA autonome piloté par des modèles OpenAI。

    Motif de la recommandation :L'analyse détaillée d'une intrusion menée par un agent autonome sur 4,5 jours révèle comment des faiblesses ordinaires s'enchaînent à l'échelle machine.

7mois23jourjeudi
  1. Hugging Face Blog62

    Diffusers intègre Nunchaku Lite pour l'inférence de diffusion en 4 bits

    Diffusers prend désormais en charge nativement les checkpoints Nunchaku Lite : il suffit d'appeler from_pretrained() pour charger un modèle quantifié en 4 bits。

    Motif de la recommandation :L'intégration native de Nunchaku Lite dans Diffusers permet de charger des checkpoints 4 bits avec from_pretrained() et de quantifier de nouvelles architectures via diffuse-compressor.

7mois8jourmercredi
  1. Hugging Face Blog62

    Hugging Face : le backend transformers de vLLM atteint la vitesse native

    Le backend de modélisation transformers pour vLLM atteint désormais une vitesse égale ou supérieure aux implémentations natives de vLLM pour de nombreuses architectures LLM。

    Motif de la recommandation :L'article détaille comment le backend transformers atteint la vitesse native de vLLM et ce que cela change pour le déploiement des modèles.

  2. Google Research62

    Google Research : réduire la congestion via des interventions de routage dans Google Maps

    Google Research publie dans Nature Cities la première étude à grande échelle sur l'utilisation des plateformes de navigation pour améliorer le trafic. Dans 10 grandes villes américaines。

    Motif de la recommandation :L'étude quantifie à l'échelle de dix villes l'effet d'un routage coordonné sur la vitesse et les émissions, avec un protocole réutilisable.

7mois7jourmardi
  1. Hugging Face Blog78

    LeRobot v0.6.0 : imaginer, évaluer, améliorer la boucle d'apprentissage robotique

    LeRobot v0.6.0 introduit des politiques à modèle du monde (VLA-JEPA, FastWAM, LingBot-VA)。

    Motif de la recommandation :LeRobot v0.6.0 expose en détail les nouveaux modèles, benchmarks et outils de déploiement, ce qui permet de juger l'évolution de la boucle d'apprentissage robotique open source.