Aller au contenu

Orientations techniques

Déploiement et ingénierie Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

175 sélections30 derniers jours 25 entréesTotal : 483 entrées

mise à jour

Archives de la sélection · page 6

24 novembrelun.101–120 entrées
19 novembremer.
  1. Google Research78

    Google Research présente un modèle de traduction vocale de bout en bout en temps réel avec 2 secondes de délai

    Google Research décrit un modèle de traduction parole-à-parole de bout en bout qui génère directement l'audio traduit dans la voix de l'orateur d'origine avec seulement 2 secondes de délai.

    Motif de la recommandation :L'article expose l'architecture de bout en bout et le pipeline de données qui ramènent la traduction vocale à 2 secondes de délai, avec un déploiement produit concret.

17 novembrelun.
12 novembremer.
5 novembremer.
  1. Google Research62

    Google Research présente Project Suncatcher : exploration d'une conception de système d'infrastructure IA scalable basée dans l'espace

    Google Research a publié le preprint « Towards a future space-based, highly scalable AI infrastructure system design » et dévoile Project Suncatcher.

    Motif de la recommandation :L'article expose le design système, les quatre défis techniques et les données de test des TPU, permettant de comprendre les contraintes réelles du calcul IA dans l'espace.

24 octobreven.
  1. Mistral AI62

    Mistral AI lance AI Studio, plateforme de production pour l'IA d'entreprise

    Mistral AI annonce AI Studio, une plateforme destinée à faire passer les projets d'IA d'entreprise du prototype à la production. Elle repose sur trois piliers.

    Motif de la recommandation :Mistral AI Studio rassemble observabilité, exécution d'agents et registre d'actifs en une seule boucle de production, ce qui éclaire les équipes bloquées au stade du prototype.

2 septembremar.
30 juilletmer.
  1. Mistral AI68

    Mistral lance Codestral 25.08 et une pile de codage complète pour l'entreprise

    Mistral AI annonce Codestral 25.08, une mise à jour de son modèle de complétion de code qui affiche +30 % de complétions acceptées.

    Motif de la recommandation :L'original détaille les améliorations de Codestral 25.08 et l'ensemble de la pile de codage Mistral, permettant de juger de son adéquation aux déploiements privés en entreprise.

11 juinmer.
  1. Mistral AI62

    Mistral AI lance Mistral Compute, une offre d'infrastructure IA privée

    Mistral AI annonce Mistral Compute, une nouvelle offre d'infrastructure IA fournissant une pile privée et intégrée allant des serveurs bare-metal au PaaS entièrement managé. L'offre inclut la suite d'entraînement de Mistral AI et s'appuie sur un partenariat avec NVIDIA pour proposer les dernières architectures de référence et des dizaines de milliers de GPU. Mistral Compute vise les États, entreprises et laboratoires de recherche en Europe, au Moyen-Orient, en Asie et dans l'hémisphère sud, avec un accent sur la souveraineté des données et l'utilisation d'énergie décarbonée.

    Motif de la recommandation :Mistral Compute propose une pile d'infrastructure IA privée, du bare-metal au PaaS, avec des GPU NVIDIA et un accent sur la souveraineté des données.

4 juinmer.
27 maimar.
7 maimer.
  1. Mistral AI78

    Mistral AI lance Mistral Medium 3, un modèle intermédiaire au coût réduit

    Mistral AI annonce Mistral Medium 3, un modèle qui atteint selon l'entreprise au moins 90 % des performances de Claude Sonnet 3.7 sur les benchmarks pour un coût de 0.

    Motif de la recommandation :Mistral Medium 3 revendique des performances proches de Claude Sonnet 3.7 pour un coût bien inférieur, avec un déploiement possible sur quatre GPU ou plus.

7 marsven.
  1. Mistral AI78

    Mistral AI lance Mistral OCR, une API de reconnaissance optique de caractères pour documents complexes

    Mistral AI annonce Mistral OCR, une API de reconnaissance optique de caractères qui traite images et PDF en entrée et restitue un contenu ordonné mêlant texte et images. Le modèle est présenté comme multilingue et multimodal, avec des benchmarks internes le plaçant devant Google Document AI, Azure OCR, Gemini-1.5 et GPT-4o sur les documents complexes, les mathématiques, le multilingue, les scans et les tableaux. L'API mistral-ocr-latest est facturée 1000 pages par dollar, avec environ le double de pages par dollar en inférence par lots, disponible sur la Plateforme et bientôt chez les partenaires cloud et en local, avec auto-hébergement sélectif pour les organisations traitant des informations sensibles.

    Motif de la recommandation :L'original expose les performances comparées de Mistral OCR et son tarif à la page, utile pour évaluer son intégration dans un pipeline RAG documentaire.

7 févrierven.
22 octobremar.
10 octobrejeu.
9 octobremer.
18 septembremer.
13 septembreven.
  1. Hugging Face Blog62

    Hugging Face publie la première release candidate d'Accelerate 1.0.0

    Hugging Face a publié la première release candidate d'Accelerate 1.0.0, une bibliothèque d'entraînement distribué utilisée par transformers.

    Motif de la recommandation :L'annonce détaille les changements cassants et les nouvelles intégrations de la version 1.0.0, ce qui aide les utilisateurs à évaluer la migration.