Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.
175 sélections30 derniers jours 25 entréesTotal : 483 entrées
mise à jour
Archives de la sélection · page 6
24 novembrelun.101–120 entrées · Au total 175 entrées
Motif de la recommandation :Le détail du programme d'accès accéléré et des modèles concernés permet de situer le rôle des laboratoires nationaux dans l'IA scientifique.
Google Research décrit un modèle de traduction parole-à-parole de bout en bout qui génère directement l'audio traduit dans la voix de l'orateur d'origine avec seulement 2 secondes de délai.
Motif de la recommandation :L'article expose l'architecture de bout en bout et le pipeline de données qui ramènent la traduction vocale à 2 secondes de délai, avec un déploiement produit concret.
Motif de la recommandation :JAX-Privacy 1.0 expose les briques DP, la scalabilité et des exemples de fine-tuning Gemma, ce qui permet de juger de son intégration dans les pipelines existants.
Motif de la recommandation :L'article expose le design système, les quatre défis techniques et les données de test des TPU, permettant de comprendre les contraintes réelles du calcul IA dans l'espace.
Mistral AI annonce AI Studio, une plateforme destinée à faire passer les projets d'IA d'entreprise du prototype à la production. Elle repose sur trois piliers.
Motif de la recommandation :Mistral AI Studio rassemble observabilité, exécution d'agents et registre d'actifs en une seule boucle de production, ce qui éclaire les équipes bloquées au stade du prototype.
Motif de la recommandation :Mistral détaille l'annuaire de connecteurs MCP et la gestion des souvenirs dans Le Chat, deux briques qui conditionnent l'usage en entreprise.
Motif de la recommandation :L'original détaille les améliorations de Codestral 25.08 et l'ensemble de la pile de codage Mistral, permettant de juger de son adéquation aux déploiements privés en entreprise.
Mistral AI annonce Mistral Compute, une nouvelle offre d'infrastructure IA fournissant une pile privée et intégrée allant des serveurs bare-metal au PaaS entièrement managé. L'offre inclut la suite d'entraînement de Mistral AI et s'appuie sur un partenariat avec NVIDIA pour proposer les dernières architectures de référence et des dizaines de milliers de GPU. Mistral Compute vise les États, entreprises et laboratoires de recherche en Europe, au Moyen-Orient, en Asie et dans l'hémisphère sud, avec un accent sur la souveraineté des données et l'utilisation d'énergie décarbonée.
Motif de la recommandation :Mistral Compute propose une pile d'infrastructure IA privée, du bare-metal au PaaS, avec des GPU NVIDIA et un accent sur la souveraineté des données.
Motif de la recommandation :Mistral Code regroupe modèles, plugin IDE et contrôles d'entreprise dans une offre déployable en cloud ou en air-gapped, avec des clients déjà engagés.
Motif de la recommandation :L'annonce détaille les connecteurs intégrés, la mémoire persistante et l'orchestration multi-agents, avec des chiffres SimpleQA montrant l'apport de la recherche web.
Mistral AI annonce Mistral Medium 3, un modèle qui atteint selon l'entreprise au moins 90 % des performances de Claude Sonnet 3.7 sur les benchmarks pour un coût de 0.
Motif de la recommandation :Mistral Medium 3 revendique des performances proches de Claude Sonnet 3.7 pour un coût bien inférieur, avec un déploiement possible sur quatre GPU ou plus.
Mistral AI annonce Mistral OCR, une API de reconnaissance optique de caractères qui traite images et PDF en entrée et restitue un contenu ordonné mêlant texte et images. Le modèle est présenté comme multilingue et multimodal, avec des benchmarks internes le plaçant devant Google Document AI, Azure OCR, Gemini-1.5 et GPT-4o sur les documents complexes, les mathématiques, le multilingue, les scans et les tableaux. L'API mistral-ocr-latest est facturée 1000 pages par dollar, avec environ le double de pages par dollar en inférence par lots, disponible sur la Plateforme et bientôt chez les partenaires cloud et en local, avec auto-hébergement sélectif pour les organisations traitant des informations sensibles.
Motif de la recommandation :L'original expose les performances comparées de Mistral OCR et son tarif à la page, utile pour évaluer son intégration dans un pipeline RAG documentaire.
Motif de la recommandation :L'original détaille les capacités, les paliers tarifaires et les options de déploiement de le Chat, ce qui permet de situer l'offre face aux assistants existants.
Motif de la recommandation :L'annonce détaille le support WebGPU, les nouveaux formats de quantification et la compatibilité multi-runtimes, ce qui aide à évaluer l'exécution de modèles dans le navigateur.
Motif de la recommandation :L'article détaille les changements d'architecture de SD3.5 et fournit des exemples de code pour l'inférence, la quantification et l'entraînement LoRA.
Motif de la recommandation :L'audit indépendant de Trail of Bits détaille les vulnérabilités corrigées dans Gradio 5, utile pour évaluer la sécurité des applications ML déployées.
Motif de la recommandation :L'annonce détaille les améliorations de performance, de design et de streaming de Gradio 5, utile pour juger de son adoption en production.
Motif de la recommandation :L'article détaille des astuces concrètes pour fine-tuner un modèle existant en 1.58 bit, avec code et benchmarks, ce qui permet de reproduire la méthode.
Motif de la recommandation :L'annonce détaille les changements cassants et les nouvelles intégrations de la version 1.0.0, ce qui aide les utilisateurs à évaluer la migration.