Motif de la recommandation :Mistral détaille les nouvelles capacités de Le Chat, du mode Deep Research à l'édition d'images, ce qui aide à situer l'offre face aux assistants concurrents.
Motif de la recommandation :Mistral ouvre deux tailles de modèles vocaux sous Apache 2.0, avec des chiffres de prix et de contexte qui permettent de comparer aux API fermées.
Hugging Face Blog annonce Holo1, une nouvelle famille de VLM d'automatisation d'interface graphique qui alimente l'agent GUI Surfer-H. Le contenu détaillé n'est pas disponible.
Mistral AI annonce Mistral Medium 3, un modèle qui atteint selon l'entreprise au moins 90 % des performances de Claude Sonnet 3.7 sur les benchmarks pour un coût de 0.
Motif de la recommandation :Mistral Medium 3 revendique des performances proches de Claude Sonnet 3.7 pour un coût bien inférieur, avec un déploiement possible sur quatre GPU ou plus.
Motif de la recommandation :Mistral Small 3.1 précise les performances, la fenêtre de contexte et les points de disponibilité, ce qui permet de juger de son intérêt pour des déploiements légers.
Mistral AI annonce Mistral OCR, une API de reconnaissance optique de caractères qui traite images et PDF en entrée et restitue un contenu ordonné mêlant texte et images. Le modèle est présenté comme multilingue et multimodal, avec des benchmarks internes le plaçant devant Google Document AI, Azure OCR, Gemini-1.5 et GPT-4o sur les documents complexes, les mathématiques, le multilingue, les scans et les tableaux. L'API mistral-ocr-latest est facturée 1000 pages par dollar, avec environ le double de pages par dollar en inférence par lots, disponible sur la Plateforme et bientôt chez les partenaires cloud et en local, avec auto-hébergement sélectif pour les organisations traitant des informations sensibles.
Motif de la recommandation :L'original expose les performances comparées de Mistral OCR et son tarif à la page, utile pour évaluer son intégration dans un pipeline RAG documentaire.
Motif de la recommandation :L'original détaille les capacités, les paliers tarifaires et les options de déploiement de le Chat, ce qui permet de situer l'offre face aux assistants existants.
Google publie PaliGemma 2, une nouvelle série de modèles de vision-langage, annoncée sur le blog de Hugging Face. Le contenu disponible ne fournit pas d'autres détails sur les capacités.
Motif de la recommandation :L'annonce détaille les nouvelles capacités de le Chat et un tableau comparatif avec ChatGPT, Perplexity et Claude, utile pour situer l'offre.
Motif de la recommandation :L'annonce détaille les performances de Pixtral Large sur plusieurs benchmarks et sa disponibilité sous licence ouverte, ce qui permet de situer le modèle face à GPT-4o et Gemini-1.5 Pro.
Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.
Motif de la recommandation :L'annonce détaille les nouveaux tarifs par modèle et le palier gratuit de la Plateforme, ce qui permet d'évaluer le coût d'usage des API Mistral.
Motif de la recommandation :Présente l'architecture et les performances de Pixtral 12B, avec des comparaisons face aux modèles ouverts et fermés de même échelle.
Motif de la recommandation :Mistral NeMo est un modèle 12B à fenêtre de 128k, sous licence Apache 2.0, avec un tokenizer Tekken plus efficace et une quantification FP8, ce qui permet d'évaluer les compromis entre taille, contexte et coût d'inférence.
Motif de la recommandation :Falcon 2 11B est publié en version LLM et VLM, avec les détails d'entraînement et les résultats d'évaluation pour situer ses performances.
Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.
Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.