Aller au contenu

Orientations techniques

Multimodal Dernières actualités

Les capacités au-delà du texte : compréhension visuelle, mixte texte-image, entrées et sorties audio et vidéo — avancées des modèles et des produits.

85 sélections30 derniers jours 6 entréesTotal : 124 entrées

mise à jour

Archives de la sélection · page 4

17 juilletjeu.61–80 entrées
15 juilletmar.
26 juinjeu.
3 juinmar.
7 maimer.
  1. Mistral AI78

    Mistral AI lance Mistral Medium 3, un modèle intermédiaire au coût réduit

    Mistral AI annonce Mistral Medium 3, un modèle qui atteint selon l'entreprise au moins 90 % des performances de Claude Sonnet 3.7 sur les benchmarks pour un coût de 0.

    Motif de la recommandation :Mistral Medium 3 revendique des performances proches de Claude Sonnet 3.7 pour un coût bien inférieur, avec un déploiement possible sur quatre GPU ou plus.

17 marslun.
  1. Mistral AI78

    Mistral AI publie Mistral Small 3.1 sous licence Apache 2.0

    Mistral AI annonce Mistral Small 3.1, présenté comme surpassant Gemma 3 et GPT-4o Mini avec une vitesse d'inférence de 150 tokens par seconde.

    Motif de la recommandation :Mistral Small 3.1 précise les performances, la fenêtre de contexte et les points de disponibilité, ce qui permet de juger de son intérêt pour des déploiements légers.

12 marsmer.
7 marsven.
  1. Mistral AI78

    Mistral AI lance Mistral OCR, une API de reconnaissance optique de caractères pour documents complexes

    Mistral AI annonce Mistral OCR, une API de reconnaissance optique de caractères qui traite images et PDF en entrée et restitue un contenu ordonné mêlant texte et images. Le modèle est présenté comme multilingue et multimodal, avec des benchmarks internes le plaçant devant Google Document AI, Azure OCR, Gemini-1.5 et GPT-4o sur les documents complexes, les mathématiques, le multilingue, les scans et les tableaux. L'API mistral-ocr-latest est facturée 1000 pages par dollar, avec environ le double de pages par dollar en inférence par lots, disponible sur la Plateforme et bientôt chez les partenaires cloud et en local, avec auto-hébergement sélectif pour les organisations traitant des informations sensibles.

    Motif de la recommandation :L'original expose les performances comparées de Mistral OCR et son tarif à la page, utile pour évaluer son intégration dans un pipeline RAG documentaire.

21 févrierven.
7 févrierven.
5 décembrejeu.
18 novembrelun.
23 septembrelun.
  1. Hugging Face Blog62

    Hugging Face dévoile les coulisses de FineVideo, un jeu de données de 43 000 vidéos annotées

    Hugging Face publie les détails techniques de FineVideo, un jeu de données de 43 000 vidéos totalisant 3 400 heures.

    Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.

17 septembremar.
18 juilletjeu.
  1. Mistral AI78

    Mistral AI publie Mistral NeMo, un modèle 12B avec une fenêtre de contexte de 128k

    Mistral AI publie Mistral NeMo, un modèle 12B développé en collaboration avec NVIDIA.

    Motif de la recommandation :Mistral NeMo est un modèle 12B à fenêtre de 128k, sous licence Apache 2.0, avec un tokenizer Tekken plus efficace et une quantification FP8, ce qui permet d'évaluer les compromis entre taille, contexte et coût d'inférence.

24 maiven.
14 maimar.
  1. Hugging Face Blog73

    Google publie PaliGemma, une famille de modèles vision-langage open source

    Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.

    Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.