Aller au contenu

Orientations techniques

Multimodal Dernières actualités

Les capacités au-delà du texte : compréhension visuelle, mixte texte-image, entrées et sorties audio et vidéo — avancées des modèles et des produits.

87 sélections30 derniers jours 8 entréesTotal : 126 entrées

mise à jour

Archives de la sélection · page 5

24 maiven.81–87 entrées
14 maimar.
  1. Hugging Face Blog73

    Google publie PaliGemma, une famille de modèles vision-langage open source

    Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.

    Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.

15 avrillun.
  1. Hugging Face Blog72

    Hugging Face publie Idefics2, un modèle multimodal ouvert de 8B paramètres

    Hugging Face publie Idefics2, un modèle multimodal généraliste de 8B paramètres sous licence Apache 2.0.

    Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.

26 févrierlun.
6 marslun.
  1. Hugging Face Blog65

    Kakao Brain publie les modèles ViT et ALIGN et le jeu de données COYO

    Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.

    Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.

15 févriermer.
15 décembremer.