Motif de la recommandation :Falcon 2 11B est publié en version LLM et VLM, avec les détails d'entraînement et les résultats d'évaluation pour situer ses performances.
Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.
Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.
Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.
Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.
Motif de la recommandation :Présente le fonctionnement de Q-Former et des exemples de code exécutables pour la légende d'images, le VQA et le dialogue multimodal.
Motif de la recommandation :Présente l'implémentation de Perceiver IO dans Transformers et détaille le traitement de texte, image, flux optique et autoencodage multimodal.