Aller au contenu

Orientations techniques

Multimodal Dernières actualités

Les capacités au-delà du texte : compréhension visuelle, mixte texte-image, entrées et sorties audio et vidéo — avancées des modèles et des produits.

108 sélections30 derniers jours 6 entréesTotal : 155 entrées

mise à jour

Archives de la sélection · page 2

6mois9jourmardi21–40 entrées
6mois5jourvendredi
  1. Hugging Face Blog65

    NVIDIA publie Nemotron 3.5 Content Safety, un modèle de sécurité multimodal personnalisable

    NVIDIA publie Nemotron 3.5 Content Safety, un modèle de sécurité de contenu multimodal et multilingue de 4B paramètres construit sur Gemma 3 4B IT。

    Motif de la recommandation :L'article détaille les capacités de sécurité multimodale et multilingue de Nemotron 3.5, ainsi que les modes d'inférence et les options de déploiement, ce qui aide le lecteur à évaluer son intégration dans des pipelines de production.

5mois18jourlundi
  1. Google DeepMind88

    Google DeepMind lance Gemini Omni Flash, un modèle de génération vidéo multimodale

    Google DeepMind annonce Gemini Omni, une nouvelle famille de modèles capable de créer du contenu à partir de n'importe quelle entrée。

    Motif de la recommandation :Google DeepMind présente Gemini Omni Flash, un modèle multimodal capable de générer et d'éditer des vidéos à partir de plusieurs entrées, avec un déploiement immédiat sur plusieurs produits.

5mois17jourdimanche
5mois16joursamedi
4mois30jourjeudi
  1. Google DeepMind62

    Google DeepMind lance l'initiative de recherche AI co-clinician pour explorer le modèle de soins triadiques

    Google DeepMind annonce l'initiative de recherche AI co-clinician, qui vise à faire de l'IA un membre collaboratif de l'équipe soignante。

    Motif de la recommandation :L'original expose la conception d'architecture et les résultats d'évaluation de l'IA co-clinicien, permettant de comprendre les capacités et les limites actuelles de l'IA dans les scénarios médicaux.

4mois28jourmardi
  1. Hugging Face Blog78

    NVIDIA lance Nemotron 3 Nano Omni, un modèle omni-modal pour documents, audio et vidéo

    NVIDIA publie Nemotron 3 Nano Omni, un modèle de compréhension omni-modal conçu pour l'analyse de documents。

    Motif de la recommandation :L'original détaille l'architecture hybride Mamba-Transformer-MoE et les gains sur les benchmarks documents, vidéo et audio, ce qui permet de situer les capacités omni-modales ouvertes.

4mois16jourjeudi
  1. Google DeepMind70

    Google DeepMind dévoile Gemini 3.1 Flash TTS avec balises audio

    Google DeepMind annonce Gemini 3.1 Flash TTS, un nouveau modèle de synthèse vocale offrant un contrôle granulaire via des balises audio en langage naturel. Le modèle atteint un score Elo de 1 211 sur le classement TTS d'Artificial Analysis, prend en charge plus de 70 langues et le dialogue multi-locuteurs natif. Il est déployé en preview pour les développeurs via l'API Gemini et Google AI Studio, pour les entreprises sur Vertex AI, et pour les utilisateurs Workspace via Google Vids. Tous les audios générés sont marqués par SynthID.

    Motif de la recommandation :Le nouveau modèle de synthèse vocale introduit des balises audio en langage naturel et un support de plus de 70 langues, avec un déploiement en preview via l'API Gemini et Vertex AI.

4mois9jourjeudi
4mois3jourvendredi
4mois2jourjeudi
  1. Hugging Face Blog88

    Google DeepMind publie la famille Gemma 4 de modèles multimodaux ouverts sur Hugging Face

    Google DeepMind publie sur Hugging Face la famille Gemma 4, des modèles multimodaux sous licence Apache 2.0 capables de traiter texte。

    Motif de la recommandation :L'article détaille l'architecture, les tailles et les benchmarks de Gemma 4, ainsi que son intégration dans les principaux moteurs d'inférence et outils de fine-tuning.

4mois1jourmercredi
3mois31jourmardi
  1. Hugging Face Blog67

    IBM publie Granite 4.0 3B Vision, un VLM compact pour les documents d'entreprise

    IBM annonce Granite 4.0 3B Vision, un modèle vision-langage compact destiné à l'extraction d'informations dans les documents d'entreprise。

    Motif de la recommandation :Le modèle compact et son adaptateur LoRA sont décrits avec les benchmarks de tableaux, graphiques et KVP, ce qui aide à juger son intérêt pour l'extraction documentaire.

3mois29jourdimanche
3mois26jourjeudi
  1. Google DeepMind80

    Google DeepMind publie Gemini 3.1 Flash Live, son modèle vocal le plus abouti

    Google DeepMind publie Gemini 3.1 Flash Live, présenté comme son modèle audio et vocal de plus haute qualité。

    Motif de la recommandation :Le modèle de voix de Google DeepMind améliore la précision et réduit la latence, avec des scores sur ComplexFuncBench Audio et Audio MultiChallenge qui permettent de situer les capacités de dialogue en temps réel.

  2. Google DeepMind73

    Google DeepMind lance Lyria 3 Pro, génération musicale jusqu'à 3 minutes

    Google DeepMind présente Lyria 3 Pro, une version avancée de son modèle de génération musicale capable de créer des morceaux allant jusqu'à 3 minutes avec une meilleure compréhension de la composition, permettant de demander des intros, couplets, refrains et ponts. Le modèle arrive en aperçu public sur Vertex AI et rejoint Google AI Studio, l'API Gemini, Google Vids, l'application Gemini et ProducerAI, avec un déploiement auprès des clients Workspace et des abonnés payants. Toutes les sorties sont marquées par SynthID et le modèle ne reproduit pas les artistes nommés dans les prompts.

    Motif de la recommandation :Lyria 3 Pro allonge la génération à 3 minutes avec une conscience structurelle, et son intégration à Vertex AI, AI Studio, Vids et Gemini éclaire les usages professionnels.

3mois24jourmardi
3mois17jourmardi
  1. Hugging Face Blog67

    H Company publie Holotron-12B, un modèle multimodal computer-use à haut débit

    H Company publie Holotron-12B, un modèle multimodal computer-use post-entraîné à partir du modèle ouvert NVIDIA Nemotron-Nano-2 VL sur des données propriétaires。

    Motif de la recommandation :L'article détaille l'architecture SSM hybride et les chiffres de débit, utiles pour évaluer le déploiement d'agents computer-use à grande échelle.

  2. OpenAI News78

    OpenAI lance GPT-5.4 mini et nano

    OpenAI lance GPT-5.4 mini et nano, deux versions plus petites et plus rapides de GPT-5.4。

    Motif de la recommandation :L'original indique les scénarios ciblés par les deux petites versions de GPT-5.4, utile pour évaluer le choix de modèle pour les charges API à haut volume.

  3. Mistral AI82

    Mistral AI publie Mistral Small 4, un modèle hybride unifiant raisonnement, multimodal et codage agentique

    Mistral AI annonce Mistral Small 4, le premier modèle Mistral à unifier les capacités de Magistral (raisonnement)。

    Motif de la recommandation :Mistral Small 4 unifie les capacités de Magistral, Pixtral et Devstral dans un seul modèle open source, avec un paramètre reasoning_effort configurable et des gains de latence et de débit mesurés par rapport à Small 3.