Motif de la recommandation :L'architecture sans encodeur et l'exécution locale sur 16 Go de VRAM permettent de juger de l'impact sur les déploiements embarqués.
Motif de la recommandation :L'article détaille les capacités de sécurité multimodale et multilingue de Nemotron 3.5, ainsi que les modes d'inférence et les options de déploiement, ce qui aide le lecteur à évaluer son intégration dans des pipelines de production.
Motif de la recommandation :Google DeepMind présente Gemini Omni Flash, un modèle multimodal capable de générer et d'éditer des vidéos à partir de plusieurs entrées, avec un déploiement immédiat sur plusieurs produits.
Motif de la recommandation :Google étend SynthID et C2PA à Search, Gemini, Chrome et Pixel, avec une API de détection sur Cloud, ce qui éclaire la traçabilité des contenus générés.
Motif de la recommandation :L'original expose la conception d'architecture et les résultats d'évaluation de l'IA co-clinicien, permettant de comprendre les capacités et les limites actuelles de l'IA dans les scénarios médicaux.
Motif de la recommandation :L'original détaille l'architecture hybride Mamba-Transformer-MoE et les gains sur les benchmarks documents, vidéo et audio, ce qui permet de situer les capacités omni-modales ouvertes.
Google DeepMind annonce Gemini 3.1 Flash TTS, un nouveau modèle de synthèse vocale offrant un contrôle granulaire via des balises audio en langage naturel. Le modèle atteint un score Elo de 1 211 sur le classement TTS d'Artificial Analysis, prend en charge plus de 70 langues et le dialogue multi-locuteurs natif. Il est déployé en preview pour les développeurs via l'API Gemini et Google AI Studio, pour les entreprises sur Vertex AI, et pour les utilisateurs Workspace via Google Vids. Tous les audios générés sont marqués par SynthID.
Motif de la recommandation :Le nouveau modèle de synthèse vocale introduit des balises audio en langage naturel et un support de plus de 70 langues, avec un déploiement en preview via l'API Gemini et Vertex AI.
Motif de la recommandation :La v5.4 de Sentence Transformers unifie texte, image, audio et vidéo dans une même API d'embedding et de reranking, avec la liste des modèles compatibles.
Motif de la recommandation :L'original détaille les quatre tailles de Gemma 4, la licence Apache 2.0 et les performances comparées sur Arena, ce qui permet de juger de son intérêt pour le déploiement local et l'edge.
Motif de la recommandation :L'article détaille l'architecture, les tailles et les benchmarks de Gemma 4, ainsi que son intégration dans les principaux moteurs d'inférence et outils de fine-tuning.
Motif de la recommandation :Falcon Perception et Falcon OCR adoptent une architecture Transformer à fusion précoce unique, avec des benchmarks détaillés et un code open source pour comparer les compromis de conception.
Motif de la recommandation :Le modèle compact et son adaptateur LoRA sont décrits avec les benchmarks de tableaux, graphiques et KVP, ce qui aide à juger son intérêt pour l'extraction documentaire.
Motif de la recommandation :Google DeepMind expose quatre principes d'interaction et des démos d'un pointeur assisté par Gemini, avec un déploiement déjà amorcé dans Chrome.
Motif de la recommandation :Le modèle de voix de Google DeepMind améliore la précision et réduit la latence, avec des scores sur ComplexFuncBench Audio et Audio MultiChallenge qui permettent de situer les capacités de dialogue en temps réel.
Google DeepMind présente Lyria 3 Pro, une version avancée de son modèle de génération musicale capable de créer des morceaux allant jusqu'à 3 minutes avec une meilleure compréhension de la composition, permettant de demander des intros, couplets, refrains et ponts. Le modèle arrive en aperçu public sur Vertex AI et rejoint Google AI Studio, l'API Gemini, Google Vids, l'application Gemini et ProducerAI, avec un déploiement auprès des clients Workspace et des abonnés payants. Toutes les sorties sont marquées par SynthID et le modèle ne reproduit pas les artistes nommés dans les prompts.
Motif de la recommandation :Lyria 3 Pro allonge la génération à 3 minutes avec une conscience structurelle, et son intégration à Vertex AI, AI Studio, Vids et Gemini éclaire les usages professionnels.
Motif de la recommandation :Mistral publie son premier modèle TTS avec architecture, latence et tarification détaillées, utile pour évaluer les briques vocales d'un agent.
H Company publie Holotron-12B, un modèle multimodal computer-use post-entraîné à partir du modèle ouvert NVIDIA Nemotron-Nano-2 VL sur des données propriétaires。
Motif de la recommandation :L'article détaille l'architecture SSM hybride et les chiffres de débit, utiles pour évaluer le déploiement d'agents computer-use à grande échelle.
Motif de la recommandation :L'original indique les scénarios ciblés par les deux petites versions de GPT-5.4, utile pour évaluer le choix de modèle pour les charges API à haut volume.
Motif de la recommandation :Mistral Small 4 unifie les capacités de Magistral, Pixtral et Devstral dans un seul modèle open source, avec un paramètre reasoning_effort configurable et des gains de latence et de débit mesurés par rapport à Small 3.