Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.
Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.
Google DeepMind lance Gemini 3.8 Live with Live Avatar.
Motif de la recommandation :L'original détaille les capacités visuelles temps réel, l'exécution asynchrone d'outils et la prise en charge de 97 langues, ce qui aide à évaluer l'usage en entreprise.
Hugging Face présente Workflow1111, un canevas de workflow unique qui reconstruit la plupart des fonctionnalités d'AUTOMATIC1111 sous forme de 11 pipelines multimédias construits avec 73 nœuds. Le canevas couvre la génération texte-image, le hi-resolution fix, l'image-to-image, la matrice de prompts, l'interrogation VLM, la détection vers masque d'inpainting, les annotateurs de style ControlNet, la suppression d'arrière-plan, le stockage PNG Info et l'image-to-video, avec des modèles comme FLUX.1-Kontext, Qwen3-4B, Qwen2.5-VL, DETR, AuraSR ×4, BRIA RMBG-2.0 et Wan 2.2 I2V A14B. Chaque nœud de sortie devient un point d'accès REST, et avec mcp_server=True, ces points d'accès deviennent des outils MCP appelables par des assistants IA comme Claude Code ou Cursor.
Motif de la recommandation :L'article détaille comment reconstruire l'ensemble des fonctionnalités d'AUTOMATIC1111 avec 73 nœuds Gradio Workflow, et comment chaque sortie devient un point d'accès REST et un outil MCP.
Google DeepMind lance la compréhension vidéo agentique sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite。
Motif de la recommandation :L'original expose les chiffres de réduction de tokens et de coûts ainsi que le mode d'activation par API, ce qui permet d'évaluer l'intérêt pour l'analyse de vidéos longues.
Google DeepMind annonce Gemini Omni 1.1 Flash, une mise à jour de ses capacités de génération vidéo destinée aux développeurs via la Gemini API dans Google AI Studio. Le modèle peut analyser jusqu'à 10 secondes de contexte vidéo antérieur pour l'extension de scène, contre une seconde auparavant, avec des extensions par tranches de 10 secondes jusqu'à 40 secondes cumulées. Il ajoute l'interpolation entre première et dernière images, la génération de prévisualisations 360p jusqu'à 60 % plus rapides et à un tiers du coût du 720p, l'upscaling jusqu'en 4K, ainsi que la référence de vidéos jusqu'à trois secondes en entrée multimodale. Omni 1.1 est disponible dans Google AI Studio, via l'Agent Platform API pour les entreprises, et pour les abonnés Google AI Plus, Pro et Ultra dans Google Flow, l'extension de scène étant accessible dans l'application Gemini.
Motif de la recommandation :L'original détaille les contrôles créatifs et les paliers de coût de la génération vidéo, utile pour évaluer les workflows de production existants.
Thinking Machines Lab a publié sur Hugging Face Inkling, un grand modèle de langage multimodal open source d'environ 1T de paramètres (975B au total。
Motif de la recommandation :L'article détaille l'architecture MoE, les variantes de quantification et le support d'inférence jour 0, ce qui aide à évaluer les besoins matériels et les options de déploiement.
Google DeepMind annonce Nano Banana 2 Lite (gemini-3.1-flash-lite-image), son modèle d'image Gemini le plus rapide et le plus économique。
Motif de la recommandation :Deux modèles génératifs de Google DeepMind précisent latence, coût et limites, ce qui aide à évaluer leur intégration dans des pipelines multimédia.
Google DeepMind annonce Gemini Omni, une nouvelle famille de modèles capable de créer du contenu à partir de n'importe quelle entrée。
Motif de la recommandation :Google DeepMind présente Gemini Omni Flash, un modèle multimodal capable de générer et d'éditer des vidéos à partir de plusieurs entrées, avec un déploiement immédiat sur plusieurs produits.
NVIDIA publie Nemotron 3 Nano Omni, un modèle de compréhension omni-modal conçu pour l'analyse de documents。
Motif de la recommandation :L'original détaille l'architecture hybride Mamba-Transformer-MoE et les gains sur les benchmarks documents, vidéo et audio, ce qui permet de situer les capacités omni-modales ouvertes.
Overworld publie Waypoint-1.5, son nouveau modèle de monde vidéo temps réel。
Motif de la recommandation :L'original expose les paliers de résolution, la plage matérielle et les modes d'exécution locale, ce qui permet de juger de l'accessibilité réelle du modèle.
Overworld publie Waypoint-1, un modèle de diffusion vidéo interactif en temps réel contrôlable à la souris。
Motif de la recommandation :L'original expose l'architecture et les optimisations d'inférence d'un modèle de diffusion vidéo interactif, utile pour comprendre les compromis des world models temps réel.
Google DeepMind présente D4RT (Dynamic 4D Reconstruction and Tracking)。
Motif de la recommandation :L'article présente l'architecture unifiée de D4RT et son efficacité jusqu'à 300 fois supérieure, utile pour évaluer les pistes de déploiement en robotique et en RA.
Google DeepMind améliore Veo 3.1 Ingredients to Video, sa capacité de génération vidéo à partir d'images de référence。
Motif de la recommandation :L'original détaille les améliorations de cohérence des personnages et des arrière-plans ainsi que les sorties verticales natives, ce qui permet de juger de l'impact sur les flux de création vidéo mobile.
Disney et OpenAI ont conclu un accord pour intégrer plus de 200 personnages Disney。
Motif de la recommandation :L'accord couvre plus de 200 personnages Disney et l'adoption de ChatGPT Enterprise, ce qui éclaire l'usage de l'IA générative dans le divertissement.
OpenAI annonce Sora 2, un modèle de génération vidéo capable de produire des dialogues et des effets sonores synchronisés. Le produit Sora n'est plus disponible.
OpenAI publie Sora 2, un nouveau modèle de génération vidéo et audio. Selon OpenAI。
Motif de la recommandation :L'original présente les capacités de génération vidéo et audio de Sora 2, permettant de situer les changements par rapport à la version précédente.
OpenAI annonce le lancement de Sora 2 et de l'application Sora。
Motif de la recommandation :L'article expose les mesures de sécurité de Sora 2 et de l'application Sora, permettant de comprendre comment OpenAI encadre un modèle vidéo et une plateforme sociale de création.
OpenAI annonce que son modèle de génération vidéo Sora est désormais utilisable sur sora.com. Les utilisateurs peuvent générer des vidéos jusqu'à 1080p。
Motif de la recommandation :Sora est accessible via sora.com avec des vidéos jusqu'à 1080p et 20 secondes, ce qui permet de mesurer les capacités réelles du modèle.
Hugging Face publie les détails techniques de FineVideo, un jeu de données de 43 000 vidéos totalisant 3 400 heures。
Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.