Aller au contenu
9mois25jourvendredi
  1. Google Research70

    Google Research présente un cadre multi-agents pour automatiser la génération vidéo longue cohérente

    Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.

    Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.

9mois23jourmercredi
9mois21jourlundi
9mois16jourmercredi
9mois10jourjeudi
  1. Hugging Face Blog62

    Reconstruire AUTOMATIC1111 avec Gradio Workflow : 11 pipelines et 73 nœuds

    Hugging Face présente Workflow1111, un canevas de workflow unique qui reconstruit la plupart des fonctionnalités d'AUTOMATIC1111 sous forme de 11 pipelines multimédias construits avec 73 nœuds. Le canevas couvre la génération texte-image, le hi-resolution fix, l'image-to-image, la matrice de prompts, l'interrogation VLM, la détection vers masque d'inpainting, les annotateurs de style ControlNet, la suppression d'arrière-plan, le stockage PNG Info et l'image-to-video, avec des modèles comme FLUX.1-Kontext, Qwen3-4B, Qwen2.5-VL, DETR, AuraSR ×4, BRIA RMBG-2.0 et Wan 2.2 I2V A14B. Chaque nœud de sortie devient un point d'accès REST, et avec mcp_server=True, ces points d'accès deviennent des outils MCP appelables par des assistants IA comme Claude Code ou Cursor.

    Motif de la recommandation :L'article détaille comment reconstruire l'ensemble des fonctionnalités d'AUTOMATIC1111 avec 73 nœuds Gradio Workflow, et comment chaque sortie devient un point d'accès REST et un outil MCP.

9mois2jourmercredi
8mois28jourvendredi
  1. Google DeepMind76

    Google DeepMind lance Gemini Omni 1.1 Flash avec des contrôles créatifs pour la vidéo générative

    Google DeepMind annonce Gemini Omni 1.1 Flash, une mise à jour de ses capacités de génération vidéo destinée aux développeurs via la Gemini API dans Google AI Studio. Le modèle peut analyser jusqu'à 10 secondes de contexte vidéo antérieur pour l'extension de scène, contre une seconde auparavant, avec des extensions par tranches de 10 secondes jusqu'à 40 secondes cumulées. Il ajoute l'interpolation entre première et dernière images, la génération de prévisualisations 360p jusqu'à 60 % plus rapides et à un tiers du coût du 720p, l'upscaling jusqu'en 4K, ainsi que la référence de vidéos jusqu'à trois secondes en entrée multimodale. Omni 1.1 est disponible dans Google AI Studio, via l'Agent Platform API pour les entreprises, et pour les abonnés Google AI Plus, Pro et Ultra dans Google Flow, l'extension de scène étant accessible dans l'application Gemini.

    Motif de la recommandation :L'original détaille les contrôles créatifs et les paliers de coût de la génération vidéo, utile pour évaluer les workflows de production existants.

7mois15jourmercredi
  1. Hugging Face Blog88

    Thinking Machines Lab publie Inkling, un LLM multimodal open source de 1T paramètres avec fenêtre de contexte de 1M

    Thinking Machines Lab a publié sur Hugging Face Inkling, un grand modèle de langage multimodal open source d'environ 1T de paramètres (975B au total。

    Motif de la recommandation :L'article détaille l'architecture MoE, les variantes de quantification et le support d'inférence jour 0, ce qui aide à évaluer les besoins matériels et les options de déploiement.

7mois1jourmercredi
3mois23jourlundi
2mois3jourmardi
1mois21jourmercredi
1mois16jourvendredi
1mois14jourmercredi
  1. Google DeepMind75

    Google DeepMind met à jour Veo 3.1 Ingredients to Video avec la cohérence et le format vertical

    Google DeepMind améliore Veo 3.1 Ingredients to Video, sa capacité de génération vidéo à partir d'images de référence。

    Motif de la recommandation :L'original détaille les améliorations de cohérence des personnages et des arrière-plans ainsi que les sorties verticales natives, ce qui permet de juger de l'impact sur les flux de création vidéo mobile.

12mois11jourjeudi
9mois30jourmardi
7mois17jourjeudi
12mois9jourlundi
  1. OpenAI News88

    OpenAI rend Sora disponible sur sora.com

    OpenAI annonce que son modèle de génération vidéo Sora est désormais utilisable sur sora.com. Les utilisateurs peuvent générer des vidéos jusqu'à 1080p。

    Motif de la recommandation :Sora est accessible via sora.com avec des vidéos jusqu'à 1080p et 20 secondes, ce qui permet de mesurer les capacités réelles du modèle.

2mois15jourjeudi
  1. OpenAI News91

    Les modèles de génération vidéo comme simulateurs du monde

    OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.

    Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.

1mois3jourmardi