Aller au contenu
  1. Google DeepMind76

    Google DeepMind lance Gemini Omni 1.1 Flash avec des contrôles créatifs pour la vidéo générative

    Google DeepMind annonce Gemini Omni 1.1 Flash, une mise à jour de ses capacités de génération vidéo destinée aux développeurs via la Gemini API dans Google AI Studio. Le modèle peut analyser jusqu'à 10 secondes de contexte vidéo antérieur pour l'extension de scène, contre une seconde auparavant, avec des extensions par tranches de 10 secondes jusqu'à 40 secondes cumulées. Il ajoute l'interpolation entre première et dernière images, la génération de prévisualisations 360p jusqu'à 60 % plus rapides et à un tiers du coût du 720p, l'upscaling jusqu'en 4K, ainsi que la référence de vidéos jusqu'à trois secondes en entrée multimodale. Omni 1.1 est disponible dans Google AI Studio, via l'Agent Platform API pour les entreprises, et pour les abonnés Google AI Plus, Pro et Ultra dans Google Flow, l'extension de scène étant accessible dans l'application Gemini.

    Motif de la recommandation :L'original détaille les contrôles créatifs et les paliers de coût de la génération vidéo, utile pour évaluer les workflows de production existants.

  1. Hugging Face Blog88

    Thinking Machines Lab publie Inkling, un LLM multimodal open source de 1T paramètres avec fenêtre de contexte de 1M

    Thinking Machines Lab a publié sur Hugging Face Inkling, un grand modèle de langage multimodal open source d'environ 1T de paramètres (975B au total。

    Motif de la recommandation :L'article détaille l'architecture MoE, les variantes de quantification et le support d'inférence jour 0, ce qui aide à évaluer les besoins matériels et les options de déploiement.

  1. Google DeepMind80

    Google DeepMind lance Nano Banana 2 Lite et Gemini Omni Flash

    Google DeepMind annonce Nano Banana 2 Lite (gemini-3.1-flash-lite-image), son modèle d'image Gemini le plus rapide et le plus économique。

    Motif de la recommandation :Deux modèles génératifs de Google DeepMind précisent latence, coût et limites, ce qui aide à évaluer leur intégration dans des pipelines multimédia.

  1. Google DeepMind88

    Google DeepMind lance Gemini Omni Flash, un modèle de génération vidéo multimodale

    Google DeepMind annonce Gemini Omni, une nouvelle famille de modèles capable de créer du contenu à partir de n'importe quelle entrée。

    Motif de la recommandation :Google DeepMind présente Gemini Omni Flash, un modèle multimodal capable de générer et d'éditer des vidéos à partir de plusieurs entrées, avec un déploiement immédiat sur plusieurs produits.

  1. Hugging Face Blog78

    NVIDIA lance Nemotron 3 Nano Omni, un modèle omni-modal pour documents, audio et vidéo

    NVIDIA publie Nemotron 3 Nano Omni, un modèle de compréhension omni-modal conçu pour l'analyse de documents。

    Motif de la recommandation :L'original détaille l'architecture hybride Mamba-Transformer-MoE et les gains sur les benchmarks documents, vidéo et audio, ce qui permet de situer les capacités omni-modales ouvertes.

  1. Hugging Face Blog78

    Overworld publie Waypoint-1, un modèle de diffusion vidéo interactif en temps réel

    Overworld publie Waypoint-1, un modèle de diffusion vidéo interactif en temps réel contrôlable à la souris。

    Motif de la recommandation :L'original expose l'architecture et les optimisations d'inférence d'un modèle de diffusion vidéo interactif, utile pour comprendre les compromis des world models temps réel.

  1. OpenAI News82

    OpenAI publie Sora 2, un modèle de génération vidéo et audio

    OpenAI publie Sora 2, un nouveau modèle de génération vidéo et audio. Selon OpenAI。

    Motif de la recommandation :L'original présente les capacités de génération vidéo et audio de Sora 2, permettant de situer les changements par rapport à la version précédente.

  1. OpenAI News75

    Carte système de Sora

    Sora est le modèle de génération vidéo d'OpenAI, conçu pour prendre en entrée du texte。

Fin de la liste