Aller au contenu
8mois28jourvendredi
  1. Google DeepMind76

    Google DeepMind lance Gemini Omni 1.1 Flash avec des contrôles créatifs pour la vidéo générative

    Google DeepMind annonce Gemini Omni 1.1 Flash, une mise à jour de ses capacités de génération vidéo destinée aux développeurs via la Gemini API dans Google AI Studio. Le modèle peut analyser jusqu'à 10 secondes de contexte vidéo antérieur pour l'extension de scène, contre une seconde auparavant, avec des extensions par tranches de 10 secondes jusqu'à 40 secondes cumulées. Il ajoute l'interpolation entre première et dernière images, la génération de prévisualisations 360p jusqu'à 60 % plus rapides et à un tiers du coût du 720p, l'upscaling jusqu'en 4K, ainsi que la référence de vidéos jusqu'à trois secondes en entrée multimodale. Omni 1.1 est disponible dans Google AI Studio, via l'Agent Platform API pour les entreprises, et pour les abonnés Google AI Plus, Pro et Ultra dans Google Flow, l'extension de scène étant accessible dans l'application Gemini.

    Motif de la recommandation :L'original détaille les contrôles créatifs et les paliers de coût de la génération vidéo, utile pour évaluer les workflows de production existants.

7mois15jourmercredi
  1. Hugging Face Blog88

    Thinking Machines Lab publie Inkling, un LLM multimodal open source de 1T paramètres avec fenêtre de contexte de 1M

    Thinking Machines Lab a publié sur Hugging Face Inkling, un grand modèle de langage multimodal open source d'environ 1T de paramètres (975B au total。

    Motif de la recommandation :L'article détaille l'architecture MoE, les variantes de quantification et le support d'inférence jour 0, ce qui aide à évaluer les besoins matériels et les options de déploiement.

7mois1jourmercredi
1mois16jourvendredi
9mois30jourmardi
12mois9jourlundi