Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.
Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.
Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.
OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.