Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
Sean Parker, cofondateur de Napster, et Prem Akkaraju, PDG de Stability AI, réorientent l'entreprise vers des outils d'IA destinés aux professionnels de la musique. Fin août.
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。
Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.
OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.
Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.
DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise. OpenAI indique avoir développé une pile de mesures de sécurité pour préparer DALL·E 3 à une diffusion plus large et partage des mises à jour sur ses recherches en matière de provenance.