Diffusion Controller : comment unifier et simplifier la génération d'images IA
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
OpenAI a lancé ChatGPT Images 2.0, avec un rendu de texte, un support multilingue et un raisonnement visuel améliorés. Le texte source renvoie également aux nouveautés d'Images 2.5.
ChatGPT permet de générer et d'affiner des images à partir de prompts clairs。
OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.
OpenAI et NORAD s'associent pour enrichir « NORAD Tracks Santa » avec trois outils ChatGPT permettant aux familles de créer des elfes festifs。
OpenAI ajoute à ChatGPT for Business le modèle o3, la génération d'images。
OpenAI 于 2025 年推出 GPT-4o 的原生图像生成功能, 具备更强的文本渲染和指令遵循能力. 文中还提及可探索 ChatGPT Images 2.5.
OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。
Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.
OpenAI a simplifié, stabilisé et mis à l'échelle les modèles de cohérence en temps continu。
OpenAI 发布 Consistency Models, 指出扩散模型虽推动了图像, 音频和视频生成, 但依赖迭代采样过程, 导致生成速度较慢.
OpenAI présente des techniques d'entraînement améliorées pour les Consistency Models。
Canva, plateforme de communication visuelle utilisée par plus de 175 millions de personnes chaque mois。
OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.
Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.
DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise. OpenAI indique avoir développé une pile de mesures de sécurité pour préparer DALL·E 3 à une diffusion plus large et partage des mises à jour sur ses recherches en matière de provenance.
OpenAI publie la fiche système de DALL·E 3.
OpenAI présente Point-E, un système permettant de générer des nuages de points 3D à partir de prompts complexes.
OpenAI annonce que l'API DALL·E est désormais disponible en bêta publique. À partir d'aujourd'hui, les développeurs peuvent commencer à créer des applications avec l'API DALL·E.
Motif de la recommandation :L'API DALL·E passe en bêta publique, permettant aux développeurs d'intégrer la génération d'images dans leurs applications.
OpenAI annonce que DALL·E est désormais accessible sans liste d'attente。
Motif de la recommandation :L'ouverture de DALL·E sans liste d'attente et les enseignements tirés du déploiement éclairent l'évolution des conditions d'accès aux outils de génération d'images.
OpenAI annonce l'arrivée de l'outpainting dans DALL·E, une fonctionnalité qui permet d'étendre une image au-delà de ses limites d'origine et de produire des visuels de n'importe quelle taille.
OpenAI annonce que DALL·E est disponible en version bêta et invite progressivement 1 million de personnes de la liste d'attente au cours des prochaines semaines. Les utilisateurs peuvent créer avec des crédits gratuits renouvelés chaque mois, et acheter des crédits supplémentaires par tranches de 115 générations pour 15 dollars.
Motif de la recommandation :L'original précise le quota d'invitations, le crédit mensuel gratuit et le prix des crédits supplémentaires, ce qui permet de juger du coût d'usage de DALL·E en version bêta.
OpenAI annonce la mise en œuvre d'une nouvelle technique afin que DALL·E génère des images de personnes reflétant plus fidèlement la diversité de la population mondiale. Cette mise à jour s'inscrit dans les efforts de réduction des biais et d'amélioration de la sécurité du modèle.
Dans le cadre de l'aperçu de recherche DALL·E 2, plus de 3 000 artistes de plus de 118 pays ont intégré DALL·E à leurs flux de travail créatifs. Les artistes du groupe d'accès anticipé ont aidé à découvrir de nouveaux usages de DALL·E et ont été des voix clés dans les décisions sur ses fonctionnalités.
OpenAI présente les mesures de pré-entraînement de DALL·E 2。
Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.
OpenAI annonce une mise à jour de la preview de recherche de DALL·E 2 。
Motif de la recommandation :L'annonce expose l'échelle d'usage de la preview et le rythme d'ouverture de la liste d'attente, utile pour suivre le déploiement de DALL·E 2.
OpenAI 发布研究« Hierarchical text-conditional image generation with CLIP latents », 探讨基于 CLIP latents 的层次化文本条件图像生成方法. 原文正文未能获取, 仅可确认标题所指向的研究主题.
OpenAI annonce avoir entraîné un réseau neuronal nommé DALL·E qui crée des images à partir de légendes textuelles, pour une large gamme de concepts exprimables en langage naturel.
Motif de la recommandation :Un réseau neuronal nommé DALL·E génère des images à partir de légendes textuelles, ce qui permet de situer le jalon de la génération texte-image.
OpenAI 发现, 正如在大规模语言上训练的 Transformer 模型能够生成连贯文本, 同一模型在像素序列上训练后也能生成连贯的图像补全与样本. 通过建立样本质量与图像分类准确率之间的相关性, OpenAI 表明其最佳生成模型在无监督设置下也包含可与顶级卷积网络媲美的特征.
Motif de la recommandation :OpenAI 展示同一 Transformer 架构在像素序列上也能生成连贯图像, 并给出生成质量与分类精度的关联.
OpenAI a créé MuseNet, un réseau neuronal profond capable de générer des compositions musicales de 4 minutes avec 10 instruments différents et de combiner des styles allant de la country à Mozart en passant par les Beatles. MuseNet n'a pas été programmé explicitement avec une compréhension musicale, mais a découvert des motifs d'harmonie, de rythme et de style en apprenant à prédire le token suivant dans des centaines de milliers de fichiers MIDI. Il utilise la même technologie non supervisée généraliste que GPT-2, un grand modèle Transformer entraîné à prédire le token suivant dans une séquence, qu'il s'agisse d'audio ou de texte.
Motif de la recommandation :MuseNet montre comment une architecture Transformer généraliste, celle de GPT-2, peut être réutilisée pour générer de la musique sur des fichiers MIDI.
OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.