Aller au contenu
  1. OpenAI News78

    OpenAI lance ChatGPT Images et GPT-Image-1.5

    OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.

  1. OpenAI News80

    OpenAI 在 GPT-4o 中引入原生图像生成

    OpenAI 于 2025 年推出 GPT-4o 的原生图像生成功能, 具备更强的文本渲染和指令遵循能力. 文中还提及可探索 ChatGPT Images 2.5.

  2. OpenAI News80

    OpenAI publie un addendum à la fiche système de GPT-4o sur la génération d'images

    OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。

    Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.

  1. OpenAI News91

    Les modèles de génération vidéo comme simulateurs du monde

    OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.

    Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.

  1. OpenAI News78

    DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise

    DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise. OpenAI indique avoir développé une pile de mesures de sécurité pour préparer DALL·E 3 à une diffusion plus large et partage des mises à jour sur ses recherches en matière de provenance.

  1. OpenAI News70

    L'API DALL·E est disponible en bêta publique

    OpenAI annonce que l'API DALL·E est désormais disponible en bêta publique. À partir d'aujourd'hui, les développeurs peuvent commencer à créer des applications avec l'API DALL·E.

    Motif de la recommandation :L'API DALL·E passe en bêta publique, permettant aux développeurs d'intégrer la génération d'images dans leurs applications.

  1. OpenAI News80

    DALL·E désormais accessible sans liste d'attente

    OpenAI annonce que DALL·E est désormais accessible sans liste d'attente。

    Motif de la recommandation :L'ouverture de DALL·E sans liste d'attente et les enseignements tirés du déploiement éclairent l'évolution des conditions d'accès aux outils de génération d'images.

  1. OpenAI News62

    DALL·E introduit l'outpainting

    OpenAI annonce l'arrivée de l'outpainting dans DALL·E, une fonctionnalité qui permet d'étendre une image au-delà de ses limites d'origine et de produire des visuels de n'importe quelle taille.

  1. OpenAI News88

    DALL·E entre en version bêta et ouvre les invitations

    OpenAI annonce que DALL·E est disponible en version bêta et invite progressivement 1 million de personnes de la liste d'attente au cours des prochaines semaines. Les utilisateurs peuvent créer avec des crédits gratuits renouvelés chaque mois, et acheter des crédits supplémentaires par tranches de 115 générations pour 15 dollars.

    Motif de la recommandation :L'original précise le quota d'invitations, le crédit mensuel gratuit et le prix des crédits supplémentaires, ce qui permet de juger du coût d'usage de DALL·E en version bêta.

  1. OpenAI News60

    OpenAI détaille les mesures de pré-entraînement de DALL·E 2

    OpenAI présente les mesures de pré-entraînement de DALL·E 2。

    Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.

  1. OpenAI News78

    OpenAI met à jour la preview de recherche de DALL·E 2

    OpenAI annonce une mise à jour de la preview de recherche de DALL·E 2 。

    Motif de la recommandation :L'annonce expose l'échelle d'usage de la preview et le rythme d'ouverture de la liste d'attente, utile pour suivre le déploiement de DALL·E 2.

  1. OpenAI News88

    基于 CLIP latents 的层次化文本条件图像生成

    OpenAI 发布研究« Hierarchical text-conditional image generation with CLIP latents », 探讨基于 CLIP latents 的层次化文本条件图像生成方法. 原文正文未能获取, 仅可确认标题所指向的研究主题.

  1. OpenAI News88

    OpenAI présente DALL·E, un réseau neuronal qui génère des images à partir de texte

    OpenAI annonce avoir entraîné un réseau neuronal nommé DALL·E qui crée des images à partir de légendes textuelles, pour une large gamme de concepts exprimables en langage naturel.

    Motif de la recommandation :Un réseau neuronal nommé DALL·E génère des images à partir de légendes textuelles, ce qui permet de situer le jalon de la génération texte-image.

  1. OpenAI News70

    OpenAI 发布 Image GPT :用 Transformer 生成图像

    OpenAI 发现, 正如在大规模语言上训练的 Transformer 模型能够生成连贯文本, 同一模型在像素序列上训练后也能生成连贯的图像补全与样本. 通过建立样本质量与图像分类准确率之间的相关性, OpenAI 表明其最佳生成模型在无监督设置下也包含可与顶级卷积网络媲美的特征.

    Motif de la recommandation :OpenAI 展示同一 Transformer 架构在像素序列上也能生成连贯图像, 并给出生成质量与分类精度的关联.

  1. OpenAI News70

    OpenAI présente MuseNet, un réseau neuronal profond capable de générer des compositions musicales

    OpenAI a créé MuseNet, un réseau neuronal profond capable de générer des compositions musicales de 4 minutes avec 10 instruments différents et de combiner des styles allant de la country à Mozart en passant par les Beatles. MuseNet n'a pas été programmé explicitement avec une compréhension musicale, mais a découvert des motifs d'harmonie, de rythme et de style en apprenant à prédire le token suivant dans des centaines de milliers de fichiers MIDI. Il utilise la même technologie non supervisée généraliste que GPT-2, un grand modèle Transformer entraîné à prédire le token suivant dans une séquence, qu'il s'agisse d'audio ou de texte.

    Motif de la recommandation :MuseNet montre comment une architecture Transformer généraliste, celle de GPT-2, peut être réutilisée pour générer de la musique sur des fichiers MIDI.

Fin de la liste