Aller au contenu
  1. OpenAI News91

    Les modèles de génération vidéo comme simulateurs du monde

    OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.

    Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.

  1. OpenAI News60

    OpenAI détaille les mesures de pré-entraînement de DALL·E 2

    OpenAI présente les mesures de pré-entraînement de DALL·E 2。

    Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.

  1. OpenAI News88

    基于 CLIP latents 的层次化文本条件图像生成

    OpenAI 发布研究« Hierarchical text-conditional image generation with CLIP latents », 探讨基于 CLIP latents 的层次化文本条件图像生成方法. 原文正文未能获取, 仅可确认标题所指向的研究主题.

  1. OpenAI News70

    OpenAI 发布 Image GPT :用 Transformer 生成图像

    OpenAI 发现, 正如在大规模语言上训练的 Transformer 模型能够生成连贯文本, 同一模型在像素序列上训练后也能生成连贯的图像补全与样本. 通过建立样本质量与图像分类准确率之间的相关性, OpenAI 表明其最佳生成模型在无监督设置下也包含可与顶级卷积网络媲美的特征.

    Motif de la recommandation :OpenAI 展示同一 Transformer 架构在像素序列上也能生成连贯图像, 并给出生成质量与分类精度的关联.

Fin de la liste