OpenAI a lancé ChatGPT Images 2.0, avec un rendu de texte, un support multilingue et un raisonnement visuel améliorés. Le texte source renvoie également aux nouveautés d'Images 2.5.
OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.
OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。
Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.
OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.
Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.
DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise. OpenAI indique avoir développé une pile de mesures de sécurité pour préparer DALL·E 3 à une diffusion plus large et partage des mises à jour sur ses recherches en matière de provenance.
OpenAI annonce que l'API DALL·E est désormais disponible en bêta publique. À partir d'aujourd'hui, les développeurs peuvent commencer à créer des applications avec l'API DALL·E.
Motif de la recommandation :L'API DALL·E passe en bêta publique, permettant aux développeurs d'intégrer la génération d'images dans leurs applications.
OpenAI annonce que DALL·E est désormais accessible sans liste d'attente。
Motif de la recommandation :L'ouverture de DALL·E sans liste d'attente et les enseignements tirés du déploiement éclairent l'évolution des conditions d'accès aux outils de génération d'images.
OpenAI annonce l'arrivée de l'outpainting dans DALL·E, une fonctionnalité qui permet d'étendre une image au-delà de ses limites d'origine et de produire des visuels de n'importe quelle taille.
OpenAI annonce que DALL·E est disponible en version bêta et invite progressivement 1 million de personnes de la liste d'attente au cours des prochaines semaines. Les utilisateurs peuvent créer avec des crédits gratuits renouvelés chaque mois, et acheter des crédits supplémentaires par tranches de 115 générations pour 15 dollars.
Motif de la recommandation :L'original précise le quota d'invitations, le crédit mensuel gratuit et le prix des crédits supplémentaires, ce qui permet de juger du coût d'usage de DALL·E en version bêta.
OpenAI présente les mesures de pré-entraînement de DALL·E 2。
Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.
OpenAI annonce une mise à jour de la preview de recherche de DALL·E 2 。
Motif de la recommandation :L'annonce expose l'échelle d'usage de la preview et le rythme d'ouverture de la liste d'attente, utile pour suivre le déploiement de DALL·E 2.
OpenAI annonce avoir entraîné un réseau neuronal nommé DALL·E qui crée des images à partir de légendes textuelles, pour une large gamme de concepts exprimables en langage naturel.
Motif de la recommandation :Un réseau neuronal nommé DALL·E génère des images à partir de légendes textuelles, ce qui permet de situer le jalon de la génération texte-image.
OpenAI a créé MuseNet, un réseau neuronal profond capable de générer des compositions musicales de 4 minutes avec 10 instruments différents et de combiner des styles allant de la country à Mozart en passant par les Beatles. MuseNet n'a pas été programmé explicitement avec une compréhension musicale, mais a découvert des motifs d'harmonie, de rythme et de style en apprenant à prédire le token suivant dans des centaines de milliers de fichiers MIDI. Il utilise la même technologie non supervisée généraliste que GPT-2, un grand modèle Transformer entraîné à prédire le token suivant dans une séquence, qu'il s'agisse d'audio ou de texte.
Motif de la recommandation :MuseNet montre comment une architecture Transformer généraliste, celle de GPT-2, peut être réutilisée pour générer de la musique sur des fichiers MIDI.