Google DeepMind annonce Nano Banana 2 Lite (gemini-3.1-flash-lite-image), son modèle d'image Gemini le plus rapide et le plus économique。
Motif de la recommandation :Deux modèles génératifs de Google DeepMind précisent latence, coût et limites, ce qui aide à évaluer leur intégration dans des pipelines multimédia.
OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.
Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image), un modèle de génération et d'édition d'images construit sur Gemini 3 Pro。
Motif de la recommandation :L'original détaille les capacités de génération et d'édition d'images, les résolutions et les intégrations, ce qui aide le lecteur à évaluer les scénarios de production concernés.
Google DeepMind présente Nano Banana Pro (Gemini 3 Pro Image), un nouveau modèle de génération et d'édition d'images construit sur Gemini 3 Pro。
Motif de la recommandation :Présentation des capacités de Nano Banana Pro et de sa disponibilité dans les produits Google, utile pour situer les usages de génération et d'édition d'images.
OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。
Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.
Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN。
Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.
Segmind a mis en open source le code d'entraînement et les poids de ses modèles SD-Small et SD-Tiny。
Motif de la recommandation :L'article détaille la méthode de distillation par suppression de blocs et publie le code et les poids, ce qui permet de reproduire et d'adapter ces modèles compressés.
OpenAI annonce avoir entraîné un réseau neuronal nommé DALL·E qui crée des images à partir de légendes textuelles, pour une large gamme de concepts exprimables en langage naturel.
Motif de la recommandation :Un réseau neuronal nommé DALL·E génère des images à partir de légendes textuelles, ce qui permet de situer le jalon de la génération texte-image.
OpenAI a créé MuseNet, un réseau neuronal profond capable de générer des compositions musicales de 4 minutes avec 10 instruments différents et de combiner des styles allant de la country à Mozart en passant par les Beatles. MuseNet n'a pas été programmé explicitement avec une compréhension musicale, mais a découvert des motifs d'harmonie, de rythme et de style en apprenant à prédire le token suivant dans des centaines de milliers de fichiers MIDI. Il utilise la même technologie non supervisée généraliste que GPT-2, un grand modèle Transformer entraîné à prédire le token suivant dans une séquence, qu'il s'agisse d'audio ou de texte.
Motif de la recommandation :MuseNet montre comment une architecture Transformer généraliste, celle de GPT-2, peut être réutilisée pour générer de la musique sur des fichiers MIDI.