Aller au contenu
  1. Google DeepMind80

    Google DeepMind lance Nano Banana 2 Lite et Gemini Omni Flash

    Google DeepMind annonce Nano Banana 2 Lite (gemini-3.1-flash-lite-image), son modèle d'image Gemini le plus rapide et le plus économique。

    Motif de la recommandation :Deux modèles génératifs de Google DeepMind précisent latence, coût et limites, ce qui aide à évaluer leur intégration dans des pipelines multimédia.

  1. Google DeepMind85

    Google DeepMind 发布 Nano Banana 2 图像模型

    Google DeepMind 发布最新图像生成模型 Nano Banana 2 (Gemini 3.1 Flash Image), 将 Nano Banana Pro 的高级世界知识。

    Motif de la recommandation :谷歌发布 Nano Banana 2, 将 Pro 级世界知识与文字渲染下放到 Flash 速度, 并同步接入 Gemini, 搜索, API 等入口.

  1. OpenAI News78

    OpenAI lance ChatGPT Images et GPT-Image-1.5

    OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.

  1. Google DeepMind80

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image)

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image), un modèle de génération et d'édition d'images construit sur Gemini 3 Pro。

    Motif de la recommandation :L'original détaille les capacités de génération et d'édition d'images, les résolutions et les intégrations, ce qui aide le lecteur à évaluer les scénarios de production concernés.

  2. Google DeepMind88

    Google DeepMind lance Nano Banana Pro (Gemini 3 Pro Image)

    Google DeepMind présente Nano Banana Pro (Gemini 3 Pro Image), un nouveau modèle de génération et d'édition d'images construit sur Gemini 3 Pro。

    Motif de la recommandation :Présentation des capacités de Nano Banana Pro et de sa disponibilité dans les produits Google, utile pour situer les usages de génération et d'édition d'images.

  1. OpenAI News80

    OpenAI 在 GPT-4o 中引入原生图像生成

    OpenAI 于 2025 年推出 GPT-4o 的原生图像生成功能, 具备更强的文本渲染和指令遵循能力. 文中还提及可探索 ChatGPT Images 2.5.

  2. OpenAI News80

    OpenAI publie un addendum à la fiche système de GPT-4o sur la génération d'images

    OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。

    Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.

  1. Hugging Face Blog72

    Würstchen : un modèle de diffusion rapide pour la génération d'images

    Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN。

    Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.

  1. Hugging Face Blog62

    Segmind ouvre le code et les poids de distillation de SD-Small et SD-Tiny

    Segmind a mis en open source le code d'entraînement et les poids de ses modèles SD-Small et SD-Tiny。

    Motif de la recommandation :L'article détaille la méthode de distillation par suppression de blocs et publie le code et les poids, ce qui permet de reproduire et d'adapter ces modèles compressés.

  1. OpenAI News88

    OpenAI présente DALL·E, un réseau neuronal qui génère des images à partir de texte

    OpenAI annonce avoir entraîné un réseau neuronal nommé DALL·E qui crée des images à partir de légendes textuelles, pour une large gamme de concepts exprimables en langage naturel.

    Motif de la recommandation :Un réseau neuronal nommé DALL·E génère des images à partir de légendes textuelles, ce qui permet de situer le jalon de la génération texte-image.

  1. OpenAI News70

    OpenAI présente MuseNet, un réseau neuronal profond capable de générer des compositions musicales

    OpenAI a créé MuseNet, un réseau neuronal profond capable de générer des compositions musicales de 4 minutes avec 10 instruments différents et de combiner des styles allant de la country à Mozart en passant par les Beatles. MuseNet n'a pas été programmé explicitement avec une compréhension musicale, mais a découvert des motifs d'harmonie, de rythme et de style en apprenant à prédire le token suivant dans des centaines de milliers de fichiers MIDI. Il utilise la même technologie non supervisée généraliste que GPT-2, un grand modèle Transformer entraîné à prédire le token suivant dans une séquence, qu'il s'agisse d'audio ou de texte.

    Motif de la recommandation :MuseNet montre comment une architecture Transformer généraliste, celle de GPT-2, peut être réutilisée pour générer de la musique sur des fichiers MIDI.

Fin de la liste