Aller au contenu
  1. Hugging Face Blog62

    Reconstruire AUTOMATIC1111 avec Gradio Workflow : 11 pipelines et 73 nœuds

    Hugging Face présente Workflow1111, un canevas de workflow unique qui reconstruit la plupart des fonctionnalités d'AUTOMATIC1111 sous forme de 11 pipelines multimédias construits avec 73 nœuds. Le canevas couvre la génération texte-image, le hi-resolution fix, l'image-to-image, la matrice de prompts, l'interrogation VLM, la détection vers masque d'inpainting, les annotateurs de style ControlNet, la suppression d'arrière-plan, le stockage PNG Info et l'image-to-video, avec des modèles comme FLUX.1-Kontext, Qwen3-4B, Qwen2.5-VL, DETR, AuraSR ×4, BRIA RMBG-2.0 et Wan 2.2 I2V A14B. Chaque nœud de sortie devient un point d'accès REST, et avec mcp_server=True, ces points d'accès deviennent des outils MCP appelables par des assistants IA comme Claude Code ou Cursor.

    Motif de la recommandation :L'article détaille comment reconstruire l'ensemble des fonctionnalités d'AUTOMATIC1111 avec 73 nœuds Gradio Workflow, et comment chaque sortie devient un point d'accès REST et un outil MCP.

  1. OpenAI News62

    OpenAI lance ChatGPT Images 2.5

    OpenAI lance ChatGPT Images 2.5, qui transforme les idées, croquis et photos de référence en images plus personnalisées et plus soignées, reflétant mieux les intentions de l'utilisateur.

  1. Google DeepMind80

    Google DeepMind lance Nano Banana 2 Lite et Gemini Omni Flash

    Google DeepMind annonce Nano Banana 2 Lite (gemini-3.1-flash-lite-image), son modèle d'image Gemini le plus rapide et le plus économique。

    Motif de la recommandation :Deux modèles génératifs de Google DeepMind précisent latence, coût et limites, ce qui aide à évaluer leur intégration dans des pipelines multimédia.

  1. Hugging Face Blog62

    Comment un agent a construit une galerie 3D de Paris en enchaînant deux Hugging Face Spaces

    Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces。

    Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.

  1. Hugging Face Blog62

    Hugging Face lance Modular Diffusers, des blocs composables pour les pipelines de diffusion

    Hugging Face présente Modular Diffusers, une nouvelle façon de construire des pipelines de diffusion en composant des blocs réutilisables。

    Motif de la recommandation :L'article détaille la composition par blocs des pipelines de diffusion et l'intégration avec Mellon, ce qui permet de juger de la flexibilité offerte pour construire des workflows personnalisés.

  1. Hugging Face Blog62

    PRX Part 3 : entraîner un modèle text-to-image en 24h

    Photoroom publie le troisième volet de sa série PRX, consacré à un speedrun d'entraînement d'un modèle text-to-image en 24 heures sur 32 H200。

    Motif de la recommandation :L'article détaille la recette complète d'un entraînement text-to-image en 24h sur 32 H200 pour environ 1500 dollars, avec code open source.

  1. Google DeepMind85

    Google DeepMind 发布 Nano Banana 2 图像模型

    Google DeepMind 发布最新图像生成模型 Nano Banana 2 (Gemini 3.1 Flash Image), 将 Nano Banana Pro 的高级世界知识。

    Motif de la recommandation :谷歌发布 Nano Banana 2, 将 Pro 级世界知识与文字渲染下放到 Flash 速度, 并同步接入 Gemini, 搜索, API 等入口.

  1. Google DeepMind75

    Google déploie Lyria 3 dans l'application Gemini pour générer de la musique à partir de texte ou d'images

    Google DeepMind met en beta Lyria 3 dans l'application Gemini, un modèle de génération musicale qui produit des pistes de 30 secondes à partir d'un texte ou d'une photo。

    Motif de la recommandation :Lyria 3 est déployé dans l'application Gemini en beta avec génération de pistes de 30 secondes à partir de texte ou d'images, ce qui permet de situer les capacités musicales grand public de Google.

  1. Google DeepMind78

    Google DeepMind déploie Project Genie, prototype de création de mondes interactifs

    Google DeepMind ouvre l'accès à Project Genie, un prototype de recherche expérimental réservé aux abonnés Google AI Ultra aux États-Unis (18 ans et plus)。

    Motif de la recommandation :Le prototype détaille trois capacités concrètes et les limites connues du modèle Genie 3, utile pour situer l'état réel des world models.

  1. OpenAI News78

    OpenAI lance ChatGPT Images et GPT-Image-1.5

    OpenAI a lancé ChatGPT Images ainsi que GPT-Image-1.5 dans l'API, une version plus rapide de l'expérience de génération d'images. Le texte mentionne également ChatGPT Images 2.5.

  1. Google DeepMind80

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image)

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image), un modèle de génération et d'édition d'images construit sur Gemini 3 Pro。

    Motif de la recommandation :L'original détaille les capacités de génération et d'édition d'images, les résolutions et les intégrations, ce qui aide le lecteur à évaluer les scénarios de production concernés.

  2. Google DeepMind88

    Google DeepMind lance Nano Banana Pro (Gemini 3 Pro Image)

    Google DeepMind présente Nano Banana Pro (Gemini 3 Pro Image), un nouveau modèle de génération et d'édition d'images construit sur Gemini 3 Pro。

    Motif de la recommandation :Présentation des capacités de Nano Banana Pro et de sa disponibilité dans les produits Google, utile pour situer les usages de génération et d'édition d'images.

  1. OpenAI News80

    OpenAI 在 GPT-4o 中引入原生图像生成

    OpenAI 于 2025 年推出 GPT-4o 的原生图像生成功能, 具备更强的文本渲染和指令遵循能力. 文中还提及可探索 ChatGPT Images 2.5.

  2. OpenAI News80

    OpenAI publie un addendum à la fiche système de GPT-4o sur la génération d'images

    OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。

    Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.

  1. OpenAI News91

    Les modèles de génération vidéo comme simulateurs du monde

    OpenAI explore l'entraînement à grande échelle de modèles génératifs sur des données vidéo. L'équipe entraîne conjointement des modèles de diffusion conditionnés par texte sur des vidéos et des images de durées, résolutions et formats variables, en s'appuyant sur une architecture Transformer opérant sur des patchs spatio-temporels de codes latents vidéo et image. Le plus grand modèle, Sora, peut générer une minute de vidéo haute fidélité, et les résultats suggèrent que le passage à l'échelle des modèles de génération vidéo est une voie prometteuse vers des simulateurs généralistes du monde physique.

    Motif de la recommandation :L'article expose l'entraînement conjoint de modèles de diffusion sur vidéos et images et présente Sora capable de générer une minute de vidéo, ce qui éclaire la voie vers des simulateurs du monde physique.

  1. Hugging Face Blog85

    SDXL en 4 étapes avec les LoRA Latent Consistency

    Hugging Face présente les LoRA Latent Consistency (LCM)。

    Motif de la recommandation :L'article détaille une méthode LoRA pour accélérer SDXL et SD 1.5 en 4 étapes, avec code, benchmarks et scripts d'entraînement directement réutilisables.

  1. OpenAI News78

    DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise

    DALL·E 3 est désormais disponible dans ChatGPT Plus et Enterprise. OpenAI indique avoir développé une pile de mesures de sécurité pour préparer DALL·E 3 à une diffusion plus large et partage des mises à jour sur ses recherches en matière de provenance.