02-Advanced - Modèles avancés

← Image Foundation | ↑ Image | → Image Orchestration

Ce module explore les modèles de pointe : Qwen Image Edit avancé, FLUX, SD 3.5, Z-Image/Lumina, et la quantification extrême (Bonsai ternaire 1.58-bit).

Dans le cadre du fil rouge contenu visuel éducatif : un visuel de qualité demande des outils précis. 01-5b édite une image existante pour corriger ou enrichir un diagramme. 02-2 génère des images haute qualité. 02-4 offre une génération rapide pour le prototypage itératif. 02-5 aborde la quantification ternaire 1.58-bit : un modèle 4B dont le transformer ternaire pèse ~1.21 GB on-disk (0.74 GB en strict 1.58-bit) et se génère en ~2s, parfait pour déployer la génération d’images sur du matériel modeste (formation, demos) sans sacrifier la qualité.

Vue d’overview

Statistique Valeur
Notebooks 5
Kernel Python 3
Durée estimée ~5-7h
GPU requis 5-29GB

Notebooks

# Notebook Contenu Service VRAM
1 01-5b-Qwen-Image-Edit-2509 Édition avancée Qwen ComfyUI ~29GB
2 02-2-FLUX-1-Advanced-Generation Génération FLUX ComfyUI Variable
3 02-3-Stable-Diffusion-3-5 SD 3.5 ComfyUI Variable
4 02-4-Z-Image-Lumina2 Z-Image/Lumina ComfyUI ~10GB
5 02-5-Bonsai-Image-Ternary Quantification ternaire 1.58-bit (BitNet), custom node ComfyUI (custom node) ~5GB

Prérequis

Docker Services

cd docker-configurations/services/comfyui-qwen
docker-compose up -d

Accès : http://localhost:8188

Dépendances

pip install -r requirements.txt
pip install -r requirements-comfyui.txt

Progression recommandée

  1. 01-5b-Qwen-Image-Edit-2509 - Édition multimodale avancée
  2. 02-2-FLUX-1-Advanced-Generation - Génération de haute qualité
  3. 02-3-Stable-Diffusion-3.5 - SD 3.5 pour contrôle fin
  4. 02-4-Z-Image-Lumina2 - Modèle léger et rapide
  5. 02-5-Bonsai-Image-Ternary - Quantification extrême pour déploiement sobre en VRAM

Technologies clés

Qwen Image Edit 2509

  • Architecture : Diffusion conditioned
  • Points forts : Édition précise, texte dans l’image
  • VRAM : ~29GB (VAE 16 canaux)

Triptyque d'édition Qwen Image Edit — image originale d'intérieur de café (gauche), masque blanc flou (centre), zone d'édition marquée en rouge (droite)
Sortie du notebook 01-5b (cellule 22) : triptyque d’édition Qwen Image Edit — image originale d’intérieur de café / masque blanc / zone d’édition marquée en rouge (workflow image-to-image avec masque d’inpainting).

Batch generation Qwen Image Edit — mosaïque 4 variations thématiques (cityscape futuriste au coucher de soleil / temple japonais en automne / récif corallien sous-marin / bibliothèque cosy avec chat)
Sortie du notebook 01-5b (cellule 30) : batch generation Qwen Image Edit — mosaïque 4 variations thématiques (cityscape / temple / récif / bibliothèque) sur 4 domaines visuels distincts.

FLUX 1

  • Architecture : Transformer-based
  • Points forts : Consistency, contrôle prompts
  • VRAM : Variable

Jardin zen japonais au coucher de soleil (cerisier en fleurs sakura, sable ratissé en motifs concentriques, mousses vert-vif, pierres plates) — génération FLUX.1-schnell en 4 steps Comparatif de ratios d'aspect FLUX-1 — même coucher de soleil sur palmiers rendu en 4 ratios (1:1 carré, 16:9 paysage, 9:16 portrait, 4:3 standard)
Sorties du notebook 02-2 : jardin zen japonais au coucher de soleil (gauche, FLUX.1-schnell 4 steps, cellule 13) et comparatif de ratios d’aspect sur coucher de soleil tropical (droite, cellule 21).

Stable Diffusion 3.5

  • Architecture : Diffusion classique
  • Points forts : Écosystème mature, contrôle contrôles
  • VRAM : Variable

Z-Image/Lumina

  • Architecture : LuminaDiffusers
  • Points forts : Vitesse, qualité légère
  • VRAM : ~10GB

Samouraï robotique en armure traditionnelle japonaise (kabuto à cornes) debout dans une ruelle cyberpunk nocturne ruisselante de pluie, enseignes néon rose/magenta — rendu cinématographique Z-Image
Sortie du notebook 02-4 (cellule 11) : samouraï robotique en armure traditionnelle dans ruelle cyberpunk aux néons rose/magenta (rendu cinématographique Z-Image, prototypage rapide pour itérer sur un prompt).

Bonsai-Image 4B (Ternary 1.58-bit)

  • Architecture : Transformer 4B quantifié ternaire (BitNet b1.58), Gemlite INT2 + HQQ 4-bit text encoder
  • Points forts : Transformer 4B ternaire ~1.21 GB on-disk (0.74 GB en strict 1.58-bit, vs 7.45 GB en FP16 pour les poids), génération ~2s en 4 steps, déploiable sur GPU d’entrée de gamme
  • VRAM : ~5GB
  • Accès : custom node ComfyUI BonsaiTernaryNode (modèle auto-téléchargé depuis HuggingFace au premier run)

Bonsai ternaire 1,58-bit — génération efficace
Sortie du notebook 02-5 (cellule 7) : Bonsai ternaire 1,58-bit — génération en ~2 s sur ~5 GB de VRAM.

Comparatif

Modèle Spécialité VRAM Qualité Vitesse
Qwen Édition ~29GB Excellent Lent
FLUX Génération Variable Exceptionnel Moyen
SD 3.5 Polyvalent Variable Bon Rapide
Z-Image Léger ~10GB Bon Très rapide
Bonsai Quantifié (1.58-bit) ~5GB Bon Très rapide

Ressources

Retour au sommet