01-Foundation - Modèles de base

← Documentation Image | ↑ .. | → Image Advanced

Ce module couvre les fondamentaux de la génération d’images par IA : modèles cloud, ComfyUI, et opérations de base.

Dans le cadre du fil rouge contenu visuel éducatif : avant de produire des visuels, il faut savoir générer une image à partir d’un texte. 01-1 et 01-2 couvrent les API cloud (simples et immédiates). 01-4 et 01-5 passent en local via ComfyUI pour le contrôle fin. 01-3 donne les bases de manipulation (PIL, OpenCV) utiles pour comprendre ce que font les modèles.

Vue d’overview

Statistique Valeur
Notebooks 5
Kernel Python 3
Durée estimée ~3-4h
GPU requis 0-29GB

Notebooks

# Notebook Contenu Service VRAM
1 01-1-OpenAI-DALL-E-3 Génération avec gpt-image-1 (DALL-E 3 retiré) OpenAI API 0
2 01-2-GPT-5-Image-Generation Génération avec GPT-5 OpenAI API 0
3 01-3-Basic-Image-Operations Opérations de base PIL/OpenCV 0
4 01-4-Forge-SD-XL-Turbo Stable Diffusion XL Turbo ComfyUI Variable
5 01-5-Qwen-Image-Edit Introduction Qwen ComfyUI ~29GB
5b 01-5b-Qwen-Image-Edit-2509 Édition avancée Qwen Image Edit 2509 ComfyUI ~29GB

01-1 — API cloud. Le point d’entrée le plus immédiat : un prompt, une clé, et gpt-image-1 renvoie un visuel en ~19 s :

Paysage urbain futuriste au coucher de soleil avec voitures volantes et lumières néon généré par gpt-image-1
gpt-image-1 : ville futuriste au coucher de soleil, voitures volantes, néons reflétés sur les immeubles de verre (1024×1024 requis, redimensionné à 746×789).

01-4 — Génération locale via Forge. Mêmes prompts, mais sur GPU auto-hébergé via Stable Diffusion XL Turbo : le mode 4-steps produit un rendu acceptable en ~18 s, et fixer la seed garantit la reproductibilité :

Paysage de montagne serein au coucher de soleil (vallée herbeuse, chaînes de montagnes bleutées, éclairage golden hour), photoréaliste, généré par SDXL Turbo via Forge Ville futuriste industrielle (ruelle verticale entre tours, fenêtres éclairées, brume cyan/orange) générée en 4 steps SDXL Turbo cfg=2.0
SDXL Turbo : paysage de montagne « golden hour » (gauche) et ville futuriste industrielle en mode 4-steps cfg=2.0 (droite) — premier exemple de génération locale via Forge.

Forêt brumeuse aux troncs verticaux et mousses orangées, générée avec seed fixe 42 pour reproductibilité
SDXL Turbo : forêt brumeuse reproductible (seed fixe 42) — la seed garantit le même résultat à chaque exécution.

01-5 — Édition via ComfyUI. Qwen Image Edit (workflow Phase 29 : VAE 16 canaux + CLIP sd3 + UNET fp8 + ModelSamplingAuraFlow shift=3.0 + CFGNorm 1.0) : le hello-world atteste que le service est joignable (~277 s, ~29 GB VRAM), puis le workflow image-to-image édite un visuel existant (~170 s) :

Chat tigré domestique sur appui de fenêtre en bois — première génération hello-world du workflow ComfyUI Qwen Image Edit 2509 (~277 s, ~29 GB VRAM) Panneau avant/après Qwen Image Edit Phase 29 : à gauche le chat tigré original, à droite son édition watercolor (denoise=0.5, seed=42) — l'input pédagogique est maintenant une vraie photo, l'édition Qwen est visible
Qwen Image Edit : hello-world chat tigré (gauche, ~277 s) puis workflow image-to-image Phase 29 (droite, ~277 s) — édition watercolor sur photo naturelle (denoise=0.5). L’input pédagogique a été enrichi : une vraie photo remplace l’ancien aplat bleu de test (cf. MANIFEST, issue #9344).

Note (issue #14580, c.248) : depuis la bascule remote authentifié, le notebook cible par défaut https://qwen-image-edit.myia.io (Bearer depuis GenAI/.env → COMFYUI_API_TOKEN). LOCAL_MODE=True sur http://127.0.0.1:8188 reste disponible en override (COMFYUI_API_URL ou QWEN_IMAGE_EDIT_URL) pour les machines GPU qui hébergent leur propre ComfyUI. Les deux visuels ci-dessus ont été régénérés depuis un run Papermill distant (seed 42, denoise 0.5, prompt watercolor).

Prérequis

API Keys

Voir scripts/secrets/render_envs.py + .claude/rules/secrets-hygiene.md. Les clés sont centralisées dans .secrets/master.env (gitignored) et propagées via python scripts/secrets/render_envs.py vers GenAI/.env. Jamais de littéraux inline (sk-..., Bearer ...) ni dans ce README, ni dans le code, ni dans les cellules notebooks (cf incident 2026-05-14).

Docker Services (optionnel)

cd docker-configurations/services/comfyui-qwen
docker-compose up -d

Accès : http://localhost:8188

Progression recommandée

  1. 01-1-OpenAI-DALL-E-3 - Introduction rapide à la génération d’images
  2. 01-2-GPT-5-Image-Generation - Génération multimodale avec texte
  3. 01-3-Basic-Image-Operations - Manipulation d’images locale
  4. 01-4-Forge-SD-XL-Turbo - Modèle open source via ComfyUI
  5. 01-5-Qwen-Image-Edit - Édition d’images avancée

Points clés

  • Cloud vs Local : OpenAI (facile, API) vs ComfyUI (puissant, local)
  • Formats : PNG, JPEG, WebP supportés
  • Qualité : gpt-image-1 > GPT-5 > SD-XL Turbo
  • Flexibilité : SD-XL Turbo plus paramétrable que les modèles cloud

Ressources

Retour au sommet