01-Foundation - Modèles de base
← Documentation Image | ↑ .. | → Image Advanced
Ce module couvre les fondamentaux de la génération d’images par IA : modèles cloud, ComfyUI, et opérations de base.
Dans le cadre du fil rouge contenu visuel éducatif : avant de produire des visuels, il faut savoir générer une image à partir d’un texte. 01-1 et 01-2 couvrent les API cloud (simples et immédiates). 01-4 et 01-5 passent en local via ComfyUI pour le contrôle fin. 01-3 donne les bases de manipulation (PIL, OpenCV) utiles pour comprendre ce que font les modèles.
Vue d’overview
| Statistique | Valeur |
|---|---|
| Notebooks | 5 |
| Kernel | Python 3 |
| Durée estimée | ~3-4h |
| GPU requis | 0-29GB |
Notebooks
| # | Notebook | Contenu | Service | VRAM |
|---|---|---|---|---|
| 1 | 01-1-OpenAI-DALL-E-3 | Génération avec gpt-image-1 (DALL-E 3 retiré) | OpenAI API | 0 |
| 2 | 01-2-GPT-5-Image-Generation | Génération avec GPT-5 | OpenAI API | 0 |
| 3 | 01-3-Basic-Image-Operations | Opérations de base | PIL/OpenCV | 0 |
| 4 | 01-4-Forge-SD-XL-Turbo | Stable Diffusion XL Turbo | ComfyUI | Variable |
| 5 | 01-5-Qwen-Image-Edit | Introduction Qwen | ComfyUI | ~29GB |
| 5b | 01-5b-Qwen-Image-Edit-2509 | Édition avancée Qwen Image Edit 2509 | ComfyUI | ~29GB |
01-1 — API cloud. Le point d’entrée le plus immédiat : un prompt, une clé, et gpt-image-1 renvoie un visuel en ~19 s :

gpt-image-1 : ville futuriste au coucher de soleil, voitures volantes, néons reflétés sur les immeubles de verre (1024×1024 requis, redimensionné à 746×789).
01-4 — Génération locale via Forge. Mêmes prompts, mais sur GPU auto-hébergé via Stable Diffusion XL Turbo : le mode 4-steps produit un rendu acceptable en ~18 s, et fixer la seed garantit la reproductibilité :

SDXL Turbo : paysage de montagne « golden hour » (gauche) et ville futuriste industrielle en mode 4-steps cfg=2.0 (droite) — premier exemple de génération locale via Forge.

SDXL Turbo : forêt brumeuse reproductible (seed fixe 42) — la seed garantit le même résultat à chaque exécution.
01-5 — Édition via ComfyUI. Qwen Image Edit (workflow Phase 29 : VAE 16 canaux + CLIP sd3 + UNET fp8 + ModelSamplingAuraFlow shift=3.0 + CFGNorm 1.0) : le hello-world atteste que le service est joignable (~277 s, ~29 GB VRAM), puis le workflow image-to-image édite un visuel existant (~170 s) :

Qwen Image Edit : hello-world chat tigré (gauche, ~277 s) puis workflow image-to-image Phase 29 (droite, ~277 s) — édition watercolor sur photo naturelle (denoise=0.5). L’input pédagogique a été enrichi : une vraie photo remplace l’ancien aplat bleu de test (cf. MANIFEST, issue #9344).
Note (issue #14580, c.248) : depuis la bascule
remote authentifié, le notebook cible par défauthttps://qwen-image-edit.myia.io(Bearer depuisGenAI/.env → COMFYUI_API_TOKEN).LOCAL_MODE=Truesurhttp://127.0.0.1:8188reste disponible en override (COMFYUI_API_URLouQWEN_IMAGE_EDIT_URL) pour les machines GPU qui hébergent leur propre ComfyUI. Les deux visuels ci-dessus ont été régénérés depuis un run Papermill distant (seed 42, denoise 0.5, prompt watercolor).
Prérequis
API Keys
Voir scripts/secrets/render_envs.py + .claude/rules/secrets-hygiene.md. Les clés sont centralisées dans .secrets/master.env (gitignored) et propagées via python scripts/secrets/render_envs.py vers GenAI/.env. Jamais de littéraux inline (sk-..., Bearer ...) ni dans ce README, ni dans le code, ni dans les cellules notebooks (cf incident 2026-05-14).
Docker Services (optionnel)
cd docker-configurations/services/comfyui-qwen
docker-compose up -dAccès : http://localhost:8188
Progression recommandée
- 01-1-OpenAI-DALL-E-3 - Introduction rapide à la génération d’images
- 01-2-GPT-5-Image-Generation - Génération multimodale avec texte
- 01-3-Basic-Image-Operations - Manipulation d’images locale
- 01-4-Forge-SD-XL-Turbo - Modèle open source via ComfyUI
- 01-5-Qwen-Image-Edit - Édition d’images avancée
Points clés
- Cloud vs Local : OpenAI (facile, API) vs ComfyUI (puissant, local)
- Formats : PNG, JPEG, WebP supportés
- Qualité : gpt-image-1 > GPT-5 > SD-XL Turbo
- Flexibilité : SD-XL Turbo plus paramétrable que les modèles cloud