02-Advanced - Voix, Musique & Séparation
← Audio Foundation | ↑ Audio | → Audio Orchestration
Ce module explore les techniques avancées : clonage vocal, génération musicale, séparation de sources, et modèles TTS expressifs.
Dans le cadre du fil rouge podcast : un podcast de qualité a besoin d’une voix cohérente et d’une identité sonore. 02-2 clone une voix à partir d’un échantillon pour créer un narrateur récurrent. 02-3 génère le jingle et le fond musical. 02-4 isole les pistes audio d’un mix existant (utile pour remastériser un interview). 02-8 ajoute des émotions et de la prosodie pour varier le ton selon les passages.
Vue d’ensemble
| Statistique | Valeur |
|---|---|
| Notebooks | 9 |
| Kernel | Python 3 |
| Durée estimée | ~6-8h |
| GPU requis | 2-24GB |
Notebooks
| # | Notebook | Contenu | Service | VRAM |
|---|---|---|---|---|
| 1 | 02-1-Chatterbox-TTS | Chatterbox Turbo, émotions, prosodie | Local GPU | ~8 GB |
| 2 | 02-2-XTTS-Voice-Cloning | XTTS v2, clonage vocal zero-shot | Local GPU | ~6 GB |
| 3 | 02-3-MusicGen-Generation | Meta MusicGen, text-to-music | Local GPU | ~10 GB |
| 4 | 02-4-Demucs-Source-Separation | Demucs v4, extraction stems | Local GPU | ~4 GB |
| 5 | 02-5-Multi-Model-TTS-Gateway | Gateway multi-TTS (Kokoro, TADA, Qwen3) | tts-api.myia.io | ~12 GB |
| 6 | 02-6-MIDI-Generation | midi-model (SkyTNT), génération symbolique | Local GPU | ~2-4 GB |
| 7 | 02-7-YuE2-Song-Generation | YuE2-3B : zero-shot, cover, édition agentique (4 étapes canoniques) | Routée GPU 24 GB (Linux) | ~24 GB |
| 8 | 02-8-Expressive-TTS | Fish S2 Pro, Dia TTS, tags expressifs | Local GPU | 6-18 GB |
| 9 | 02-9-AceStep-Music-Generation | ACE-Step v1.5, text-to-song multilingue | Local GPU | <4 GB |
Prérequis
GPU Requirements
- Minimum : 4 GB VRAM (Demucs, Kokoro)
- Recommandé : 8-12 GB VRAM (XTTS, Chatterbox, MusicGen)
- Optimal : 24 GB VRAM (SongGeneration, Expressive TTS)
Dépendances
pip install -r requirements.txt
pip install -r requirements-audio.txt # MusicGen (audiocraft), Demucs inclusProgression recommandée
Parcours Voix
- 02-1-Chatterbox-TTS - TTS avec émotions et prosodie
- 02-2-XTTS-Voice-Cloning - Clonage vocal
- 02-8-Expressive-TTS - TTS ultra-expressif
- 02-5-Multi-Model-TTS-Gateway - Comparatif multi-modèle
Parcours Musique
- 02-3-MusicGen-Generation - Génération de musique textuelle
- 02-9-AceStep-Music-Generation - Text-to-song multilingue (<4 GB VRAM)
- 02-6-MIDI-Generation - Génération MIDI symbolique
- 02-7-YuE2-Song-Generation - Chansons complètes (YuE2-3B)
- 02-4-Demucs-Source-Separation - Séparation de sources
Technologies clés
| Technologie | Utilisation |
|---|---|
| XTTS v2 | Clonage vocal zero-shot |
| MusicGen | Génération text-to-music |
| ACE-Step v1.5 | Text-to-song multilingue (<4 GB VRAM) |
| Demucs v4 | Séparation de sources 4 stems |
| Chatterbox Turbo | TTS émotionnel |
| Fish S2 Pro | TTS ultra-naturel |
Cas d’usage
- Voix IA : Assistant vocal, doublage, narration personnalisée
- Musique : Jingles, bandes sonores, musique algorithmique
- Production : Post-traitement audio, remixing, mastering