02-Advanced - Voix, Musique & Séparation

← Audio Foundation | ↑ Audio | → Audio Orchestration

Ce module explore les techniques avancées : clonage vocal, génération musicale, séparation de sources, et modèles TTS expressifs.

Dans le cadre du fil rouge podcast : un podcast de qualité a besoin d’une voix cohérente et d’une identité sonore. 02-2 clone une voix à partir d’un échantillon pour créer un narrateur récurrent. 02-3 génère le jingle et le fond musical. 02-4 isole les pistes audio d’un mix existant (utile pour remastériser un interview). 02-8 ajoute des émotions et de la prosodie pour varier le ton selon les passages.

Vue d’ensemble

Statistique Valeur
Notebooks 9
Kernel Python 3
Durée estimée ~6-8h
GPU requis 2-24GB

Notebooks

# Notebook Contenu Service VRAM
1 02-1-Chatterbox-TTS Chatterbox Turbo, émotions, prosodie Local GPU ~8 GB
2 02-2-XTTS-Voice-Cloning XTTS v2, clonage vocal zero-shot Local GPU ~6 GB
3 02-3-MusicGen-Generation Meta MusicGen, text-to-music Local GPU ~10 GB
4 02-4-Demucs-Source-Separation Demucs v4, extraction stems Local GPU ~4 GB
5 02-5-Multi-Model-TTS-Gateway Gateway multi-TTS (Kokoro, TADA, Qwen3) tts-api.myia.io ~12 GB
6 02-6-MIDI-Generation midi-model (SkyTNT), génération symbolique Local GPU ~2-4 GB
7 02-7-YuE2-Song-Generation YuE2-3B : zero-shot, cover, édition agentique (4 étapes canoniques) Routée GPU 24 GB (Linux) ~24 GB
8 02-8-Expressive-TTS Fish S2 Pro, Dia TTS, tags expressifs Local GPU 6-18 GB
9 02-9-AceStep-Music-Generation ACE-Step v1.5, text-to-song multilingue Local GPU <4 GB

Prérequis

GPU Requirements

  • Minimum : 4 GB VRAM (Demucs, Kokoro)
  • Recommandé : 8-12 GB VRAM (XTTS, Chatterbox, MusicGen)
  • Optimal : 24 GB VRAM (SongGeneration, Expressive TTS)

Dépendances

pip install -r requirements.txt
pip install -r requirements-audio.txt  # MusicGen (audiocraft), Demucs inclus

Progression recommandée

Parcours Voix

  1. 02-1-Chatterbox-TTS - TTS avec émotions et prosodie
  2. 02-2-XTTS-Voice-Cloning - Clonage vocal
  3. 02-8-Expressive-TTS - TTS ultra-expressif
  4. 02-5-Multi-Model-TTS-Gateway - Comparatif multi-modèle

Parcours Musique

  1. 02-3-MusicGen-Generation - Génération de musique textuelle
  2. 02-9-AceStep-Music-Generation - Text-to-song multilingue (<4 GB VRAM)
  3. 02-6-MIDI-Generation - Génération MIDI symbolique
  4. 02-7-YuE2-Song-Generation - Chansons complètes (YuE2-3B)
  5. 02-4-Demucs-Source-Separation - Séparation de sources

Technologies clés

Technologie Utilisation
XTTS v2 Clonage vocal zero-shot
MusicGen Génération text-to-music
ACE-Step v1.5 Text-to-song multilingue (<4 GB VRAM)
Demucs v4 Séparation de sources 4 stems
Chatterbox Turbo TTS émotionnel
Fish S2 Pro TTS ultra-naturel

Cas d’usage

  • Voix IA : Assistant vocal, doublage, narration personnalisée
  • Musique : Jingles, bandes sonores, musique algorithmique
  • Production : Post-traitement audio, remixing, mastering

Ressources

Retour au sommet