Partie 4 — Neuro-Symbolique

← Partie 3 — Avancée | ↑ Planification

La dernière partie explore la frontière entre IA symbolique et apprentissage profond. Les parties précédentes ont construit des solveurs que l’on conçoit ; celle-ci regarde ce qui change quand on apprend à planifier. Quatre angles : les LLM comme générateurs de plans (notebook 10), une interface unifiée qui rend le modèle PDDL portable entre tous les moteurs (notebook 11), Learning to Plan (notebook 12) — le point où l’apprentissage rencontre la planification — et la position inverse (notebook 10b) : le LLM non plus solveur mais réducteur d’espace de recherche, la correction restant au solveur déterministe, clôture de la série vers les foundation models.

Position dans la série

Étape Question
← 03-Advanced Comment résoudre par contraintes, temps ou hiérarchie ?
Partie 4 — Neuro-Symbolique Comment apprendre à planifier plutôt que le coder à la main ?
Fin de la série → Ponts vers RL, vérification formelle, théorie des jeux

Le fil conducteur : le geste de planifier — un état, un but, une séquence d’actions — reste identique ; ce qui change, c’est l’agent qui cherche. Du LLM prompté (notebook 10) au réseau qui apprend une heuristique (notebook 12) jusqu’au LLM qui se borne à restreindre l’espace (notebook 10b), la structure symbolique persiste sous l’apprentissage. C’est elle, rappelle le fil rouge de la série, que l’on emporte au-delà.

Notebooks

# Notebook Durée Contenu
10 Planners-10-LLM-Planning 50 min Large Language Models pour la planification : prompting, génération de plans, plan repair ; limites et avantages
11 Planners-11-Unified-Planning 40 min Interface unified-planning : un modèle PDDL, plusieurs solveurs, comparaison croisée des performances
12 Planners-12-LOOP 45 min Learning to Plan (framework LOOP) : state encoder, policy/value networks, encodage PDDL en tenseurs, 85,8 % de coverage IPC
10b Planners-10b-LLM-Space-Reducer 40 min Le LLM comme réducteur d’espace de recherche (position aicpp) : mini-DSL sur grilles ARC, trois bras mesurés — exhaustif borné, LLM-direct, LLM-réducteur

Prérequis

  • Parties 1 à 3 : toute la mécanique de la planification symbolique (notebooks 1-9)
  • Machine learning (notebooks 10, 12) : réseaux de neurones, fonction de perte, rétropropagation
  • API LLM (notebooks 10, 10b) : clé OpenAI/Anthropic/OpenRouter, prompting
  • PyTorch (notebook 12) : tenseurs, modules, boucle d’entraînement

À l’issue de cette partie

Vous saurez :

  1. Utiliser un LLM pour générer et réparer des plans, et en mesurer les limites
  2. Abstraire un problème de planification via unified-planning pour le porter d’un solveur à l’autre
  3. Entraîner un modèle à planifier (LOOP) : encoder un état PDDL, apprendre une politique ou une heuristique
  4. Comparer LLM-solver et LLM-réducteur (notebook 10b) : trois bras mesurés (nœuds, temps, réussite vérifiée) sur un mini-DSL ARC
  5. Situer la planification neuro-symbolique dans la trajectoire des foundation models

Pour aller plus loin (fin de série)

La série s’achève ; les ponts sortent de Planners :

  • Vers l’apprentissage par renforcement — un plan est une politique déterministe ; le RL en calcule une stochastique sous incertitude. Pont naturel vers les politiques apprises.
  • Vers la certification formelle — un plan correct n’est pas un plan sûr : la vérification Lean s’applique aux séquences d’actions critiques.
  • Vers la théorie des jeux — la planification mono-agent rencontre la recherche adversariale (minimax) en multi-agent.
  • Cartographie complète → Planification (README parent) — Ponts avec les autres séries
Retour au sommet