Théorie de la Décision Bayésienne (PyMC)

← Série Probas | ↑ Arc Théorie de la Décision | Corpus bayésien PyMC (Python) → | Arc décision Infer.NET (C#) → | Lake Lean decision_theory_lean →

Arc autonome de théorie de la décision bayésienne en PyMC — le socle (1-7) et son capstone (08) — qui prolongent la modélisation probabiliste (le corpus bayésien ../../PyMC/) jusqu’au choix d’action sous incertitude. Un posterior n’est pas une fin — c’est l’input d’une politique optimale. Cette série formalise ce passage, de l’utilité espérée aux processus markoviens et aux bandits bayésiens MCMC. L’extension actuarielle descend en sous-série dédiée : Actuariat/ (T1-T5), présentée par le capstone du slot 08.

Prérequis : le corpus bayésien ../../PyMC/ (notamment PyMC-04-Bayesian-Networks). Aucun prérequis en théorie de la décision : les axiomes de Von Neumann-Morgenstern sont introduits ex nihilo.

Stack : PyMC (Python 3, NUTS/ADVI), échantillonnage MCMC par défaut, diagnostics ArviZ. Miroir Python de l’arc DecisionTheory/DecInfer/ (Infer.NET, message passing).

Pourquoi un arc autonome

Jusqu’à la restructuration de la série, la théorie de la décision était imbriquée dans le corpus bayésien PyMC, ce qui masquait la dualité des deux fils : modéliser l’incertitude (inférence bayésienne) vs décider face à l’incertitude (théorie de la décision). L’extraction dans DecisionTheory/DecPyMC/ rend ces deux arcs physiquement indépendants tout en préservant le continuum pédagogique (le fil décision s’appuie sur les posteriors du corpus bayésien). Le lake decision_theory_lean, à la racine de la série Probas, reste visible des deux pistes (PyMC et Infer.NET).

Vue d’ensemble

# Notebook Durée Concepts
1 DecPyMC-1-Utility-Foundations 50 min Loteries, axiomes VNM, utilité espérée, diagnostic hiérarchique multi-sites
2 DecPyMC-2-Utility-Money 60 min Paradoxe St-Petersbourg, CARA, CRRA, profil de risque par inference bayésienne
3 DecPyMC-3-Multi-Attribute 50 min MAUT, SMART, swing weights
4 DecPyMC-4-Decision-Networks 55 min Diagrammes d’influence, prévalence à test imparfait (état latent)
5 DecPyMC-5-Value-Information 45 min EVPI, EVSI, valeur de l’information
6 DecPyMC-6-Expert-Systems 50 min Systèmes experts, Minimax, regret
7 DecPyMC-7-Sequential 60 min MDPs, itération valeur/politique, bandits, Thompson Sampling MCMC, POMDPs
8 DecPyMC-08-Actuariat-Capstone ~15 min Capstone : l’escalier vers la sous-série Actuariat (T1-T5) — suite de DecPyMC-7

Durée totale : ~6h (socle) — la sous-série Actuariat porte ses ~4h propres

Aperçu — la décision sous incertitude en images

Chaque notebook de l’arc rend visible un geste décisionnel distinct, dans une figure extraite des sorties réelles des notebooks. Plutôt qu’une galerie séparée du propos, ces figures sont replacées ci-dessous dans leur progression pédagogique — du posterior d’utilité aux bandits bayésiens MCMC — au plus près du concept qu’elles illustrent. La provenance détaillée (cellule, output, poids, alt-text) est documentée dans assets/readme/MANIFEST.md.

2 — Décider, ce n’est pas maximiser l’espérance. Devant trois actifs aux rendements incertains, l’espérance seule ne tranche pas : c’est toute la distribution postérieure des rendements qui décide. Un agent aversif au risque replie son choix sur la queue gauche ; un agent neutre regarde la moyenne. Les distributions superposées rendent visible pourquoi deux décideurs rationnels peuvent choisir différemment.

Choix d'investissement sous aversion au risque : distributions postérieures de rendement (Obligations, Actions, Crypto) et utilité espérée en fonction du coefficient d'aversion CRRA.

3 — Le compromis multi-attributs sous incertitude. Aucun critère unique ne résume une décision réelle : coût, qualité, délai, risque sont en compétition. Une simulation de Monte Carlo sur chaque critère, pondérée par des swing weights, expose les trade-offs et la zone de non-dominance — là où aucune option ne bat toutes les autres sur tous les axes.

Décision multi-attributs sous incertitude : distributions d'utilité de deux projets (Projet A E[U]=0.509, Projet B E[U]=0.482) et nuage de points rendement-risque illustrant la zone de non-dominance stochastique.

5 — Combien vaut l’information parfaite ? L’EVPI (Expected Value of Perfect Information) mesure le gain espéré si l’on levait toute l’incertitude avant de décider. La carte de chaleur, selon la probabilité d’un gisement et le gain associé, révèle les régions où acheter l’information paie et celles où elle est sans valeur — le pont entre incertitude et valeur monétaire.

Carte de chaleur EVPI selon la probabilité a priori de pétrole et le gain si pétrole trouvé, avec frontière de décision et scénario actuel (P=0.30, G=1000k) tombant en zone d'information peu précieuse.

5 — La convergence de l’estimateur Monte Carlo. L’EVPI n’a pas toujours de forme analytique fermée : on l’approche par Monte Carlo. La courbe de convergence montre l’estimateur se stabiliser vers la valeur analytique à mesure que croît le nombre d’échantillons — la preuve empirique que la simulation rejoint la théorie, et la quantité d’échantillons nécessaire pour s’y fier.

Convergence de l'estimateur Monte Carlo de l'EVPI vers sa valeur analytique.

6 — Composer avis experts et règles en un graphe de décision. Quand plusieurs sources d’avis (capteurs, experts, règles) doivent converger vers une action, le graphe de décision formalise leur combinaison. Chaque nœud pondère une incertitude ou une préférence ; l’arc de décision agrège le tout sous un critère (Minimax, regret) — rendre lisible un processus qui, sans formalisation, resterait opaque.

Système expert multi-sources : graphe de décision combinant avis et règles de décision.

7 — Thompson Sampling : le bandit qui apprend. Face à des bras aux récompenses inconnues, Thompson Sampling échantillonne une action selon la probabilité qu’elle soit optimale, puis met à jour son posterior après chaque essai. La courbe de regret, qui croît puis s’aplatit, est la signature d’un apprentissage bayésien réussi : on exploite de plus en plus les meilleurs bras tout en continuant d’explorer.

Thompson Sampling bayésien sur 4 bandits (vrais means 0.3/0.5/0.7/0.4) : regret cumulé comparé à Greedy, ε-greedy et UCB1, et posterior Beta final pour chaque bras après 2000 pas.

Note d’audit c.486 (2026-07-14, doctrine #5780). Audit vision G.1 firsthand des 6 PNG assets/readme/ sur cette lane CoursIA-2 (vision MiniMax M3) : 3 figures ACCURATE sans correction (dt5-mc-convergence.png, dt6-expert-graph.png, dt7-thompson.png), 2 corrections réelles alt-texts sur-vendeurs (dt2-investment.png — l’alt-text v1 omettait le 4ᵉ panneau « EU vs aversion CRRA » qui est précisément le panneau décisionnel de la figure ; dt3-multiattribute.png — l’alt-text v1 mentionnait « Monte Carlo » sans rendre visible la zone de non-dominance stochastique ni l’écart E[U] 0.027 non significatif), 1 enrichissement alt-text (dt5-evpi-heatmap.png — ajout de la frontière de décision bleue et du scenario actuel ★ (P=0.30, G=1000k)). Investigation nbformat Python confirme les attributions source (cells 31/38/29/54/40/49 des notebooks DecPyMC-{2,3,5,5,6,7}-*.ipynb). 0 PNG modifié, 0 notebook ré-exécuté (C.3 strict), 0 catalogue régénéré (catalog-pr-hygiene R1). Pattern transférable : pour les MANIFEST matplotlib Probas/DecisionTheory/DecPyMC/ le panneau décisif est souvent un sous-graphe périphérique (panneau 4 sur 4, ou scatter latéral) qui complète le tableau principal et que l’alt-text générique omet.

Progression Pédagogique

flowchart TD
    A["<b>Fondations</b> (1-2)<br/>axiomes vNM · utilité de l'argent<br/>aversion au risque"]
    B["<b>Multi-attributs & réseaux</b> (3-4)<br/>MAUT · diagrammes d'influence"]
    C["<b>Valeur & robustesse</b> (5-6)<br/>EVPI/EVSI · Minimax/regret"]
    D["<b>Séquentiel & bandits</b> (7)<br/>MDPs · Thompson Sampling MCMC"]
    E["<b>Jambe actuarielle</b> (8-12)<br/>crédibilité · tarification · ruine"]
    BAY["Corpus bayésien<br/>../../PyMC/ (posteriors)"]
    LAKE["Lake decision_theory_lean<br/>(formalisation)"]
    BAY -->|"posterior = input"| A
    A --> B --> C --> D --> E
    D -.->|"formalisation"| LAKE
    %% color: explicite -- sans lui, libelle clair sur fond clair en mode sombre GitHub (#15022) ; ne pas harmoniser le ton avec le stroke (libelle sinon illisible)
    classDef lake fill:#fff3cd,stroke:#856404,stroke-width:2px,color:#856404;
    class LAKE lake;

Le socle des fondations (1-3) pose les axiomes de rationalité et la notion d’aversion au risque ; les notebooks 3-4 étendent aux décisions multi-critères et aux réseaux de décision (nœuds de chance/décision/utilité) ; 5-6 mesurent la valeur de l’information et la robustesse sous incertitude sévère ; 7 clôture par le séquentiel (MDPs, équation de Bellman) et les bandits bayésiens où Thompson Sampling est calculé par échantillonnage MCMC plutôt que par la formule conjuguée. Les notebooks 8-12 forment ensuite la jambe actuarielle — l’application de la décision bayésienne au métier de l’assurance : la crédibilité (Bühlmann–Straub), le passage du risque à la prime, la ruine (Cramér–Lundberg), la valeur de l’information en souscription, et le fréquence × sévérité hiérarchique.

Spécificité PyMC : Thompson Sampling par MCMC

Là où l’arc Infer.NET calcule les posteriors de bandits par message passing (EP/VMP, analytique), cet arc PyMC les obtient par échantillonnage NUTS. La valeur distinctive apparaît sur des modèles de bandits non conjugués (priors Beta-Bernoulli conjugués mis à part) : seul l’échantillonnage MCMC sait alors explorer le posterior, et Thompson Sampling se nourrit directement des échantillons. Le sujet de DecInfer-10-Thompson-Sampling est, côté Python, intégré dans DecPyMC-7-Sequential (section bandits bayésiens MCMC).

Ponts inter-series

Série Lien Relation
Corpus bayésien PyMC Posteriors (Beta, gaussiennes) Le posterior est l’input de la politique de décision
Arc décision Infer.NET DecInfer-01 à DecInfer-10 Même arc décision en C# (message passing EP/VMP), avec companions Lean 4 (vNM, Gittins)
Inférence causale PyMC-05 do(·) de Pearl L’intervention comme transformation de modèle avant la décision
Lake decision_theory_lean Formalisation Preuves formelles Lean 4 (vNM sound, Gittins) — companions côté Infer.NET
GameTheory Décision sous incertitude Miroir : adversaire rationnel vs processus stochastique
RL MDPs (DecPyMC-7) L’agent apprend la politique par interaction

Conclusion

La théorie de la décision bayésienne ferme la boucle ouverte par le corpus bayésien : un posterior n’est utile que s’il informe une action. De l’utilité espérée (DecPyMC-1) aux MDPs et bandits MCMC (DecPyMC-7), puis au capstone actuariel (DecPyMC-08) qui ouvre la sous-série Actuariat (T1-T5), cet arc montre que décider sous incertitude est un calcul rigoureux — et l’arc miroir Infer.NET l’ancre en plus dans la preuve formelle Lean 4 (indice de Gittins, théorème vNM).

Bonne exploration de la théorie de la décision bayésienne en PyMC !

Retour au sommet