Théorie de la Décision Bayésienne (PyMC)
← Série Probas | ↑ Arc Théorie de la Décision | Corpus bayésien PyMC (Python) → | Arc décision Infer.NET (C#) → | Lake Lean decision_theory_lean →
Arc autonome de théorie de la décision bayésienne en PyMC — le socle (1-7) et son capstone (08) — qui prolongent la modélisation probabiliste (le corpus bayésien ../../PyMC/) jusqu’au choix d’action sous incertitude. Un posterior n’est pas une fin — c’est l’input d’une politique optimale. Cette série formalise ce passage, de l’utilité espérée aux processus markoviens et aux bandits bayésiens MCMC. L’extension actuarielle descend en sous-série dédiée : Actuariat/ (T1-T5), présentée par le capstone du slot 08.
Prérequis : le corpus bayésien ../../PyMC/ (notamment PyMC-04-Bayesian-Networks). Aucun prérequis en théorie de la décision : les axiomes de Von Neumann-Morgenstern sont introduits ex nihilo.
Stack : PyMC (Python 3, NUTS/ADVI), échantillonnage MCMC par défaut, diagnostics ArviZ. Miroir Python de l’arc DecisionTheory/DecInfer/ (Infer.NET, message passing).
Pourquoi un arc autonome
Jusqu’à la restructuration de la série, la théorie de la décision était imbriquée dans le corpus bayésien PyMC, ce qui masquait la dualité des deux fils : modéliser l’incertitude (inférence bayésienne) vs décider face à l’incertitude (théorie de la décision). L’extraction dans DecisionTheory/DecPyMC/ rend ces deux arcs physiquement indépendants tout en préservant le continuum pédagogique (le fil décision s’appuie sur les posteriors du corpus bayésien). Le lake decision_theory_lean, à la racine de la série Probas, reste visible des deux pistes (PyMC et Infer.NET).
Vue d’ensemble
| # | Notebook | Durée | Concepts |
|---|---|---|---|
| 1 | DecPyMC-1-Utility-Foundations | 50 min | Loteries, axiomes VNM, utilité espérée, diagnostic hiérarchique multi-sites |
| 2 | DecPyMC-2-Utility-Money | 60 min | Paradoxe St-Petersbourg, CARA, CRRA, profil de risque par inference bayésienne |
| 3 | DecPyMC-3-Multi-Attribute | 50 min | MAUT, SMART, swing weights |
| 4 | DecPyMC-4-Decision-Networks | 55 min | Diagrammes d’influence, prévalence à test imparfait (état latent) |
| 5 | DecPyMC-5-Value-Information | 45 min | EVPI, EVSI, valeur de l’information |
| 6 | DecPyMC-6-Expert-Systems | 50 min | Systèmes experts, Minimax, regret |
| 7 | DecPyMC-7-Sequential | 60 min | MDPs, itération valeur/politique, bandits, Thompson Sampling MCMC, POMDPs |
| 8 | DecPyMC-08-Actuariat-Capstone | ~15 min | Capstone : l’escalier vers la sous-série Actuariat (T1-T5) — suite de DecPyMC-7 |
Durée totale : ~6h (socle) — la sous-série Actuariat porte ses ~4h propres
Aperçu — la décision sous incertitude en images
Chaque notebook de l’arc rend visible un geste décisionnel distinct, dans une figure extraite des sorties réelles des notebooks. Plutôt qu’une galerie séparée du propos, ces figures sont replacées ci-dessous dans leur progression pédagogique — du posterior d’utilité aux bandits bayésiens MCMC — au plus près du concept qu’elles illustrent. La provenance détaillée (cellule, output, poids, alt-text) est documentée dans assets/readme/MANIFEST.md.
2 — Décider, ce n’est pas maximiser l’espérance. Devant trois actifs aux rendements incertains, l’espérance seule ne tranche pas : c’est toute la distribution postérieure des rendements qui décide. Un agent aversif au risque replie son choix sur la queue gauche ; un agent neutre regarde la moyenne. Les distributions superposées rendent visible pourquoi deux décideurs rationnels peuvent choisir différemment.
3 — Le compromis multi-attributs sous incertitude. Aucun critère unique ne résume une décision réelle : coût, qualité, délai, risque sont en compétition. Une simulation de Monte Carlo sur chaque critère, pondérée par des swing weights, expose les trade-offs et la zone de non-dominance — là où aucune option ne bat toutes les autres sur tous les axes.
5 — Combien vaut l’information parfaite ? L’EVPI (Expected Value of Perfect Information) mesure le gain espéré si l’on levait toute l’incertitude avant de décider. La carte de chaleur, selon la probabilité d’un gisement et le gain associé, révèle les régions où acheter l’information paie et celles où elle est sans valeur — le pont entre incertitude et valeur monétaire.
5 — La convergence de l’estimateur Monte Carlo. L’EVPI n’a pas toujours de forme analytique fermée : on l’approche par Monte Carlo. La courbe de convergence montre l’estimateur se stabiliser vers la valeur analytique à mesure que croît le nombre d’échantillons — la preuve empirique que la simulation rejoint la théorie, et la quantité d’échantillons nécessaire pour s’y fier.
6 — Composer avis experts et règles en un graphe de décision. Quand plusieurs sources d’avis (capteurs, experts, règles) doivent converger vers une action, le graphe de décision formalise leur combinaison. Chaque nœud pondère une incertitude ou une préférence ; l’arc de décision agrège le tout sous un critère (Minimax, regret) — rendre lisible un processus qui, sans formalisation, resterait opaque.
7 — Thompson Sampling : le bandit qui apprend. Face à des bras aux récompenses inconnues, Thompson Sampling échantillonne une action selon la probabilité qu’elle soit optimale, puis met à jour son posterior après chaque essai. La courbe de regret, qui croît puis s’aplatit, est la signature d’un apprentissage bayésien réussi : on exploite de plus en plus les meilleurs bras tout en continuant d’explorer.
Note d’audit c.486 (2026-07-14, doctrine #5780). Audit vision G.1 firsthand des 6 PNG
assets/readme/sur cette laneCoursIA-2(vision MiniMax M3) : 3 figures ACCURATE sans correction (dt5-mc-convergence.png,dt6-expert-graph.png,dt7-thompson.png), 2 corrections réelles alt-texts sur-vendeurs (dt2-investment.png— l’alt-text v1 omettait le 4ᵉ panneau « EU vs aversion CRRA » qui est précisément le panneau décisionnel de la figure ;dt3-multiattribute.png— l’alt-text v1 mentionnait « Monte Carlo » sans rendre visible la zone de non-dominance stochastique ni l’écart E[U] 0.027 non significatif), 1 enrichissement alt-text (dt5-evpi-heatmap.png— ajout de la frontière de décision bleue et du scenario actuel ★ (P=0.30, G=1000k)). InvestigationnbformatPython confirme les attributions source (cells 31/38/29/54/40/49 des notebooksDecPyMC-{2,3,5,5,6,7}-*.ipynb). 0 PNG modifié, 0 notebook ré-exécuté (C.3 strict), 0 catalogue régénéré (catalog-pr-hygiene R1). Pattern transférable : pour les MANIFEST matplotlibProbas/DecisionTheory/DecPyMC/le panneau décisif est souvent un sous-graphe périphérique (panneau 4 sur 4, ou scatter latéral) qui complète le tableau principal et que l’alt-text générique omet.
Progression Pédagogique
flowchart TD
A["<b>Fondations</b> (1-2)<br/>axiomes vNM · utilité de l'argent<br/>aversion au risque"]
B["<b>Multi-attributs & réseaux</b> (3-4)<br/>MAUT · diagrammes d'influence"]
C["<b>Valeur & robustesse</b> (5-6)<br/>EVPI/EVSI · Minimax/regret"]
D["<b>Séquentiel & bandits</b> (7)<br/>MDPs · Thompson Sampling MCMC"]
E["<b>Jambe actuarielle</b> (8-12)<br/>crédibilité · tarification · ruine"]
BAY["Corpus bayésien<br/>../../PyMC/ (posteriors)"]
LAKE["Lake decision_theory_lean<br/>(formalisation)"]
BAY -->|"posterior = input"| A
A --> B --> C --> D --> E
D -.->|"formalisation"| LAKE
%% color: explicite -- sans lui, libelle clair sur fond clair en mode sombre GitHub (#15022) ; ne pas harmoniser le ton avec le stroke (libelle sinon illisible)
classDef lake fill:#fff3cd,stroke:#856404,stroke-width:2px,color:#856404;
class LAKE lake;
Le socle des fondations (1-3) pose les axiomes de rationalité et la notion d’aversion au risque ; les notebooks 3-4 étendent aux décisions multi-critères et aux réseaux de décision (nœuds de chance/décision/utilité) ; 5-6 mesurent la valeur de l’information et la robustesse sous incertitude sévère ; 7 clôture par le séquentiel (MDPs, équation de Bellman) et les bandits bayésiens où Thompson Sampling est calculé par échantillonnage MCMC plutôt que par la formule conjuguée. Les notebooks 8-12 forment ensuite la jambe actuarielle — l’application de la décision bayésienne au métier de l’assurance : la crédibilité (Bühlmann–Straub), le passage du risque à la prime, la ruine (Cramér–Lundberg), la valeur de l’information en souscription, et le fréquence × sévérité hiérarchique.
Spécificité PyMC : Thompson Sampling par MCMC
Là où l’arc Infer.NET calcule les posteriors de bandits par message passing (EP/VMP, analytique), cet arc PyMC les obtient par échantillonnage NUTS. La valeur distinctive apparaît sur des modèles de bandits non conjugués (priors Beta-Bernoulli conjugués mis à part) : seul l’échantillonnage MCMC sait alors explorer le posterior, et Thompson Sampling se nourrit directement des échantillons. Le sujet de DecInfer-10-Thompson-Sampling est, côté Python, intégré dans DecPyMC-7-Sequential (section bandits bayésiens MCMC).
Ponts inter-series
| Série | Lien | Relation |
|---|---|---|
| Corpus bayésien PyMC | Posteriors (Beta, gaussiennes) | Le posterior est l’input de la politique de décision |
| Arc décision Infer.NET | DecInfer-01 à DecInfer-10 | Même arc décision en C# (message passing EP/VMP), avec companions Lean 4 (vNM, Gittins) |
| Inférence causale PyMC-05 | do(·) de Pearl |
L’intervention comme transformation de modèle avant la décision |
Lake decision_theory_lean |
Formalisation | Preuves formelles Lean 4 (vNM sound, Gittins) — companions côté Infer.NET |
| GameTheory | Décision sous incertitude | Miroir : adversaire rationnel vs processus stochastique |
| RL | MDPs (DecPyMC-7) | L’agent apprend la politique par interaction |
Conclusion
La théorie de la décision bayésienne ferme la boucle ouverte par le corpus bayésien : un posterior n’est utile que s’il informe une action. De l’utilité espérée (DecPyMC-1) aux MDPs et bandits MCMC (DecPyMC-7), puis au capstone actuariel (DecPyMC-08) qui ouvre la sous-série Actuariat (T1-T5), cet arc montre que décider sous incertitude est un calcul rigoureux — et l’arc miroir Infer.NET l’ancre en plus dans la preuve formelle Lean 4 (indice de Gittins, théorème vNM).
Bonne exploration de la théorie de la décision bayésienne en PyMC !

![Décision multi-attributs sous incertitude : distributions d'utilité de deux projets (Projet A E[U]=0.509, Projet B E[U]=0.482) et nuage de points rendement-risque illustrant la zone de non-dominance stochastique.](assets/readme/dt3-multiattribute.png)



