Maths Post-Bac Ouvrir l'app

Exercices corrigés — Probabilités (mesure) et théorème central limite

Probabilités & Statistiques · 18 exercices-types du palier socle

L2L3Maths ingénieur

Chaque exercice donne l'énoncé, des indices progressifs et la correction rédigée étape par étape. Ouvre les blocs seulement après avoir cherché.

Revoir le cours : Probabilités (mesure) et théorème central limite Définitions, méthodes et exemples corrigés du chapitre.

Axiomes de Kolmogorov : la probabilité est une mesure

DémonstrationDifficulté 3/5

Énoncer les axiomes de Kolmogorov d'un espace probabilisé (Ω,A,P)(\Omega,\mathcal{A},P). En déduire P(∅)=0P(\varnothing)=0, P(Ac)=1−P(A)P(A^c)=1-P(A) et la monotonie. Vérifier ces propriétés sur le dé équilibré Ω={1,…,6}\Omega=\{1,\dots,6\}, P({ω})=16P(\{\omega\})=\tfrac16.

Indices (3)

PP est une mesure (σ-additive) avec P(Ω)=1P(\Omega)=1.

Ω=A⊔Ac\Omega=A\sqcup A^c et additivité finie.

A⊆B⇒B=A⊔(B∖A)A\subseteq B\Rightarrow B=A\sqcup(B\setminus A).

Correction détaillée
Les trois axiomes de KOLMOGOROV, et pourquoi ce sont ceux-là

Un espace probabilisé est un triplet (Ω,A,P)(\Omega,\mathcal{A},P) où A\mathcal{A} est une tribu et P:A→[0,1]P:\mathcal{A}\to[0,1] vérifie :

(K1)P(A)≥0(K2)P(Ω)=1(K3)P(⨆nAn)=∑nP(An)(σ-additiviteˊ)\begin{array}{ll} \textbf{(K1)} & P(A)\geq 0\\ \textbf{(K2)} & P(\Omega)=1\\ \textbf{(K3)} & P\Big(\bigsqcup_{n}A_n\Big)=\sum_n P(A_n)\quad\text{(} \sigma\text{-additivit\'e)} \end{array}
une probabiliteˊ EST une mesure de masse totale 1\boxed{\text{une probabilit\'e EST une mesure de masse totale } 1}

👉 Tout le chapitre repose sur cette identification : les théorèmes de la théorie de la mesure — convergence dominée, Fubini, Radon-Nikodym — deviennent des outils probabilistes.

Étape 1 — Les trois conséquences

P(∅)=0P(\varnothing)=0. La suite ∅,∅,…\varnothing,\varnothing,\dots est disjointe, donc par (K3)

P(∅)=∑n=1∞P(∅)P(\varnothing)=\sum_{n=1}^{\infty}P(\varnothing)

Une série de terme constant converge seulement si ce terme est nul :

P(∅)=0\boxed{P(\varnothing)=0}

P(Ac)=1−P(A)P(A^{c})=1-P(A). Comme Ω=A⊔Ac\Omega=A\sqcup A^{c} :

1=P(Ω)=P(A)+P(Ac)1=P(\Omega)=P(A)+P(A^{c})

MONOTONIE. Si A⊆BA\subseteq B, alors B=A⊔(B∖A)B=A\sqcup(B\setminus A) :

P(B)=P(A)+P(B∖A)⏟≥0≥P(A)P(B)=P(A)+\underbrace{P(B\setminus A)}_{\geq 0}\geq P(A)
A⊆B ⟹ P(A)≤P(B)\boxed{A\subseteq B\ \Longrightarrow\ P(A)\leq P(B)}
Étape 2 — Vérification sur le dé équilibré
Ω={1,2,3,4,5,6},A=P(Ω),P({k})=16\Omega=\{1,2,3,4,5,6\},\qquad \mathcal{A}=\mathcal{P}(\Omega),\qquad P(\{k\})=\frac16
P(Ω)66=1✓ (K2)P(pair)=P({2,4,6})36=12P(impair)12=1−12✓ compleˊmentaireP({1,2})≤P({1,2,3})26≤36✓ monotonie\begin{array}{lll} P(\Omega) & \frac66=1 & \checkmark\ \text{(K2)}\\ P(\text{pair})=P(\{2,4,6\}) & \frac36=\frac12 & \\ P(\text{impair}) & \frac12=1-\frac12 & \checkmark\ \text{compl\'ementaire}\\ P(\{1,2\})\leq P(\{1,2,3\}) & \frac26\leq\frac36 & \checkmark\ \text{monotonie} \end{array}

Sur un Ω\Omega FINI, la σ\sigma-additivité se réduit à l'additivité finie — les suites infinies d'événements disjoints y sont nulles à partir d'un rang.

👉 C'est pourquoi le dé est l'exemple de contrôle idéal : tout s'y calcule exactement, et les formules générales s'y vérifient à la main.

Étape 3 — Pourquoi la $\sigma$-additivité, et pas seulement l'additivité

L'additivité FINIE ne suffit pas — elle ne permet pas de passer à la limite.

An↑A ⟹ P(An)→P(A)\boxed{A_n\uparrow A\ \Longrightarrow\ P(A_n)\to P(A)}

Cette continuité croissante est ÉQUIVALENTE à (K3) en présence de l'additivité finie, et c'est elle qu'on emploie constamment :

loi des grands nombresconvergence presque suˆreBorel-CantelliP(lim sup⁡An)fonction de reˊpartitioncontinuiteˊ aˋ droite\begin{array}{ll} \text{loi des grands nombres} & \text{convergence presque s\^ure}\\ \text{Borel-Cantelli} & P(\limsup A_n)\\ \text{fonction de r\'epartition} & \text{continuit\'e \`a droite} \end{array}

👉 Sans σ\sigma-additivité, aucun théorème limite — et c'est précisément ce que ce chapitre étudie.

Sur un Ω\Omega INFINI, la tribu ne peut pas toujours être P(Ω)\mathcal{P}(\Omega) : sur [0,1][0,1], il n'existe aucune probabilité σ\sigma-additive et invariante par translation définie sur toutes les parties. D'où le recours à la tribu borélienne.

Le statut de ce qui est admis, et pourquoi il faut le dire
veˊrifieˊ ici, par calculles trois conseˊquences, sur le deˊADMISl’existence de la mesure de Lebesgue sur [0,1]ADMISle theˊoreˋme d’extension de Caratheˊodory\begin{array}{ll} \text{v\'erifi\'e ici, par calcul} & \text{les trois cons\'equences, sur le d\'e}\\ \text{ADMIS} & \text{l'existence de la mesure de Lebesgue sur } [0,1]\\ \text{ADMIS} & \text{le th\'eor\`eme d'extension de Carath\'eodory} \end{array}

Ce chapitre est CALCULATOIRE-FIRST : il ancre chaque notion sur un cas fini où tout se vérifie, et étiquette honnêtement les théorèmes profonds qu'il admet.

dire ce qui est ADMIS n’est pas une faiblesse, c’est la seule honneˆteteˊ possible\boxed{\text{dire ce qui est ADMIS n'est pas une faiblesse, c'est la seule honn\^etet\'e possible}}

👉 Le lecteur doit savoir où il se tient : ce qu'il peut refaire lui-même, et ce qu'il prend pour acquis. Les exercices C4, D2 et D5 portent explicitement cette distinction.

Réponse. Axiomes de Kolmogorov (PP mesure, P(Ω)=1P(\Omega)=1) ; P(∅)=0P(\varnothing)=0, P(Ac)=1−P(A)P(A^c)=1-P(A), monotonie. (Vérifié machine : ∑P(ω)=1\sum P(\omega)=1, additivité, monotonie sur le dé — A ✓)
Faire cet exercice dans l'app →

Variable aléatoire, loi image, fonction de répartition

DémonstrationDifficulté 3/5

Définir une variable aléatoire comme fonction mesurable et sa loi PXP_X comme mesure image. Montrer que FX(x)=P(X≤x)F_X(x)=P(X\leq x) est croissante, de limites 00 et 11. Que vaut P(a<X≤b)P(a<X\leq b) ?

Indices (3)

XX mesurable : {X≤x}∈A\{X\leq x\}\in\mathcal{A}.

PX(B)=P(X−1(B))P_X(B)=P(X^{-1}(B)).

{X≤a}⊆{X≤b}\{X\leq a\}\subseteq\{X\leq b\} pour a≤ba\leq b.

Correction détaillée
Les trois définitions, et le résultat
variable aleˊatoireX:Ω→R MESURABLEloiPX(B)=P(X−1(B)) — la mesure IMAGEreˊpartitionFX(x)=P(X≤x)\begin{array}{ll} \textbf{variable al\'eatoire} & X:\Omega\to\mathbb{R}\ \text{MESURABLE}\\ \textbf{loi} & P_X(B)=P(X^{-1}(B))\ \text{— la mesure IMAGE}\\ \textbf{r\'epartition} & F_X(x)=P(X\leq x) \end{array}
FX croissante, FX(−∞)=0, FX(+∞)=1, continue aˋ DROITE\boxed{F_X\ \text{croissante},\ F_X(-\infty)=0,\ F_X(+\infty)=1,\ \text{continue \`a DROITE}}
P(a<X≤b)=FX(b)−FX(a)\boxed{P(a<X\leq b)=F_X(b)-F_X(a)}
Étape 1 — Mesurable, et pourquoi
X mesurable  ⟺  X−1(B)∈A pour tout boreˊlien BX\ \text{mesurable}\iff X^{-1}(B)\in\mathcal{A}\ \text{pour tout bor\'elien } B

C'est exactement ce qu'il faut pour que P(X∈B)P(X\in B) AIT UN SENS — sans mesurabilité, l'événement {X∈B}\{X\in B\} pourrait ne pas être dans la tribu, et sa probabilité ne serait pas définie.

la mesurabiliteˊ n’est pas technique : c’est la condition d’EXISTENCE\boxed{\text{la mesurabilit\'e n'est pas technique : c'est la condition d'EXISTENCE}}

Il suffit de le vérifier sur les B=]−∞,x]B=]-\infty,x] — ils engendrent la tribu borélienne, et l'image réciproque commute aux opérations ensemblistes.

Étape 2 — La loi comme mesure image
PX(B)=P(X−1(B))P_X(B)=P\big(X^{-1}(B)\big)

C'est une PROBABILITÉ sur R\mathbb{R} :

PX(R)=P(X−1(R))=P(Ω)=1 ✓P_X(\mathbb{R})=P(X^{-1}(\mathbb{R}))=P(\Omega)=1\ \checkmark

et la σ\sigma-additivité se transporte, car X−1X^{-1} préserve les unions disjointes.

👉 Toute l'information probabiliste de XX est dans PXP_X — l'espace Ω\Omega de départ n'importe plus. C'est pourquoi on dit « soit XX de loi N(0,1)\mathcal{N}(0,1) » sans jamais préciser Ω\Omega.

deux v.a. de MEˆME LOI sont interchangeables dans tout calcul\boxed{\text{deux v.a. de M\^EME LOI sont interchangeables dans tout calcul}}
Étape 3 — Les propriétés de $F_X$

CROISSANTE : si x≤yx\leq y, alors {X≤x}⊆{X≤y}\{X\leq x\}\subseteq\{X\leq y\}, donc par monotonie (exercice A1)

FX(x)≤FX(y)F_X(x)\leq F_X(y)

LIMITES : par continuité de la mesure le long des suites monotones,

{X≤n}↑Ω ⟹ FX(n)→1\{X\leq n\}\uparrow\Omega\ \Longrightarrow\ F_X(n)\to 1
{X≤−n}↓∅ ⟹ FX(−n)→0\{X\leq -n\}\downarrow\varnothing\ \Longrightarrow\ F_X(-n)\to 0

CONTINUE À DROITE : {X≤x+1/n}↓{X≤x}\{X\leq x+1/n\}\downarrow\{X\leq x\}, d'où FX(x+1/n)→FX(x)F_X(x+1/n)\to F_X(x).

👉 La continuité à droite vient du choix de ≤\leq dans la définition. Avec <<, on obtiendrait la continuité à gauche — c'est une convention, mais il faut s'y tenir.

Étape 4 — L'intervalle, et le contrôle sur le dé
]−∞,b]=]−∞,a] ⊔ ]a,b]]-\infty,b]=]-\infty,a]\ \sqcup\ ]a,b]

Union disjointe, donc par additivité :

FX(b)=FX(a)+P(a<X≤b)F_X(b)=F_X(a)+P(a<X\leq b)
P(a<X≤b)=FX(b)−FX(a)\boxed{P(a<X\leq b)=F_X(b)-F_X(a)}

Sur le dé :

x<1[1,2[[2,3[[3,4[[4,5[[5,6[≥6FX(x)01/62/63/64/65/61\begin{array}{lccccccc} x & <1 & [1,2[ & [2,3[ & [3,4[ & [4,5[ & [5,6[ & \geq 6\\\hline F_X(x) & 0 & 1/6 & 2/6 & 3/6 & 4/6 & 5/6 & 1 \end{array}
P(2<X≤4)=F(4)−F(2)=46−26=13P(2<X\leq 4)=F(4)-F(2)=\frac46-\frac26=\frac13

Contrôle direct : {3,4}\{3,4\}, soit 22 cas sur 66, donc 13\frac13 ✓

⚠️ Les SAUTS de FXF_X sont les atomes : P(X=x)=FX(x)−FX(x−)P(X=x)=F_X(x)-F_X(x^-). Ici chaque saut vaut 16\frac16. Pour une loi à densité, FXF_X est continue et il n'y a aucun atome.

Réponse. XX mesurable ; PXP_X mesure image ; FXF_X croissante 0→10\to1 ; P(a<X≤b)=FX(b)−FX(a)P(a<X\leq b)=F_X(b)-F_X(a). (Conclusion certifiée sur instances ; mesurabilité/loi image = relecture)
Faire cet exercice dans l'app →

Espérance = intégrale ∫X dP : linéarité, E[1_A]=P(A)

CalculDifficulté 3/5

Définir E[X]=∫ΩX dPE[X]=\int_\Omega X\,dP et rappeler la linéarité et E[1A]=P(A)E[\mathbf 1_A]=P(A). Sur le dé équilibré, calculer E[X]E[X], vérifier E[2X+3]=2E[X]+3E[2X+3]=2E[X]+3, et E[1A]=P(A)E[\mathbf 1_A]=P(A) pour A={A=\{pair}\}.

Indices (3)

E[X]=∑ωX(ω)P(ω)E[X]=\sum_\omega X(\omega)P(\omega) en fini.

E[1A]=∑ω∈AP(ω)=P(A)E[\mathbf 1_A]=\sum_{\omega\in A}P(\omega)=P(A).

E[X]=16(1+⋯+6)E[X]=\tfrac16(1+\dots+6).

Correction détaillée
La définition, et ce qu'elle unifie
E[X]=∫ΩX dP\boxed{E[X]=\int_{\Omega}X\,dP}

L'espérance est une INTÉGRALE — au sens de Lebesgue, contre la mesure PP.

cas discretE[X]=∑kxkP(X=xk)cas aˋ densiteˊE[X]=∫Rx f(x) dx\begin{array}{ll} \text{cas discret} & E[X]=\sum_k x_kP(X=x_k)\\ \text{cas \`a densit\'e} & E[X]=\int_{\mathbb{R}}x\,f(x)\,dx \end{array}

👉 Une seule définition, deux formules — c'est tout le bénéfice de la théorie de la mesure. Avant Lebesgue, discret et continu demandaient deux théories séparées.

Étape 1 — Les deux propriétés fondamentales

LINÉARITÉ — c'est celle de l'intégrale :

E[aX+bY]=aE[X]+bE[Y]E[aX+bY]=aE[X]+bE[Y]

⚠️ Elle ne demande AUCUNE hypothèse d'indépendance — c'est ce qui la rend si commode, et c'est la différence essentielle avec la variance (exercice B2).

L'INDICATRICE :

E[1A]=∫Ω1A dP=P(A)E[\mathbf 1_A]=\int_{\Omega}\mathbf 1_A\,dP=P(A)
une probabiliteˊ est l’espeˊrance de son indicatrice\boxed{\text{une probabilit\'e est l'esp\'erance de son indicatrice}}

👉 C'est le pont qui permet de traduire un énoncé ensembliste en énoncé d'espérance — et c'est ce qu'emploient Markov (exercice D4) et Borel-Cantelli (exercice D3).

Étape 2 — Le calcul sur le dé
E[X]=∑k=16k⋅16=1+2+3+4+5+66=216=72=3,5E[X]=\sum_{k=1}^{6}k\cdot\frac16=\frac{1+2+3+4+5+6}{6}=\frac{21}{6}=\boxed{\frac72=3{,}5}

⚠️ 3,53{,}5 n'est PAS une valeur possible du dé. L'espérance est une moyenne, pas une prédiction — c'est le malentendu le plus fréquent.

Vérification de la linéarité :

E[2X+3]=∑k(2k+3)16=2⋅21+186=606=10E[2X+3]=\sum_k(2k+3)\frac16=\frac{2\cdot 21+18}{6}=\frac{60}{6}=10
2E[X]+3=2⋅72+3=7+3=10 ✓2E[X]+3=2\cdot\frac72+3=7+3=10\ \checkmark
Étape 3 — L'indicatrice
A={pair}={2,4,6}A=\{\text{pair}\}=\{2,4,6\}
1A(k)={1k∈{2,4,6}0sinon\mathbf 1_A(k)=\begin{cases}1 & k\in\{2,4,6\}\\ 0 & \text{sinon}\end{cases}
E[1A]=1⋅16+0⋅16+1⋅16+0⋅16+1⋅16+0⋅16=36=12E[\mathbf 1_A]=1\cdot\frac16+0\cdot\frac16+1\cdot\frac16+0\cdot\frac16+1\cdot\frac16+0\cdot\frac16=\frac36=\frac12
P(A)=∣{2,4,6}∣6=12 ✓P(A)=\frac{\lvert\{2,4,6\}\rvert}{6}=\frac12\ \checkmark
E[1A]=P(A)\boxed{E[\mathbf 1_A]=P(A)}
Ce que l'intégrale apporte
theˊoreˋmeusage probabilisteconvergence monotonelimites croissantes d’espeˊrancesconvergence domineˊeE[Xn]→E[X] sous dominationFubiniX⊥Y⇒E[g(X)h(Y)]=E[g(X)]E[h(Y)] (exercice D1)transfertE[g(X)]=∫g dPX\begin{array}{ll} \text{th\'eor\`eme} & \text{usage probabiliste}\\\hline \text{convergence monotone} & \text{limites croissantes d'esp\'erances}\\ \text{convergence domin\'ee} & E[X_n]\to E[X]\ \text{sous domination}\\ \text{Fubini} & X\perp Y\Rightarrow E[g(X)h(Y)]=E[g(X)]E[h(Y)]\ \text{(exercice D1)}\\ \text{transfert} & E[g(X)]=\int g\,dP_X \end{array}

Le théorème de TRANSFERT est celui qu'on emploie sans y penser :

E[g(X)]=∫Ωg(X) dP=∫Rg dPXE[g(X)]=\int_{\Omega}g(X)\,dP=\int_{\mathbb{R}}g\,dP_X

👉 Il permet de calculer avec la LOI, sans jamais revenir à Ω\Omega — et c'est ce qui rend les calculs de l'exercice A5 possibles.

⚠️ E[X]E[X] n'existe pas toujours : il faut E[∣X∣]<∞E[\lvert X\rvert]<\infty. La loi de Cauchy, de densité 1π(1+x2)\frac{1}{\pi(1+x^2)}, n'a aucune espérance — et c'est pourquoi elle échappe à la loi des grands nombres comme au TCL.

Réponse. E[X]=∫X dPE[X]=\int X\,dP, linéaire, E[1A]=P(A)E[\mathbf 1_A]=P(A) ; dé : E[X]=72E[X]=\tfrac72, E[2X+3]=10E[2X+3]=10. (Vérifié machine : E[X]=7/2E[X]=7/2, linéarité E[2X+3]=2E[X]+3E[2X+3]=2E[X]+3, E[1A]=P(A)=1/2E[\mathbf 1_A]=P(A)=1/2 — A ✓)
Faire cet exercice dans l'app →

Variance, écart-type, inégalité de Bienaymé-Tchebychev

CalculDifficulté 3/5

Définir Var(X)=E[X2]−E[X]2\mathrm{Var}(X)=E[X^2]-E[X]^2 et Var(aX+b)=a2Var(X)\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X). Calculer Var(X)\mathrm{Var}(X) pour le dé et vérifier Var(2X+5)=4 Var(X)\mathrm{Var}(2X+5)=4\,\mathrm{Var}(X). Énoncer l'inégalité de Bienaymé-Tchebychev.

Indices (3)

Var(X)=E[(X−μ)2]=E[X2]−μ2\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2.

E[X2]=16∑k=16k2E[X^2]=\tfrac16\sum_{k=1}^6 k^2.

Tchebychev : P(∣X−μ∣≥kσ)≤1k2P(|X-\mu|\geq k\sigma)\leq\tfrac1{k^2}.

Correction détaillée
Les définitions et l'inégalité
Var(X)=E[(X−E[X])2]=E[X2]−E[X]2,σ=Var(X)\boxed{\mathrm{Var}(X)=E\big[(X-E[X])^2\big]=E[X^2]-E[X]^2,\qquad \sigma=\sqrt{\mathrm{Var}(X)}}
Var(aX+b)=a2 Var(X)\boxed{\mathrm{Var}(aX+b)=a^2\,\mathrm{Var}(X)}
BIENAYMEˊ-TCHEBYCHEV: P(∣X−E[X]∣≥ε)≤Var(X)ε2\boxed{\text{BIENAYM\'E-TCHEBYCHEV} : \ P\big(\lvert X-E[X]\rvert\geq\varepsilon\big)\leq\frac{\mathrm{Var}(X)}{\varepsilon^2}}

La variance mesure la DISPERSION ; l'inégalité la transforme en majoration de probabilité, et c'est elle qui démontrera la loi faible des grands nombres.

Étape 1 — La formule de Koenig-Huygens
E[(X−m)2]=E[X2−2mX+m2]avec m=E[X]E\big[(X-m)^2\big]=E[X^2-2mX+m^2]\qquad\text{avec } m=E[X]

Par linéarité (exercice A3) :

=E[X2]−2mE[X]+m2=E[X2]−2m2+m2=E[X2]−m2=E[X^2]-2mE[X]+m^2=E[X^2]-2m^2+m^2=E[X^2]-m^2
Var(X)=E[X2]−E[X]2\boxed{\mathrm{Var}(X)=E[X^2]-E[X]^2}

Et Var(X)≥0\mathrm{Var}(X)\geq 0 puisque c'est l'espérance d'un carré — d'où

E[X2]≥E[X]2E[X^2]\geq E[X]^2

👉 C'est un cas particulier de l'inégalité de Jensen (exercice D4), avec la fonction convexe x↦x2x\mapsto x^2.

Étape 2 — L'effet d'une transformation affine
E[aX+b]=aE[X]+b=am+bE[aX+b]=aE[X]+b=am+b
Var(aX+b)=E[(aX+b−am−b)2]=E[a2(X−m)2]=a2Var(X)\mathrm{Var}(aX+b)=E\big[(aX+b-am-b)^2\big]=E\big[a^2(X-m)^2\big]=a^2\mathrm{Var}(X)
Var(aX+b)=a2Var(X)\boxed{\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)}

👉 La translation bb DISPARAÎT — elle déplace la distribution sans la disperser. Et le facteur est a2a^2, non aa : la variance est quadratique, l'écart-type linéaire :

σ(aX+b)=∣a∣ σ(X)\sigma(aX+b)=\lvert a\rvert\,\sigma(X)
Étape 3 — Le calcul sur le dé
E[X]=72,E[X2]=∑k=16k2⋅16=1+4+9+16+25+366=916E[X]=\frac72,\qquad E[X^2]=\sum_{k=1}^{6}k^2\cdot\frac16=\frac{1+4+9+16+25+36}{6}=\frac{91}{6}
Var(X)=916−(72)2=916−494=182−14712=3512≈2,917\mathrm{Var}(X)=\frac{91}{6}-\left(\frac72\right)^2=\frac{91}{6}-\frac{49}{4}=\frac{182-147}{12}=\boxed{\frac{35}{12}\approx 2{,}917}
σ=35/12≈1,708\sigma=\sqrt{35/12}\approx 1{,}708

Vérification de la transformation affine :

Var(2X+5)=353et4 Var(X)=4⋅3512=353 ✓\mathrm{Var}(2X+5)=\frac{35}{3}\qquad\text{et}\qquad 4\,\mathrm{Var}(X)=4\cdot\frac{35}{12}=\frac{35}{3}\ \checkmark
Étape 4 — Bienaymé-Tchebychev, et sa qualité

Démonstration, par Markov (exercice D4) appliqué à (X−m)2≥0(X-m)^2\geq 0 :

P(∣X−m∣≥ε)=P((X−m)2≥ε2)≤E[(X−m)2]ε2=Var(X)ε2P\big(\lvert X-m\rvert\geq\varepsilon\big)=P\big((X-m)^2\geq\varepsilon^2\big)\leq\frac{E[(X-m)^2]}{\varepsilon^2}=\frac{\mathrm{Var}(X)}{\varepsilon^2}

Sur le dé, avec ε=2\varepsilon=2 :

P(∣X−3,5∣≥2)≤35/124=3548≈0,729P\big(\lvert X-3{,}5\rvert\geq 2\big)\leq\frac{35/12}{4}=\frac{35}{48}\approx 0{,}729

Valeur RÉELLE : ∣X−3,5∣≥2\lvert X-3{,}5\rvert\geq 2 signifie X∈{1,6}X\in\{1,6\}, soit

P=26=13≈0,333P=\frac26=\frac13\approx 0{,}333
0,333≤0,729 ✓mais la borne est LARGE0{,}333\leq 0{,}729\ \checkmark\qquad\text{mais la borne est LARGE}

👉 Tchebychev est grossière, et c'est assumé : elle ne suppose rien sur la loi, seulement l'existence de la variance. C'est cette universalité qui la rend précieuse — la loi faible des grands nombres (exercice B5) s'en déduit sans hypothèse de forme.

le TCL donnera une bien meilleure approximation, au prix d’un passage aˋ la limite\boxed{\text{le TCL donnera une bien meilleure approximation, au prix d'un passage \`a la limite}}
Réponse. Var(X)=3512\mathrm{Var}(X)=\tfrac{35}{12} (dé), Var(2X+5)=353\mathrm{Var}(2X+5)=\tfrac{35}3 ; Tchebychev P(∣X−μ∣≥kσ)≤1k2P(|X-\mu|\geq k\sigma)\leq\tfrac1{k^2}. (Vérifié machine : Var=35/12\mathrm{Var}=35/12, Var(2X+5)=4Var\mathrm{Var}(2X+5)=4\mathrm{Var}, Tchebychev sur instances — A ✓)
Faire cet exercice dans l'app →

Lois usuelles : espérance et variance

CalculDifficulté 3/5

Donner l'espérance et la variance des lois Bernoulli B(p)\mathcal{B}(p), binomiale B(n,p)\mathcal{B}(n,p), Poisson P(λ)\mathcal{P}(\lambda), uniforme U[0,1]\mathcal{U}[0,1], exponentielle E(λ)\mathcal{E}(\lambda) et normale N(μ,σ2)\mathcal{N}(\mu,\sigma^2). Vérifier E,VarE,\mathrm{Var} de B(n,p)\mathcal{B}(n,p) par décomposition en somme de Bernoulli.

Indices (3)

B(n,p)=\mathcal{B}(n,p)= somme de nn Bernoulli indépendantes.

Espérance additive ; variance additive si indépendance.

P(λ)\mathcal{P}(\lambda) : E=Var=λE=\mathrm{Var}=\lambda.

Correction détaillée
Le tableau à connaître
loiE[X]Var(X)B(p)pp(1−p)BernoulliB(n,p)npnp(1−p)binomialeP(λ)λλPoissonU[0,1]12112uniformeE(λ)1λ1λ2exponentielleN(μ,σ2)μσ2normale\begin{array}{lccl} \text{loi} & E[X] & \mathrm{Var}(X) & \\\hline \mathcal{B}(p) & p & p(1-p) & \text{Bernoulli}\\ \mathcal{B}(n,p) & np & np(1-p) & \text{binomiale}\\ \mathcal{P}(\lambda) & \lambda & \lambda & \text{Poisson}\\ \mathcal{U}[0,1] & \tfrac12 & \tfrac1{12} & \text{uniforme}\\ \mathcal{E}(\lambda) & \tfrac1\lambda & \tfrac1{\lambda^2} & \text{exponentielle}\\ \mathcal{N}(\mu,\sigma^2) & \mu & \sigma^2 & \text{normale} \end{array}

La ligne de Poisson est remarquable : espérance et variance coïncident. C'est une signature de cette loi — nécessaire mais pas suffisante : la loi uniforme sur {0,2}\{0,2\} a aussi E=Var=1E=\mathrm{Var}=1 —, et un test de terrain rapide.

Étape 1 — Bernoulli et binomiale

Bernoulli : X∈{0,1}X\in\{0,1\} avec P(X=1)=pP(X=1)=p.

E[X]=0⋅(1−p)+1⋅p=pE[X]=0\cdot(1-p)+1\cdot p=p
E[X2]=02(1−p)+12p=p(car X2=X pour X∈{0,1})E[X^2]=0^2(1-p)+1^2p=p\qquad\text{(car } X^2=X\ \text{pour } X\in\{0,1\})
Var(X)=p−p2=p(1−p)\mathrm{Var}(X)=p-p^2=p(1-p)

👉 X2=XX^2=X est le raccourci : une variable à valeurs 0/10/1 est son propre carré.

Binomiale : X=∑i=1nXiX=\sum_{i=1}^{n}X_i, somme de nn Bernoulli indépendantes.

E[X]=nE[X1]=np(lineˊariteˊ, SANS indeˊpendance)E[X]=nE[X_1]=np\qquad\text{(lin\'earit\'e, SANS ind\'ependance)}
Var(X)=n Var(X1)=np(1−p)(exige l’INDEˊPENDANCE)\mathrm{Var}(X)=n\,\mathrm{Var}(X_1)=np(1-p)\qquad\textbf{(exige l'IND\'EPENDANCE)}

⚠️ L'asymétrie est le point à retenir : l'espérance s'additionne toujours, la variance seulement sous indépendance (exercice B2).

Étape 2 — Poisson, et le calcul de la variance
P(X=k)=e−λλkk!P(X=k)=e^{-\lambda}\frac{\lambda^{k}}{k!}
E[X]=∑k≥0k e−λλkk!=λe−λ∑k≥1λk−1(k−1)!=λe−λeλ=λE[X]=\sum_{k\geq 0}k\,e^{-\lambda}\frac{\lambda^{k}}{k!}=\lambda e^{-\lambda}\sum_{k\geq 1}\frac{\lambda^{k-1}}{(k-1)!}=\lambda e^{-\lambda}e^{\lambda}=\lambda

Pour la variance, on passe par le moment FACTORIEL — plus simple que E[X2]E[X^2] :

E[X(X−1)]=∑k≥2k(k−1)e−λλkk!=λ2e−λ∑k≥2λk−2(k−2)!=λ2E[X(X-1)]=\sum_{k\geq 2}k(k-1)e^{-\lambda}\frac{\lambda^k}{k!}=\lambda^2e^{-\lambda}\sum_{k\geq 2}\frac{\lambda^{k-2}}{(k-2)!}=\lambda^2
E[X2]=E[X(X−1)]+E[X]=λ2+λE[X^2]=E[X(X-1)]+E[X]=\lambda^2+\lambda
Var(X)=λ2+λ−λ2=λ\mathrm{Var}(X)=\lambda^2+\lambda-\lambda^2=\boxed{\lambda}

👉 Le passage par E[X(X−1)]E[X(X-1)] fait tomber DEUX termes du factoriel — c'est le geste standard pour les lois discrètes.

Étape 3 — Uniforme et exponentielle

Uniforme [0,1][0,1], densité f=1[0,1]f=\mathbf 1_{[0,1]} :

E[X]=∫01x dx=12,E[X2]=∫01x2 dx=13E[X]=\int_0^1x\,dx=\frac12,\qquad E[X^2]=\int_0^1x^2\,dx=\frac13
Var(X)=13−14=112\mathrm{Var}(X)=\frac13-\frac14=\frac{1}{12}

Exponentielle, densité λe−λx1x≥0\lambda e^{-\lambda x}\mathbf 1_{x\geq 0} :

E[X]=∫0∞xλe−λxdx=1λ(IPP)E[X]=\int_0^{\infty}x\lambda e^{-\lambda x}dx=\frac1\lambda\qquad\text{(IPP)}
E[X2]=∫0∞x2λe−λxdx=2λ2E[X^2]=\int_0^{\infty}x^2\lambda e^{-\lambda x}dx=\frac{2}{\lambda^2}
Var(X)=2λ2−1λ2=1λ2\mathrm{Var}(X)=\frac{2}{\lambda^2}-\frac{1}{\lambda^2}=\boxed{\frac{1}{\lambda^2}}

Contrôle dimensionnel : σ=1/λ=E[X]\sigma=1/\lambda=E[X] — l'exponentielle a un écart-type égal à sa moyenne. C'est une autre signature reconnaissable.

Ce que le tableau permet de faire
standardiserZ=X−E[X]σ, d’espeˊrance 0 et de variance 1appliquer le TCLil faut μ et σ2 FINISreconnaiˆtre une loipar le rapport Var/E\begin{array}{ll} \text{standardiser} & Z=\dfrac{X-E[X]}{\sigma},\ \text{d'esp\'erance } 0\ \text{et de variance } 1\\ \text{appliquer le TCL} & \text{il faut } \mu\ \text{et}\ \sigma^2\ \text{FINIS}\\ \text{reconna\^itre une loi} & \text{par le rapport } \mathrm{Var}/E \end{array}
Var/Eloi=1Poissoncompatible, sans suffire<1binomialeVar/E=1−p>1sur-disperseˊebinomiale neˊgative, meˊlange\begin{array}{lll} \mathrm{Var}/E & \text{loi} & \\\hline =1 & \text{Poisson} & \text{compatible, sans suffire}\\ <1 & \text{binomiale} & \mathrm{Var}/E=1-p\\ >1 & \text{sur-dispers\'ee} & \text{binomiale n\'egative, m\'elange} \end{array}

👉 C'est le premier diagnostic d'un statisticien devant des données de comptage — et il ne coûte qu'une division.

⚠️ La loi de CAUCHY n'a ni espérance ni variance : ∫∣x∣π(1+x2)dx\int\frac{\lvert x\rvert}{\pi(1+x^2)}dx diverge. Elle échappe donc au TCL, et la moyenne de nn variables de Cauchy suit... encore une Cauchy, sans aucune concentration.

Réponse. Tableau E,VarE,\mathrm{Var} des 6 lois ; B(n,p)\mathcal{B}(n,p) : E=npE=np, Var=npq\mathrm{Var}=npq (somme de Bernoulli). (Vérifié machine : E,VarE,\mathrm{Var} dérivés de φ\varphi pour les 6 lois — A/C ✓)
Faire cet exercice dans l'app →

Variable à densité, ∫f=1, espérance par intégrale

CalculDifficulté 3/5

Définir une v.a. à densité ff et la condition ∫Rf dλ=1\int_\mathbb{R}f\,d\lambda=1. Pour la loi exponentielle f(x)=λe−λx1x≥0f(x)=\lambda e^{-\lambda x}\mathbf 1_{x\geq0}, vérifier ∫f=1\int f=1 et calculer E[X]=1λE[X]=\tfrac1\lambda, Var(X)=1λ2\mathrm{Var}(X)=\tfrac1{\lambda^2}. Quel est le lien FX↔fF_X\leftrightarrow f ?

Indices (3)

P(X∈B)=∫Bf dλP(X\in B)=\int_B f\,d\lambda, f≥0f\geq0.

E[X]=∫xf(x) dxE[X]=\int x f(x)\,dx, E[X2]=∫x2fE[X^2]=\int x^2 f.

FX′=fF_X'=f p.p. (Radon-Nikodym par rapport à λ\lambda).

Correction détaillée
La définition, et la condition qui la porte
X est aˋ DENSITEˊ f siP(X∈B)=∫Bf dλpour tout boreˊlien BX\ \text{est \`a DENSIT\'E } f\ \text{si}\qquad P(X\in B)=\int_{B}f\,d\lambda\qquad\text{pour tout bor\'elien } B
f≥0et∫Rf dλ=1\boxed{f\geq 0\quad\text{et}\quad \int_{\mathbb{R}}f\,d\lambda=1}

La seconde condition n'est pas décorative : c'est P(R)=1P(\mathbb{R})=1, l'axiome (K2).

Conséquence immédiate : P(X=a)=∫{a}f=0P(X=a)=\int_{\{a\}}f=0 — une loi à densité n'a AUCUN atome, donc FXF_X est continue.

Étape 1 — Vérifier que l'exponentielle est une densité
f(x)=λe−λx1x≥0,λ>0f(x)=\lambda e^{-\lambda x}\mathbf 1_{x\geq 0},\qquad\lambda>0

Positive ✓ (produit de deux quantités positives)

D'intégrale 11 :

∫Rf=∫0∞λe−λxdx=[−e−λx]0∞=0−(−1)=1 ✓\int_{\mathbb{R}}f=\int_0^{\infty}\lambda e^{-\lambda x}dx=\Big[-e^{-\lambda x}\Big]_0^{\infty}=0-(-1)=\boxed{1}\ \checkmark

La fonction de répartition :

F(x)=∫0xλe−λtdt=1−e−λx(x≥0)F(x)=\int_0^{x}\lambda e^{-\lambda t}dt=1-e^{-\lambda x}\qquad(x\geq 0)

Contrôles : F(0)=0F(0)=0, F(+∞)=1F(+\infty)=1, croissante ✓ — conforme à l'exercice A2.

Étape 2 — L'espérance, par intégration par parties
E[X]=∫0∞x λe−λxdxE[X]=\int_0^{\infty}x\,\lambda e^{-\lambda x}dx

IPP avec u=xu=x et v′=λe−λxv'=\lambda e^{-\lambda x}, donc v=−e−λxv=-e^{-\lambda x} :

E[X]=[−xe−λx]0∞+∫0∞e−λxdxE[X]=\Big[-xe^{-\lambda x}\Big]_0^{\infty}+\int_0^{\infty}e^{-\lambda x}dx

Le crochet est NUL : xe−λx→0xe^{-\lambda x}\to 0 quand x→∞x\to\infty (l'exponentielle l'emporte), et vaut 00 en 00.

E[X]=[−1λe−λx]0∞=1λE[X]=\Big[-\frac{1}{\lambda}e^{-\lambda x}\Big]_0^{\infty}=\boxed{\frac1\lambda}

Et de même :

E[X2]=2λ2 ⟹ Var(X)=2λ2−1λ2=1λ2E[X^2]=\frac{2}{\lambda^2}\ \Longrightarrow\ \mathrm{Var}(X)=\frac{2}{\lambda^2}-\frac{1}{\lambda^2}=\frac{1}{\lambda^2}
Étape 3 — L'absence de mémoire
P(X>s+t∣X>s)=P(X>t)\boxed{P(X>s+t\mid X>s)=P(X>t)}

Démonstration, avec P(X>x)=e−λxP(X>x)=e^{-\lambda x} :

P(X>s+t∣X>s)=P(X>s+t)P(X>s)=e−λ(s+t)e−λs=e−λt=P(X>t)P(X>s+t\mid X>s)=\frac{P(X>s+t)}{P(X>s)}=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}}=e^{-\lambda t}=P(X>t)

👉 L'exponentielle « oublie » son passé — une ampoule qui a déjà duré ss heures a la même espérance de vie résiduelle qu'une neuve.

c’est la SEULE loi continue sans meˊmoire\boxed{\text{c'est la SEULE loi continue sans m\'emoire}}

Son analogue discret est la loi GÉOMÉTRIQUE — même propriété, même caractérisation.

Ce que la théorie de la mesure unifie
discretaˋ densiteˊloi∑kpkδxkf dλE[X]∑kxkpk∫xf(x)dxFXen escaliercontinueP(X=a)pa0\begin{array}{lll} & \text{discret} & \text{\`a densit\'e}\\\hline \text{loi} & \sum_kp_k\delta_{x_k} & f\,d\lambda\\ E[X] & \sum_kx_kp_k & \int xf(x)dx\\ F_X & \text{en escalier} & \text{continue}\\ P(X=a) & p_a & \mathbf{0} \end{array}

Une seule définition — E[X]=∫X dPE[X]=\int X\,dP — recouvre les deux colonnes.

👉 Le théorème de RADON-NIKODYM (admis) dit exactement quand une loi a une densité : quand elle est absolument continue par rapport à Lebesgue, c'est-à-dire quand tout ensemble de mesure nulle est de probabilité nulle.

PX≪λ  ⟺  PX a une densiteˊ\boxed{P_X\ll\lambda\iff P_X\ \text{a une densit\'e}}

Et il existe des lois d'AUCUN des deux types : la loi de l'escalier de Cantor est continue — sans atome — et pourtant sans densité. Elle est portée par un ensemble de mesure de Lebesgue nulle.

Réponse. Densité ∫f=1\int f=1, FX′=fF_X'=f ; exponentielle : ∫f=1\int f=1, E=1λE=\tfrac1\lambda, Var=1λ2\mathrm{Var}=\tfrac1{\lambda^2}. (Vérifié machine : E=1/λE=1/\lambda, Var=1/λ2\mathrm{Var}=1/\lambda^2 via φ\varphi — A/C ✓)
Faire cet exercice dans l'app →

Indépendance d'événements et de variables

DémonstrationDifficulté 3/5

Définir l'indépendance de deux événements puis de deux v.a. Sur deux dés (espace produit {1,…,6}2\{1,\dots,6\}^2, équiprobable), vérifier que A={1erA=\{1^{\text{er}} dé pair}\} et B={2eB=\{2^{\text{e}} dé ≤2}\leq2\} sont indépendants : P(A∩B)=P(A)P(B)=16P(A\cap B)=P(A)P(B)=\tfrac16.

Indices (3)

A⊥BA\perp B : P(A∩B)=P(A)P(B)P(A\cap B)=P(A)P(B).

X⊥YX\perp Y : la loi jointe se factorise pour tous les boréliens.

P(A)=12P(A)=\tfrac12, P(B)=13P(B)=\tfrac13.

Correction détaillée
Les deux définitions
A⊥B  ⟺  P(A∩B)=P(A)P(B)\boxed{A\perp B\iff P(A\cap B)=P(A)P(B)}
X⊥Y  ⟺  P(X∈B1, Y∈B2)=P(X∈B1)P(Y∈B2)  ∀B1,B2\boxed{X\perp Y\iff P(X\in B_1,\ Y\in B_2)=P(X\in B_1)P(Y\in B_2)\ \ \forall B_1,B_2}

La seconde est bien plus forte : elle exige l'indépendance de tous les événements construits sur XX et YY, pas d'un seul couple.

de fac¸on eˊquivalente:P(X,Y)=PX⊗PY(exercice D1)\text{de fa\c con \'equivalente} : P_{(X,Y)}=P_X\otimes P_Y\qquad\text{(exercice D1)}
Étape 1 — Le cadre : deux dés
Ω={1,…,6}2,∣Ω∣=36,P({ω})=136\Omega=\{1,\dots,6\}^2,\qquad \lvert\Omega\rvert=36,\qquad P(\{\omega\})=\frac{1}{36}
A={1er deˊ pair},B={2e deˊ≤2}A=\{1^{\text{er}}\ \text{d\'e pair}\},\qquad B=\{2^{\text{e}}\ \text{d\'e}\leq 2\}
P(A)=3×636=12,P(B)=6×236=13P(A)=\frac{3\times 6}{36}=\frac12,\qquad P(B)=\frac{6\times 2}{36}=\frac13
Étape 2 — Vérifier l'indépendance
A∩B={(a,b) : a∈{2,4,6}, b∈{1,2}}A\cap B=\{(a,b)\ :\ a\in\{2,4,6\},\ b\in\{1,2\}\}
∣A∩B∣=3×2=6 ⟹ P(A∩B)=636=16\lvert A\cap B\rvert=3\times 2=6\ \Longrightarrow\ P(A\cap B)=\frac{6}{36}=\frac16
P(A)P(B)=12×13=16 ✓P(A)P(B)=\frac12\times\frac13=\frac16\ \checkmark
A⊥B\boxed{A\perp B}

👉 La raison de fond : AA ne dépend que de la première coordonnée, BB que de la seconde, et la mesure est un produit. C'est un cas particulier de l'exercice D1.

Étape 3 — Un contre-exemple, et pourquoi il éclaire

Sur le MÊME dé (un seul lancer) :

A={pair}={2,4,6},C={X≤2}={1,2}A=\{\text{pair}\}=\{2,4,6\},\qquad C=\{X\leq 2\}=\{1,2\}
P(A)=12,P(C)=13,A∩C={2}P(A)=\frac12,\qquad P(C)=\frac13,\qquad A\cap C=\{2\}
P(A∩C)=16=12×13 ✓P(A\cap C)=\frac16=\frac12\times\frac13\ \checkmark

Ils sont INDÉPENDANTS, alors qu'ils portent sur le même lancer !

l’indeˊpendance est une proprieˊteˊ NUMEˊRIQUE, pas causale\boxed{\text{l'ind\'ependance est une propri\'et\'e NUM\'ERIQUE, pas causale}}

👉 C'est le malentendu le plus fréquent : deux événements peuvent être indépendants sans être « sans rapport », et l'inverse aussi. Seul le calcul tranche.

Un vrai contre-exemple : A={pair}A=\{\text{pair}\} et D={X≤3}={1,2,3}D=\{X\leq 3\}=\{1,2,3\}.

P(A∩D)=P({2})=16maisP(A)P(D)=12⋅12=14P(A\cap D)=P(\{2\})=\frac16\qquad\text{mais}\qquad P(A)P(D)=\frac12\cdot\frac12=\frac14
16≠14 ⟹ DEˊPENDANTS\frac16\neq\frac14\ \Longrightarrow\ \text{D\'EPENDANTS}
L'indépendance MUTUELLE, plus forte que deux à deux
deux aˋ deuxP(Ai∩Aj)=P(Ai)P(Aj) ∀i≠jMUTUELLEP(⋂i∈IAi)=∏i∈IP(Ai) ∀I\begin{array}{ll} \text{deux \`a deux} & P(A_i\cap A_j)=P(A_i)P(A_j)\ \forall i\neq j\\ \textbf{MUTUELLE} & P\Big(\bigcap_{i\in I}A_i\Big)=\prod_{i\in I}P(A_i)\ \forall I \end{array}

⚠️ La seconde est STRICTEMENT plus forte, et le contre-exemple de Bernstein le montre. Sur deux pièces équilibrées :

A={1re pile},B={2e pile},C={meˆme reˊsultat}A=\{1^{\text{re}}\ \text{pile}\},\quad B=\{2^{\text{e}}\ \text{pile}\},\quad C=\{\text{m\^eme r\'esultat}\}

Deux à deux indépendants : chaque paire donne 14=12⋅12\frac14=\frac12\cdot\frac12 ✓

Mais pas mutuellement :

P(A∩B∩C)=P(A∩B)=14alors queP(A)P(B)P(C)=18P(A\cap B\cap C)=P(A\cap B)=\frac14\qquad\text{alors que}\qquad P(A)P(B)P(C)=\frac18
14≠18\frac14\neq\frac18

👉 CC est entièrement DÉTERMINÉ par AA et BB — connaître les deux premiers donne le troisième. C'est l'indépendance mutuelle qui est exigée dans « i.i.d. », et donc dans tout ce chapitre.

Réponse. A⊥BA\perp B : P(A∩B)=P(A)P(B)P(A\cap B)=P(A)P(B) ; 2 dés : 16=12⋅13\tfrac16=\tfrac12\cdot\tfrac13. (Vérifié machine : P(A∩B)=P(A)P(B)=1/6P(A\cap B)=P(A)P(B)=1/6 — B ✓)
Faire cet exercice dans l'app →

E[XY]=E[X]E[Y] et Var(X+Y)=Var X+Var Y si indépendance

DémonstrationDifficulté 3/5

Montrer que X⊥Y⇒E[XY]=E[X]E[Y]X\perp Y\Rightarrow E[XY]=E[X]E[Y], puis Var(X+Y)=Var(X)+Var(Y)\mathrm{Var}(X+Y)=\mathrm{Var}(X)+\mathrm{Var}(Y). Vérifier sur deux dés : E[XY]=494E[XY]=\tfrac{49}4, Var(X+Y)=356\mathrm{Var}(X+Y)=\tfrac{35}6.

Indices (3)

Factorisation de la loi jointe (Fubini) ⇒E[XY]=E[X]E[Y]\Rightarrow E[XY]=E[X]E[Y].

Var(X+Y)=VarX+VarY+2 Cov(X,Y)\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y+2\,\mathrm{Cov}(X,Y).

Cov(X,Y)=E[XY]−E[X]E[Y]=0\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]=0 si ⊥\perp.

Correction détaillée
Les deux résultats
X⊥Y ⟹ E[XY]=E[X]E[Y]\boxed{X\perp Y\ \Longrightarrow\ E[XY]=E[X]E[Y]}
X⊥Y ⟹ Var(X+Y)=Var(X)+Var(Y)\boxed{X\perp Y\ \Longrightarrow\ \mathrm{Var}(X+Y)=\mathrm{Var}(X)+\mathrm{Var}(Y)}

⚠️ Contraste avec l'espérance : E[X+Y]=E[X]+E[Y]E[X+Y]=E[X]+E[Y] toujours, sans hypothèse. La variance, elle, exige l'indépendance — ou au moins la décorrélation.

c’est cette additiviteˊ de la variance qui produit le n du TCL\boxed{\text{c'est cette additivit\'e de la variance qui produit le } \sqrt n\ \text{du TCL}}
Étape 1 — Le produit des espérances

Par le théorème de Fubini (exercice D1), l'indépendance signifie P(X,Y)=PX⊗PYP_{(X,Y)}=P_X\otimes P_Y, donc

E[XY]=∫R2xy d(PX⊗PY)=(∫x dPX)(∫y dPY)=E[X]E[Y]E[XY]=\int_{\mathbb{R}^2}xy\ d(P_X\otimes P_Y)=\Big(\int x\,dP_X\Big)\Big(\int y\,dP_Y\Big)=E[X]E[Y]
E[XY]=E[X]E[Y]\boxed{E[XY]=E[X]E[Y]}

Dans le cas discret, c'est un calcul direct :

E[XY]=∑i,jxiyjP(X=xi,Y=yj)=∑i,jxiyjP(X=xi)P(Y=yj)=E[X]E[Y]E[XY]=\sum_{i,j}x_iy_jP(X=x_i,Y=y_j)=\sum_{i,j}x_iy_jP(X=x_i)P(Y=y_j)=E[X]E[Y]

👉 C'est la factorisation de la loi jointe qui permet de séparer la somme double.

Étape 2 — L'additivité de la variance
Var(X+Y)=E[(X+Y)2]−(E[X+Y])2\mathrm{Var}(X+Y)=E\big[(X+Y)^2\big]-\big(E[X+Y]\big)^2

Développons les deux termes :

E[(X+Y)2]=E[X2]+2E[XY]+E[Y2]E[(X+Y)^2]=E[X^2]+2E[XY]+E[Y^2]
(E[X]+E[Y])2=E[X]2+2E[X]E[Y]+E[Y]2\big(E[X]+E[Y]\big)^2=E[X]^2+2E[X]E[Y]+E[Y]^2

En soustrayant :

Var(X+Y)=Var(X)+Var(Y)+2(E[XY]−E[X]E[Y])⏟= Cov(X,Y)\mathrm{Var}(X+Y)=\mathrm{Var}(X)+\mathrm{Var}(Y)+2\underbrace{\big(E[XY]-E[X]E[Y]\big)}_{=\ \mathrm{Cov}(X,Y)}
Var(X+Y)=Var(X)+Var(Y)+2 Cov(X,Y)\boxed{\mathrm{Var}(X+Y)=\mathrm{Var}(X)+\mathrm{Var}(Y)+2\,\mathrm{Cov}(X,Y)}

Sous indépendance, l'étape 1 donne Cov=0\mathrm{Cov}=0, d'où le résultat.

👉 La formule générale est plus utile que le cas indépendant : elle montre exactement ce que coûte la dépendance, et elle vaut toujours.

Étape 3 — La vérification sur deux dés
E[X]=E[Y]=72,Var(X)=Var(Y)=3512E[X]=E[Y]=\frac72,\qquad \mathrm{Var}(X)=\mathrm{Var}(Y)=\frac{35}{12}
E[XY]=E[X]E[Y]=72⋅72=494E[XY]=E[X]E[Y]=\frac72\cdot\frac72=\boxed{\frac{49}{4}}

Contrôle EXHAUSTIF sur les 3636 issues :

E[XY]=136∑a=16∑b=16ab=136(∑aa)(∑bb)=21×2136=44136=494 ✓E[XY]=\frac{1}{36}\sum_{a=1}^{6}\sum_{b=1}^{6}ab=\frac{1}{36}\Big(\sum_a a\Big)\Big(\sum_b b\Big)=\frac{21\times 21}{36}=\frac{441}{36}=\frac{49}{4}\ \checkmark

Et la variance de la somme :

Var(X+Y)=3512+3512=7012=356≈5,833\mathrm{Var}(X+Y)=\frac{35}{12}+\frac{35}{12}=\frac{70}{12}=\boxed{\frac{35}{6}}\approx 5{,}833

Contrôle exhaustif : le calcul direct sur les 3636 issues donne bien 356\frac{35}{6} ✓

La conséquence qui produit le TCL

Pour nn variables i.i.d. de variance σ2\sigma^2 :

Var(Sn)=Var(∑i=1nXi)=nσ2\mathrm{Var}(S_n)=\mathrm{Var}\Big(\sum_{i=1}^{n}X_i\Big)=n\sigma^2
σ(Sn)=σn\sigma(S_n)=\sigma\sqrt n
la somme croiˆt en n, sa dispersion en n\boxed{\text{la somme cro\^it en } n,\ \text{sa dispersion en } \sqrt n}

Pour la MOYENNE :

Var(X‾n)=1n2⋅nσ2=σ2n ⟹ σ(X‾n)=σn\mathrm{Var}(\overline X_n)=\frac{1}{n^2}\cdot n\sigma^2=\frac{\sigma^2}{n}\ \Longrightarrow\ \sigma(\overline X_n)=\frac{\sigma}{\sqrt n}

👉 C'est la formule la plus utilisée de toute la statistique : l'incertitude d'une moyenne décroît en 1/n1/\sqrt n.

loi des grands nombresσ2/n→0, donc concentration (exercice B5)TCLla bonne normalisation est σn (exercice E1)Monte-Carloerreur en 1/N (exercice E5)\begin{array}{ll} \text{loi des grands nombres} & \sigma^2/n\to 0,\ \text{donc concentration (exercice B5)}\\ \text{TCL} & \text{la bonne normalisation est } \sigma\sqrt n\ \text{(exercice E1)}\\ \text{Monte-Carlo} & \text{erreur en } 1/\sqrt N\ \text{(exercice E5)} \end{array}

Et le prix à payer : diviser l'erreur par 1010 demande 100100 fois plus d'observations.

Réponse. X⊥Y⇒E[XY]=E[X]E[Y]X\perp Y\Rightarrow E[XY]=E[X]E[Y], Var(X+Y)=VarX+VarY\mathrm{Var}(X+Y)=\mathrm{Var}X+\mathrm{Var}Y ; 2 dés : 494\tfrac{49}4, 356\tfrac{35}6. (Vérifié machine : E[XY]=49/4E[XY]=49/4, Var(X+Y)=35/6\mathrm{Var}(X+Y)=35/6, Cov=0\mathrm{Cov}=0 — B ✓)
Faire cet exercice dans l'app →

Covariance, corrélation, décorrélation n'est pas indépendance

DémonstrationDifficulté 3/5

Définir Cov(X,Y)\mathrm{Cov}(X,Y) et ρ(X,Y)∈[−1,1]\rho(X,Y)\in[-1,1]. Montrer ρ(X,7−X)=−1\rho(X,7-X)=-1 (deux dés). Donner un contre-exemple de v.a. décorrélées mais dépendantes.

Indices (3)

ρ=Cov(X,Y)σXσY\rho=\tfrac{\mathrm{Cov}(X,Y)}{\sigma_X\sigma_Y}, ∣ρ∣≤1|\rho|\leq1 (Cauchy-Schwarz).

Y=7−XY=7-X est affine décroissante de XX.

Prendre Y=X2Y=X^2 avec XX symétrique.

Correction détaillée
Les définitions et les deux résultats
Cov(X,Y)=E[XY]−E[X]E[Y],ρ(X,Y)=Cov(X,Y)σXσY∈[−1,1]\boxed{\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y],\qquad \rho(X,Y)=\frac{\mathrm{Cov}(X,Y)}{\sigma_X\sigma_Y}\in[-1,1]}
ρ(X, 7−X)=−1\boxed{\rho(X,\ 7-X)=-1}
deˊcorreˊleˊes ⟹̸ indeˊpendantes\boxed{\text{d\'ecorr\'el\'ees}\ \not\Longrightarrow\ \text{ind\'ependantes}}

Le dernier point est le piège central de tout le chapitre : ρ\rho ne mesure que la dépendance linéaire.

Étape 1 — L'encadrement de $\rho$

Par Cauchy-Schwarz (exercice D4), appliqué aux variables centrées :

∣E[(X−μX)(Y−μY)]∣≤E[(X−μX)2]E[(Y−μY)2]=σXσY\lvert E[(X-\mu_X)(Y-\mu_Y)]\rvert\leq\sqrt{E[(X-\mu_X)^2]}\sqrt{E[(Y-\mu_Y)^2]}=\sigma_X\sigma_Y
∣Cov(X,Y)∣≤σXσY ⟹ ∣ρ∣≤1\boxed{\lvert\mathrm{Cov}(X,Y)\rvert\leq\sigma_X\sigma_Y\ \Longrightarrow\ \lvert\rho\rvert\leq 1}

Et le cas d'ÉGALITÉ est instructif : ∣ρ∣=1\lvert\rho\rvert=1 si et seulement si les variables centrées sont proportionnelles, c'est-à-dire

Y=aX+b presque suˆrementY=aX+b\ \text{presque s\^urement}
ρ=+1 si a>0,ρ=−1 si a<0\rho=+1\ \text{si } a>0,\qquad \rho=-1\ \text{si } a<0
Étape 2 — Le calcul de $\rho(X,7-X)$
Y=7−X— une relation AFFINE de pente −1Y=7-X\qquad\text{— une relation AFFINE de pente } -1
E[Y]=7−72=72,Var(Y)=(−1)2Var(X)=3512E[Y]=7-\frac72=\frac72,\qquad \mathrm{Var}(Y)=(-1)^2\mathrm{Var}(X)=\frac{35}{12}

La covariance :

Cov(X,7−X)=E[X(7−X)]−E[X]E[7−X]=7E[X]−E[X2]−494\mathrm{Cov}(X,7-X)=E[X(7-X)]-E[X]E[7-X]=7E[X]-E[X^2]-\frac{49}{4}
=7⋅72−916−494=492−916−494=7\cdot\frac72-\frac{91}{6}-\frac{49}{4}=\frac{49}{2}-\frac{91}{6}-\frac{49}{4}

Sur 1212 comme dénominateur commun :

=294−182−14712=−3512=\frac{294-182-147}{12}=\frac{-35}{12}
ρ=−35/1235/12⋅35/12=−35/1235/12=−1\rho=\frac{-35/12}{\sqrt{35/12}\cdot\sqrt{35/12}}=\frac{-35/12}{35/12}=\boxed{-1}

👉 Cohérent avec le cas d'égalité : YY est une fonction affine décroissante de XX.

Interprétation : sur un dé, la face opposée est 7−X7-X. Connaître l'une donne exactement l'autre — dépendance totale, et de nature affine.

Étape 3 — Le contre-exemple : décorrélées mais dépendantes
X uniforme sur {−1, 0, 1},Y=X2X\ \text{uniforme sur } \{-1,\ 0,\ 1\},\qquad Y=X^2

Décorrélées :

E[X]=−1+0+13=0,E[XY]=E[X3]=−1+0+13=0E[X]=\frac{-1+0+1}{3}=0,\qquad E[XY]=E[X^3]=\frac{-1+0+1}{3}=0
Cov(X,Y)=E[XY]−E[X]E[Y]=0−0=0\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]=0-0=\boxed{0}

Mais DÉPENDANTES, et de la façon la plus forte possible : YY est une fonction de XX !

P(Y=0∣X=0)=1alors queP(Y=0)=13P(Y=0\mid X=0)=1\qquad\text{alors que}\qquad P(Y=0)=\frac13
1≠13 ⟹ deˊpendantes1\neq\frac13\ \Longrightarrow\ \text{d\'ependantes}
Cov=0 mais Y est ENTIEˋREMENT deˊtermineˊ par X\boxed{\mathrm{Cov}=0\ \text{mais } Y\ \text{est ENTI\`EREMENT d\'etermin\'e par } X}

👉 La raison : la dépendance est quadratique, et ρ\rho ne voit que le linéaire. C'est la SYMÉTRIE de la loi de XX qui annule la covariance.

Ce que $\rho$ mesure, et ce qu'il ne voit pas
relationρdeˊpendance ?Y=2X+3+1totaleY=7−X−1totaleY=X2 (X symeˊtrique)0TOTALEX⊥Y0aucune\begin{array}{lll} \text{relation} & \rho & \text{d\'ependance ?}\\\hline Y=2X+3 & +1 & \text{totale}\\ Y=7-X & -1 & \text{totale}\\ Y=X^2\ (X\ \text{sym\'etrique}) & \mathbf{0} & \textbf{TOTALE}\\ X\perp Y & 0 & \text{aucune} \end{array}

Les deux lignes du milieu ont le même ρ\rho et des situations opposées.

indeˊpendance ⟹ ρ=0, mais pas, en geˊneˊral, l’inverse\boxed{\text{ind\'ependance}\ \Longrightarrow\ \rho=0,\ \text{mais pas, en g\'en\'eral, l'inverse}}

⚠️ Exception importante : pour un vecteur GAUSSIEN, décorrélation et indépendance coïncident (exercice D6) — comme, plus modestement, pour deux variables de Bernoulli. C'est une propriété remarquable de la loi normale, et elle explique pourquoi la confusion est si répandue en statistique — là où l'on travaille précisément sous hypothèse gaussienne.

👉 Pour le TCL, seule la DÉCORRÉLATION serait nécessaire à l'additivité des variances (exercice B2). Mais l'indépendance est requise pour la fonction caractéristique de la somme (exercice C3) — c'est là qu'elle devient indispensable.

Réponse. ρ∈[−1,1]\rho\in[-1,1] ; ρ(X,7−X)=−1\rho(X,7-X)=-1 ; décorrélé ⇏\not\Rightarrow indépendant (Y=X2Y=X^2). (Vérifié machine : ρ(X,7−X)=−1\rho(X,7-X)=-1, ∣ρ∣≤1|\rho|\leq1 Cauchy-Schwarz — B ✓)
Faire cet exercice dans l'app →

Modes de convergence d'une suite de variables aléatoires

DémonstrationDifficulté 3/5

Définir les convergences presque sûre, en probabilité, en loi et en moyenne quadratique (L2L^2). Donner les implications entre elles. Laquelle intervient dans la loi des grands nombres ? dans le TCL ?

Indices (3)

p.s. : P(Xn→X)=1P(X_n\to X)=1 ; proba : P(∣Xn−X∣>ε)→0P(|X_n-X|>\varepsilon)\to0.

L2L^2 : E[(Xn−X)2]→0E[(X_n-X)^2]\to0 ; loi : FXn→FXF_{X_n}\to F_X aux points de continuité.

p.s. ou L2L^2 ⇒\Rightarrow proba ⇒\Rightarrow loi.

Correction détaillée
Les quatre modes, et leur hiérarchie
presque suˆreXn→X p.s.P(lim⁡Xn=X)=1en probabiliteˊXn→PXP(∣Xn−X∣>ε)→0en moyenne quadratiqueXn→L2XE[(Xn−X)2]→0en loiXn→LXFn(x)→F(x) en tout point de continuiteˊ\begin{array}{lll} \textbf{presque s\^ure} & X_n\to X\ \text{p.s.} & P(\lim X_n=X)=1\\ \textbf{en probabilit\'e} & X_n\overset{P}{\to}X & P(\lvert X_n-X\rvert>\varepsilon)\to 0\\ \textbf{en moyenne quadratique} & X_n\overset{L^2}{\to}X & E[(X_n-X)^2]\to 0\\ \textbf{en loi} & X_n\overset{\mathcal{L}}{\to}X & F_n(x)\to F(x)\ \text{en tout point de continuit\'e} \end{array}
p.s. ⟹ en probabiliteˊ ⟹ en loi\boxed{\text{p.s.}\ \Longrightarrow\ \text{en probabilit\'e}\ \Longrightarrow\ \text{en loi}}
L2 ⟹ en probabiliteˊ\boxed{L^2\ \Longrightarrow\ \text{en probabilit\'e}}

Aucune réciproque n'est vraie — et chaque contre-exemple est instructif.

Étape 1 — Les implications

L2⇒L^2\Rightarrow probabilité, par Tchebychev (exercice A4) :

P(∣Xn−X∣>ε)≤E[(Xn−X)2]ε2→0P\big(\lvert X_n-X\rvert>\varepsilon\big)\leq\frac{E[(X_n-X)^2]}{\varepsilon^2}\to 0

p.s. ⇒\Rightarrow probabilité : c'est le théorème de convergence dominée appliqué aux indicatrices, ou directement la continuité de la mesure.

Probabilité ⇒\Rightarrow loi : la convergence en probabilité force celle des fonctions de répartition aux points de continuité.

👉 La convergence en loi est la PLUS FAIBLE — elle ne porte que sur les lois, pas sur les variables. Elle peut avoir lieu entre variables définies sur des espaces différents.

Étape 2 — Les contre-exemples

Probabilité sans p.s. — la « bosse glissante » : sur [0,1][0,1] uniforme, Xn=1InX_n=\mathbf 1_{I_n} où les InI_n parcourent [0,12],[12,1],[0,14],…[0,\frac12],[\frac12,1],[0,\frac14],\dots

P(Xn≠0)=∣In∣→0 ⟹ Xn→P0P(X_n\neq 0)=\lvert I_n\rvert\to 0\ \Longrightarrow\ X_n\overset{P}{\to}0

Mais pour CHAQUE ω\omega, Xn(ω)X_n(\omega) vaut 11 infiniment souvent — aucune convergence ponctuelle.

Loi sans probabilité : X∼N(0,1)X\sim\mathcal{N}(0,1) et Xn=−XX_n=-X pour tout nn.

Xn a la MEˆME loi que X (symeˊtrie) ⟹ Xn→LXX_n\ \text{a la M\^EME loi que } X\ \text{(sym\'etrie)}\ \Longrightarrow\ X_n\overset{\mathcal{L}}{\to}X

Mais ∣Xn−X∣=2∣X∣\lvert X_n-X\rvert=2\lvert X\rvert ne tend pas vers 00.

👉 C'est le contre-exemple à retenir : la convergence en loi ne dit rien sur le lien entre XnX_n et XX.

Étape 3 — Quel mode dans quel théorème
theˊoreˋmemodeexerciceloi FAIBLE des grands nombresen PROBABILITEˊB5loi FORTE des grands nombresPRESQUE SUˆREB6TCLEN LOIE1\begin{array}{lll} \text{th\'eor\`eme} & \text{mode} & \text{exercice}\\\hline \text{loi FAIBLE des grands nombres} & \text{en PROBABILIT\'E} & \text{B5}\\ \text{loi FORTE des grands nombres} & \text{PRESQUE S\^URE} & \text{B6}\\ \textbf{TCL} & \textbf{EN LOI} & \text{E1} \end{array}

👉 C'est là toute la différence entre « faible » et « forte » : le même énoncé, deux modes de convergence, et la forte implique la faible.

⚠️ Le TCL ne converge QU'EN LOI, et c'est essentiel : Sn∗S_n^\ast ne converge vers aucune variable aléatoire particulière. Ce sont ses lois qui s'approchent de N(0,1)\mathcal{N}(0,1).

Sn∗→Z n’aurait aucun sens en probabiliteˊ\boxed{\text{} S_n^\ast\to Z \text{ n'aurait aucun sens en probabilit\'e}}
Pourquoi la convergence en loi suffit

Ce qu'on veut calculer en pratique :

P(a≤Sn∗≤b) ≈ Φ(b)−Φ(a)P(a\leq S_n^\ast\leq b)\ \approx\ \Phi(b)-\Phi(a)

et c'est exactement ce que la convergence en loi donne — pas besoin de plus.

convergence en loisuffit aˋ approcher des PROBABILITEˊSconvergence p.s. ou en probabiliteˊpour approcher une VARIABLE\begin{array}{ll} \text{convergence en loi} & \text{suffit \`a approcher des PROBABILIT\'ES}\\ \text{convergence p.s. ou en probabilit\'e} & \text{pour approcher une VARIABLE} \end{array}

👉 Le théorème de PORTEMANTEAU donne les formulations équivalentes de la convergence en loi, dont celle-ci, la plus commode :

Xn→LX  ⟺  E[g(Xn)]→E[g(X)] pour toute g continue borneˊeX_n\overset{\mathcal{L}}{\to}X\iff E[g(X_n)]\to E[g(X)]\ \text{pour toute } g\ \text{continue born\'ee}

Et le théorème de LÉVY (exercice C4) la caractérise par les fonctions caractéristiques — c'est ce qui rendra la preuve du TCL possible.

Réponse. p.s. ⇒\Rightarrow proba ⇒\Rightarrow loi ; L2⇒L^2\Rightarrow proba ; LGN faible/forte = proba/p.s., TCL = loi. (Conclusion certifiée sur instances ; hiérarchie générale = relecture)
Faire cet exercice dans l'app →

Loi faible des grands nombres par Bienaymé-Tchebychev

DémonstrationDifficulté 3/5

Démontrer la loi FAIBLE des grands nombres : pour XiX_i i.i.d. de moyenne μ\mu et variance σ2<∞\sigma^2<\infty, X‾n=1n∑Xi→μ\overline{X}_n=\tfrac1n\sum X_i\to\mu en probabilité. Préciser la vitesse fournie par Tchebychev.

Indices (3)

E[X‾n]=μE[\overline{X}_n]=\mu, Var(X‾n)=σ2n\mathrm{Var}(\overline{X}_n)=\tfrac{\sigma^2}n.

Appliquer Tchebychev à X‾n\overline{X}_n.

P(∣X‾n−μ∣≥ε)≤σ2nε2P(|\overline{X}_n-\mu|\geq\varepsilon)\leq\tfrac{\sigma^2}{n\varepsilon^2}.

Correction détaillée
Le théorème, et sa démonstration en trois lignes
Xi i.i.d., E[Xi]=μ, Var(Xi)=σ2<∞ ⟹ X‾n→Pμ\boxed{X_i\ \text{i.i.d.},\ E[X_i]=\mu,\ \mathrm{Var}(X_i)=\sigma^2<\infty\ \Longrightarrow\ \overline X_n\overset{P}{\to}\mu}
X‾n=1n∑i=1nXi\overline X_n=\frac1n\sum_{i=1}^{n}X_i

La démonstration tient en deux calculs et une application de Tchebychev.

VITESSE fournie: P(∣X‾n−μ∣≥ε)≤σ2nε2\text{VITESSE fournie} : \ P\big(\lvert\overline X_n-\mu\rvert\geq\varepsilon\big)\leq\frac{\sigma^2}{n\varepsilon^2}
Étape 1 — Espérance et variance de la moyenne

Espérance, par linéarité (aucune hypothèse nécessaire) :

E[X‾n]=1n∑i=1nE[Xi]=nμn=μE[\overline X_n]=\frac1n\sum_{i=1}^{n}E[X_i]=\frac{n\mu}{n}=\mu
X‾n est un estimateur SANS BIAIS de μ\boxed{\overline X_n\ \text{est un estimateur SANS BIAIS de } \mu}

Variance, qui exige l'indépendance (exercice B2) :

Var(X‾n)=1n2Var(∑iXi)=1n2⋅nσ2=σ2n\mathrm{Var}(\overline X_n)=\frac{1}{n^2}\mathrm{Var}\Big(\sum_iX_i\Big)=\frac{1}{n^2}\cdot n\sigma^2=\boxed{\frac{\sigma^2}{n}}

👉 La variance TEND VERS ZÉRO — c'est tout le contenu du théorème : la moyenne se concentre.

Étape 2 — Appliquer Tchebychev

L'inégalité de Bienaymé-Tchebychev (exercice A4) appliquée à X‾n\overline X_n :

P(∣X‾n−μ∣≥ε)≤Var(X‾n)ε2=σ2nε2P\big(\lvert\overline X_n-\mu\rvert\geq\varepsilon\big)\leq\frac{\mathrm{Var}(\overline X_n)}{\varepsilon^2}=\boxed{\frac{\sigma^2}{n\varepsilon^2}}

Et ce majorant tend vers 00 quand n→∞n\to\infty, à ε\varepsilon fixé :

X‾n→Pμ\overline X_n\overset{P}{\to}\mu

👉 Trois lignes, aucune astuce — c'est le rendement de l'inégalité de Tchebychev, grossière mais universelle.

Étape 3 — La vitesse, et ce qu'elle vaut

Sur le dé : μ=3,5\mu=3{,}5, σ2=3512\sigma^2=\frac{35}{12}, avec ε=0,1\varepsilon=0{,}1 :

nσ2/(nε2)borne10035/12100×0,012,92 — INUTILE (>1)1 0000,2910 0000,029100 0000,0029\begin{array}{lcl} n & \sigma^2/(n\varepsilon^2) & \text{borne}\\\hline 100 & \frac{35/12}{100\times 0{,}01} & 2{,}92\ \text{— INUTILE } (>1)\\ 1\,000 & & 0{,}29\\ 10\,000 & & 0{,}029\\ 100\,000 & & 0{,}0029 \end{array}
la borne deˊcroiˆt en 1/n\boxed{\text{la borne d\'ecro\^it en } 1/n}

⚠️ Elle est très grossière : à n=100n=100, elle est supérieure à 11, donc sans information. Le TCL donnera bien mieux — une approximation en e−cε2ne^{-c\varepsilon^2 n} plutôt qu'une borne en 1/n1/n (une vraie borne exponentielle, pour des variables bornées, est l'inégalité de Hoeffding).

Comparaison à n=1000n=1000, ε=0,1\varepsilon=0{,}1 :

Tchebychev:0,29TCL:≈2(1−Φ(1,85))≈0,064\text{Tchebychev} : 0{,}29\qquad\text{TCL} : \approx 2\big(1-\Phi(1{,}85)\big)\approx 0{,}064

👉 Le TCL est cinq fois plus précis ici — mais il n'est qu'asymptotique, alors que Tchebychev vaut pour tout nn. Les deux se complètent.

Faible et forte : ce qui les sépare
modehypotheˋseFAIBLEen probabiliteˊσ2<∞ (preuve ci-dessus)FORTEpresque suˆreE[∣X∣]<∞ seulement !\begin{array}{lll} & \text{mode} & \text{hypoth\`ese}\\\hline \textbf{FAIBLE} & \text{en probabilit\'e} & \sigma^2<\infty\ \text{(preuve ci-dessus)}\\ \textbf{FORTE} & \text{presque s\^ure} & E[\lvert X\rvert]<\infty\ \text{seulement !} \end{array}

⚠️ La forte demande MOINS que la preuve ci-dessus : l'espérance finie suffit, la variance n'est pas requise (la faible aussi, d'ailleurs, vaut sous E[∣X∣]<∞E[\lvert X\rvert]<\infty : théorème de Khintchine). C'est contre-intuitif — un théorème plus fort sous une hypothèse plus faible.

le prix est une deˊmonstration bien plus difficile (exercice B6)\boxed{\text{le prix est une d\'emonstration bien plus difficile (exercice B6)}}

👉 Interprétation de la différence :

faiblepour n grand, l’eˊcart est probablement petitfortepour PRESQUE TOUTE trajectoire, l’eˊcart finit par rester petit\begin{array}{ll} \text{faible} & \text{pour } n\ \text{grand, l'\'ecart est probablement petit}\\ \text{forte} & \text{pour PRESQUE TOUTE trajectoire, l'\'ecart finit par rester petit} \end{array}

La faible autorise des écarts qui reviennent infiniment souvent, pourvu qu'ils soient de plus en plus rares. La forte les interdit — c'est exactement la « bosse glissante » de l'exercice B4.

Réponse. Var(X‾n)=σ2n\mathrm{Var}(\overline{X}_n)=\tfrac{\sigma^2}n ; P(∣X‾n−μ∣≥ε)≤σ2nε2→0P(|\overline{X}_n-\mu|\geq\varepsilon)\leq\tfrac{\sigma^2}{n\varepsilon^2}\to0 (loi faible). (Vérifié sur instances : Tchebychev, Var(X‾n)∝1/n\mathrm{Var}(\overline{X}_n)\propto1/n ; Monte-Carlo — B ✓)
Faire cet exercice dans l'app →

Loi forte (ADMIS) et méthode de Monte-Carlo

DémonstrationDifficulté 3/5

Énoncer la loi FORTE des grands nombres (Kolmogorov). Expliquer comment elle justifie la méthode de Monte-Carlo et estimer π\pi par tirage de points dans le carré. Quelle est la vitesse de l'erreur ?

Indices (3)

X‾n→μ\overline{X}_n\to\mu presque sûrement (si E∣X∣<∞E|X|<\infty).

Monte-Carlo : E[g(U)]≈1N∑g(Ui)E[g(U)]\approx\tfrac1N\sum g(U_i).

Erreur ∼σN\sim\tfrac{\sigma}{\sqrt N} (TCL).

Correction détaillée
Le théorème, et son statut
LOI FORTE (Kolmogorov, ADMIS): E[∣X∣]<∞ ⟹ X‾n→μ PRESQUE SUˆREMENT\boxed{\text{LOI FORTE (Kolmogorov, ADMIS)} : \ E[\lvert X\rvert]<\infty\ \Longrightarrow\ \overline X_n\to\mu\ \text{PRESQUE S\^UREMENT}}

⚠️ Statut : ADMIS. Sa démonstration dépasse ce chapitre — elle demande les inégalités maximales de Kolmogorov, ou la théorie des martingales.

Ce qu'on vérifie ici : la loi FAIBLE (exercice B5, démontrée), et les conséquences numériques de la forte sur Monte-Carlo — que l'on peut mesurer.

hypotheˋse:l’espeˊrance finie SUFFIT — pas besoin de variance\text{hypoth\`ese} : \text{l'esp\'erance finie SUFFIT — pas besoin de variance}
Étape 1 — Ce que la forte ajoute
FAIBLE∀ε, P(∣X‾n−μ∣>ε)→0FORTEP(lim⁡nX‾n=μ)=1\begin{array}{ll} \text{FAIBLE} & \forall\varepsilon,\ P(\lvert\overline X_n-\mu\rvert>\varepsilon)\to 0\\ \textbf{FORTE} & P\big(\lim_n\overline X_n=\mu\big)=1 \end{array}

La forte porte sur les TRAJECTOIRES : pour presque tout ω\omega, la suite numérique X‾n(ω)\overline X_n(\omega) converge vers μ\mu.

👉 C'est ce qui justifie qu'on puisse lancer UNE simulation et lui faire confiance. La faible ne garantirait que « la plupart des simulations sont bonnes pour nn grand » — sans exclure qu'une trajectoire donnée oscille indéfiniment.

Monte-Carlo REPOSE sur la loi forte\boxed{\text{Monte-Carlo REPOSE sur la loi forte}}
Étape 2 — La méthode de Monte-Carlo

Pour estimer I=E[g(U)]I=E[g(U)] avec UU uniforme :

I^N=1N∑i=1Ng(Ui) →N→∞p.s. I\widehat I_N=\frac1N\sum_{i=1}^{N}g(U_i)\ \xrightarrow[N\to\infty]{\text{p.s.}}\ I

Estimation de π\pi : on tire (U,V)(U,V) uniformes dans [0,1]2[0,1]^2 et l'on compte les points du quart de disque.

p=P(U2+V2≤1)=aire du quart de disqueaire du carreˊ=π/41=π4p=P(U^2+V^2\leq 1)=\frac{\text{aire du quart de disque}}{\text{aire du carr\'e}}=\frac{\pi/4}{1}=\frac\pi4
π^N=4×#{points dans le disque}N\widehat\pi_N=4\times\frac{\#\{\text{points dans le disque}\}}{N}

Contrôle : π/4≈0,785398\pi/4\approx 0{,}785398 ✓

Étape 3 — La vitesse, et ce qu'elle coûte

Les indicatrices suivent une Bernoulli(π/4\pi/4), de variance

σ2=π4(1−π4)≈0,1685\sigma^2=\frac\pi4\Big(1-\frac\pi4\Big)\approx 0{,}1685
σ(π^N)=4×σN\sigma\big(\widehat\pi_N\big)=4\times\frac{\sigma}{\sqrt N}
Ndemi-largeur IC 95%104≈0,0322 deˊcimales106≈0,00323 deˊcimales108≈0,000324 deˊcimales\begin{array}{lcl} N & \text{demi-largeur IC } 95\% & \\\hline 10^4 & \approx 0{,}032 & \text{2 d\'ecimales}\\ 10^6 & \approx 0{,}0032 & \text{3 d\'ecimales}\\ 10^8 & \approx 0{,}00032 & \text{4 d\'ecimales} \end{array}
erreur∼CN\boxed{\text{erreur} \sim \frac{C}{\sqrt N}}

⚠️ Une décimale de plus coûte 100100 fois plus de tirages. C'est ce qui rend Monte-Carlo inefficace en petite dimension — une quadrature classique y fait bien mieux.

Où Monte-Carlo gagne, et ce que le TCL ajoute
meˊthodeerreur en dimension dtrapeˋzesN−2/ds’effondre avec dSimpsonN−4/didemMonte-CarloN−1/2indeˊpendant de d\begin{array}{lll} \text{m\'ethode} & \text{erreur en dimension } d & \\\hline \text{trap\`ezes} & N^{-2/d} & \text{s'effondre avec } d\\ \text{Simpson} & N^{-4/d} & \text{idem}\\ \textbf{Monte-Carlo} & \mathbf{N^{-1/2}} & \textbf{ind\'ependant de } d \end{array}

👉 C'est la seule méthode dont la vitesse ne dépend PAS de la dimension — d'où son emploi en finance, en physique statistique et en apprentissage, où dd se compte en milliers.

d=2les trapeˋzes gagnent (N−1 contre N−1/2)d=8eˊgaliteˊ pour Simpson (deˋs d=4 pour les trapeˋzes)d=20Monte-Carlo eˊcrase tout\begin{array}{ll} d=2 & \text{les trap\`ezes gagnent } (N^{-1}\ \text{contre } N^{-1/2})\\ d=8 & \text{\'egalit\'e pour Simpson (d\`es } d=4\ \text{pour les trap\`ezes)}\\ d=20 & \text{Monte-Carlo \'ecrase tout} \end{array}

Et le TCL apporte ce que la loi forte ne donne pas : la LOI de l'erreur (exercice E5). La forte dit que l'erreur tend vers 00 ; le TCL dit qu'elle est gaussienne, donc quantifiable par un intervalle de confiance.

la loi forte JUSTIFIE, le TCL QUANTIFIE\boxed{\text{la loi forte JUSTIFIE, le TCL QUANTIFIE}}
Réponse. LFGN (p.s., ADMIS) justifie Monte-Carlo ; π≈3,14\pi\approx3{,}14 ; erreur ∼σN\sim\tfrac\sigma{\sqrt N}. (LFGN ADMIS ; Monte-Carlo vérifié sur instances : π≈3,1377\pi\approx3{,}1377, erreur ∝1/N\propto1/\sqrt N — B ✓)
Faire cet exercice dans l'app →

Énoncé du théorème central limite

DémonstrationDifficulté 3/5

Énoncer précisément le théorème central limite (hypothèses comprises). Que signifie la convergence ? Pourquoi le facteur de normalisation est-il σn\sigma\sqrt n ? Préciser le statut de vérification.

Indices (3)

XiX_i i.i.d., E[X]=μE[X]=\mu, 0<Var(X)=σ2<∞0<\mathrm{Var}(X)=\sigma^2<\infty.

Sn∗=Sn−nμσn→N(0,1)S_n^\ast=\tfrac{S_n-n\mu}{\sigma\sqrt n}\to\mathcal{N}(0,1) en loi.

Var(Sn)=nσ2\mathrm{Var}(S_n)=n\sigma^2 donne l'échelle n\sqrt n.

Correction détaillée
L'énoncé complet, hypothèses comprises

Soient (Xi)i≥1(X_i)_{i\geq 1} i.i.d. avec E[Xi]=μE[X_i]=\mu et Var(Xi)=σ2∈ ]0,∞[\mathrm{Var}(X_i)=\sigma^2\in\,]0,\infty[. Posons Sn=∑i=1nXiS_n=\sum_{i=1}^{n}X_i. Alors

Sn∗=Sn−nμσn →n→∞L N(0,1)\boxed{S_n^{\ast}=\frac{S_n-n\mu}{\sigma\sqrt n}\ \xrightarrow[n\to\infty]{\mathcal{L}}\ \mathcal{N}(0,1)}

La convergence est EN LOI (exercice B4) : pour tout xx,

P(Sn∗≤x) ⟶ Φ(x)=∫−∞xe−t2/22πdtP\big(S_n^{\ast}\leq x\big)\ \longrightarrow\ \Phi(x)=\int_{-\infty}^{x}\frac{e^{-t^2/2}}{\sqrt{2\pi}}dt

Statut de vérification : la preuve est faite à l'exercice C5, modulo le théorème de Lévy (exercice C4), qui est ADMIS.

Étape 1 — Pourquoi $\sigma\sqrt n$, et pas autre chose

Le facteur est IMPOSÉ par le calcul de la variance (exercice B2) :

E[Sn]=nμ,Var(Sn)=nσ2,σ(Sn)=σnE[S_n]=n\mu,\qquad \mathrm{Var}(S_n)=n\sigma^2,\qquad \sigma(S_n)=\sigma\sqrt n

Standardiser, c'est diviser par l'écart-type :

E[Sn∗]=0,Var(Sn∗)=nσ2σ2n=1E[S_n^{\ast}]=0,\qquad \mathrm{Var}(S_n^{\ast})=\frac{n\sigma^2}{\sigma^2 n}=1
toute autre normalisation eˊchoue\boxed{\text{toute autre normalisation \'echoue}}
diviser parVar obtenuelimitenσ2/n→0constante 0 (c’est la LGN)σn1N(0,1)n4σ2n→∞aucune limite\begin{array}{lll} \text{diviser par} & \mathrm{Var}\ \text{obtenue} & \text{limite}\\\hline n & \sigma^2/n\to 0 & \text{constante } 0\ \text{(c'est la LGN)}\\ \boldsymbol{\sigma\sqrt n} & \mathbf{1} & \boldsymbol{\mathcal{N}(0,1)}\\ \sqrt[4]{n} & \sigma^2\sqrt n\to\infty & \text{aucune limite} \end{array}

👉 n\sqrt n est la SEULE échelle où quelque chose de non trivial se produit — c'est l'échelle des fluctuations, entre la loi des grands nombres et l'explosion.

Étape 2 — Ce que « en loi » signifie, et ne signifie pas
seules les LOIS convergent, pas les variables\boxed{\text{seules les LOIS convergent, pas les variables}}
VRAIP(a≤Sn∗≤b)→Φ(b)−Φ(a)FAUXSn∗ converge vers une variable Z\begin{array}{ll} \text{VRAI} & P(a\leq S_n^{\ast}\leq b)\to\Phi(b)-\Phi(a)\\ \text{FAUX} & S_n^{\ast}\ \text{converge vers une variable } Z \end{array}

Sn∗S_n^\ast ne converge vers RIEN au sens presque sûr — au contraire, elle continue d'osciller indéfiniment (c'est la loi du logarithme itéré qui en décrit l'amplitude).

👉 Et c'est bien assez : en pratique, on veut approcher des probabilités, et la convergence en loi les donne (exercice B4).

Nuance sur les points de continuité : la convergence des FnF_n n'est exigée qu'aux points où FF est continue. Ici Φ\Phi est continue partout, donc la convergence a lieu en tout point — c'est une simplification propre à la limite gaussienne.

Étape 3 — Les hypothèses, et ce qui rate sans elles
hypotheˋsesi on l’oˆtecontre-exempleσ2<∞limite parfois STABLE non gaussienneloi de Cauchyindeˊpendancepeut eˊchouersuites fortement correˊleˊesidentique distributionaffaiblissablecondition de Lindeberg\begin{array}{lll} \text{hypoth\`ese} & \text{si on l'\^ote} & \text{contre-exemple}\\\hline \sigma^2<\infty & \text{limite parfois STABLE non gaussienne} & \text{loi de Cauchy}\\ \text{ind\'ependance} & \text{peut \'echouer} & \text{suites fortement corr\'el\'ees}\\ \text{identique distribution} & \text{affaiblissable} & \text{condition de Lindeberg} \end{array}

La loi de CAUCHY est le contre-exemple canonique : de densité 1π(1+x2)\frac{1}{\pi(1+x^2)}, elle n'a ni espérance ni variance, et

X‾n suit encore une CAUCHY, pour tout n\overline X_n\ \text{suit encore une CAUCHY, pour tout } n
aucune concentration, aucun TCL\boxed{\text{aucune concentration, aucun TCL}}

👉 La troisième ligne est importante en pratique : la condition de Lindeberg remplace « identiquement distribuées » par « aucun terme ne domine ». C'est elle qui justifie le TCL sur des données réelles, jamais parfaitement i.i.d.

Lindeberg: 1sn2∑iE[Xi21∣Xi∣>εsn]→0\text{Lindeberg} : \ \frac{1}{s_n^2}\sum_iE\big[X_i^2\mathbf 1_{\lvert X_i\rvert>\varepsilon s_n}\big]\to 0
Ce que le TCL EXPLIQUE
la loi normale apparaiˆt partout parce que tout est SOMME\boxed{\text{la loi normale appara\^it partout parce que tout est SOMME}}
erreurs de mesuresomme de petites perturbationstaille d’un individusomme d’effets geˊneˊtiquesbruit eˊlectroniquesomme de chocsmoyenne d’un sondagesomme de reˊponses\begin{array}{ll} \text{erreurs de mesure} & \text{somme de petites perturbations}\\ \text{taille d'un individu} & \text{somme d'effets g\'en\'etiques}\\ \text{bruit \'electronique} & \text{somme de chocs}\\ \text{moyenne d'un sondage} & \text{somme de r\'eponses} \end{array}

👉 Le TCL dit que la FORME de la limite ne dépend pas de la loi de départ — seuls μ\mu et σ2\sigma^2 comptent. C'est un phénomène d'universalité, et c'est ce qui le rend si frappant.

deˊ, pieˋce, exponentielle, uniforme ⟶ toutes la MEˆME limite\text{d\'e, pi\`ece, exponentielle, uniforme}\ \longrightarrow\ \text{toutes la M\^EME limite}

⚠️ Mais l'universalité a une limite : si la variance est infinie, la limite peut être une loi stable de Lévy, à queues lourdes — ou encore gaussienne, avec une normalisation plus forte que n\sqrt n (densité ∣x∣−3\lvert x\rvert^{-3} sur ∣x∣≥1\lvert x\rvert\geq 1). Les lois stables non gaussiennes interviennent en finance, où l'hypothèse gaussienne sous-estime gravement les événements extrêmes.

Réponse. TCL : Sn∗=Sn−nμσn→N(0,1)S_n^\ast=\tfrac{S_n-n\mu}{\sigma\sqrt n}\to\mathcal{N}(0,1) en loi (i.i.d., variance finie). (TCL ADMIS — preuve par φ\varphi certifiée jusqu'à Lévy ; convergence KS vérifiée sur instances — E)
Faire cet exercice dans l'app →

Approximation normale : de Moivre-Laplace, Poisson, continuité

CalculDifficulté 3/5

Déduire du TCL l'approximation B(n,p)≈N(np,npq)\mathcal{B}(n,p)\approx\mathcal{N}(np,npq). L'appliquer à X∼B(100;0,5)X\sim\mathcal{B}(100;0{,}5) pour estimer P(40≤X≤60)P(40\leq X\leq60) avec correction de continuité. Quand l'approximation est-elle valable ?

Indices (3)

B(n,p)\mathcal{B}(n,p) = somme de nn Bernoulli i.i.d.

Centrer-réduire : Z=X−npnpqZ=\tfrac{X-np}{\sqrt{npq}}.

Correction ±12\pm\tfrac12 pour une loi entière ; lire Φ\Phi.

Correction détaillée
Les résultats
B(n,p) ≈ N(np, np(1−p))pour n grand\boxed{\mathcal{B}(n,p)\ \approx\ \mathcal{N}\big(np,\ np(1-p)\big)\quad\text{pour } n\ \text{grand}}

Sur X∼B(100;0,5)X\sim\mathcal{B}(100;0{,}5) :

valeur EXACTE0,9648normale SANS correction0,9545eˊcart 0,0103normale AVEC correction0,9643eˊcart 0,0005\begin{array}{lcl} \text{valeur EXACTE} & 0{,}9648 & \\ \text{normale SANS correction} & 0{,}9545 & \text{\'ecart } 0{,}0103\\ \textbf{normale AVEC correction} & \mathbf{0{,}9643} & \text{\'ecart } \mathbf{0{,}0005} \end{array}
la correction de continuiteˊ divise l’erreur par 20\boxed{\text{la correction de continuit\'e divise l'erreur par } 20}
Étape 1 — Déduire l'approximation du TCL

Une binomiale EST une somme : X=∑i=1nXiX=\sum_{i=1}^{n}X_i avec Xi∼B(p)X_i\sim\mathcal{B}(p) indépendantes.

μ=p,σ2=p(1−p)(exercice A5)\mu=p,\qquad \sigma^2=p(1-p)\qquad(\text{exercice A5})

Le TCL s'applique directement :

X−npnp(1−p) →L N(0,1)\frac{X-np}{\sqrt{np(1-p)}}\ \xrightarrow{\mathcal{L}}\ \mathcal{N}(0,1)
c’est le theˊoreˋme de DE MOIVRE-LAPLACE\boxed{\text{c'est le th\'eor\`eme de DE MOIVRE-LAPLACE}}

👉 Historiquement, c'est le PREMIER cas du TCL — de Moivre l'a établi en 1733 pour p=12p=\frac12, Laplace l'a étendu en 1812, bien avant l'énoncé général.

Étape 2 — Le calcul, avec correction de continuité
n=100,p=0,5 ⟹ μ=50,σ=100×0,25=5n=100,\quad p=0{,}5\ \Longrightarrow\ \mu=50,\quad \sigma=\sqrt{100\times 0{,}25}=5

⚠️ La correction de continuité : XX est entière, la normale est continue. Pour approcher P(40≤X≤60)P(40\leq X\leq 60), il faut prendre l'intervalle élargi d'un demi de chaque côté :

[39,5 ; 60,5]et non[40 ; 60][39{,}5\ ;\ 60{,}5]\qquad\text{et non}\qquad [40\ ;\ 60]
P(40≤X≤60)≈Φ(60,5−505)−Φ(39,5−505)P(40\leq X\leq 60)\approx\Phi\Big(\frac{60{,}5-50}{5}\Big)-\Phi\Big(\frac{39{,}5-50}{5}\Big)
=Φ(2,1)−Φ(−2,1)=2Φ(2,1)−1=\Phi(2{,}1)-\Phi(-2{,}1)=2\Phi(2{,}1)-1
=2×0,98214−1=0,9643=2\times 0{,}98214-1=\boxed{0{,}9643}
Étape 3 — Pourquoi la correction améliore autant

Sans correction, on prendrait Φ(2)−Φ(−2)=0,9545\Phi(2)-\Phi(-2)=0{,}9545 — écart de 0,01030{,}0103.

Avec, l'écart tombe à 0,0005\mathbf{0{,}0005}.

erreur diviseˊe par 20\boxed{\text{erreur divis\'ee par } 20}

👉 La raison géométrique : la loi binomiale est un histogramme de barres de largeur 11 centrées sur les entiers. La normale approche l'aire sous la courbe. Prendre [40,60][40,60] coupe en deux les barres des extrémités ; prendre [39,5 ; 60,5][39{,}5\ ;\ 60{,}5] les inclut entièrement.

la barre en k occupe [k−12, k+12]\text{la barre en } k\ \text{occupe} \ [k-\tfrac12,\ k+\tfrac12]

⚠️ La correction compte surtout quand l'intervalle est ÉTROIT — pour P(X=50)P(X=50) exactement, elle est indispensable : sans elle, on obtiendrait 00.

P(X=50)≈Φ(0,1)−Φ(−0,1)=0,0797contre 0,0796 exactP(X=50)\approx\Phi(0{,}1)-\Phi(-0{,}1)=0{,}0797\qquad\text{contre } 0{,}0796\ \text{exact}
Quand l'approximation est valable, et l'alternative
reˋgle usuelle: np≥5 ET n(1−p)≥5\boxed{\text{r\`egle usuelle} : \ np\geq 5\ \text{ET}\ n(1-p)\geq 5}

Ici : np=n(1−p)=50≥5np=n(1-p)=50\geq 5 ✓ largement.

npnpapproximation1000,550excellente1000,022MAUVAISE — utiliser POISSON10000,0033Poisson P(3)\begin{array}{lccl} n & p & np & \text{approximation}\\\hline 100 & 0{,}5 & 50 & \text{excellente}\\ 100 & 0{,}02 & 2 & \textbf{MAUVAISE — utiliser POISSON}\\ 1000 & 0{,}003 & 3 & \text{Poisson } \mathcal{P}(3) \end{array}

L'approximation de POISSON couvre le cas des événements rares :

B(n,p) ≈ P(np)quand n grand et p petit, np modeˊreˊ\mathcal{B}(n,p)\ \approx\ \mathcal{P}(np)\qquad\text{quand } n\ \text{grand et } p\ \text{petit, } np\ \text{mod\'er\'e}

👉 Les deux régimes se distinguent : la normale exige que la binomiale soit symétrique et étalée, Poisson qu'elle soit concentrée près de 00. Le critère np≥5np\geq 5 est une règle empirique, pas une frontière exacte : quand pp est petit et npnp grand, Poisson et normale conviennent toutes deux.

np grand→normale;np petit→Poisson\boxed{np\ \text{grand} \to \text{normale} ; \quad np\ \text{petit} \to \text{Poisson}}
Réponse. B(n,p)≈N(np,npq)\mathcal{B}(n,p)\approx\mathcal{N}(np,npq) ; P(40≤X≤60)≈0,96P(40\leq X\leq60)\approx0{,}96 (correction de continuité). (TCL ADMIS ; mécanisme φB(n,p)=(q+peit)n\varphi_{\mathcal{B}(n,p)}=(q+pe^{it})^n certifié — A/C ✓ ; valeurs de Φ\Phi = table)
Faire cet exercice dans l'app →

Vitesse de convergence : inégalité de Berry-Esseen

DémonstrationDifficulté 3/5

Énoncer l'inégalité de Berry-Esseen quantifiant l'erreur du TCL. Sur la somme de nn variables de Rademacher (±1\pm1), donner l'ordre de sup⁡x∣FSn∗(x)−Φ(x)∣\sup_x|F_{S_n^\ast}(x)-\Phi(x)| pour n=10,100n=10,100.

Indices (3)

sup⁡x∣Fn−Φ∣≤Cρσ3n\sup_x|F_n-\Phi|\leq\tfrac{C\rho}{\sigma^3\sqrt n}, ρ=E∣X−μ∣3\rho=E|X-\mu|^3.

C≤0,4748C\leq0{,}4748 (constante optimale ADMIS).

Rademacher : σ=1\sigma=1, ρ=1\rho=1 ⇒\Rightarrow borne 0,4748/n0{,}4748/\sqrt n.

Correction détaillée
L'inégalité, et ce qu'elle apporte
sup⁡x∣FSn∗(x)−Φ(x)∣ ≤ Cρσ3n\boxed{\sup_x\big\lvert F_{S_n^{\ast}}(x)-\Phi(x)\big\rvert\ \leq\ \frac{C\rho}{\sigma^3\sqrt n}}

où ρ=E[∣X−μ∣3]\rho=E\big[\lvert X-\mu\rvert^3\big] est le moment absolu d'ordre 3, et C≈0,4748C\approx 0{,}4748 (Shevtsova, 2011).

👉 Le TCL dit que l'erreur tend vers 00 ; Berry-Esseen dit À QUELLE VITESSE. C'est la différence entre un théorème qualitatif et un outil utilisable.

vitesse: 1n— et elle est OPTIMALE\text{vitesse} : \ \frac{1}{\sqrt n}\qquad\text{— et elle est OPTIMALE}
Étape 1 — Lire l'inégalité
le sup⁡xc’est une erreur UNIFORME, valable partoutρ/σ3sans dimension — moment absolu d’ordre 3 normaliseˊ1/nla vitesse, optimale\begin{array}{ll} \text{le } \sup_x & \text{c'est une erreur UNIFORME, valable partout}\\ \rho/\sigma^3 & \text{sans dimension — moment absolu d'ordre 3 normalis\'e}\\ 1/\sqrt n & \text{la vitesse, optimale} \end{array}

Le rapport ρ/σ3\rho/\sigma^3 (toujours ≥1\geq 1) fixe la largeur de la borne : plus il est grand, plus la garantie est faible. Ce n'est PAS une mesure de l'écart à la gaussienne : Rademacher donne 11, moins que la gaussienne elle-même :

pour X deˊjaˋ normale:ρ/σ3=22/π≈1,596\text{pour } X\ \text{d\'ej\`a normale} : \rho/\sigma^3=2\sqrt{2/\pi}\approx 1{,}596

⚠️ La borne n'est jamais nulle, même pour une loi normale — elle est majorante, pas exacte. Dans ce cas l'erreur réelle vaut 00.

Étape 2 — Le calcul sur Rademacher
Xi=±1 avec probabiliteˊ 12 chacuneX_i=\pm 1\ \text{avec probabilit\'e } \tfrac12\ \text{chacune}
μ=E[X]=0σ2=E[X2]=1donc σ=1ρ=E[∣X∣3]=1car ∣X∣=1 toujours\begin{array}{ll} \mu=E[X]=0 & \\ \sigma^2=E[X^2]=1 & \text{donc } \sigma=1\\ \rho=E[\lvert X\rvert^3]=1 & \text{car } \lvert X\rvert=1\ \text{toujours} \end{array}
ρσ3=11=1\frac{\rho}{\sigma^3}=\frac{1}{1}=1
sup⁡x∣Fn(x)−Φ(x)∣≤0,4748n\boxed{\sup_x\lvert F_n(x)-\Phi(x)\rvert\leq\frac{0{,}4748}{\sqrt n}}
nborne100,150grossieˋre1000,047acceptable1 0000,015bonne10 0000,0047excellente\begin{array}{lcl} n & \text{borne} & \\\hline 10 & 0{,}150 & \text{grossi\`ere}\\ 100 & 0{,}047 & \text{acceptable}\\ 1\,000 & 0{,}015 & \text{bonne}\\ 10\,000 & 0{,}0047 & \text{excellente} \end{array}
Étape 3 — La borne est-elle serrée ?

L'erreur RÉELLE pour Rademacher est à peine plus petite que la borne — d'un facteur 1,21{,}2 environ : la borne est presque atteinte.

nborneerreur reˊelle (ordre)100,150≈0,121000,047≈0,040\begin{array}{lcc} n & \text{borne} & \text{erreur r\'eelle (ordre)}\\\hline 10 & 0{,}150 & \approx 0{,}12\\ 100 & 0{,}047 & \approx 0{,}040 \end{array}

👉 Mais la VITESSE 1/n1/\sqrt n est optimale, et Rademacher le prouve : pour nn pair, SnS_n ne prend que des valeurs paires, et il subsiste un « défaut de discrétisation » d'ordre exactement 1/n1/\sqrt n.

on ne peut pas faire mieux que n−1/2 en geˊneˊral\boxed{\text{on ne peut pas faire mieux que } n^{-1/2}\ \text{en g\'en\'eral}}

Sauf hypothèse supplémentaire : si XX est à densité et vérifie la condition de Cramér, un développement d'Edgeworth donne une correction en 1/n1/n :

Fn(x)≈Φ(x)+γ6n(1−x2)φ(x)+O(1/n)F_n(x)\approx\Phi(x)+\frac{\gamma}{6\sqrt n}(1-x^2)\varphi(x)+O(1/n)

où γ\gamma est le coefficient d'asymétrie.

Ce que l'inégalité permet de décider
questionreˊponsen est-il assez grand ?oui si Cρ/(σ3n) est neˊgligeablequelle preˊcision garantir ?la borne, valable pour TOUT nquelle n pour 1% ?n≥(Cρ/σ3/0,01)2\begin{array}{ll} \text{question} & \text{r\'eponse}\\\hline \text{} n\ \text{est-il assez grand ?} & \text{oui si } C\rho/(\sigma^3\sqrt n)\ \text{est n\'egligeable}\\ \text{quelle pr\'ecision garantir ?} & \text{la borne, valable pour TOUT } n\\ \text{quelle } n\ \text{pour } 1\%\ \text{?} & n\geq(C\rho/\sigma^3/0{,}01)^2 \end{array}

Pour Rademacher à 1%1\% :

n≥(0,47480,01)2≈2 254n\geq\left(\frac{0{,}4748}{0{,}01}\right)^2\approx 2\,254

👉 C'est une garantie NON ASYMPTOTIQUE, valable pour ce nn précis — là où le TCL seul ne dit rien à nn fini.

le TCL est une LIMITE ; Berry-Esseen est une GARANTIE\boxed{\text{le TCL est une LIMITE ; Berry-Esseen est une GARANTIE}}

Et la règle empirique « n≥30n\geq 30 » du lycée se relit à cette lumière : elle vaut pour des lois peu asymétriques, où ρ/σ3\rho/\sigma^3 reste modéré — et pas pour des lois très dissymétriques, où il faut bien davantage.

Réponse. Berry-Esseen : sup⁡∣Fn−Φ∣≤0,4748 ρσ3n\sup|F_n-\Phi|\leq\tfrac{0{,}4748\,\rho}{\sigma^3\sqrt n} ; Rademacher ≈0,12\approx0{,}12 (n=10n{=}10), 0,040{,}04 (n=100n{=}100). (Constante optimale ADMIS ; bornes vérifiées sur convolution exacte — E ✓)
Faire cet exercice dans l'app →

Intervalle de confiance et fluctuation par le TCL

CalculDifficulté 3/5

Construire, par le TCL, un intervalle de confiance asymptotique à 95%95\% pour une proportion pp estimée par p^=Snn\widehat p=\tfrac{S_n}n (Sn∼B(n,p)S_n\sim\mathcal{B}(n,p)). Application : sondage p^=0,52\widehat p=0{,}52 sur n=1000n=1000. Quel lien avec l'intervalle de fluctuation ?

Indices (3)

p^−pp(1−p)/n→N(0,1)\tfrac{\widehat p-p}{\sqrt{p(1-p)/n}}\to\mathcal{N}(0,1).

1,961{,}96 = quantile à 97,5%97{,}5\% de N(0,1)\mathcal{N}(0,1).

Marge ≈1n\approx\tfrac1{\sqrt n} (majorant p(1−p)≤14p(1-p)\leq\tfrac14).

Correction détaillée
La construction, et le résultat
IC95%(p)=[p^−1,96p^(1−p^)n,  p^+1,96p^(1−p^)n]\boxed{\text{IC}_{95\%}(p)=\left[\widehat p-1{,}96\sqrt{\frac{\widehat p(1-\widehat p)}{n}},\ \ \widehat p+1{,}96\sqrt{\frac{\widehat p(1-\widehat p)}{n}}\right]}

Sondage p^=0,52\widehat p=0{,}52 sur n=1000n=1000 :

marge=1,960,52×0,481000=1,96×0,0158=0,031\text{marge}=1{,}96\sqrt{\frac{0{,}52\times 0{,}48}{1000}}=1{,}96\times 0{,}0158=\boxed{0{,}031}
IC=[0,489 ; 0,551]\text{IC}=[0{,}489\ ;\ 0{,}551]

⚠️ 0,50{,}5 EST DANS L'INTERVALLE — on ne peut pas conclure que le candidat est majoritaire.

Étape 1 — Appliquer le TCL
Sn∼B(n,p),p^=SnnS_n\sim\mathcal{B}(n,p),\qquad \widehat p=\frac{S_n}{n}
E[p^]=p,Var(p^)=p(1−p)nE[\widehat p]=p,\qquad \mathrm{Var}(\widehat p)=\frac{p(1-p)}{n}

Par le TCL (exercice E2) :

p^−pp(1−p)/n →L N(0,1)\frac{\widehat p-p}{\sqrt{p(1-p)/n}}\ \xrightarrow{\mathcal{L}}\ \mathcal{N}(0,1)

Donc, avec z0,975=1,96z_{0{,}975}=1{,}96 :

P(∣p^−pp(1−p)/n∣≤1,96) ⟶ 0,95P\left(\left\lvert\frac{\widehat p-p}{\sqrt{p(1-p)/n}}\right\rvert\leq 1{,}96\right)\ \longrightarrow\ 0{,}95

En isolant pp :

∣p^−p∣≤1,96p(1−p)n\lvert\widehat p-p\rvert\leq 1{,}96\sqrt{\frac{p(1-p)}{n}}
Étape 2 — Le remplacement de $p$ par $\widehat p$

⚠️ La borne dépend de pp, qu'on ne connaît pas. On y substitue p^\widehat p :

p(1−p)n ⟶ p^(1−p^)n\sqrt{\frac{p(1-p)}{n}}\ \longrightarrow\ \sqrt{\frac{\widehat p(1-\widehat p)}{n}}
c’est LICITE, et c’est le theˊoreˋme de SLUTSKY (exercice D6)\boxed{\text{c'est LICITE, et c'est le th\'eor\`eme de SLUTSKY (exercice D6)}}

Pourquoi : p^→p\widehat p\to p en probabilité (loi des grands nombres), donc p^(1−p^)→p(1−p)\sqrt{\widehat p(1-\widehat p)}\to\sqrt{p(1-p)} par continuité. Slutsky garantit que le quotient converge encore vers N(0,1)\mathcal{N}(0,1).

👉 Sans Slutsky, ce remplacement serait une approximation non justifiée — c'est le théorème qui rend la statistique inférentielle possible.

Étape 3 — L'application numérique
p^=0,52,n=1000\widehat p=0{,}52,\qquad n=1000
p^(1−p^)=0,52×0,48=0,2496\widehat p(1-\widehat p)=0{,}52\times 0{,}48=0{,}2496
0,24961000=0,0002496=0,0158\sqrt{\frac{0{,}2496}{1000}}=\sqrt{0{,}0002496}=0{,}0158
marge=1,96×0,0158=0,0310\text{marge}=1{,}96\times 0{,}0158=0{,}0310
IC95%=[0,489 ; 0,551]\boxed{\text{IC}_{95\%}=[0{,}489\ ;\ 0{,}551]}

Contrôle par la MAJORATION universelle : p(1−p)≤14p(1-p)\leq\frac14 toujours, d'où

marge≤1,962n=0,981000=0,0310\text{marge}\leq\frac{1{,}96}{2\sqrt n}=\frac{0{,}98}{\sqrt{1000}}=0{,}0310

👉 C'est la « marge d'erreur en 1/n1/\sqrt n » des instituts de sondage — et ici elle coïncide, p^\widehat p étant proche de 0,50{,}5.

Ce qu'on peut conclure, et ce qu'on ne peut pas
0,5∈[0,489 ; 0,551]0{,}5\in[0{,}489\ ;\ 0{,}551]
on ne peut PAS conclure que p>0,5\boxed{\text{on ne peut PAS conclure que } p>0{,}5}

Le sondage est compatible avec une minorité.

⚠️ L'interprétation correcte de « 95 % » :

FAUXp a 95% de chances d’eˆtre dans l’intervalleVRAIsi l’on reˊpeˊtait le sondage, 95% des intervalles contiendraient p \begin{array}{ll} \text{FAUX} & \text{} p\ \text{a } 95\%\ \text{de chances d'\^etre dans l'intervalle}\\ \textbf{VRAI} & \text{si l'on r\'ep\'etait le sondage, } 95\%\ \text{des intervalles contiendraient } p\ \text{} \end{array}

👉 pp est une constante, pas une variable aléatoire — c'est l'INTERVALLE qui est aléatoire. L'énoncé faux relève de l'interprétation bayésienne, qui demande une autre construction (intervalle de crédibilité).

Combien faudrait-il de sondés pour trancher ? Il faudrait que 0,50{,}5 sorte de l'intervalle :

1,960,2496n<0,02 ⟹ n>2 3971{,}96\sqrt{\frac{0{,}2496}{n}}<0{,}02\ \Longrightarrow\ n>2\,397
il faudrait environ 2 400 sondeˊs\boxed{\text{il faudrait environ } 2\,400\ \text{sond\'es}}
Réponse. IC à 95%95\% : p^±1,96p^(1−p^)/n\widehat p\pm1{,}96\sqrt{\widehat p(1-\widehat p)/n} ; 0,52±0,0310{,}52\pm0{,}031. (TCL ADMIS ; mécanisme certifié ; quantile 1,961{,}96 = table — E)
Faire cet exercice dans l'app →

Erreur de Monte-Carlo en 1/√N (c'est le TCL)

DémonstrationDifficulté 3/5

Montrer que l'erreur d'une estimation de Monte-Carlo I^N=1N∑g(Ui)\widehat I_N=\tfrac1N\sum g(U_i) est de l'ordre de σN\tfrac{\sigma}{\sqrt N}, et que sa loi est gaussienne (TCL). En déduire un IC pour I^N\widehat I_N et expliquer pourquoi « quadrupler NN divise l'erreur par 22 ».

Indices (3)

Var(I^N)=σ2N\mathrm{Var}(\widehat I_N)=\tfrac{\sigma^2}N (σ2=Var(g(U))\sigma^2=\mathrm{Var}(g(U))).

TCL : N(I^N−I)→N(0,σ2)\sqrt N(\widehat I_N-I)\to\mathcal{N}(0,\sigma^2).

14N=121N\tfrac1{\sqrt{4N}}=\tfrac12\tfrac1{\sqrt N}.

Correction détaillée
Le résultat, et sa double portée
I^N−I ≈ σN Z,Z∼N(0,1)\boxed{\widehat I_N-I\ \approx\ \frac{\sigma}{\sqrt N}\,Z,\qquad Z\sim\mathcal{N}(0,1)}

Deux informations, et la seconde est celle qui compte :

la TAILLE de l’erreurσ/N — donneˊe par la variancela LOI de l’erreurgaussienne — donneˊe par le TCL\begin{array}{ll} \text{la TAILLE de l'erreur} & \sigma/\sqrt N\ \text{— donn\'ee par la variance}\\ \textbf{la LOI de l'erreur} & \textbf{gaussienne — donn\'ee par le TCL} \end{array}

👉 C'est la loi qui permet de construire un intervalle de confiance, donc de dire quelque chose de quantifié. La taille seule ne donnerait qu'un ordre de grandeur.

Étape 1 — L'estimateur et sa variance
I^N=1N∑i=1Ng(Ui),Ui i.i.d. uniformes\widehat I_N=\frac1N\sum_{i=1}^{N}g(U_i),\qquad U_i\ \text{i.i.d. uniformes}
E[I^N]=E[g(U)]=I— SANS BIAISE[\widehat I_N]=E[g(U)]=I\qquad\text{— SANS BIAIS}
Var(I^N)=Var(g(U))N=σ2N\mathrm{Var}(\widehat I_N)=\frac{\mathrm{Var}\big(g(U)\big)}{N}=\frac{\sigma^2}{N}
σ(I^N)=σN\sigma\big(\widehat I_N\big)=\frac{\sigma}{\sqrt N}

avec σ2=Var(g(U))=E[g(U)2]−I2\sigma^2=\mathrm{Var}(g(U))=E[g(U)^2]-I^2.

Étape 2 — Le TCL donne la LOI

Les g(Ui)g(U_i) sont i.i.d., d'espérance II et de variance σ2\sigma^2. Le TCL s'applique :

I^N−Iσ/N →L N(0,1)\frac{\widehat I_N-I}{\sigma/\sqrt N}\ \xrightarrow{\mathcal{L}}\ \mathcal{N}(0,1)
IC95%(I)=[I^N−1,96σ^N,  I^N+1,96σ^N]\boxed{\text{IC}_{95\%}(I)=\left[\widehat I_N-1{,}96\frac{\widehat\sigma}{\sqrt N},\ \ \widehat I_N+1{,}96\frac{\widehat\sigma}{\sqrt N}\right]}

où σ^\widehat\sigma est l'écart-type EMPIRIQUE :

σ^2=1N−1∑i(g(Ui)−I^N)2\widehat\sigma^2=\frac{1}{N-1}\sum_i\big(g(U_i)-\widehat I_N\big)^2

👉 Le remplacement de σ\sigma par σ^\widehat\sigma est encore SLUTSKY (exercice D6) — le même mécanisme qu'à l'exercice E4.

Monte-Carlo fournit sa propre barre d’erreur\boxed{\text{Monte-Carlo fournit sa propre barre d'erreur}}
Étape 3 — L'exemple de $\pi$
g(u,v)=1u2+v2≤1,I=E[g]=π4≈0,7854g(u,v)=\mathbf 1_{u^2+v^2\leq 1},\qquad I=E[g]=\frac\pi4\approx 0{,}7854

gg suit une Bernoulli(π/4\pi/4), donc

σ2=π4(1−π4)≈0,1685,σ≈0,4105\sigma^2=\frac\pi4\Big(1-\frac\pi4\Big)\approx 0{,}1685,\qquad \sigma\approx 0{,}4105
Ndemi-IC sur π (×4)1044×1,96×0,4105100≈0,0322 deˊcimales106≈0,00323 deˊcimales108≈0,000324 deˊcimales\begin{array}{lcl} N & \text{demi-IC sur } \pi\ (\times 4) & \\\hline 10^4 & 4\times 1{,}96\times\frac{0{,}4105}{100}\approx 0{,}032 & \text{2 d\'ecimales}\\ 10^6 & \approx 0{,}0032 & \text{3 d\'ecimales}\\ 10^8 & \approx 0{,}00032 & \text{4 d\'ecimales} \end{array}
une deˊcimale de plus couˆte 100 fois plus de tirages\boxed{\text{une d\'ecimale de plus co\^ute } 100\ \text{fois plus de tirages}}
Ce qui accélère Monte-Carlo

On ne peut pas améliorer le 1/N1/\sqrt N — mais on peut RÉDUIRE σ\sigma.

variables antitheˊtiquesutiliser U et 1−U — correˊlation neˊgativevariable de controˆlesoustraire une h d’espeˊrance connue et correˊleˊe aˋ geˊchantillonnage preˊfeˊrentieltirer selon une loi qui eˊpouse gstratificationdeˊcouper le domaine, tirer dans chaque strate\begin{array}{ll} \textbf{variables antith\'etiques} & \text{utiliser } U\ \text{et}\ 1-U\ \text{— corr\'elation n\'egative}\\ \textbf{variable de contr\^ole} & \text{soustraire une } h\ \text{d'esp\'erance connue et corr\'el\'ee \`a } g\\ \textbf{\'echantillonnage pr\'ef\'erentiel} & \text{tirer selon une loi qui \'epouse } g\\ \textbf{stratification} & \text{d\'ecouper le domaine, tirer dans chaque strate} \end{array}

👉 Toutes ces méthodes gardent la vitesse N−1/2N^{-1/2} et diminuent la CONSTANTE. Un facteur 1010 sur σ\sigma vaut un facteur 100100 sur NN.

la vitesse est imposeˊe par le TCL ; seule la constante se travaille\boxed{\text{la vitesse est impos\'ee par le TCL ; seule la constante se travaille}}

⚠️ Sauf à changer de méthode : les suites à discrépance faible (quasi-Monte-Carlo) atteignent N−1N^{-1} — mais elles ne sont plus aléatoires, donc le TCL ne s'y applique pas, et l'on perd la barre d'erreur probabiliste.

Réponse. Erreur Monte-Carlo ∼σN\sim\tfrac\sigma{\sqrt N}, gaussienne (TCL) ; IC I^N±1,96σ^N\widehat I_N\pm1{,}96\tfrac{\widehat\sigma}{\sqrt N} ; ×4\times4 tirages ⇒\Rightarrow erreur ÷2\div2. (Vérifié sur instances : erreur ∝1/N\propto1/\sqrt N, sd(N)/sd(4N)≈2\mathrm{sd}(N)/\mathrm{sd}(4N)\approx2 — E ✓)
Faire cet exercice dans l'app →

Convergence empirique vers Φ : distance de Kolmogorov-Smirnov

DémonstrationDifficulté 3/5

Définir la distance de Kolmogorov-Smirnov Dn=sup⁡x∣Fn(x)−Φ(x)∣D_n=\sup_x|F_n(x)-\Phi(x)| entre la répartition empirique de sommes standardisées et Φ\Phi. Sur des sommes de 3030 uniformes standardisées, donner l'ordre de DD et interpréter.

Indices (3)

FnF_n = répartition empirique (escalier) de MM tirages.

Dn=sup⁡x∣Fn(x)−Φ(x)∣D_n=\sup_x|F_n(x)-\Phi(x)| (écart uniforme).

Petit DD ⇒\Rightarrow l'histogramme épouse la cloche.

Correction détaillée
La distance, et ce qu'elle mesure
Dn=sup⁡x∈R∣Fn(x)−Φ(x)∣\boxed{D_n=\sup_{x\in\mathbb{R}}\big\lvert F_n(x)-\Phi(x)\big\rvert}

où FnF_n est la fonction de répartition empirique de sommes standardisées.

Fn(x)=1m∑j=1m1S(j)∗≤xF_n(x)=\frac1m\sum_{j=1}^{m}\mathbf 1_{S^{\ast}_{(j)}\leq x}

Elle mesure l'écart MAXIMAL à la gaussienne, uniformément sur R\mathbb{R} — c'est la même quantité que celle bornée par Berry-Esseen (exercice E3).

Étape 1 — Deux sources d'erreur, à ne pas confondre
Dn ≤ sup⁡x∣Fn(x)−FS∗(x)∣⏟erreur d’EˊCHANTILLONNAGE + sup⁡x∣FS∗(x)−Φ(x)∣⏟erreur du TCLD_n\ \leq\ \underbrace{\sup_x\lvert F_n(x)-F_{S^\ast}(x)\rvert}_{\text{erreur d'\'ECHANTILLONNAGE}}\ +\ \underbrace{\sup_x\lvert F_{S^\ast}(x)-\Phi(x)\rvert}_{\text{erreur du TCL}}
termeordredeˊpend deeˊchantillonnage1/mle nombre de REˊPEˊTITIONS mTCL1/nla taille des SOMMES n\begin{array}{lll} \text{terme} & \text{ordre} & \text{d\'epend de}\\\hline \text{\'echantillonnage} & 1/\sqrt m & \text{le nombre de R\'EP\'ETITIONS } m\\ \text{TCL} & 1/\sqrt n & \text{la taille des SOMMES } n \end{array}

👉 Les deux se contrôlent séparément, et c'est essentiel : augmenter mm ne réduit pas l'erreur du TCL, et augmenter nn ne réduit pas le bruit d'échantillonnage.

Le premier terme est régi par le théorème de GLIVENKO-CANTELLI (D→0D\to 0 p.s.) et quantifié par KOLMOGOROV-SMIRNOV.

Étape 2 — L'ordre de grandeur, sur $30$ uniformes
S=∑i=130Ui,Ui∼U[0,1]S=\sum_{i=1}^{30}U_i,\qquad U_i\sim\mathcal{U}[0,1]
μ=30×12=15,σ2=30×112=2,5,σ≈1,58\mu=30\times\tfrac12=15,\qquad \sigma^2=30\times\tfrac1{12}=2{,}5,\qquad \sigma\approx 1{,}58

Erreur du TCL, par Berry-Esseen — pour U[0,1]\mathcal{U}[0,1] centrée, ρ/σ3=121232≈1,30\rho/\sigma^3=\tfrac{12\sqrt{12}}{32}\approx 1{,}30 :

sup⁡x∣FS∗−Φ∣≤0,4748×1,3030≈0,113\sup_x\lvert F_{S^\ast}-\Phi\rvert\leq\frac{0{,}4748\times 1{,}30}{\sqrt{30}}\approx 0{,}113

⚠️ C'est une MAJORATION très large : l'erreur réelle est de l'ordre de 0,001\mathbf{0{,}001} (calcul exact : ≈0,0009\approx 0{,}0009), soit plus de cent fois moins.

👉 La raison : l'uniforme est symétrique et à support borné — deux propriétés que Berry-Esseen ne sait pas exploiter. La convergence y est exceptionnellement rapide.

la somme de 12 uniformes servait autrefois de geˊneˊrateur GAUSSIEN\boxed{\text{la somme de 12 uniformes servait autrefois de g\'en\'erateur GAUSSIEN}}
Étape 3 — Le bruit d'échantillonnage

Avec mm répétitions, la statistique de Kolmogorov-Smirnov vérifie

m Dm →L K(loi de Kolmogorov)\sqrt m\,D_m\ \xrightarrow{\mathcal{L}}\ K\qquad\text{(loi de Kolmogorov)}
P(K≤1,36)=0,95P(K\leq 1{,}36)=0{,}95
mseuil 5%=1,36/m1000,136bruit dominant1 0000,04310 0000,0136encore supeˊrieur aˋ l’erreur TCL\begin{array}{lcl} m & \text{seuil } 5\% = 1{,}36/\sqrt m & \\\hline 100 & 0{,}136 & \text{bruit dominant}\\ 1\,000 & 0{,}043 & \\ 10\,000 & 0{,}0136 & \text{encore sup\'erieur \`a l'erreur TCL} \end{array}

👉 Il faut mm GRAND pour voir l'erreur du TCL — sinon le bruit d'échantillonnage la masque entièrement. À m=100m=100, on ne mesure que du bruit.

un banc mal dimensionneˊ mesure son propre bruit\boxed{\text{un banc mal dimensionn\'e mesure son propre bruit}}
Le protocole qui discrimine
1.fixer n (taille des sommes) et m (reˊpeˊtitions)2.simuler m sommes de n variables, standardiser3.calculer Dn contre Φ4.TEMOIN:refaire avec des N(0,1) — l’erreur reˊsiduelle est le BRUIT\begin{array}{ll} 1. & \text{fixer } n\ \text{(taille des sommes) et } m\ \text{(r\'ep\'etitions)}\\ 2. & \text{simuler } m\ \text{sommes de } n\ \text{variables, standardiser}\\ 3. & \text{calculer } D_n\ \text{contre } \Phi\\ 4. & \textbf{TEMOIN} : \text{refaire avec des } \mathcal{N}(0,1)\ \text{— l'erreur r\'esiduelle est le BRUIT} \end{array}

⚠️ L'étape 4 est celle qu'on oublie, et sans elle le résultat n'est pas interprétable : un DnD_n non nul peut venir du TCL ou de l'échantillonnage, et rien ne les distingue.

le teˊmoin gaussien seˊpare les deux sources\boxed{\text{le t\'emoin gaussien s\'epare les deux sources}}

Et le contraste nn / mm est le contrôle qui valide le protocole :

augmenter nDn doit deˊcroiˆtre en 1/naugmenter mDn doit se STABILISER (pas tendre vers 0)\begin{array}{ll} \text{augmenter } n & D_n\ \text{doit d\'ecro\^itre en } 1/\sqrt n\\ \text{augmenter } m & D_n\ \text{doit se STABILISER (pas tendre vers } 0) \end{array}

👉 Si DnD_n ne décroît pas quand nn augmente, ce n'est pas le TCL qu'on mesure — c'est que mm est trop petit, ou que les tirages ne sont pas indépendants.

Réponse. D=sup⁡x∣FM−Φ∣D=\sup_x|F_M-\Phi| ; somme de 3030 uniformes : D≈0,01<0,03D\approx0{,}01<0{,}03 (TCL visible dès n=30n=30). (Vérifié sur instances : KS =0,0102=0{,}0102 — E ✓)
Faire cet exercice dans l'app →

S'entraîner davantage sur probabilités (mesure) et théorème central limite

18 exercices d'entraînement supplémentaires sur ce chapitre, plus le palier approfondissement, les quiz, le tuteur IA et les PDF à imprimer — dans l'app Maths Post-Bac.