Maths Post-Bac Ouvrir l'app

Statistique inférentielle

Probabilités & Statistiques · leçon socle (gratuite)

BUTBTSL1L2L3Maths ingénieurCAPES

Estimation, intervalles de confiance & tests d'hypothèse (socle)

La statistique inférentielle part d'un échantillon (taille nn) pour tirer des conclusions sur la population entière. Elle prolonge le chapitre Probabilités & statistiques (loi normale, échantillonnage, intervalles de confiance) : ici on estime, on encadre et surtout on décide.

A. Estimation ponctuelle : estimateur sans biais

On observe x1,…,xnx_1,\dots,x_n. Deux estimateurs fondamentaux :

  • Moyenne empirique x‾=1n∑i=1nxi\overline{x}=\dfrac1n\displaystyle\sum_{i=1}^n x_i : estimateur sans biais de la moyenne μ\mu de la population (E(X‾)=μE(\overline{X})=\mu).
  • Variance empirique corrigée s2=1n−1∑i=1n(xi−x‾)2s^2=\dfrac1{n-1}\displaystyle\sum_{i=1}^n (x_i-\overline{x})^2 : estimateur sans biais de la variance σ2\sigma^2.

⚠️ Le diviseur est n−1n-1, pas nn : diviser par nn donne une variance biaisée (qui sous-estime σ2\sigma^2). Le −1-1 compense le fait que x‾\overline{x} est lui-même estimé à partir des données (perte d'un degré de liberté). On distingue l'estimateur (la formule, variable aléatoire) de l'estimation (la valeur numérique obtenue sur l'échantillon).

B. Intervalle de confiance d'une moyenne, σ\sigma inconnu : loi de Student

Quand l'écart-type σ\sigma de la population est connu, l'IC à 95 %95\,\% d'une moyenne est [x‾±1,96 σn]\big[\overline{x}\pm 1{,}96\,\tfrac{\sigma}{\sqrt n}\big] (chapitre parent). Mais en pratique σ\sigma est inconnu : on le remplace par ss. Si la population est normale, la quantité X‾−μs/n\dfrac{\overline{X}-\mu}{s/\sqrt n} ne suit plus une loi normale mais la loi de Student Tn−1T_{n-1} à n−1n-1 degrés de liberté. D'où :

  IC1−α(μ)=[x‾−tn−1; 1−α/2 sn  ;  x‾+tn−1; 1−α/2 sn]  \boxed{\;IC_{1-\alpha}(\mu)=\Big[\overline{x}-t_{n-1;\,1-\alpha/2}\,\tfrac{s}{\sqrt n}\;;\;\overline{x}+t_{n-1;\,1-\alpha/2}\,\tfrac{s}{\sqrt n}\Big]\;}
La loi de Student a des queues plus épaisses que la normale (l'incertitude sur ss élargit l'intervalle) ; pour nn grand, tn−1; 0,975→1,96t_{n-1;\,0{,}975}\to 1{,}96 et on retrouve la normale.

Vingt intervalles de confiance calcules sur vingt echantillons differents, traces horizontalement les uns sous les autres, et une ligne verticale figurant la vraie moyenne : dix-neuf intervalles coupent cette ligne, un seul la manque et est mis en evidence.
Ce que « 95 %95\,\% » veut dire, et ce qu'il ne dit pas : c'est l'intervalle qui est aléatoire, pas μ\mu. Chaque échantillon en produit un nouveau, et c'est la proportion de ceux qui attrapent μ\mu qui vaut 95 %95\,\%. Ici 2020 échantillons de taille n=25n=25 tirés dans N(10;22)\mathcal N(10;2^2), demi-largeur 1,96 σ/n=0,7841{,}96\,\sigma/\sqrt n=0{,}784 : 1919 intervalles contiennent μ=10\mu=10, un le rate. Une fois l'échantillon tiré, l'intervalle contient μ\mu ou ne le contient pas — dire « μ\mu a 95 %95\,\% de chances d'y être » est le contresens classique. Contre-épreuve sur 4 0004\,000 échantillons : couverture 94,30 %94{,}30\,\%.

C. Intervalle de confiance d'une variance : loi du khi-deux

Si la population est normale, la quantité (n−1)s2σ2\dfrac{(n-1)s^2}{\sigma^2} suit une loi du khi-deux χn−12\chi^2_{n-1} (cette hypothèse est ici indispensable, même pour nn grand). Comme σ2\sigma^2 est au dénominateur de cette quantité, l'IC de σ2\sigma^2 a des bornes croisées ; et comme la loi n'est pas symétrique, il n'est pas centré sur s2s^2 :

IC1−α(σ2)=[(n−1)s2χn−1; 1−α/22  ;  (n−1)s2χn−1; α/22].IC_{1-\alpha}(\sigma^2)=\Big[\tfrac{(n-1)s^2}{\chi^2_{n-1;\,1-\alpha/2}}\;;\;\tfrac{(n-1)s^2}{\chi^2_{n-1;\,\alpha/2}}\Big].
(le grand quantile est au dénominateur de la borne inférieure). On obtient l'IC de l'écart-type en prenant les racines carrées.

D. Intervalle de confiance d'une proportion

[f±z1−α/2f(1−f)n]\big[f\pm z_{1-\alpha/2}\sqrt{\tfrac{f(1-f)}{n}}\big] avec ff la fréquence observée, sous conditions n≥30n\geq 30, nf≥5nf\geq 5 et n(1−f)≥5n(1-f)\geq 5. L'estimation ponctuelle (x‾\overline{x} ou ff) est toujours au centre de l'IC.

E. Tests d'hypothèse : la démarche

On oppose deux hypothèses : l'hypothèse nulle H0H_0 (le statu quo, ex. μ=μ0\mu=\mu_0) et l'hypothèse alternative H1H_1. La démarche :

  1. statistique de test : on standardise l'estimation. Moyenne, σ\sigma connu : z=x‾−μ0σ/nz=\dfrac{\overline{x}-\mu_0}{\sigma/\sqrt n} (loi normale). Moyenne, σ\sigma inconnu : t=x‾−μ0s/nt=\dfrac{\overline{x}-\mu_0}{s/\sqrt n} (Student Tn−1T_{n-1}). Proportion : z=f−p0p0(1−p0)/nz=\dfrac{f-p_0}{\sqrt{p_0(1-p_0)/n}}.
  2. risque α\alpha (souvent 5 %5\,\%) : probabilité maximale de rejeter H0H_0 à tort.
  3. région de rejet : test bilatéral H1:μ≠μ0H_1:\mu\neq\mu_0 → on rejette si ∣z∣>z1−α/2\lvert z\rvert>z_{1-\alpha/2} (deux queues α/2\alpha/2). Test unilatéral H1:μ>μ0H_1:\mu>\mu_0 (resp. <<) → on rejette si z>z1−αz>z_{1-\alpha} (resp. z<−z1−αz<-z_{1-\alpha}, une seule queue).
  4. pp-value : probabilité, si H0H_0 est vraie, d'observer une statistique au moins aussi extrême. On rejette H0H_0   ⟺  p≤α\iff p\leq\alpha. Bilatéral : p=2 P(Z≥∣z∣)=2(1−Φ(∣z∣))p=2\,P(Z\geq\lvert z\rvert)=2\big(1-\Phi(\lvert z\rvert)\big) ; unilatéral : p=1−Φ(z)p=1-\Phi(z) si H1:μ>μ0H_1:\mu>\mu_0, p=Φ(z)p=\Phi(z) si H1:μ<μ0H_1:\mu<\mu_0 (la moitié du pp bilatéral seulement quand zz est du côté de H1H_1).

Deux types d'erreur : 1ʳᵉ espèce = rejeter H0H_0 alors qu'elle est vraie (probabilité α\alpha) ; 2ᵈᵉ espèce = conserver H0H_0 alors qu'elle est fausse (probabilité β\beta, la puissance étant 1−β1-\beta).

F. Tests du khi-deux

La statistique est toujours χ2=∑(O−E)2E\chi^2=\displaystyle\sum\dfrac{(O-E)^2}{E} (OO effectifs observés, EE attendus sous H0H_0). On rejette H0H_0 si χ2>χν; 1−α2\chi^2>\chi^2_{\nu;\,1-\alpha}.

  • Ajustement (adéquation) : H0H_0 « les données suivent une loi donnée ». Degrés de liberté ν=k−1\nu=k-1 (kk classes).
  • Indépendance : H0H_0 « les deux variables d'un tableau de contingence sont indépendantes ». Effectif attendu d'une case =total ligne×total colonnetotal=\dfrac{\text{total ligne}\times\text{total colonne}}{\text{total}} ; degrés de liberté ν=(r−1)(c−1)\nu=(r-1)(c-1).

G. Comparaison de deux échantillons

  • Deux moyennes (échantillons indépendants, grands nn) : z=x‾1−x‾2s12/n1+s22/n2z=\dfrac{\overline{x}_1-\overline{x}_2}{\sqrt{s_1^2/n_1+s_2^2/n_2}}.
  • Deux proportions : on estime une proportion groupée p^=k1+k2n1+n2\widehat p=\dfrac{k_1+k_2}{n_1+n_2} et z=f1−f2p^(1−p^)(1/n1+1/n2)z=\dfrac{f_1-f_2}{\sqrt{\widehat p(1-\widehat p)(1/n_1+1/n_2)}}.

Contrôle systématique. Vérifier le bon nombre de degrés de liberté (n−1n-1 pour une variance, k−1k-1 ou (r−1)(c−1)(r-1)(c-1) pour un khi-deux) ; le caractère uni- ou bilatéral du test (il change le seuil et la pp-value) ; la cohérence décision   ⟺  p≤α\iff p\leq\alpha ; et que les conditions d'application (nn grand, effectifs attendus ≥5\geq 5) sont réunies.

18 exercices corrigés de statistique inférentielle Énoncé, indices et correction détaillée étape par étape — en accès libre.

Dans le palier approfondissement (Pro) : Régression & corrélation, Monte-Carlo, fiabilité & chaînes de Markov

  • A. Régression linéaire par les moindres carrés
  • B. Corrélation et coefficient de détermination
  • C. Test de significativité de la pente
  • D. Méthode de Monte-Carlo
  • E. Fiabilité
  • F. Chaînes de Markov

La suite dans l'app Maths Post-Bac

Palier approfondissement, 54 exercices corrigés pas à pas, quiz, tuteur IA, PDF téléchargeables et suivi de progression — pour BUT, BTS, licence et maths de l'ingénieur.