Maths Post-Bac Ouvrir l'app

Statistique descriptive

Probabilités & Statistiques · leçon socle (gratuite)

BTSL1L2L3Maths ingénieurCAPES

Statistique descriptive — série à une variable (socle)

Idée. Une série statistique est une liste de valeurs mesurées sur une population : les notes d'une classe, les temps d'attente de 4040 clients, les masses de 5050 colis. La statistique descriptive ne cherche pas à prédire ni à tester : elle résume la série par quelques nombres (une position — où sont les valeurs ? — et une dispersion — sont-elles serrées ou étalées ?) et par un graphique, pour qu'on puisse la lire et la comparer à une autre. Tout le chapitre tient dans une question : quel résumé pour quelle question ?

Note (périmètre de vérification). Chaque moyenne, médiane, quartile, variance et proportion de ce chapitre est certifiée machine (_verif_statistique_descriptive.py, calcul exact en fractions, recoupé par numpy). Les conventions employées sont écrites ci-dessous et employées partout : elles ne sont pas les seules possibles — l'approfondissement (C5) explique pourquoi deux manuels donnent parfois deux premiers quartiles pour la même série.

A. Série, effectifs, caractéristiques de position

  • Vocabulaire. La population est l'ensemble étudié ; chaque individu porte une valeur du caractère. Un caractère est qualitatif (une couleur, une filière), quantitatif discret (un nombre de pièces défectueuses, une note entière) ou quantitatif continu (une masse, une durée) — les valeurs d'un caractère continu se regroupent en classes.
  • Tableau d'effectifs. Pour chaque valeur xix_i, l'effectif nin_i est le nombre d'individus qui la portent ; n=nin=\sum n_i est l'effectif total ; la fréquence est fi=ninf_i=\dfrac{n_i}{n} (les fréquences totalisent 11, soit 100%100\,\%) ; la fréquence cumulée croissante F(x)F(x) est la proportion des valeurs inférieures ou égales à xx. C'est elle qui sert à lire médiane et quartiles.
  • Moyenne. xˉ=1ninixi\bar x=\dfrac1n\sum_i n_i\,x_i — une moyenne pondérée par les effectifs, ce qui est la même chose que la moyenne de la liste où chaque valeur est répétée nin_i fois. C'est le barycentre des valeurs. Elle vaut pour un caractère quantitatif seulement.
  • Médiane. On range les nn valeurs par ordre croissant. Si nn est impair, la médiane Me\mathrm{Me} est la valeur du milieu (la n+12\tfrac{n+1}2-ième) ; si nn est pair, c'est la demi-somme des deux valeurs centrales (la n2\tfrac n2-ième et la suivante). Au moins la moitié des valeurs sont Me\leq\mathrm{Me}, au moins la moitié sont Me\geq\mathrm{Me}.
  • Mode. La valeur (ou la classe) d'effectif maximal. Il peut y en avoir plusieurs, et c'est le seul résumé qui ait un sens pour un caractère qualitatif.
  • Moyenne ou médiane ? La moyenne bouge dès qu'une valeur bouge : un seul salaire très élevé la tire vers le haut. La médiane, elle, ne dépend que du rang des valeurs : la même valeur extrême ne la déplace pas. On dit que la médiane est robuste. Sur une série symétrique les deux coïncident ; sur une série étalée à droite (salaires, temps d'attente), la moyenne est au-dessus de la médiane.
  • Série regroupée en classes. Pour un caractère continu on regroupe les valeurs en intervalles [ai,bi[[a_i,b_i[ d'effectifs nin_i. Faute de connaître les valeurs exactes, on estime la moyenne en remplaçant chaque classe par son centre ci=ai+bi2c_i=\tfrac{a_i+b_i}2 : xˉ1nnici\bar x\approx\tfrac1n\sum n_i\,c_i. Ce n'est plus la moyenne de la série brute, c'est une estimation — et elle dépend du découpage.
  • Histogramme. Chaque classe est un rectangle dont l'aire est proportionnelle à l'effectif. Si les classes ont la même largeur, la hauteur suffit. Si elles sont inégales, la hauteur est la densité de fréquence fibiai\dfrac{f_i}{b_i-a_i} (ou l'effectif par unité de largeur) : une classe deux fois plus large et de même effectif est deux fois moins haute. Tracer les effectifs en hauteur avec des classes inégales est le contresens le plus courant du chapitre.

Deux histogrammes cote a cote de la meme serie a classes inegales : a gauche la hauteur est l'effectif et la classe large parait dominante, a droite la hauteur est la densite et cette classe redevient modeste.
Avec des classes inégales, c'est l'AIRE qui dit la fréquence, pas la hauteur. La même série — les temps d'attente de 4040 clients — est tracée deux fois : à gauche la hauteur est l'effectif (1010 ; 1414 ; 1212 ; 44), à droite la densité de fréquence (0,050{,}05 ; 0,070{,}07 ; 0,030{,}03 ; 0,0050{,}005 par minute). À gauche, la classe large [10,20[[10,20[ paraît presque aussi fournie que [5,10[[5,10[ ; à droite elle retombe à 37\tfrac37 de sa densité, ce qui est la vérité par minute d'attente. Les aires du panneau de droite valent les fréquences 25%25\,\% ; 35%35\,\% ; 30%30\,\% ; 10%10\,\%, et totalisent 11.

  • Médiane d'une série groupée. On ne connaît pas les valeurs : on cherche la classe médiane (celle où FF franchit 12\tfrac12) et on y interpole linéairement — on suppose les valeurs uniformément réparties dans la classe. Si F(a)<12F(b)F(a)<\tfrac12\leq F(b) sur la classe [a,b[[a,b[, alors
    Mea+(ba)12F(a)F(b)F(a).\mathrm{Me}\approx a+(b-a)\,\frac{\tfrac12-F(a)}{F(b)-F(a)}.
    Même formule pour Q1Q_1 et Q3Q_3 avec 14\tfrac14 et 34\tfrac34. Graphiquement : on trace le polygone des fréquences cumulées (les points (bi,F(bi))(b_i,F(b_i)) reliés par des segments) et on lit l'abscisse où il coupe l'horizontale 50%50\,\%.

Le polygone des frequences cumulees croissantes de 50 colis, avec les trois lectures graphiques de Q1, de la mediane et de Q3 sur les horizontales 25, 50 et 75 pour cent.
On lit la médiane là où la courbe coupe l'horizontale 50%50\,\%. Le polygone des fréquences cumulées des masses de 5050 colis (classes de largeur 22 kg) passe par les points (2;0,10)(2;0{,}10), (4;0,30)(4;0{,}30), (6;0,60)(6;0{,}60), (8;0,84)(8;0{,}84) et (10;1)(10;1) ; entre deux bornes, le segment interpole — on suppose les valeurs uniformément réparties dans la classe. Les trois horizontales donnent Q1=3,5Q_1=3{,}5 kg, Me5,33\mathrm{Me}\approx5{,}33 kg et Q3=7,25Q_3=7{,}25 kg : la médiane tombe dans la classe [4,6[[4,6[, celle où FF franchit 12\tfrac12.

  • Changement d'unité ou de barème. Si yi=axi+by_i=a\,x_i+b avec a>0a>0, alors yˉ=axˉ+b\bar y=a\,\bar x+b et Mey=aMex+b\mathrm{Me}_y=a\,\mathrm{Me}_x+b : une transformation affine croissante se transporte sur les caractéristiques de position (les rangs ne changent pas, et la moyenne est linéaire).

B. Caractéristiques de dispersion

  • Étendue. maxmin\max-\min. Un seul nombre, très sensible aux extrêmes : il décrit l'intervalle occupé, pas la façon dont les valeurs s'y répartissent.
  • Quartiles — la convention de ce chapitre. Q1Q_1 est la plus petite valeur de la série telle que la fréquence cumulée F(Q1)F(Q_1) soit 14\geq\tfrac14 ; Q3Q_3 est la plus petite valeur telle que F(Q3)34F(Q_3)\geq\tfrac34. En pratique : au moins 25%25\,\% des valeurs sont Q1\leq Q_1, au moins 75%75\,\% sont Q3\leq Q_3. Sur une série de n=12n=12 valeurs rangées, Q1Q_1 est la 3e3^{\text{e}} (car 312=14\tfrac3{12}=\tfrac14) et Q3Q_3 la 9e9^{\text{e}} ; sur n=10n=10, Q1Q_1 est la 3e3^{\text{e}} (car 210<14310\tfrac2{10}<\tfrac14\leq\tfrac3{10}) et Q3Q_3 la 8e8^{\text{e}}. ⚠️ Les tableurs et les calculatrices emploient souvent une autre convention (interpolation) et donnent des quartiles légèrement différents : l'approfondissement compare les trois.
  • Écart interquartile. IQR=Q3Q1\mathrm{IQR}=Q_3-Q_1 : la largeur de l'intervalle qui contient la moitié centrale des valeurs. Insensible aux extrêmes, comme la médiane.
  • Boîte à moustaches. Une boîte de Q1Q_1 à Q3Q_3, coupée par la médiane, prolongée par des moustaches jusqu'au minimum et au maximum. Deux séries se comparent d'un coup d'œil : position (médiane), dispersion (longueur de la boîte), asymétrie (la médiane n'est pas au milieu de la boîte). Variante fréquente : moustaches limitées à 1,5×IQR1{,}5\times\mathrm{IQR} au-delà de la boîte, les valeurs plus lointaines étant marquées comme isolées — dire la convention qu'on emploie.

Deux boites a moustaches alignees sur le meme axe des notes, de meme mediane 20 : la boite du groupe 1 est courte avec une longue moustache a droite, celle du groupe 2 est nettement plus large.
Même médiane, dispersions différentes : c'est la longueur de la boîte qui les sépare. Deux groupes de 1111 étudiants notés sur 4040 ont la même médiane 2020, et deux profils opposés — groupe 1 : 1414 ; 1717 ; 2020 ; 2323 ; 4040, groupe 2 : 44 ; 1212 ; 2020 ; 2828 ; 3636. La boîte contient la moitié centrale des valeurs : IQR=6\mathrm{IQR}=6 pour le premier groupe contre 1616 pour le second. La longue moustache droite du groupe 1 trahit son seul 4040, qui tire la moyenne à 21,3\approx21{,}3 au-dessus de la médiane sans déplacer celle-ci.

  • Variance et écart-type. La variance est la moyenne des carrés des écarts à la moyenne :
    V=1nini(xixˉ)2,σ=V.V=\frac1n\sum_i n_i\,(x_i-\bar x)^2,\qquad\sigma=\sqrt V.
    L'écart-type σ\sigma a l'unité de la série (des minutes, des grammes), la variance a le carré de cette unité. Plus σ\sigma est grand, plus les valeurs s'éloignent de la moyenne. Dans ce chapitre la variance est toujours divisée par nn : c'est la variance de la série. La calculatrice affiche aussi une valeur divisée par n1n-1 (σn1\sigma_{n-1}, la « variance corrigée ») ; elle sert à estimer la variance d'une population à partir d'un échantillon, ce qui est une autre question (approfondissement D3).
  • Formule de Koenig-Huygens. V=x2xˉ2V=\overline{x^2}-\bar x^{\,2} : la moyenne des carrés moins le carré de la moyenne. Plus rapide à la main (pas d'écarts à calculer), et un excellent recoupement de la définition — les deux doivent coïncider exactement.
  • Transformation affine. Si y=ax+by=ax+b : Vy=a2VxV_y=a^2\,V_x et σy=aσx\sigma_y=\lvert a\rvert\,\sigma_x. Ajouter bb ne change pas la dispersion (translation) ; multiplier par aa la multiplie par a\lvert a\rvert. Cas important : la valeur centrée réduite zi=xixˉσz_i=\dfrac{x_i-\bar x}{\sigma} a pour moyenne 00 et pour écart-type 11, et dit à combien d'écarts-types de la moyenne se trouve xix_i — c'est ce qui permet de comparer une note sur 2020 et une note sur 4040.
  • Série groupée. Variance et écart-type s'estiment par les centres des classes, comme la moyenne.
  • ⚠️ « 68%68\,\% des valeurs dans [xˉσ,xˉ+σ][\bar x-\sigma,\bar x+\sigma] » est une propriété de la loi normale, pas des séries : une série peut en avoir 50%50\,\%, 72%72\,\% ou 100%100\,\%. Ce qui est vrai pour toute série est bien plus faible et se démontre (approfondissement C2) : au plus 1k2\tfrac1{k^2} des valeurs sont à plus de kσk\sigma de la moyenne.

E. Choisir un résumé, comparer deux séries

  • Quel résumé ? Position : la moyenne quand les valeurs se compensent (une moyenne de production, un panier moyen) ; la médiane quand la série est asymétrique ou contient des extrêmes (salaires, délais). Dispersion : l'écart-type accompagne la moyenne, l'écart interquartile accompagne la médiane. Donner les deux familles quand on peut, avec le graphique qui va avec.
  • Comparer deux séries d'unités ou de niveaux différents. L'écart-type seul ne compare pas 1010 grammes à 11 millimètre. Le coefficient de variation CV=σxˉ\mathrm{CV}=\dfrac{\sigma}{\bar x} (sans unité, souvent en %\%) mesure la dispersion relative : σ=10\sigma=10 g sur une moyenne de 500500 g, c'est 2%2\,\% ; σ=1\sigma=1 mm sur 2020 mm, c'est 5%5\,\% — la seconde machine est relativement moins régulière.
  • Moyenne de moyennes. La moyenne d'une population réunissant deux sous-populations est la moyenne pondérée par les effectifs des deux moyennes : xˉ=n1xˉ1+n2xˉ2n1+n2\bar x=\dfrac{n_1\bar x_1+n_2\bar x_2}{n_1+n_2}. La moyenne simple xˉ1+xˉ22\tfrac{\bar x_1+\bar x_2}2 est fausse dès que n1n2n_1\neq n_2.
  • Quel graphique ? Diagramme en bâtons pour un caractère discret (une barre par valeur, séparées), en secteurs pour un qualitatif (des parts de 100%100\,\%), histogramme pour un continu regroupé en classes (rectangles accolés, aire proportionnelle à l'effectif), boîte à moustaches pour comparer plusieurs séries, polygone des fréquences cumulées pour lire médiane et quartiles.
  • Lire un problème type BTS. Compléter le tableau (effectifs, fréquences, cumulées), calculer les résumés à la calculatrice en sachant lesquels (moyenne, σn\sigma_n et non σn1\sigma_{n-1}), lire graphiquement médiane et quartiles sur le polygone, puis interpréter : « au moins 75%75\,\% des ampoules durent moins de… ». Un résultat sans interprétation n'est pas une réponse.
18 exercices corrigés de statistique descriptive Énoncé, indices et correction détaillée étape par étape — en accès libre.

Dans le palier approfondissement (Pro) : Ce que les résumés garantissent, et le pont vers l'inférence

  • C. Ce que les résumés minimisent, et ce qu'ils garantissent
  • D. Vers la modélisation et l'inférence

La suite dans l'app Maths Post-Bac

Palier approfondissement, 54 exercices corrigés pas à pas, quiz, tuteur IA, PDF téléchargeables et suivi de progression — pour BUT, BTS, licence et maths de l'ingénieur.