Maths Post-Bac Ouvrir l'app

Exercices corrigés — Statistique descriptive

Probabilités & Statistiques · 18 exercices-types du palier socle

BTSL1L2L3Maths ingénieurCAPES

Chaque exercice donne l'énoncé, des indices progressifs et la correction rédigée étape par étape. Ouvre les blocs seulement après avoir cherché.

Revoir le cours : Statistique descriptive Définitions, méthodes et exemples corrigés du chapitre.

Tableau d'effectifs, fréquences et fréquences cumulées

ApplicationDifficulté 3/5

Les notes sur 2020 d'une classe de 2525 étudiants sont les suivantes : un 66, deux 88, trois 99, quatre 1010, cinq 1111, quatre 1212, deux 1313, deux 1414, un 1616 et un 1818. 1. Dresser le tableau des effectifs, des fréquences (en %\%) et des fréquences cumulées croissantes. 2. Calculer la moyenne, la médiane et le mode de la série. 3. Quelle proportion d'étudiants a obtenu au moins 1212 ? au plus 99 ? 4. Lire sur les fréquences cumulées le premier et le troisième quartile, avec la convention du cours.

Indices (3)

Une fréquence est un effectif divisé par n=25n=25 : chaque étudiant pèse 4%4\,\%.

La médiane d'une série de 2525 valeurs rangées est la 13e13^{\text{e}} : compter les effectifs cumulés jusqu'à dépasser 1313.

Q1Q_1 est la plus petite note dont la fréquence cumulée atteint 25%25\,\% ; Q3Q_3, celle qui atteint 75%75\,\%.

Correction détaillée
Ce qu'il faut voir

Une série avec des répétitions se lit dans un tableau, et le tableau répond à tout. Les 2525 notes ne sont pas 2525 nombres à manipuler un par un : ce sont 1010 valeurs distinctes, chacune avec son effectif nin_i. La fréquence fi=ni25f_i=\tfrac{n_i}{25} dit le poids de chaque note ; la fréquence cumulée F(x)F(x) dit quelle proportion des étudiants a au plus xx — et c'est elle qui donne la médiane et les quartiles sans rien ranger.

👉 Avec n=25n=25, chaque étudiant pèse 125=4%\tfrac1{25}=4\,\% : toutes les fréquences sont des multiples de 4%4\,\%, ce qui rend le tableau vérifiable de tête.

Rappel de cours

Fréquence : fi=ninf_i=\dfrac{n_i}{n}, et fi=1\sum f_i=1. Fréquence cumulée croissante : F(xk)=f1++fkF(x_k)=f_1+\dots+f_k, proportion des valeurs xk\leq x_k.

Moyenne pondérée : xˉ=1nnixi\bar x=\dfrac1n\sum n_i\,x_i. Médiane (nn impair) : la n+12\tfrac{n+1}2-ième valeur rangée. Mode : la valeur d'effectif maximal.

Quartiles (convention du chapitre) : Q1Q_1 est la plus petite valeur telle que F14F\geq\tfrac14, Q3Q_3 la plus petite telle que F34F\geq\tfrac34.

Étape 1 — le tableau
note xix_i 66 88 99 1010 1111 1212 1313 1414 1616 1818
effectif nin_i 11 22 33 44 55 44 22 22 11 11
fréquence fif_i (%\%) 44 88 1212 1616 2020 1616 88 88 44 44
cumulée FF (%\%) 44 1212 2424 4040 6060 7676 8484 9292 9696 100100

Les effectifs totalisent 1+2+3+4+5+4+2+2+1+1=251+2+3+4+5+4+2+2+1+1=25 ✓ et les fréquences 100%100\,\% ✓. Chaque cumulée est la précédente plus la fréquence de la colonne : 24+16=4024+16=40, 40+20=6040+20=60, 60+16=7660+16=76

Étape 2 — moyenne, médiane, mode

Moyenne. On pondère chaque note par son effectif :

nixi=6+16+27+40+55+48+26+28+16+18=280,xˉ=28025=11,2.\sum n_i\,x_i=6+16+27+40+55+48+26+28+16+18=280,\qquad\bar x=\frac{280}{25}=11{,}2.

Médiane. n=25n=25 est impair : la médiane est la 13e13^{\text{e}} note rangée. Les effectifs cumulés valent 1, 3, 6, 10, 151,\ 3,\ 6,\ 10,\ 15 pour les notes 6, 8, 9, 10, 116,\ 8,\ 9,\ 10,\ 11 : les rangs 1111 à 1515 portent la note 1111, donc la 13e13^{\text{e}} vaut 1111.

xˉ=11,2Me=11mode=11\boxed{\bar x=11{,}2\qquad\mathrm{Me}=11\qquad\text{mode}=11}

Le mode est la note la plus fréquente, 1111 (effectif 55). Ici les trois résumés sont proches : la série est à peu près symétrique autour de 1111, avec une légère queue vers le haut (1616, 1818) qui tire la moyenne un peu au-dessus de la médiane.

Étape 3 — lire des proportions dans les cumulées

« Au moins 1212 » est le complémentaire de « au plus 1111 » : 1F(11)=100%60%=40%1-F(11)=100\,\%-60\,\%=40\,\%. Contrôle direct : 4+2+2+1+1=104+2+2+1+1=10 étudiants sur 2525, soit 1025=40%\tfrac{10}{25}=40\,\% ✓.

« Au plus 99 » se lit directement : F(9)=24%F(9)=24\,\%, soit 1+2+3=61+2+3=6 étudiants ✓.

P(x12)=40%P(x9)=24%\boxed{P(x\geq12)=40\,\%\qquad P(x\leq9)=24\,\%}
Étape 4 — les quartiles par les cumulées

Q1Q_1 est la plus petite note dont la cumulée atteint 25%25\,\%. Or F(9)=24%<25%F(9)=24\,\%<25\,\% et F(10)=40%25%F(10)=40\,\%\geq25\,\% : donc Q1=10Q_1=10. De même F(11)=60%<75%F(11)=60\,\%<75\,\% et F(12)=76%75%F(12)=76\,\%\geq75\,\% : Q3=12Q_3=12.

Q1=10Q3=12Q3Q1=2\boxed{Q_1=10\qquad Q_3=12\qquad Q_3-Q_1=2}

Lecture : la moitié centrale des étudiants a entre 1010 et 1212. Une boîte à moustaches de cette classe serait très resserrée — deux points de largeur — avec des moustaches de 66 à 1818.

L'erreur classique

⚠️ Prendre la médiane des valeurs distinctes. Les dix notes distinctes rangées ont pour « milieu » 1111 et 1212 — mais ce n'est pas la médiane de la série, où le 1111 est porté par cinq étudiants et le 1818 par un seul. La médiane se lit sur les effectifs cumulés, jamais sur la liste des valeurs.

⚠️ Confondre F(9)=24%<25%F(9)=24\,\%<25\,\% avec « Q1=9Q_1=9 ». La convention dit la plus petite valeur pour laquelle on atteint 25%25\,\% : à 99 on n'y est pas encore, c'est 1010 qui franchit.

À retenir

Tableau d'abord, calculs ensuite. Effectifs, fréquences, cumulées : les trois lignes répondent à la moyenne (somme des nixin_ix_i), à la médiane et aux quartiles (cumulées), aux proportions (cumulées et complémentaire).

Chaque individu pèse 1n\tfrac1n. Avec n=25n=25 c'est 4%4\,\% : tout se vérifie de tête, et une fréquence qui n'est pas un multiple de 4%4\,\% est une faute de calcul.

Réponse. xˉ=11,2\bar x=11{,}2, Me=11\mathrm{Me}=11, mode 1111 ; 40%40\,\% ont au moins 1212, 24%24\,\% au plus 99 ; Q1=10Q_1=10, Q3=12Q_3=12. (Recoupement : nixi=280\sum n_ix_i=280, fi=100%\sum f_i=100\,\% ✓)
Faire cet exercice dans l'app →

Moyenne et médiane : n pair, n impair, et une valeur qui déménage

CalculDifficulté 3/5

Huit étudiants notent leur temps de trajet quotidien, en minutes : 12, 15, 15, 18, 22, 25, 30, 3512,\ 15,\ 15,\ 18,\ 22,\ 25,\ 30,\ 35. 1. Calculer la moyenne et la médiane de cette série. 2. Un neuvième étudiant arrive ; son trajet dure 4444 minutes. Recalculer la moyenne et la médiane. 3. Et si ce neuvième trajet durait 440440 minutes ? Comparer l'effet sur les deux résumés et expliquer la différence.

Indices (3)

Avec n=8n=8 (pair), la médiane est la demi-somme des 4e4^{\text{e}} et 5e5^{\text{e}} valeurs rangées.

Avec n=9n=9, la médiane est la 5e5^{\text{e}} valeur rangée — quelle que soit la taille de la valeur ajoutée, pourvu qu'elle soit au-dessus.

La moyenne varie de valeur ajouteˊexˉn+1\tfrac{\text{valeur ajoutée}-\bar x}{n+1} : elle dépend de la valeur, la médiane seulement de son rang.

Correction détaillée
Ce qu'il faut voir

La moyenne dépend de toutes les valeurs, la médiane seulement de leur ordre. C'est la différence de nature entre les deux résumés, et cet exercice la fait mesurer : ajouter une valeur au-dessus de la médiane la décale d'un cran dans la liste rangée, que cette valeur soit 4444 ou 440440. La moyenne, elle, absorbe la valeur entière — et 440440 minutes de trajet, c'est plus que les huit autres réunis.

👉 La série est rangée dès l'énoncé : profites-en, la médiane se lit sans calcul.

Rappel de cours

Moyenne : xˉ=1nxi\bar x=\dfrac1n\sum x_i.

Médiane, série rangée x(1)x(n)x_{(1)}\leq\dots\leq x_{(n)} : si nn est pair, Me=x(n/2)+x(n/2+1)2\mathrm{Me}=\dfrac{x_{(n/2)}+x_{(n/2+1)}}2 ; si nn est impair, Me=x((n+1)/2)\mathrm{Me}=x_{((n+1)/2)}.

Ajouter une valeur vv à une série de moyenne xˉ\bar x donne la nouvelle moyenne nxˉ+vn+1=xˉ+vxˉn+1\dfrac{n\bar x+v}{n+1}=\bar x+\dfrac{v-\bar x}{n+1}.

Étape 1 — huit valeurs
xˉ=12+15+15+18+22+25+30+358=1728=21,5 min.\bar x=\frac{12+15+15+18+22+25+30+35}{8}=\frac{172}{8}=21{,}5\ \text{min}.

n=8n=8 est pair : les valeurs centrales sont la 4e4^{\text{e}} et la 5e5^{\text{e}}, soit 1818 et 2222 :

Me=18+222=20 min.\mathrm{Me}=\frac{18+22}{2}=20\ \text{min}.
xˉ=21,5Me=20\boxed{\bar x=21{,}5\qquad\mathrm{Me}=20}

La moyenne dépasse la médiane : la série est étalée à droite (les longs trajets 3030 et 3535 pèsent plus que les courts ne compensent).

Étape 2 — un neuvième à 44 minutes

Moyenne. xˉ=172+449=2169=24\bar x'=\dfrac{172+44}{9}=\dfrac{216}{9}=24 min. Par la formule d'ajout : 21,5+4421,59=21,5+2,5=2421{,}5+\dfrac{44-21{,}5}{9}=21{,}5+2{,}5=24 ✓.

Médiane. La série rangée devient 12,15,15,18,22,25,30,35,4412,15,15,18,\mathbf{22},25,30,35,44 ; n=9n=9 impair, la médiane est la 5e5^{\text{e}} valeur : 2222.

xˉ=24Me=22\boxed{\bar x'=24\qquad\mathrm{Me}'=22}

La moyenne a gagné 2,52{,}5 min, la médiane 22 min — ici les deux bougent d'un ordre comparable, parce que 4444 n'est pas très éloigné des autres.

Étape 3 — un neuvième à 440 minutes

Moyenne. xˉ=172+4409=6129=68\bar x''=\dfrac{172+440}{9}=\dfrac{612}{9}=68 min. Le « trajet moyen » a triplé à cause d'un seul étudiant, et huit sur neuf sont largement en dessous.

Médiane. La série rangée est 12,15,15,18,22,25,30,35,44012,15,15,18,\mathbf{22},25,30,35,440 : la 5e5^{\text{e}} valeur est toujours 2222. Que le dernier vaille 4444 ou 440440 ne change pas qui est au milieu.

xˉ=68Me=22\boxed{\bar x''=68\qquad\mathrm{Me}''=22}

Pourquoi. La médiane ne « voit » de la valeur ajoutée que sa position (au-dessus ou au-dessous du centre) ; la moyenne la reçoit tout entière, divisée par n+1n+1 : 44021,5946,5\dfrac{440-21{,}5}{9}\approx46{,}5 min d'augmentation.

Contrôle

Les trois moyennes se recoupent par la somme : 172172, 216=172+44216=172+44, 612=172+440612=172+440, divisées par 88, 99, 99 — soit 21,521{,}5, 2424 et 6868 ✓. Et pour la médiane, on peut vérifier la propriété « au moins la moitié de chaque côté » : avec Me=22\mathrm{Me}''=22, quatre valeurs sont strictement en dessous et quatre strictement au-dessus, la neuvième est la médiane elle-même ✓.

L'erreur classique

⚠️ Recalculer la médiane comme si nn était resté pair. Après ajout, n=9n=9 : il n'y a plus deux valeurs centrales mais une seule. Prendre 18+222=20\tfrac{18+22}2=20 ou 22+252=23,5\tfrac{22+25}2=23{,}5 est faux.

⚠️ Croire que la médiane « ne bouge jamais ». Elle a bougé de 2020 à 2222 : ajouter une valeur au-dessus déplace le centre d'un demi-cran. Ce qui ne bouge pas, c'est sa sensibilité à la taille de la valeur ajoutée.

À retenir

Une valeur extrême déplace la moyenne d'environ vxˉn+1\tfrac{v-\bar x}{n+1} et la médiane d'au plus un cran. C'est pourquoi on cite la médiane pour les temps, les salaires, les délais — toute série où quelques valeurs peuvent être énormes.

Avant de calculer une médiane : compter nn, et ranger. Pair ou impair, la règle change.

Réponse. n=8n=8 : xˉ=21,5\bar x=21{,}5, Me=20\mathrm{Me}=20 ; avec 4444 : xˉ=24\bar x=24, Me=22\mathrm{Me}=22 ; avec 440440 : xˉ=68\bar x=68, Me=22\mathrm{Me}=22 — la médiane ne voit que le rang, la moyenne absorbe la valeur. (Recoupement : sommes 172172, 216216, 612612 ✓)
Faire cet exercice dans l'app →

Salaires : quel résumé raconte quoi ?

ApplicationDifficulté 3/5

Dans une petite entreprise, les dix salaires mensuels (en euros) sont : 1500, 1600, 1700, 1800, 1900, 2000, 2100, 2200, 2400, 28001\,500,\ 1\,600,\ 1\,700,\ 1\,800,\ 1\,900,\ 2\,000,\ 2\,100,\ 2\,200,\ 2\,400,\ 2\,800. 1. Calculer la moyenne et la médiane. 2. Le salarié à 28002\,800 euros part ; il est remplacé par le nouveau directeur, payé 1280012\,800 euros. Recalculer la moyenne et la médiane. 3. Combien de salariés gagnent moins que le « salaire moyen » de l'entreprise après l'arrivée du directeur ? 4. La direction annonce « un salaire moyen de 30003\,000 euros », le syndicat « un salaire médian de 19501\,950 euros ». Qui a raison ?

Indices (3)

Dix valeurs : la médiane est la demi-somme des 5e5^{\text{e}} et 6e6^{\text{e}}.

Remplacer 28002\,800 par 1280012\,800 ajoute 1000010\,000 à la somme, donc 10001\,000 à la moyenne.

Le directeur reste la plus grande valeur : le rang des neuf autres n'a pas changé.

Correction détaillée
Ce qu'il faut voir

Les deux résumés sont exacts, et ils ne répondent pas à la même question. La moyenne divise la masse salariale par le nombre de personnes : c'est ce que coûte un salarié « en moyenne » à l'entreprise. La médiane est le salaire de la personne du milieu : c'est ce que gagne un salarié « typique ». Sur une série symétrique les deux coïncident ; dès qu'un salaire s'envole, elles se séparent — et chacun cite celle qui l'arrange.

👉 L'exercice chiffre l'écart : un seul salaire de 1280012\,800 euros fait passer la moyenne de 20002\,000 à 30003\,000 euros sans toucher à la médiane.

Rappel de cours

La moyenne est le barycentre des valeurs : elle est sensible à chaque valeur, et une valeur extrême la déplace de Δn\dfrac{\Delta}{n} si Δ\Delta est la variation de cette valeur.

La médiane ne dépend que des rangs : remplacer la plus grande valeur par une valeur encore plus grande ne la change pas. On dit qu'elle est robuste.

Sur une série étalée à droite (salaires, patrimoines, durées), xˉ>Me\bar x>\mathrm{Me} ; la majorité des individus est sous la moyenne.

Étape 1 — les dix salaires
xˉ=1500+1600+1700+1800+1900+2000+2100+2200+2400+280010=2000010=2000 euros.\bar x=\frac{1500+1600+1700+1800+1900+2000+2100+2200+2400+2800}{10}=\frac{20\,000}{10}=2\,000\ \text{euros}.

n=10n=10, pair : la médiane est la demi-somme des 5e5^{\text{e}} et 6e6^{\text{e}} valeurs rangées, 19001\,900 et 20002\,000 :

Me=1900+20002=1950 euros.\mathrm{Me}=\frac{1900+2000}{2}=1\,950\ \text{euros}.
xˉ=2000Me=1950\boxed{\bar x=2\,000\qquad\mathrm{Me}=1\,950}

Moyenne et médiane sont proches : la série est presque symétrique, à peine tirée vers le haut par le 28002\,800.

Étape 2 — le directeur

Moyenne. La somme gagne 128002800=1000012\,800-2\,800=10\,000 : xˉ=20000+1000010=3000\bar x'=\dfrac{20\,000+10\,000}{10}=3\,000 euros. Un seul salaire a ajouté 10001\,000 euros à la moyenne de tout le monde.

Médiane. La série rangée est 1500,1600,1700,1800,1900,2000,2100,2200,2400,128001500,1600,1700,1800,\mathbf{1900},\mathbf{2000},2100,2200,2400,12800 : les 5e5^{\text{e}} et 6e6^{\text{e}} valeurs sont les mêmes, donc Me=1950\mathrm{Me}'=1\,950 euros.

xˉ=3000Me=1950\boxed{\bar x'=3\,000\qquad\mathrm{Me}'=1\,950}

Le directeur aurait pu gagner 100000100\,000 euros : la médiane serait encore 19501\,950. Elle ne sait pas combien il gagne, seulement qu'il est au-dessus du milieu.

Étape 3 — qui est sous la moyenne ?

Les salaires inférieurs à 30003\,000 euros sont 1500,,24001500,\dots,2400 : neuf salariés sur dix, soit 90%90\,\%. Le « salaire moyen » n'est atteint par personne sauf le directeur.

C'est le mécanisme général d'une série étalée à droite : la moyenne est tirée vers les grandes valeurs, et la majorité se retrouve en dessous d'elle. « La moitié des salariés gagnent moins que la moyenne » est faux en général — ici c'est 90%90\,\%.

Étape 4 — qui a raison ?

Les deux. 30003\,000 euros est bien la moyenne, 19501\,950 euros est bien la médiane : aucun des deux chiffres n'est faux. Ce qui diffère, c'est la question à laquelle chacun répond.

  • La direction parle de masse salariale par tête : 3000×10=300003\,000\times10=30\,000 euros de salaires versés chaque mois. C'est le point de vue du budget.
  • Le syndicat parle du salarié typique : la moitié du personnel gagne au plus 19501\,950 euros. C'est le point de vue des personnes.

Un résumé honnête donne les deux, et dit pourquoi ils diffèrent : un salaire très élevé. Donner l'un sans l'autre, c'est choisir ce qu'on veut faire croire.

L'erreur classique

⚠️ Recalculer toute la somme quand une seule valeur change. xˉ=xˉ+12800280010\bar x'=\bar x+\dfrac{12800-2800}{10} : la moyenne se met à jour par la variation, sans refaire l'addition — et c'est aussi ce qui montre d'où vient l'écart.

⚠️ Croire que la médiane « est » le salaire de quelqu'un. Ici 19501\,950 euros n'est le salaire de personne : avec nn pair, la médiane est une demi-somme. Ce qu'elle garantit, c'est que la moitié gagne au plus 19001\,900 et l'autre moitié au moins 20002\,000.

À retenir

Salaires, délais, durées : citer la médiane, et donner la moyenne à côté. Leur écart mesure l'asymétrie ; un écart de 10501\,050 euros sur dix personnes signale une valeur hors norme, pas une « erreur ».

Une valeur extrême change la moyenne de Δn\tfrac{\Delta}{n} et la médiane de rien tant qu'elle reste du même côté du centre.

Réponse. xˉ=2000\bar x=2\,000, Me=1950\mathrm{Me}=1\,950 ; avec le directeur : xˉ=3000\bar x=3\,000, Me=1950\mathrm{Me}=1\,950 (inchangée) ; 99 salariés sur 1010 sont sous la moyenne ; les deux chiffres sont exacts et répondent à deux questions différentes. (Recoupement : +10000+10\,000 sur la somme, +1000+1\,000 sur la moyenne ✓)
Faire cet exercice dans l'app →

Classes inégales : centres, moyenne estimée et le bon histogramme

ApplicationDifficulté 3/5

Les temps d'attente de 4040 clients à un guichet ont été regroupés en classes : [0,5[[0,5[ : 1010 clients ; [5,10[[5,10[ : 1414 ; [10,20[[10,20[ : 1212 ; [20,40[[20,40[ : 44. 1. Calculer les fréquences et estimer la moyenne par les centres des classes. 2. On trace un histogramme en prenant pour hauteur l'effectif. Pourquoi ce graphique est-il trompeur ? Calculer les hauteurs correctes (densités de fréquence, par minute). 3. La classe [10,20[[10,20[ « paraît » presque aussi fournie que [5,10[[5,10[ : est-ce vrai par minute d'attente ? 4. Estimer la médiane par interpolation.

Indices (3)

Le centre de [a,b[[a,b[ est a+b2\tfrac{a+b}2 ; la moyenne estimée est 1nnici\tfrac1n\sum n_ic_i.

Dans un histogramme, c'est l'aire qui représente l'effectif : hauteur == fréquence // largeur.

La classe médiane est celle où la fréquence cumulée franchit 50%50\,\% ; on y interpole linéairement.

Correction détaillée
Ce qu'il faut voir

Quand les classes n'ont pas la même largeur, la hauteur ment. Un histogramme représente un effectif par une aire ; si [10,20[[10,20[ est deux fois plus large que [5,10[[5,10[, un rectangle de même hauteur y contiendrait deux fois plus de clients. Tracer les effectifs en hauteur revient donc à gonfler visuellement les classes larges — ici [10,20[[10,20[ et surtout [20,40[[20,40[, qui s'étale sur la moitié de l'axe avec 44 clients seulement.

👉 La correction consiste à diviser chaque fréquence par la largeur de sa classe : on obtient une densité, et l'aire de chaque rectangle redevient la fréquence.

Deux histogrammes cote a cote de la meme serie a classes inegales : a gauche la hauteur est l'effectif et la classe large parait dominante, a droite la hauteur est la densite et cette classe redevient modeste.
Avec des classes inégales, c'est l'AIRE qui dit la fréquence, pas la hauteur. La même série — les temps d'attente de 4040 clients — est tracée deux fois : à gauche la hauteur est l'effectif (1010 ; 1414 ; 1212 ; 44), à droite la densité de fréquence (0,050{,}05 ; 0,070{,}07 ; 0,030{,}03 ; 0,0050{,}005 par minute). À gauche, la classe large [10,20[[10,20[ paraît presque aussi fournie que [5,10[[5,10[ ; à droite elle retombe à 37\tfrac37 de sa densité, ce qui est la vérité par minute d'attente. Les aires du panneau de droite valent les fréquences 25%25\,\% ; 35%35\,\% ; 30%30\,\% ; 10%10\,\%, et totalisent 11.

Rappel de cours

Série groupée. On estime la moyenne par les centres : xˉ1nnici\bar x\approx\dfrac1n\sum n_i\,c_i avec ci=ai+bi2c_i=\dfrac{a_i+b_i}2.

Histogramme. Aire du rectangle de la classe [ai,bi[[a_i,b_i[ proportionnelle à nin_i. Hauteur == densité de fréquence fibiai\dfrac{f_i}{b_i-a_i} (ou effectif par unité, nibiai\dfrac{n_i}{b_i-a_i}). Avec des classes de même largeur, hauteur et effectif sont proportionnels et la question ne se pose pas.

Médiane d'une série groupée : classe [a,b[[a,b[FF franchit 12\tfrac12, puis Mea+(ba)12F(a)F(b)F(a)\mathrm{Me}\approx a+(b-a)\dfrac{\frac12-F(a)}{F(b)-F(a)}.

Étape 1 — fréquences et moyenne estimée
classe [0,5[[0,5[ [5,10[[5,10[ [10,20[[10,20[ [20,40[[20,40[
effectif 1010 1414 1212 44
fréquence 0,250{,}25 0,350{,}35 0,300{,}30 0,100{,}10
centre cic_i 2,52{,}5 7,57{,}5 1515 3030
largeur 55 55 1010 2020
xˉ10×2,5+14×7,5+12×15+4×3040=25+105+180+12040=43040=10,75 min.\bar x\approx\frac{10\times2{,}5+14\times7{,}5+12\times15+4\times30}{40}=\frac{25+105+180+120}{40}=\frac{430}{40}=10{,}75\ \text{min}.
xˉ10,75 min\boxed{\bar x\approx10{,}75\ \text{min}}

C'est une estimation : on a supposé que dans chaque classe les clients attendent en moyenne le temps du centre. Les vraies valeurs pourraient donner 10,210{,}2 ou 11,311{,}3 ; on ne le saura pas sans elles.

Étape 2 — les hauteurs correctes

Hauteur == fréquence divisée par la largeur :

classe [0,5[[0,5[ [5,10[[5,10[ [10,20[[10,20[ [20,40[[20,40[
densité (par min) 0,25/5=0,050{,}25/5=0{,}05 0,35/5=0,070{,}35/5=0{,}07 0,30/10=0,030{,}30/10=0{,}03 0,10/20=0,0050{,}10/20=0{,}005

Contrôle : la somme des aires vaut 0,05×5+0,07×5+0,03×10+0,005×20=0,25+0,35+0,30+0,10=10{,}05\times5+0{,}07\times5+0{,}03\times10+0{,}005\times20=0{,}25+0{,}35+0{,}30+0{,}10=1 ✓ — l'aire totale d'un histogramme de densités est toujours 11.

En effectifs par minute, c'est 22 ; 2,82{,}8 ; 1,21{,}2 ; 0,20{,}2 clients par minute d'attente : le graphique décroît après [5,10[[5,10[, ce que le tracé en hauteur == effectif masquait complètement.

Étape 3 — la classe qui trompe

En effectif, [10,20[[10,20[ contient 1212 clients contre 1414 pour [5,10[[5,10[ : presque autant. Mais [10,20[[10,20[ est deux fois plus large. Par minute, elle porte 0,030{,}03 contre 0,070{,}07, soit 0,030,07=3743%\tfrac{0{,}03}{0{,}07}=\tfrac37\approx43\,\% de la densité de [5,10[[5,10[.

Autrement dit, entre 1010 et 2020 minutes il arrive moins de la moitié de clients par minute qu'entre 55 et 1010. Le rectangle tracé en hauteur == effectif faisait croire l'inverse.

Étape 4 — médiane par interpolation

Fréquences cumulées aux bornes : F(5)=0,25F(5)=0{,}25, F(10)=0,60F(10)=0{,}60, F(20)=0,90F(20)=0{,}90, F(40)=1F(40)=1. La cumulée franchit 0,50{,}5 dans [5,10[[5,10[ : c'est la classe médiane.

Me5+5×0,50,250,600,25=5+5×0,250,35=5+2578,57 min.\mathrm{Me}\approx5+5\times\frac{0{,}5-0{,}25}{0{,}60-0{,}25}=5+5\times\frac{0{,}25}{0{,}35}=5+\frac{25}{7}\approx8{,}57\ \text{min}.
Me8,57 min\boxed{\mathrm{Me}\approx8{,}57\ \text{min}}

La médiane (8,68{,}6) est nettement sous la moyenne (10,7510{,}75) : la longue classe [20,40[[20,40[ tire la moyenne vers le haut — signature d'une série étalée à droite, comme presque tous les temps d'attente.

L'erreur classique

⚠️ Hauteur == effectif avec des classes inégales. C'est l'erreur visée par tout l'exercice : elle multiplie visuellement l'importance de chaque classe par sa largeur. Le contrôle est immédiat — si l'aire totale des rectangles n'est pas 11 (ou nn), le graphique est faux.

⚠️ Prendre le centre de [20,40[[20,40[ pour 2020. Le centre est 3030 ; avec 2020 la moyenne tombe à 9,759{,}75. Sur une classe large, le choix du centre pèse lourd — c'est une raison de plus de se méfier des estimations sur classes inégales.

À retenir

Histogramme : l'aire, jamais la hauteur. Classes égales, on trace les effectifs ; classes inégales, on trace les densités fibiai\tfrac{f_i}{b_i-a_i}, et l'aire totale vaut 11.

Sur une série groupée, moyenne et médiane sont des estimations. Les dire comme telles, avec le symbole \approx.

Réponse. Fréquences 0,250{,}25 ; 0,350{,}35 ; 0,300{,}30 ; 0,100{,}10 ; xˉ10,75\bar x\approx10{,}75 min ; densités 0,050{,}05 ; 0,070{,}07 ; 0,030{,}03 ; 0,0050{,}005 par minute (aire totale 11) ; [10,20[[10,20[ porte 37\tfrac37 de la densité de [5,10[[5,10[ ; Me5+2578,57\mathrm{Me}\approx5+\tfrac{25}7\approx8{,}57 min. (Recoupement : \sum aires =1=1 ✓)
Faire cet exercice dans l'app →

Polygone des fréquences cumulées et lecture des quartiles

ApplicationDifficulté 3/5

Les masses (en kg) de 5050 colis sont réparties ainsi : [0,2[[0,2[ : 55 colis ; [2,4[[2,4[ : 1010 ; [4,6[[4,6[ : 1515 ; [6,8[[6,8[ : 1212 ; [8,10[[8,10[ : 88. 1. Dresser le tableau des fréquences cumulées croissantes aux bornes des classes. 2. Tracer le polygone des fréquences cumulées et y lire, à l'œil, la médiane. 3. Calculer par interpolation linéaire Q1Q_1, la médiane et Q3Q_3. 4. Estimer la moyenne par les centres ; la comparer à la médiane.

Indices (3)

F(bi)F(b_i) est la proportion de colis de masse <bi<b_i : on cumule les effectifs et on divise par 5050.

Le polygone joint les points (bi,F(bi))(b_i,F(b_i)), en partant de (0,0)(0,0).

Dans la classe [a,b[[a,b[FF franchit pp : xpa+(ba)pF(a)F(b)F(a)x_p\approx a+(b-a)\dfrac{p-F(a)}{F(b)-F(a)}.

Correction détaillée
Ce qu'il faut voir

Le polygone des fréquences cumulées est une machine à lire les quantiles. On ne connaît pas les 5050 masses, seulement combien tombent dans chaque classe. Mais si l'on suppose les masses uniformément réparties à l'intérieur de chaque classe, la fréquence cumulée croît linéairement d'une borne à l'autre : c'est le polygone. Pour lire Q1Q_1, on cherche où il coupe 25%25\,\% ; pour la médiane, 50%50\,\% ; pour Q3Q_3, 75%75\,\%.

👉 L'interpolation n'est rien d'autre que « lire sur la ligne droite » entre deux points connus.

Le polygone des frequences cumulees croissantes de 50 colis, avec les trois lectures graphiques de Q1, de la mediane et de Q3 sur les horizontales 25, 50 et 75 pour cent.
On lit la médiane là où la courbe coupe l'horizontale 50%50\,\%. Le polygone des fréquences cumulées des masses de 5050 colis (classes de largeur 22 kg) passe par les points (2;0,10)(2;0{,}10), (4;0,30)(4;0{,}30), (6;0,60)(6;0{,}60), (8;0,84)(8;0{,}84) et (10;1)(10;1) ; entre deux bornes, le segment interpole — on suppose les valeurs uniformément réparties dans la classe. Les trois horizontales donnent Q1=3,5Q_1=3{,}5 kg, Me5,33\mathrm{Me}\approx5{,}33 kg et Q3=7,25Q_3=7{,}25 kg : la médiane tombe dans la classe [4,6[[4,6[, celle où FF franchit 12\tfrac12.

Rappel de cours

Fréquence cumulée aux bornes : F(bk)=n1++nknF(b_k)=\dfrac{n_1+\dots+n_k}{n}, avec F(a1)=0F(a_1)=0 et F(bdernier)=1F(b_{\text{dernier}})=1.

Interpolation linéaire dans [a,b[[a,b[ : si F(a)<pF(b)F(a)<p\leq F(b), le quantile d'ordre pp est estimé par xpa+(ba)pF(a)F(b)F(a)x_p\approx a+(b-a)\dfrac{p-F(a)}{F(b)-F(a)}. Le quotient est la fraction de la classe qu'il faut parcourir pour atteindre pp.

Ce sont des estimations ; la médiane réelle des 5050 masses peut différer.

Étape 1 — les cumulées
borne bib_i 22 44 66 88 1010
effectif cumulé 55 1515 3030 4242 5050
F(bi)F(b_i) 0,100{,}10 0,300{,}30 0,600{,}60 0,840{,}84 11

Et F(0)=0F(0)=0. La cumulée passe 0,250{,}25 entre 22 et 44, passe 0,500{,}50 entre 44 et 66, passe 0,750{,}75 entre 66 et 88 : voilà déjà les trois classes où se trouvent Q1Q_1, Me\mathrm{Me} et Q3Q_3.

Étape 2 — le polygone et la lecture à l'œil

On place les points (0,0)(0,0), (2,0,10)(2,0{,}10), (4,0,30)(4,0{,}30), (6,0,60)(6,0{,}60), (8,0,84)(8,0{,}84), (10,1)(10,1) et on les joint par des segments. L'horizontale 50%50\,\% coupe le segment de (4,0,30)(4,0{,}30) à (6,0,60)(6,0{,}60) un peu au-delà de son milieu — le milieu du segment est à F=0,45F=0{,}45, on est donc un peu plus loin : on lit Me5,3\mathrm{Me}\approx5{,}3 kg. C'est ce que le calcul va confirmer.

Étape 3 — les trois quartiles par interpolation

Q1Q_1, dans [2,4[[2,4[FF passe de 0,100{,}10 à 0,300{,}30 :

Q12+2×0,250,100,300,10=2+2×0,150,20=2+1,5=3,5 kg.Q_1\approx2+2\times\frac{0{,}25-0{,}10}{0{,}30-0{,}10}=2+2\times\frac{0{,}15}{0{,}20}=2+1{,}5=3{,}5\ \text{kg}.

Médiane, dans [4,6[[4,6[FF passe de 0,300{,}30 à 0,600{,}60 :

Me4+2×0,500,300,600,30=4+2×0,200,30=4+43=1635,33 kg.\mathrm{Me}\approx4+2\times\frac{0{,}50-0{,}30}{0{,}60-0{,}30}=4+2\times\frac{0{,}20}{0{,}30}=4+\frac43=\frac{16}{3}\approx5{,}33\ \text{kg}.

Q3Q_3, dans [6,8[[6,8[FF passe de 0,600{,}60 à 0,840{,}84 :

Q36+2×0,750,600,840,60=6+2×0,150,24=6+1,25=7,25 kg.Q_3\approx6+2\times\frac{0{,}75-0{,}60}{0{,}84-0{,}60}=6+2\times\frac{0{,}15}{0{,}24}=6+1{,}25=7{,}25\ \text{kg}.
Q13,5Me5,33Q37,25\boxed{Q_1\approx3{,}5\qquad\mathrm{Me}\approx5{,}33\qquad Q_3\approx7{,}25}

Écart interquartile estimé : 7,253,5=3,757{,}25-3{,}5=3{,}75 kg — la moitié centrale des colis pèse entre 3,53{,}5 et 7,257{,}25 kg.

Étape 4 — moyenne par les centres

Centres 1,3,5,7,91,3,5,7,9 :

xˉ5×1+10×3+15×5+12×7+8×950=5+30+75+84+7250=26650=5,32 kg.\bar x\approx\frac{5\times1+10\times3+15\times5+12\times7+8\times9}{50}=\frac{5+30+75+84+72}{50}=\frac{266}{50}=5{,}32\ \text{kg}.
xˉ5,32 kg\boxed{\bar x\approx5{,}32\ \text{kg}}

Moyenne 5,325{,}32 et médiane 5,335{,}33 : quasiment égales — la répartition est presque symétrique autour de 5566 kg (les classes [2,4[[2,4[ et [6,8[[6,8[ se répondent, [0,2[[0,2[ et [8,10[[8,10[ aussi, à peu près). Sur une série asymétrique on aurait vu un écart net, comme en A4.

L'erreur classique

⚠️ Interpoler avec les effectifs de la mauvaise classe. Le dénominateur F(b)F(a)F(b)-F(a) est la fréquence de la classe où l'on interpole, pas la fréquence cumulée. Pour la médiane, c'est 0,300{,}30 (la fréquence de [4,6[[4,6[), pas 0,600{,}60.

⚠️ Confondre F(bi)F(b_i) et fif_i. Le polygone se trace avec les cumulées ; tracer les fréquences simples donne un polygone des fréquences (une courbe en cloche), sur lequel on ne lit aucun quantile.

À retenir

Cumuler, tracer, lire. Les points (bi,F(bi))(b_i,F(b_i)) reliés en ligne droite ; les horizontales 25%25\,\%, 50%50\,\%, 75%75\,\% ; l'abscisse de chaque intersection est le quantile estimé.

Interpolation == « fraction de la classe à parcourir » : pF(a)F(b)F(a)\dfrac{p-F(a)}{F(b)-F(a)}, multipliée par la largeur, ajoutée à la borne inférieure.

Réponse. FF aux bornes : 0,100{,}10 ; 0,300{,}30 ; 0,600{,}60 ; 0,840{,}84 ; 11 ; Q13,5Q_1\approx3{,}5 kg, Me1635,33\mathrm{Me}\approx\tfrac{16}3\approx5{,}33 kg, Q37,25Q_3\approx7{,}25 kg ; xˉ5,32\bar x\approx5{,}32 kg, presque égale à la médiane (série quasi symétrique). (Recoupement : lecture graphique 5,3\approx5{,}3 ✓)
Faire cet exercice dans l'app →

Deux ateliers à comparer, et un changement de barème

ApplicationDifficulté 3/5

Deux ateliers fabriquent la même pièce. Production journalière (pièces) de l'atelier A sur 1010 jours : 40, 42, 44, 45, 45, 46, 48, 50, 52, 5840,\ 42,\ 44,\ 45,\ 45,\ 46,\ 48,\ 50,\ 52,\ 58 ; de l'atelier B sur 1515 jours : 30, 33, 38, 38, 39, 39, 41, 42, 42, 43, 45, 48, 49, 51, 5230,\ 33,\ 38,\ 38,\ 39,\ 39,\ 41,\ 42,\ 42,\ 43,\ 45,\ 48,\ 49,\ 51,\ 52. 1. Pour chaque atelier, calculer la moyenne, la médiane et l'étendue. 2. Lequel produit le plus ? Lequel est le plus régulier ? 3. Les notes de la classe de A1 (moyenne 11,211{,}2, médiane 1111, sur 2020) sont converties sur 4040 par la formule y=2x+1y=2x+1. Donner la nouvelle moyenne et la nouvelle médiane sans recalculer la série, et justifier.

Indices (3)

Ranger d'abord ; n=10n=10 et n=15n=15 ne donnent pas la médiane au même endroit.

L'étendue est maxmin\max-\min : un premier indicateur de régularité, très sensible aux extrêmes.

Si y=ax+by=ax+b avec a>0a>0 : yˉ=axˉ+b\bar y=a\bar x+b et Mey=aMex+b\mathrm{Me}_y=a\,\mathrm{Me}_x+b.

Correction détaillée
Ce qu'il faut voir

Comparer, c'est mettre en regard une position ET une dispersion. L'atelier A produit plus en moyenne — mais il a aussi la journée exceptionnelle à 5858 pièces ; l'atelier B produit moins, mais ses journées se ressemblent davantage. Deux résumés au lieu d'un, et déjà la comparaison prend du sens. La question 3 ajoute la troisième idée du lot : une transformation affine croissante se transporte sur moyenne et médiane, sans qu'on ait à refaire les calculs.

Rappel de cours

Étendue =maxmin=\max-\min. Médiane : n=10n=10 (pair) \Rightarrow demi-somme des 5e5^{\text{e}} et 6e6^{\text{e}} ; n=15n=15 (impair) \Rightarrow la 8e8^{\text{e}}.

Transformation affine. Si yi=axi+by_i=ax_i+b : yˉ=1n(axi+b)=axˉ+b\bar y=\dfrac1n\sum(ax_i+b)=a\bar x+b (linéarité de la somme). Si de plus a>0a>0, l'ordre des valeurs est conservé, donc Mey=aMex+b\mathrm{Me}_y=a\,\mathrm{Me}_x+b.

Étape 1 — atelier A

La série est rangée. Somme =40+42+44+45+45+46+48+50+52+58=470=40+42+44+45+45+46+48+50+52+58=470, donc xˉA=47010=47\bar x_A=\dfrac{470}{10}=47 pièces.

Médiane : n=10n=10, demi-somme des 5e5^{\text{e}} et 6e6^{\text{e}} valeurs (4545 et 4646) : MeA=45,5\mathrm{Me}_A=45{,}5. Étendue : 5840=1858-40=18.

xˉA=47MeA=45,5eA=18\boxed{\bar x_A=47\qquad\mathrm{Me}_A=45{,}5\qquad e_A=18}

Étape 2 — atelier B

Somme =30+33+38+38+39+39+41+42+42+43+45+48+49+51+52=630=30+33+38+38+39+39+41+42+42+43+45+48+49+51+52=630, donc xˉB=63015=42\bar x_B=\dfrac{630}{15}=42 pièces.

Médiane : n=15n=15, la 8e8^{\text{e}} valeur rangée : 30,33,38,38,39,39,41,42,30,33,38,38,39,39,41,\mathbf{42},\dots soit MeB=42\mathrm{Me}_B=42. Étendue : 5230=2252-30=22.

xˉB=42MeB=42eB=22\boxed{\bar x_B=42\qquad\mathrm{Me}_B=42\qquad e_B=22}

Étape 3 — lecture comparée

Qui produit le plus ? A, sur les deux résumés : moyenne 4747 contre 4242, médiane 45,545{,}5 contre 4242. L'écart de moyennes (55 pièces) est un peu supérieur à l'écart de médianes (3,53{,}5) : la journée à 5858 gonfle un peu la moyenne de A.

Qui est le plus régulier ? Sur l'étendue, A (1818) devance B (2222). Mais l'étendue ne regarde que les deux extrêmes ; B a une mauvaise journée à 3030 qui l'alourdit à elle seule. L'écart-type (lot B) et l'écart interquartile donneront une réponse plus fine — l'approfondissement C3 reprend précisément ces deux ateliers pour décomposer la variance.

Ce qu'on peut affirmer : A produit davantage ; sur la régularité, l'étendue penche pour A, sans que ce seul indicateur suffise à trancher.

Étape 4 — le changement de barème

Chaque note xx sur 2020 devient y=2x+1y=2x+1 sur 4040. Comme a=2>0a=2>0 :

yˉ=2xˉ+1=2×11,2+1=23,4,Mey=2Mex+1=2×11+1=23.\bar y=2\bar x+1=2\times11{,}2+1=23{,}4,\qquad\mathrm{Me}_y=2\,\mathrm{Me}_x+1=2\times11+1=23.
yˉ=23,4Mey=23\boxed{\bar y=23{,}4\qquad\mathrm{Me}_y=23}

Justification. Pour la moyenne : (2xi+1)=2xi+25\sum(2x_i+1)=2\sum x_i+25, et en divisant par 2525 on obtient 2xˉ+12\bar x+1 — c'est la linéarité. Pour la médiane : x2x+1x\mapsto2x+1 est croissante, donc elle ne change pas l'ordre des notes ; la 13e13^{\text{e}} note reste la 13e13^{\text{e}}, et elle vaut désormais 2×11+1=232\times11+1=23.

Contrôle sur la série entière : (2xi+1)=2×280+25=585\sum(2x_i+1)=2\times280+25=585, 58525=23,4\dfrac{585}{25}=23{,}4 ✓.

L'erreur classique

⚠️ Comparer des ateliers sur la seule moyenne. « A fait 4747, B fait 4242 » ne dit rien de la variabilité ; un atelier qui alterne 3030 et 6060 a la même moyenne qu'un atelier constant à 4545, et ne se gère pas du tout de la même façon.

⚠️ Appliquer la transformation à la médiane quand a<0a<0. Avec y=x+20y=-x+20 (une pénalité), l'ordre est renversé : la médiane devient Mex+20-\mathrm{Me}_x+20 seulement parce que la médiane est au milieu — mais Q1Q_1 et Q3Q_3 s'échangent. La règle « Mey=aMex+b\mathrm{Me}_y=a\mathrm{Me}_x+b » est sûre pour a>0a>0.

À retenir

Comparer deux séries == une position ++ une dispersion, chacune choisie selon la question. Moyenne et médiane pour le niveau ; étendue en première approche, puis écart-type ou IQR.

y=ax+by=ax+b, a>0a>0 : moyenne et médiane suivent. Aucun calcul à refaire — et pour la dispersion, on verra en B5 que seul le facteur aa compte.

Réponse. A : xˉ=47\bar x=47, Me=45,5\mathrm{Me}=45{,}5, étendue 1818 ; B : xˉ=42\bar x=42, Me=42\mathrm{Me}=42, étendue 2222 — A produit plus, et paraît plus régulier à l'étendue ; barème y=2x+1y=2x+1 : yˉ=23,4\bar y=23{,}4, Mey=23\mathrm{Me}_y=23 (linéarité, transformation croissante). (Recoupement : (2xi+1)=585\sum(2x_i+1)=585, 585/25=23,4585/25=23{,}4 ✓)
Faire cet exercice dans l'app →

Étendue, quartiles et écart interquartile : la convention et les rangs

CalculDifficulté 3/5

Les durées (en minutes) de 1212 interventions d'un technicien, rangées : 8, 10, 11, 13, 14, 16, 17, 19, 22, 24, 26, 358,\ 10,\ 11,\ 13,\ 14,\ 16,\ 17,\ 19,\ 22,\ 24,\ 26,\ 35. 1. Donner l'étendue, Q1Q_1, la médiane, Q3Q_3 et l'écart interquartile, avec la convention du cours (plus petite valeur telle que la fréquence cumulée soit 14\geq\tfrac14, resp. 34\tfrac34). 2. Même question pour les 1010 durées 5, 7, 8, 9, 11, 12, 14, 15, 18, 255,\ 7,\ 8,\ 9,\ 11,\ 12,\ 14,\ 15,\ 18,\ 25. 3. Un tableur donne, pour la première série, Q1=12,5Q_1=12{,}5 et Q3=22,5Q_3=22{,}5. Est-ce une erreur ?

Indices (3)

Sur 1212 valeurs, la kk-ième a pour fréquence cumulée k12\tfrac k{12} : chercher le premier kk tel que k1214\tfrac k{12}\geq\tfrac14.

Sur 1010 valeurs, 210<14310\tfrac2{10}<\tfrac14\leq\tfrac3{10} : Q1Q_1 est la 3e3^{\text{e}} valeur.

Le tableur interpole entre deux valeurs : autre convention, pas une erreur — voir l'approfondissement.

Correction détaillée
Ce qu'il faut voir

Un quartile est un rang avant d'être une valeur. Avec la convention du cours, Q1Q_1 est la première valeur de la série rangée dont la fréquence cumulée atteint 25%25\,\% : sur nn valeurs, c'est la kk-ième avec kk le plus petit entier tel que kn14\tfrac kn\geq\tfrac14. Tout se joue donc sur ce rang — et sur une petite série, changer de convention change de rang, donc de valeur. L'exercice fait d'abord appliquer la convention à deux tailles (1212, où 14\tfrac14 tombe pile sur un rang, et 1010, où il ne tombe pas), puis explique pourquoi le tableur donne autre chose.

Rappel de cours

Étendue =maxmin=\max-\min.

Quartiles (convention du chapitre). Q1Q_1 : plus petite valeur de la série telle que F(Q1)14F(Q_1)\geq\tfrac14 ; Q3Q_3 : plus petite telle que F(Q3)34F(Q_3)\geq\tfrac34. Sur une série rangée de taille nn, Q1Q_1 est la valeur de rang n/4\lceil n/4\rceil et Q3Q_3 celle de rang 3n/4\lceil 3n/4\rceil (arrondi par excès).

Écart interquartile IQR=Q3Q1\mathrm{IQR}=Q_3-Q_1 : largeur de la moitié centrale, insensible aux extrêmes.

Étape 1 — la série de 12 durées

Étendue : 358=2735-8=27 min.

Rangs. 312=14\tfrac3{12}=\tfrac14 exactement, et 212<14\tfrac2{12}<\tfrac14 : le premier rang qui atteint 25%25\,\% est le 3e3^{\text{e}}, donc Q1=x(3)=11Q_1=x_{(3)}=11. De même 912=34\tfrac9{12}=\tfrac34 et 812<34\tfrac8{12}<\tfrac34 : Q3=x(9)=22Q_3=x_{(9)}=22.

Médiane : n=12n=12 pair, demi-somme des 6e6^{\text{e}} et 7e7^{\text{e}} : Me=16+172=16,5\mathrm{Me}=\dfrac{16+17}2=16{,}5.

e=27Q1=11Me=16,5Q3=22IQR=11\boxed{e=27\qquad Q_1=11\qquad\mathrm{Me}=16{,}5\qquad Q_3=22\qquad\mathrm{IQR}=11}

Lecture : la moitié centrale des interventions dure entre 1111 et 2222 min ; l'intervention à 3535 min n'influence ni Q3Q_3 ni l'IQR — elle n'influence que l'étendue.

Étape 2 — la série de 10 durées

Étendue : 255=2025-5=20 min.

Rangs. 210=0,2<0,25\tfrac2{10}=0{,}2<0{,}25 et 310=0,30,25\tfrac3{10}=0{,}3\geq0{,}25 : Q1=x(3)=8Q_1=x_{(3)}=8. Puis 710=0,7<0,75\tfrac7{10}=0{,}7<0{,}75 et 810=0,80,75\tfrac8{10}=0{,}8\geq0{,}75 : Q3=x(8)=15Q_3=x_{(8)}=15.

Médiane : n=10n=10, demi-somme des 5e5^{\text{e}} et 6e6^{\text{e}} : Me=11+122=11,5\mathrm{Me}=\dfrac{11+12}2=11{,}5.

e=20Q1=8Me=11,5Q3=15IQR=7\boxed{e=20\qquad Q_1=8\qquad\mathrm{Me}=11{,}5\qquad Q_3=15\qquad\mathrm{IQR}=7}

Ici n4=2,5\tfrac n4=2{,}5 n'est pas entier : on arrondit par excès au rang 33, jamais par défaut au rang 22 (dont la fréquence cumulée 0,20{,}2 n'atteint pas 0,250{,}25).

Étape 3 — le tableur n'a pas tort

Le tableur emploie une autre convention : il place Q1Q_1 au rang « 1+0,25(n1)1+0{,}25\,(n-1) », soit 1+0,25×11=3,751+0{,}25\times11=3{,}75, et interpole entre la 3e3^{\text{e}} valeur (1111) et la 4e4^{\text{e}} (1313) : 11+0,75×(1311)=12,511+0{,}75\times(13-11)=12{,}5. De même Q3Q_3 au rang 1+0,75×11=9,251+0{,}75\times11=9{,}25 : 22+0,25×(2422)=22,522+0{,}25\times(24-22)=22{,}5.

Ce n'est donc pas une erreur mais une définition différente, qui donne un IQR de 1010 au lieu de 1111. Sur une grande série les deux conventions se rejoignent ; sur 1212 valeurs elles diffèrent d'un cran. La règle : dire sa convention. L'approfondissement (C5) compare les trois usuelles sur cette même série.

Contrôle

Avec la convention du cours, au moins 25%25\,\% des valeurs doivent être Q1\leq Q_1 et au moins 75%75\,\% être Q3\leq Q_3. Série de 1212 : 33 valeurs 11\leq11 (25%25\,\% ✓), 99 valeurs 22\leq22 (75%75\,\% ✓). Série de 1010 : 33 valeurs 8\leq8 (30%25%30\,\%\geq25\,\% ✓), 88 valeurs 15\leq15 (80%75%80\,\%\geq75\,\% ✓). Et dans les deux cas Q1MeQ3Q_1\leq\mathrm{Me}\leq Q_3 ✓.

L'erreur classique

⚠️ Prendre le rang n4\tfrac n4 arrondi au plus proche. Sur 1010 valeurs, 2,52{,}5 « arrondi » à 22 ou à 33 selon l'humeur : la convention tranche — le premier rang qui atteint 14\tfrac14, donc l'arrondi par excès.

⚠️ Interpoler avec la convention du cours. « Q1Q_1 est entre la 2e2^{\text{e}} et la 3e3^{\text{e}} valeur, je prends la moyenne » mélange deux conventions. Celle du cours rend toujours une valeur de la série ; c'est ce qui la rend simple à lire sur un tableau d'effectifs cumulés.

À retenir

Q1Q_1 : rang n/4\lceil n/4\rceil ; Q3Q_3 : rang 3n/4\lceil3n/4\rceil ; médiane : le milieu (demi-somme si nn pair). Trois rangs, trois valeurs, un IQR.

Un quartile sans convention n'est pas un résultat. Tableur, calculatrice, manuel : trois réponses possibles, toutes justes dans leur définition.

Réponse. Série de 1212 : e=27e=27, Q1=11Q_1=11, Me=16,5\mathrm{Me}=16{,}5, Q3=22Q_3=22, IQR=11\mathrm{IQR}=11 ; série de 1010 : e=20e=20, Q1=8Q_1=8, Me=11,5\mathrm{Me}=11{,}5, Q3=15Q_3=15, IQR=7\mathrm{IQR}=7 ; le tableur interpole (12,512{,}5 et 22,522{,}5) : autre convention, pas une erreur. (Recoupement : au moins 25%25\,\% et 75%75\,\% des valeurs sous Q1Q_1 et Q3Q_3 ✓)
Faire cet exercice dans l'app →

Boîtes à moustaches : deux séries de même médiane

ApplicationDifficulté 3/5

Deux groupes de 1111 étudiants passent la même épreuve notée sur 4040. Groupe 1 : 14, 16, 17, 18, 19, 20, 21, 22, 23, 24, 4014,\ 16,\ 17,\ 18,\ 19,\ 20,\ 21,\ 22,\ 23,\ 24,\ 40. Groupe 2 : 4, 8, 12, 15, 18, 20, 22, 25, 28, 32, 364,\ 8,\ 12,\ 15,\ 18,\ 20,\ 22,\ 25,\ 28,\ 32,\ 36. 1. Pour chaque groupe, donner les cinq nombres de la boîte à moustaches : minimum, Q1Q_1, médiane, Q3Q_3, maximum. 2. Tracer les deux boîtes sur un même axe et les comparer. 3. Calculer les deux moyennes ; que dit l'écart entre moyenne et médiane du groupe 1 ? 4. Avec la variante « moustaches à 1,5×IQR1{,}5\times\mathrm{IQR} », quelle valeur devient isolée, et dans quel groupe ?

Indices (3)

n=11n=11 : la médiane est la 6e6^{\text{e}} valeur, Q1Q_1 la 3e3^{\text{e}} (31114\tfrac3{11}\geq\tfrac14), Q3Q_3 la 9e9^{\text{e}}.

Une boîte va de Q1Q_1 à Q3Q_3, coupée par la médiane ; les moustaches vont aux extrêmes.

Borne haute de la variante : Q3+1,5×IQRQ_3+1{,}5\times\mathrm{IQR}.

Correction détaillée
Ce qu'il faut voir

Même médiane, séries très différentes : c'est ce que la boîte montre d'un coup d'œil. Les deux groupes ont 2020 pour médiane. Mais dans le groupe 1 la moitié centrale tient en 66 points (1717 à 2323), dans le groupe 2 elle s'étale sur 1616 points (1212 à 2828). La boîte du groupe 2 est presque trois fois plus longue : ses étudiants sont bien plus hétérogènes. Et le 4040 du groupe 1, seul tout en haut, ne déforme ni la boîte ni la médiane — la boîte à moustaches est faite pour ça.

Deux boites a moustaches alignees sur le meme axe des notes, de meme mediane 20 : la boite du groupe 1 est courte avec une longue moustache a droite, celle du groupe 2 est nettement plus large.
Même médiane, dispersions différentes : c'est la longueur de la boîte qui les sépare. Deux groupes de 1111 étudiants notés sur 4040 ont la même médiane 2020, et deux profils opposés — groupe 1 : 1414 ; 1717 ; 2020 ; 2323 ; 4040, groupe 2 : 44 ; 1212 ; 2020 ; 2828 ; 3636. La boîte contient la moitié centrale des valeurs : IQR=6\mathrm{IQR}=6 pour le premier groupe contre 1616 pour le second. La longue moustache droite du groupe 1 trahit son seul 4040, qui tire la moyenne à 21,3\approx21{,}3 au-dessus de la médiane sans déplacer celle-ci.

Rappel de cours

Les cinq nombres : min\min, Q1Q_1, Me\mathrm{Me}, Q3Q_3, max\max. La boîte va de Q1Q_1 à Q3Q_3 (elle contient la moitié centrale des valeurs), la médiane la coupe ; les moustaches rejoignent les extrêmes.

Variante : moustaches limitées à Q11,5IQRQ_1-1{,}5\,\mathrm{IQR} et Q3+1,5IQRQ_3+1{,}5\,\mathrm{IQR} ; toute valeur au-delà est marquée isolée (un point à part). Les deux conventions existent : dire laquelle on emploie.

Sur n=11n=11 valeurs rangées : Q1=x(3)Q_1=x_{(3)}, Me=x(6)\mathrm{Me}=x_{(6)}, Q3=x(9)Q_3=x_{(9)}.

Étape 1 — les cinq nombres

Les deux séries sont rangées et n=11n=11 : 3110,270,25\tfrac3{11}\approx0{,}27\geq0{,}25 (et 2110,18<0,25\tfrac2{11}\approx0{,}18<0{,}25), donc Q1=x(3)Q_1=x_{(3)} ; 9110,820,75\tfrac9{11}\approx0{,}82\geq0{,}75 (et 8110,73<0,75\tfrac8{11}\approx0{,}73<0{,}75), donc Q3=x(9)Q_3=x_{(9)} ; la médiane est x(6)x_{(6)}.

min\min Q1Q_1 Me\mathrm{Me} Q3Q_3 max\max IQR\mathrm{IQR}
groupe 1 1414 1717 2020 2323 4040 66
groupe 2 44 1212 2020 2828 3636 1616
G1 : 14, 17, 20, 23, 40G2 : 4, 12, 20, 28, 36\boxed{\text{G1 : }14,\ 17,\ 20,\ 23,\ 40\qquad\text{G2 : }4,\ 12,\ 20,\ 28,\ 36}
Étape 2 — le tracé et la lecture

Sur un axe gradué de 00 à 4040, on dessine pour chaque groupe un rectangle de Q1Q_1 à Q3Q_3, un trait à la médiane, et deux segments jusqu'au minimum et au maximum. C'est la figure ci-dessus.

Position : les deux médianes sont alignées sur 2020 — les deux groupes ont le même « étudiant du milieu ».

Dispersion : boîte de longueur 66 contre 1616. Le groupe 1 est homogène (la moitié centrale à ±3\pm3 points de la médiane), le groupe 2 hétérogène (des étudiants à 44, d'autres à 3636).

Asymétrie : dans le groupe 1 la médiane est au milieu de la boîte (171720202323) mais la moustache droite est très longue (2323 à 4040) : une seule valeur, très haute. Dans le groupe 2 la boîte est symétrique (121220202828 : médiane au milieu, moustaches de 88 et 88) et les moustaches aussi (88 de chaque côté) : répartition régulière.

Étape 3 — moyennes, et l'écart moyenne-médiane

Groupe 1 : somme 14+16+17+18+19+20+21+22+23+24+40=23414+16+17+18+19+20+21+22+23+24+40=234, xˉ1=2341121,3\bar x_1=\dfrac{234}{11}\approx21{,}3. Groupe 2 : somme 220220, xˉ2=22011=20\bar x_2=\dfrac{220}{11}=20.

xˉ121,3xˉ2=20\boxed{\bar x_1\approx21{,}3\qquad\bar x_2=20}

Dans le groupe 2, moyenne et médiane coïncident : la série est symétrique. Dans le groupe 1, la moyenne dépasse la médiane de 1,31{,}3 point — et une seule note en est responsable : sans le 4040, les dix autres ont pour moyenne 19410=19,4\tfrac{194}{10}=19{,}4, en dessous de 2020. L'écart moyenne-médiane est le signal d'une valeur extrême, que la boîte montre par sa longue moustache.

Étape 4 — la variante à 1,5 IQR

Groupe 1 : Q3+1,5×IQR=23+1,5×6=23+9=32Q_3+1{,}5\times\mathrm{IQR}=23+1{,}5\times6=23+9=32. Le 4040 dépasse 3232 : il est isolé. La moustache s'arrête alors à la plus grande valeur non isolée, 2424, et le 4040 est marqué par un point.

Groupe 2 : Q3+1,5×IQR=28+1,5×16=28+24=52Q_3+1{,}5\times\mathrm{IQR}=28+1{,}5\times16=28+24=52, et la borne basse 1224=1212-24=-12 : aucune note ne sort de [12,52][-12,52], aucune valeur isolée. Les moustaches vont bien de 44 à 3636.

seule valeur isoleˊe : le 40 du groupe 1\boxed{\text{seule valeur isolée : le }40\text{ du groupe 1}}

Avec cette variante, la boîte du groupe 1 devient visuellement encore plus compacte (1414 à 2424, plus un point à 4040) : la variante sépare « l'étudiant hors norme » du reste du groupe.

L'erreur classique

⚠️ Lire la longueur de la moustache comme une dispersion. La moustache droite du groupe 1 est longue à cause d'une valeur. C'est la boîte qui mesure la dispersion de la masse des valeurs, pas les moustaches — d'où la variante à 1,5IQR1{,}5\,\mathrm{IQR}, qui les raccourcit pour isoler les valeurs atypiques.

⚠️ Conclure « le groupe 1 est meilleur » de sa moyenne 21,321{,}3. À médiane égale, la différence de moyenne vient d'un seul étudiant. Le groupe 1 n'est pas meilleur : il est plus homogène, avec une exception.

À retenir

Cinq nombres, un dessin, trois lectures : position (médiane), dispersion (longueur de la boîte), asymétrie et valeurs extrêmes (place de la médiane dans la boîte, moustaches).

Deux séries se comparent boîtes alignées sur le même axe. Une moyenne ne suffit jamais — deux séries à même moyenne peuvent avoir des boîtes de longueur 66 et 1616.

Réponse. G1 : 14, 17, 20, 23, 4014,\ 17,\ 20,\ 23,\ 40 (IQR 66) ; G2 : 4, 12, 20, 28, 364,\ 12,\ 20,\ 28,\ 36 (IQR 1616) ; même médiane 2020, groupe 2 bien plus dispersé ; xˉ121,3\bar x_1\approx21{,}3 (tirée par le 4040), xˉ2=20\bar x_2=20 ; en variante 1,5IQR1{,}5\,\mathrm{IQR}, seul le 4040 est isolé (23+9=32<4023+9=32<40). (Recoupement : sans le 4040, moyenne 19,4<2019{,}4<20 ✓)
Faire cet exercice dans l'app →

Variance et écart-type par la définition

CalculDifficulté 3/5

1. Pour la série 2, 4, 4, 4, 5, 5, 7, 92,\ 4,\ 4,\ 4,\ 5,\ 5,\ 7,\ 9, calculer la moyenne, les écarts à la moyenne, leurs carrés, la variance et l'écart-type — en fractions, sans calculatrice. 2. Même travail pour 3, 5, 6, 103,\ 5,\ 6,\ 10. 3. Pourquoi la somme des écarts vaut-elle toujours 00, et pourquoi élève-t-on au carré ? 4. Dans quelle unité s'expriment variance et écart-type si les valeurs sont des longueurs en cm ?

Indices (3)

La variance est la moyenne des carrés des écarts, divisée par nn (pas par n1n-1).

(xixˉ)=xinxˉ=0\sum(x_i-\bar x)=\sum x_i-n\bar x=0 : c'est la définition même de xˉ\bar x.

Une somme de carrés est un carré d'unité ; la racine ramène à l'unité de départ.

Correction détaillée
Ce qu'il faut voir

La variance mesure à quelle distance, en moyenne, les valeurs sont de leur moyenne — mais « distance » au sens du carré. Le calcul à la main, en fractions, est ce qui fait comprendre la formule : on centre (on retranche xˉ\bar x), on élève au carré (pour que les écarts ne se compensent pas), on fait la moyenne, on prend la racine (pour retrouver l'unité). La première série est choisie pour que tout tombe juste : moyenne 55, variance 44, écart-type 22.

Rappel de cours

Variance de la série x1,,xnx_1,\dots,x_n : V=1ni=1n(xixˉ)2V=\dfrac1n\sum_{i=1}^n(x_i-\bar x)^2. Écart-type : σ=V\sigma=\sqrt V.

Propriétés : V0V\geq0, et V=0V=0 si et seulement si toutes les valeurs sont égales. σ\sigma a l'unité des xix_i ; VV a le carré de cette unité.

Ce chapitre divise toujours par nn (variance de la série). La calculatrice propose aussi σn1\sigma_{n-1}, qui divise par n1n-1 : c'est un autre objet (approfondissement D3).

Étape 1 — première série, en fractions

Moyenne : xˉ=2+4+4+4+5+5+7+98=408=5\bar x=\dfrac{2+4+4+4+5+5+7+9}{8}=\dfrac{40}{8}=5.

xix_i 22 44 44 44 55 55 77 99
xixˉx_i-\bar x 3-3 1-1 1-1 1-1 00 00 22 44
(xixˉ)2(x_i-\bar x)^2 99 11 11 11 00 00 44 1616

Somme des écarts : 3111+0+0+2+4=0-3-1-1-1+0+0+2+4=0 ✓. Somme des carrés : 9+1+1+1+0+0+4+16=329+1+1+1+0+0+4+16=32.

V=328=4,σ=4=2.V=\frac{32}{8}=4,\qquad\sigma=\sqrt4=2.
xˉ=5V=4σ=2\boxed{\bar x=5\qquad V=4\qquad\sigma=2}

Lecture : les valeurs sont « en moyenne » à 22 de la moyenne 55 — au sens quadratique. De fait, six valeurs sur huit sont dans [3,7][3,7].

Étape 2 — deuxième série

xˉ=3+5+6+104=244=6\bar x=\dfrac{3+5+6+10}4=\dfrac{24}4=6. Écarts : 3, 1, 0, 4-3,\ -1,\ 0,\ 4 (somme 00 ✓) ; carrés : 9, 1, 0, 169,\ 1,\ 0,\ 16, somme 2626.

V=264=132=6,5,σ=6,52,55.V=\frac{26}{4}=\frac{13}2=6{,}5,\qquad\sigma=\sqrt{6{,}5}\approx2{,}55.
xˉ=6V=6,5σ2,55\boxed{\bar x=6\qquad V=6{,}5\qquad\sigma\approx2{,}55}

Ici l'écart-type n'est pas un entier : la racine se calcule à la fin, et une seule fois — jamais sur chaque écart.

Étape 3 — pourquoi zéro, pourquoi le carré

La somme des écarts est nulle par construction. (xixˉ)=xinxˉ\sum(x_i-\bar x)=\sum x_i-n\bar x, et nxˉ=xin\bar x=\sum x_i par définition de la moyenne. Donc la « moyenne des écarts » vaut toujours 00 et ne mesure rien : les écarts positifs compensent exactement les négatifs.

D'où le carré. (xixˉ)2(x_i-\bar x)^2 est positif, nul seulement si xi=xˉx_i=\bar x, et il grossit vite avec l'écart : une valeur à distance 44 pèse 1616, une valeur à distance 11 pèse 11. La variance est donc sensible aux valeurs éloignées — c'est un choix, pas un accident. (On pourrait prendre les valeurs absolues : c'est l'écart absolu moyen, moins commode en calcul ; l'approfondissement C1 montre que la moyenne minimise les carrés et la médiane les valeurs absolues.)

Étape 4 — les unités

Si les xix_i sont en cm, les écarts sont en cm, leurs carrés en cm2\text{cm}^2, et la variance — moyenne de carrés — en cm2\text{cm}^2. L'écart-type, racine d'une aire, revient en cm : c'est lui qu'on compare aux valeurs, qu'on ajoute à la moyenne (« xˉ±σ\bar x\pm\sigma »), qu'on lit sur un graphique. La variance sert aux calculs (elle s'ajoute, elle se décompose) ; l'écart-type sert à lire.

V en cm2,σ en cm\boxed{V\text{ en }\text{cm}^2,\qquad\sigma\text{ en cm}}

L'erreur classique

⚠️ Oublier le carré et calculer la moyenne des écarts : on trouve 00, toujours, et l'on conclut à une dispersion nulle. Ou prendre la moyenne des xixˉ\lvert x_i-\bar x\rvert, qui est un autre indicateur (ici 128=1,5\tfrac{12}8=1{,}5 pour la première série, pas 22).

⚠️ Diviser par n1n-1 sans raison. 3274,57\tfrac{32}7\approx4{,}57 n'est pas la variance de cette série ; c'est une estimation de variance d'une population dont la série serait un échantillon — question d'inférence, pas de description.

À retenir

Centrer, élever au carré, moyenner, prendre la racine. Quatre gestes, dans cet ordre, et le contrôle gratuit à l'étape 1 : la somme des écarts vaut 00.

σ\sigma a l'unité des données, VV son carré. On lit σ\sigma, on calcule avec VV.

Réponse. Série 1 : xˉ=5\bar x=5, écarts 3,1,1,1,0,0,2,4-3,-1,-1,-1,0,0,2,4, carrés de somme 3232, V=4V=4, σ=2\sigma=2 ; série 2 : xˉ=6\bar x=6, V=132=6,5V=\tfrac{13}2=6{,}5, σ2,55\sigma\approx2{,}55 ; la somme des écarts est nulle par définition de xˉ\bar x, d'où le carré ; VV en cm2\text{cm}^2, σ\sigma en cm. (Recoupement : somme des écarts =0=0 dans les deux cas ✓)
Faire cet exercice dans l'app →

Koenig-Huygens : la formule rapide, et le recoupement

CalculDifficulté 3/5

On reprend les 2525 notes de A1 (un 66, deux 88, trois 99, quatre 1010, cinq 1111, quatre 1212, deux 1313, deux 1414, un 1616, un 1818 ; moyenne 11,211{,}2). 1. Calculer x2\overline{x^2}, la moyenne des carrés des notes. 2. En déduire la variance par la formule de Koenig-Huygens V=x2xˉ2V=\overline{x^2}-\bar x^{\,2}, puis l'écart-type. 3. Recouper par la définition : calculer ni(xixˉ)2\sum n_i(x_i-\bar x)^2 et retrouver la même variance. 4. Démontrer la formule de Koenig-Huygens.

Indices (3)

x2=1nnixi2\overline{x^2}=\dfrac1n\sum n_i\,x_i^2 : pondérer les carrés par les effectifs.

Par la définition, les écarts sont xi11,2x_i-11{,}2 ; les carrés se pondèrent aussi par nin_i.

Développer (xixˉ)2=xi22xˉxi+xˉ2(x_i-\bar x)^2=x_i^2-2\bar x\,x_i+\bar x^{\,2} et sommer.

Correction détaillée
Ce qu'il faut voir

Koenig-Huygens, c'est la variance sans les écarts. Calculer 2525 écarts à 11,211{,}2, les élever au carré, les pondérer : long et propice aux fautes. La formule V=x2xˉ2V=\overline{x^2}-\bar x^{\,2} ne demande que la moyenne des carrés des valeurs — des entiers — et le carré de la moyenne. Et comme les deux calculs doivent donner exactement le même nombre, faire les deux est le meilleur contrôle du chapitre : une divergence, même au centième, est une faute quelque part.

Rappel de cours

Formule de Koenig-Huygens : V=x2xˉ2=1nnixi2(1nnixi)2V=\overline{x^2}-\bar x^{\,2}=\dfrac1n\sum n_i\,x_i^2-\left(\dfrac1n\sum n_i\,x_i\right)^2.

⚠️ x2\overline{x^2} (moyenne des carrés) et xˉ2\bar x^{\,2} (carré de la moyenne) sont deux nombres différents, et le premier est toujours le plus grand — leur différence est la variance, positive.

Étape 1 — la moyenne des carrés
xix_i 66 88 99 1010 1111 1212 1313 1414 1616 1818
nin_i 11 22 33 44 55 44 22 22 11 11
nixi2n_i\,x_i^2 3636 128128 243243 400400 605605 576576 338338 392392 256256 324324
nixi2=36+128+243+400+605+576+338+392+256+324=3298,x2=329825=131,92.\sum n_i\,x_i^2=36+128+243+400+605+576+338+392+256+324=3\,298,\qquad\overline{x^2}=\frac{3\,298}{25}=131{,}92.
Étape 2 — variance et écart-type par Koenig
V=x2xˉ2=131,9211,22=131,92125,44=6,48.V=\overline{x^2}-\bar x^{\,2}=131{,}92-11{,}2^2=131{,}92-125{,}44=6{,}48.
σ=6,482,55.\sigma=\sqrt{6{,}48}\approx2{,}55.
V=6,48σ2,55\boxed{V=6{,}48\qquad\sigma\approx2{,}55}

Lecture : les notes s'écartent en moyenne d'environ 2,52{,}5 points de la moyenne 11,211{,}2 ; l'intervalle [xˉσ,xˉ+σ][8,65,13,75][\bar x-\sigma,\bar x+\sigma]\approx[8{,}65,13{,}75] contient les notes de 99 à 1313, soit 3+4+5+4+2=183+4+5+4+2=18 étudiants sur 2525 (72%72\,\%).

Étape 3 — recoupement par la définition

Écarts xi11,2x_i-11{,}2 : 5,2-5{,}2 ; 3,2-3{,}2 ; 2,2-2{,}2 ; 1,2-1{,}2 ; 0,2-0{,}2 ; 0,80{,}8 ; 1,81{,}8 ; 2,82{,}8 ; 4,84{,}8 ; 6,86{,}8. Carrés pondérés :

xix_i 66 88 99 1010 1111 1212 1313 1414 1616 1818
ni(xixˉ)2n_i(x_i-\bar x)^2 27,0427{,}04 20,4820{,}48 14,5214{,}52 5,765{,}76 0,20{,}2 2,562{,}56 6,486{,}48 15,6815{,}68 23,0423{,}04 46,2446{,}24

Somme : 27,04+20,48+14,52+5,76+0,2+2,56+6,48+15,68+23,04+46,24=16227{,}04+20{,}48+14{,}52+5{,}76+0{,}2+2{,}56+6{,}48+15{,}68+23{,}04+46{,}24=162, et V=16225=6,48V=\dfrac{162}{25}=6{,}48 ✓ — exactement la valeur de Koenig. Les deux chemins se rejoignent, ce qui certifie les deux.

Étape 4 — la démonstration

On développe chaque carré : (xixˉ)2=xi22xˉxi+xˉ2(x_i-\bar x)^2=x_i^2-2\bar x\,x_i+\bar x^{\,2}. En sommant avec les effectifs :

ni(xixˉ)2=nixi22xˉnixi+xˉ2ni=nixi22xˉnxˉ+nxˉ2=nixi2nxˉ2,\sum n_i(x_i-\bar x)^2=\sum n_i x_i^2-2\bar x\sum n_i x_i+\bar x^{\,2}\sum n_i=\sum n_ix_i^2-2\bar x\cdot n\bar x+n\bar x^{\,2}=\sum n_ix_i^2-n\bar x^{\,2},
puisque nixi=nxˉ\sum n_ix_i=n\bar x et ni=n\sum n_i=n. On divise par nn :
V=1nnixi2xˉ2=x2xˉ2.V=\frac1n\sum n_ix_i^2-\bar x^{\,2}=\overline{x^2}-\bar x^{\,2}.\qquad\blacksquare

Le terme croisé 2xˉnixi-2\bar x\sum n_ix_i absorbe nxˉ2n\bar x^{\,2} deux fois et il en reste un négatif : c'est tout le mécanisme.

L'erreur classique

⚠️ Élever la moyenne au carré à la place de la moyenne des carrés (ou l'inverse). x2=131,92\overline{x^2}=131{,}92 et xˉ2=125,44\bar x^{\,2}=125{,}44 : les confondre donne une variance nulle ou négative — une variance négative est impossible, c'est le signal d'alarme.

⚠️ Arrondir xˉ\bar x avant de l'élever au carré. Avec xˉ11\bar x\approx11 on obtient 131,92121=10,92131{,}92-121=10{,}92 au lieu de 6,486{,}48 : la formule soustrait deux nombres proches, et une petite erreur sur l'un devient une grosse erreur sur la différence. Garder la valeur exacte de la moyenne.

À retenir

V=x2xˉ2V=\overline{x^2}-\bar x^{\,2} : moyenne des carrés moins carré de la moyenne. Rapide à la main, mais fragile aux arrondis — garder xˉ\bar x exacte.

Faire les deux calculs quand c'est possible : la définition et Koenig doivent coïncider exactement, c'est le contrôle le moins cher qui existe.

Réponse. nixi2=3298\sum n_ix_i^2=3\,298, x2=131,92\overline{x^2}=131{,}92, xˉ2=125,44\bar x^{\,2}=125{,}44, V=6,48V=6{,}48, σ2,55\sigma\approx2{,}55 ; par la définition ni(xixˉ)2=162\sum n_i(x_i-\bar x)^2=162, V=162/25=6,48V=162/25=6{,}48 ✓ ; démonstration par développement de (xixˉ)2(x_i-\bar x)^2 et nixi=nxˉ\sum n_ix_i=n\bar x. (Recoupement : les deux chemins donnent exactement 6,486{,}48 ✓)
Faire cet exercice dans l'app →

Changement d'unité et valeurs centrées réduites

CalculDifficulté 3/5

Les températures maximales (en °C) relevées sur 1010 jours : 13, 13, 15, 15, 16, 16, 17, 17, 19, 1913,\ 13,\ 15,\ 15,\ 16,\ 16,\ 17,\ 17,\ 19,\ 19. 1. Calculer la moyenne, la variance et l'écart-type. 2. Un correspondant américain veut les mêmes résumés en degrés Fahrenheit, y=1,8x+32y=1{,}8\,x+32. Les obtenir sans convertir les dix valeurs, puis vérifier sur la série convertie. 3. Calculer les valeurs centrées réduites zi=xixˉσz_i=\dfrac{x_i-\bar x}{\sigma} ; quelles sont leur moyenne et leur variance ? 4. Que signifie « 1919 °C a pour valeur centrée réduite 1,51{,}5 » ?

Indices (3)

Les écarts à 1616 sont ±3, ±1, 0\pm3,\ \pm1,\ 0 : la somme des carrés se calcule de tête.

Si y=ax+by=ax+b : yˉ=axˉ+b\bar y=a\bar x+b, Vy=a2VxV_y=a^2V_x, σy=aσx\sigma_y=\lvert a\rvert\sigma_x — le +32+32 ne change pas la dispersion.

Une valeur centrée réduite compte les écarts-types entre la valeur et la moyenne.

Correction détaillée
Ce qu'il faut voir

Changer d'unité, c'est une transformation affine, et les résumés suivent des règles simples. La moyenne suit la transformation entière (axˉ+ba\bar x+b) ; la dispersion ne voit que le facteur aa : ajouter 3232 décale tout le monde sans rien resserrer ni écarter, multiplier par 1,81{,}8 dilate les écarts de 1,81{,}8. Et la transformation la plus utile de toutes est celle qui ramène n'importe quelle série à une moyenne 00 et un écart-type 11 : centrer, réduire. C'est elle qui permet de comparer une température à une note.

Rappel de cours

Si yi=axi+by_i=a\,x_i+b : yˉ=axˉ+b\bar y=a\bar x+b,  Vy=a2Vx\ V_y=a^2\,V_x,  σy=aσx\ \sigma_y=\lvert a\rvert\,\sigma_x.

Valeur centrée réduite : zi=xixˉσz_i=\dfrac{x_i-\bar x}{\sigma} (cas a=1σa=\tfrac1\sigma, b=xˉσb=-\tfrac{\bar x}\sigma). La série des ziz_i a pour moyenne 00 et pour écart-type 11. ziz_i est le nombre d'écarts-types entre xix_i et la moyenne, signé.

Étape 1 — les résumés en °C

xˉ=13+13+15+15+16+16+17+17+19+1910=16010=16\bar x=\dfrac{13+13+15+15+16+16+17+17+19+19}{10}=\dfrac{160}{10}=16 °C.

Écarts à 1616 : 3,3,1,1,0,0,1,1,3,3-3,-3,-1,-1,0,0,1,1,3,3 ; carrés : 9,9,1,1,0,0,1,1,9,99,9,1,1,0,0,1,1,9,9, somme 4040.

V=4010=4,σ=2 °C.V=\frac{40}{10}=4,\qquad\sigma=2\ \text{°C}.
xˉ=16 °CV=4σ=2 °C\boxed{\bar x=16\ \text{°C}\qquad V=4\qquad\sigma=2\ \text{°C}}

Étape 2 — en Fahrenheit, par les formules

Avec a=1,8a=1{,}8 et b=32b=32 :

yˉ=1,8×16+32=28,8+32=60,8 °F,σy=1,8×2=3,6 °F,Vy=1,82×4=3,24×4=12,96.\bar y=1{,}8\times16+32=28{,}8+32=60{,}8\ \text{°F},\qquad\sigma_y=1{,}8\times2=3{,}6\ \text{°F},\qquad V_y=1{,}8^2\times4=3{,}24\times4=12{,}96.
yˉ=60,8σy=3,6Vy=12,96\boxed{\bar y=60{,}8\qquad\sigma_y=3{,}6\qquad V_y=12{,}96}

Vérification sur la série convertie. yiy_i : 55,455{,}4 ; 55,455{,}4 ; 5959 ; 5959 ; 60,860{,}8 ; 60,860{,}8 ; 62,662{,}6 ; 62,662{,}6 ; 66,266{,}2 ; 66,266{,}2. Somme 608608, moyenne 60,860{,}8 ✓. Écarts à 60,860{,}8 : ±5,4\pm5{,}4, ±1,8\pm1{,}8, 00 — exactement 1,81{,}8 fois les écarts en °C ; carrés 29,1629{,}16 et 3,243{,}24 (quatre fois chacun) : somme 4×29,16+4×3,24=116,64+12,96=129,64\times29{,}16+4\times3{,}24=116{,}64+12{,}96=129{,}6, Vy=12,96V_y=12{,}96 ✓.

Pourquoi. yiyˉ=a(xixˉ)y_i-\bar y=a(x_i-\bar x) : le bb disparaît dans l'écart, et le aa sort au carré de la somme des carrés.

Étape 3 — centrer, réduire

zi=xi162z_i=\dfrac{x_i-16}{2} :

xix_i 1313 1313 1515 1515 1616 1616 1717 1717 1919 1919
ziz_i 1,5-1{,}5 1,5-1{,}5 0,5-0{,}5 0,5-0{,}5 00 00 0,50{,}5 0,50{,}5 1,51{,}5 1,51{,}5

Moyenne : la somme est 00 (les ziz_i sont symétriques), donc zˉ=0\bar z=0. Variance : carrés 2,252{,}25 (quatre fois) et 0,250{,}25 (quatre fois), somme 9+1=109+1=10, Vz=1010=1V_z=\dfrac{10}{10}=1.

zˉ=0Vz=1σz=1\boxed{\bar z=0\qquad V_z=1\qquad\sigma_z=1}

C'est général : z=1σxxˉσz=\tfrac1\sigma x-\tfrac{\bar x}\sigma est affine avec a=1σa=\tfrac1\sigma, donc zˉ=xˉxˉσ=0\bar z=\tfrac{\bar x-\bar x}\sigma=0 et σz=1σσ=1\sigma_z=\tfrac1\sigma\sigma=1.

Étape 4 — lire une valeur centrée réduite

z=1,5z=1{,}5 pour 1919 °C signifie : 1919 est à 1,51{,}5 écart-type au-dessus de la moyenne (16+1,5×2=1916+1{,}5\times2=19). Le nombre n'a plus d'unité — il ne dépend plus du degré Celsius ni du Fahrenheit : en °F, 66,266{,}2 est aussi à 1,51{,}5 écart-type de 60,860{,}8 (60,8+1,5×3,6=66,260{,}8+1{,}5\times3{,}6=66{,}2 ✓).

C'est ce qui rend les zz comparables entre séries : une note de 1414 dans une classe de moyenne 11,211{,}2 et d'écart-type 2,552{,}55 a pour z1,10z\approx1{,}10 — « moins exceptionnelle » que ces 1919 °C, bien que les unités n'aient rien à voir.

L'erreur classique

⚠️ Ajouter bb à l'écart-type : σy=1,8×2+32=35,6\sigma_y=1{,}8\times2+32=35{,}6 °F est absurde — une translation ne disperse rien. Le +32+32 ne touche que la moyenne.

⚠️ Multiplier la variance par aa au lieu de a2a^2 : 1,8×4=7,21{,}8\times4=7{,}2 au lieu de 12,9612{,}96. C'est l'écart-type qui est multiplié par a\lvert a\rvert ; la variance, carré de l'écart-type, l'est par a2a^2.

À retenir

y=ax+by=ax+b : la moyenne prend aa et bb, l'écart-type ne prend que a\lvert a\rvert, la variance a2a^2.

Centrer-réduire efface l'unité : zz compte des écarts-types. C'est l'outil de comparaison entre séries hétérogènes, et le premier pas vers la loi normale centrée réduite.

Réponse. xˉ=16\bar x=16 °C, V=4V=4, σ=2\sigma=2 ; en °F : yˉ=60,8\bar y=60{,}8, σy=3,6\sigma_y=3{,}6, Vy=12,96V_y=12{,}96 (vérifié sur la série convertie) ; zi=±1,5z_i=\pm1{,}5, ±0,5\pm0{,}5, 00, de moyenne 00 et de variance 11 ; z=1,5z=1{,}5 : 1919 °C est à 1,51{,}5 écart-type au-dessus de la moyenne. (Recoupement : 66,2=60,8+1,5×3,666{,}2=60{,}8+1{,}5\times3{,}6 ✓)
Faire cet exercice dans l'app →

Série groupée : variance par les centres, et le mythe des 68 %

ApplicationDifficulté 3/5

Les durées (en minutes, arrondies) de 2020 appels à un service client : 0, 1, 1, 3, 3, 3, 4, 5, 5, 6, 6, 7, 7, 9, 10, 10, 11, 14, 16, 190,\ 1,\ 1,\ 3,\ 3,\ 3,\ 4,\ 5,\ 5,\ 6,\ 6,\ 7,\ 7,\ 9,\ 10,\ 10,\ 11,\ 14,\ 16,\ 19. 1. Calculer la moyenne et l'écart-type de la série brute. 2. Regrouper en classes [0,5[[0,5[, [5,10[[5,10[, [10,15[[10,15[, [15,20[[15,20[ et estimer moyenne et écart-type par les centres ; comparer. 3. Quelle proportion des appels dure entre xˉσ\bar x-\sigma et xˉ+σ\bar x+\sigma ? 4. Un manuel affirme : « environ 68%68\,\% des valeurs d'une série sont dans [xˉσ,xˉ+σ][\bar x-\sigma,\bar x+\sigma] ». Que penser de cette phrase ? Donner une série de 2020 valeurs où la proportion vaut 100%100\,\%.

Indices (3)

La série est choisie pour que xˉ\bar x et VV soient entiers : les écarts vont de 7-7 à 1212.

Par les centres : ci=2,5c_i=2{,}5 ; 7,57{,}5 ; 12,512{,}5 ; 17,517{,}5, effectifs 7, 7, 4, 27,\ 7,\ 4,\ 2.

Compter les valeurs dans [2,12][2,12]. Pour le 100%100\,\%, penser à une série qui ne prend que deux valeurs.

Correction détaillée
Ce qu'il faut voir

Le « 68%68\,\% » appartient à la loi normale, pas aux séries. C'est une propriété de la courbe en cloche (proba_coeur, loi normale) — et beaucoup de séries réelles, surtout à peu près symétriques et à effectif raisonnable, s'en approchent. Mais une série n'a aucune obligation : celle-ci en met 70%70\,\% dans [xˉσ,xˉ+σ][\bar x-\sigma,\bar x+\sigma], une série à deux valeurs en met 100%100\,\%, et l'on peut en construire à 50%50\,\%. Ce que toute série garantit est bien plus faible et se démontre (approfondissement C2). L'exercice fait aussi mesurer ce que coûte un regroupement en classes : les résumés estimés par les centres s'écartent des vrais.

Rappel de cours

Série groupée : xˉ1nnici\bar x\approx\dfrac1n\sum n_ic_i et V1nni(cixˉ)2V\approx\dfrac1n\sum n_i(c_i-\bar x)^2 avec cic_i les centres — des estimations, qui dépendent du découpage.

Loi normale N(μ,σ)\mathcal N(\mu,\sigma) : P(μσXμ+σ)0,68P(\mu-\sigma\leq X\leq\mu+\sigma)\approx0{,}68. C'est une propriété de cette loi. Pour une série quelconque, seule l'inégalité de Tchebychev s'applique : au moins 11k21-\tfrac1{k^2} des valeurs dans [xˉkσ,xˉ+kσ][\bar x-k\sigma,\bar x+k\sigma] — ce qui ne dit rien pour k=1k=1.

Étape 1 — la série brute

Somme : 0+1+1+3+3+3+4+5+5+6+6+7+7+9+10+10+11+14+16+19=1400+1+1+3+3+3+4+5+5+6+6+7+7+9+10+10+11+14+16+19=140, donc xˉ=14020=7\bar x=\dfrac{140}{20}=7 min.

Écarts à 77 : 7,6,6,4,4,4,3,2,2,1,1,0,0,2,3,3,4,7,9,12-7,-6,-6,-4,-4,-4,-3,-2,-2,-1,-1,0,0,2,3,3,4,7,9,12 (somme 00 ✓). Carrés : 49+36+36+16+16+16+9+4+4+1+1+0+0+4+9+9+16+49+81+144=50049+36+36+16+16+16+9+4+4+1+1+0+0+4+9+9+16+49+81+144=500.

V=50020=25,σ=5 min.V=\frac{500}{20}=25,\qquad\sigma=5\ \text{min}.
xˉ=7σ=5\boxed{\bar x=7\qquad\sigma=5}

Étape 2 — par les centres
classe [0,5[[0,5[ [5,10[[5,10[ [10,15[[10,15[ [15,20[[15,20[
effectif 77 77 44 22
centre 2,52{,}5 7,57{,}5 12,512{,}5 17,517{,}5
xˉc=7×2,5+7×7,5+4×12,5+2×17,520=17,5+52,5+50+3520=15520=7,75.\bar x_c=\frac{7\times2{,}5+7\times7{,}5+4\times12{,}5+2\times17{,}5}{20}=\frac{17{,}5+52{,}5+50+35}{20}=\frac{155}{20}=7{,}75.

Écarts des centres à 7,757{,}75 : 5,25-5{,}25 ; 0,25-0{,}25 ; 4,754{,}75 ; 9,759{,}75. Carrés pondérés : 7×27,5625+7×0,0625+4×22,5625+2×95,0625=192,9375+0,4375+90,25+190,125=473,757\times27{,}5625+7\times0{,}0625+4\times22{,}5625+2\times95{,}0625=192{,}9375+0{,}4375+90{,}25+190{,}125=473{,}75.

Vc=473,7520=23,687523,69,σc4,87.V_c=\frac{473{,}75}{20}=23{,}6875\approx23{,}69,\qquad\sigma_c\approx4{,}87.
xˉc=7,75σc4,87\boxed{\bar x_c=7{,}75\qquad\sigma_c\approx4{,}87}

Comparaison. Vraie moyenne 77, estimée 7,757{,}75 ; vrai écart-type 55, estimé 4,874{,}87. L'écart vient du fait que dans [0,5[[0,5[ les appels sont concentrés vers le bas (0,1,1,3,3,3,40,1,1,3,3,3,4, de moyenne 1572,1\tfrac{15}7\approx2{,}1 et non 2,52{,}5) : le centre d'une classe n'est la moyenne de ses valeurs que si elles y sont réparties uniformément.

Étape 3 — la proportion dans [x̄ − σ, x̄ + σ]

[xˉσ,xˉ+σ]=[2,12][\bar x-\sigma,\bar x+\sigma]=[2,12]. Les valeurs de la série dans cet intervalle : 3,3,3,4,5,5,6,6,7,7,9,10,10,113,3,3,4,5,5,6,6,7,7,9,10,10,11, soit 1414 appels sur 2020.

1420=70%\boxed{\frac{14}{20}=70\,\%}

Restent 66 appels dehors : 0,1,10,1,1 en dessous, 14,16,1914,16,19 au-dessus. Proche de 68%68\,\% ? Oui — mais c'est une coïncidence de cette série, pas une loi.

Étape 4 — le manuel a tort (en général)

La phrase est vraie pour une loi normale, et approximativement vraie pour des séries qui lui ressemblent. Elle est fausse comme énoncé général : la proportion dans [xˉσ,xˉ+σ][\bar x-\sigma,\bar x+\sigma] peut prendre à peu près n'importe quelle valeur entre 00 (exclu) et 100%100\,\%.

Un exemple à 100%100\,\%. La série de 2020 valeurs formée de dix 22 et dix 88 : xˉ=5\bar x=5, écarts ±3\pm3, V=9V=9, σ=3\sigma=3, et [xˉσ,xˉ+σ]=[2,8][\bar x-\sigma,\bar x+\sigma]=[2,8] contient toutes les valeurs.

Et à 50%50\,\% ? Quatre valeurs 0,0,10,100,0,10,10 et seize valeurs 55 : xˉ=5\bar x=5, V=4×2520=5V=\dfrac{4\times25}{20}=5, σ2,24\sigma\approx2{,}24, l'intervalle [2,76,7,24][2{,}76,7{,}24] contient les seize 55 (80%80\,\%) — plus haut cette fois. Pour descendre bas, il faut beaucoup de valeurs à la limite : ce que garantit toute série, c'est seulement qu'au plus 1k2\tfrac1{k^2} des valeurs sont à plus de kσk\sigma — pour k=2k=2, au moins 75%75\,\% dans [xˉ2σ,xˉ+2σ][\bar x-2\sigma,\bar x+2\sigma] (ici [3,17][-3,17] : 1919 appels sur 2020, 95%95\,\% ✓).

L'erreur classique

⚠️ Appliquer le 68%68\,\% à une série quelconque, ou pire, en déduire une proportion sans compter. La proportion se compte dans les données ; le 68%68\,\% est une propriété de la loi normale qu'on invoque quand on a des raisons de modéliser la série par cette loi.

⚠️ Croire que les centres donnent la « vraie » moyenne. 7,757{,}75 contre 77 : dix pour cent d'écart, parce qu'une classe est mal centrée. Sur une série groupée, écrire \approx, et dire pourquoi.

À retenir

Une proportion dans [xˉ±σ][\bar x\pm\sigma] se compte, elle ne se récite pas. 68%68\,\% est le chiffre de la cloche ; les séries font ce qu'elles veulent, de 100%100\,\% à bien moins.

Un regroupement en classes coûte de la précision : moyenne et écart-type par les centres sont des estimations, d'autant plus fausses que les classes sont larges ou mal centrées.

Réponse. Brute : xˉ=7\bar x=7, σ=5\sigma=5 ; par les centres : xˉc=7,75\bar x_c=7{,}75, σc4,87\sigma_c\approx4{,}87 (estimations) ; 14/20=70%14/20=70\,\% des appels dans [2,12][2,12] ; le « 68%68\,\% » est une propriété de la loi normale, pas des séries — dix 22 et dix 88 donnent 100%100\,\% dans [2,8][2,8]. (Recoupement : somme des écarts 00, \sum carrés 500500 ✓)
Faire cet exercice dans l'app →

Relevé de production : le problème complet

ApplicationDifficulté 3/5

Un contrôle qualité relève le nombre de pièces défectueuses dans chacun de 2020 lots : deux lots à 00, cinq à 11, six à 22, quatre à 33, deux à 44 et un à 66. 1. Dresser le tableau (effectifs, fréquences, fréquences cumulées). 2. Calculer la moyenne, la médiane, le mode, Q1Q_1 et Q3Q_3. 3. Calculer la variance (par Koenig-Huygens) et l'écart-type. 4. Donner les cinq nombres de la boîte à moustaches ; le lot à 66 défauts est-il une valeur isolée au sens de la variante 1,5IQR1{,}5\,\mathrm{IQR} ? 5. Rédiger trois phrases d'interprétation pour le responsable de production.

Indices (3)

n=20n=20 : chaque lot pèse 5%5\,\% ; la médiane est la demi-somme des 10e10^{\text{e}} et 11e11^{\text{e}} valeurs.

Koenig : V=x2xˉ2V=\overline{x^2}-\bar x^{\,2} avec x2=120nixi2\overline{x^2}=\tfrac1{20}\sum n_ix_i^2.

Borne haute =Q3+1,5×(Q3Q1)=Q_3+1{,}5\times(Q_3-Q_1) ; comparer à 66.

Correction détaillée
Ce qu'il faut voir

Un problème complet, c'est le tableau puis chaque famille de résumés dans l'ordre : position, dispersion, graphique, interprétation. Rien de nouveau par rapport aux lots A et B — mais tout ensemble, et sur des données discrètes avec répétitions, ce qui est la situation d'un relevé qualité. Le piège n'est pas dans les calculs : il est dans la dernière question, où il faut transformer 2,152{,}15 et 1,421{,}42 en phrases qu'un responsable de production peut utiliser.

Rappel de cours

Tableau : nin_i, fi=ninf_i=\tfrac{n_i}n, FF cumulée. Moyenne xˉ=1nnixi\bar x=\tfrac1n\sum n_ix_i. Médiane : nn pair \Rightarrow demi-somme des deux valeurs centrales. Q1Q_1, Q3Q_3 : plus petites valeurs telles que F14F\geq\tfrac14, F34F\geq\tfrac34.

Koenig : V=x2xˉ2V=\overline{x^2}-\bar x^{\,2}. Boîte : min,Q1,Me,Q3,max\min,Q_1,\mathrm{Me},Q_3,\max ; variante : valeur isolée si >Q3+1,5IQR>Q_3+1{,}5\,\mathrm{IQR} ou <Q11,5IQR<Q_1-1{,}5\,\mathrm{IQR}.

Étape 1 — le tableau
défauts xix_i 00 11 22 33 44 66
effectif nin_i 22 55 66 44 22 11
fréquence (%\%) 1010 2525 3030 2020 1010 55
cumulée (%\%) 1010 3535 6565 8585 9595 100100

Effectif total 2+5+6+4+2+1=202+5+6+4+2+1=20 ✓, fréquences 100%100\,\% ✓.

Étape 2 — position

Moyenne : nixi=0+5+12+12+8+6=43\sum n_ix_i=0+5+12+12+8+6=43, donc xˉ=4320=2,15\bar x=\dfrac{43}{20}=2{,}15 défauts par lot.

Médiane : n=20n=20, demi-somme des 10e10^{\text{e}} et 11e11^{\text{e}} valeurs rangées. Effectifs cumulés 2,7,132,7,13 : les rangs 88 à 1313 portent la valeur 22, donc x(10)=x(11)=2x_{(10)}=x_{(11)}=2 et Me=2\mathrm{Me}=2.

Mode : 22 (effectif 66).

Quartiles : F(0)=10%<25%F(1)=35%F(0)=10\,\%<25\,\%\leq F(1)=35\,\%, donc Q1=1Q_1=1 ; F(2)=65%<75%F(3)=85%F(2)=65\,\%<75\,\%\leq F(3)=85\,\%, donc Q3=3Q_3=3.

xˉ=2,15Me=2mode 2Q1=1Q3=3\boxed{\bar x=2{,}15\qquad\mathrm{Me}=2\qquad\text{mode }2\qquad Q_1=1\qquad Q_3=3}

Étape 3 — dispersion

nixi2=0+5×1+6×4+4×9+2×16+1×36=5+24+36+32+36=133\sum n_ix_i^2=0+5\times1+6\times4+4\times9+2\times16+1\times36=5+24+36+32+36=133, donc x2=13320=6,65\overline{x^2}=\dfrac{133}{20}=6{,}65.

V=6,652,152=6,654,6225=2,0275,σ=2,02751,42.V=6{,}65-2{,}15^2=6{,}65-4{,}6225=2{,}0275,\qquad\sigma=\sqrt{2{,}0275}\approx1{,}42.
V=2,0275σ1,42\boxed{V=2{,}0275\qquad\sigma\approx1{,}42}

Étendue : 60=66-0=6 ; écart interquartile : 31=23-1=2. L'écart-type (1,421{,}42) et l'IQR (22) disent la même chose : les lots s'écartent typiquement d'un ou deux défauts de la valeur centrale.

Étape 4 — la boîte, et le lot à 6

Les cinq nombres : min=0\min=0, Q1=1Q_1=1, Me=2\mathrm{Me}=2, Q3=3Q_3=3, max=6\max=6. La boîte va de 11 à 33, coupée en 22 — parfaitement symétrique — avec une moustache courte à gauche (00) et longue à droite (66).

Variante 1,5IQR1{,}5\,\mathrm{IQR} : borne haute Q3+1,5×2=3+3=6Q_3+1{,}5\times2=3+3=6. Le lot à 66 défauts est exactement sur la borne, donc pas isolé au sens strict (>6>6) — il reste au bout de la moustache. C'est un cas limite : un lot à 77 aurait été marqué comme isolé. À la production, on le signale de toute façon : c'est le seul lot au-delà de 44.

0, 1, 2, 3, 6 ; le 6 n’est pas isoleˊ (borne =6)\boxed{0,\ 1,\ 2,\ 3,\ 6\ ;\ \text{le }6\text{ n'est pas isolé (borne }=6)}

Étape 5 — trois phrases pour le responsable
  1. Niveau : « Un lot présente en moyenne 2,152{,}15 défauts, et la moitié des lots en ont au plus 22. » (position — moyenne et médiane concordent, la série est à peu près symétrique.)
  2. Régularité : « La moitié centrale des lots se situe entre 11 et 33 défauts ; l'écart-type est de 1,41{,}4 défaut. » (dispersion — IQR et σ\sigma.)
  3. Alerte : « 35%35\,\% des lots ont au plus un défaut ; un lot sur vingt en a 66, très au-dessus des autres — à examiner à part. » (lecture des cumulées et du maximum.)

Chaque phrase porte un nombre et ce qu'il veut dire ; aucune ne se contente d'un résultat nu.

L'erreur classique

⚠️ Calculer la moyenne des valeurs distinctes 0+1+2+3+4+662,67\tfrac{0+1+2+3+4+6}6\approx2{,}67 en oubliant les effectifs : les six valeurs n'ont pas le même poids. Même piège pour la médiane, qui se lit sur les cumulées.

⚠️ Oublier de convertir 6,654,62256{,}65-4{,}6225 en une interprétation. Une variance de 2,02752{,}0275 « défauts au carré » ne parle à personne ; c'est σ1,4\sigma\approx1{,}4 défaut, en unité de la série, qui se lit.

À retenir

L'ordre d'un problème complet : tableau, position, dispersion, boîte, phrases. Et le contrôle à chaque étape — effectifs qui totalisent nn, fréquences qui totalisent 100%100\,\%, Q1MeQ3Q_1\leq\mathrm{Me}\leq Q_3.

Une interprétation, c'est un nombre suivi de sa signification pour la personne qui lit. « σ1,42\sigma\approx1{,}42 » n'est pas une réponse ; « les lots s'écartent typiquement d'un défaut et demi de la moyenne » en est une.

Réponse. xˉ=2,15\bar x=2{,}15, Me=2\mathrm{Me}=2, mode 22, Q1=1Q_1=1, Q3=3Q_3=3 ; x2=6,65\overline{x^2}=6{,}65, V=2,0275V=2{,}0275, σ1,42\sigma\approx1{,}42 ; boîte 0,1,2,3,60,1,2,3,6, borne haute 3+3=63+3=6 : le lot à 66 n'est pas isolé (cas limite) ; 35%35\,\% des lots ont au plus un défaut. (Recoupement : effectifs 2020, fréquences 100%100\,\% ✓)
Faire cet exercice dans l'app →

Coefficient de variation : comparer deux machines

ApplicationDifficulté 3/5

La machine A remplit des sachets ; masses relevées (g) : 485, 485, 495, 495, 500, 500, 505, 505, 515, 515485,\ 485,\ 495,\ 495,\ 500,\ 500,\ 505,\ 505,\ 515,\ 515. La machine B découpe des tiges ; longueurs relevées (mm) : 18,5, 18,5, 19,5, 19,5, 20, 20, 20,5, 20,5, 21,5, 21,518{,}5,\ 18{,}5,\ 19{,}5,\ 19{,}5,\ 20,\ 20,\ 20{,}5,\ 20{,}5,\ 21{,}5,\ 21{,}5. 1. Calculer la moyenne et l'écart-type de chaque série. 2. Peut-on dire que B est plus régulière que A parce que 1<101<10 ? 3. Calculer les deux coefficients de variation et conclure. 4. Un client tolère un écart de ±2%\pm2\,\% autour de la valeur nominale (500500 g, 2020 mm) : quelle proportion de pièces est conforme pour chaque machine ?

Indices (3)

Les écarts à la moyenne sont symétriques (±15,±5,0\pm15,\pm5,0 pour A ; ±1,5,±0,5,0\pm1{,}5,\pm0{,}5,0 pour B) : la variance se calcule de tête.

Un écart-type a une unité ; comparer des grammes et des millimètres n'a pas de sens.

CV=σ/xˉ\mathrm{CV}=\sigma/\bar x ; ±2%\pm2\,\% de 500500 g, c'est ±10\pm10 g ; ±2%\pm2\,\% de 2020 mm, c'est ±0,4\pm0{,}4 mm.

Correction détaillée
Ce qu'il faut voir

Un écart-type ne se compare qu'à sa propre moyenne. 1010 g de dispersion sur des sachets de 500500 g, c'est peu ; 11 mm sur des tiges de 2020 mm, c'est cinq fois plus en proportion. Le coefficient de variation σxˉ\dfrac\sigma{\bar x} divise la dispersion par la position et efface l'unité : c'est lui qui répond à « quelle machine est la plus régulière ? » quand les deux ne mesurent pas la même chose. Et la tolérance du client, exprimée en pourcentage, dit la même chose autrement.

Rappel de cours

Coefficient de variation : CV=σxˉ\mathrm{CV}=\dfrac{\sigma}{\bar x} (sans unité, souvent en %\%), pour des séries de valeurs positives. Il mesure la dispersion relative à la moyenne et permet de comparer des séries d'unités ou d'échelles différentes.

Un CV de 2%2\,\% signifie : l'écart-type vaut 2%2\,\% de la moyenne.

Étape 1 — les résumés de chaque machine

Machine A. Somme 50005\,000, xˉA=500\bar x_A=500 g. Écarts à 500500 : 15,15,5,5,0,0,5,5,15,15-15,-15,-5,-5,0,0,5,5,15,15 ; carrés 225,225,25,25,0,0,25,25,225,225225,225,25,25,0,0,25,25,225,225, somme 10001\,000 ; VA=100010=100V_A=\dfrac{1000}{10}=100, σA=10\sigma_A=10 g.

Machine B. Somme 200200, xˉB=20\bar x_B=20 mm. Écarts : 1,5,1,5,0,5,0,5,0,0,0,5,0,5,1,5,1,5-1{,}5,-1{,}5,-0{,}5,-0{,}5,0,0,0{,}5,0{,}5,1{,}5,1{,}5 ; carrés 2,252{,}25 (quatre fois) et 0,250{,}25 (quatre fois), somme 9+1=109+1=10 ; VB=1010=1V_B=\dfrac{10}{10}=1, σB=1\sigma_B=1 mm.

xˉA=500 g, σA=10 gxˉB=20 mm, σB=1 mm\boxed{\bar x_A=500\ \text{g},\ \sigma_A=10\ \text{g}\qquad\bar x_B=20\ \text{mm},\ \sigma_B=1\ \text{mm}}

Étape 2 — pourquoi « 1 < 10 » ne dit rien

σA=10\sigma_A=10 grammes et σB=1\sigma_B=1 millimètre : deux unités, aucune comparaison possible. Pire, même unité ne suffirait pas : 1010 g d'écart-type sur des sachets de 500500 g n'est pas la même performance que 1010 g sur des sachets de 5050 g. Ce qui compte est la dispersion rapportée à la grandeur mesurée.

Étape 3 — les coefficients de variation
CVA=10500=0,02=2%,CVB=120=0,05=5%.\mathrm{CV}_A=\frac{10}{500}=0{,}02=2\,\%,\qquad\mathrm{CV}_B=\frac{1}{20}=0{,}05=5\,\%.
CVA=2%CVB=5%\boxed{\mathrm{CV}_A=2\,\%\qquad\mathrm{CV}_B=5\,\%}

Conclusion : la machine A est plus régulière, relativement à ce qu'elle produit — ses sachets s'écartent typiquement de 2%2\,\% de la masse visée, les tiges de B de 5%5\,\% de la longueur visée. C'est l'inverse de ce que suggérait « 1<101<10 ».

Étape 4 — la tolérance du client

±2%\pm2\,\% de 500500 g, c'est ±10\pm10 g : conformes les masses dans [490,510][490,510], soit 495,495,500,500,505,505495,495,500,500,505,50566 sachets sur 1010 (60%60\,\%).

±2%\pm2\,\% de 2020 mm, c'est ±0,4\pm0{,}4 mm : conformes les longueurs dans [19,6;20,4][19{,}6\,;\,20{,}4], soit les deux 202022 tiges sur 1010 (20%20\,\%).

A : 60% conformesB : 20%\boxed{\text{A : }60\,\%\text{ conformes}\qquad\text{B : }20\,\%}

La tolérance relative du client raconte la même histoire que le CV : à ±2%\pm2\,\%, A passe trois fois plus souvent que B. Le CV de 2%2\,\% de A veut d'ailleurs dire que la tolérance du client est égale à un écart-type — d'où environ la moitié des pièces dedans ; pour B, la tolérance vaut 0,4σ0{,}4\sigma, bien plus étroite.

L'erreur classique

⚠️ Comparer des écarts-types d'unités différentes, ou de moyennes très différentes. Le réflexe « le plus petit σ\sigma est le plus régulier » n'est valable qu'à même unité et même ordre de grandeur.

⚠️ Employer le CV sur une série dont la moyenne est proche de 00 (des températures autour de 00 °C, des écarts signés) : diviser par une moyenne presque nulle donne un CV énorme et sans signification. Le CV est fait pour des grandeurs positives à moyenne nette.

À retenir

CV=σ/xˉ\mathrm{CV}=\sigma/\bar x : la dispersion en pourcentage de la moyenne. C'est le seul indicateur qui compare des séries d'unités différentes.

Une tolérance en %\% se compare directement au CV : tolérance == CV veut dire « environ un écart-type de chaque côté ».

Réponse. A : xˉ=500\bar x=500 g, σ=10\sigma=10 g ; B : xˉ=20\bar x=20 mm, σ=1\sigma=1 mm ; 1<101<10 ne compare rien (unités et échelles différentes) ; CVA=2%<CVB=5%\mathrm{CV}_A=2\,\%<\mathrm{CV}_B=5\,\% : A est plus régulière ; tolérance ±2%\pm2\,\% : 6/106/10 sachets conformes contre 2/102/10 tiges. (Recoupement : \sum carrés 10001\,000 et 1010 ✓)
Faire cet exercice dans l'app →

La moyenne des moyennes est une moyenne pondérée

CalculDifficulté 3/5

On reprend les deux ateliers de A6 : l'atelier A a produit en moyenne 4747 pièces par jour sur 1010 jours, l'atelier B 4242 pièces par jour sur 1515 jours. 1. Un stagiaire calcule la production moyenne journalière de l'usine : 47+422=44,5\dfrac{47+42}{2}=44{,}5. Pourquoi est-ce faux ? 2. Calculer la vraie moyenne, puis la retrouver à partir des 2525 valeurs. 3. Dans quel cas la moyenne simple des moyennes serait-elle juste ? 4. La médiane de l'atelier A est 45,545{,}5 et celle de B est 4242. Peut-on en déduire la médiane des 2525 jours ?

Indices (3)

La moyenne est un total divisé par un effectif : reconstituer les deux totaux.

xˉ=nAxˉA+nBxˉBnA+nB\bar x=\dfrac{n_A\bar x_A+n_B\bar x_B}{n_A+n_B}.

Pour la médiane, il faut ranger les 2525 valeurs : aucune formule ne combine deux médianes.

Correction détaillée
Ce qu'il faut voir

Une moyenne est un total divisé par un effectif — et deux totaux s'additionnent, pas deux moyennes. L'atelier B a travaillé plus de jours : ses 4242 pièces pèsent 1515 fois, les 4747 de A seulement 1010 fois. La moyenne de l'usine est donc plus proche de 4242 que de 4747, et le stagiaire, qui donne le même poids aux deux, la surestime. C'est la moyenne pondérée du lot A, retrouvée à l'échelle des groupes — et c'est aussi la porte d'entrée du paradoxe de Simpson (approfondissement D5).

Rappel de cours

Si une population est réunion de groupes d'effectifs njn_j et de moyennes xˉj\bar x_j :

xˉ=jnjxˉjjnj.\bar x=\frac{\sum_j n_j\,\bar x_j}{\sum_j n_j}.
La moyenne simple 1Jxˉj\tfrac1J\sum\bar x_j n'est correcte que si tous les njn_j sont égaux.

Il n'existe aucune formule analogue pour la médiane : la médiane d'une réunion ne se déduit pas des médianes des parties.

Étape 1 — pourquoi 44,5 est faux

44,544{,}5 serait la moyenne si l'usine avait produit autant de jours dans chaque atelier. Ici A totalise 10×47=47010\times47=470 pièces et B 15×42=63015\times42=630 pièces : 11001\,100 pièces en 2525 jours. Le stagiaire a calculé la moyenne de deux nombres, pas la moyenne de 2525 journées de production.

Étape 2 — la vraie moyenne, deux fois

Par les totaux :

xˉ=10×47+15×4210+15=470+63025=110025=44 pieˋces par jour.\bar x=\frac{10\times47+15\times42}{10+15}=\frac{470+630}{25}=\frac{1\,100}{25}=44\ \text{pièces par jour}.

Par les 2525 valeurs (celles de A6) : atelier A 40+42+44+45+45+46+48+50+52+58=47040+42+44+45+45+46+48+50+52+58=470, atelier B 30+33+38+38+39+39+41+42+42+43+45+48+49+51+52=63030+33+38+38+39+39+41+42+42+43+45+48+49+51+52=630, total 11001\,100, moyenne 4444 ✓.

xˉ=44  (44,5)\boxed{\bar x=44\ \ (\neq44{,}5)}

La vraie moyenne est plus proche de 4242 que de 4747, comme prévu : B a plus de poids.

Étape 3 — quand la moyenne simple est juste

Avec nA=nB=nn_A=n_B=n : xˉ=nxˉA+nxˉB2n=xˉA+xˉB2\bar x=\dfrac{n\bar x_A+n\bar x_B}{2n}=\dfrac{\bar x_A+\bar x_B}2. La moyenne simple des moyennes est juste si et seulement si les effectifs sont égaux (ou, plus généralement, si les moyennes sont égales — auquel cas le résultat est le même de toute façon). Dès que les effectifs diffèrent, l'écart vaut

xˉA+xˉB2xˉ=(nBnA)(xˉAxˉB)2(nA+nB)=5×550=0,5,\frac{\bar x_A+\bar x_B}2-\bar x=\frac{(n_B-n_A)(\bar x_A-\bar x_B)}{2(n_A+n_B)}=\frac{5\times5}{50}=0{,}5,
ce qui est bien la différence 44,54444{,}5-44.

Étape 4 — la médiane ne se combine pas

Non. Une médiane est un rang, et ranger les 2525 valeurs ensemble mélange les deux séries : la 13e13^{\text{e}} valeur globale n'a aucune raison de se déduire des 5e5^{\text{e}}-6e6^{\text{e}} de A et de la 8e8^{\text{e}} de B. Il faut ranger : 30,33,38,38,39,39,40,41,42,42,42,43,44,45,45,45,46,48,48,49,50,51,52,52,5830,33,38,38,39,39,40,41,42,42,42,43,\mathbf{44},45,45,45,46,48,48,49,50,51,52,52,58 ; la 13e13^{\text{e}} vaut 4444.

Meusine=44, obtenue en rangeant, pas en combinant\boxed{\mathrm{Me}_{\text{usine}}=44,\ \text{obtenue en rangeant, pas en combinant}}

Ici elle coïncide avec la moyenne — coïncidence, la réunion étant à peu près symétrique. Ni 45,5+422=43,75\tfrac{45{,}5+42}2=43{,}75 ni une pondération n'auraient donné 4444 autrement que par hasard.

L'erreur classique

⚠️ Moyenner des pourcentages, des moyennes, des taux sans leurs effectifs. « 80%80\,\% de réussite dans un groupe, 45%45\,\% dans l'autre, donc 62,5%62{,}5\,\% en tout » est faux dès que les groupes n'ont pas la même taille — et cette erreur, retournée, fabrique le paradoxe de Simpson.

⚠️ Pondérer la médiane comme la moyenne. Une médiane pondérée « 10×45,5+15×4225=43,4\tfrac{10\times45{,}5+15\times42}{25}=43{,}4 » n'a aucun sens : la médiane n'est pas une somme.

À retenir

Pour combiner des moyennes : revenir aux totaux. xˉ=njxˉjnj\bar x=\dfrac{\sum n_j\bar x_j}{\sum n_j} — la moyenne simple n'est juste qu'à effectifs égaux.

La médiane ne se combine jamais : ranger l'ensemble, ou renoncer.

Réponse. 44,544{,}5 suppose des effectifs égaux ; vraie moyenne 470+63025=44\tfrac{470+630}{25}=44 (retrouvée sur les 2525 valeurs) ; moyenne simple juste si et seulement si nA=nBn_A=n_B (écart (nBnA)(xˉAxˉB)2(nA+nB)=0,5\tfrac{(n_B-n_A)(\bar x_A-\bar x_B)}{2(n_A+n_B)}=0{,}5) ; la médiane des 2525 jours se lit en rangeant : 4444. (Recoupement : 1100/25=441\,100/25=44 ✓)
Faire cet exercice dans l'app →

Quel graphique pour quelle variable ? Et un histogramme à corriger

ApplicationDifficulté 3/5

1. Pour chaque situation, choisir la représentation adaptée et dire pourquoi : (a) la répartition de 200200 étudiants entre quatre filières ; (b) le nombre d'enfants par foyer dans un lotissement ; (c) la durée de vie de 500500 ampoules ; (d) la comparaison des notes de quatre classes à un même devoir. 2. Un rapport présente les âges de 6060 clients par un histogramme dont les rectangles ont pour hauteurs les effectifs : [0,10[[0,10[ : 2020 ; [10,30[[10,30[ : 3030 ; [30,40[[30,40[ : 1010. Pourquoi est-il faux ? Calculer les hauteurs correctes et dire quelle classe est en réalité la plus dense.

Indices (3)

Qualitatif → secteurs ou bâtons ; discret → bâtons ; continu → histogramme ; plusieurs séries → boîtes.

Les classes [10,30[[10,30[ est deux fois plus large que les autres : sa hauteur doit être divisée par 22.

Hauteur == effectif par unité de largeur (ou fréquence par unité).

Correction détaillée
Ce qu'il faut voir

Le graphique dépend de la nature du caractère, et un mauvais graphique fait dire aux données ce qu'elles ne disent pas. Un caractère qualitatif n'a pas d'ordre : des parts de disque ou des barres séparées. Un caractère discret a des valeurs isolées : des bâtons, séparés eux aussi. Un caractère continu regroupé en classes se dessine par des rectangles accolés dont l'aire porte l'effectif — et c'est là que le rapport de la question 2 se trompe, en donnant à une classe deux fois plus large une hauteur qu'elle n'a pas.

Rappel de cours
caractère graphique
qualitatif secteurs (parts de 100%100\,\%) ou bâtons
quantitatif discret diagramme en bâtons (une barre par valeur, séparées)
quantitatif continu (classes) histogramme (rectangles accolés, aire \propto effectif)
plusieurs séries à comparer boîtes à moustaches alignées
lecture de médiane et quartiles polygone des fréquences cumulées

Histogramme à classes inégales : hauteur =nibiai=\dfrac{n_i}{b_i-a_i} (effectif par unité) ou fibiai\dfrac{f_i}{b_i-a_i} (densité de fréquence).

Étape 1 — les quatre situations

(a) Filières : caractère qualitatif à quatre modalités. Un diagramme en secteurs montre les parts de chaque filière dans les 200200 ; un diagramme en bâtons convient aussi. Un histogramme n'aurait aucun sens : il n'y a ni ordre ni largeur.

(b) Enfants par foyer : discret (0,1,2,3,0,1,2,3,\dots). Diagramme en bâtons, une barre par valeur, séparées — les valeurs intermédiaires (1,51{,}5 enfant) n'existent pas, les barres ne doivent pas se toucher.

(c) Durée de vie : continu, 500500 valeurs à regrouper en classes. Histogramme, rectangles accolés, aire proportionnelle à l'effectif ; et le polygone des fréquences cumulées si l'on veut lire une médiane.

(d) Quatre classes, un devoir : quatre séries du même caractère à comparer. Boîtes à moustaches alignées sur le même axe — position, dispersion et asymétrie de chacune d'un seul coup d'œil. Quatre histogrammes superposés seraient illisibles.

Étape 2 — le rapport trompeur

Les classes ont des largeurs 1010, 2020 et 1010. Tracer les effectifs en hauteur donne au rectangle de [10,30[[10,30[ une aire 30×20=60030\times20=600 contre 20×10=20020\times10=200 pour [0,10[[0,10[ : le dessin affirme que la classe du milieu pèse trois fois la première, alors que son effectif n'est que 1,51{,}5 fois plus grand. La largeur double compte deux fois.

Hauteurs correctes — effectif par unité de largeur (par année d'âge) :

classe [0,10[[0,10[ [10,30[[10,30[ [30,40[[30,40[
effectif 2020 3030 1010
largeur 1010 2020 1010
hauteur =ni/largeur=n_i/\text{largeur} 22 1,51{,}5 11
fréquence 13\tfrac13 12\tfrac12 16\tfrac16
densité =fi/largeur=f_i/\text{largeur} 1300,033\tfrac1{30}\approx0{,}033 140=0,025\tfrac1{40}=0{,}025 1600,017\tfrac1{60}\approx0{,}017
hauteurs 2 ; 1,5 ; 1  (clients par anneˊe d’aˆge)\boxed{\text{hauteurs }2\ ;\ 1{,}5\ ;\ 1\ \text{ (clients par année d'âge)}}

La classe la plus dense est [0,10[[0,10[ : 22 clients par année d'âge, contre 1,51{,}5 pour [10,30[[10,30[. Le rapport faisait croire l'inverse. Contrôle : les aires 2×10+1,5×20+1×10=20+30+10=60=n2\times10+1{,}5\times20+1\times10=20+30+10=60=n ✓.

Contrôle

Un histogramme correct vérifie toujours : somme des aires =n=n (en effectifs par unité) ou =1=1 (en densités de fréquence). Ici 130×10+140×20+160×10=13+12+16=1\tfrac1{30}\times10+\tfrac1{40}\times20+\tfrac1{60}\times10=\tfrac13+\tfrac12+\tfrac16=1 ✓. Sur le graphique du rapport, la somme des aires vaut 200+600+100=90060200+600+100=900\neq60 : il était faux avant même d'être lu.

L'erreur classique

⚠️ Un histogramme pour un caractère discret ou qualitatif. Des rectangles accolés suggèrent une continuité qui n'existe pas ; « 1,51{,}5 enfant » ou « entre BTS et BUT » n'ont pas de sens. Bâtons séparés.

⚠️ Des classes inégales tracées en hauteur == effectif. Le tableur le fait par défaut ; c'est à toi de diviser par la largeur. Le test : additionner les aires.

À retenir

Qualitatif : secteurs ou bâtons. Discret : bâtons. Continu : histogramme, aire \propto effectif. Comparaison : boîtes.

Classes inégales : hauteur == effectif // largeur. Et vérifier que les aires totalisent nn.

Réponse. (a) secteurs ou bâtons (qualitatif) ; (b) bâtons séparés (discret) ; (c) histogramme et polygone des cumulées (continu) ; (d) boîtes alignées (comparaison) ; le rapport tracé en hauteur == effectif triple visuellement [10,30[[10,30[ ; hauteurs correctes 22 ; 1,51{,}5 ; 11 clients par année, la classe la plus dense est [0,10[[0,10[. (Recoupement : aires 20+30+10=60=n20+30+10=60=n ✓)
Faire cet exercice dans l'app →

Valeurs centrées réduites : quelles notes sont hors norme ?

ApplicationDifficulté 3/5

On reprend les 2525 notes de A1 : moyenne xˉ=11,2\bar x=11{,}2, écart-type σ2,55\sigma\approx2{,}55 (calculé en B4). 1. Calculer les valeurs centrées réduites des notes 66, 1414 et 1818. 2. Déterminer les bornes xˉ2σ\bar x-2\sigma et xˉ+2σ\bar x+2\sigma ; quelles notes sont au-delà de deux écarts-types de la moyenne, et quelle proportion des étudiants représentent-elles ? 3. Quelle proportion des notes est dans [xˉσ,xˉ+σ][\bar x-\sigma,\bar x+\sigma] ? 4. L'inégalité de Tchebychev garantit qu'au moins 75%75\,\% des valeurs sont à moins de 2σ2\sigma de la moyenne. Est-ce vérifié, et de combien ?

Indices (3)

z=xxˉσz=\dfrac{x-\bar x}{\sigma} ; garder σ2,546\sigma\approx2{,}546 pour les calculs, arrondir à la fin.

Une note est hors norme (au sens 2σ2\sigma) si z>2\lvert z\rvert>2.

Compter les étudiants, pas les notes distinctes : le tableau d'effectifs de A1 sert encore.

Correction détaillée
Ce qu'il faut voir

La valeur centrée réduite répond à « cette note est-elle exceptionnelle ? » sans regarder les autres. Un 1818 dans une classe où tout le monde a 1818 n'est pas exceptionnel ; un 1818 à 2,72{,}7 écarts-types au-dessus de la moyenne l'est. Le seuil « 2σ2\sigma » est une convention courante — et l'exercice le confronte à la seule garantie universelle, l'inégalité de Tchebychev, qui dit que jamais plus d'un quart des valeurs ne peuvent être au-delà.

Rappel de cours

zi=xixˉσz_i=\dfrac{x_i-\bar x}{\sigma} : nombre d'écarts-types entre xix_i et la moyenne, signé. z=0z=0 à la moyenne, z=±1z=\pm1 à un écart-type.

Tchebychev (démontrée en approfondissement C2) : pour toute série, la proportion des valeurs telles que xixˉkσ\lvert x_i-\bar x\rvert\geq k\sigma est 1k2\leq\tfrac1{k^2}. Pour k=2k=2 : au plus 25%25\,\% au-delà, donc au moins 75%75\,\% dans [xˉ2σ,xˉ+2σ][\bar x-2\sigma,\bar x+2\sigma].

Étape 1 — trois valeurs centrées réduites

Avec σ=6,482,546\sigma=\sqrt{6{,}48}\approx2{,}546 :

z(6)=611,22,546=5,22,5462,04,z(14)=2,82,5461,10,z(18)=6,82,5462,67.z(6)=\frac{6-11{,}2}{2{,}546}=\frac{-5{,}2}{2{,}546}\approx-2{,}04,\qquad z(14)=\frac{2{,}8}{2{,}546}\approx1{,}10,\qquad z(18)=\frac{6{,}8}{2{,}546}\approx2{,}67.
z(6)2,04z(14)1,10z(18)2,67\boxed{z(6)\approx-2{,}04\qquad z(14)\approx1{,}10\qquad z(18)\approx2{,}67}

Le 1414 est un bon résultat mais ordinaire (à peine plus d'un écart-type) ; le 66 et le 1818 sont à plus de deux écarts-types, dans les deux sens.

Étape 2 — les bornes à deux écarts-types

2σ5,092\sigma\approx5{,}09 :

xˉ2σ11,25,09=6,11,xˉ+2σ11,2+5,09=16,29.\bar x-2\sigma\approx11{,}2-5{,}09=6{,}11,\qquad\bar x+2\sigma\approx11{,}2+5{,}09=16{,}29.

Les notes hors de [6,11;16,29][6{,}11\,;\,16{,}29] : le 66 (un étudiant) et le 1818 (un étudiant). Le 1616 est dedans (16<16,2916<16{,}29), de justesse.

hors norme : 6 et 18, soit 225=8%\boxed{\text{hors norme : }6\text{ et }18,\ \text{soit }\tfrac2{25}=8\,\%}

Étape 3 — à un écart-type

[xˉσ,xˉ+σ][8,65;13,75][\bar x-\sigma,\bar x+\sigma]\approx[8{,}65\,;\,13{,}75] contient les notes 9,10,11,12,139,10,11,12,13, d'effectifs 3+4+5+4+2=183+4+5+4+2=18 :

1825=72%\boxed{\frac{18}{25}=72\,\%}

Proche du 68%68\,\% de la loi normale — cette classe a une répartition « en cloche » ; B6 a montré que ce n'est pas une règle.

Étape 4 — Tchebychev, et la marge

Dans [xˉ2σ,xˉ+2σ][\bar x-2\sigma,\bar x+2\sigma] : tout le monde sauf le 66 et le 1818, soit 2323 étudiants sur 2525, 92%92\,\%. Tchebychev garantissait au moins 75%75\,\% : c'est vérifié, avec 1717 points de marge.

92%75% \boxed{92\,\%\geq75\,\%\ ✓}

Cette marge est normale : Tchebychev vaut pour toutes les séries, y compris les plus étalées, donc elle est très prudente sur une série en cloche. La borne n'est atteinte que par des séries très particulières (C2).

L'erreur classique

⚠️ Arrondir σ\sigma à 2,52{,}5 avant de calculer les zz. z(18)z(18) passerait de 2,672{,}67 à 2,722{,}72, et surtout la borne xˉ+2σ\bar x+2\sigma de 16,2916{,}29 à 16,216{,}2 : sans conséquence ici, mais une note à 16,2516{,}25 changerait de camp. Garder trois décimales sur σ\sigma, arrondir les zz à la fin.

⚠️ Lire Tchebychev comme « environ 75%75\,\% ». C'est « au moins 75%75\,\% » : une borne inférieure, souvent très largement dépassée.

À retenir

z=xxˉσz=\tfrac{x-\bar x}\sigma : au-delà de ±2\pm2, une valeur est hors norme — convention utile, à ne pas confondre avec une loi.

Tchebychev est une garantie, pas une estimation : au moins 11k21-\tfrac1{k^2} des valeurs à moins de kσk\sigma, pour n'importe quelle série. Ici 92%92\,\% contre 75%75\,\% garantis.

Réponse. z(6)2,04z(6)\approx-2{,}04, z(14)1,10z(14)\approx1{,}10, z(18)2,67z(18)\approx2{,}67 ; bornes 6,116{,}11 et 16,2916{,}29, notes hors norme 66 et 1818 (8%8\,\%) ; 72%72\,\% des notes dans [xˉ±σ][\bar x\pm\sigma] ; 92%92\,\% dans [xˉ±2σ][\bar x\pm2\sigma], contre au moins 75%75\,\% garantis par Tchebychev. (Recoupement : 2+23=252+23=25 ✓)
Faire cet exercice dans l'app →

Problème type BTS : durée de vie d'ampoules

ApplicationDifficulté 3/5

On a mesuré la durée de vie (en centaines d'heures) de 6060 ampoules : [8,10[[8,10[ : 33 ; [10,12[[10,12[ : 1616 ; [12,14[[12,14[ : 2222 ; [14,16[[14,16[ : 1616 ; [16,18[[16,18[ : 33. 1. Compléter le tableau avec les fréquences et les fréquences cumulées croissantes (en %\%, à 0,10{,}1 près). 2. Estimer la moyenne et l'écart-type par les centres des classes. 3. Par interpolation, estimer Q1Q_1, la médiane et Q3Q_3, et en déduire l'écart interquartile. 4. Quelle proportion d'ampoules dure au moins 14001\,400 heures ? Interpréter Q3Q_3 en une phrase.

Indices (3)

Cumulées en fractions de 6060 : 33, 1919, 4141, 5757, 6060.

Les centres sont 9,11,13,15,179,11,13,15,17 ; la série est symétrique autour de 1313.

Interpoler dans la classe où la cumulée franchit 25%25\,\%, 50%50\,\%, 75%75\,\%.

Correction détaillée
Ce qu'il faut voir

C'est l'exercice de BTS type : un tableau de classes, une calculatrice, et surtout des phrases à la fin. Les données sont symétriques autour de 1313 (centaines d'heures) : 3,16,22,16,33,16,22,16,3 — on doit donc trouver moyenne et médiane égales à 1313, et Q1Q_1, Q3Q_3 à égale distance de la médiane. Si les calculs ne le confirment pas, c'est qu'il y a une faute. La symétrie est ici le contrôle gratuit.

Rappel de cours

Série groupée : xˉ1nnici\bar x\approx\tfrac1n\sum n_ic_i, V1nni(cixˉ)2V\approx\tfrac1n\sum n_i(c_i-\bar x)^2. Quantile d'ordre pp par interpolation dans la classe [a,b[[a,b[FF franchit pp : a+(ba)pF(a)F(b)F(a)a+(b-a)\dfrac{p-F(a)}{F(b)-F(a)}.

Sur une série symétrique, moyenne == médiane == centre de symétrie, et Q3Me=MeQ1Q_3-\mathrm{Me}=\mathrm{Me}-Q_1.

Étape 1 — le tableau
classe [8,10[[8,10[ [10,12[[10,12[ [12,14[[12,14[ [14,16[[14,16[ [16,18[[16,18[
effectif 33 1616 2222 1616 33
fréquence (%\%) 55 26,726{,}7 36,736{,}7 26,726{,}7 55
cumulée (%\%) 55 31,731{,}7 68,368{,}3 9595 100100

En fractions exactes, les cumulées valent 360\tfrac3{60}, 1960\tfrac{19}{60}, 4160\tfrac{41}{60}, 5760\tfrac{57}{60}, 11 — c'est avec elles qu'on interpole, les pourcentages arrondis introduiraient des erreurs.

Étape 2 — moyenne et écart-type par les centres

Centres 9,11,13,15,179,11,13,15,17 :

xˉ3×9+16×11+22×13+16×15+3×1760=27+176+286+240+5160=78060=13.\bar x\approx\frac{3\times9+16\times11+22\times13+16\times15+3\times17}{60}=\frac{27+176+286+240+51}{60}=\frac{780}{60}=13.

Écarts des centres à 1313 : 4,2,0,2,4-4,-2,0,2,4 ; carrés pondérés 3×16+16×4+22×0+16×4+3×16=48+64+0+64+48=2243\times16+16\times4+22\times0+16\times4+3\times16=48+64+0+64+48=224 ;

V22460=56153,73,σ1,93.V\approx\frac{224}{60}=\frac{56}{15}\approx3{,}73,\qquad\sigma\approx1{,}93.
xˉ13 (1300 h)σ1,93 (193 h)\boxed{\bar x\approx13\ \text{(1\,300 h)}\qquad\sigma\approx1{,}93\ \text{(193 h)}}

La moyenne tombe sur le centre de symétrie, comme attendu.

Étape 3 — quartiles par interpolation

Q1Q_1 : F(10)=360=0,05<0,25F(12)=1960F(10)=\tfrac{3}{60}=0{,}05<0{,}25\leq F(12)=\tfrac{19}{60}, classe [10,12[[10,12[ :

Q110+2×0,253601960360=10+2×12601660=10+2×0,75=11,5.Q_1\approx10+2\times\frac{0{,}25-\tfrac3{60}}{\tfrac{19}{60}-\tfrac3{60}}=10+2\times\frac{\tfrac{12}{60}}{\tfrac{16}{60}}=10+2\times0{,}75=11{,}5.

Médiane : F(12)=1960<0,5F(14)=4160F(12)=\tfrac{19}{60}<0{,}5\leq F(14)=\tfrac{41}{60}, classe [12,14[[12,14[ :

Me12+2×306019602260=12+2×1122=12+1=13.\mathrm{Me}\approx12+2\times\frac{\tfrac{30}{60}-\tfrac{19}{60}}{\tfrac{22}{60}}=12+2\times\frac{11}{22}=12+1=13.

Q3Q_3 : F(14)=4160<0,75F(16)=5760F(14)=\tfrac{41}{60}<0{,}75\leq F(16)=\tfrac{57}{60}, classe [14,16[[14,16[ :

Q314+2×456041601660=14+2×416=14+0,5=14,5.Q_3\approx14+2\times\frac{\tfrac{45}{60}-\tfrac{41}{60}}{\tfrac{16}{60}}=14+2\times\frac4{16}=14+0{,}5=14{,}5.
Q111,5Me13Q314,5IQR3\boxed{Q_1\approx11{,}5\qquad\mathrm{Me}\approx13\qquad Q_3\approx14{,}5\qquad\mathrm{IQR}\approx3}

Symétrie confirmée : 1311,5=14,513=1,513-11{,}5=14{,}5-13=1{,}5 ✓.

Étape 4 — interprétation

Au moins 14001\,400 heures : les classes [14,16[[14,16[ et [16,18[[16,18[, soit 16+3=1916+3=19 ampoules sur 6060 :

196031,7%.\frac{19}{60}\approx31{,}7\,\%.
(C'est aussi 1F(14)=168,3%1-F(14)=1-68{,}3\,\%.)

Q314,5Q_3\approx14{,}5 : « environ trois quarts des ampoules durent moins de 14501\,450 heures » — ou, dit dans l'autre sens, « un quart des ampoules dépasse 14501\,450 heures ». Et avec Q1Q_1 : « la moitié centrale des ampoules dure entre 11501\,150 et 14501\,450 heures ».

31,7% durent au moins 1400 h ; 75% durent moins de 1450 h\boxed{31{,}7\,\%\ \text{durent au moins }1\,400\ \text{h}\ ;\ 75\,\%\ \text{durent moins de }1\,450\ \text{h}}

L'erreur classique

⚠️ Interpoler avec les pourcentages arrondis (31,731{,}7, 68,368{,}3) au lieu des fractions exactes : la médiane sort à 13,0013{,}00… par chance, mais Q1Q_1 et Q3Q_3 dérivent au centième. Les fractions de 6060 ne coûtent rien.

⚠️ Écrire « σ1,93\sigma\approx1{,}93 » sans unité. Les données sont en centaines d'heures : σ193\sigma\approx193 h, xˉ1300\bar x\approx1\,300 h. Une réponse à un responsable se donne en heures.

À retenir

Tableau, cumulées en fractions, centres, interpolation, phrases. La symétrie des effectifs est un contrôle : moyenne, médiane et milieu de la boîte doivent coïncider.

Un quartile s'interprète en « au moins x%x\,\% des … ont au plus … » — c'est la phrase que le sujet attend.

Réponse. Cumulées 55 ; 31,731{,}7 ; 68,368{,}3 ; 9595 ; 100%100\,\% (360,1960,4160,5760,1\tfrac3{60},\tfrac{19}{60},\tfrac{41}{60},\tfrac{57}{60},1) ; xˉ13\bar x\approx13, V56153,73V\approx\tfrac{56}{15}\approx3{,}73, σ1,93\sigma\approx1{,}93 (centaines d'heures) ; Q111,5Q_1\approx11{,}5, Me13\mathrm{Me}\approx13, Q314,5Q_3\approx14{,}5, IQR3\mathrm{IQR}\approx3 ; 196031,7%\tfrac{19}{60}\approx31{,}7\,\% durent au moins 14001\,400 h ; 75%75\,\% durent moins de 14501\,450 h. (Recoupement : symétrie 1311,5=14,51313-11{,}5=14{,}5-13 ✓)
Faire cet exercice dans l'app →

S'entraîner davantage sur statistique descriptive

18 exercices d'entraînement supplémentaires sur ce chapitre, plus le palier approfondissement, les quiz, le tuteur IA et les PDF à imprimer — dans l'app Maths Post-Bac.