Maths Post-Bac Ouvrir l'app

Exercices corrigés — Optimisation

Analyse · 18 exercices-types du palier socle

L2L3Maths ingénieur

Chaque exercice donne l'énoncé, des indices progressifs et la correction rédigée étape par étape. Ouvre les blocs seulement après avoir cherché.

Revoir le cours : Optimisation Définitions, méthodes et exemples corrigés du chapitre.

Minimum d'une quadratique

CalculDifficulté 3/5

Trouver et classer les extrema de f(x,y)=x2+y2−4x−6y+13f(x,y)=x^2+y^2-4x-6y+13.

Indices (3)

Points critiques : ∇f=(2x−4, 2y−6)=0⃗\nabla f=(2x-4,\,2y-6)=\vec0.

Hessienne H=(2002)H=\begin{pmatrix}2&0\\0&2\end{pmatrix} (constante).

Calculer rt−s2rt-s^2 et le signe de rr.

Correction détaillée
L'idée directrice

Chercher un extremum d'une fonction de deux variables, c'est répondre à deux questions successives, et il ne faut jamais les mélanger.

  1. Où ? — Un extremum intérieur ne peut se produire que là où la fonction est plate : le gradient s'annule. Cela donne une liste de candidats, appelés points critiques.
  2. Quoi ? — Être plat ne suffit pas : le sommet d'une colline, le fond d'une cuvette et le milieu d'une selle de cheval sont tous les trois plats. C'est la hessienne, c'est-à-dire les dérivées secondes, qui départage.

Ici la fonction est une simple quadratique, donc le calcul sera court — mais la démarche est exactement celle qu'on refera sur des exemples autrement plus coriaces.

Étape 1 — les points critiques

On dérive par rapport à chaque variable, l'autre étant tenue pour une constante :

fx=∂∂x(x2+y2−4x−6y+13)=2x−4,fy=2y−6.f_x=\frac{\partial}{\partial x}\bigl(x^2+y^2-4x-6y+13\bigr)=2x-4,\qquad f_y=2y-6.

Le gradient ∇f=(2x−4,  2y−6)\nabla f=(2x-4,\;2y-6) s'annule quand les deux composantes s'annulent :

2x−4=0 ⟹ x=2,2y−6=0 ⟹ y=3.2x-4=0\ \Longrightarrow\ x=2,\qquad 2y-6=0\ \Longrightarrow\ y=3.

Ici le système est découplé — chaque équation ne contient qu'une variable — d'où un unique point critique (2,3)(2,3). Ce confort disparaîtra dès l'exercice A4, où les deux équations seront entremêlées.

Valeur en ce point : f(2,3)=4+9−8−18+13=0f(2,3)=4+9-8-18+13=0.

Étape 2 — la nature du point

On calcule les trois dérivées secondes, traditionnellement notées r,s,tr,s,t :

r=fxx=2,s=fxy=0,t=fyy=2,r=f_{xx}=2,\qquad s=f_{xy}=0,\qquad t=f_{yy}=2,

et on forme le discriminant rt−s2=2×2−0=4rt-s^2=2\times2-0=4.

La règle, qu'il faut savoir réciter :

rt−s2rt-s^2 rr conclusion
>0>0 >0>0 minimum local
>0>0 <0<0 maximum local
<0<0 — point col (ni l'un ni l'autre)
=0=0 — test muet : il faut autre chose

Ici rt−s2=4>0rt-s^2=4>0 et r=2>0r=2>0 : (2,3)(2,3) est un minimum local.

Pourquoi cette règle marche

Ce tableau n'est pas une recette arbitraire. Au voisinage d'un point critique, ff ressemble à sa partie quadratique :

f(2+h,3+k)≈f(2,3)+12(rh2+2shk+tk2).f(2+h,3+k)\approx f(2,3)+\tfrac12\bigl(rh^2+2shk+tk^2\bigr).

La question « minimum ou pas » devient donc : cette forme quadratique en (h,k)(h,k) est-elle toujours positive ? Or rt−s2rt-s^2 est exactement le déterminant de la hessienne, c'est-à-dire le produit de ses deux valeurs propres.

  • rt−s2>0rt-s^2>0 : les deux valeurs propres ont le même signe, et rr dit lequel — la surface est courbée pareillement dans toutes les directions.
  • rt−s2<0rt-s^2<0 : elles sont de signes opposés — ça monte dans une direction, ça descend dans l'autre : c'est une selle.

Ici H=(2002)H=\begin{pmatrix}2&0\\0&2\end{pmatrix}, de valeurs propres 22 et 22 : deux fois positives, cuvette dans toutes les directions.

Étape 3 — du local au global

Le test de la hessienne ne dit rien au-delà du voisinage du point. Pour conclure globalement, il faut un argument d'une autre nature — ici, la mise sous forme canonique :

f(x,y)=x2−4x+4⏟(x−2)2+y2−6y+9⏟(y−3)2+13−4−9⏟0=(x−2)2+(y−3)2.f(x,y)=\underbrace{x^2-4x+4}_{(x-2)^2}+\underbrace{y^2-6y+9}_{(y-3)^2}+\underbrace{13-4-9}_{0}=(x-2)^2+(y-3)^2.

Somme de deux carrés : f≥0f\ge0 partout, avec égalité seulement si x=2x=2 et y=3y=3 simultanément. Le minimum est donc global et strict.

Cette écriture révèle aussi la géométrie : les lignes de niveau f=cf=c sont les cercles de centre (2,3)(2,3) et de rayon c\sqrt{c}. On lit littéralement une cuvette parfaitement ronde.

(2, 3) minimum GLOBAL,f(2,3)=0\boxed{(2,\,3)\ \text{minimum GLOBAL},\qquad f(2,3)=0}
Contrôle numérique

Un extremum se vérifie toujours en testant des points autour :

point ff
(2,3)(2,3) 00
(2,1 ; 3)(2{,}1\,;\,3) 0,010{,}01
(1,9 ; 3)(1{,}9\,;\,3) 0,010{,}01
(2 ; 3,5)(2\,;\,3{,}5) 0,250{,}25
(0,0)(0,0) 1313

Tout ce qui l'entoure est strictement plus grand. Réponse : minimum global 00, atteint en (2,3)(2,3), et c'est le seul extremum.

Réponse. Minimum global 00 en (2,3)(2,3). (Recoupement : scipy.optimize.minimize donne argmin (2,3)(2,3), valeur 00 ✓)
Faire cet exercice dans l'app →

Point col

CalculDifficulté 3/5

Montrer que f(x,y)=x2−y2f(x,y)=x^2-y^2 a un point col en (0,0)(0,0).

Indices (3)

∇f=(2x,−2y)=0⃗⇒(0,0)\nabla f=(2x,-2y)=\vec0\Rightarrow(0,0).

H=(200−2)H=\begin{pmatrix}2&0\\0&-2\end{pmatrix}.

rt−s2<0rt-s^2<0 caractérise un col.

Correction détaillée
L'idée directrice

Un point col — on dit aussi point selle — est le cas où le test de la hessienne répond « ni minimum, ni maximum ». Le nom vient de la selle de cheval : en s'asseyant dessus, on est au point le plus bas dans le sens tête-queue, et au point le plus haut dans le sens des jambes.

La fonction f(x,y)=x2−y2f(x,y)=x^2-y^2 est le col modèle, celui qu'on garde en tête. Toute la démonstration tient en une phrase : il suffit d'exhiber deux directions où le comportement est opposé.

Étape 1 — le point critique
fx=2x,fy=−2y.f_x=2x,\qquad f_y=-2y.

∇f=0⃗\nabla f=\vec0 donne 2x=02x=0 et −2y=0-2y=0, donc l'unique point critique est (0,0)(0,0), où f(0,0)=0f(0,0)=0.

Étape 2 — le test formel
r=fxx=2,s=fxy=0,t=fyy=−2,r=f_{xx}=2,\qquad s=f_{xy}=0,\qquad t=f_{yy}=-2,
rt−s2=2×(−2)−0=−4<0.rt-s^2=2\times(-2)-0=-4<0.

Discriminant strictement négatif : c'est un point col. Noter qu'on n'a même pas eu à regarder le signe de rr — quand rt−s2<0rt-s^2<0, la conclusion tombe seule.

Étape 3 — la preuve directe, qui est la vraie

Le test est commode, mais il vaut mieux savoir montrer le col à la main, parce que cet argument-là survivra quand le test sera muet (exercice A6).

On restreint ff à deux droites passant par l'origine :

  • le long de l'axe des xx (on pose y=0y=0) : f(x,0)=x2 ≥0f(x,0)=x^2\ \ge 0, avec égalité seulement en 00. Sur cette droite, l'origine est un minimum.
  • le long de l'axe des yy (on pose x=0x=0) : f(0,y)=−y2 ≤0f(0,y)=-y^2\ \le 0, avec égalité seulement en 00. Sur cette droite, l'origine est un maximum.

Conclusion : dans tout disque centré en (0,0)(0,0), si petit soit-il, ff prend des valeurs strictement positives (sur l'axe des xx) et strictement négatives (sur l'axe des yy). L'origine ne peut donc être ni un minimum local (il y a du plus petit tout près) ni un maximum local (il y a du plus grand tout près).

(0, 0) est un point COL:rt−s2=−4<0\boxed{(0,\,0)\ \text{est un point COL} : rt-s^2=-4<0}
Ce que ça donne en chiffres

Prenons un disque de rayon 0,10{,}1 autour de l'origine :

point ff
(0,1 ; 0)(0{,}1\,;\,0) +0,01+0{,}01
(−0,1 ; 0)(-0{,}1\,;\,0) +0,01+0{,}01
(0 ; 0,1)(0\,;\,0{,}1) −0,01-0{,}01
(0 ; −0,1)(0\,;\,-0{,}1) −0,01-0{,}01
(0,0)(0,0) 00

Des valeurs des deux côtés de 00, arbitrairement près de l'origine. En réduisant le rayon à 0,0010{,}001 on obtiendrait ±10−6\pm10^{-6} : le phénomène ne disparaît jamais.

La géométrie, pour fixer l'image

Les lignes de niveau de x2−y2x^2-y^2 sont les hyperboles x2−y2=cx^2-y^2=c :

  • c>0c>0 : deux branches ouvertes vers la gauche et la droite ;
  • c<0c<0 : deux branches ouvertes vers le haut et le bas ;
  • c=0c=0 : les deux droites y=xy=x et y=−xy=-x, qui se croisent précisément à l'origine.

Ce croisement de deux lignes de niveau est la signature visuelle d'un col — là où, autour d'un extremum, on verrait des courbes fermées emboîtées (les cercles de l'exercice A1).

Réponse : (0,0)(0,0) est bien un point col, avec rt−s2=−4<0rt-s^2=-4<0 ; ff y vaut 00, croît le long de l'axe des xx et décroît le long de l'axe des yy.

Réponse. (0,0)(0,0) est un point col (rt−s2=−4<0rt-s^2=-4<0). (Recoupement : vp {2,−2}\{2,-2\} de signes opposés — minimum dans une direction, maximum dans l'autre ✓)
Faire cet exercice dans l'app →

Min local et col

CalculDifficulté 3/5

Déterminer et classer les points critiques de f(x,y)=x3−3x+y2f(x,y)=x^3-3x+y^2.

Indices (3)

∇f=(3x2−3, 2y)=0⃗\nabla f=(3x^2-3,\,2y)=\vec0.

3x2−3=0⇒x=±13x^2-3=0\Rightarrow x=\pm1, et y=0y=0.

H=(6x002)H=\begin{pmatrix}6x&0\\0&2\end{pmatrix} dépend de xx.

Correction détaillée
L'idée directrice

Premier exemple avec plusieurs points critiques, et c'est là que la démarche prend son sens : on liste tous les candidats, puis on les classe un par un. Ne jamais classer avant d'avoir fini la liste — on manquerait un point.

La structure de f(x,y)=x3−3x+y2f(x,y)=x^3-3x+y^2 est éclairante : la variable yy n'apparaît que par y2y^2, donc dans la direction yy c'est toujours une cuvette. Tout se joue dans la direction xx, où x3−3xx^3-3x a la forme classique en S\mathsf{S} d'un polynôme de degré 3.

Étape 1 — la liste des candidats
fx=3x2−3,fy=2y.f_x=3x^2-3,\qquad f_y=2y.

Le système est encore découplé :

3x2−3=0 ⟹ x2=1 ⟹ x=±1,2y=0 ⟹ y=0.3x^2-3=0\ \Longrightarrow\ x^2=1\ \Longrightarrow\ x=\pm1,\qquad 2y=0\ \Longrightarrow\ y=0.

Attention au piège le plus fréquent du chapitre : x2=1x^2=1 donne deux solutions, x=1x=1 et x=−1x=-1. Oublier la racine négative ferait perdre la moitié de l'exercice.

Deux points critiques :   (1,0)  \;(1,0)\; et   (−1,0)\;(-1,0).

Étape 2 — la hessienne, qui dépend du point
r=fxx=6x,s=fxy=0,t=fyy=2.r=f_{xx}=6x,\qquad s=f_{xy}=0,\qquad t=f_{yy}=2.

Nouveauté importante : rr dépend de xx. Il faut donc évaluer la hessienne en chaque point critique séparément — c'est exactement pour ça qu'on a d'abord dressé la liste complète.

rt−s2=6x×2−0=12x.rt-s^2=6x\times2-0=12x.
  • En (1,0)(1,0) : rt−s2=12>0rt-s^2=12>0 et r=6>0r=6>0 ⇒\Rightarrow minimum local, de valeur f(1,0)=1−3+0=−2f(1,0)=1-3+0=-2.
  • En (−1,0)(-1,0) : rt−s2=−12<0rt-s^2=-12<0 ⇒\Rightarrow point col, de valeur f(−1,0)=−1+3+0=2f(-1,0)=-1+3+0=2.
Lire le résultat le long des axes

Pour se convaincre du col en (−1,0)(-1,0), on refait le geste de l'exercice A2 : on coupe par deux droites.

  • Direction yy (x=−1x=-1 fixé) : f(−1,y)=2+y2f(-1,y)=2+y^2, minimale en y=0y=0. Ça monte quand on s'écarte.
  • Direction xx (y=0y=0 fixé) : g(x)=x3−3xg(x)=x^3-3x, avec g′(x)=3x2−3g'(x)=3x^2-3. En x=−1x=-1, g′′(−1)=6×(−1)=−6<0g''(-1)=6\times(-1)=-6<0 : c'est un maximum de gg. Ça descend quand on s'écarte.

Monte dans un sens, descend dans l'autre : col confirmé, sans recourir au tableau.

Contrôle numérique

On teste autour de chaque candidat, à distance 0,20{,}2 :

autour de (1,0)(1,0) ff autour de (−1,0)(-1,0) ff
(1,0)(1,0) −2-2 (−1,0)(-1,0)     2\;\;2
(1,2 ; 0)(1{,}2\,;\,0) −1,872-1{,}872 (−0,8 ; 0)(-0{,}8\,;\,0)     1,888\;\;1{,}888
(0,8 ; 0)(0{,}8\,;\,0) −1,888-1{,}888 (−1,2 ; 0)(-1{,}2\,;\,0)     1,872\;\;1{,}872
(1 ; 0,2)(1\,;\,0{,}2) −1,96-1{,}96 (−1 ; 0,2)(-1\,;\,0{,}2)     2,04\;\;2{,}04

Autour de (1,0)(1,0) : tout est plus grand que −2-2 — minimum. Autour de (−1,0)(-1,0) : 1,8721{,}872 et 1,8881{,}888 sont plus petits que 22, tandis que 2,042{,}04 est plus grand — col.

Étape 3 — et globalement ?

Le minimum en (1,0)(1,0) est local seulement, et il faut le dire. En effet

f(x,0)=x3−3x →x→−∞ −∞,f(x,0)=x^3-3x\ \xrightarrow[x\to-\infty]{}\ -\infty,

par exemple f(−10,0)=−1000+30=−970f(-10,0)=-1000+30=-970, très en dessous de −2-2. La fonction n'est pas minorée : il n'y a pas de minimum global.

C'est une différence de fond avec A1, où la forme canonique donnait le global gratuitement. Ici le terme x3x^3 l'interdit.

Réponse : (1,0)(1,0) minimum local de valeur −2-2 ; (−1,0)(-1,0) point col de valeur 22 ; aucun extremum global.

(1, 0) min local, f=−2(−1, 0) col, f=2aucun extremum global\boxed{(1,\,0)\ \text{min local},\ f=-2\qquad(-1,\,0)\ \text{col},\ f=2\qquad\text{aucun extremum global}}
Réponse. (1,0)(1,0) minimum local (f=−2f=-2) ; (−1,0)(-1,0) point col. (Recoupement : la Hessienne diag(6x,2)\mathrm{diag}(6x,2) change de signe en x=0x=0 ✓)
Faire cet exercice dans l'app →

Système cubique

CalculDifficulté 3/5

Trouver et classer les points critiques de f(x,y)=x3+y3−3xyf(x,y)=x^3+y^3-3xy.

Indices (3)

∇f=(3x2−3y, 3y2−3x)=0⃗⇒y=x2\nabla f=(3x^2-3y,\,3y^2-3x)=\vec0\Rightarrow y=x^2 et x=y2x=y^2.

x=x4⇒x∈{0,1}x=x^4\Rightarrow x\in\{0,1\} (racines réelles).

H=(6x−3−36y)H=\begin{pmatrix}6x&-3\\-3&6y\end{pmatrix}.

Correction détaillée
L'idée directrice

Cette fois le système des points critiques est couplé : chaque équation contient les deux variables. C'est le cas général, et la technique à retenir est celle de la substitution — on tire une variable d'une équation, on la reporte dans l'autre.

f(x,y)=x3+y3−3xy.f(x,y)=x^3+y^3-3xy.

Remarque utile avant de calculer : ff est symétrique en xx et yy (l'échanger ne change rien). Les points critiques seront donc, soit sur la diagonale y=xy=x, soit par paires symétriques. Cela ne dispense pas du calcul, mais donne un moyen de vérifier qu'on n'a rien oublié.

Étape 1 — résoudre le système couplé
fx=3x2−3y,fy=3y2−3x.f_x=3x^2-3y,\qquad f_y=3y^2-3x.

En divisant par 33 :

{x2−y=0y2−x=0⟺{y=x2x=y2\begin{cases}x^2-y=0\\ y^2-x=0\end{cases}\quad\Longleftrightarrow\quad\begin{cases}y=x^2\\ x=y^2\end{cases}

Substitution — on reporte y=x2y=x^2 dans la seconde :

x=(x2)2=x4⟺x4−x=0⟺x (x3−1)=0.x=(x^2)^2=x^4\quad\Longleftrightarrow\quad x^4-x=0\quad\Longleftrightarrow\quad x\,(x^3-1)=0.

On factorise au lieu de diviser par xx : diviser ferait perdre la solution x=0x=0. D'où x=0x=0 ou x3=1x^3=1, soit x=1x=1 (seule racine réelle).

  • x=0⇒y=02=0x=0\Rightarrow y=0^2=0 : point (0,0)(0,0).
  • x=1⇒y=12=1x=1\Rightarrow y=1^2=1 : point (1,1)(1,1).

Deux points critiques, tous deux sur la diagonale — cohérent avec la symétrie annoncée.

Étape 2 — classer chaque point
r=fxx=6x,s=fxy=−3,t=fyy=6y.r=f_{xx}=6x,\qquad s=f_{xy}=-3,\qquad t=f_{yy}=6y.
rt−s2=36xy−9.rt-s^2=36xy-9.

Ici les trois coefficients comptent : s=−3s=-3 n'est plus nul, contrairement à A1–A3.

  • En (0,0)(0,0) : rt−s2=0−9=−9<0rt-s^2=0-9=-9<0 ⇒\Rightarrow point col, f(0,0)=0f(0,0)=0.
  • En (1,1)(1,1) : rt−s2=36−9=27>0rt-s^2=36-9=27>0 et r=6>0r=6>0 ⇒\Rightarrow minimum local, f(1,1)=1+1−3=−1f(1,1)=1+1-3=-1.
Voir le col en $(0,0)$ sans le tableau

Comme s≠0s\neq0, les axes ne suffisent plus : le long de l'axe des xx on a f(x,0)=x3f(x,0)=x^3, qui n'a ni min ni max en 00 mais un point d'inflexion. Il faut choisir de meilleures directions — la diagonale et l'antidiagonale :

  • sur y=xy=x : f(x,x)=2x3−3x2=x2(2x−3)f(x,x)=2x^3-3x^2=x^2(2x-3). Près de 00, le facteur 2x−32x-3 vaut environ −3-3, donc f<0f<0 : ça descend. Par exemple f(0,1 ; 0,1)=−0,028f(0{,}1\,;\,0{,}1)=-0{,}028.
  • sur y=−xy=-x : f(x,−x)=x3−x3+3x2=3x2>0f(x,-x)=x^3-x^3+3x^2=3x^2>0 : ça monte. Par exemple f(0,1 ; −0,1)=+0,03f(0{,}1\,;\,-0{,}1)=+0{,}03.

Des valeurs des deux signes aussi près qu'on veut de l'origine : col confirmé.

Leçon générale : quand une direction ne tranche pas, en essayer une autre — le col est une propriété de la surface, pas des axes.

Contrôle numérique autour du minimum
point ff
(1,1)(1,1) −1-1
(1,1 ; 1)(1{,}1\,;\,1) −0,969-0{,}969
(0,9 ; 1)(0{,}9\,;\,1) −0,971-0{,}971
(1 ; 1,1)(1\,;\,1{,}1) −0,969-0{,}969
(1,1 ; 1,1)(1{,}1\,;\,1{,}1) −0,968-0{,}968

Tous strictement supérieurs à −1-1 : minimum local net.

Globalité

Comme en A3, le minimum n'est que local : sur la diagonale,

f(x,x)=2x3−3x2 →x→−∞ −∞,f(x,x)=2x^3-3x^2\ \xrightarrow[x\to-\infty]{}\ -\infty,

par exemple f(−10,−10)=−2000−300=−2300f(-10,-10)=-2000-300=-2300. La fonction n'est pas minorée.

Réponse : (0,0)(0,0) point col (f=0f=0), (1,1)(1,1) minimum local (f=−1f=-1) ; pas d'extremum global.

(0, 0) col, f=0(1, 1) min local, f=−1pas d’extremum global\boxed{(0,\,0)\ \text{col},\ f=0\qquad(1,\,1)\ \text{min local},\ f=-1\qquad\text{pas d'extremum global}}
Réponse. (0,0)(0,0) col ; (1,1)(1,1) minimum local, f=−1f=-1. (Recoupement : scipy confirme le minimum local en (1,1)(1,1) ✓)
Faire cet exercice dans l'app →

Deux minima globaux

CalculDifficulté 3/5

Étudier les extrema de f(x,y)=x4+y4−4xyf(x,y)=x^4+y^4-4xy.

Indices (3)

∇f=(4x3−4y, 4y3−4x)=0⃗⇒y=x3\nabla f=(4x^3-4y,\,4y^3-4x)=\vec0\Rightarrow y=x^3 et x=y3x=y^3.

x=x9⇒x∈{0,1,−1}x=x^9\Rightarrow x\in\{0,1,-1\}.

H=(12x2−4−412y2)H=\begin{pmatrix}12x^2&-4\\-4&12y^2\end{pmatrix}.

Correction détaillée
L'idée directrice
f(x,y)=x4+y4−4xy.f(x,y)=x^4+y^4-4xy.

Trois nouveautés par rapport aux exercices précédents, et chacune vaut la peine d'être notée :

  1. le système critique se résout par une élévation de puissance plutôt que par substitution directe ;
  2. il y a deux minima distincts de même valeur — un minimum global n'est pas forcément atteint en un seul point ;
  3. cette fois, contrairement à A3 et A4, on pourra conclure au global, parce que les puissances quatrièmes dominent le terme croisé à l'infini.
Étape 1 — le système critique
fx=4x3−4y,fy=4y3−4x.f_x=4x^3-4y,\qquad f_y=4y^3-4x.

En divisant par 44 :

{x3=yy3=x\begin{cases}x^3=y\\ y^3=x\end{cases}

On reporte la première dans la seconde : (x3)3=x(x^3)^3=x, soit

x9−x=0⟺x (x8−1)=0.x^9-x=0\quad\Longleftrightarrow\quad x\,(x^8-1)=0.

Encore une fois on factorise plutôt que de diviser. Sur les réels, x8=1x^8=1 donne x=±1x=\pm1 (les six autres racines sont complexes et ne nous concernent pas). D'où :

  • x=0⇒y=03=0x=0\Rightarrow y=0^3=0 : point (0,0)(0,0) ;
  • x=1⇒y=1x=1\Rightarrow y=1 : point (1,1)(1,1) ;
  • x=−1⇒y=−1x=-1\Rightarrow y=-1 : point (−1,−1)(-1,-1).

Trois points critiques.

Étape 2 — classement
r=fxx=12x2,s=fxy=−4,t=fyy=12y2,r=f_{xx}=12x^2,\qquad s=f_{xy}=-4,\qquad t=f_{yy}=12y^2,
rt−s2=144x2y2−16.rt-s^2=144x^2y^2-16.
  • (0,0)(0,0) : rt−s2=−16<0rt-s^2=-16<0 ⇒\Rightarrow point col, f=0f=0.
  • (1,1)(1,1) : rt−s2=144−16=128>0rt-s^2=144-16=128>0, r=12>0r=12>0 ⇒\Rightarrow minimum local, f(1,1)=1+1−4=−2f(1,1)=1+1-4=-2.
  • (−1,−1)(-1,-1) : rt−s2=144−16=128>0rt-s^2=144-16=128>0, r=12>0r=12>0 ⇒\Rightarrow minimum local, f(−1,−1)=1+1−4=−2f(-1,-1)=1+1-4=-2.

Les deux minima ont exactement la même valeur −2-2, ce qui n'a rien d'un hasard : f(−x,−y)=f(x,y)f(-x,-y)=f(x,y), la fonction est invariante par symétrie centrale.

Le col en $(0,0)$, vu à la main

Comme en A4, on prend la diagonale et l'antidiagonale :

  • sur y=xy=x : f(x,x)=2x4−4x2=2x2(x2−2)f(x,x)=2x^4-4x^2=2x^2(x^2-2). Près de 00, x2−2≈−2<0x^2-2\approx-2<0 donc f<0f<0. Exemple : f(0,2 ; 0,2)=−0,1568f(0{,}2\,;\,0{,}2)=-0{,}1568.
  • sur y=−xy=-x : f(x,−x)=2x4+4x2>0f(x,-x)=2x^4+4x^2>0. Exemple : f(0,2 ; −0,2)=+0,1632f(0{,}2\,;\,-0{,}2)=+0{,}1632.

Des deux signes arbitrairement près de l'origine : col.

Contrôle numérique autour des minima
point ff point ff
(1,1)(1,1) −2-2 (−1,−1)(-1,-1) −2-2
(1,1 ; 1)(1{,}1\,;\,1) −1,9359-1{,}9359 (−1,1 ; −1)(-1{,}1\,;\,-1) −1,9359-1{,}9359
(0,9 ; 1)(0{,}9\,;\,1) −1,9439-1{,}9439 (1,2 ; 1,2)(1{,}2\,;\,1{,}2) −1,6128-1{,}6128

Tout ce qui entoure les deux points est strictement plus grand que −2-2.

Étape 3 — le minimum est GLOBAL

Contrairement à A3 et A4, on peut ici conclure globalement, et il faut deux arguments enchaînés.

(a) ff est minorée et tend vers +∞+\infty à l'infini. L'inégalité 2∣xy∣≤x2+y22\lvert xy\rvert\le x^2+y^2 donne 4∣xy∣≤2(x2+y2)4\lvert xy\rvert\le 2(x^2+y^2), donc

f(x,y) ≥ x4+y4−2(x2+y2).f(x,y)\ \ge\ x^4+y^4-2(x^2+y^2).

Or u4−2u2=(u2−1)2−1≥−1u^4-2u^2=(u^2-1)^2-1\ge-1 pour tout réel uu. Donc f≥−1−1=−2f\ge-1-1=-2 !

(b) La borne −2-2 est atteinte, précisément en (1,1)(1,1) et (−1,−1)(-1,-1).

Le minimum −2-2 est donc bien global, atteint en exactement deux points. Vérification que la majoration est cohérente : f(2,2)=16+16−16=16f(2,2)=16+16-16=16, f(−2,−2)=16f(-2,-2)=16 — ça remonte bien dans toutes les directions.

Réponse : minimum global −2-2 atteint en (1,1)(1,1) et (−1,−1)(-1,-1) ; point col en (0,0)(0,0) de valeur 00 ; pas de maximum (ff n'est pas majorée).

(1, 1) et (−1, −1) minima GLOBAUX, f=−2(0, 0) col\boxed{(1,\,1)\ \text{et}\ (-1,\,-1)\ \text{minima GLOBAUX},\ f=-2\qquad(0,\,0)\ \text{col}}
Réponse. (0,0)(0,0) col ; (1,1)(1,1) et (−1,−1)(-1,-1) minima globaux, f=−2f=-2. (Recoupement : scipy atteint −2-2 ; symétrie f(x,y)=f(−x,−y)f(x,y)=f(-x,-y) ⇒ deux minima ✓)
Faire cet exercice dans l'app →

Cas douteux du test

DémonstrationDifficulté 3/5

Pour f(x,y)=x4+y4f(x,y)=x^4+y^4, montrer que le test rt−s2rt-s^2 est non concluant en (0,0)(0,0), puis conclure autrement.

Indices (3)

∇f=(4x3,4y3)=0⃗⇒(0,0)\nabla f=(4x^3,4y^3)=\vec0\Rightarrow(0,0).

Calculer la Hessienne en (0,0)(0,0).

Quand le test échoue, raisonner directement sur le signe de ff.

Correction détaillée
L'idée directrice

Le test rt−s2rt-s^2 a un quatrième cas, celui qu'on oublie : rt−s2=0rt-s^2=0. Le tableau ne dit alors rien du tout — ni « c'est un extremum », ni « ce n'en est pas un ». C'est un cas douteux, et le mot est exact : le test est simplement muet.

L'exercice sert à ancrer deux réflexes :

  1. reconnaître qu'on est dans ce cas et ne pas conclure ;
  2. savoir passer à un argument direct, qui est souvent plus simple que le test lui-même.
Étape 1 — le point critique et le test
f(x,y)=x4+y4,fx=4x3,fy=4y3.f(x,y)=x^4+y^4,\qquad f_x=4x^3,\qquad f_y=4y^3.

4x3=04x^3=0 et 4y3=04y^3=0 donnent l'unique point critique (0,0)(0,0), avec f(0,0)=0f(0,0)=0.

Les dérivées secondes :

r=fxx=12x2,s=fxy=0,t=fyy=12y2.r=f_{xx}=12x^2,\qquad s=f_{xy}=0,\qquad t=f_{yy}=12y^2.

En (0,0)(0,0), ces trois quantités valent 00 : la hessienne est la matrice nulle,

H(0,0)=(0000),rt−s2=0.H(0,0)=\begin{pmatrix}0&0\\0&0\end{pmatrix},\qquad rt-s^2=0.

Le test est non concluant. Il faut s'arrêter là et changer d'outil.

Pourquoi le test échoue ici

Rappelons ce que fait vraiment le test : il approche ff par sa partie quadratique au voisinage du point. Or ici cette partie quadratique est identiquement nulle — le développement de ff ne commence qu'au degré 44.

Le test regarde donc un terme qui n'existe pas, et ne peut évidemment rien en dire. C'est la même chose qu'en une variable avec g(x)=x4g(x)=x^4 : g′′(0)=0g''(0)=0, le critère de la dérivée seconde est muet, alors que le minimum en 00 crève les yeux.

Point capital : rt−s2=0rt-s^2=0 ne signifie pas « ce n'est pas un extremum ». Les trois fonctions x4+y4x^4+y^4, −x4−y4-x^4-y^4 et x3+y3x^3+y^3 ont toutes une hessienne nulle en l'origine, et pourtant la première y a un minimum, la deuxième un maximum, la troisième ni l'un ni l'autre. Le test ne les distingue pas ; nous, si.

Étape 2 — conclure autrement (et c'est immédiat)

Pas besoin d'artillerie : une puissance paire est toujours positive ou nulle.

x4≥0ety4≥0⟹f(x,y)=x4+y4 ≥ 0=f(0,0).x^4\ge0\quad\text{et}\quad y^4\ge0\qquad\Longrightarrow\qquad f(x,y)=x^4+y^4\ \ge\ 0=f(0,0).

Donc (0,0)(0,0) est un minimum global.

Est-il strict ? Oui : f(x,y)=0f(x,y)=0 exige x4=0x^4=0 et y4=0y^4=0 (deux termes positifs de somme nulle sont tous deux nuls), donc x=y=0x=y=0. Aucun autre point n'atteint la valeur 00.

L'argument direct est plus court que le test — et il donne davantage : il conclut au global et au strict, là où le test ne parle jamais que du local.

Contrôle numérique
point ff
(0,0)(0,0) 00
(0,1 ; 0)(0{,}1\,;\,0) 10−410^{-4}
(0 ; 0,1)(0\,;\,0{,}1) 10−410^{-4}
(0,1 ; 0,1)(0{,}1\,;\,0{,}1) 2×10−42\times10^{-4}
(0,1 ; −0,1)(0{,}1\,;\,-0{,}1) 2×10−42\times10^{-4}
(0,01 ; 0,01)(0{,}01\,;\,0{,}01) 2×10−82\times10^{-8}

Toujours >0>0, dans toutes les directions. On voit aussi pourquoi le test ne voyait rien : les valeurs sont extraordinairement plates près de 00 — à distance 0,010{,}01, ff vaut deux cent-millionièmes, quand une cuvette quadratique ordinaire (x2+y2x^2+y^2) donnerait 2×10−42\times10^{-4}, soit dix mille fois plus.

Ce qu'il faut retenir

La marche à suivre quand rt−s2=0rt-s^2=0 :

  • chercher une minoration ou une majoration évidente (somme de carrés, de puissances paires…) ;
  • sinon, restreindre à des droites ou à des courbes bien choisies, comme aux exercices A2, A4 et A5, pour exhiber des valeurs des deux côtés ;
  • en dernier recours, pousser le développement limité à l'ordre suivant.

Réponse : rt−s2=0rt-s^2=0 en (0,0)(0,0), le test est muet ; mais f=x4+y4≥0f=x^4+y^4\ge0 avec égalité seulement en l'origine, donc (0,0)(0,0) est un minimum global strict, de valeur 00.

Réponse. rt−s2=0rt-s^2=0 (test non concluant), mais f≥0⇒(0,0)f\ge0\Rightarrow(0,0) est un minimum global. (Recoupement : le test du second ordre ne tranche pas les cas plats — il faut alors un argument direct ✓)
Faire cet exercice dans l'app →

Rectangle d'aire maximale

ApplicationDifficulté 3/5

Parmi les rectangles de périmètre 2020, lequel a l'aire maximale ? (maximiser xyxy sous x+y=10x+y=10, x,y>0x,y>0).

Indices (3)

g(x,y)=x+y−10=0g(x,y)=x+y-10=0.

∇f=(y,x)\nabla f=(y,x), ∇g=(1,1)\nabla g=(1,1) ; poser ∇f=λ∇g\nabla f=\lambda\nabla g.

y=λy=\lambda et x=λ⇒x=yx=\lambda\Rightarrow x=y.

Correction détaillée
L'idée directrice

Jusqu'ici on cherchait un extremum libre : le point pouvait se promener partout. Ici il est assigné à résidence sur la droite x+y=10x+y=10, et c'est une situation toute différente.

La méthode de Lagrange repose sur une observation géométrique simple. Déplaçons-nous le long de la contrainte : tant que la ligne de niveau de ff qu'on traverse n'est pas tangente à la contrainte, on la traverse — donc ff change, donc on n'est pas à un extremum. À l'optimum, la ligne de niveau effleure la contrainte.

Or « effleurer », en termes de gradients, s'écrit : ∇f\nabla f et ∇g\nabla g sont colinéaires, soit

∇f=λ ∇g.\nabla f=\lambda\,\nabla g.

Le nombre λ\lambda s'appelle le multiplicateur de Lagrange.

Étape 1 — poser le problème proprement

Un rectangle de côtés xx et yy a pour périmètre 2(x+y)=202(x+y)=20, donc

x+y=10,x>0, y>0,x+y=10,\qquad x>0,\ y>0,

et pour aire f(x,y)=xyf(x,y)=xy. On maximise ff sous la contrainte g(x,y)=x+y−10=0g(x,y)=x+y-10=0.

Attention à ne pas confondre les deux fonctions : ff est ce qu'on optimise, gg est ce qui contraint. Les inverser conduit à un système sans queue ni tête.

Étape 2 — le système de Lagrange
∇f=(y, x),∇g=(1, 1).\nabla f=(y,\,x),\qquad \nabla g=(1,\,1).

Le système ∇f=λ∇g\nabla f=\lambda\nabla g, complété par la contrainte elle-même (qu'on oublie une fois sur deux) :

{y=λx=λx+y=10\begin{cases}y=\lambda\\ x=\lambda\\ x+y=10\end{cases}

Les deux premières donnent immédiatement x=y  (=λ)x=y\;(=\lambda). En reportant dans la troisième : 2x=102x=10, donc

x=y=5,λ=5,f(5,5)=25.x=y=5,\qquad \lambda=5,\qquad f(5,5)=25.

Le rectangle optimal est le carré de côté 55, d'aire 2525.

Étape 3 — s'assurer que c'est bien un maximum

Le système de Lagrange ne fournit que des candidats ; il ne dit pas s'ils sont maximum ou minimum. Ici le plus simple est d'éliminer la contrainte : y=10−xy=10-x, donc

h(x)=x(10−x)=10x−x2,x∈ ]0,10[.h(x)=x(10-x)=10x-x^2,\qquad x\in\,]0,10[.

h′(x)=10−2xh'(x)=10-2x s'annule en x=5x=5, et h′′(x)=−2<0h''(x)=-2<0 : c'est bien un maximum, unique sur l'intervalle. Aux bords, h(0+)→0h(0^+)\to0 et h(10−)→0h(10^-)\to0 : l'aire s'effondre quand le rectangle s'aplatit.

Cette substitution est toujours possible pour une contrainte linéaire, et elle est souvent plus rapide que Lagrange. La méthode de Lagrange prend son intérêt quand la contrainte ne se résout pas facilement — voir B3 et B4, où elle est incontournable.

x=y=5 (le carreˊ),aire maximale=25\boxed{x=y=5\ \text{(le carré)},\qquad \text{aire maximale}=25}
Contrôle numérique

On teste des rectangles de périmètre 2020 :

xx y=10−xy=10-x aire xyxy
11 99 99
33 77 2121
44 66 2424
5\mathbf{5} 5\mathbf{5} 25\mathbf{25}
66 44 2424
99 11 99

Le maximum est net en (5,5)(5,5), et le tableau est symétrique autour de lui — ce qui était prévisible, échanger xx et yy ne change ni le périmètre ni l'aire.

Ce que signifie $\lambda$

Le multiplicateur n'est pas un déchet de calcul : il mesure la sensibilité de l'optimum à la contrainte. Si le périmètre passe de 2020 à 20+ε20+\varepsilon, la contrainte devient x+y=10+ε/2x+y=10+\varepsilon/2 et l'aire optimale passe de 2525 à (5+ε/4)2≈25+5ε2\bigl(5+\varepsilon/4\bigr)^2\approx25+\tfrac{5\varepsilon}{2}.

Par rapport à la contrainte c=x+yc=x+y, l'aire optimale vaut c2/4c^2/4, de dérivée c/2=5=λc/2=5=\lambda. On retrouve la règle générale :

λ=d (optimum)d (niveau de la contrainte).\lambda=\frac{\mathrm{d}\,(\text{optimum})}{\mathrm{d}\,(\text{niveau de la contrainte})}.

C'est pour cette raison qu'en économie λ\lambda s'appelle le prix fictif de la ressource : il dit ce que vaudrait une unité supplémentaire.

Réponse : le carré 5×55\times5, d'aire maximale 2525, avec λ=5\lambda=5.

Réponse. Carré 5×55\times5, aire maximale 2525. (Recoupement : à périmètre fixé, le carré maximise l'aire — vérifié ∇f∥∇g\nabla f\parallel\nabla g ✓)
Faire cet exercice dans l'app →

Point d'une droite le plus proche de O

ApplicationDifficulté 3/5

Trouver le point de la droite x+y=1x+y=1 le plus proche de l'origine (minimiser x2+y2x^2+y^2 sous x+y=1x+y=1).

Indices (3)

Minimiser le carré de la distance évite la racine.

∇f=(2x,2y)=λ(1,1)⇒x=y\nabla f=(2x,2y)=\lambda(1,1)\Rightarrow x=y.

Reporter dans la contrainte.

Correction détaillée
L'idée directrice

Chercher le point d'une droite le plus proche de l'origine, c'est chercher le pied de la perpendiculaire — un fait de géométrie de collège. L'intérêt de l'exercice est de voir la méthode de Lagrange retrouver ce résultat, ce qui est la meilleure façon de lui faire confiance ensuite, quand la géométrie ne sera plus visible.

Une précaution d'écriture, à prendre systématiquement : on minimise le carré de la distance,

f(x,y)=x2+y2,f(x,y)=x^2+y^2,

et non x2+y2\sqrt{x^2+y^2}. Les deux ont leur minimum au même endroit, puisque t↦tt\mapsto\sqrt t est croissante — mais le carré est un polynôme, donc dérivable partout et sans radical à traîner.

Étape 1 — le système

Contrainte : g(x,y)=x+y−1=0g(x,y)=x+y-1=0. Gradients :

∇f=(2x, 2y),∇g=(1, 1).\nabla f=(2x,\,2y),\qquad \nabla g=(1,\,1).
{2x=λ2y=λx+y=1\begin{cases}2x=\lambda\\ 2y=\lambda\\ x+y=1\end{cases}

Les deux premières équations donnent 2x=2y2x=2y, donc x=yx=y. La contrainte donne alors 2x=12x=1 :

x=y=12,λ=1,f(12,12)=14+14=12.x=y=\tfrac12,\qquad \lambda=1,\qquad f\left(\tfrac12,\tfrac12\right)=\tfrac14+\tfrac14=\tfrac12.

La distance cherchée est 1/2=22≈0,7071\sqrt{1/2}=\dfrac{\sqrt2}{2}\approx0{,}7071.

Étape 2 — pourquoi c'est un minimum

Ici encore, le minimum n'est pas garanti par le système. Deux façons de conclure, à connaître toutes les deux :

Par substitution. y=1−xy=1-x, donc

h(x)=x2+(1−x)2=2x2−2x+1.h(x)=x^2+(1-x)^2=2x^2-2x+1.

C'est une parabole de coefficient dominant 2>02>0 : elle a un minimum, en x=22×2=12x=\dfrac{2}{2\times2}=\dfrac12, de valeur h(1/2)=1/2h(1/2)=1/2. ✓

Par l'infini. Sur la droite, f→+∞f\to+\infty quand on s'éloigne dans un sens ou dans l'autre. Un unique point critique sur une fonction continue qui tend vers +∞+\infty des deux côtés ne peut être qu'un minimum.

Étape 3 — le lien avec la perpendiculaire

C'est ici que la géométrie éclaire le calcul. La condition ∇f=λ∇g\nabla f=\lambda\nabla g s'écrit

(2x,2y)=λ(1,1)c’est-aˋ-dire(x,y) ∥ (1,1).(2x,2y)=\lambda(1,1)\qquad\text{c'est-à-dire}\qquad (x,y)\ \parallel\ (1,1).

Or (1,1)(1,1) est précisément le vecteur normal à la droite x+y=1x+y=1. La condition dit donc : le vecteur OM→\overrightarrow{OM} est perpendiculaire à la droite. On retrouve mot pour mot le pied de la perpendiculaire.

Vérification par la formule de la distance d'un point à une droite ax+by+c=0ax+by+c=0 :

d=∣ax0+by0+c∣a2+b2=∣0+0−1∣1+1=12=22≈0,7071. ✓d=\frac{\lvert a x_0+b y_0+c\rvert}{\sqrt{a^2+b^2}}=\frac{\lvert 0+0-1\rvert}{\sqrt{1+1}}=\frac{1}{\sqrt2}=\frac{\sqrt2}{2}\approx0{,}7071.\ \checkmark
(12,  12),d=22≈0,707\boxed{\left(\tfrac12,\;\tfrac12\right),\qquad d=\tfrac{\sqrt2}{2}\approx0{,}707}
Contrôle numérique

On parcourt la droite y=1−xy=1-x :

xx yy x2+y2x^2+y^2 distance
00 11 11 11
0,30{,}3 0,70{,}7 0,580{,}58 0,76160{,}7616
0,5\mathbf{0{,}5} 0,5\mathbf{0{,}5} 0,5\mathbf{0{,}5} 0,7071\mathbf{0{,}7071}
0,70{,}7 0,30{,}3 0,580{,}58 0,76160{,}7616
11 00 11 11

Minimum net et symétrique en x=1/2x=1/2, comme attendu de 2x2−2x+12x^2-2x+1.

Réponse : le point (12,12)\left(\tfrac12,\tfrac12\right), à distance 22≈0,707\tfrac{\sqrt2}{2}\approx0{,}707 de l'origine, avec λ=1\lambda=1.

Réponse. Point (12,12)\left(\tfrac12,\tfrac12\right), distance2=12^2=\tfrac12. (Recoupement : c'est le pied de la perpendiculaire abaissée de OO sur la droite ✓)
Faire cet exercice dans l'app →

Extrema sur le cercle

CalculDifficulté 3/5

Déterminer les extrema de f(x,y)=x+yf(x,y)=x+y sur le cercle x2+y2=1x^2+y^2=1.

Indices (3)

∇f=(1,1)=λ(2x,2y)⇒x=y\nabla f=(1,1)=\lambda(2x,2y)\Rightarrow x=y.

2x2=1⇒x=±122x^2=1\Rightarrow x=\pm\tfrac1{\sqrt2}.

Évaluer ff en chaque point.

Correction détaillée
L'idée directrice

Première contrainte non linéaire : le cercle x2+y2=1x^2+y^2=1. La substitution devient pénible (il faudrait écrire y=±1−x2y=\pm\sqrt{1-x^2}, avec deux cas et une racine non dérivable aux bords), alors que Lagrange, lui, ne coûte rien. C'est ici que la méthode gagne vraiment sa place.

Autre nouveauté : le domaine est fermé et borné — un cercle. Une fonction continue y atteint donc son maximum et son minimum : on sait d'avance que les deux existent, il n'y a plus qu'à les trouver. Cette remarque, appelée théorème des bornes atteintes, dispense de toute étude de nature.

Étape 1 — le système
f(x,y)=x+y,g(x,y)=x2+y2−1.f(x,y)=x+y,\qquad g(x,y)=x^2+y^2-1.
∇f=(1, 1),∇g=(2x, 2y).\nabla f=(1,\,1),\qquad \nabla g=(2x,\,2y).
{1=2λx1=2λyx2+y2=1\begin{cases}1=2\lambda x\\ 1=2\lambda y\\ x^2+y^2=1\end{cases}

D'abord vérifier que λ≠0\lambda\ne0 : si λ=0\lambda=0, la première équation donnerait 1=01=0, absurde. On peut donc diviser.

Des deux premières : 2λx=2λy2\lambda x=2\lambda y, donc x=yx=y. La contrainte devient 2x2=12x^2=1, soit x=±12=±22x=\pm\dfrac{1}{\sqrt2}=\pm\dfrac{\sqrt2}{2}.

Étape 2 — les deux candidats
M+=(22, 22),M−=(−22, −22).M_+=\left(\tfrac{\sqrt2}{2},\,\tfrac{\sqrt2}{2}\right),\qquad M_-=\left(-\tfrac{\sqrt2}{2},\,-\tfrac{\sqrt2}{2}\right).
f(M+)=22+22=2≈1,4142,f(M−)=−2≈−1,4142.f(M_+)=\tfrac{\sqrt2}{2}+\tfrac{\sqrt2}{2}=\sqrt2\approx1{,}4142,\qquad f(M_-)=-\sqrt2\approx-1{,}4142.

Multiplicateurs correspondants : λ=12x=±22\lambda=\dfrac{1}{2x}=\pm\dfrac{\sqrt2}{2}.

Comme le cercle est fermé borné et que ce sont les seuls points critiques, la plus grande valeur trouvée est le maximum et la plus petite est le minimum. Aucune étude supplémentaire n'est requise.

max⁡f=2 en M+,min⁡f=−2 en M−.\boxed{\max f=\sqrt2\ \text{en }M_+,\qquad \min f=-\sqrt2\ \text{en }M_-.}
La lecture géométrique

Les lignes de niveau de f(x,y)=x+yf(x,y)=x+y sont les droites x+y=cx+y=c, toutes parallèles de direction (1,−1)(1,-1). Faire croître cc, c'est translater la droite vers le haut à droite.

Le maximum de cc compatible avec le cercle est atteint quand la droite devient tangente — elle touche le cercle en un seul point sans le traverser. C'est exactement la tangence annoncée dans l'idée directrice de B1, ici parfaitement visible.

Et la condition ∇f∥∇g\nabla f\parallel\nabla g dit : (1,1)∥(2x,2y)(1,1)\parallel(2x,2y), c'est-à-dire que le rayon OM→\overrightarrow{OM} pointe dans la direction (1,1)(1,1). La tangente au cercle étant perpendiculaire au rayon, elle est bien perpendiculaire à (1,1)(1,1) : c'est une droite de niveau.

Vérification par la trigonométrie

Le cercle unité se paramètre par x=cos⁡θx=\cos\theta, y=sin⁡θy=\sin\theta. Alors

f=cos⁡θ+sin⁡θ=2 sin⁡ ⁣(θ+π4),f=\cos\theta+\sin\theta=\sqrt2\,\sin\!\left(\theta+\tfrac{\pi}{4}\right),

grâce à la formule de l'addition. Le sinus varie entre −1-1 et 11, donc ff varie entre −2-\sqrt2 et 2\sqrt2 — exactement ce que Lagrange a trouvé.

Le maximum a lieu quand θ+π/4=π/2\theta+\pi/4=\pi/2, soit θ=π/4\theta=\pi/4 : le point (cos⁡45°,sin⁡45°)=(22,22)(\cos45°,\sin45°)=\left(\tfrac{\sqrt2}{2},\tfrac{\sqrt2}{2}\right) ✓. Le minimum en θ=5π/4\theta=5\pi/4, diamétralement opposé ✓.

Avoir deux méthodes indépendantes qui donnent le même résultat est la meilleure garantie qu'on ne s'est pas trompé.

Contrôle numérique
θ\theta x=cos⁡θx=\cos\theta y=sin⁡θy=\sin\theta x+yx+y
0°0° 11 00 11
30°30° 0,86600{,}8660 0,50{,}5 1,36601{,}3660
45°\mathbf{45°} 0,7071\mathbf{0{,}7071} 0,7071\mathbf{0{,}7071} 1,4142\mathbf{1{,}4142}
60°60° 0,50{,}5 0,86600{,}8660 1,36601{,}3660
90°90° 00 11 11
225°225° −0,7071-0{,}7071 −0,7071-0{,}7071 −1,4142-1{,}4142

Le maximum 1,4142=21{,}4142=\sqrt2 tombe bien à 45°45°, avec symétrie de part et d'autre.

Réponse : maximum 2\sqrt2 en (22,22)\left(\tfrac{\sqrt2}{2},\tfrac{\sqrt2}{2}\right), minimum −2-\sqrt2 en (−22,−22)\left(-\tfrac{\sqrt2}{2},-\tfrac{\sqrt2}{2}\right).

Réponse. Max 2\sqrt2, min −2-\sqrt2 (aux points ±(12,12)\pm\left(\tfrac1{\sqrt2},\tfrac1{\sqrt2}\right)). (Recoupement : x+y=2cos⁡(θ−π4)x+y=\sqrt2\cos(\theta-\tfrac\pi4) sur le cercle, amplitude 2\sqrt2 ✓)
Faire cet exercice dans l'app →

Produit sur le cercle

CalculDifficulté 3/5

Déterminer les extrema de f(x,y)=xyf(x,y)=xy sur le cercle x2+y2=1x^2+y^2=1.

Indices (3)

∇f=(y,x)=λ(2x,2y)\nabla f=(y,x)=\lambda(2x,2y).

y=2λxy=2\lambda x et x=2λy⇒x2=y2x=2\lambda y\Rightarrow x^2=y^2.

Avec x2+y2=1x^2+y^2=1 : x2=y2=12x^2=y^2=\tfrac12.

Correction détaillée
L'idée directrice

Même contrainte qu'en B3 — le cercle unité — mais la fonction f(x,y)=xyf(x,y)=xy n'est plus linéaire. Conséquence : il y aura quatre points critiques au lieu de deux, et le système se résoudra en factorisant, pas en simplifiant.

C'est aussi l'occasion d'un réflexe à installer : quand un système donne x2=y2x^2=y^2, cela signifie y=xy=x ou y=−xy=-x — deux branches à traiter, jamais une seule.

Étape 1 — le système
∇f=(y, x),∇g=(2x, 2y).\nabla f=(y,\,x),\qquad \nabla g=(2x,\,2y).
{y=2λx(1)x=2λy(2)x2+y2=1(3)\begin{cases}y=2\lambda x\quad(1)\\ x=2\lambda y\quad(2)\\ x^2+y^2=1\quad(3)\end{cases}

Multiplions (1)(1) par yy et (2)(2) par xx :

y2=2λxy,x2=2λxy.y^2=2\lambda xy,\qquad x^2=2\lambda xy.

Les membres de droite sont identiques, donc

x2=y2⟺y=x  ou  y=−x.x^2=y^2\qquad\Longleftrightarrow\qquad y=x\ \text{ ou }\ y=-x.

(Astuce à retenir : multiplier chaque équation par la variable qui manque fait apparaître le même produit λxy\lambda xy des deux côtés, qui s'élimine tout seul.)

Étape 2 — les quatre points

Branche y=xy=x. (3)(3) donne 2x2=12x^2=1, donc x=±22x=\pm\tfrac{\sqrt2}{2} :

(22,22) et (−22,−22),f=x⋅x=x2=12.\left(\tfrac{\sqrt2}{2},\tfrac{\sqrt2}{2}\right)\ \text{et}\ \left(-\tfrac{\sqrt2}{2},-\tfrac{\sqrt2}{2}\right),\qquad f=x\cdot x=x^2=\tfrac12.

Branche y=−xy=-x. Même équation 2x2=12x^2=1 :

(22,−22) et (−22,22),f=−x2=−12.\left(\tfrac{\sqrt2}{2},-\tfrac{\sqrt2}{2}\right)\ \text{et}\ \left(-\tfrac{\sqrt2}{2},\tfrac{\sqrt2}{2}\right),\qquad f=-x^2=-\tfrac12.

Les multiplicateurs valent λ=12\lambda=\tfrac12 sur la première branche et λ=−12\lambda=-\tfrac12 sur la seconde.

Le cercle étant fermé borné :

max⁡f=12 (2 points),min⁡f=−12 (2 points).\boxed{\max f=\tfrac12\ \text{(2 points)},\qquad \min f=-\tfrac12\ \text{(2 points)}.}

Comme en A5, un extremum peut parfaitement être atteint en plusieurs points.

Vérification par la trigonométrie

Avec x=cos⁡θx=\cos\theta, y=sin⁡θy=\sin\theta :

f=cos⁡θ sin⁡θ=12sin⁡(2θ),f=\cos\theta\,\sin\theta=\tfrac12\sin(2\theta),

par la formule de duplication. Le sinus variant dans [−1,1][-1,1], ff varie dans [−12,12]\left[-\tfrac12,\tfrac12\right] ✓.

Le maximum 12\tfrac12 a lieu quand sin⁡2θ=1\sin2\theta=1, soit 2θ=90°2\theta=90° ou 450°450°, donc θ=45°\theta=45° ou 225°225° : les deux points de la branche y=xy=x ✓. Le minimum quand sin⁡2θ=−1\sin2\theta=-1, soit θ=135°\theta=135° ou 315°315° : la branche y=−xy=-x ✓.

Le facteur 22 dans sin⁡(2θ)\sin(2\theta) explique d'un coup pourquoi il y a quatre points ici contre deux en B3 : la fonction fait deux tours pendant que le point en fait un.

Contrôle numérique
θ\theta xx yy xyxy
0°0° 11 00 00
30°30° 0,86600{,}8660 0,50{,}5 0,43300{,}4330
45°\mathbf{45°} 0,70710{,}7071 0,70710{,}7071 0,5\mathbf{0{,}5}
60°60° 0,50{,}5 0,86600{,}8660 0,43300{,}4330
90°90° 00 11 00
135°\mathbf{135°} −0,7071-0{,}7071 0,70710{,}7071 −0,5\mathbf{-0{,}5}
225°225° −0,7071-0{,}7071 −0,7071-0{,}7071 0,50{,}5

On voit les quatre extrema se succéder tous les 45°45°, séparés par des zéros sur les axes.

Ce que ça dit au passage

Le résultat xy≤12xy\le\tfrac12 sur le cercle unité est une inégalité classique déguisée. Sur x2+y2=1x^2+y^2=1 elle s'écrit

xy ≤ x2+y22,xy\ \le\ \frac{x^2+y^2}{2},

qui est vraie pour tous réels, puisqu'elle équivaut à 0≤(x−y)20\le(x-y)^2. L'égalité a lieu si et seulement si x=yx=y — exactement les points trouvés.

Réponse : maximum 12\tfrac12 en ±(22,22)\pm\left(\tfrac{\sqrt2}{2},\tfrac{\sqrt2}{2}\right), minimum −12-\tfrac12 en ±(22,−22)\pm\left(\tfrac{\sqrt2}{2},-\tfrac{\sqrt2}{2}\right).

Réponse. Max 12\tfrac12, min −12-\tfrac12. (Recoupement : xy=12sin⁡(2θ)xy=\tfrac12\sin(2\theta) sur le cercle, amplitude 12\tfrac12 ✓)
Faire cet exercice dans l'app →

Produit maximal à somme fixée

ApplicationDifficulté 3/5

Maximiser f(x,y,z)=xyzf(x,y,z)=xyz sous x+y+z=3x+y+z=3 avec x,y,z>0x,y,z>0.

Indices (3)

∇f=(yz,xz,xy)=λ(1,1,1)\nabla f=(yz,xz,xy)=\lambda(1,1,1).

yz=xz=xy⇒x=y=zyz=xz=xy\Rightarrow x=y=z.

Reporter dans la contrainte.

Correction détaillée
L'idée directrice

Premier problème à trois variables. La méthode ne change pas d'un iota : on écrit ∇f=λ∇g\nabla f=\lambda\nabla g, ce qui donne maintenant trois équations, plus la contrainte, soit quatre équations à quatre inconnues (x,y,z,λ)(x,y,z,\lambda).

Ce qui change, c'est la façon de résoudre : à trois variables, on ne substitue plus tête baissée. On cherche une symétrie ou une combinaison qui simplifie. Ici f(x,y,z)=xyzf(x,y,z)=xyz et la contrainte x+y+z=3x+y+z=3 sont toutes deux complètement symétriques — les échanger de n'importe quelle façon ne change rien —, ce qui laisse fortement présager une solution où les trois variables sont égales.

Étape 1 — le système
∇f=(yz, xz, xy),∇g=(1, 1, 1).\nabla f=(yz,\,xz,\,xy),\qquad \nabla g=(1,\,1,\,1).
{yz=λxz=λxy=λx+y+z=3\begin{cases}yz=\lambda\\ xz=\lambda\\ xy=\lambda\\ x+y+z=3\end{cases}

Les trois premières donnent yz=xz=xyyz=xz=xy.

Comme le problème impose x,y,z>0x,y,z>0, aucune variable n'est nulle et on peut diviser sans crainte :

  • yz=xzyz=xz, on divise par z≠0z\neq0 :   y=x\;y=x ;
  • xz=xyxz=xy, on divise par x≠0x\neq0 :   z=y\;z=y.

Donc x=y=zx=y=z, et la contrainte donne 3x=33x=3 :

x=y=z=1,λ=1×1=1,f(1,1,1)=1.x=y=z=1,\qquad \lambda=1\times1=1,\qquad f(1,1,1)=1.

Noter à quel point l'hypothèse x,y,z>0x,y,z>0 a servi : sans elle, (0,0,3)(0,0,3), (0,3,0)(0,3,0) et (3,0,0)(3,0,0) seraient aussi des points critiques, avec λ=0\lambda=0 et f=0f=0. L'énoncé les écarte.

Étape 2 — pourquoi c'est un maximum

Le domaine {x,y,z>0, x+y+z=3}\{x,y,z>0,\ x+y+z=3\} est un triangle ouvert : le théorème des bornes atteintes ne s'applique pas directement. Il faut donc examiner ce qui se passe au bord.

Quand une variable tend vers 00, le produit xyzxyz tend vers 00. Sur le bord fermé, ff vaut donc 00 partout — c'est la plus petite valeur possible, puisque f>0f>0 à l'intérieur.

Donc : ff est continue sur le triangle fermé (compact), y atteint son maximum, ce maximum est >0>0 donc n'est pas sur le bord, donc il est à l'intérieur, donc c'est un point critique. Le seul est (1,1,1)(1,1,1).

max⁡f=1 en (1,1,1).\boxed{\max f=1\ \text{en }(1,1,1).}
La vérification qui vaut démonstration

Ce résultat est l'inégalité arithmético-géométrique pour trois nombres :

xyz3 ≤ x+y+z3,\sqrt[3]{xyz}\ \le\ \frac{x+y+z}{3},

avec égalité si et seulement si x=y=zx=y=z. Ici le membre de droite vaut 33=1\dfrac33=1, donc

xyz3≤1⟹xyz≤1,\sqrt[3]{xyz}\le1\qquad\Longrightarrow\qquad xyz\le1,

avec égalité exactement en (1,1,1)(1,1,1). Lagrange retrouve une inégalité classique — et réciproquement, l'inégalité prouve que le candidat de Lagrange est bien le maximum global. Les deux se confortent.

Contrôle numérique
(x,y,z)(x,y,z) somme produit
(1,1,1)\mathbf{(1,1,1)} 33 1\mathbf{1}
(1,1 ; 1 ; 0,9)(1{,}1\,;\,1\,;\,0{,}9) 33 0,990{,}99
(1,2 ; 1 ; 0,8)(1{,}2\,;\,1\,;\,0{,}8) 33 0,960{,}96
(1,5 ; 1 ; 0,5)(1{,}5\,;\,1\,;\,0{,}5) 33 0,750{,}75
(2 ; 0,5 ; 0,5)(2\,;\,0{,}5\,;\,0{,}5) 33 0,50{,}5
(2,5 ; 0,25 ; 0,25)(2{,}5\,;\,0{,}25\,;\,0{,}25) 33 0,156250{,}15625

Plus on déséquilibre, plus le produit s'effondre. Le maximum récompense l'égalité parfaite — c'est le contenu même de l'inégalité arithmético-géométrique.

La forme générale, à retenir

Le même calcul avec x+y+z=sx+y+z=s donne x=y=z=s/3x=y=z=s/3 et un produit maximal de (s/3)3(s/3)^3. Et à nn variables, x1+⋯+xn=sx_1+\dots+x_n=s donne un produit maximal (s/n)n(s/n)^n, atteint quand toutes les variables sont égales.

C'est le principe derrière une foule de résultats : parmi les rectangles de périmètre donné, le carré maximise l'aire (exercice B1) ; parmi les boîtes de somme d'arêtes donnée, le cube maximise le volume ; etc.

Réponse : maximum 11, atteint en (1,1,1)(1,1,1), avec λ=1\lambda=1.

Réponse. Maximum 11 en (1,1,1)(1,1,1). (Recoupement : inégalité arithmético-géométrique xyz≤(x+y+z3)3=1xyz\le\left(\tfrac{x+y+z}3\right)^3=1, égalité ssi x=y=zx=y=z ✓)
Faire cet exercice dans l'app →

Distance d'un point à un plan

ApplicationDifficulté 3/5

Trouver le point du plan x+2y+3z=14x+2y+3z=14 le plus proche de l'origine (minimiser x2+y2+z2x^2+y^2+z^2).

Indices (3)

∇f=(2x,2y,2z)=λ(1,2,3)\nabla f=(2x,2y,2z)=\lambda(1,2,3).

x=λ2, y=λ, z=3λ2x=\tfrac\lambda2,\ y=\lambda,\ z=\tfrac{3\lambda}2.

Reporter dans la contrainte.

Correction détaillée
L'idée directrice

C'est l'exercice B2 monté d'une dimension : on cherche le point d'un plan le plus proche de l'origine, et la réponse doit être le pied de la perpendiculaire au plan.

Deux réflexes déjà installés se retrouvent tels quels :

  • on minimise le carré de la distance, f(x,y,z)=x2+y2+z2f(x,y,z)=x^2+y^2+z^2, pour éviter le radical ;
  • le gradient de la contrainte, ∇g=(1,2,3)\nabla g=(1,2,3), n'est autre que le vecteur normal au plan.

À la fin, on vérifiera avec la formule de la distance d'un point à un plan, qui doit redonner la même chose.

Étape 1 — le système

Contrainte : g(x,y,z)=x+2y+3z−14=0g(x,y,z)=x+2y+3z-14=0.

∇f=(2x, 2y, 2z),∇g=(1, 2, 3).\nabla f=(2x,\,2y,\,2z),\qquad \nabla g=(1,\,2,\,3).
{2x=λ2y=2λ2z=3λx+2y+3z=14\begin{cases}2x=\lambda\\ 2y=2\lambda\\ 2z=3\lambda\\ x+2y+3z=14\end{cases}

Les trois premières se lisent d'un coup :

x=λ2,y=λ,z=3λ2.x=\frac{\lambda}{2},\qquad y=\lambda,\qquad z=\frac{3\lambda}{2}.

Autrement dit (x,y,z)=λ2 (1,2,3)(x,y,z)=\dfrac{\lambda}{2}\,(1,2,3) : le point cherché est sur la normale au plan passant par l'origine, ce qui est exactement la définition du pied de la perpendiculaire. La méthode le sort toute seule.

Étape 2 — le multiplicateur, puis le point

On reporte dans la contrainte :

λ2+2λ+3⋅3λ2=14⟺λ2+2λ+9λ2=14.\frac{\lambda}{2}+2\lambda+3\cdot\frac{3\lambda}{2}=14\quad\Longleftrightarrow\quad\frac{\lambda}{2}+2\lambda+\frac{9\lambda}{2}=14.

En mettant tout sur 22 : λ+4λ+9λ2=14λ2=7λ=14\dfrac{\lambda+4\lambda+9\lambda}{2}=\dfrac{14\lambda}{2}=7\lambda=14, donc

λ=2,(x,y,z)=(1, 2, 3).\lambda=2,\qquad (x,y,z)=(1,\,2,\,3).
f(1,2,3)=1+4+9=14,distance=14≈3,7417.f(1,2,3)=1+4+9=14,\qquad \text{distance}=\sqrt{14}\approx3{,}7417.

Coïncidence remarquable et instructive : le point (1,2,3)(1,2,3) est le vecteur normal lui-même, et ff vaut 1414, qui est aussi le second membre. Ce n'est pas un hasard — le coefficient 14=12+22+3214=1^2+2^2+3^2 est le carré de la norme de la normale.

Étape 3 — confirmer par une autre voie

La formule du cours. La distance de l'origine au plan ax+by+cz+d=0ax+by+cz+d=0 vaut

∣d∣a2+b2+c2=∣−14∣1+4+9=1414=14≈3,7417. ✓\frac{\lvert d\rvert}{\sqrt{a^2+b^2+c^2}}=\frac{\lvert-14\rvert}{\sqrt{1+4+9}}=\frac{14}{\sqrt{14}}=\sqrt{14}\approx3{,}7417.\ \checkmark

Par Cauchy–Schwarz. Pour tout point du plan,

14=∣x+2y+3z∣=∣(x,y,z)⋅(1,2,3)∣ ≤ x2+y2+z2⋅14,14=\lvert x+2y+3z\rvert=\bigl\lvert (x,y,z)\cdot(1,2,3)\bigr\rvert\ \le\ \sqrt{x^2+y^2+z^2}\cdot\sqrt{14},

d'où x2+y2+z2≥1414=14\sqrt{x^2+y^2+z^2}\ge\dfrac{14}{\sqrt{14}}=\sqrt{14}. L'égalité dans Cauchy–Schwarz a lieu exactement quand les deux vecteurs sont colinéaires, ce qui redonne (x,y,z)=t(1,2,3)(x,y,z)=t(1,2,3), puis t=1t=1.

Ce dernier argument est le meilleur des trois : il prouve d'un coup que c'est bien un minimum global, sans étude de nature.

(1, 2, 3),d=14≈3,742\boxed{(1,\,2,\,3),\qquad d=\sqrt{14}\approx3{,}742}
Contrôle numérique

Tous les points ci-dessous vérifient x+2y+3z=14x+2y+3z=14 :

(x,y,z)(x,y,z) x2+y2+z2x^2+y^2+z^2 distance
(1,2,3)\mathbf{(1,2,3)} 14\mathbf{14} 3,7417\mathbf{3{,}7417}
(1,1 ; 2 ; 2,9667)(1{,}1\,;\,2\,;\,2{,}9667) 14,011114{,}0111 3,74313{,}7431
(0,9 ; 2 ; 3,0333)(0{,}9\,;\,2\,;\,3{,}0333) 14,011114{,}0111 3,74313{,}7431
(1 ; 2,1 ; 2,9333)(1\,;\,2{,}1\,;\,2{,}9333) 14,014414{,}0144 3,74363{,}7436
(2 ; 2 ; 2,6667)(2\,;\,2\,;\,2{,}6667) 15,111115{,}1111 3,88733{,}8873
(0 ; 0 ; 4,6667)(0\,;\,0\,;\,4{,}6667) 21,777821{,}7778 4,66674{,}6667
(0 ; 7 ; 0)(0\,;\,7\,;\,0) 4949 77

Attention en construisant un tel tableau : chaque point doit être sur le plan. On fixe xx et yy, puis on calcule z=(14−x−2y)/3z=(14-x-2y)/3 — on ne bouge pas une coordonnée sans corriger les autres, sinon on compare des points qui ne sont pas dans le domaine.

Réponse : le point (1,2,3)(1,2,3), à distance 14≈3,742\sqrt{14}\approx3{,}742 de l'origine, avec λ=2\lambda=2.

Réponse. Point (1,2,3)(1,2,3), distance2=14^2=14. (Recoupement : formule d2=14212+22+32=19614=14d^2=\tfrac{14^2}{1^2+2^2+3^2}=\tfrac{196}{14}=14 ✓)
Faire cet exercice dans l'app →

Forme quadratique convexe

CalculDifficulté 3/5

Montrer que f(x,y)=x2+xy+y2f(x,y)=x^2+xy+y^2 est strictement convexe et donner son minimum global.

Indices (3)

Calculer la Hessienne (constante).

Convexité ⇔\Leftrightarrow Hessienne ⪰0\succeq0 (vp ≥0\ge0).

Le point critique d'une fonction convexe est le min global.

Correction détaillée
L'idée directrice

La convexité est la propriété qui transforme l'optimisation d'un art en une routine. Une fonction convexe n'a pas de « faux minimum » où l'on pourrait rester piégé : dès qu'on trouve un point critique, c'est le minimum, et il est global.

Pour une fonction deux fois dérivable, la convexité se lit sur la hessienne :

hessienne fonction
semi-définie positive (≥0\ge0) partout convexe
définie positive (>0>0) partout strictement convexe (condition suffisante, pas nécessaire)

Ici f(x,y)=x2+xy+y2f(x,y)=x^2+xy+y^2 est une forme quadratique : sa hessienne est constante, donc il suffit de la calculer une fois.

Étape 1 — la hessienne
fx=2x+y,fy=x+2y,f_x=2x+y,\qquad f_y=x+2y,
r=fxx=2,s=fxy=1,t=fyy=2.r=f_{xx}=2,\qquad s=f_{xy}=1,\qquad t=f_{yy}=2.
H=(2112).H=\begin{pmatrix}2&1\\1&2\end{pmatrix}.

Elle ne dépend pas du point — c'est le propre des quadratiques.

Étape 2 — trois preuves qu'elle est définie positive

Chacune est suffisante ; les connaître toutes permet de choisir la plus rapide selon la situation.

(a) Le critère de Sylvester (le plus mécanique). On regarde les mineurs principaux dominants — les déterminants des sous-matrices en haut à gauche :

Δ1=2>0,Δ2=det⁡H=2×2−1×1=3>0.\Delta_1=2>0,\qquad \Delta_2=\det H=2\times2-1\times1=3>0.

Tous strictement positifs ⇒\Rightarrow HH définie positive.

(b) Les valeurs propres. det⁡(H−μI)=(2−μ)2−1=0\det(H-\mu I)=(2-\mu)^2-1=0 donne 2−μ=±12-\mu=\pm1, soit

μ1=1,μ2=3.\mu_1=1,\qquad \mu_2=3.

Toutes deux >0>0 ⇒\Rightarrow définie positive. (Contrôle : leur somme 1+3=41+3=4 doit valoir la trace 2+2=42+2=4 ✓ ; leur produit 1×3=31\times3=3 doit valoir le déterminant 33 ✓.)

(c) La forme canonique (la plus parlante). On complète le carré en xx :

x2+xy+y2=(x+y2)2−y24+y2=(x+y2)2+3y24.x^2+xy+y^2=\left(x+\frac{y}{2}\right)^2-\frac{y^2}{4}+y^2=\left(x+\frac{y}{2}\right)^2+\frac{3y^2}{4}.

Somme de deux carrés à coefficients >0>0 : positive, et nulle seulement si les deux termes le sont.

Étape 3 — le minimum global

Le point critique : 2x+y=02x+y=0 et x+2y=0x+2y=0. Ce système linéaire a pour déterminant 3≠03\ne0, donc une unique solution, (0,0)(0,0), où f=0f=0.

Et la forme canonique conclut sans appel :

f(x,y)=(x+y2)2+3y24 ≥ 0,f(x,y)=\left(x+\frac{y}{2}\right)^2+\frac{3y^2}{4}\ \ge\ 0,

avec égalité si et seulement si y=0y=0 (second terme) et x+y/2=0x+y/2=0 (premier terme), c'est-à-dire x=y=0x=y=0.

min⁡f=0, atteint uniquement en (0,0), et ce minimum est global.\boxed{\min f=0,\ \text{atteint uniquement en }(0,0),\ \text{et ce minimum est global.}}

Comparer avec l'exercice A3 : là-bas, le minimum n'était que local, parce que ff n'y était pas convexe. C'est la convexité, et rien d'autre, qui autorise le passage du local au global.

Contrôle numérique
point ff
(0,0)(0,0) 00
(0,1 ; 0)(0{,}1\,;\,0) 0,010{,}01
(0 ; 0,1)(0\,;\,0{,}1) 0,010{,}01
(0,1 ; −0,1)(0{,}1\,;\,-0{,}1) 0,010{,}01
(1,−1)(1,-1) 11
(1,1)(1,1) 33
(−1,−1)(-1,-1) 33

Toujours >0>0 hors de l'origine. Noter que (1,−1)(1,-1) donne 11 alors que (1,1)(1,1) donne 33 : la cuvette est plus douce dans la direction (1,−1)(1,-1) — c'est la direction propre associée à la petite valeur propre μ1=1\mu_1=1, et plus raide dans la direction (1,1)(1,1), associée à μ2=3\mu_2=3. Les valeurs propres se lisent donc directement sur la forme de la cuvette.

Réponse. Strictement convexe (vp 1,3>01,3>0), minimum global 00 en (0,0)(0,0). (Recoupement : det⁡H=3>0\det H=3>0, tr H=4>0\mathrm{tr}\,H=4>0 ⇒ Hessienne définie positive ✓)
Faire cet exercice dans l'app →

Convexité selon un paramètre

CalculDifficulté 3/5

Pour quelles valeurs de aa la fonction f(x,y)=x2+axy+y2f(x,y)=x^2+axy+y^2 est-elle convexe ?

Indices (3)

H=(2aa2)H=\begin{pmatrix}2&a\\a&2\end{pmatrix}.

Convexe ⇔H⪰0⇔det⁡H≥0\Leftrightarrow H\succeq0\Leftrightarrow\det H\ge0 et diagonale ≥0\ge0.

det⁡H=4−a2\det H=4-a^2.

Correction détaillée
L'idée directrice

Même famille qu'en E1, mais avec un paramètre : la question n'est plus « est-elle convexe ? » mais « pour quelles valeurs de aa l'est-elle ? ». La réponse sera un intervalle, et il faudra soigner ses bornes — c'est là que se joue tout l'exercice.

f(x,y)=x2+axy+y2.f(x,y)=x^2+axy+y^2.

Deux pièges à éviter dès le départ :

  • ne pas oublier le facteur : fxy=af_{xy}=a, pas 2a2a (le terme axyaxy dérivé en xx donne ayay, puis en yy donne aa) ;
  • convexe demande la hessienne semi-définie positive, donc des inégalités larges. Les bornes a=±2a=\pm2 sont donc incluses.
Étape 1 — la hessienne
fx=2x+ay,fy=ax+2y,f_x=2x+ay,\qquad f_y=ax+2y,
r=fxx=2,s=fxy=a,t=fyy=2,r=f_{xx}=2,\qquad s=f_{xy}=a,\qquad t=f_{yy}=2,
H=(2aa2),det⁡H=4−a2.H=\begin{pmatrix}2&a\\a&2\end{pmatrix},\qquad \det H=4-a^2.
Étape 2 — la condition

On veut HH semi-définie positive, c'est-à-dire (pour une matrice symétrique 2×22\times2) :

tr⁡H=4 ≥0toujours ✓,det⁡H=4−a2 ≥0.\operatorname{tr}H=4\ \ge0\quad\text{toujours }\checkmark,\qquad \det H=4-a^2\ \ge0.
4−a2≥0⟺a2≤4⟺∣a∣≤2⟺−2≤a≤24-a^2\ge0\quad\Longleftrightarrow\quad a^2\le4\quad\Longleftrightarrow\quad \lvert a\rvert\le2\quad\Longleftrightarrow\quad \boxed{-2\le a\le2}

Et pour la convexité stricte, il faut det⁡H>0\det H>0, soit −2<a<2-2<a<2 (bornes exclues).

Étape 3 — examiner les bornes, qui sont le cœur du sujet

Cas a=2a=2. f=x2+2xy+y2=(x+y)2f=x^2+2xy+y^2=(x+y)^2. Cette fonction est convexe — c'est un carré — mais pas strictement : elle est nulle sur toute la droite y=−xy=-x. Le minimum 00 n'est plus atteint en un point mais sur une droite entière. La hessienne (2222)\begin{pmatrix}2&2\\2&2\end{pmatrix} a pour valeurs propres 00 et 44 : la valeur propre nulle est exactement la direction plate.

Cas a=−2a=-2. f=(x−y)2f=(x-y)^2, symétriquement : nulle sur y=xy=x.

Cas ∣a∣>2\lvert a\rvert>2, par exemple a=3a=3 : det⁡H=4−9=−5<0\det H=4-9=-5<0, valeurs propres −1-1 et 55, de signes opposés. On reconnaît un point col en (0,0)(0,0) (exercices A2, A4). Vérification directe : f(x,x)=2x2+3x2=5x2>0f(x,x)=2x^2+3x^2=5x^2>0 mais f(x,−x)=2x2−3x2=−x2<0f(x,-x)=2x^2-3x^2=-x^2<0. Des deux signes autour de l'origine : pas convexe, et pas de minimum.

Tableau récapitulatif
aa det⁡H\det H valeurs propres conclusion
−3-3 −5-5 −1-1 et 55 non convexe (col)
−2\mathbf{-2} 0\mathbf{0} 00 et 44 convexe, non stricte : f=(x−y)2f=(x-y)^2
−1-1 33 11 et 33 strictement convexe
00 44 22 et 22 strictement convexe : f=x2+y2f=x^2+y^2
11 33 11 et 33 strictement convexe
2\mathbf{2} 0\mathbf{0} 00 et 44 convexe, non stricte : f=(x+y)2f=(x+y)^2
33 −5-5 −1-1 et 55 non convexe (col)

Le tableau est symétrique en a↦−aa\mapsto-a, ce qui était prévisible : changer yy en −y-y transforme le cas aa en le cas −a-a.

Réponse : ff est convexe si et seulement si −2≤a≤2-2\le a\le2, et strictement convexe si et seulement si −2<a<2-2<a<2.

Ce qu'il faut retenir de la forme

Pour une forme quadratique générale q(x,y)=αx2+βxy+γy2q(x,y)=\alpha x^2+\beta xy+\gamma y^2, la hessienne est (2αββ2γ)\begin{pmatrix}2\alpha&\beta\\\beta&2\gamma\end{pmatrix} et la condition det⁡≥0\det\ge0 s'écrit

4αγ−β2≥0,soitβ2≤4αγ4\alpha\gamma-\beta^2\ge0,\qquad\text{soit}\qquad \beta^2\le4\alpha\gamma

— c'est-à-dire, au signe près, le discriminant du trinôme αX2+βX+γ\alpha X^2+\beta X+\gamma. Une forme quadratique est positive exactement quand α≥0\alpha\ge0, γ≥0\gamma\ge0 et que le discriminant β2−4αγ\beta^2-4\alpha\gamma du trinôme associé est négatif ou nul. Ce pont entre « discriminant négatif » et « pas de changement de signe » est le même objet vu de deux côtés.

Réponse. Convexe ssi ∣a∣≤2|a|\le2 (strictement convexe ssi ∣a∣<2|a|<2). (Recoupement : pour ∣a∣>2|a|>2 la Hessienne a une valeur propre négative — fonction non convexe, point col en 0⃗\vec0 ✓)
Faire cet exercice dans l'app →

Descente de gradient 1D

CalculDifficulté 3/5

Appliquer la descente de gradient à f(x)=x2f(x)=x^2 depuis x0=1x_0=1 avec un pas α=0,1\alpha=0{,}1 : donner x1,x2,x3x_1,x_2,x_3. Pour quels α\alpha converge-t-elle ?

Indices (3)

f′(x)=2xf'(x)=2x, donc xn+1=xn−α⋅2xn=(1−2α)xnx_{n+1}=x_n-\alpha\cdot2x_n=(1-2\alpha)x_n.

Itérer avec α=0,1\alpha=0{,}1.

Convergence vers 00 ssi ∣1−2α∣<1|1-2\alpha|<1.

Correction détaillée
L'idée directrice

La descente de gradient est l'algorithme d'optimisation le plus utilisé au monde — c'est lui qui entraîne les réseaux de neurones. Son principe tient en une phrase : le gradient pointe vers la plus forte montée, donc on avance dans la direction opposée.

xk+1=xk−α f′(xk),x_{k+1}=x_k-\alpha\,f'(x_k),

où α>0\alpha>0 est le pas (ou taux d'apprentissage). Le pas est le seul réglage, et c'est tout l'enjeu : trop petit, on n'avance pas ; trop grand, on saute par-dessus le minimum et on s'éloigne.

Sur f(x)=x2f(x)=x^2, tout se calcule exactement, ce qui permet de voir précisément où bascule la convergence.

Étape 1 — la récurrence explicite
f(x)=x2 ⟹ f′(x)=2x,f(x)=x^2\ \Longrightarrow\ f'(x)=2x,
xk+1=xk−α⋅2xk=(1−2α) xk.x_{k+1}=x_k-\alpha\cdot 2x_k=(1-2\alpha)\,x_k.

C'est une suite géométrique de raison q=1−2αq=1-2\alpha. D'où la forme close

xk=(1−2α)k x0.x_k=(1-2\alpha)^k\,x_0.

Le comportement ne dépend donc que de ∣q∣\lvert q\rvert — et cette réduction à un seul nombre est ce qui rend l'exemple si instructif.

Étape 2 — les trois premiers pas ($\alpha=0{,}1$)

Avec α=0,1\alpha=0{,}1, la raison vaut q=1−0,2=0,8q=1-0{,}2=0{,}8, et x0=1x_0=1 :

x1=0,8×1=0,8,x2=0,8×0,8=0,64,x3=0,8×0,64=0,512.x_1=0{,}8\times1=\boxed{0{,}8},\qquad x_2=0{,}8\times0{,}8=\boxed{0{,}64},\qquad x_3=0{,}8\times0{,}64=\boxed{0{,}512}.

En fractions exactes : 45, 1625, 64125\dfrac45,\ \dfrac{16}{25},\ \dfrac{64}{125}.

La suite continue 0,40960{,}4096 ; 0,327680{,}32768 ; 0,2621440{,}262144… et tend vers 00, qui est bien le minimum de x2x^2. La convergence est géométrique : on gagne un facteur 0,80{,}8 à chaque étape, donc il faut environ 1010 itérations pour diviser la distance par 1010 (puisque 0,810≈0,1070{,}8^{10}\approx0{,}107).

Étape 3 — pour quels $\alpha$ ça converge

La suite géométrique xk=qkx0x_k=q^k x_0 tend vers 00 si et seulement si ∣q∣<1\lvert q\rvert<1 :

∣1−2α∣<1⟺−1<1−2α<1⟺0<2α<2⟺0<α<1\lvert 1-2\alpha\rvert<1\quad\Longleftrightarrow\quad -1<1-2\alpha<1\quad\Longleftrightarrow\quad 0<2\alpha<2\quad\Longleftrightarrow\quad \boxed{0<\alpha<1}

Détaillons ce qui se passe selon α\alpha — c'est le tableau à retenir :

α\alpha q=1−2αq=1-2\alpha comportement
0,10{,}1 0,80{,}8 converge lentement, sans changer de signe
0,50{,}5 00 atteint le minimum en UN pas (pas optimal)
0,60{,}6 −0,2-0{,}2 converge en oscillant autour de 00
0,90{,}9 −0,8-0{,}8 converge en oscillant, lentement
11 −1-1 oscille sans fin entre 11 et −1-1 : ne converge pas
1,21{,}2 −1,4-1{,}4 diverge en oscillant
Voir la divergence en chiffres

C'est le comportement le plus instructif, parce qu'en pratique c'est le symptôme d'un pas mal réglé. Avec α=1,2\alpha=1{,}2 (donc q=−1,4q=-1{,}4), depuis x0=1x_0=1 :

kk xkx_k
00 11
11 −1,4-1{,}4
22 1,961{,}96
33 −2,744-2{,}744
44 3,84163{,}8416
55 −5,3782-5{,}3782

L'algorithme saute par-dessus le minimum, et de plus en plus loin. Le signe alterne : c'est la signature visuelle d'un pas trop grand.

À comparer avec α=0,6\alpha=0{,}6 (q=−0,2q=-0{,}2), qui oscille aussi mais en rétrécissant : −0,2-0{,}2 ; 0,040{,}04 ; −0,008-0{,}008 ; 0,00160{,}0016. Oscillation n'est donc pas divergence : ce qui compte est ∣q∣\lvert q\rvert, pas son signe.

Le pas optimal, et sa portée

Le meilleur pas est celui qui annule qq : α=12\alpha=\tfrac12, et l'algorithme atteint le minimum exactement en une itération. Ce n'est pas une coïncidence : ce pas vaut 1f′′=12\dfrac{1}{f''}=\dfrac12, et un pas 1/f′′1/f'' n'est autre que la méthode de Newton, qui résout exactement une quadratique en un coup.

Attention à ne pas généraliser trop vite : dès qu'il y a plusieurs variables avec des courbures différentes, aucun pas ne peut annuler toutes les raisons à la fois. C'est précisément l'objet de l'exercice suivant.

Réponse : x1=0,8x_1=0{,}8, x2=0,64x_2=0{,}64, x3=0,512x_3=0{,}512 ; la méthode converge si et seulement si 0<α<10<\alpha<1, et le pas optimal est α=12\alpha=\tfrac12.

Réponse. x1=0,8x_1=0{,}8, x2=0,64x_2=0{,}64, x3=0,512x_3=0{,}512 ; converge ssi 0<α<10<\alpha<1. (Recoupement : suite géométrique de raison 1−2α1-2\alpha ; α=12\alpha=\tfrac12 atteint le min en un pas ✓)
Faire cet exercice dans l'app →

Pas et conditionnement

DémonstrationDifficulté 3/5

Pour f(x,y)=x2+10y2f(x,y)=x^2+10y^2, expliquer pourquoi le pas α\alpha de la descente de gradient doit vérifier α<110\alpha<\tfrac1{10}, et pourquoi la convergence est lente.

Indices (3)

∇f=(2x,20y)\nabla f=(2x,20y), donc xn+1=(1−2α)xnx_{n+1}=(1-2\alpha)x_n et yn+1=(1−20α)yny_{n+1}=(1-20\alpha)y_n.

Chaque composante est stable ssi son facteur est <1<1 en module.

La plus grande courbure (2020) impose le pas.

Correction détaillée
L'idée directrice

On passe à deux variables, avec des courbures très différentes dans chaque direction :

f(x,y)=x2+10y2.f(x,y)=x^2+10y^2.

Les lignes de niveau sont des ellipses très allongées — une vallée étroite. L'algorithme y rencontre son problème le plus caractéristique : la direction raide impose un pas petit, mais ce pas est alors ridiculement petit pour la direction plate. On avance donc au rythme de la plus lente, en étant bridé par la plus rapide.

Étape 1 — deux récurrences indépendantes
fx=2x,fy=20y.f_x=2x,\qquad f_y=20y.

La descente s'écrit :

{xk+1=xk−2αxk=(1−2α) xkyk+1=yk−20αyk=(1−20α) yk\begin{cases}x_{k+1}=x_k-2\alpha x_k=(1-2\alpha)\,x_k\\[2pt] y_{k+1}=y_k-20\alpha y_k=(1-20\alpha)\,y_k\end{cases}

Point capital : les deux coordonnées évoluent sans se parler, chacune comme une suite géométrique, mais avec des raisons différentes :

qx=1−2α,qy=1−20α.q_x=1-2\alpha,\qquad q_y=1-20\alpha.

Un seul pas α\alpha pour deux raisons : voilà toute la difficulté.

Étape 2 — d'où vient la condition $\alpha<\tfrac1{10}$

La convergence exige que les deux raisons soient de module <1<1 :

∣1−2α∣<1  ⟺  0<α<1,∣1−20α∣<1  ⟺  0<α<110.\lvert 1-2\alpha\rvert<1\iff 0<\alpha<1,\qquad \lvert 1-20\alpha\rvert<1\iff 0<\alpha<\tfrac1{10}.

L'intersection est 0<α<1100<\alpha<\tfrac1{10} : c'est la contrainte la plus sévère qui gagne, et elle vient de la direction la plus raide (celle où la courbure vaut 2020).

Ce qui se passe si on dépasse :

α\alpha qxq_x qyq_y résultat
1/20=0,051/20=0{,}05 0,90{,}9 0\mathbf{0} yy réglé en 1 pas, xx décroît de 10 %
1/11≈0,09091/11\approx0{,}0909 0,81820{,}8182 −0,8182-0{,}8182 les deux au même rythme — optimal
1/10=0,11/10=0{,}1 0,80{,}8 −1\mathbf{-1} yy oscille sans jamais décroître
1/9≈0,1111/9\approx0{,}111 0,77780{,}7778 −1,2222-1{,}2222 yy diverge

À α=1/10\alpha=1/10 exactement, yy rebondit indéfiniment entre 11 et −1-1 : ff ne descend plus en dessous de 1010. La borne est donc stricte.

Étape 3 — la divergence en chiffres

Départ (1,1)(1,1), avec α=1/9\alpha=1/9 :

kk xkx_k yky_k ff
00 11 11 1111
11 0,77780{,}7778 −1,2222-1{,}2222 15,5415{,}54
22 0,60490{,}6049 1,49381{,}4938 22,6822{,}68
33 0,47050{,}4705 −1,8258-1{,}8258 33,5633{,}56
44 0,36600{,}3660 2,23152{,}2315 49,9349{,}93

Observation frappante : xx converge très bien pendant que yy explose. Et ff augmente, alors que la méthode est censée la faire descendre ! Le tout à cause d'un pas dépassant à peine le seuil (0,1110{,}111 contre 0,10{,}1).

C'est le mode d'échec typique en apprentissage automatique, où l'on voit la fonction de coût partir vers l'infini : le remède est presque toujours de diviser le pas.

Étape 4 — pourquoi c'est LENT même quand ça converge

Prenons le meilleur pas possible. Il équilibre les deux raisons, 1−2α=−(1−20α)1-2\alpha=-(1-20\alpha), soit 22α=222\alpha=2 :

α⋆=111,∣qx∣=∣qy∣=911≈0,8182.\alpha^\star=\frac1{11},\qquad \lvert q_x\rvert=\lvert q_y\rvert=\frac{9}{11}\approx0{,}8182.

Même optimalement réglée, la descente ne gagne qu'un facteur 0,820{,}82 par itération — contre le facteur 00 (un seul pas !) qu'on obtenait sur x2x^2 en E3.

La quantité qui gouverne tout est le conditionnement, rapport des courbures :

κ=202=10,taux optimal=κ−1κ+1=911≈0,818.\kappa=\frac{20}{2}=10,\qquad \text{taux optimal}=\frac{\kappa-1}{\kappa+1}=\frac{9}{11}\approx0{,}818.
  • κ=1\kappa=1 (cuvette ronde) : taux 00, convergence en un pas ;
  • κ=10\kappa=10 : taux 0,820{,}82, il faut ≈12\approx12 itérations pour gagner un facteur 1010 ;
  • κ=1000\kappa=1000 : taux ≈0,998\approx0{,}998, il en faudrait plus de 10001000.

Le conditionnement, et non le nombre de variables, est ce qui rend une descente lente.

Ce qu'on fait en pratique

Trois remèdes classiques, tous destinés à combattre un κ\kappa élevé :

  • remettre les variables à l'échelle — ici le changement u=y10u=y\sqrt{10} donne f=x2+u2f=x^2+u^2, donc κ=1\kappa=1 : le problème devient trivial. C'est le préconditionnement ;
  • ajouter de l'inertie (méthode du moment) : on garde une partie du déplacement précédent, ce qui amortit les zigzags dans la direction raide ;
  • utiliser la courbure (Newton, quasi-Newton) : on remplace α\alpha par H−1H^{-1}, ce qui revient à donner à chaque direction son propre pas.

Réponse : il faut α<110\alpha<\tfrac1{10} parce que la direction yy a une courbure 2020 et impose ∣1−20α∣<1\lvert 1-20\alpha\rvert<1 ; et la convergence est lente parce que le conditionnement κ=10\kappa=10 plafonne le taux à 911≈0,82\tfrac9{11}\approx0{,}82 par itération.

Réponse. Stable ssi 0<α<1100<\alpha<\tfrac1{10} ; convergence lente car κ=10\kappa=10 (vp 22 et 2020). (Recoupement : le pas est limité par la plus grande vp de la Hessienne, la vitesse par la plus petite ✓)
Faire cet exercice dans l'app →

Moindres carrés comme minimisation

CalculDifficulté 3/5

Ajuster une droite y=ax+by=ax+b aux points (1,1),(2,2),(3,2),(4,3)(1,1),(2,2),(3,2),(4,3) en minimisant S(a,b)=∑i(yi−axi−b)2S(a,b)=\sum_i(y_i-ax_i-b)^2.

Indices (3)

SS est une quadratique convexe en (a,b)(a,b) : son minimum est en ∇S=0⃗\nabla S=\vec0.

∂aS=0\partial_a S=0 et ∂bS=0\partial_b S=0 donnent les équations normales.

xˉ=2,5\bar x=2{,}5, yˉ=2\bar y=2.

Correction détaillée
L'idée directrice

La régression linéaire — ajuster une droite à un nuage de points — est un problème d'optimisation à deux variables, et l'un des plus utiles qui soient. Ce qui se cherche n'est pas xx ou yy, mais les paramètres aa (la pente) et bb (l'ordonnée à l'origine) :

S(a,b)=∑i=14(yi−axi−b)2.S(a,b)=\sum_{i=1}^{4}\bigl(y_i-a x_i-b\bigr)^2.

Chaque terme est le carré de l'écart vertical entre le point et la droite. On les met au carré pour deux raisons : les écarts positifs et négatifs ne doivent pas se compenser, et le carré est dérivable (contrairement à la valeur absolue).

SS étant une somme de carrés de fonctions affines de (a,b)(a,b), elle est convexe : un point critique sera donc le minimum global — c'est ce qui rend la méthode fiable.

Étape 1 — les sommes préliminaires

On range les données et on calcule les quatre sommes dont tout dépend. Points : (1,1)(1,1), (2,2)(2,2), (3,2)(3,2), (4,3)(4,3).

ii xix_i yiy_i xiyix_iy_i xi2x_i^2
1 11 11 11 11
2 22 22 44 44
3 33 22 66 99
4 44 33 1212 1616
somme 10\mathbf{10} 8\mathbf{8} 23\mathbf{23} 30\mathbf{30}

Soit n=4n=4, ∑x=10\sum x=10, ∑y=8\sum y=8, ∑xy=23\sum xy=23, ∑x2=30\sum x^2=30.

Ce tableau est le seul endroit où l'on peut se tromper bêtement — le refaire une fois avant de continuer coûte trente secondes et évite tout le reste.

Étape 2 — annuler le gradient

On dérive SS par rapport à chaque paramètre. La dérivée de (yi−axi−b)2(y_i-ax_i-b)^2 vaut 2(yi−axi−b)×(−xi)2(y_i-ax_i-b)\times(-x_i) pour aa, et 2(yi−axi−b)×(−1)2(y_i-ax_i-b)\times(-1) pour bb :

∂S∂a=−2∑xi (yi−axi−b)=0,∂S∂b=−2∑(yi−axi−b)=0.\frac{\partial S}{\partial a}=-2\sum x_i\,(y_i-ax_i-b)=0,\qquad \frac{\partial S}{\partial b}=-2\sum (y_i-ax_i-b)=0.

En développant, on obtient les équations normales :

{a∑xi2+b∑xi=∑xiyia∑xi+n b=∑yisoit{30a+10b=2310a+4b=8\begin{cases}a\sum x_i^2+b\sum x_i=\sum x_iy_i\\[2pt] a\sum x_i+n\,b=\sum y_i\end{cases}\qquad\text{soit}\qquad\begin{cases}30a+10b=23\\ 10a+4b=8\end{cases}
Étape 3 — résoudre

Multiplions la seconde par 33 pour aligner les aa :

{30a+10b=2330a+12b=24\begin{cases}30a+10b=23\\ 30a+12b=24\end{cases}

Soustrayons la première de la seconde : 2b=12b=1, donc

b=12=0,5\boxed{b=\tfrac12=0{,}5}

Puis 10a+4×12=810a+4\times\tfrac12=8 donne 10a=610a=6 :

a=35=0,6\boxed{a=\tfrac35=0{,}6}

La droite des moindres carrés est

y=0,6 x+0,5.y=0{,}6\,x+0{,}5.

Vérification immédiate dans les équations de départ — un geste à ne jamais sauter : 30×0,6+10×0,5=18+5=2330\times0{,}6+10\times0{,}5=18+5=23 ✓ et 10×0,6+4×0,5=6+2=810\times0{,}6+4\times0{,}5=6+2=8 ✓.

Étape 4 — les résidus

On compare valeurs prédites et valeurs observées :

xix_i yiy_i observé y^i=0,6xi+0,5\hat y_i=0{,}6x_i+0{,}5 résidu yi−y^iy_i-\hat y_i
11 11 1,11{,}1 −0,1-0{,}1
22 22 1,71{,}7 +0,3+0{,}3
33 22 2,32{,}3 −0,3-0{,}3
44 33 2,92{,}9 +0,1+0{,}1

Deux contrôles qui valident le calcul :

  • la somme des résidus est nulle : −0,1+0,3−0,3+0,1=0-0{,}1+0{,}3-0{,}3+0{,}1=0. Ce n'est pas une coïncidence, c'est exactement la seconde équation normale ;
  • la droite passe par le point moyen (xˉ,yˉ)=(104,84)=(2,5 ; 2)(\bar x,\bar y)=\left(\tfrac{10}{4},\tfrac84\right)=(2{,}5\,;\,2). Vérifions : 0,6×2,5+0,5=1,5+0,5=20{,}6\times2{,}5+0{,}5=1{,}5+0{,}5=2 ✓. Toute droite de moindres carrés passe par le barycentre du nuage.

Somme des carrés résiduels :

S(0,6 ; 0,5)=0,01+0,09+0,09+0,01=0,2.S(0{,}6\,;\,0{,}5)=0{,}01+0{,}09+0{,}09+0{,}01=0{,}2.
Le minimum est bien global

La hessienne de SS vaut

H=2(∑xi2∑xi∑xin)=2(3010104),det⁡=4 (120−100)=80>0,H=2\begin{pmatrix}\sum x_i^2&\sum x_i\\ \sum x_i&n\end{pmatrix}=2\begin{pmatrix}30&10\\10&4\end{pmatrix},\qquad \det=4\,(120-100)=80>0,

avec 2×30=60>02\times30=60>0 : définie positive, donc SS est strictement convexe et le point critique trouvé est bien le minimum global (critère de l'exercice E1).

Contrôle numérique en perturbant les paramètres :

(a,b)(a,b) SS
(0,6 ; 0,5)\mathbf{(0{,}6\,;\,0{,}5)} 0,2\mathbf{0{,}2}
(0,7 ; 0,5)(0{,}7\,;\,0{,}5) 0,50{,}5
(0,5 ; 0,5)(0{,}5\,;\,0{,}5) 0,50{,}5
(0,6 ; 0,6)(0{,}6\,;\,0{,}6) 0,240{,}24
(0,6 ; 0,4)(0{,}6\,;\,0{,}4) 0,240{,}24

Toutes les perturbations font remonter SS.

Réponse : y=0,6 x+0,5y=0{,}6\,x+0{,}5, avec des résidus (−0,1 ; 0,3 ; −0,3 ; 0,1)(-0{,}1\,;\,0{,}3\,;\,-0{,}3\,;\,0{,}1) et une somme des carrés résiduels de 0,20{,}2.

Réponse. Droite y=0,6 x+0,5y=0{,}6\,x+0{,}5. (Recoupement : SS strictement convexe ⇒ unique min ; numpy.polyfit donne [0,6,0,5][0{,}6,0{,}5] — même résultat que la régression du chapitre Méthodes numériques ✓)
Faire cet exercice dans l'app →

Convexité ⇒ minimum global

DémonstrationDifficulté 3/5

Expliquer pourquoi, pour une fonction convexe dérivable, un point critique est nécessairement un minimum global. Illustrer sur f(x,y)=x2+y2−4x−6y+13f(x,y)=x^2+y^2-4x-6y+13.

Indices (3)

Convexité : f(y⃗)≥f(x⃗)+∇f(x⃗)⋅(y⃗−x⃗)f(\vec y)\ge f(\vec x)+\nabla f(\vec x)\cdot(\vec y-\vec x).

En un point critique x⃗⋆\vec x^\star, ∇f(x⃗⋆)=0⃗\nabla f(\vec x^\star)=\vec0.

Substituer.

Correction détaillée
La propriété à démontrer

Pour une fonction quelconque, un point critique peut être un minimum, un maximum, un col, ou rien de tout cela — et même un vrai minimum peut n'être que local : c'est le cas de (1,0)(1,0) à l'exercice A3, dépassé par f(−10,0)=−970f(-10,0)=-970.

La convexité fait disparaître d'un coup toute cette casuistique :

Si ff est convexe et dérivable, tout point où ∇f=0⃗\nabla f=\vec0 est un minimum GLOBAL.

C'est le théorème qui fait la valeur pratique de la convexité : plus besoin de hessienne, plus besoin de vérifier le bord, plus de « c'est peut-être seulement local ». On trouve, on a fini.

L'argument, en une ligne

Tout repose sur la caractérisation suivante de la convexité, à connaître par cœur :

une fonction convexe est au-dessus de chacune de ses tangentes.\textbf{une fonction convexe est au-dessus de chacune de ses tangentes.}

Formellement, pour tous points a⃗\vec a et x⃗\vec x :

f(x⃗) ≥ f(a⃗)+∇f(a⃗)⋅(x⃗−a⃗).f(\vec x)\ \ge\ f(\vec a)+\nabla f(\vec a)\cdot(\vec x-\vec a).

Supposons maintenant ∇f(a⃗)=0⃗\nabla f(\vec a)=\vec0. Le produit scalaire s'annule, et il reste :

f(x⃗) ≥ f(a⃗)pour TOUT x⃗.f(\vec x)\ \ge\ f(\vec a)\qquad\text{pour TOUT }\vec x.

C'est la définition même d'un minimum global. La démonstration tient en une substitution.

Pourquoi l'image de la tangente est la bonne

En une variable, y=f(a)+f′(a)(x−a)y=f(a)+f'(a)(x-a) est l'équation de la tangente en aa. Dire que la courbe est au-dessus de sa tangente, c'est dire qu'elle « tourne vers le haut » — c'est la convexité.

Quand la tangente est horizontale (f′(a)=0f'(a)=0), elle devient la droite y=f(a)y=f(a). La courbe étant au-dessus, aucune valeur ne peut descendre sous f(a)f(a).

L'image explique aussi pourquoi le théorème tombe en défaut sans convexité : sur f(x)=x3−3xf(x)=x^3-3x en x=1x=1, la courbe passe sous sa tangente horizontale dès qu'on va assez à gauche — d'où le minimum seulement local d'A3.

L'illustration demandée

Reprenons f(x,y)=x2+y2−4x−6y+13f(x,y)=x^2+y^2-4x-6y+13 de l'exercice A1.

1. Elle est convexe. Sa hessienne est constante :

H=(2002),H=\begin{pmatrix}2&0\\0&2\end{pmatrix},

de valeurs propres 22 et 22, toutes deux >0>0 : définie positive, donc ff est même strictement convexe.

2. Elle a un point critique. ∇f=(2x−4, 2y−6)=0⃗\nabla f=(2x-4,\,2y-6)=\vec0 donne (2,3)(2,3).

3. Conclusion, sans autre calcul. Par le théorème, (2,3)(2,3) est un minimum global, de valeur f(2,3)=0f(2,3)=0.

Comparons le coût : en A1 il avait fallu écrire la forme canonique f=(x−2)2+(y−3)2f=(x-2)^2+(y-3)^2 pour conclure au global. Avec la convexité, cette étape disparaît — c'est exactement ce qu'on gagne.

Contrôle numérique
point ff écart au minimum
(2,3)\mathbf{(2,3)} 0\mathbf{0} —
(2,5 ; 3)(2{,}5\,;\,3) 0,250{,}25 +0,25+0{,}25
(2 ; 4)(2\,;\,4) 11 +1+1
(0,0)(0,0) 1313 +13+13
(10,10)(10,10) 113113 +113+113
(−10,−10)(-10,-10) 313313 +313+313

Aucune valeur ne descend sous 00, même très loin. À comparer avec A3, où s'éloigner faisait plonger ff vers −∞-\infty : la convexité est précisément ce qui interdit cette échappée.

Les conséquences pratiques

Ce théorème est la raison pour laquelle on cherche toujours à reformuler un problème sous forme convexe :

  • pas de minimum local parasite : une descente de gradient ne peut pas rester piégée ailleurs qu'au vrai minimum ;
  • un critère d'arrêt fiable : ∇f≈0⃗\nabla f\approx\vec0 signifie qu'on a fini, ce qui est faux en général ;
  • l'unicité dès que la convexité est stricte : deux minima distincts a⃗≠b⃗\vec a\ne\vec b donneraient f=f(a⃗)f=f(\vec a) sur tout le segment [a⃗,b⃗][\vec a,\vec b], ce qu'une fonction strictement convexe interdit.

Les moindres carrés (E5), la régression ridge (D6) et toute la programmation linéaire (lot C) doivent leur robustesse à cette propriété.

Réponse : pour ff convexe dérivable, f(x⃗)≥f(a⃗)+∇f(a⃗)⋅(x⃗−a⃗)=f(a⃗)f(\vec x)\ge f(\vec a)+\nabla f(\vec a)\cdot(\vec x-\vec a)=f(\vec a) dès que ∇f(a⃗)=0⃗\nabla f(\vec a)=\vec0 ; sur f=x2+y2−4x−6y+13f=x^2+y^2-4x-6y+13, de hessienne 2I2I définie positive, le point critique (2,3)(2,3) est donc un minimum global de valeur 00.

Réponse. Convexe + ∇f(x⃗⋆)=0⃗⇒x⃗⋆\nabla f(\vec x^\star)=\vec0\Rightarrow\vec x^\star minimum global. (Recoupement : aucun minimum local parasite ni col possible pour une fonction convexe — propriété reine de l'optimisation ✓)
Faire cet exercice dans l'app →

S'entraîner davantage sur optimisation

18 exercices d'entraînement supplémentaires sur ce chapitre, plus le palier approfondissement, les quiz, le tuteur IA et les PDF à imprimer — dans l'app Maths Post-Bac.