homecarab1.fr
Biostatistiques et méthodes d'analysechevron_rightÉchantillonnage et estimationchevron_rightEstimation ponctuelle d'une moyenne, d'une proportion et d'une variance
stylus_noteS'entraînerS'entraînerarrow_backarrow_forward

Sommaire

  • 1Du paramètre inconnu à son estimation
  • 2Propriétés attendues d'un estimateur
    • 2.1Biais
    • 2.2Précision et convergence
  • 3Estimation ponctuelle d'une moyenne
  • 4Estimation ponctuelle d'une proportion lock — section verrouillée
  • 5Estimation ponctuelle d'une variance lock — section verrouillée
  1. Accueilchevron_right
  2. Ficheschevron_right
  3. Biostatistiques et méthodes d'analysechevron_right
  4. Échantillonnage et estimationchevron_right
  5. Estimation ponctuelle d'une moyenne, d'une proportion et d'une variance

B10 · Échantillonnage et estimation

Estimation ponctuelle d'une moyenne, d'une proportion et d'une variance

Définir un estimateur et les propriétés attendues, notamment l'absence de biais. Établir les estimateurs usuels et justifier la correction du dénominateur de la variance estimée.

Biostatistiques et méthodes d'analyse·schedule5 min de lecture·quiz15 QCM corrigés

Du paramètre inconnu à son estimation

L'étude porte sur une population, décrite par une loi de probabilité dont certaines caractéristiques numériques sont inconnues. Les questions de représentativité et de fluctuations d'échantillonnage sont traitées dans les fiches voisines ; ici, on suppose que les observations constituent un échantillon aléatoire permettant l'inférence.

Définition

Paramètre

Caractéristique numérique fixe mais inconnue de la population, généralement notée θ\thetaθ. Une moyenne μ\muμ, une proportion ppp ou une variance σ2\sigma^2σ2 sont des paramètres.

On considère un échantillon aléatoire composé de nnn variables aléatoires X1,…,XnX_1,\ldots,X_nX1​,…,Xn​, indépendantes et de même loi que la variable étudiée dans la population. Avant le recueil des données, les XiX_iXi​ sont aléatoires. Après le recueil, elles prennent les valeurs observées x1,…,xnx_1,\ldots,x_nx1​,…,xn​.

Définition

Estimateur

Variable aléatoire construite uniquement à partir des observations de l'échantillon et destinée à approcher un paramètre inconnu. Un estimateur de θ\thetaθ est généralement noté θ^\widehat{\theta}θ.

Définition

Estimation ponctuelle

Valeur numérique unique attribuée à un paramètre inconnu à partir d'un échantillon observé.

Il faut distinguer l'estimateur, qui est une règle de calcul aléatoire avant l'observation, de l'estimation, qui est la valeur obtenue après application de cette règle aux données.

Comparaison

Estimateur et estimation

CritèreEstimateurEstimation
Naturevariable aléatoirevaleur numérique observée
Notation généraleθ^\widehat{\theta}θvaleur prise par θ^\widehat{\theta}θ
Moment considéréavant l'observationaprès l'observation
Variabilitédépend de l'échantillonnagefixée pour l'échantillon recueilli

Propriétés attendues d'un estimateur

Un bon estimateur doit viser correctement le paramètre et varier aussi peu que possible d'un échantillon à l'autre. Ces deux exigences sont distinctes.

Biais

Définition

Biais d'un estimateur

Écart entre l'espérance de l'estimateur et le paramètre estimé.

Formule

Biais

Biais⁡θ(θ^)=Eθ[θ^]−θ\operatorname{Biais}_{\theta}\left(\widehat{\theta}\right) = \mathbb{E}_{\theta}\left[\widehat{\theta}\right]-\thetaBiaisθ​(θ)=Eθ​[θ]−θ
  • Biais⁡θ(θ^)\operatorname{Biais}_{\theta}\left(\widehat{\theta}\right)Biaisθ​(θ) : biais de l'estimateur pour la valeur θ\thetaθ
  • θ^\widehat{\theta}θ : estimateur du paramètre
  • Eθ\mathbb{E}_{\theta}Eθ​ : espérance sous la loi caractérisée par θ\thetaθ
  • θ\thetaθ : paramètre inconnu
Définition

Estimateur sans biais

Estimateur dont l'espérance est égale au paramètre estimé pour toute valeur admissible de ce paramètre, soit Eθ[θ^]=θ\mathbb{E}_{\theta}[\widehat{\theta}]=\thetaEθ​[θ]=θ.

L'absence de biais signifie que les estimations sont centrées sur la vraie valeur lorsqu'on répète théoriquement l'échantillonnage. Elle ne garantit pas qu'une estimation particulière soit proche du paramètre.

Précision et convergence

Définition

Précision d'un estimateur

Faible dispersion de l'estimateur autour de son espérance, mesurée notamment par sa variance ou son écart-type.

Entre deux estimateurs sans biais d'un même paramètre, celui dont la variance est la plus faible est le plus précis. Sa valeur fluctue moins entre les échantillons.

Définition

Estimateur convergent

Estimateur qui se rapproche en probabilité du paramètre lorsque la taille nnn de l'échantillon tend vers l'infini.

La convergence est une propriété asymptotique : elle décrit le comportement lorsque la quantité d'information augmente. Un estimateur peut être biaisé pour une taille finie tout en devenant convergent si son biais et sa variance tendent vers zéro.

L'erreur quadratique moyenne rassemble le biais et la dispersion dans un même critère.

Formule

Décomposition de l'erreur quadratique moyenne

Eθ[(θ^−θ)2]=Var⁡θ(θ^)+(Biais⁡θ(θ^))2\mathbb{E}_{\theta}\left[\left(\widehat{\theta}-\theta\right)^2\right] = \operatorname{Var}_{\theta}\left(\widehat{\theta}\right) + \left( \operatorname{Biais}_{\theta}\left(\widehat{\theta}\right) \right)^2Eθ​[(θ−θ)2]=Varθ​(θ)+(Biaisθ​(θ))2
  • Eθ\mathbb{E}_{\theta}Eθ​ : espérance sous la loi caractérisée par θ\thetaθ
  • θ^\widehat{\theta}θ : estimateur du paramètre θ\thetaθ
  • θ\thetaθ : paramètre estimé
  • Var⁡θ(θ^)\operatorname{Var}_{\theta}\left(\widehat{\theta}\right)Varθ​(θ) : variance de l'estimateur
  • Biais⁡θ(θ^)\operatorname{Biais}_{\theta}\left(\widehat{\theta}\right)Biaisθ​(θ) : biais de l'estimateur
Attention

Sans biais ne signifie pas exact

Une estimation sans biais peut être très éloignée du paramètre si sa variance est élevée. L'absence de biais est une propriété de la distribution de l'estimateur, non une garantie portant sur chaque échantillon.

Estimation ponctuelle d'une moyenne

On suppose que la variable étudiée possède une espérance finie μ\muμ et une variance finie σ2\sigma^2σ2. L'estimateur usuel de μ\muμ est la moyenne de l'échantillon.

Formule

Moyenne empirique

X‾=1n∑i=1nXi\overline{X} = \frac{1}{n}\sum_{i=1}^{n}X_iX=n1​i=1∑n​Xi​
  • X‾\overline{X}X : moyenne empirique, estimateur de μ\muμ
  • nnn : taille de l'échantillon
  • XiX_iXi​ : variable aléatoire correspondant à la iii-ième observation
  • iii : indice de l'observation, variant de 111 à nnn

Par linéarité de l'espérance et parce que chaque XiX_iXi​ a pour espérance μ\muμ :

E[X‾]=1n∑i=1nE[Xi]=μ.\mathbb{E}\left[\overline{X}\right] = \frac{1}{n}\sum_{i=1}^{n}\mathbb{E}[X_i] = \mu.E[X]=n1​i=1∑n​E[Xi​]=μ.

La moyenne empirique est donc un estimateur sans biais de la moyenne de la population.

L'indépendance des observations permet d'additionner leurs variances :

Var⁡(X‾)=1n2∑i=1nVar⁡(Xi)=σ2n.\operatorname{Var}\left(\overline{X}\right) = \frac{1}{n^2}\sum_{i=1}^{n}\operatorname{Var}(X_i) = \frac{\sigma^2}{n}.Var(X)=n21​i=1∑n​Var(Xi​)=nσ2​.

Son écart-type vaut donc σ/n\sigma/\sqrt{n}σ/n​. La dispersion de l'estimateur diminue lorsque nnn augmente, ce qui justifie sa convergence vers μ\muμ.

Après observation, l'estimation obtenue est x‾=1n∑i=1nxi\overline{x}=\frac{1}{n}\sum_{i=1}^{n}x_ix=n1​∑i=1n​xi​.

Exemple

Calcul d'une estimation ponctuelle de moyenne

Dans un échantillon de 555 concentrations, les valeurs observées sont x1=8x_1=8x1​=8, x2=10x_2=10x2​=10, x3=12x_3=12x3​=12, x4=9x_4=9x4​=9 et x5=11x_5=11x5​=11.

x‾=8+10+12+9+115=505=10\overline{x} = \frac{8+10+12+9+11}{5} = \frac{50}{5} = 10x=58+10+12+9+11​=550​=10

L'estimation ponctuelle de la moyenne inconnue de la population est donc 101010 dans l'unité de mesure de la concentration. La moyenne empirique X‾\overline{X}X est la règle aléatoire utilisée avant l'observation, tandis que x‾=10\overline{x}=10x=10 est sa valeur observée.

Estimation ponctuelle d'une proportion

Une proportion est modélisée à l'aide d'une variable indicatrice YiY_iYi​ qui vaut 111 lorsque l'individu présente la caractéristique étudiée et 000 sinon. Cette variable suit une loi de Bernoulli de paramètre ppp, avec E[Yi]=p\mathbb{E}[Y_i]=pE[Yi​]=p et Var⁡(Yi)=p(1−p)\operatorname{Var}(Y_i)=p(1-p)Var(Yi​)=p(1−p).

Formule

Proportion empirique

p^=1n∑i=1nYi=Kn\widehat{p} = \frac{1}{n}\sum_{i=1}^{n}Y_i = \frac{K}{n}p​=n1​i=1∑n​Yi​=nK​
  • p^\widehat{p}p​ : proportion empirique, estimateur de ppp
  • ppp : proportion inconnue dans la population
  • nnn : taille de l'échantillon
  • YiY_iYi​ : indicatrice associée à la iii-ième observation
  • iii : indice de l'observation
  • KKK : nombre d'observations possédant la caractéristique

La proportion empirique est une moyenne de variables indicatrices. Les résultats précédents donnent donc directement :

E[p^]=petVar⁡(p^)=p(1−p)n.\mathbb{E}[\widehat{p}]=p \qquad\text{et}\qquad \operatorname{Var}(\widehat{p})=\frac{p(1-p)}{n}.E[p​]=petVar(p​)=np(1−p)​.

Ainsi, p^\widehat{p}p​ est sans biais et sa variance tend vers zéro lorsque nnn augmente. Elle est donc convergente.

Exemple

Calcul d'une proportion empirique

Dans un échantillon de 200200200 patients, 363636 présentent la caractéristique étudiée.

La proportion empirique vaut :

p^=Kn=36200=0,18\widehat{p} = \frac{K}{n} = \frac{36}{200} = 0{,}18p​=nK​=20036​=0,18

L'estimation ponctuelle de la proportion dans la population est 0,180{,}180,18, soit 18%18\%18%. Dans cet échantillon, 18%18\%18% des patients présentent la caractéristique.

Estimation ponctuelle d'une variance

La variance de la population est définie par :

σ2=E[(X−μ)2].\sigma^2=\mathbb{E}\left[(X-\mu)^2\right].σ2=E[(X−μ)2].

Elle mesure la dispersion des valeurs autour de la moyenne inconnue μ\muμ. Dans l'échantillon, cette moyenne est remplacée par X‾\overline{X}X. Une première expression naturelle serait alors :

Sn2=1n∑i=1n(Xi−X‾)2.S_n^2 = \frac{1}{n}\sum_{i=1}^{n}(X_i-\overline{X})^2.Sn2​=n1​i=1∑n​(Xi​−X)2.

Cependant, cet estimateur est biaisé. L'identité fondamentale est :

∑i=1n(Xi−X‾)2=∑i=1n(Xi−μ)2−n(X‾−μ)2.\sum_{i=1}^{n}(X_i-\overline{X})^2 = \sum_{i=1}^{n}(X_i-\mu)^2 - n(\overline{X}-\mu)^2.i=1∑n​(Xi​−X)2=i=1∑n​(Xi​−μ)2−n(X−μ)2.

L'espérance du premier terme à droite vaut nσ2n\sigma^2nσ2. Celle du second vaut :

nE[(X‾−μ)2]=nVar⁡(X‾)=σ2.n\mathbb{E}\left[(\overline{X}-\mu)^2\right] = n\operatorname{Var}(\overline{X}) = \sigma^2.nE[(X−μ)2]=nVar(X)=σ2.

Par conséquent :

E[∑i=1n(Xi−X‾)2]=(n−1)σ2.\mathbb{E}\left[ \sum_{i=1}^{n}(X_i-\overline{X})^2 \right] = (n-1)\sigma^2.E[i=1∑n​(Xi​−X)2]=(n−1)σ2.

La division par nnn conduit donc à E[Sn2]=n−1nσ2\mathbb{E}[S_n^2]=\frac{n-1}{n}\sigma^2E[Sn2​]=nn−1​σ2 : la variance est systématiquement sous-estimée en moyenne.

Formule

Variance empirique corrigée

S2=1n−1∑i=1n(Xi−X‾)2S^2 = \frac{1}{n-1} \sum_{i=1}^{n}(X_i-\overline{X})^2S2=n−11​i=1∑n​(Xi​−X)2
  • S2S^2S2 : estimateur sans biais de la variance σ2\sigma^2σ2
  • nnn : taille de l'échantillon, avec n>1n>1n>1
  • XiX_iXi​ : iii-ième observation aléatoire
  • X‾\overline{X}X : moyenne empirique
  • iii : indice de l'observation

La correction du dénominateur est appelée correction de Bessel. Elle compense exactement la perte liée au remplacement de μ\muμ par X‾\overline{X}X.

Les écarts Xi−X‾X_i-\overline{X}Xi​−X ne sont pas tous libres, car leur somme est nécessairement nulle. Dès que n−1n-1n−1 écarts sont connus, le dernier est imposé. Il reste donc n−1n-1n−1 degrés de liberté, ce qui explique le dénominateur corrigé.

Exemple

Calcul de la variance empirique corrigée

Considérons trois valeurs observées : x1=2x_1=2x1​=2, x2=4x_2=4x2​=4 et x3=6x_3=6x3​=6.

La moyenne empirique est :

x‾=2+4+63=4\overline{x} = \frac{2+4+6}{3} = 4x=32+4+6​=4

Les écarts à cette moyenne sont −2-2−2, 000 et 222. Leur somme est nulle : −2+0+2=0-2+0+2=0−2+0+2=0. Dès que les deux premiers écarts sont connus, le dernier est imposé.

La somme des carrés des écarts vaut :

(2−4)2+(4−4)2+(6−4)2=4+0+4=8(2-4)^2+(4-4)^2+(6-4)^2 = 4+0+4 = 8(2−4)2+(4−4)2+(6−4)2=4+0+4=8

La variance empirique corrigée est donc :

S2=83−1=4S^2 = \frac{8}{3-1} = 4S2=3−18​=4

Pour cet échantillon de taille 333, il reste 222 degrés de liberté et le dénominateur corrigé est bien n−1=2n-1=2n−1=2. La valeur 444 est l'estimation corrigée de la variance de la population.

À retenir

Pourquoi diviser par n−1n-1n−1

La somme des carrés centrés sur la moyenne empirique a pour espérance (n−1)σ2(n-1)\sigma^2(n−1)σ2. La division par n−1n-1n−1, et non par nnn, rend l'estimateur de la variance sans biais.

Attention

Variance et écart-type corrigé

Même si S2S^2S2 est sans biais pour σ2\sigma^2σ2, sa racine SSS n'est généralement pas sans biais pour σ\sigmaσ. Une transformation non linéaire ne conserve pas automatiquement l'absence de biais.

Points clés
  • Un estimateur est une variable aléatoire calculée à partir de l'échantillon ; son estimation est la valeur observée.
  • Le biais vaut E[θ^]−θ\mathbb{E}[\widehat{\theta}]-\thetaE[θ]−θ ; un estimateur sans biais est centré sur le paramètre.
  • La moyenne empirique X‾\overline{X}X estime μ\muμ sans biais et sa variance vaut σ2/n\sigma^2/nσ2/n.
  • La proportion empirique p^\widehat{p}p​ estime ppp sans biais et sa variance vaut p(1−p)/np(1-p)/np(1−p)/n.
  • La variance calculée avec le dénominateur nnn est biaisée vers le bas.
  • Le dénominateur n−1n-1n−1 corrige ce biais et correspond aux n−1n-1n−1 degrés de liberté des écarts à la moyenne empirique.

Fiches connexes

À réviser dans la foulée, sur Échantillonnage et estimation.

  • Fiche 01Population, échantillon et représentativitéÉchantillonnage et estimation
  • Fiche 02Fluctuations d'échantillonnageÉchantillonnage et estimation
  • Fiche 04Intervalles de confiance et intervalles de pariÉchantillonnage et estimation
lock_open

Entre ton email pour débloquer le reste de cette fiche

Il reste 2 sections à lire — plus les QCM corrigés, l'examen blanc et le suivi. 72 h d'essai gratuit, sans carte bancaire.

Déjà un compte ? Se connecter · Voir les formules

arrow_backPrécédentFluctuations d'échantillonnageÉchantillonnage et estimationSuivantarrow_forwardIntervalles de confiance et intervalles de pariÉchantillonnage et estimation
Sommaire
  • 1Du paramètre inconnu à son estimation
  • 2Propriétés attendues d'un estimateur
    • 2.1Biais
    • 2.2Précision et convergence
  • 3Estimation ponctuelle d'une moyenne
  • 4Estimation ponctuelle d'une proportion lock — section verrouillée
  • 5Estimation ponctuelle d'une variance lock — section verrouillée