B10 · Échantillonnage et estimation
Fluctuations d'échantillonnage
Décrire la variabilité d'une statistique d'un échantillon à l'autre et la distribution d'échantillonnage d'une moyenne et d'une proportion. Relier la précision à la taille de l'échantillon.
Biostatistiques et méthodes d'analyse5 min de lecture15 QCM corrigés
Origine des fluctuations d'échantillonnage
Une population est l'ensemble des unités sur lesquelles porte l'étude. Un échantillon est un sous-ensemble d'unités effectivement observées. Ces notions, ainsi que les conditions de représentativité, sont détaillées dans la fiche précédente.
Même lorsque le prélèvement est aléatoire et correctement réalisé, deux échantillons issus d'une même population ne contiennent généralement pas les mêmes unités. Les valeurs observées changent donc d'un prélèvement à l'autre.
La fluctuation d'échantillonnage ne résulte pas nécessairement d'une erreur de mesure ou d'un défaut méthodologique. Elle est inhérente au prélèvement d'une partie seulement de la population. Une statistique observée est ainsi l'une des valeurs possibles produites par le mécanisme aléatoire d'échantillonnage.
Paramètre et statistique
Un paramètre décrit la population et possède une valeur fixe, généralement inconnue. Une statistique correspondante est calculée dans l'échantillon et fluctue autour de ce paramètre.
L'utilisation d'une statistique observée comme estimation d'un paramètre relève de l'estimation ponctuelle, étudiée dans la fiche suivante. La présente fiche s'intéresse à la variabilité de cette statistique avant toute observation.
Distribution d'échantillonnage
Cette distribution est une construction théorique. Elle décrit :
- la position centrale des valeurs possibles de la statistique ;
- leur dispersion autour du paramètre ;
- la forme générale de leur répartition.
Plus la distribution d'échantillonnage est resserrée, plus la statistique a tendance à être proche du paramètre recherché. La dispersion de cette distribution mesure donc la précision d'échantillonnage.
Distribution d'échantillonnage d'une moyenne
On considère un échantillon aléatoire de taille . Pour chaque unité , la variable aléatoire représente la valeur du caractère quantitatif observé. On suppose les variables indépendantes, de même loi, de moyenne et de variance .
La moyenne d'échantillon est elle-même une variable aléatoire, car elle dépend des unités sélectionnées.
Grâce à la linéarité de l'espérance, la moyenne des valeurs possibles de est égale à la moyenne de la population. Grâce à l’indépendance, les variances des observations s’additionnent, tandis que la division par multiplie la variance par .
Si le caractère suit une loi normale dans la population, la moyenne d'échantillon suit exactement une loi normale, quelle que soit la taille . Si la loi initiale n'est pas normale mais possède une variance finie, le théorème central limite indique que la distribution de tend vers une loi normale lorsque augmente.
Distribution d'échantillonnage d'une proportion
Pour un caractère binaire, chaque unité présente ou non la modalité étudiée. On associe à chaque unité une variable valant si la modalité est présente et sinon. Chaque suit alors une loi de Bernoulli de paramètre , où est la proportion dans la population.
Si désigne le nombre d'unités présentant la modalité, alors suit une loi binomiale de paramètres et . La proportion d'échantillon est .
La distribution exacte de est discrète, car seules les valeurs , , jusqu'à sont possibles. Lorsque est suffisamment grand et que n'est pas trop proche de ou de , cette distribution peut être approchée par une loi normale. Les conditions précises dépendent du degré d'approximation recherché et ne se résument pas à une taille universelle.
La quantité détermine aussi la variabilité intrinsèque du caractère binaire. Elle est maximale lorsque et diminue lorsque se rapproche de ou de .
Taille d'échantillon et précision
Pour la moyenne comme pour la proportion, l'erreur standard est proportionnelle à . L'augmentation de la taille de l'échantillon resserre donc la distribution d'échantillonnage autour du paramètre, sans modifier son centre.
Cette dépendance en racine carrée entraîne des rendements décroissants : multiplier par divise l'erreur standard par . Pour diviser l'erreur standard par un facteur , il faut multiplier la taille par , où est un nombre strictement positif.
Lorsque le prélèvement est effectué sans remise dans une population finie de taille , les observations ne sont plus strictement indépendantes. Si la fraction prélevée n'est pas négligeable, l'erreur standard doit être multipliée par le facteur de correction , où est la taille de la population et celle de l'échantillon.
Entre ton email pour débloquer le reste de cette fiche
Il reste 2 sections à lire — plus les QCM corrigés, l'examen blanc et le suivi. 72 h d'essai gratuit, sans carte bancaire.