B10 · Échantillonnage et estimation
Population, échantillon et représentativité
Distinguer population et échantillon, paramètre et statistique. Présenter les modes de tirage, la notion de représentativité et les principaux biais de sélection.
Biostatistiques et méthodes d'analyse7 min de lecture17 QCM corrigés
Population, unités et champ de l'étude
Une étude statistique porte sur un ensemble d'unités clairement délimité. Ces unités peuvent être des personnes, des événements ou des mesures, mais leur nature doit rester identique tout au long de l'analyse.
La population cible est définie par des critères précis, notamment les caractéristiques des unités, le territoire et la période concernés. Une définition imprécise empêche de savoir à qui les conclusions s'appliquent.
La population réellement accessible peut être plus restreinte que la population cible.
L'écart entre population cible et population source est essentiel. Même si l'échantillon représente parfaitement la population source, les résultats ne sont pas nécessairement généralisables à une population cible plus large.
Une base de sondage incomplète exclut certaines unités avant même le tirage. À l'inverse, des doublons peuvent donner à certaines unités une probabilité de sélection trop élevée.
De la population à l'échantillon
L'étude exhaustive de toutes les unités constitue un recensement. Elle est souvent impossible ou inutile en raison du coût, de la durée du recueil ou du caractère inaccessible d'une partie de la population. On étudie alors un sous-ensemble.
L'échantillonnage désigne la procédure par laquelle les unités de l'échantillon sont choisies. Sa qualité ne dépend donc pas seulement du nombre d'unités incluses, mais aussi de la manière dont elles ont été sélectionnées.
Paramètre et statistique
La moyenne de la population est habituellement notée , sa variance et sa proportion . Leur valeur ne change pas lorsqu'un nouvel échantillon est tiré, car ils décrivent la même population.
La moyenne observée , la variance observée et la proportion observée sont des statistiques. Elles sont connues une fois les données recueillies, mais leur valeur dépend des unités sélectionnées.
La variation d'une statistique entre plusieurs échantillons issus de la même population constitue la fluctuation d'échantillonnage, étudiée dans la fiche suivante.
Modes de tirage probabilistes
Le recours au hasard ne garantit pas que l'échantillon reproduise exactement toutes les caractéristiques de la population. Il évite cependant que le choix des unités dépende arbitrairement de l'enquêteur et permet de raisonner sur les erreurs dues au tirage.
Tirage aléatoire simple
Toutes les unités ont la même probabilité d'être sélectionnées et tous les échantillons de même taille sont équiprobables. Ce mode exige une base de sondage complète et sans doublon.
Tirage systématique
Les unités sont ordonnées, un point de départ est tiré au hasard, puis une unité est sélectionnée à intervalles réguliers. La méthode est simple, mais une périodicité cachée dans l'ordre de la base peut déformer la sélection.
Tirage stratifié
La population est divisée en strates, c'est-à-dire en sous-groupes définis avant le tirage. Un tirage probabiliste est ensuite réalisé dans chaque strate. Cette méthode assure la présence des catégories jugées importantes et peut améliorer la précision si les unités d'une même strate sont homogènes.
Tirage en grappes
La population est divisée en groupes naturels appelés grappes. Certaines grappes sont tirées, puis toutes leurs unités ou une partie d'entre elles sont étudiées. Cette organisation facilite le recueil, mais les unités d'une même grappe se ressemblent souvent, ce qui réduit l'information apportée par chaque observation supplémentaire.
Tirage à plusieurs degrés
La sélection s'effectue successivement à plusieurs niveaux, des groupes les plus larges jusqu'aux unités statistiques. Il associe plusieurs procédures de tirage et nécessite de connaître la probabilité globale d'inclusion de chaque unité.
Modes de sélection non probabilistes
La sélection peut reposer sur la facilité d'accès, la participation volontaire ou le jugement de l'enquêteur. La méthode des quotas impose que certaines proportions observées ressemblent à celles de la population, mais le choix des unités à l'intérieur de chaque catégorie n'est pas aléatoire.
Ces méthodes peuvent produire un échantillon ressemblant à la population sur quelques variables tout en restant déséquilibré sur d'autres variables non contrôlées. Elles limitent donc la portée de la généralisation statistique.
Représentativité
La représentativité dépend de plusieurs éléments liés entre eux :
- la bonne définition de la population cible ;
- la proximité entre population source et population cible ;
- la qualité de la base de sondage ;
- le mode de sélection des unités ;
- le taux de participation et les raisons de non-participation ;
- le maintien des unités dans l'étude jusqu'à l'analyse.
Elle ne signifie pas que toutes les caractéristiques de la population doivent être reproduites exactement. Elle exige surtout que les écarts observés ne résultent pas d'un mécanisme de sélection lié aux variables étudiées.
Principaux biais de sélection
Contrairement à une variation aléatoire, un biais ne disparaît pas nécessairement lorsque la taille de l'échantillon augmente.
Biais de couverture
Il apparaît lorsque la base de sondage ne couvre pas correctement la population source. Certaines unités sont absentes, présentes plusieurs fois ou classées de manière incorrecte.
Biais de volontariat
Les unités qui choisissent de participer peuvent avoir des caractéristiques différentes de celles qui refusent. La sélection dépend alors d'une décision potentiellement liée à la variable étudiée.
Biais de non-réponse
Des unités ont été sélectionnées, mais aucune donnée exploitable n'est obtenue. Le biais apparaît si la probabilité de répondre dépend des caractéristiques analysées.
Biais lié aux critères d'inclusion
Des critères mal définis, modifiés au cours du recueil ou appliqués différemment selon les unités peuvent sélectionner préférentiellement certains profils.
Biais d'attrition
Certaines unités initialement incluses quittent l'étude ou deviennent inobservables. Si ces pertes dépendent du phénomène étudié, l'échantillon final ne représente plus correctement l'échantillon initial.
Préserver la représentativité
Des pondérations peuvent partiellement corriger des probabilités inégales de sélection ou certains déséquilibres connus. Elles ne réparent cependant pas automatiquement l'absence de catégories entières ni un mécanisme de non-réponse mal compris.
Entre ton email pour débloquer le reste de cette fiche
Il reste 4 sections à lire — plus les QCM corrigés, l'examen blanc et le suivi. 72 h d'essai gratuit, sans carte bancaire.