homecarab1.fr
Biostatistiques et méthodes d'analysechevron_rightÉchantillonnage et estimationchevron_rightPopulation, échantillon et représentativité
stylus_noteS'entraînerS'entraînerarrow_backarrow_forward

Sommaire

  • 1Population, unités et champ de l'étude
  • 2De la population à l'échantillon
  • 3Paramètre et statistique
  • 4Modes de tirage probabilistes
    • 4.1Tirage aléatoire simple
    • 4.2Tirage systématique
    • 4.3Tirage stratifié
    • 4.4Tirage en grappes
    • 4.5Tirage à plusieurs degrés
  • 5Modes de sélection non probabilistes lock — section verrouillée
  • 6Représentativité lock — section verrouillée
  • 7Principaux biais de sélection lock — section verrouillée
    • 7.1Biais de couverture lock — section verrouillée
    • 7.2Biais de volontariat lock — section verrouillée
    • 7.3Biais de non-réponse lock — section verrouillée
    • 7.4Biais lié aux critères d'inclusion lock — section verrouillée
    • 7.5Biais d'attrition lock — section verrouillée
  • 8Préserver la représentativité lock — section verrouillée
  1. Accueilchevron_right
  2. Ficheschevron_right
  3. Biostatistiques et méthodes d'analysechevron_right
  4. Échantillonnage et estimationchevron_right
  5. Population, échantillon et représentativité

B10 · Échantillonnage et estimation

Population, échantillon et représentativité

Distinguer population et échantillon, paramètre et statistique. Présenter les modes de tirage, la notion de représentativité et les principaux biais de sélection.

Biostatistiques et méthodes d'analyse·schedule7 min de lecture·quiz17 QCM corrigés

Population, unités et champ de l'étude

Une étude statistique porte sur un ensemble d'unités clairement délimité. Ces unités peuvent être des personnes, des événements ou des mesures, mais leur nature doit rester identique tout au long de l'analyse.

Définition

Unité statistique

Élément individuel sur lequel sont recueillies les variables étudiées. Chaque ligne d'un ensemble de données correspond en principe à une unité statistique.

Définition

Population cible

Ensemble des unités auxquelles les résultats de l'étude doivent pouvoir être généralisés.

La population cible est définie par des critères précis, notamment les caractéristiques des unités, le territoire et la période concernés. Une définition imprécise empêche de savoir à qui les conclusions s'appliquent.

La population réellement accessible peut être plus restreinte que la population cible.

Définition

Population source

Ensemble des unités effectivement accessibles et susceptibles d'être incluses dans l'étude.

L'écart entre population cible et population source est essentiel. Même si l'échantillon représente parfaitement la population source, les résultats ne sont pas nécessairement généralisables à une population cible plus large.

Définition

Base de sondage

Liste ou dispositif permettant d'identifier les unités de la population source susceptibles d'être sélectionnées.

Une base de sondage incomplète exclut certaines unités avant même le tirage. À l'inverse, des doublons peuvent donner à certaines unités une probabilité de sélection trop élevée.

De la population à l'échantillon

L'étude exhaustive de toutes les unités constitue un recensement. Elle est souvent impossible ou inutile en raison du coût, de la durée du recueil ou du caractère inaccessible d'une partie de la population. On étudie alors un sous-ensemble.

Définition

Échantillon

Sous-ensemble d'unités effectivement observées, sélectionnées dans une population source selon une procédure déterminée.

L'échantillonnage désigne la procédure par laquelle les unités de l'échantillon sont choisies. Sa qualité ne dépend donc pas seulement du nombre d'unités incluses, mais aussi de la manière dont elles ont été sélectionnées.

Comparaison

Population et échantillon

CritèrePopulationÉchantillon
Étendueensemble des unités concernéessous-ensemble observé
Taillenotée généralement NNNnotée généralement nnn
Description numériqueparamètresstatistiques
Rôleobjet de la généralisationsource des données analysées

Paramètre et statistique

Définition

Paramètre

Caractéristique numérique de la population, fixe pour une population donnée mais généralement inconnue.

La moyenne de la population est habituellement notée μ\muμ, sa variance σ2\sigma^2σ2 et sa proportion π\piπ. Leur valeur ne change pas lorsqu'un nouvel échantillon est tiré, car ils décrivent la même population.

Définition

Statistique

Fonction calculée uniquement à partir des observations de l'échantillon, sans dépendre d'un paramètre inconnu.

La moyenne observée xˉ\bar{x}xˉ, la variance observée s2s^2s2 et la proportion observée p^\hat{p}p^​ sont des statistiques. Elles sont connues une fois les données recueillies, mais leur valeur dépend des unités sélectionnées.

Exemple

Distinguer une proportion de population et une proportion observée

Dans une population de 100100100 patients, 202020 présentent le phénomène étudié. La proportion dans cette population est donc le paramètre π=20100=0,20\pi = \frac{20}{100} = 0{,}20π=10020​=0,20, soit 20%20\%20%.

Un premier échantillon aléatoire de 101010 patients comprend 333 patients présentant le phénomène :

p^=310=0,30=30%\hat{p} = \frac{3}{10} = 0{,}30 = 30\%p^​=103​=0,30=30%

Un second échantillon aléatoire de 101010 patients ne comprend qu’un seul patient présentant le phénomène :

p^=110=0,10=10%\hat{p} = \frac{1}{10} = 0{,}10 = 10\%p^​=101​=0,10=10%

Le paramètre π\piπ demeure égal à 20%20\%20% car la population n’a pas changé. La statistique p^\hat{p}p^​ vaut ici successivement 30%30\%30% puis 10%10\%10% : elle dépend des unités sélectionnées.

Comparaison

Paramètre et statistique

CritèreParamètreStatistique
Ensemble décritpopulationéchantillon
Statut avant l'étudefixe mais généralement inconnuvariable selon le tirage
Notation usuelleμ\muμ, σ2\sigma^2σ2, π\piπxˉ\bar{x}xˉ, s2s^2s2, p^\hat{p}p^​
Calcul directnécessite la population entièrerepose sur les observations recueillies

La variation d'une statistique entre plusieurs échantillons issus de la même population constitue la fluctuation d'échantillonnage, étudiée dans la fiche suivante.

À retenir

Un paramètre décrit la population et demeure fixe. Une statistique décrit l'échantillon et varie potentiellement d'un échantillon à l'autre.

Modes de tirage probabilistes

Définition

Échantillonnage probabiliste

Procédure dans laquelle chaque unité de la population source possède une probabilité de sélection connue et strictement positive.

Le recours au hasard ne garantit pas que l'échantillon reproduise exactement toutes les caractéristiques de la population. Il évite cependant que le choix des unités dépende arbitrairement de l'enquêteur et permet de raisonner sur les erreurs dues au tirage.

Tirage aléatoire simple

Toutes les unités ont la même probabilité d'être sélectionnées et tous les échantillons de même taille sont équiprobables. Ce mode exige une base de sondage complète et sans doublon.

Tirage systématique

Les unités sont ordonnées, un point de départ est tiré au hasard, puis une unité est sélectionnée à intervalles réguliers. La méthode est simple, mais une périodicité cachée dans l'ordre de la base peut déformer la sélection.

Tirage stratifié

La population est divisée en strates, c'est-à-dire en sous-groupes définis avant le tirage. Un tirage probabiliste est ensuite réalisé dans chaque strate. Cette méthode assure la présence des catégories jugées importantes et peut améliorer la précision si les unités d'une même strate sont homogènes.

Tirage en grappes

La population est divisée en groupes naturels appelés grappes. Certaines grappes sont tirées, puis toutes leurs unités ou une partie d'entre elles sont étudiées. Cette organisation facilite le recueil, mais les unités d'une même grappe se ressemblent souvent, ce qui réduit l'information apportée par chaque observation supplémentaire.

Tirage à plusieurs degrés

La sélection s'effectue successivement à plusieurs niveaux, des groupes les plus larges jusqu'aux unités statistiques. Il associe plusieurs procédures de tirage et nécessite de connaître la probabilité globale d'inclusion de chaque unité.

Modes de sélection non probabilistes

Définition

Échantillonnage non probabiliste

Procédure dans laquelle la probabilité de sélection de chaque unité est inconnue ou peut être nulle.

La sélection peut reposer sur la facilité d'accès, la participation volontaire ou le jugement de l'enquêteur. La méthode des quotas impose que certaines proportions observées ressemblent à celles de la population, mais le choix des unités à l'intérieur de chaque catégorie n'est pas aléatoire.

Ces méthodes peuvent produire un échantillon ressemblant à la population sur quelques variables tout en restant déséquilibré sur d'autres variables non contrôlées. Elles limitent donc la portée de la généralisation statistique.

Attention

Aléatoire ne signifie pas arbitraire

Un tirage aléatoire suit une procédure probabiliste définie. Une sélection faite sans règle précise n'est pas aléatoire au sens statistique.

Représentativité

Définition

Représentativité

Capacité d'un échantillon à refléter suffisamment les caractéristiques pertinentes de la population cible pour permettre la généralisation des résultats.

La représentativité dépend de plusieurs éléments liés entre eux :

  • la bonne définition de la population cible ;
  • la proximité entre population source et population cible ;
  • la qualité de la base de sondage ;
  • le mode de sélection des unités ;
  • le taux de participation et les raisons de non-participation ;
  • le maintien des unités dans l'étude jusqu'à l'analyse.

Elle ne signifie pas que toutes les caractéristiques de la population doivent être reproduites exactement. Elle exige surtout que les écarts observés ne résultent pas d'un mécanisme de sélection lié aux variables étudiées.

À retenir

Taille et représentativité

Augmenter la taille de l'échantillon réduit les variations dues au hasard, mais ne corrige pas un mécanisme de sélection biaisé. Un grand échantillon peut donc être très peu représentatif.

Principaux biais de sélection

Définition

Biais de sélection

Erreur systématique produite lorsque les unités incluses diffèrent des unités non incluses d'une manière liée au phénomène étudié.

Contrairement à une variation aléatoire, un biais ne disparaît pas nécessairement lorsque la taille de l'échantillon augmente.

Exemple

Un grand échantillon peut rester biaisé

Une population de 10 00010\,00010000 personnes comporte 1 0001\,0001000 personnes présentant le phénomène étudié et 9 0009\,0009000 personnes ne le présentant pas. La proportion réelle est :

π=1 00010 000=0,10=10%\pi = \frac{1\,000}{10\,000} = 0{,}10 = 10\%π=100001000​=0,10=10%

Une enquête repose sur une participation volontaire. Parmi les personnes présentant le phénomène, 500500500 participent ; parmi les autres, 500500500 participent également. L’échantillon compte donc 1 0001\,0001000 participants, dont 500500500 présentent le phénomène :

p^=5001 000=0,50=50%\hat{p} = \frac{500}{1\,000} = 0{,}50 = 50\%p^​=1000500​=0,50=50%

La proportion observée est de 50%50\%50%, alors que la proportion réelle est de 10%10\%10%. L’échantillon est pourtant de grande taille. L’écart provient ici de la participation plus fréquente des personnes présentant le phénomène : augmenter le nombre de participants sans modifier ce mécanisme conserverait un biais de volontariat.

Biais de couverture

Il apparaît lorsque la base de sondage ne couvre pas correctement la population source. Certaines unités sont absentes, présentes plusieurs fois ou classées de manière incorrecte.

Biais de volontariat

Les unités qui choisissent de participer peuvent avoir des caractéristiques différentes de celles qui refusent. La sélection dépend alors d'une décision potentiellement liée à la variable étudiée.

Biais de non-réponse

Des unités ont été sélectionnées, mais aucune donnée exploitable n'est obtenue. Le biais apparaît si la probabilité de répondre dépend des caractéristiques analysées.

Biais lié aux critères d'inclusion

Des critères mal définis, modifiés au cours du recueil ou appliqués différemment selon les unités peuvent sélectionner préférentiellement certains profils.

Biais d'attrition

Certaines unités initialement incluses quittent l'étude ou deviennent inobservables. Si ces pertes dépendent du phénomène étudié, l'échantillon final ne représente plus correctement l'échantillon initial.

Attention

Ne pas confondre biais de sélection et biais d'information

Le biais de sélection concerne les unités présentes dans l'analyse. Le biais d'information concerne la manière dont les variables sont mesurées ou classées.

Préserver la représentativité

Méthode

Construire un échantillon interprétable

  1. Définir précisément la population cible et la période concernée
  2. Identifier une population source aussi proche que possible de cette cible
  3. Construire ou vérifier une base de sondage complète et sans doublon
  4. Choisir une procédure probabiliste adaptée à l'organisation de la population
  5. Appliquer des critères d'inclusion identiques à toutes les unités
  6. Documenter les refus, les non-réponses et les pertes de suivi

Des pondérations peuvent partiellement corriger des probabilités inégales de sélection ou certains déséquilibres connus. Elles ne réparent cependant pas automatiquement l'absence de catégories entières ni un mécanisme de non-réponse mal compris.

Points clés
  • La population cible est l'ensemble auquel les résultats doivent être généralisés, tandis que l'échantillon est le sous-ensemble effectivement observé.
  • Un paramètre décrit la population ; une statistique est calculée sur l'échantillon.
  • L'échantillonnage probabiliste repose sur des probabilités de sélection connues et strictement positives.
  • La représentativité dépend du cadre de sélection, du tirage et de la participation, pas seulement de la taille de l'échantillon.
  • Les biais de couverture, de volontariat, de non-réponse et d'attrition produisent des écarts systématiques.
  • Un biais de sélection persiste potentiellement même dans un échantillon de grande taille.

Fiches connexes

À réviser dans la foulée, sur Échantillonnage et estimation.

  • Fiche 02Fluctuations d'échantillonnageÉchantillonnage et estimation
  • Fiche 03Estimation ponctuelle d'une moyenne, d'une proportion et d'une varianceÉchantillonnage et estimation
  • Fiche 04Intervalles de confiance et intervalles de pariÉchantillonnage et estimation
lock_open

Entre ton email pour débloquer le reste de cette fiche

Il reste 4 sections à lire — plus les QCM corrigés, l'examen blanc et le suivi. 72 h d'essai gratuit, sans carte bancaire.

Déjà un compte ? Se connecter · Voir les formules

arrow_backPrécédentThéorème central limite et approximations entre loisProbabilitésSuivantarrow_forwardFluctuations d'échantillonnageÉchantillonnage et estimation
Sommaire
  • 1Population, unités et champ de l'étude
  • 2De la population à l'échantillon
  • 3Paramètre et statistique
  • 4Modes de tirage probabilistes
    • 4.1Tirage aléatoire simple
    • 4.2Tirage systématique
    • 4.3Tirage stratifié
    • 4.4Tirage en grappes
    • 4.5Tirage à plusieurs degrés
  • 5Modes de sélection non probabilistes lock — section verrouillée
  • 6Représentativité lock — section verrouillée
  • 7Principaux biais de sélection lock — section verrouillée
    • 7.1Biais de couverture lock — section verrouillée
    • 7.2Biais de volontariat lock — section verrouillée
    • 7.3Biais de non-réponse lock — section verrouillée
    • 7.4Biais lié aux critères d'inclusion lock — section verrouillée
    • 7.5Biais d'attrition lock — section verrouillée
  • 8Préserver la représentativité lock — section verrouillée