homecarab1.fr
Biostatistiques et méthodes d'analysechevron_rightTests d'hypothèseschevron_rightComparaison de proportions et tests exacts
stylus_noteS'entraînerS'entraînerarrow_backarrow_forward

Sommaire

  • 1Identifier la structure de la comparaison
  • 2Comparer une proportion à une référence
    • 2.1Test asymptotique
  • 3Comparer deux proportions indépendantes
  • 4Test exact de Fisher pour deux groupes indépendants lock — section verrouillée
  • 5Test de McNemar pour données appariées lock — section verrouillée
  • 6Démarche de choix lock — section verrouillée
  1. Accueilchevron_right
  2. Ficheschevron_right
  3. Biostatistiques et méthodes d'analysechevron_right
  4. Tests d'hypothèseschevron_right
  5. Comparaison de proportions et tests exacts

B10 · Tests d'hypothèses

Comparaison de proportions et tests exacts

Traiter la comparaison d'une proportion à une référence et de deux proportions indépendantes pour de grands effectifs. Présenter le test exact de Fisher pour les petits effectifs et le test de McNemar pour données appariées.

Biostatistiques et méthodes d'analyse·schedule6 min de lecture·quiz15 QCM corrigés

Identifier la structure de la comparaison

Une proportion décrit la fréquence d'une modalité dans une population lorsque la variable étudiée est binaire, c'est-à-dire qu'elle ne possède que deux modalités complémentaires.

Définition

Proportion observée

Fréquence d'une modalité dans un échantillon de taille nnn. Si cette modalité est observée xxx fois, la proportion observée est p^=x/n\hat p = x/np^​=x/n.

La méthode de comparaison dépend du plan d'étude :

  • un échantillon : comparaison de sa proportion à une proportion théorique ou de référence ;
  • deux échantillons indépendants : comparaison de deux proportions provenant de sujets distincts ;
  • données appariées : comparaison de deux observations liées, réalisées sur les mêmes sujets ou sur des sujets associés par paires.

Les principes généraux des tests, notamment les hypothèses, le risque de première espèce et la valeur ppp, sont établis dans les fiches précédentes du sous-bloc.

Comparaison

Choix du test selon le plan d'étude

SituationGrands effectifsPetits effectifs
Une proportion contre une référencetest asymptotique de proportiontest binomial exact
Deux proportions indépendantestest asymptotique de deux proportionstest exact de Fisher
Deux proportions appariéestest de McNemar asymptotiquetest de McNemar exact

Comparer une proportion à une référence

On cherche à déterminer si la proportion ppp d'une population est compatible avec une valeur de référence p0p_0p0​.

Pour un test bilatéral, les hypothèses sont :

  • hypothèse nulle : H0:p=p0H_0 : p = p_0H0​:p=p0​ ;
  • hypothèse alternative : H1:p≠p0H_1 : p \neq p_0H1​:p=p0​.

Pour un test unilatéral, l'hypothèse alternative devient p>p0p > p_0p>p0​ ou p<p0p < p_0p<p0​. Son orientation doit être fixée avant l'analyse.

Test asymptotique

Sous H0H_0H0​, le nombre d'observations de la modalité étudiée suit une loi binomiale de paramètres nnn et p0p_0p0​. Lorsque l'effectif est suffisamment grand, la proportion observée p^\hat pp^​ est approximativement normale, de moyenne p0p_0p0​ et de variance p0(1−p0)/np_0(1-p_0)/np0​(1−p0​)/n.

Formule

Statistique de comparaison d'une proportion à une référence

Z=p^−p0p0(1−p0)navecp^=xnZ = \frac{\hat p-p_0}{\sqrt{\frac{p_0(1-p_0)}{n}}} \qquad \text{avec} \qquad \hat p = \frac{x}{n}Z=np0​(1−p0​)​​p^​−p0​​avecp^​=nx​
  • ZZZ : statistique de test, approximativement distribuée selon la loi normale centrée réduite sous H0H_0H0​
  • p^\hat pp^​ : proportion observée dans l'échantillon
  • p0p_0p0​ : proportion fixée par l'hypothèse nulle
  • xxx : nombre d'observations de la modalité étudiée
  • nnn : taille totale de l'échantillon
Exemple

Comparer une proportion observée à une référence

Dans un échantillon de n=200n=200n=200 sujets, la modalité est observée x=74x=74x=74 fois. La proportion de référence est p0=0,30p_0=0{,}30p0​=0,30.

  • Proportion observée : p^=74200=0,37\hat p=\frac{74}{200}=0{,}37p^​=20074​=0,37
  • Effectifs théoriques sous H0H_0H0​ : np0=200×0,30=60np_0=200\times0{,}30=60np0​=200×0,30=60 et n(1−p0)=200×0,70=140n(1-p_0)=200\times0{,}70=140n(1−p0​)=200×0,70=140 ; ils sont supérieurs à 5.
  • Écart-type sous H0H_0H0​ : 0,30×0,70200=0,0324\sqrt{\frac{0{,}30\times0{,}70}{200}}=0{,}03242000,30×0,70​​=0,0324
  • Statistique : Z=0,37−0,300,0324=2,16Z=\frac{0{,}37-0{,}30}{0{,}0324}=2{,}16Z=0,03240,37−0,30​=2,16

Pour un test bilatéral au risque de 5%5\%5%, la valeur critique est approximativement 1,961{,}961,96. Comme ∣Z∣=2,16\lvert Z\rvert=2{,}16∣Z∣=2,16 est supérieur à 1,961{,}961,96, les données ne sont pas compatibles avec une proportion égale à 0,300{,}300,30 à ce risque. La proportion observée est supérieure à la référence.

L'approximation normale exige que les effectifs théoriques np0np_0np0​ et n(1−p0)n(1-p_0)n(1−p0​) soient suffisamment grands. Le seuil de 5 pour chacun constitue une règle d'usage fréquente, mais non une frontière mathématique absolue.

Pour un test bilatéral au risque α\alphaα, H0H_0H0​ est rejetée lorsque la valeur absolue de ZZZ dépasse le quantile critique de la loi normale centré-réduite. Dans un test unilatéral, une seule extrémité de cette loi constitue la région de rejet.

Attention

Variance calculée sous l'hypothèse nulle

Dans la statistique de test, l'écart-type est calculé avec p0p_0p0​, et non avec p^\hat pp^​, car la distribution de référence est celle supposée vraie sous H0H_0H0​.

Lorsque l'approximation normale est insuffisante, la loi binomiale permet un test exact. Cette méthode est distincte du test exact de Fisher, qui concerne deux groupes indépendants.

Comparer deux proportions indépendantes

On considère deux populations indépendantes, de proportions respectives p1p_1p1​ et p2p_2p2​. Les échantillons comportent n1n_1n1​ et n2n_2n2​ sujets, parmi lesquels la modalité étudiée est observée respectivement x1x_1x1​ et x2x_2x2​ fois.

Pour une comparaison bilatérale :

  • H0:p1=p2H_0 : p_1 = p_2H0​:p1​=p2​ ;
  • H1:p1≠p2H_1 : p_1 \neq p_2H1​:p1​=p2​.

Sous H0H_0H0​, les deux groupes partagent une même proportion inconnue. Celle-ci est estimée en regroupant les observations des deux échantillons : il s'agit de la proportion commune estimée.

Formule

Test asymptotique de deux proportions indépendantes

Z=p^1−p^2p^c(1−p^c)(1n1+1n2)avecp^1=x1n1,p^2=x2n2,p^c=x1+x2n1+n2Z = \frac{\hat p_1-\hat p_2} {\sqrt{\hat p_c(1-\hat p_c)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}} \qquad \text{avec} \qquad \hat p_1=\frac{x_1}{n_1}, \quad \hat p_2=\frac{x_2}{n_2}, \quad \hat p_c=\frac{x_1+x_2}{n_1+n_2}Z=p^​c​(1−p^​c​)(n1​1​+n2​1​)​p^​1​−p^​2​​avecp^​1​=n1​x1​​,p^​2​=n2​x2​​,p^​c​=n1​+n2​x1​+x2​​
  • ZZZ : statistique de test, approximativement distribuée selon la loi normale centrée réduite sous H0H_0H0​
  • p^1\hat p_1p^​1​ et p^2\hat p_2p^​2​ : proportions observées dans les groupes 1 et 2
  • p^c\hat p_cp^​c​ : estimation groupée de la proportion commune sous H0H_0H0​
  • x1x_1x1​ et x2x_2x2​ : nombres d'observations de la modalité étudiée
  • n1n_1n1​ et n2n_2n2​ : tailles des deux échantillons indépendants
Exemple

Comparer deux proportions indépendantes

Dans le groupe 1, 606060 sujets sur 100100100 présentent la modalité. Dans le groupe 2, elle est présente chez 484848 sujets sur 120120120.

  • Proportions observées : p^1=60100=0,60\hat p_1=\frac{60}{100}=0{,}60p^​1​=10060​=0,60 et p^2=48120=0,40\hat p_2=\frac{48}{120}=0{,}40p^​2​=12048​=0,40
  • Proportion commune estimée sous H0H_0H0​ : p^c=60+48100+120=108220=0,491\hat p_c=\frac{60+48}{100+120}=\frac{108}{220}=0{,}491p^​c​=100+12060+48​=220108​=0,491
  • Erreur-type groupée : 0,491×0,509(1100+1120)=0,0677\sqrt{0{,}491\times0{,}509\left(\frac{1}{100}+\frac{1}{120}\right)}=0{,}06770,491×0,509(1001​+1201​)​=0,0677
  • Statistique : Z=0,60−0,400,0677=2,95Z=\frac{0{,}60-0{,}40}{0{,}0677}=2{,}95Z=0,06770,60−0,40​=2,95

Pour un test bilatéral au risque de 5%5\%5%, ∣Z∣=2,95\lvert Z\rvert=2{,}95∣Z∣=2,95 dépasse 1,961{,}961,96. Les données sont donc incompatibles avec l'égalité des deux proportions à ce risque. La modalité est plus fréquente dans le groupe 1.

L'approximation est acceptable lorsque les nombres théoriques de sujets présentant et ne présentant pas la modalité sont suffisamment grands dans chaque groupe. Ces nombres sont calculés sous H0H_0H0​ à partir de p^c\hat p_cp^​c​.

La statistique Z2Z^2Z2 est équivalente à la statistique du test du khi-deux de Pearson appliqué à un tableau à deux lignes et deux colonnes, avec un degré de liberté. La construction générale des tests du khi-deux relève de la fiche dédiée.

À retenir

Pour tester H0:p1=p2H_0 : p_1=p_2H0​:p1​=p2​, l'erreur-type repose sur la proportion groupée p^c\hat p_cp^​c​, car l'hypothèse nulle impose une proportion commune aux deux populations.

Test exact de Fisher pour deux groupes indépendants

Lorsque les effectifs sont faibles ou que certaines fréquences théoriques sont trop petites, l'approximation normale et celle du khi-deux peuvent être imprécises.

Définition

Test exact de Fisher

Test de comparaison de deux proportions indépendantes fondé sur la distribution exacte des tableaux possibles, conditionnellement aux effectifs marginaux observés.

Notons :

  • aaa le nombre de sujets présentant la modalité dans le groupe 1 ;
  • bbb le nombre de sujets ne la présentant pas dans le groupe 1 ;
  • ccc et ddd les nombres correspondants dans le groupe 2 ;
  • N=a+b+c+dN=a+b+c+dN=a+b+c+d l'effectif total.

Sous H0H_0H0​, et lorsque les totaux des groupes ainsi que le nombre total de sujets présentant la modalité sont fixés, la fréquence aaa suit une loi hypergéométrique.

Formule

Probabilité conditionnelle d'un tableau

P(A=a∣marges)=(a+ba)(c+dc)(Na+c)P(A=a \mid \text{marges}) = \frac{\binom{a+b}{a}\binom{c+d}{c}} {\binom{N}{a+c}}P(A=a∣marges)=(a+cN​)(aa+b​)(cc+d​)​
  • AAA : variable aléatoire représentant le nombre de sujets présentant la modalité dans le groupe 1
  • aaa, bbb, ccc et ddd : effectifs observés des quatre combinaisons entre groupe et modalité
  • NNN : effectif total, égal à a+b+c+da+b+c+da+b+c+d
  • (uv)\binom{u}{v}(vu​) : nombre de façons de choisir vvv éléments parmi uuu
  • P(A=a∣marges)P(A=a \mid \text{marges})P(A=a∣marges) : probabilité du tableau observé conditionnellement à ses marges

La valeur ppp est obtenue en additionnant les probabilités des tableaux compatibles avec les mêmes marges et au moins aussi défavorables à H0H_0H0​ que le tableau observé. Pour un test bilatéral, plusieurs conventions de classement des tableaux existent ; la convention employée doit donc être précisée.

Le qualificatif exact signifie que la distribution de la statistique n'est pas remplacée par une approximation asymptotique. Le test reste valide avec de petits effectifs, mais peut être conservateur du fait du caractère discret des probabilités.

Test de McNemar pour données appariées

Deux proportions ne sont pas indépendantes lorsque les deux mesures portent sur les mêmes sujets. Chaque paire d'observations peut être concordante, lorsque les deux réponses sont identiques, ou discordante, lorsqu'elles diffèrent.

Définition

Test de McNemar

Test d'homogénéité des proportions marginales pour deux mesures binaires appariées. Il compare les deux sens possibles de discordance au sein des paires.

Notons bbb le nombre de paires positives à la première mesure et négatives à la seconde, et ccc le nombre de paires négatives à la première mesure et positives à la seconde. Sous H0H_0H0​, les deux sens de discordance ont la même probabilité.

Les paires concordantes n'apportent aucune information sur une différence entre les proportions marginales : seules les b+cb+cb+c paires discordantes interviennent.

Formule

Statistique asymptotique de McNemar

χMcN2=(b−c)2b+c\chi^2_{\mathrm{McN}}=\frac{(b-c)^2}{b+c}χMcN2​=b+c(b−c)2​
  • χMcN2\chi^2_{\mathrm{McN}}χMcN2​ : statistique de McNemar, approximativement distribuée selon une loi du khi-deux à un degré de liberté sous H0H_0H0​
  • bbb : nombre de discordances dans le premier sens
  • ccc : nombre de discordances dans le sens opposé
  • b+cb+cb+c : nombre total de paires discordantes

Une correction de continuité peut remplacer le numérateur par (∣b−c∣−1)2\left(\lvert b-c\rvert-1\right)^2(∣b−c∣−1)2. Lorsque le nombre de discordances est faible, le test exact est préférable : conditionnellement à b+cb+cb+c, le nombre de discordances dans un sens suit sous H0H_0H0​ une loi binomiale de paramètres b+cb+cb+c et 1/21/21/2.

Attention

Indépendance et appariement

Le test de deux proportions indépendantes et le test exact de Fisher ignorent le lien entre observations appariées. Pour des données binaires appariées, le test approprié est celui de McNemar.

À retenir

Dans le test de McNemar, l'information sur la différence des proportions est entièrement portée par les paires discordantes. Les paires concordantes n'interviennent pas dans la statistique.

Démarche de choix

Méthode

Choisir un test de comparaison de proportions

  1. Vérifier que la variable est binaire et identifier la proportion étudiée
  2. Déterminer s'il existe un seul échantillon, deux groupes indépendants ou des données appariées
  3. Formuler H0H_0H0​ et choisir avant l'analyse une alternative bilatérale ou unilatérale
  4. Examiner les effectifs théoriques ou, pour McNemar, le nombre de paires discordantes
  5. Utiliser le test asymptotique si l'approximation est satisfaisante, sinon le test exact adapté
  6. Conclure sur la compatibilité des données avec H0H_0H0​ au risque fixé
Points clés
  • Une proportion se compare à une référence par un test normal asymptotique lorsque np0np_0np0​ et n(1−p0)n(1-p_0)n(1−p0​) sont suffisamment grands
  • Deux proportions indépendantes se comparent avec une variance calculée à partir de la proportion groupée sous H0H_0H0​
  • Le test exact de Fisher remplace les approximations pour deux groupes indépendants de faibles effectifs
  • Le test de McNemar est réservé aux données binaires appariées
  • Le test de McNemar repose uniquement sur les deux catégories de paires discordantes

Fiches connexes

À réviser dans la foulée, sur Tests d'hypothèses.

  • Fiche 01Principe d'un test statistique : hypothèses, risques et puissanceTests d'hypothèses
  • Fiche 02Statistique de test, région de rejet et p-valueTests d'hypothèses
  • Fiche 03Comparaison d'une moyenne à une valeur de référenceTests d'hypothèses
lock_open

Entre ton email pour débloquer le reste de cette fiche

Il reste 3 sections à lire — plus les QCM corrigés, l'examen blanc et le suivi. 72 h d'essai gratuit, sans carte bancaire.

Déjà un compte ? Se connecter · Voir les formules

arrow_backPrécédentComparaison de variancesTests d'hypothèsesSuivantarrow_forwardTests du khi-deux : conformité, indépendance et homogénéitéTests d'hypothèses
Sommaire
  • 1Identifier la structure de la comparaison
  • 2Comparer une proportion à une référence
    • 2.1Test asymptotique
  • 3Comparer deux proportions indépendantes
  • 4Test exact de Fisher pour deux groupes indépendants lock — section verrouillée
  • 5Test de McNemar pour données appariées lock — section verrouillée
  • 6Démarche de choix lock — section verrouillée