L’essentiel
- Chirurgie ouverte, total
- 78 % (273/350)
- Néphrolithotomie percutanée, total
- 83 % (289/350)
- Résultat par taille de calcul
- chirurgie ouverte meilleure dans les deux groupes
Source : Charig et al., British Medical Journal, 1986 ; analyse de Julious et Mullee, BMJ, 1994.
L’exemple des calculs rénaux
L’étude compare deux techniques de traitement des calculs rénaux. Le succès est défini comme l’élimination du calcul ou sa réduction à moins de 2 mm trois mois après l’intervention.
| Groupe | Chirurgie ouverte | Néphrolithotomie percutanée |
|---|---|---|
| Calculs de moins de 2 cm | 93 % (81/87) | 87 % (234/270) |
| Calculs de 2 cm ou plus | 73 % (192/263) | 69 % (55/80) |
| Ensemble | 78 % (273/350) | 83 % (289/350) |
La chirurgie ouverte gagne dans chaque ligne et perd au total. Il n’y a pourtant aucune erreur de calcul : 81 + 192 = 273 et 234 + 55 = 289.
Pourquoi le résultat s’inverse
Le taux global de chaque technique est une moyenne pondérée des taux des sous-groupes, où les poids sont les effectifs. Or les deux techniques n’ont pas traité les mêmes patients :
- la chirurgie ouverte a surtout traité de gros calculs (263 sur 350, soit 75 %), plus difficiles ;
- la technique percutanée a surtout traité de petits calculs (270 sur 350, soit 77 %), plus faciles.
Le calcul qui explique tout
Chirurgie ouverte : 0,25 × 93 % + 0,75 × 73 % ≈ 78 %, tirée vers le bas par les cas difficiles.
Percutanée : 0,77 × 87 % + 0,23 × 69 % ≈ 83 %, tirée vers le haut par les cas faciles.
La taille du calcul agit à la fois sur le choix de la technique et sur la chance de succès : c’est un facteur de confusion.
C’est la même erreur que faire une moyenne de moyennes sans regarder les effectifs, poussée à l’extrême. Le bon raisonnement compare des groupes comparables (même taille de calcul), puis, si l’on veut un chiffre global, applique les deux techniques à une même répartition de patients (standardisation).
L’exemple historique des admissions à Berkeley
À l’automne 1973, l’université de Californie à Berkeley a admis environ 44 % des 8 442 hommes candidats en troisième cycle et 35 % des 4 321 femmes. L’écart semblait révéler une discrimination. En analysant les données département par département, Bickel, Hammel et O’Connell (Science, 1975) ont montré que la plupart des départements n’admettaient pas moins de femmes que d’hommes : les candidates s’étaient davantage portées vers les filières les plus sélectives, où le taux d’admission était faible pour tous. L’écart global venait de cette répartition, et non d’un biais au sein des départements.
Comment ne pas se faire piéger
- Demandez-vous ce qui différencie les groupes comparés en dehors de la variable étudiée (âge, gravité, taille, filière).
- Désagrégez : calculez les taux ou moyennes par sous-groupe homogène.
- Regardez les effectifs de chaque case : une répartition très déséquilibrée est un signal d’alerte.
- Standardisez si vous voulez un chiffre global : appliquez les taux de chaque groupe à une même population de référence.
- Méfiez-vous aussi de l’excès inverse : découper selon n’importe quelle variable peut créer des inversions artificielles. Le choix du découpage doit reposer sur un mécanisme plausible.
Le paradoxe de Simpson ne se corrige pas par plus de données : une étude très grande, donc avec un intervalle de confiance étroit (voir intervalle de confiance et erreur type), peut donner une conclusion précise… et fausse. La loi des grands nombres réduit le hasard, pas les biais de composition.
Où on le rencontre
| Domaine | Comparaison trompeuse | Variable cachée typique |
|---|---|---|
| Médecine | Taux de guérison de deux traitements | Gravité des cas traités |
| Éducation | Réussite de deux établissements | Profil des élèves, filières |
| Salaires | Évolution du salaire moyen | Changement de la composition de l’emploi |
| Sport | Moyenne de réussite de deux joueurs sur deux saisons | Nombre de tentatives par saison |
Le cas des salaires est fréquent : le salaire moyen d’une entreprise peut baisser alors que chaque salarié a été augmenté, si l’entreprise a embauché beaucoup de jeunes moins payés. Une moyenne peut aussi être déformée par une valeur aberrante ; le paradoxe de Simpson, lui, vient de la structure des groupes. L’espérance conditionnelle et les données groupées (moyenne de données groupées) permettent de formaliser ces décompositions. Toutes les méthodes sont dans la rubrique calcul de moyenne.
Questions fréquentes
D’où vient le nom ?
Du statisticien britannique Edward H. Simpson, qui l’a décrit en 1951 dans un article sur l’interprétation des tableaux de contingence. Le phénomène avait été remarqué avant lui, notamment par Karl Pearson et George Udny Yule.
Faut-il toujours préférer les chiffres désagrégés ?
Pas toujours : tout dépend de la question. Pour comparer l’effet de deux traitements, on désagrège selon les facteurs qui influencent à la fois le choix du traitement et le résultat. Pour décrire une population globale, le chiffre agrégé reste exact.
Le paradoxe peut-il se produire avec des moyennes et pas seulement des pourcentages ?
Oui. Un pourcentage est une moyenne de 0 et de 1 ; le phénomène touche de la même façon les notes moyennes, les salaires moyens ou les durées moyennes.
Sources
- Charig C. R., Webb D. R., Payne S. R., Wickham J. E., « Comparison of treatment of renal calculi by open surgery, percutaneous nephrolithotomy, and extracorporeal shockwave lithotripsy », British Medical Journal, vol. 292, 1986. pmc.ncbi.nlm.nih.gov
- Julious S. A., Mullee M. A., « Confounding and Simpson’s paradox », BMJ, vol. 309, 1994. pmc.ncbi.nlm.nih.gov
- Bickel P. J., Hammel E. A., O’Connell J. W., « Sex Bias in Graduate Admissions: Data from Berkeley », Science, vol. 187, 1975.
- Simpson E. H., « The Interpretation of Interaction in Contingency Tables », Journal of the Royal Statistical Society, série B, vol. 13, 1951.