Les statistiques descriptives résument des données qu’on a sous les yeux. Les statistiques inférentielles font un saut beaucoup plus audacieux : à partir d’un échantillon (quelques centaines de personnes), elles tirent des conclusions sur une population entière (plusieurs millions). C’est cet outil qui permet aux sondages, aux essais cliniques et aux études scientifiques d’exister.
Si je mesure quelque chose sur un échantillon, que puis-je dire de la population entière — et avec quelle marge d’erreur ?
Vue d’ensemble§
flowchart TB
Pop["POPULATION<br/>paramètre vrai θ (inconnu)"]
Pop -->|échantillonnage<br/>aléatoire| Ech["ÉCHANTILLON<br/>n observations"]
Ech -->|estimation| Theta["estimateur θ̂"]
Ech -->|intervalle| IC["IC à 95 %<br/>[a, b]"]
Ech -->|test| Test["p-value<br/>rejet/non rejet H₀"]
Theta -.->|tend vers| Pop
IC -.->|contient θ avec proba 0,95| Pop
1. Estimation ponctuelle§
1.1 Estimateur — définition§
Un estimateur d’un paramètre est une variable aléatoire calculée à partir d’un échantillon . Elle prend une valeur particulière (estimation) une fois l’échantillon réalisé.
Exemples classiques :
- Moyenne empirique pour estimer la moyenne
- Variance empirique corrigée pour estimer
- Fréquence pour estimer une proportion
1.2 Qualités d’un estimateur§
| Qualité | Définition | Importance |
|---|---|---|
| Sans biais | En moyenne, on tape juste | |
| Convergent | en probabilité | Plus on a de données, plus on est précis |
| Efficace | Variance minimale parmi les sans biais | Précision optimale pour un donné |
La variance empirique est biaisée : elle sous-estime car on utilise au lieu de . Diviser par corrige ce biais (correction de Bessel).
2. Théorèmes limites — pourquoi ça marche§
2.1 Loi des grands nombres§
Si sont i.i.d. d’espérance , alors :
Conséquence pratique : sur un grand échantillon, la moyenne empirique est très proche de la moyenne théorique. C’est pourquoi un sondage de 1 000 personnes peut estimer un score national avec ~3 points d’incertitude.
2.2 Théorème central limite (TCL) — le théorème-clé§
Pour i.i.d. d’espérance et de variance :
Autrement dit, la moyenne empirique, quelle que soit la loi des , suit approximativement une loi normale dès que est assez grand.
C’est ce miracle qui fait fonctionner toute l’inférence : on n’a pas besoin de connaître la loi exacte des données, la moyenne devient gaussienne par magie. En pratique, suffit pour la plupart des distributions.
3. Intervalles de confiance (IC)§
3.1 Idée§
Au lieu de donner un nombre comme estimation, on donne une fourchette assortie d’un niveau de confiance.
Un intervalle de confiance pour au niveau est un intervalle aléatoire tel que :
Niveaux usuels : (IC à 95 %), (IC à 99 %).
3.2 IC pour une moyenne (variance connue)§
Si ou par TCL pour grand :
avec pour un IC à 95 %.
3.3 IC pour une proportion§
Si estime une proportion :
\text{IC}_{95%}(p) \approx \left[\hat{p} - 1{,}96 \sqrt{\frac{\hat{p}(1-\hat{p})}{n}},; \hat{p} + 1{,}96\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}\right]Sur personnes, disent voter pour le candidat A. Donc .
Marge d’erreur : .
IC à 95 % : — on est raisonnablement sûr que le score réel est entre 50,9 % et 57,1 %. C’est ce qu’on appelle la « marge d’erreur de ±3 % » dans la presse.
Un IC à 95 % ne signifie pas « il y a 95 % de chances que θ soit dans l’intervalle » (θ est fixe, pas aléatoire). Il signifie : « si on répétait l’expérience 100 fois, environ 95 des intervalles construits contiendraient θ ».
4. Tests d’hypothèses§
4.1 Cadre général§
On formule deux hypothèses contradictoires :
- : hypothèse nulle (pas d’effet, statu quo)
- : hypothèse alternative (l’effet existe)
On calcule une statistique de test à partir des données, et on décide de rejeter ou non .
flowchart LR
Donnees[Données] --> Stat[Statistique<br/>de test]
Stat --> Cmp{Compare à<br/>valeur critique}
Cmp -->|"|T| grand"| Rejet[Rejet H₀<br/>« effet significatif »]
Cmp -->|"|T| petit"| NonRejet[Non rejet H₀<br/>« pas de preuve »]
4.2 Types d’erreur§
| Réalité \ Décision | Ne pas rejeter | Rejeter |
|---|---|---|
| vraie | Bonne décision | Erreur de type I () — faux positif |
| vraie | Erreur de type II () — faux négatif | Bonne décision |
- (niveau du test) : probabilité de rejeter à tort . Typiquement 5 %.
- (puissance du test) : probabilité de détecter un vrai effet.
Trade-off : baisser augmente . La seule façon de réduire les deux est d’augmenter .
4.3 p-value§
La p-value est la probabilité, sous l’hypothèse vraie, d’obtenir une statistique aussi extrême (ou plus) que celle observée.
Règle de décision : si , on rejette .
- Elle n’est pas la probabilité que soit vraie
- Elle n’est pas la probabilité qu’on se trompe en rejetant
- n’est pas « deux fois plus convaincant » que
La crise de réplicabilité scientifique (psychologie, médecine) tient en partie à des abus de p-value — sélection des résultats significatifs (« p-hacking »), seuil arbitraire de 5 %.
4.4 Tests classiques§
| Test | Quand l’utiliser | Statistique |
|---|---|---|
| Test de Student (t-test) | Comparer une moyenne à une valeur, ou deux moyennes | suit loi de Student |
| Test du χ² d’ajustement | Une distribution observée colle-t-elle à une distribution théorique ? | |
| Test du χ² d’indépendance | Deux variables qualitatives sont-elles indépendantes ? | Idem sur tableau de contingence |
| Test de Fisher (F-test) | Comparer deux variances | |
| Test de Kolmogorov-Smirnov | Comparer une distribution à une distribution théorique (non paramétrique) | Sup de l’écart entre fonctions de répartition |
| ANOVA | Comparer plusieurs moyennes simultanément | Décomposition de la variance |
Deux groupes (placebo vs médicament), 100 patients chacun, on mesure une amélioration. On veut tester :
- : pas de différence entre les deux groupes
- : le médicament a un effet
Le t-test donne . Comme , on rejette : l’effet observé est trop improbable sous l’hypothèse de « pas de différence ». Le médicament a un effet (au niveau de 5 %).
5. Régression linéaire§
Modèle le plus utilisé en sciences appliquées : on cherche à expliquer une variable par une variable .
5.1 Modèle§
5.2 Estimation — moindres carrés§
On minimise la somme des carrés des résidus :
5.3 Coefficient de détermination §
avec SCR = somme des carrés des résidus, SCT = somme totale. : proche de 1 = modèle bien ajusté.
Une forte corrélation peut venir de :
- cause (causalité directe)
- cause (inversion)
- Une variable cachée cause les deux (confondant)
- Le hasard pur (corrélations fortuites sur petits échantillons)
Exemple célèbre : consommation de chocolat par habitant et nombre de prix Nobel par pays sont fortement corrélés. Mais c’est probablement le PIB qui cause les deux.
5.4 Régression multiple, logistique, non linéaire§
Extensions naturelles : plusieurs variables explicatives, variable binaire (régression logistique), formes non linéaires (polynomiale, exponentielle). Base de la statistique appliquée moderne et de l’apprentissage supervisé.
6. Approche bayésienne — alternative§
Là où le frequentisme considère comme fixe et inconnu, le bayésien considère comme une variable aléatoire avec une distribution.
Avantages :
- Permet d’intégrer un savoir a priori
- L’interprétation des IC (« intervalles crédibles ») est intuitive : « il y a 95 % de chances que y soit »
- Naturel pour la mise à jour séquentielle (mises à jour bayésiennes)
Inconvénient : le choix du prior est subjectif et peut influencer les conclusions, surtout sur petits échantillons.
L’IA moderne (modèles génératifs, réseaux bayésiens) repose largement sur cette approche.
7. Pièges à connaître§
| Piège | Description |
|---|---|
| p-hacking | Multiplier les tests jusqu’à en trouver un significatif par hasard |
| HARKing | Hypothesising After Results are Known — inventer l’hypothèse a posteriori |
| Survivor bias | Échantillon non aléatoire (on n’étudie que les survivants/disponibles) |
| Simpson’s paradox | Une tendance dans des sous-groupes s’inverse en agrégeant |
| Régression vers la moyenne | Les extrêmes tendent à se rapprocher de la moyenne au mesurage suivant |
| Multiple testing | Tester 100 hypothèses au niveau 5 %, c’est en trouver ~5 fausses-positives en moyenne — d’où corrections (Bonferroni, FDR) |
Commentaires