Les statistiques reposent sur un principe simple : vous ne pouvez pas tout mesurer, vous en mesurez donc une partie. Vous prélevez un échantillon. Vous calculez une moyenne. Vous prétendez qu’il représente le tout. Mais voici le piège. Cette moyenne n’est jamais tout à fait exacte.
La différence entre l’estimation de votre échantillon et le véritable paramètre de population est appelée erreur d’échantillonnage. C’est l’écart entre ce que vous pensez savoir et ce qui est réellement vrai. Cet écart existe parce qu’un échantillon ne représente qu’une fraction de la population. Ce n’est pas tout. C’est une tranche. Et les tranches correspondent rarement parfaitement au tout.
Pourquoi une erreur d’échantillonnage se produit
Pensez à un lycée avec 1 000 élèves. Si vous interrogez seulement dix étudiants sur leur déjeuner préféré, votre résultat sera probablement faussé. Peut-être que ces dix étudiants adorent la pizza. L’école entière pourrait préférer les salades. L’écart entre la « préférence pour la pizza » de votre enquête et la préférence réelle de l’école est une erreur d’échantillonnage.
Ce n’est pas une erreur. Ce n’est pas un bug. C’est une fatalité mathématique. Chaque fois que vous estimez un paramètre à l’aide d’un sous-ensemble de données, une erreur d’échantillonnage se produit. Le seul moment où il disparaît, c’est lorsque vous mesurez l’ensemble de la population. Un recensement n’a aucune erreur d’échantillonnage car chaque point de données est inclus. Lorsque vous incluez tout le monde, l’estimation est la vérité.
Mais nous avons rarement le temps ou l’argent nécessaires pour recenser des millions de personnes. Alors on échantillonne. Et nous vivons avec l’erreur.
Qu’est-ce qui rend l’erreur d’échantillonnage plus grande ou plus petite ?
Toutes les erreurs d’échantillonnage ne sont pas égales. Certaines études sont plus strictes que d’autres. Plusieurs facteurs déterminent l’ampleur de cet écart.
Taille de l’échantillon
C’est le facteur le plus intuitif. Il existe une relation inverse entre la taille de l’échantillon et l’erreur d’échantillonnage. Un échantillon plus grand entraîne une erreur plus petite. Si vous interrogez 1 000 personnes au lieu de 10, votre estimation est plus proche de la véritable moyenne de la population. À mesure que la taille de l’échantillon se rapproche de la taille de la population totale, l’erreur type se rapproche de zéro. Il n’atteint jamais vraiment zéro à moins d’avoir l’ensemble de la population.
Variabilité de la population
Si tous les membres d’une population ont la même valeur, un échantillon de n’importe quelle taille sera parfait. Il n’y a aucune erreur. Mais les populations réelles sont en désordre. Ils varient. Plus les valeurs de la population sont variables, plus votre échantillon est susceptible d’être non représentatif. Une variabilité élevée signifie une erreur d’échantillonnage plus élevée.
Comment les méthodes d’échantillonnage changent la donne
La façon dont vous choisissez votre échantillon est importante. La méthode elle-même peut amplifier ou réduire l’erreur.
L’échantillonnage stratifié peut aider. Cette méthode divise la population en sous-groupes homogènes (strates) et en échantillons de chacun. Si vous souhaitez représenter les opinions dans un pays, vous pouvez stratifier par âge ou par région. En veillant à ce que chaque sous-groupe soit représenté, vous réduisez l’impact d’une forte variabilité. Cela conduit à une erreur d’échantillonnage réduite.
L’échantillonnage en grappes est différent. Ici, vous divisez la population en grappes (comme des pâtés de maisons) et sélectionnez au hasard des grappes entières à enquêter. C’est moins cher et plus facile. Mais cela peut conduire à une erreur d’échantillonnage plus importante. Pourquoi? Parce que les clusters pourraient ne pas couvrir uniformément la diversité de la population. Vous pouvez choisir des clusters trop similaires les uns aux autres. L’échantillon devient moins représentatif. L’erreur grandit.
Mesurer l’incertitude
Comment quantifier cet écart ? Nous utilisons erreur standard.
L’erreur type est une mesure de la mesure dans laquelle une estimation devrait différer du paramètre réel. C’est analogue à l’écart type de tous les échantillons possibles. Pour calculer une estimation de l’erreur type, vous prenez l’écart type de l’échantillon et le divisez par la racine carrée de la taille de l’échantillon.
“L’erreur type fournit une mesure quantitative de la mesure dans laquelle une estimation devrait différer du véritable paramètre de population.”
De l’erreur standard, nous dérivons la marge d’erreur. La marge d’erreur fournit une plage. Il vous indique que le vrai paramètre se situe probablement dans un intervalle spécifique. Une marge d’erreur ne donne pas une valeur fixe pour l’erreur d’échantillonnage. Cela dépend plutôt d’un niveau de confiance. Un niveau de confiance de 95 % signifie que si vous répétiez l’étude 100 fois, le véritable paramètre tomberait dans votre marge d’erreur 95 fois.
L’autre type d’erreur
L’erreur d’échantillonnage ne représente que la moitié de l’histoire. Elle est distincte des erreurs non dues à l’échantillonnage.
L’erreur non due à l’échantillonnage inclut toutes les autres inexactitudes. Cela n’est pas dû au fait que vous avez échantillonné un sous-ensemble. Cela est dû à des méthodes défectueuses. Ces erreurs réduisent la précision tout autant que l’erreur d’échantillonnage. Mais vous ne pouvez pas les résoudre en augmentant la taille de votre échantillon.
Les erreurs non dues à l’échantillonnage se répartissent en deux catégories :
* Erreurs systémiques : Ces biais sont à sens unique.
* Erreurs variables : Celles-ci faussent les résultats de manière aléatoire, mais elles s’équilibrent généralement avec le temps.
Les sources courantes d’erreurs non dues à l’échantillonnage comprennent :
* Erreur de couverture : Omissions, duplications ou classifications erronées des unités d’échantillonnage.
* Biais de sélection : Création d’un échantillon non aléatoire et non représentatif.
* Défauts méthodologiques : Enquêtes mal conçues.
* Erreurs de traitement des données : Erreurs dans la manière dont les données sont saisies ou calculées.
* Interprétation erronée : Lecture erronée des résultats.
L’essentiel
L’erreur d’échantillonnage est le coût de faire de la science sans tout mesurer. C’est le prix de l’inférence. Vous pouvez le gérer. Vous pouvez le réduire en augmentant la taille de l’échantillon. Vous pouvez le réduire en choisissant de meilleures méthodes d’échantillonnage comme la stratification. Vous pouvez le quantifier en utilisant l’erreur standard et la marge d’erreur.
Mais vous ne pouvez pas l’éliminer. Non, sauf si vous mesurez tout le monde. Et même dans ce cas, vous devez vous soucier des erreurs non dues à l’échantillonnage. Les données ne sont jamais propres. C’est toujours une approximation. Et ça va. Tant que vous comprenez l’écart, vous pouvez y naviguer. La question n’est pas de savoir si vos données sont parfaites. La question est de savoir quelle est l’ampleur de l’écart. Et si vous pouvez vivre avec.