Calculateur d'Écart Type

Calculez instantanément la moyenne, la variance et l'écart type (population et échantillon) d'un jeu de données.

1 217 vues

Comment l'écart type est calculé

L'écart type mesure à quelle distance, en moyenne, les valeurs se situent de la moyenne. Les étapes : trouver la moyenne de l'ensemble de données ; la soustraire de chaque valeur et élever le résultat au carré (ceci supprime les signes négatifs et pondère plus lourdement les grands écarts) ; faire la moyenne de ces différences au carré pour obtenir la variance ; puis prendre la racine carrée pour revenir aux unités d'origine, ce qui donne l'écart type.

Concrètement, prenons l'ensemble de données 2, 4, 4, 4, 5, 5, 7, 9 (n = 8). La moyenne est 5. Les écarts à la moyenne sont -3, -1, -1, -1, 0, 0, 2, 4 ; en les élevant au carré on obtient 9, 1, 1, 1, 0, 0, 4, 16, dont la somme est 32. Diviser par n = 8 donne une variance de population de 4, et la racine carrée donne un écart type de population de 2. Diviser cette même somme de 32 par n-1 = 7 donne à la place une variance d'échantillon d'environ 4,57, et un écart type d'échantillon d'environ 2,14 — nettement plus grand que le chiffre de population obtenu à partir des mêmes nombres exacts.

Cette différence n'est pas une bizarrerie d'arrondi ; c'est la correction de Bessel. Quand vous calculez la moyenne à partir d'un échantillon plutôt que de connaître la vraie moyenne de la population, cette moyenne d'échantillon est, par construction, la valeur qui minimise la somme des écarts au carré pour cet échantillon précis — donc mesurer la dispersion autour d'elle et diviser par n sous-estime systématiquement la vraie variance. Diviser par n-1 plutôt que par n corrige ce biais, ce qui explique pourquoi la formule d'échantillon sert dès que vos données sont un sous-ensemble représentant un groupe plus large, et non le groupe entier.

Ce qu'il faut savoir

La population (÷n) s'utilise lorsque vos données couvrent déjà chaque membre du groupe qui vous intéresse — les 30 élèves d'une classe précise, tous les produits d'un lot précis. L'échantillon (÷n-1) s'utilise lorsque vos données sont un sous-ensemble servant à estimer un groupe plus large non mesuré en totalité — un sondage de 500 personnes représentant une population nationale, quelques mesures de laboratoire représentant un phénomène général. L'écart type s'exprime dans la même unité que les données d'origine (kilogrammes, secondes, points), contrairement à la variance, en unités au carré et plus difficile à interpréter — c'est précisément pourquoi c'est l'écart type, et non la variance, qui est habituellement rapporté. Pour des données à peu près en forme de cloche (normales), environ 68% des valeurs se situent à moins d'un écart type de la moyenne et environ 95% à moins de deux, ce qui permet de juger rapidement si une valeur est anormalement éloignée de la normale.

Questions fréquentes

Population ou échantillon — lequel utiliser ?

Si vos données couvrent l'intégralité du groupe qui vous intéresse (tous les élèves d'une classe, tous les produits d'un lot), utilisez population (÷n). S'il s'agit d'un sous-ensemble représentant un groupe plus large que vous n'avez pas mesuré en totalité (un sondage, quelques mesures de laboratoire), utilisez échantillon (÷n-1), qui donne une estimation légèrement plus grande et non biaisée de la vraie variance de ce groupe plus large.

Qu'est-ce que la correction de Bessel et pourquoi diviser par n-1 pour un échantillon ?

La moyenne d'un échantillon est, par définition, la valeur la plus proche de tous les points de cet échantillon — donc mesurer la dispersion autour d'elle et diviser par n sous-estime la variance de la population plus large dont il est issu. Diviser par n-1 corrige ce biais systématique à la baisse, ce qui explique pourquoi la formule d'échantillon produit toujours un nombre légèrement plus grand que la formule de population sur des données identiques.

Que signifie un écart type de 5 ?

Les valeurs typiques se situent à environ ±5 de la moyenne. Pour des données à peu près normales (en cloche), environ 68% des valeurs se situent à moins d'un écart type de la moyenne et environ 95% à moins de deux — donc une valeur à plus de deux écarts types est réellement inhabituelle pour cet ensemble de données.

Quelle est la différence entre variance et écart type ?

La variance est la moyenne des distances au carré par rapport à la moyenne, donc son unité est au carré (par ex. kg² si les données sont en kg) et difficile à interpréter directement. L'écart type est la racine carrée de la variance, exprimée dans la même unité que les données d'origine — c'est pourquoi c'est ce nombre, et non la variance, que les gens citent réellement.

Une seule valeur aberrante change-t-elle beaucoup l'écart type ?

Oui, de façon disproportionnée. Comme chaque écart est élevé au carré avant d'être moyenné, une valeur éloignée de la moyenne contribue bien plus au total qu'une valeur typique — une seule valeur extrême peut gonfler sensiblement l'écart type même dans un ensemble de données par ailleurs bien regroupé.

Commentaires

Pas encore de commentaires — soyez le premier à en écrire un !

Outils similaires