Calculateur de Statistiques
Collez une liste de nombres et obtenez instantanément le nombre de valeurs, la somme, la moyenne, la médiane, le mode, l'étendue, ainsi que la variance et l'écart-type de population et d'échantillon.
221 vues
Comment Ces Statistiques Sont Calculées
Collez n'importe quelle liste de nombres — séparés par des virgules, des espaces ou des sauts de ligne — et cet outil calcule d'un coup l'ensemble du tableau descriptif. La moyenne (moyenne arithmétique) est la somme de toutes les valeurs divisée par leur nombre, n. La médiane est la valeur centrale une fois les données triées : pour un nombre impair de valeurs, c'est la valeur unique du centre ; pour un nombre pair, c'est la moyenne des deux valeurs centrales. Le mode est la valeur (ou les valeurs) qui apparaît le plus souvent ; un ensemble de données peut avoir un seul mode, plusieurs modes à égalité (bimodal ou multimodal), ou aucun mode significatif si chaque valeur n'apparaît qu'une seule fois. L'étendue est simplement la valeur maximale moins la valeur minimale.
La variance et l'écart-type mesurent la dispersion. La variance de population est la moyenne des carrés des écarts de chaque valeur à la moyenne, Σ(x - moyenne)² / n, et l'écart-type de population en est la racine carrée, ce qui rétablit les unités d'origine. Par exemple, l'ensemble 2, 4, 4, 4, 5, 5, 7, 9 a une moyenne de 5 et un mode de 4 (il apparaît trois fois, plus que toute autre valeur) ; la somme de ses écarts au carré vaut 32, ce qui donne une variance de population de 32/8 = 4 et un écart-type de population de exactement 2. La variance d'échantillon divise cette même somme par n - 1 au lieu de n, et l'écart-type d'échantillon en est la racine carrée — ici cela donne 32/7 ≈ 4,57 et environ 2,14, tous deux supérieurs aux valeurs de population obtenues à partir des mêmes nombres.
Pourquoi Diviser par n - 1 ? La Correction de Bessel
Cet écart n'est pas une bizarrerie d'arrondi — c'est une correction délibérée connue sous le nom de correction de Bessel, du nom du mathématicien et astronome allemand du XIXe siècle Friedrich Bessel. Une moyenne d'échantillon est, par construction, la valeur précise qui minimise les distances au carré aux points de données de cet échantillon lui-même. C'est pour cela que mesurer la dispersion autour d'elle et diviser par n sous-estime systématiquement la véritable variance de population — un estimateur biaisé. Diviser par n - 1 au lieu de n gonfle le résultat juste assez pour corriger ce biais à la baisse, produisant une estimation non biaisée à partir des données d'échantillon. C'est pourquoi la formule d'échantillon, et non celle de population, est le choix standard chaque fois que vos nombres constituent un sous-ensemble représentant un groupe plus large, non entièrement mesuré.
La moyenne et la médiane peuvent chacune être le résumé le plus utile selon les données. La médiane est bien plus résistante aux valeurs aberrantes : dans une distribution de revenus, une poignée de personnes aux revenus extrêmement élevés tire la moyenne bien au-dessus de ce que gagne une personne typique, tandis que la médiane — la véritable valeur centrale — reste ancrée là où se situe réellement l'essentiel des données. Cette résistance explique précisément pourquoi les statistiques de revenus et de prix immobiliers sont généralement présentées sous forme de médianes. Le mode se comporte encore différemment : il peut révéler plus d'un pic (un ensemble de données bimodal pourrait représenter deux groupes sous-jacents distincts mélangés ensemble), ou être indéfini lorsque chaque valeur de l'ensemble est unique.
Questions fréquentes
Quelle est la différence entre l'écart-type de population et l'écart-type d'échantillon ?
L'écart-type de population (÷n) suppose que vos données couvrent chaque membre du groupe qui vous intéresse. L'écart-type d'échantillon (÷n-1) suppose qu'il s'agit d'un sous-ensemble utilisé pour estimer un groupe plus large, non entièrement mesuré. La formule d'échantillon est toujours légèrement plus grande pour les mêmes nombres — cette différence est la correction de Bessel, qui compense la tendance de la variance basée sur un échantillon à sous-estimer la vraie valeur de population.
Pourquoi utilise-t-on la correction de Bessel (division par n-1) pour la variance d'échantillon ?
Une moyenne d'échantillon est, par définition, la valeur qui minimise les distances au carré aux points de données de cet échantillon particulier — donc mesurer la dispersion autour de cette moyenne et diviser par n sous-estime systématiquement la véritable variance de population. Diviser par n-1 corrige au contraire ce biais à la baisse, donnant une estimation non biaisée. Elle doit son nom au mathématicien et astronome allemand du XIXe siècle Friedrich Bessel.
Quand dois-je utiliser la médiane plutôt que la moyenne ?
Utilisez la médiane lorsque vos données contiennent des valeurs aberrantes extrêmes qui fausseraient la moyenne. Le revenu en est un exemple bien connu : quelques très hauts revenus peuvent tirer la moyenne bien au-dessus de ce que gagne réellement la plupart des gens, tandis que la médiane — la véritable valeur centrale — reste représentative. C'est pourquoi les statistiques de revenus et de prix immobiliers sont généralement présentées sous forme de médianes.
Un ensemble de données peut-il avoir plusieurs modes, ou aucun mode du tout ?
Les deux sont possibles. Si deux valeurs ou plus sont à égalité pour la fréquence la plus élevée, l'ensemble est bimodal (deux modes) ou multimodal (plus de deux), et toutes les valeurs à égalité sont indiquées. Si chaque valeur n'apparaît qu'une seule fois, rien ne se répète plus qu'autre chose, donc le mode est indéfini — affiché ici comme « Aucun ».
Comment le mode est-il exactement déterminé ?
Le calculateur compte combien de fois chaque valeur apparaît, trouve le nombre d'occurrences le plus élevé, et indique chaque valeur qui l'atteint. Si le nombre d'occurrences le plus élevé est 1 — rien ne se répète — il n'y a pas de mode significatif. Si une valeur se répète clairement plus que les autres, elle est seule le mode ; si plusieurs sont à égalité pour le nombre le plus élevé, elles sont toutes listées ensemble.
Outils similaires
Signaler un problème
Calculateur de Statistiques
Commentaires
Pas encore de commentaires — soyez le premier à en écrire un !