통계 계산기

숫자 목록을 붙여넣으면 개수, 합계, 평균, 중앙값, 최빈값, 범위, 모집단 및 표본 분산과 표준편차를 즉시 계산해 드립니다.

조회수 222회

이 통계는 어떻게 계산되나요

쉼표, 공백, 줄바꿈으로 구분된 숫자 목록을 붙여넣으면 이 도구가 전체 기술통계를 한 번에 계산합니다. 평균(산술평균)은 모든 값의 합을 개수 n으로 나눈 값입니다. 중앙값은 데이터를 정렬했을 때 가운데에 위치한 값입니다: 개수가 홀수이면 정확히 가운데 값 하나이고, 짝수이면 가운데 두 값의 평균입니다. 최빈값은 가장 자주 나타나는 값(들)입니다. 데이터 집합은 최빈값이 하나일 수도, 여러 개가 동률(이봉 또는 다봉)일 수도, 모든 값이 정확히 한 번씩만 나타나 의미 있는 최빈값이 없을 수도 있습니다. 범위는 단순히 최댓값에서 최솟값을 뺀 값입니다.

분산과 표준편차는 퍼짐 정도를 나타냅니다. 모분산은 각 값과 평균의 차를 제곱한 값들의 평균, 즉 Σ(x - 평균)² / n이며, 모표준편차는 그 제곱근으로 원래 단위를 회복시킨 값입니다. 예를 들어 2, 4, 4, 4, 5, 5, 7, 9라는 집합은 평균이 5이고 최빈값은 4입니다(다른 어떤 값보다 많은 세 번 나타남). 편차의 제곱합은 32이므로 모분산은 32/8 = 4, 모표준편차는 정확히 2가 됩니다. 표본분산은 같은 합을 n이 아닌 n - 1로 나눈 값이고, 표본표준편차는 그 제곱근입니다 — 여기서는 각각 32/7 ≈ 4.57과 약 2.14로, 동일한 숫자에서 나온 모집단 값보다 둘 다 더 큽니다.

왜 n - 1로 나눌까요? 베셀 보정

이 차이는 반올림 오류가 아니라 베셀 보정이라 불리는 의도적인 조정입니다. 이 이름은 19세기 독일의 수학자이자 천문학자인 프리드리히 베셀에서 따온 것입니다. 표본평균은 그 정의상 해당 표본 데이터에 대한 제곱거리를 최소화하는 특정한 값입니다. 그 때문에 표본평균을 기준으로 퍼짐을 측정하고 n으로 나누면 실제 모분산을 체계적으로 과소평가하게 되는 편향된 추정량이 됩니다. 대신 n - 1로 나누면 그 하향 편향을 정확히 보정할 만큼 결과가 커져서, 표본 데이터로부터 편향 없는 추정값을 얻을 수 있습니다. 이것이 바로 데이터가 더 크고 완전히 측정되지 않은 모집단을 대표하는 부분집합일 때, 모집단 공식이 아니라 표본 공식이 표준으로 쓰이는 이유입니다.

평균과 중앙값은 데이터에 따라 각각 더 유용한 요약값이 될 수 있습니다. 중앙값은 이상치에 훨씬 더 강합니다: 소득 분포에서는 극소수의 초고소득자가 평균을 실제 일반인의 소득보다 훨씬 위로 끌어올리지만, 실제 가운데 값인 중앙값은 데이터 대부분이 실제로 위치한 곳에 그대로 남아 있습니다. 이런 강건함 때문에 소득이나 주택 가격 통계는 보통 중앙값으로 보고됩니다. 최빈값은 또 다르게 작동합니다: 하나 이상의 봉우리를 나타낼 수도 있고(이봉 데이터 집합은 서로 다른 두 하위 집단이 섞여 있음을 나타낼 수 있음), 집합 내 모든 값이 고유하면 정의되지 않을 수도 있습니다.

자주 묻는 질문

모표준편차와 표본표준편차의 차이는 무엇인가요?

모표준편차(÷n)는 데이터가 관심 있는 그룹의 모든 구성원을 포함한다고 가정합니다. 표본표준편차(÷n-1)는 데이터가 더 크고 완전히 측정되지 않은 그룹을 추정하는 데 쓰이는 부분집합이라고 가정합니다. 동일한 숫자라도 표본 공식이 항상 약간 더 큰 값을 내는데, 이 추가된 크기가 바로 베셀 보정으로, 표본 기반 분산이 실제 모집단 값을 과소평가하는 경향을 상쇄합니다.

표본분산에 베셀 보정(n-1로 나누기)을 사용하는 이유는 무엇인가요?

표본평균은 정의상 해당 표본 데이터에 대한 제곱거리를 최소화하는 값입니다 — 그래서 이를 기준으로 퍼짐을 측정하고 n으로 나누면 실제 모분산을 체계적으로 과소평가하게 됩니다. 대신 n-1로 나누면 그 하향 편향이 보정되어 편향 없는 추정값을 얻을 수 있습니다. 이 방법은 19세기 독일의 수학자이자 천문학자인 프리드리히 베셀의 이름을 따서 명명되었습니다.

평균 대신 중앙값을 언제 사용해야 하나요?

평균을 왜곡시킬 만한 극단적인 이상치가 데이터에 있을 때는 중앙값을 사용하십시오. 대표적인 예가 소득입니다: 소수의 초고소득자가 평균을 대다수 사람들이 실제로 버는 금액보다 훨씬 위로 끌어올릴 수 있지만, 실제 가운데 값인 중앙값은 대표성을 유지합니다. 그래서 소득과 주택 가격 통계는 보통 중앙값으로 보고됩니다.

데이터 집합에 최빈값이 여러 개이거나 아예 없을 수도 있나요?

둘 다 가능합니다. 두 개 이상의 값이 최고 빈도로 동률이면 그 집합은 이봉(최빈값 2개) 또는 다봉(2개 초과)이며, 동률인 모든 값이 함께 보고됩니다. 모든 값이 정확히 한 번씩만 나타나면 다른 값보다 더 자주 반복되는 값이 없으므로 최빈값은 정의되지 않으며, 여기서는 "없음"으로 표시됩니다.

최빈값은 정확히 어떻게 결정되나요?

계산기는 각 값이 몇 번 나타나는지 센 뒤 가장 높은 빈도를 찾아 그 빈도에 도달한 모든 값을 보고합니다. 최고 빈도가 1이면 — 즉 아무것도 반복되지 않으면 — 의미 있는 최빈값이 없습니다. 하나의 값이 나머지보다 확실히 더 많이 반복되면 그 값만 최빈값이 되고, 여러 값이 최고 빈도에서 동률이면 모두 함께 나열됩니다.

댓글

아직 댓글이 없습니다 — 첫 댓글을 남겨보세요!

비슷한 도구