표준편차 계산기
데이터 집합의 평균, 분산, 표준편차(모집단·표본)를 즉시 계산합니다.
조회수 1,218회
표준편차는 어떻게 계산되나요
표준편차는 값들이 평균에서 평균적으로 얼마나 떨어져 있는지를 나타냅니다. 계산 순서는 다음과 같습니다: 데이터 집합의 평균을 구합니다; 각 값에서 평균을 빼고 그 결과를 제곱합니다(이는 음수 부호를 없애고 더 큰 차이에 더 큰 가중치를 줍니다); 그 제곱한 차이들의 평균을 내어 분산을 얻습니다; 그런 다음 제곱근을 취해 원래 단위로 되돌리면 표준편차가 됩니다.
구체적으로, 데이터 집합 2, 4, 4, 4, 5, 5, 7, 9(n = 8)를 예로 들어 보겠습니다. 평균은 5입니다. 평균에서의 편차는 -3, -1, -1, -1, 0, 0, 2, 4이며, 각각을 제곱하면 9, 1, 1, 1, 0, 0, 4, 16이 되어 합은 32입니다. 이를 n = 8로 나누면 모집단 분산 4가 되고, 제곱근을 취하면 모집단 표준편차 2가 됩니다. 같은 합 32를 이번에는 n-1 = 7로 나누면 표본 분산은 약 4.57이 되고, 표본 표준편차는 약 2.14가 됩니다 — 완전히 같은 숫자에서 나온 모집단 값보다 눈에 띄게 더 큽니다.
이 차이는 반올림에 따른 우연이 아니라 베셀 보정(Bessel's correction)입니다. 실제 모집단 평균을 알지 못하고 표본에서 평균을 계산할 때, 그 표본 평균은 정의상 그 특정 표본에 대해 제곱 편차의 합을 최소화하는 값입니다 — 그래서 이를 중심으로 퍼짐을 측정하고 n으로 나누면 실제 모집단 분산을 체계적으로 과소평가하게 됩니다. n 대신 n-1로 나누면 이 하향 편향이 보정됩니다. 그래서 데이터가 전체 집단이 아니라 더 큰 집단을 대신하는 부분집합일 때는 표본 공식을 사용하는 것입니다.
알아야 할 것
모집단(÷n)은 데이터가 이미 관심 있는 집단의 모든 구성원을 포함할 때 사용합니다 — 특정 학급의 학생 30명 전원, 특정 배치의 모든 제품처럼 말입니다. 표본(÷n-1)은 데이터가 완전히 측정하지 않은 더 큰 집단에 대해 무언가를 추정하기 위한 부분집합일 때 사용합니다 — 전국 인구를 대신하는 500명 규모의 설문, 일반적인 현상을 대신하는 소수의 실험실 측정값처럼 말입니다. 표준편차는 분산과 달리 원본 데이터와 같은 단위(킬로그램, 초, 점수)로 표현됩니다. 분산은 제곱 단위이기 때문에 직접 해석하기가 더 어렵습니다 — 바로 이 때문에 보통 보고되는 수치는 분산이 아니라 표준편차입니다. 대체로 종 모양(정규분포)을 띠는 데이터에서는 값의 약 68%가 평균의 표준편차 1개 범위 안에, 약 95%가 2개 범위 안에 들어가며, 이는 특정 값이 일반적인 값에서 얼마나 벗어나 있는지를 빠르게 판단하는 방법이 됩니다.
자주 묻는 질문
모집단과 표본 중 무엇을 써야 하나요?
데이터가 관심 있는 집단 전체를 포함한다면(한 학급의 모든 학생, 한 배치의 모든 제품처럼) 모집단(÷n)을 사용하세요. 완전히 측정하지 않은 더 큰 집단을 대신하는 부분집합(설문조사, 소수의 실험실 측정값)이라면 표본(÷n-1)을 사용하세요. 이는 그 더 큰 집단의 실제 분산에 대해 조금 더 크지만 편향되지 않은 추정값을 제공합니다.
베셀 보정이란 무엇이고, 표본에서는 왜 n-1로 나누나요?
표본 자체의 평균은 정의상 그 표본 안의 모든 점에 가장 가까운 값입니다 — 그래서 이를 중심으로 퍼짐을 측정하고 n으로 나누면, 그 표본이 나온 더 넓은 모집단의 분산을 과소평가하게 됩니다. 대신 n-1로 나누면 이 체계적인 하향 편향이 보정됩니다. 그래서 동일한 데이터에서 표본 공식은 항상 모집단 공식보다 약간 더 큰 수치를 냅니다.
표준편차가 5라는 것은 무슨 뜻인가요?
일반적인 값들은 평균에서 대략 ±5 범위 안에 있습니다. 대체로 정규분포에 가까운 데이터에서는 값의 약 68%가 평균의 표준편차 1개 범위 안에, 약 95%가 2개 범위 안에 들어갑니다 — 그래서 평균에서 표준편차 2개보다 더 멀리 떨어진 값은 그 데이터 집합에서 진짜로 이례적인 값입니다.
분산과 표준편차의 차이는 무엇인가요?
분산은 평균으로부터의 거리를 제곱한 값들의 평균이므로 단위가 제곱이 되어(데이터가 kg라면 kg²처럼) 직접 해석하기 어렵습니다. 표준편차는 분산의 제곱근으로, 원본 데이터와 같은 단위로 표현됩니다 — 그래서 사람들이 실제로 언급하는 수치는 분산이 아니라 표준편차입니다.
하나의 이상치가 표준편차를 크게 바꾸나요?
네, 불균형적으로 크게 바꿉니다. 각 편차는 평균을 내기 전에 제곱되기 때문에, 평균에서 멀리 떨어진 값은 일반적인 값보다 훨씬 더 큰 영향을 전체 합계에 미칩니다 — 하나의 극단적인 이상치만으로도, 그렇지 않으면 촘촘하게 모여 있는 데이터 집합의 표준편차를 눈에 띄게 부풀릴 수 있습니다.
비슷한 도구
문제 신고하기
표준편차 계산기
댓글
아직 댓글이 없습니다 — 첫 댓글을 남겨보세요!