들어가며
평균은 여러 값을 하나로 줄여 보여 주지만, 그 한 수가 항상 ‘보통’을 뜻하는 것은 아닙니다. 대부분의 값에서 멀리 떨어진 값 하나가 평균을 끌어당기거나, 서로 전혀 다른 두 자료가 같은 평균을 가질 수 있습니다.
평균을 계산하는 능력과 평균이 자료를 잘 대표하는지 판단하는 능력은 다릅니다. 산술평균·중앙값·최빈값을 자료의 모양과 함께 비교하면 한 숫자가 숨기는 부분을 찾을 수 있습니다.
산술평균은 전체를 똑같이 나눈 값입니다
산술평균은 모든 값을 더한 뒤 자료의 개수로 나눕니다. 6, 8, 10의 평균이 8이라는 것은 합 24를 세 곳에 똑같이 나누면 각각 8이 된다는 뜻입니다.
값들이 평균 주변에 비교적 고르게 모여 있다면 평균은 자료의 중심을 간단히 보여 줍니다. 하지만 평균만으로는 값들이 얼마나 퍼져 있는지 알 수 없습니다.
중앙값은 순서의 가운데를 봅니다
중앙값은 자료를 작은 값부터 늘어놓았을 때 가운데 있는 값입니다. 자료가 홀수 개면 한가운데 값, 짝수 개면 가운데 두 값의 평균을 사용합니다.
중앙값은 맨 끝의 값이 얼마나 크거나 작은지보다 위치를 봅니다. 그래서 극단적으로 큰 값 하나가 있는 자료에서는 산술평균보다 대부분의 값이 모인 위치를 더 잘 보여 줄 수 있습니다.
예제: 한 개의 큰 값이 평균을 끌어올립니다
평균과 중앙값 비교
다섯 번의 소요 시간이 7분, 8분, 8분, 9분, 28분입니다. 평균과 중앙값 중 어느 값이 보통 시간을 더 잘 설명할까요?
- 합은 60분이므로 평균은 60÷5=12분입니다.
- 정렬된 자료의 가운데 값은 8분이므로 중앙값은 8분입니다.
- 다섯 값 중 네 개가 7~9분에 모여 있고 28분만 멀리 떨어져 있습니다.
- 이번 자료의 평소 시간을 말할 때는 중앙값 8분이 더 자연스럽습니다.
답 평균 12분, 중앙값 8분
확인 28분이 지연·측정 오류·실제 특수 상황 중 무엇인지 조사한 뒤 해석해야 합니다.
집단 크기가 다르면 평균의 평균을 바로 내지 않습니다
A반 10명의 평균이 70점이고 B반 30명의 평균이 90점이라고 해 봅시다. 두 평균 70과 90을 단순히 더해 2로 나눈 80점은 전체 평균이 아닙니다. 학생 수가 다른 만큼 각 평균에 가중치를 줘야 합니다.
각 집단의 크기가 같을 때만 집단 평균들의 단순평균이 전체 평균과 같습니다. 표나 기사에서 여러 집단을 합친 평균을 볼 때는 표본 수가 함께 제시됐는지 확인하세요.
같은 평균도 자료의 퍼짐은 다를 수 있습니다
8, 8, 8, 8의 평균은 8입니다. 2, 6, 10, 14의 평균도 8입니다. 첫 자료는 값이 모두 같고, 둘째 자료는 2부터 14까지 넓게 퍼져 있습니다.
| 자료 | 값 | 평균 | 범위 |
|---|---|---|---|
| A | 8, 8, 8, 8 | 8 | 0 |
| B | 2, 6, 10, 14 | 8 | 12 |
평균이 같다는 이유만으로 두 집단이 비슷하다고 말할 수 없습니다. 최솟값·최댓값·범위나 상자그림처럼 퍼짐을 보여 주는 정보가 함께 필요합니다.
최빈값은 가장 자주 나온 값을 알려 줍니다
신발 크기나 선택한 색처럼 가장 흔한 항목이 필요한 상황에서는 최빈값이 유용합니다. 230, 235, 240, 240, 245에서 최빈값은 240입니다.
모든 값의 빈도가 같으면 최빈값이 없을 수 있고, 같은 최고 빈도의 값이 둘 이상이면 최빈값도 여러 개일 수 있습니다. 평균·중앙값·최빈값 중 하나를 기계적으로 고르기보다 질문이 무엇인지 먼저 봅니다.
- 전체 양을 고르게 나누고 싶다: 산술평균
- 극단값의 영향을 줄여 가운데를 보고 싶다: 중앙값
- 가장 자주 선택된 값을 알고 싶다: 최빈값
이상값은 이유를 확인하기 전에 지우지 않습니다
멀리 떨어진 값은 입력 오류일 수도 있지만 드문 실제 상황을 기록한 값일 수도 있습니다. 28분이 타이머 실수라면 고칠 근거가 필요하고, 교통 지연이라는 실제 사건이라면 자료에 남겨야 할 수 있습니다.
이상값을 제외한 결과를 제시한다면 제외 기준과 제외 전후의 평균을 함께 밝혀야 합니다. 값이 마음에 들지 않는다는 이유만으로 빼면 자료의 의미가 달라집니다.
정리
평균을 대표값으로 쓰기 전 질문
- 대부분의 값이 평균 주변에 모여 있는가?
- 평균을 크게 움직이는 이상값이 있는가?
- 합치려는 집단의 크기가 서로 같은가?
- 같은 평균 뒤에 서로 다른 퍼짐이 숨어 있지 않은가?
- 질문에 평균·중앙값·최빈값 중 무엇이 알맞은가?
확인
자료를 직접 판단해 보기
1. 4, 5, 5, 6, 30의 평균과 중앙값을 구하고 대표값을 고르세요.
풀이와 답 보기
평균은 50÷5=10, 중앙값은 5입니다. 네 값이 4~6에 모여 있으므로 평소 크기를 설명할 때는 중앙값 5가 더 알맞습니다.
2. 20명인 A반 평균 80점, 20명인 B반 평균 90점의 전체 평균을 구하세요.
풀이와 답 보기
두 집단의 크기가 같으므로 (80+90)÷2=85점입니다. 가중합으로 계산해도 (20×80+20×90)÷40=85입니다.
FAQ
자주 묻는 질문
평균과 산술평균은 같은 말인가요?
일상에서는 평균을 산술평균 뜻으로 많이 씁니다. 다만 대표값에는 중앙값과 최빈값도 있으므로 자료의 문맥을 확인해야 합니다.
이상값은 언제 삭제해도 되나요?
입력이나 측정 오류라는 확인 가능한 근거가 있을 때 수정하거나 제외할 수 있습니다. 실제 드문 관측이라면 이유 없이 지우지 않습니다.
평균만 같으면 두 집단의 수준도 같은가요?
아닙니다. 값의 퍼짐, 중앙값, 표본 수와 자료의 범위를 함께 봐야 합니다.
출처
참고한 자료
- OpenStax, Measures of the Center of the Data ↗
평균·중앙값·최빈값의 정의와 이상값이 중앙값 선택에 미치는 영향을 확인했습니다.
- NIST/SEMATECH, What are outliers in the data? ↗
이상값을 식별하고 원인을 조사해야 하는 이유를 확인했습니다.