평균 회귀 (Regression to the Mean)

처음 실린 날 2026-05-23 · 마지막으로 고친 날 2026-09-27

다른 이름: 평균회귀 · 평균으로의 회귀 · 평균 회귀의 법칙 · 평균회귀의 법칙 · Regression to the Mean

한 줄 정의

극단적인 측정값은 다음 측정에서 평균에 더 가까이 돌아가는 통계적 현상. 두 측정의 상관이 1보다 작은 곳이면 어디서나 생긴다. 원인은 측정 오차와 참값 자체의 일시적 변동(그날의 컨디션, 그해의 운) 둘 다다.

일상 한 줄

극단적인 결과 다음에는 평범한 결과가 따라온다. 우연도 한몫한다.

흔한 장면

왜 빠지나

빠져나오는 법

1. 극단값 다음의 변화는 "회귀"부터 의심 — 인과를 단정하기 전에 우연을 후보로 넣기. — 근거: 통계적 원리와 보건 자료 사례 [Morton & Torgerson 2003; Linden 2013] 2. 한 번 결과로 판단 금지 — 여러 번 잰 평균으로 판단한다. 몇 번이 필요한지는 측정이 얼마나 안정적인지(측정 간 상관)에 달렸다. 들쭉날쭉한 측정일수록 더 많이 재야 한다. — 근거: 통계적 원리 [Linden 2013; Morton & Torgerson 2003] 3. 개입 평가 시 통제군 필요 — 가장 나쁜 사람에게만 도움을 주면 개입이 없어도 다음 측정에서 좋아진다. 건강 점수 하위 25%로 뽑힌 대조군 34명은 아무 개입 없이 100점 척도에서 8점 넘게 올랐다. 같은 기준으로 뽑은 사람을 무작위로 나눠 비교한다 [Linden 2013]. — 근거: 모의실험과 건강 코칭 연구 대조군 자료 분석 [Linden 2013]

함께 쓰기 좋은 도구

통념이 무너지는 순간

"벌하면 좋아지고 칭찬하면 나빠진다"

⚠ 흔한 말: 군 비행 교관·스포츠 코치의 경험담. "혼냈더니 다음에 잘했고, 칭찬했더니 다음에 못했다." ✓ 학술: 카너먼이 이스라엘 공군 비행 교관들에게 강의하던 중 겪은 일화다. Tversky & Kahneman (1974)에 먼저 실렸고, Thinking, Fast and Slow (2011)에서 다시 소개됐다. 교관들은 매끄러운 착륙을 칭찬하면 다음엔 못하고, 거친 착륙을 꾸짖으면 다음엔 나아진다고 봤다. 교관이 아무 반응을 하지 않아도 뛰어난 수행 다음에는 대개 나빠지고 나쁜 수행 다음에는 대개 나아진다. 교관들은 이 회귀를 보고 "벌이 칭찬보다 효과적"이라는 잘못된 결론을 내렸다 [Tversky & Kahneman 1974].

"최고 다음은 슬럼프, 최악 다음은 반등 — 운명의 균형"

⚠ 흔한 말: 스포츠·예술·연애의 통속 심리학. ✓ 학술: Galton 1886 (Journal of the Anthropological Institute 15:246-263)의 원래 발견 "평범함으로의 회귀(regression towards mediocrity)". 아주 큰 부모의 자식은 부모보다 평균에 가까웠다. 측정값에 무작위 성분이 있으면 통계적으로 반드시 생기는 현상이다. "슬럼프"라는 이야기는 회귀 위에 나중에 덧붙인 해석이다.

"한 번의 결과로 그 사람의 실력을 알 수 있다"

⚠ 흔한 말: 면접 한 번, 시험 한 번, 발표 한 번으로 평가. ✓ 학술: 한 번의 측정값 = 실력 + 무작위 변동. 다음 측정에서는 무작위 부분이 평균 쪽으로 돌아가 회귀가 생긴다. 통제군 없이 개입 효과를 평가하면 회귀 효과를 개입 효과로 착각한다. 의학·교육·경영 평가에서 무작위 대조 시험(RCT)이 필요한 이유다. 더닝-크루거 효과(실력이 낮은 사람일수록 자기 실력을 과대평가한다는 주장)의 상당 부분도 이런 측정 잡음과 그래프 관행에서 나온 통계적 인공물이라는 비판이 있다 [Nuhfer et al. 2017; Gignac & Zajenkowski 2020]. 반대편에서는 두 차례 각 약 4,000명 규모로 재현한 연구가 하위 수행자가 자기 답의 정오를 덜 정확히 가린다는 설명을 지지했다 [Jansen et al. 2021]. 그래프 모양만 보고 효과를 판단할 수 없다는 데까지는 양쪽이 같고, 걸러낸 뒤 남는 몫의 크기를 두고 다툰다.

"회귀는 어떤 힘이 평균으로 끌어당기는 것이다"

⚠ 흔한 말: "운명·균형의 힘"으로 신비화하는 해석. ✓ 학술: 회귀는 통계적으로 반드시 생기는 결과다. 두 측정의 상관이 완전하지 않은 곳이면 어디서나 생긴다. Pearson 1896이 회귀 계수로 정식화했다. 표준화한 산점도에서 기울기(상관계수)가 1보다 작다는 수학적 사실이고, 자기계발에서 말하는 "균형 법칙"과 관계없다. 회귀는 시간 방향과도 상관없다. Galton (1886)은 같은 표를 거꾸로 읽어, 자식의 키 편차는 부모 평균 편차의 약 3분의 2이고, 반대로 한 사람의 부모 평균 편차는 그 사람 편차의 약 3분의 1이라고 적었다. 자식에서 부모 쪽으로 봐도 평균 쪽으로 회귀한다 [Galton 1886; Stigler 1997].

1차 출처

원문 핵심 인용

"It is some years since I made an extensive series of experiments on the produce of seeds of different size but of the same species... It appeared from these experiments that the offspring did not tend to resemble their parent seeds in size, but to be always more mediocre than they—to be smaller than the parents, if the parents were large; to be larger than the parents, if the parents were very small." — Galton (1886), p. 246, 둘째 문단 원문 대조: 2026-09, 공개 원문(OA PDF 추출본)

"The instructors concluded that verbal rewards are detrimental to learning, while verbal punishments are beneficial, contrary to accepted psychological doctrine. This conclusion is unwarranted because of the presence of regression toward the mean." — Tversky & Kahneman (1974), Science 185(4157). 원문 대조: 2026-09, 공개 원문

핵심 정의·메커니즘

원전 정의

Galton (1886)은 부모 205쌍과 그 성인 자녀 930명의 키를 모았다. 여성의 키는 남성 기준으로 환산했고, 아버지와 어머니 키의 평균을 "중간 부모(mid-parentage)"라 불렀다. 결론은 한 문장이다. 자녀 키의 편차(평균에서 떨어진 정도)는 평균적으로 중간 부모 편차의 "two-thirds", 3분의 2다. 그는 이를 "평범함으로의 회귀(regression towards mediocrity)"라 이름 붙였다. 앞서 같은 종의 크기가 다른 씨앗을 심은 실험에서도 부모 씨앗이 한 단위 커질 때 자식 씨앗은 평균 "one-third of a unit"만 커졌다 [Galton 1886]. 이 현상을 상관·회귀 계수라는 일반 통계 도구로 정리한 것은 Pearson (1896)이다.

작동 기제

1. 측정값은 두 성분의 합이다. 측정값 = 안정된 성분(참값·실력) + 그때만의 성분(측정 오차, 그날의 운). 두 번째 성분은 다음 측정에서 새로 뽑힌다. 2. 극단값으로 고르면 한쪽으로 치우친 운까지 함께 고른다. 상위 10%를 뽑으면 실력이 좋은 사람과 그날 운이 좋았던 사람이 섞여 들어온다 [Tversky & Kahneman 1974; Morton & Torgerson 2003]. 3. 다음 측정에서 운은 다시 뽑힌다. 그래서 집단 평균이 전체 평균 쪽으로 돌아온다. 표준화한 두 측정에서 첫 값이 x인 대상의 두 번째 기댓값은 r·x다(r = 두 측정의 상관). 평균 쪽으로 돌아가는 기대량은 (1 − r)·x. - 예: r = 0.5 이고 첫 측정이 평균보다 2 표준편차 높았다면, 다음 기댓값은 1 표준편차. 차이의 절반이 회귀로 사라진다. - r = 1이면 회귀가 없고, r = 0이면 다음 기댓값은 평균 그 자체다. 4. 컷오프로 고른 집단의 기대 회귀량은 계산할 수 있다. Linden (2013)이 정리한 식은 σ(1 − ρ)·C 다. σ는 사전 측정의 표준편차, ρ는 사전·사후 상관, C는 컷오프가 분포 꼬리에서 얼마나 먼지를 나타내는 값(φ(z)/(1 − Φ(z)))이다. 상관이 낮을수록, 컷오프가 극단일수록 회귀가 커진다. 5. 방향이 없다. Galton은 같은 표를 거꾸로 읽어, 한 사람의 가장 그럴듯한 중간 부모 편차는 그 사람 편차의 "one-third"라고 적었다. 자식에서 부모 쪽으로 봐도 평균 쪽으로 회귀한다 [Galton 1886]. 어떤 힘이 끌어당긴다는 해석이 틀린 이유다. 6. 집단 현상이다. 고른 집단의 평균은 거의 반드시 돌아오지만, 한 개인이나 병원 하나는 반대로 움직일 수 있다 [Morton & Torgerson 2003].

언제 강해지고 언제 약해지나

어떻게 재나

헷갈리는 개념과의 차이

주요 후속 연구·메타분석

회귀는 수학적으로 따라 나오는 결과라 효과크기 메타분석이나 재현 연구의 대상이 아니다. 아래는 사람이 회귀를 무시하는 방식, 실제 자료에서 회귀가 얼마나 큰지, 회귀가 다른 주장을 흔드는 경우를 다룬 연구다.

### Kahneman & Tversky (1973) — 사람은 증거의 신뢰도와 무관하게 극단을 예측한다 Psychological Review, 80(4), 237–251. DOI: 10.1037/h0034747

### Galton (1886) — 회귀라는 말을 만든 자료 Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263. DOI: 10.2307/2841583

### Morton & Torgerson (2003) — 보건 의사결정 곳곳에 숨은 회귀 BMJ, 326(7398), 1083–1084. DOI: 10.1136/bmj.326.7398.1083

### Linden (2013) — 실제 자료에서 회귀 크기를 재면 BMC Medical Research Methodology, 13, 119. DOI: 10.1186/1471-2288-13-119

Nuhfer et al. (2017) · Gignac & Zajenkowski (2020) · Jansen et al. (2021) — 더닝-크루거 효과는 회귀의 산물인가

Numeracy, 10(1), Article 4. DOI: 10.5038/1936-4660.10.1.4 / Intelligence, 80, 101449. DOI: 10.1016/j.intell.2020.101449 / Nature Human Behaviour, 5(6), 756–763. DOI: 10.1038/s41562-021-01057-0

그 밖의 문헌

비판·한계

재현성

회귀 자체는 확률 이론에서 따라 나오므로 재현 여부를 따질 대상이 아니다. 재현이 문제되는 곳은 회귀를 근거로 삼는 주장 쪽이다. 더닝-크루거 효과를 두고는 "대부분 인공물"이라는 연구(929명)와 "하위 수행자의 정오 판단이 실제로 떨어진다"는 대규모 재현(두 연구 각 약 4,000명)이 맞서 있다 [Gignac & Zajenkowski 2020; Jansen et al. 2021]. 핫핸드는 "착각"이라는 결론이 계산 편향을 보정하자 뒤집혔다 [Miller & Sanjurjo 2018].

대표 반론

쓰면 안 되는 상황

관련 모델

사고 도구 다른 글