평균 회귀 (Regression to the Mean)
처음 실린 날 2026-05-23 · 마지막으로 고친 날 2026-09-27
다른 이름: 평균회귀 · 평균으로의 회귀 · 평균 회귀의 법칙 · 평균회귀의 법칙 · Regression to the Mean
한 줄 정의
극단적인 측정값은 다음 측정에서 평균에 더 가까이 돌아가는 통계적 현상. 두 측정의 상관이 1보다 작은 곳이면 어디서나 생긴다. 원인은 측정 오차와 참값 자체의 일시적 변동(그날의 컨디션, 그해의 운) 둘 다다.
일상 한 줄
극단적인 결과 다음에는 평범한 결과가 따라온다. 우연도 한몫한다.
흔한 장면
- 최고의 한 달 다음 평범한 한 달 → "슬럼프 왔다"는 잘못된 해석.
- 신인의 화려한 데뷔작 → 다음 작품 평가 하락 → "한물갔다"고 단정.
- 최악의 시기 후 호전 → 마침 시작한 어떤 행동을 "전환점"으로 오해.
- 잘하던 직원이 한 달 부진 → "교육 필요" 결론. 그냥 우연 회귀일 수도.
왜 빠지나
- 예측을 입력에 그대로 맞춘다 — 사람은 설명이 아주 좋으면 아주 좋은 결과를, 평범하면 평범한 결과를 예측한다. 그 설명이 얼마나 믿을 만한지는 예측에 거의 반영하지 않는다. Kahneman & Tversky (1973)는 이 대표성 규칙으로 예측하면 결과가 증거의 신뢰도에 둔감해지고, 회귀에 대한 잘못된 직관도 여기서 나온다고 봤다 [Kahneman & Tversky 1973].
- 회귀를 예상하지 못하고, 보면 원인을 지어낸다 — 사람은 회귀가 반드시 일어날 상황에서 그것을 예상하지 못하고, 회귀를 목격하면 "가짜 인과 설명(spurious causal explanations)"을 만든다. 비행 교관의 "벌이 칭찬보다 낫다"가 그 예다 [Tversky & Kahneman 1974].
- 개입 시점이 극단값과 겹친다 — 사람과 조직은 일이 가장 나쁠 때 손을 쓴다. 그 뒤의 호전은 개입이 없어도 온다. 보건 분야에서는 이런 착각이 치료·정책·병원 순위 평가에 두루 퍼져 있다 [Morton & Torgerson 2003; Linden 2013].
빠져나오는 법
1. 극단값 다음의 변화는 "회귀"부터 의심 — 인과를 단정하기 전에 우연을 후보로 넣기. — 근거: 통계적 원리와 보건 자료 사례 [Morton & Torgerson 2003; Linden 2013] 2. 한 번 결과로 판단 금지 — 여러 번 잰 평균으로 판단한다. 몇 번이 필요한지는 측정이 얼마나 안정적인지(측정 간 상관)에 달렸다. 들쭉날쭉한 측정일수록 더 많이 재야 한다. — 근거: 통계적 원리 [Linden 2013; Morton & Torgerson 2003] 3. 개입 평가 시 통제군 필요 — 가장 나쁜 사람에게만 도움을 주면 개입이 없어도 다음 측정에서 좋아진다. 건강 점수 하위 25%로 뽑힌 대조군 34명은 아무 개입 없이 100점 척도에서 8점 넘게 올랐다. 같은 기준으로 뽑은 사람을 무작위로 나눠 비교한다 [Linden 2013]. — 근거: 모의실험과 건강 코칭 연구 대조군 자료 분석 [Linden 2013]
함께 쓰기 좋은 도구
- 운 vs 실력 구분 (Mauboussin) — 결과를 운과 실력 성분으로 나누기
- 표본 크기 — 작은 표본은 변동성이 크다
- 대표성 휴리스틱 — 적은 사례로 일반화하는 본능
통념이 무너지는 순간
"벌하면 좋아지고 칭찬하면 나빠진다"
⚠ 흔한 말: 군 비행 교관·스포츠 코치의 경험담. "혼냈더니 다음에 잘했고, 칭찬했더니 다음에 못했다." ✓ 학술: 카너먼이 이스라엘 공군 비행 교관들에게 강의하던 중 겪은 일화다. Tversky & Kahneman (1974)에 먼저 실렸고, Thinking, Fast and Slow (2011)에서 다시 소개됐다. 교관들은 매끄러운 착륙을 칭찬하면 다음엔 못하고, 거친 착륙을 꾸짖으면 다음엔 나아진다고 봤다. 교관이 아무 반응을 하지 않아도 뛰어난 수행 다음에는 대개 나빠지고 나쁜 수행 다음에는 대개 나아진다. 교관들은 이 회귀를 보고 "벌이 칭찬보다 효과적"이라는 잘못된 결론을 내렸다 [Tversky & Kahneman 1974].
"최고 다음은 슬럼프, 최악 다음은 반등 — 운명의 균형"
⚠ 흔한 말: 스포츠·예술·연애의 통속 심리학. ✓ 학술: Galton 1886 (Journal of the Anthropological Institute 15:246-263)의 원래 발견 "평범함으로의 회귀(regression towards mediocrity)". 아주 큰 부모의 자식은 부모보다 평균에 가까웠다. 측정값에 무작위 성분이 있으면 통계적으로 반드시 생기는 현상이다. "슬럼프"라는 이야기는 회귀 위에 나중에 덧붙인 해석이다.
"한 번의 결과로 그 사람의 실력을 알 수 있다"
⚠ 흔한 말: 면접 한 번, 시험 한 번, 발표 한 번으로 평가. ✓ 학술: 한 번의 측정값 = 실력 + 무작위 변동. 다음 측정에서는 무작위 부분이 평균 쪽으로 돌아가 회귀가 생긴다. 통제군 없이 개입 효과를 평가하면 회귀 효과를 개입 효과로 착각한다. 의학·교육·경영 평가에서 무작위 대조 시험(RCT)이 필요한 이유다. 더닝-크루거 효과(실력이 낮은 사람일수록 자기 실력을 과대평가한다는 주장)의 상당 부분도 이런 측정 잡음과 그래프 관행에서 나온 통계적 인공물이라는 비판이 있다 [Nuhfer et al. 2017; Gignac & Zajenkowski 2020]. 반대편에서는 두 차례 각 약 4,000명 규모로 재현한 연구가 하위 수행자가 자기 답의 정오를 덜 정확히 가린다는 설명을 지지했다 [Jansen et al. 2021]. 그래프 모양만 보고 효과를 판단할 수 없다는 데까지는 양쪽이 같고, 걸러낸 뒤 남는 몫의 크기를 두고 다툰다.
"회귀는 어떤 힘이 평균으로 끌어당기는 것이다"
⚠ 흔한 말: "운명·균형의 힘"으로 신비화하는 해석. ✓ 학술: 회귀는 통계적으로 반드시 생기는 결과다. 두 측정의 상관이 완전하지 않은 곳이면 어디서나 생긴다. Pearson 1896이 회귀 계수로 정식화했다. 표준화한 산점도에서 기울기(상관계수)가 1보다 작다는 수학적 사실이고, 자기계발에서 말하는 "균형 법칙"과 관계없다. 회귀는 시간 방향과도 상관없다. Galton (1886)은 같은 표를 거꾸로 읽어, 자식의 키 편차는 부모 평균 편차의 약 3분의 2이고, 반대로 한 사람의 부모 평균 편차는 그 사람 편차의 약 3분의 1이라고 적었다. 자식에서 부모 쪽으로 봐도 평균 쪽으로 회귀한다 [Galton 1886; Stigler 1997].
1차 출처
- Galton, F. (1886). Regression towards mediocrity in hereditary stature. Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263. https://doi.org/10.2307/2841583
- 사전 발표: Galton (1885). 영국과학진흥협회(British Association) H분과(인류학) 애버딘 회의 회장 연설. Nature 1885년 9월 24일 게재 (Galton 1886 서두에 명시).
- 통계적 정식화: Pearson, K. (1896). Mathematical contributions to the theory of evolution. III. Regression, heredity, and panmixia. Philosophical Transactions of the Royal Society A, 187, 253–318. https://doi.org/10.1098/rsta.1896.0007 — 상관·회귀 계수의 정의.
- Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124–1131. https://doi.org/10.1126/science.185.4157.1124 — 비행 교관 일화.
- Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. — 17장에서 같은 일화 재소개.
- Gignac, G. E., & Zajenkowski, M. (2020). The Dunning-Kruger effect is (mostly) a statistical artefact: Valid approaches to testing the hypothesis with individual differences data. Intelligence, 80, 101449. https://doi.org/10.1016/j.intell.2020.101449
- Campbell, D. T., & Kenny, D. A. (1999). A Primer on Regression Artifacts. Guilford Press. — 정책·프로그램 평가에서 회귀가 만드는 가짜 효과.
- 무료 접근 (퍼블릭 도메인):
- galton.org 원문 카탈로그 — Galton 전집
- UCLA Statistics PDF — Galton 1886 전문
원문 핵심 인용
"It is some years since I made an extensive series of experiments on the produce of seeds of different size but of the same species... It appeared from these experiments that the offspring did not tend to resemble their parent seeds in size, but to be always more mediocre than they—to be smaller than the parents, if the parents were large; to be larger than the parents, if the parents were very small." — Galton (1886), p. 246, 둘째 문단 원문 대조: 2026-09, 공개 원문(OA PDF 추출본)
"The instructors concluded that verbal rewards are detrimental to learning, while verbal punishments are beneficial, contrary to accepted psychological doctrine. This conclusion is unwarranted because of the presence of regression toward the mean." — Tversky & Kahneman (1974), Science 185(4157). 원문 대조: 2026-09, 공개 원문
핵심 정의·메커니즘
원전 정의
Galton (1886)은 부모 205쌍과 그 성인 자녀 930명의 키를 모았다. 여성의 키는 남성 기준으로 환산했고, 아버지와 어머니 키의 평균을 "중간 부모(mid-parentage)"라 불렀다. 결론은 한 문장이다. 자녀 키의 편차(평균에서 떨어진 정도)는 평균적으로 중간 부모 편차의 "two-thirds", 3분의 2다. 그는 이를 "평범함으로의 회귀(regression towards mediocrity)"라 이름 붙였다. 앞서 같은 종의 크기가 다른 씨앗을 심은 실험에서도 부모 씨앗이 한 단위 커질 때 자식 씨앗은 평균 "one-third of a unit"만 커졌다 [Galton 1886]. 이 현상을 상관·회귀 계수라는 일반 통계 도구로 정리한 것은 Pearson (1896)이다.
작동 기제
1. 측정값은 두 성분의 합이다. 측정값 = 안정된 성분(참값·실력) + 그때만의 성분(측정 오차, 그날의 운). 두 번째 성분은 다음 측정에서 새로 뽑힌다. 2. 극단값으로 고르면 한쪽으로 치우친 운까지 함께 고른다. 상위 10%를 뽑으면 실력이 좋은 사람과 그날 운이 좋았던 사람이 섞여 들어온다 [Tversky & Kahneman 1974; Morton & Torgerson 2003]. 3. 다음 측정에서 운은 다시 뽑힌다. 그래서 집단 평균이 전체 평균 쪽으로 돌아온다. 표준화한 두 측정에서 첫 값이 x인 대상의 두 번째 기댓값은 r·x다(r = 두 측정의 상관). 평균 쪽으로 돌아가는 기대량은 (1 − r)·x. - 예: r = 0.5 이고 첫 측정이 평균보다 2 표준편차 높았다면, 다음 기댓값은 1 표준편차. 차이의 절반이 회귀로 사라진다. - r = 1이면 회귀가 없고, r = 0이면 다음 기댓값은 평균 그 자체다. 4. 컷오프로 고른 집단의 기대 회귀량은 계산할 수 있다. Linden (2013)이 정리한 식은 σ(1 − ρ)·C 다. σ는 사전 측정의 표준편차, ρ는 사전·사후 상관, C는 컷오프가 분포 꼬리에서 얼마나 먼지를 나타내는 값(φ(z)/(1 − Φ(z)))이다. 상관이 낮을수록, 컷오프가 극단일수록 회귀가 커진다. 5. 방향이 없다. Galton은 같은 표를 거꾸로 읽어, 한 사람의 가장 그럴듯한 중간 부모 편차는 그 사람 편차의 "one-third"라고 적었다. 자식에서 부모 쪽으로 봐도 평균 쪽으로 회귀한다 [Galton 1886]. 어떤 힘이 끌어당긴다는 해석이 틀린 이유다. 6. 집단 현상이다. 고른 집단의 평균은 거의 반드시 돌아오지만, 한 개인이나 병원 하나는 반대로 움직일 수 있다 [Morton & Torgerson 2003].
언제 강해지고 언제 약해지나
- 측정 오차가 클수록 강해진다. 그리고 기준선 값으로 골라낸 하위 집단만 추적할 때 뚜렷해진다 [Barnett et al. 2005].
- 두 측정의 상관이 낮을수록, 고른 값이 극단일수록 강해진다. Morton & Torgerson (2003)은 "the less correlated the two variables, the larger the effect", 평균에서 멀수록 돌아갈 여지가 크다고 적었다. Linden (2013)의 모의실험(가상 인구 10,000명, 평균 비용 5,000달러, 표준편차 1,350달러)은 상관을 0.25·0.50·0.75 세 수준으로 바꿔 이 관계를 확인했다.
- 분포가 치우치면 계산이 회귀를 과소평가한다. 정규분포 자료에서는 공식 계산과 실제 회귀가 같았다. 치우친 실제 자료에서는 계산값이 실제의 절반에도 못 미쳤다 [Linden 2013] (수치는 아래 후속 연구 항목).
- 여러 번 잰 평균으로 고르면 약해진다. 한 번의 사전 측정 대신 여러 번 잰 평균이 컷오프를 넘을 때 대상으로 삼으면 회귀 몫이 줄어든다 [Linden 2013]. 혈압처럼 싸게 반복 측정할 수 있는 검사는 연속 측정 평균이 해법이다 [Morton & Torgerson 2003].
- 시계열에 추세가 있으면 "평균" 자체가 움직인다. 자기상관(이전 값이 다음 값에 영향을 주는 성질)이나 구조 변화가 있으면 단순 계산이 맞지 않는다.
어떻게 재나
- 대조군 비교: 같은 기준으로 뽑은 사람을 무작위로 개입군·대조군에 나누면 두 집단이 같은 만큼 회귀한다. 둘의 차이가 개입 효과다 [Linden 2013]. 무작위 배정이 어려우면 컷오프 바로 위아래 사람을 비교하는 회귀 불연속 설계(regression-discontinuity)를 쓴다 [Linden 2013].
- 기대 회귀량 계산: 모집단 평균·표준편차, 사전·사후 상관, 컷오프 네 값으로 위 식을 계산해 관찰된 변화에서 뺀다. 치우친 자료에서는 부트스트랩 신뢰구간을 함께 낸다 [Linden 2013].
- 공분산분석(ANCOVA): 기준선 값을 공변량으로 넣는 방법. 문헌에서 가장 흔한 분석 보정이지만 선형성 같은 가정을 확인해야 하고, 집단이 모든 기준선 변수에서 비슷하다는 보장은 없다 [Linden 2013].
- 실험 과제로 회귀 무시를 재는 법: 참가자에게 교생이 한 수업을 어떻게 했는지 묘사한 문단 여러 개를 읽히고, 그 교생의 몇 년 뒤 성과를 예측하게 한다. 묘사가 얼마나 좋은지만 따라 예측이 입력만큼 극단으로 가면 회귀를 반영하지 않은 예측이다 [Tversky & Kahneman 1974; Kahneman & Tversky 1973].
헷갈리는 개념과의 차이
- 도박사의 오류(gambler's fallacy): 앞면이 연달아 나왔으니 이번엔 뒷면이 나올 차례라는 믿음. 우연이 한쪽으로 쏠리면 반대쪽 쏠림이 와서 "균형을 맞춘다"고 본다. Tversky & Kahneman (1974)은 우연 과정에서 편차는 "corrected" 되지 않고 "merely diluted", 새 관찰에 섞여 묽어질 뿐이라고 썼다. 평균 회귀는 다음 값이 반대로 넘어간다는 예측을 하지 않는다. 다음 값의 기댓값이 평균에 가까워진다는 것뿐이다. Tversky & Kahneman (1974)은 두 오류를 모두 대표성 판단의 산물로 분류했다. 도박사의 오류 쪽 뿌리는 작은 표본도 모집단을 빼닮아야 한다는 직관, 이른바 "작은 수의 법칙"이다 [Tversky & Kahneman 1971].
- 핫핸드(hot hand): 연속 성공 뒤에 성공 확률이 올라간다는 믿음. 오랫동안 "착각"으로 분류됐다. Miller & Sanjurjo (2018)는 연속 기록 뒤의 성공률을 세는 흔한 계산 자체에 편향이 있음을 증명했고, 이를 보정하자 대표 연구의 결론이 뒤집혔다고 보고했다. 회귀를 들어 모든 연속 기록을 우연으로 돌리는 것도 확인 없이는 할 수 없다.
- 베이즈 수축(shrinkage): 극단 관찰값을 사전 평균 쪽으로 당겨 추정하는 방법. 평균 회귀를 예측에 반영하는 처방이다. 회귀는 현상이고 수축은 그 현상을 고려한 추정 방법이다.
주요 후속 연구·메타분석
회귀는 수학적으로 따라 나오는 결과라 효과크기 메타분석이나 재현 연구의 대상이 아니다. 아래는 사람이 회귀를 무시하는 방식, 실제 자료에서 회귀가 얼마나 큰지, 회귀가 다른 주장을 흔드는 경우를 다룬 연구다.
### Kahneman & Tversky (1973) — 사람은 증거의 신뢰도와 무관하게 극단을 예측한다 Psychological Review, 80(4), 237–251. DOI: 10.1037/h0034747
- 설계: 일반 참가자와 통계 훈련을 받은 참가자에게 범주 예측(직업 등)과 수치 예측(성적 등) 과제를 주고, 예측이 대표성 순위를 따르는지 확률·신뢰도 규칙을 따르는지 비교한 연구 묶음.
- 결과: 초록에 따르면 결과의 가능성 순위가 대표성 순위와 일치했고, 사람들은 드문 사건과 극단값이 대표적으로 보이면 그것을 예측했다. 예측은 증거의 신뢰도와 사전 확률에 둔감했다. 초록에는 효과크기 수치가 없다.
- 의미와 한계: 회귀를 무시하는 이유를 인지 규칙 하나(대표성)로 설명한 논문이다. 근거 없는 확신과 회귀에 대한 잘못된 직관을 같은 뿌리로 묶는다. 이 카드에서는 초록만 읽었으므로 개별 실험 수치는 싣지 않는다.
### Galton (1886) — 회귀라는 말을 만든 자료 Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263. DOI: 10.2307/2841583
- 설계: 부모 205쌍과 성인 자녀 930명의 키. 여성 키는 남성 기준으로 환산하고 부모 키를 평균해 중간 부모 값을 만들었다.
- 결과: 자녀 편차는 중간 부모 편차의 약 3분의 2. 거꾸로 읽으면 중간 부모 편차는 자녀 편차의 약 3분의 1. 씨앗 실험에서는 부모 씨앗 한 단위당 자식 씨앗이 3분의 1 단위만 달라졌다.
- 의미와 한계: 회귀가 양방향이라는 점까지 원전에 이미 들어 있다. Galton은 이 결과를 유전 연구로 제시했다. 같은 원리가 유전과 무관한 자료(시험 점수, 병원 지표)에도 그대로 적용된다는 점은 위 작동 기제와 아래 보건 사례가 보여 준다.
### Morton & Torgerson (2003) — 보건 의사결정 곳곳에 숨은 회귀 BMJ, 326(7398), 1083–1084. DOI: 10.1136/bmj.326.7398.1083
- 설계: 임상 검사, 신약 사용, 위약 효과, 공중보건 정책, 병원 순위, 임상 감사에서 회귀가 결정을 흐린 사례를 모은 해설 논문.
- 결과: 골다공증 치료 여성 중 첫해에 뼈가 줄어든 사람의 대부분(80% 초과)이 치료를 바꾸지 않았는데도 둘째 해에 뼈가 늘었다. 수막염 백신 도입의 "75%–90% 감소"라는 발표 수치는 도입 시점이 발병이 급증한 때여서 대부분이 회귀 몫이라 과대평가라고 봤다. 호르몬 치료 임상시험의 큰 위약 효과도 증상이 심한 여성을 모집한 데서 오는 회귀로 설명했다.
- 의미와 한계: 제일 나쁜 대상에게 개입하면 효과가 보장된다는 점을 역설적으로 보여 준다. 수막염 수치의 회귀 몫은 저자들의 판단이고 따로 계산하지 않았다.
### Linden (2013) — 실제 자료에서 회귀 크기를 재면 BMC Medical Research Methodology, 13, 119. DOI: 10.1186/1471-2288-13-119
- 설계: 두 단계. ① 정규분포 모의실험(가상 인구 10,000명, 사전·사후 상관 0.25·0.50·0.75, 상위 20% 비용을 고위험군으로 지정)에서 공식 계산과 실제 회귀를 비교. ② 건강 코칭 연구의 대조군 118명(개입 없이 3개월 간격 두 번 설문)에서 신체 건강 점수(SF-12 PCS, 0~100) 하위 25%인 34명을 "고위험군"으로 골라 추적.
- 결과: 정규 자료에서는 계산값과 실제값이 같았다. 대조군 고위험군은 아무 개입 없이 36.65점에서 44.93점으로 올랐다. 실제 회귀 8.28점(95% 신뢰구간 4.35~12.21), 공식 계산 3.38점(1.54~5.22), 차이 4.90점(1.12~8.68).
- 의미와 한계: 개입이 없는 대조군에서 8점 넘게 "호전"됐다. 전후 비교만 한 사업 평가였다면 이 몫이 사업 효과로 보고됐을 것이다. 치우친 자료에서는 공식이 회귀를 과소평가하므로, 저자는 자료 변환이나 신뢰구간 제시를 권했다. 고위험군 표본이 34명이라 구간이 넓다.
Nuhfer et al. (2017) · Gignac & Zajenkowski (2020) · Jansen et al. (2021) — 더닝-크루거 효과는 회귀의 산물인가
Numeracy, 10(1), Article 4. DOI: 10.5038/1936-4660.10.1.4 / Intelligence, 80, 101449. DOI: 10.1016/j.intell.2020.101449 / Nature Human Behaviour, 5(6), 756–763. DOI: 10.1038/s41562-021-01057-0
- 설계: Nuhfer 등은 신뢰도를 확인한 짝 측정으로 1,154명의 과학 소양 자기평가를 분석했다. Gignac & Zajenkowski는 일반인 929명에게 지능을 자기평가하게 하고 레이븐 누진행렬 검사를 치렀다. 실력 사분위별 평균을 그리는 기존 방식 대신 이분산성 검정(Glejser test)과 2차 회귀를 썼다. Jansen 등은 자기평가의 합리적 모델을 세워, 사분위 그래프의 패턴이 두 기제 — 자기 능력에 대한 사전 믿음의 영향, 또는 실력과 문항별 정오 판단 능력의 연관 — 중 하나나 둘 다로 생길 수 있음을 보였다. 그리고 원 연구를 두 번, 각 약 4,000명 규모로 재현해 두 기제를 갈랐다.
- 결과: Nuhfer 등은 사람들의 자기평가가 대체로 실제로 보여 줄 수 있는 실력을 반영한다고 보고했다. Gignac & Zajenkowski는 유의한 이분산성을 찾지 못했고 객관 지능과 자기평가 지능의 관계가 거의 완전히 선형이어서, 가설과 달랐다. Jansen 등은 문법과 논리 추론 영역에서 하위 수행자가 자기 답이 맞았는지 덜 정확히 가린다는 모델 쪽을 지지했다.
- 의미와 한계: Gignac & Zajenkowski는 기존 사분위 그래프가 평균 이상 효과(자기를 평균보다 낫게 보는 경향)와 회귀에 섞인다는 비판에서 출발했고, Jansen 등도 그래프 패턴만으로는 기제를 가를 수 없다고 보고 모델을 세웠다. 그래프만으로는 부족하다는 데서 출발은 같고, 걸러낸 뒤 효과가 남느냐에서 갈린다. Gignac & Zajenkowski도 효과가 일부 기술에서는 있을 수 있으나 보고된 것보다 작을 것이라고 결론지었다. 세 편 모두 이 카드에서는 초록만 읽었다.
그 밖의 문헌
- Krueger, J., & Mueller, R. A. (2002). Unskilled, unaware, or both? The better-than-average heuristic and statistical regression predict errors in estimates of own performance. Journal of Personality and Social Psychology, 82(2), 180–188. https://doi.org/10.1037/0022-3514.82.2.180 — 더닝-크루거 회귀 논쟁의 출발점. 재현 연구에서 메타인지 기술 등 후보 매개 변수는 효과를 보이지 않았다. 통계적 회귀나 평균 이상 효과 중 하나를 통계적으로 빼면 하위·상위 수행자의 비대칭 오차가 사라졌다. 오히려 상위 수행자가 남의 수행 추정을 자기 위치 판단에 덜 반영해 더 틀리기 쉬웠다(초록만 읽음).
- Tversky, A., & Kahneman, D. (1971). Belief in the law of small numbers. Psychological Bulletin, 76(2), 105–110. https://doi.org/10.1037/h0031322 — 사람은 무작위로 뽑은 표본이 모집단을 모든 핵심 특성에서 빼닮을 것이라 여긴다. 전문 심리학자 대상 설문에서 대부분이 한 번 얻은 결과가 재현될 가능성을 과대평가했다.
- Miller, J. B., & Sanjurjo, A. (2018). Surprised by the hot hand fallacy? A truth in the law of small numbers. Econometrica, 86(6), 2019–2047. https://doi.org/10.3982/ECTA14943 — 연속 기록 뒤 성공률을 세는 계산의 편향을 증명. 보정하면 핫핸드 대표 연구의 결론이 뒤집힌다.
- Barnett, A. G., van der Pols, J. C., & Dobson, A. J. (2005). Regression to the mean: What it is and how to deal with it. International Journal of Epidemiology, 34(1), 215–220. https://doi.org/10.1093/ije/dyh299 — 측정 오차가 크고 기준선으로 고른 하위 표본만 추적할 때 회귀가 커진다. 설계·분석 단계의 대처법.
- Bland, J. M., & Altman, D. G. (1994). Regression towards the mean. BMJ, 308(6942), 1499. https://doi.org/10.1136/bmj.308.6942.1499 — 의학 연구의 표준 해설. Galton 자료에서 부모와 자녀의 평균 키가 같았음(68.2인치)을 짚는다.
- Stigler, S. M. (1997). Regression towards the mean, historically considered. Statistical Methods in Medical Research, 6(2), 103–114. https://doi.org/10.1177/096228029700600202 — Galton 이후 개념의 이해와 오해의 역사.
비판·한계
재현성
회귀 자체는 확률 이론에서 따라 나오므로 재현 여부를 따질 대상이 아니다. 재현이 문제되는 곳은 회귀를 근거로 삼는 주장 쪽이다. 더닝-크루거 효과를 두고는 "대부분 인공물"이라는 연구(929명)와 "하위 수행자의 정오 판단이 실제로 떨어진다"는 대규모 재현(두 연구 각 약 4,000명)이 맞서 있다 [Gignac & Zajenkowski 2020; Jansen et al. 2021]. 핫핸드는 "착각"이라는 결론이 계산 편향을 보정하자 뒤집혔다 [Miller & Sanjurjo 2018].
대표 반론
- "통계 인공물로 다 설명된다"에 대한 반론: Jansen et al. (2021)은 사전 믿음만으로도 더닝-크루거 패턴이 생길 수 있음을 모델로 인정한 뒤, 이 설명과 "하위 수행자는 자기 답의 정오를 덜 정확히 가린다"는 설명의 예측을 갈라 대규모 재현 자료로 검증했다. 결과는 뒤의 설명 쪽이었다. 인공물 쪽의 출발점은 Krueger & Mueller (2002)다. 회귀나 평균 이상 효과를 통계적으로 빼자 하위·상위 수행자의 비대칭 오차가 사라졌다. 인공물 쪽은 그래프 관행을 걷어내면 자기평가가 대체로 실제 실력을 반영하거나 [Nuhfer et al. 2017], 객관 점수와 자기평가의 관계가 선형이어서 효과가 보고된 것보다 작다고 본다 [Gignac & Zajenkowski 2020]. 어느 쪽도 회귀의 존재는 부정하지 않는다.
- 공식 계산에 대한 반론: 기대 회귀량 공식은 정규분포를 전제한다. 치우친 실제 자료에서 공식은 회귀를 절반 이하로 잡았다 [Linden 2013]. 공식을 믿고 "회귀를 뺐으니 나머지는 효과"라고 하면 효과를 부풀린다.
- "힘"으로 설명하는 대중 해설에 대한 반론: 평균이 끌어당긴다는 설명은 틀렸다. 회귀는 불완전한 상관에서 나오고 시간 방향과 무관하다 [Galton 1886; Stigler 1997].
쓰면 안 되는 상황
- 대조군 없이 "그건 회귀일 뿐"이라고 효과를 지울 때. 회귀와 실제 효과는 함께 있을 수 있다. 무작위 대조군과 비교해야 몫을 나눌 수 있다 [Linden 2013].
- 한 사람, 한 조직에 대해 "곧 돌아온다"고 장담할 때. 회귀는 집단 평균의 성질이다. 개별 대상은 반대로 갈 수 있다 [Morton & Torgerson 2003].
- 측정이 거의 완벽하거나 변화가 구조적일 때. r이 1에 가깝거나, 추세·구조 변화로 평균 자체가 바뀌었다면 극단값은 돌아오지 않는다.
- 노력 무용론으로 쓸 때. 회귀는 우연 성분에 대한 이야기다. 실력 성분까지 없애 주지 않는다.
- 연속 기록을 무조건 우연으로 돌릴 때. 핫핸드 사례처럼 계산 방법에 따라 결론이 바뀐다 [Miller & Sanjurjo 2018].
관련 모델
- 대표성 휴리스틱 (Representativeness Heuristic, Kahneman & Tversky) — 평균 회귀를 무시하는 인지 편향
- 운 vs 실력 (Skill vs Luck, Mauboussin) — 결과를 운·실력 성분으로 분해
- 베이즈 사후 확률 — 극단값에서 사후 추정 시 사전 평균으로의 수축
- 표본 크기 무시 (Sample Size Neglect)
사고 도구 다른 글