예측 보정 (Forecast Calibration)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 캘리브레이션 · Forecast Calibration
한 줄 정의
미래 판단을 "될 것 같다/안 될 것 같다"로 끝내지 않고, 확률로 예측하고 결과를 기록해 자신의 과신·과소신뢰를 보정하는 사고도구. 굿 저지먼트 프로젝트(GJP, 미국 정보기관 후원 예측 대회)에서 뽑힌 슈퍼예측가(superforecaster)들이 평균 회귀 예상을 거슬러 2년 연속 높은 정확도를 유지할 때 보인 습관이다 [Mellers et al. 2015]. 보정 개념 자체는 기상 예보 검증(Brier 1950)과 판단 심리학(Lichtenstein et al. 1982)에서 먼저 연구됐다.
일상 한 줄
예측을 확률로 적고 결과와 맞춰 보면, 내 "90% 확신"이 실제로 몇 번 맞는지 알게 된다.
흔한 장면
- "아마 괜찮겠지"라고 말하지만 실제 확률을 쓰지 않는다.
- 60%와 90% 확신을 같은 말투로 표현한다.
- 예측이 틀리면 운이 나빴다고 하고, 맞으면 실력이라고 기억한다.
- 투자·진로·관계 선택에서 사후 해석만 남고 예측 기록은 없다.
왜 빠지나 (메커니즘)
- 확률 표현 회피: 확률을 숫자로 쓰면 사후에 책임을 남기므로, 사람들은 "아마", "괜찮겠지" 같은 모호어로 도망친다 [Tetlock & Gardner 2015].
- 보정(calibration) 상태를 모름: 자기 확신이 실제 적중률과 얼마나 어긋나는지 대부분 모른다. 70%라고 말한 사건이 실제로 70% 가까이 발생해야 잘 보정된 것이지만, 이를 측정하지 않으면 알 수 없다 [Mellers et al. 2015].
- 과신이 기본값: 확률 판단 연구에서 사람들은 대체로 과신했고, 어려운 문제일수록 과신이 컸다(어려움-쉬움 효과) [Lichtenstein et al. 1982]. 과신에는 내 실력을 부풀리기, 남보다 낫다고 믿기, 내 추정 범위를 지나치게 좁게 잡기의 세 종류가 있고, 범위를 좁게 잡는 과신이 가장 끈질기다 [Moore & Healy 2008]. 반대 해석도 있다. 과신과 어려움-쉬움 효과가 과제 조건에 따라 나타나고, 사라지고, 뒤집힌다고 예측해 실험으로 지지한 이론이다 [Gigerenzer et al. 1991].
- 사후확증 편향(hindsight bias): 결과를 알고 나면 불확실성 아래에서 내렸던 판단이 달리 보인다 [Fischhoff 1975]. 예측을 적어 두지 않으면 빗나간 예측을 사후에 정당화하기 쉽다 [Tetlock & Gardner 2015].
빠져나오는 법
1. 중요한 판단 전 "몇 % 확률인가?"를 숫자로 쓴다. 확률을 "가능성 높음" 같은 말로 뭉개면 정확도가 떨어졌다 [Friedman et al. 2018]. — 근거: 대규모 예측 자료 재분석 [Friedman et al. 2018] 2. 예측 조건과 마감일을 명확히 한다. 결과가 확정되는 질문이어야 나중에 채점할 수 있다 [Mellers et al. 2015]. — 근거 수준: 측정 조건(채점 가능성), 효과를 직접 잰 연구 없음 3. 결과가 나오면 맞고 틀림뿐 아니라 확률 구간별 적중률을 본다(보정 곡선) [Mellers et al. 2014]. — 근거 수준: 측정 방법, 스스로 곡선을 보는 습관의 효과를 잰 연구 없음 4. 기저율(비슷한 사건이 과거에 얼마나 일어났나)부터 잡고 시작한다. 비교 집단 찾기를 포함한 1시간 미만 훈련으로 Brier 점수가 6~12% 좋아졌다 [Chang et al. 2016]. — 근거: 무작위 배정 실험 [Chang et al. 2016; Mellers et al. 2014] 5. 자주 과신하는 영역과 과소신뢰하는 영역을 분리한다. 어려운 문제에서는 과대평가, 쉬운 문제에서는 과소평가가 흔하다 [Moore & Healy 2008]. — 근거 수준: 경험칙(영역 분리 자체는 카드 제안, 직접 검증 연구 없음) 6. 새 정보를 만나면 확률을 갱신하고 로그를 남긴다. 초기에 낸 100% 예측은 약 70%만 맞았고 질문 막바지의 100% 예측은 약 90% 맞았다 [Mellers et al. 2014]. 슈퍼예측가는 질문당 평균 7.8회 예측을 고쳤다(일반 팀 1.6회) [Mellers et al. 2014]. — 근거: 대회 관찰 자료 Mellers et al. 2014
함께 쓰기 좋은 도구
- 베이즈 사고 — 증거로 확률 갱신
- 기저율 무시 — reference class 확인
- 평균 회귀 — 극단 결과 해석
- 깊은 불확실성 의사결정 — 예측이 어려운 경우 견고성으로 전환
통념이 무너지는 순간
"예측은 맞거나 틀리거나 둘 중 하나다"
⚠ 흔한 말: "그 사람 예측 틀렸잖아. 예측은 결국 맞히거나 못 맞히거나지." ✓ 학술: 확률 예측의 품질은 보정(calibration, 70%라 한 사건이 실제 약 70% 발생)과 해상도(resolution, 일어날 일과 안 일어날 일에 확률을 확실히 갈라 주는 능력)로 평가한다. 둘 다 Brier 점수를 분해한 성분이다(변동성·해상도·보정의 세 성분) [Murphy 1973; Mellers et al. 2015]. 한 번의 적중·오류로는 판단할 수 없고 여러 예측을 모아 본다. [Tetlock & Gardner 2015]
"전문가면 확신 있게 단정해야 한다"
⚠ 흔한 말: "전문가가 '60%쯤'이라고 말하면 무능해 보인다. 확실하게 단언해야지." ✓ 학술: GJP에서 12개 실험 조건마다 상위 5명씩(60명) 뽑은 슈퍼예측가들은 확률을 1% 단위로 잘게 쪼개고 자주 갱신했다. 이들의 예측을 10% 단위로 반올림하면 Brier 점수가 유의하게 나빠졌다. 잘게 나눈 확률에 실제 정보가 들어 있었다 [Mellers et al. 2015]. 88만여 건의 예측을 분석한 후속 연구에서도 확률을 "가능성 높음" 같은 말 수준으로 뭉개면 정확도가 떨어졌다 [Friedman et al. 2018]. (GJP 예측이 기밀 정보를 보는 정보기관 예측시장보다 약 30% 정확했다는 수치는 언론 보도(Ignatius 2013, Washington Post)와 Tetlock & Gardner(2015)에 나온다. 동료 심사 논문으로 공개된 비교는 아니다.)
"잘 맞히는 사람은 그냥 운이 좋았던 것이다"
⚠ 흔한 말: "한두 해 잘 맞혔어도 결국 평균으로 돌아갈 거야." ✓ 학술: Mellers et al.(2015)은 상위 성과자를 정예 팀(elite team)으로 묶은 슈퍼예측가들이 2년 연속 평균 회귀 기대를 거슬러(defying expectations of regression toward the mean) 수백 개 질문에서 높은 정확도를 유지했음을 보고했다. 이진 질문의 판별력(AUC)은 슈퍼예측가 96%, 차상위 팀원 84%, 나머지 75%였다. 한편 1시간 미만의 확률 훈련만으로도 정확도가 6~11% 올랐다 [Chang et al. 2016] — 실력의 일부는 길러진다. [Mellers et al. 2015]
1차 출처
- Mellers, B. et al. (2015). "Identifying and cultivating superforecasters as a method of improving probabilistic predictions." Perspectives on Psychological Science, 10(3), 267-281. DOI: 10.1177/1745691615577794.
- Tetlock, P. E., & Gardner, D. (2015). Superforecasting: The Art and Science of Prediction. Crown.
- Brier, G. W. (1950). Verification of forecasts expressed in terms of probability. Monthly Weather Review, 78(1), 1-3. https://doi.org/10.1175/1520-0493(1950)078<0001:VOFEIT2.0.CO;2 — Brier 점수 정의.
- Lichtenstein, S., Fischhoff, B., & Phillips, L. D. (1982). Calibration of probabilities: The state of the art to 1980. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under Uncertainty: Heuristics and Biases (pp. 306-334). Cambridge University Press. https://doi.org/10.1017/CBO9780511809477.023 — 보정 연구의 고전. 과신과 어려움-쉬움 효과.
카드의 era(2015)는 GJP 연구를 기준으로 삼았다. 보정 개념의 원류는 Brier (1950)·Lichtenstein et al. (1982)이다.
원문 핵심 인용
- Mellers et al.(2015) 초록 (PDF 본문과 대조): "Defying expectations of regression toward the mean 2 years in a row, superforecasters maintained high accuracy across hundreds of questions and a wide array of topics." [Mellers et al. 2015]
- 같은 초록: "superforecasters are partly discovered and partly created" — 예측력은 타고나는 동시에 훈련으로 길러진다는 주장. [Mellers et al. 2015]
- 선발 기준 (본문 p. 269): "we selected 60 forecasters (the top 5 forecasters from each of 12 experimental conditions)" [Mellers et al. 2015]
핵심 정의·메커니즘
원전 정의
- Brier 점수(Brier score): 예측 확률과 실제 결과(일어나면 1, 아니면 0)의 차이를 제곱해 더한 값. Brier (1950) 가 기상 예보 검증용으로 정의했다. GJP 방식은 0(완벽)~2(최악). 예) 두 결과 중 일어난 쪽에 0.75, 다른 쪽에 0.25를 줬다면 (1−0.75)² + (0−0.25)² = 0.125 [Brier 1950; Mellers et al. 2015].
- Brier 점수의 분해: 변동성(variability), 보정(calibration), 해상도(resolution)의 세 성분으로 더해진다 [Murphy 1973]. 변동성은 사건 기저율에서 오는 문제의 어려움이고 실력과 무관하다. Mellers et al. (2014) 는 필라델피아 비가 투손 비보다 예측하기 어려운 이유를 예로 들었다 [Mellers et al. 2014].
- 보정(calibration): 장기적으로 주관적 확률이 실제 발생률과 맞는 정도. GJP 는 확률을 .500~.525, .526~.575 같은 좁은 구간으로 묶고, 구간별 예측값과 실제 발생 비율의 평균 제곱 오차로 계산했다(0이면 완벽). Mellers 는 이를 "적절한 겸손(appropriate humility)"이라 불렀다 [Mellers et al. 2014].
- 해상도(resolution): 신호와 잡음을 구별해 일어날 일과 안 일어날 일에 확률을 갈라 주는 능력, "적절한 결단력(appropriate decisiveness)". 늘 기저율만 말하면 보정은 좋아도 해상도는 0이다 [Mellers et al. 2014; Mellers et al. 2015].
- 과신(overconfidence): 보정 연구의 고전 결과는 평균 확신이 정답률보다 높다는 것이다 [Lichtenstein et al. 1982]. Moore & Healy (2008) 는 문헌 속 과신을 세 가지로 갈랐다. 자기 수행을 부풀리기(과대평가), 남보다 낫다고 믿기(과대배치), 자기 믿음의 범위를 너무 좁게 잡기(과잉정밀) [Moore & Healy 2008].
작동 기제
예측이 틀리는 경로와 보정이 좋아지는 경로를 순서로 적으면 이렇다.
1. 판단 단계의 편향 → 확신이 적중률보다 높게 나온다. 어려운 문제에서는 과대평가, 쉬운 문제에서는 과소평가가 나타난다(어려움-쉬움 효과) [Lichtenstein et al. 1982; Moore & Healy 2008]. 과잉정밀은 세 종류 중 가장 끈질기다 [Moore & Healy 2008]. 2. 갱신 부족 → 초기에 낸 극단 확률이 그대로 남는다. GJP 에서 질문 공개 초기(기간의 첫 20%)에 낸 100% 예측은 약 70%만 맞았고, 마지막 20%에 낸 100% 예측은 약 90% 맞았다. 저자들은 원인을 갱신 부족으로 봤다 [Mellers et al. 2014]. 3. 피드백 부재 → 오차를 알 수 없어 교정이 안 된다. 매일 예보하고 바로 결과를 확인하는 기상 예보관의 강수 확률 예보는 잘 보정돼 있었다 [Murphy & Winkler 1977]. GJP 예측자도 Brier 점수라는 분명한 피드백을 받았고 전반적으로 잘 보정됐다 [Mellers et al. 2014]. 4. 사후 재구성 → 결과를 안 뒤 판단이 바뀌어, 틀린 예측에서 배울 기회를 놓친다. Fischhoff (1975) 는 결과 정보가 불확실성 아래의 판단에 미치는 영향을 이 문제로 다뤘다(논문 제목: 사후 판단은 사전 판단과 같지 않다) [Fischhoff 1975]. 5. 개선 경로 → 확률 훈련, 팀 토론, 상위자 묶기(tracking)가 보정과 해상도를 모두 높였다 [Mellers et al. 2014]. BIN 모형으로 분해하면 세 개입 모두에서 잡음(noise) 감소가 일관되게 큰 몫을 했다 [Satopää et al. 2021].
언제 강해지고 언제 약해지나
| 조건 | 결과 | 근거 | |---|---|---| | 피드백 속도 | 결과를 매일 확인하는 기상 예보는 보정이 좋다. 결과가 늦거나 드문 영역은 학습이 어렵다 | [Murphy & Winkler 1977] | | 질문 시점 | 같은 100% 예측도 질문 초기에는 약 70%, 막바지에는 약 90% 적중 | [Mellers et al. 2014] | | 과제 난이도 | 어려운 과제는 과대평가, 쉬운 과제는 과소평가 | [Lichtenstein et al. 1982; Moore & Healy 2008] | | 과제 조건 | 과신과 어려움-쉬움 효과가 나타나는 조건, 사라지는 조건, 뒤집히는 조건을 이론으로 예측하고 실험으로 지지했다 | [Gigerenzer et al. 1991] | | 질문 방식 | 한 문항에 대한 확신과 "몇 개 맞혔을 것 같은가" 같은 빈도 판단이 체계적으로 다르다(확신-빈도 효과) | [Gigerenzer et al. 1991] | | 훈련 | 1시간 미만 훈련이 4년 모두 Brier 점수를 유의하게 개선(본문의 연도별 값 6~12%, 초록은 6~11%로 요약) | [Chang et al. 2016] | | 집계 방식 | 시장 가격은 단순 평균보다 정확했지만, 최근 예측 가중·과거 성적 가중·재보정을 거친 팀 예측 조사가 시장을 앞섰다 | [Atanasov et al. 2017] |
어떻게 재나
- 보정 곡선: 예측을 확률 구간별로 묶어 구간별 실제 발생 비율을 대각선과 비교한다. 점이 대각선 아래면 과신이다. GJP 1년 차 곡선은 훈련 없음 29,997건, 시나리오 훈련 27,477건, 확률 훈련 25,844건의 예측으로 그렸다 [Mellers et al. 2014].
- 예측 대회: 참가자가 실제 사건 질문에 0~100% 확률을 내고 마감 전까지 자유롭게 갱신한다. GJP 1·2년 차는 199개 지정학 질문, 질문당 평균 102일 공개였다. 결과 확정 후 Brier 점수와 그 분해 성분, 판별력(AUC)으로 채점한다 [Mellers et al. 2014; Mellers et al. 2015].
- 판별력(AUC): 신호 탐지 이론의 ROC 곡선 아래 면적. 0.5는 찍기와 같다. 슈퍼예측가 96%, 차상위 팀원 84%, 나머지 75% [Mellers et al. 2015].
- 반올림 검사: 확률을 0.05·0.10·0.33 단위로 반올림해 점수가 나빠지는지로 확률을 몇 단계까지 구분해 쓰는지 잰다. 슈퍼예측가는 0.10 단위 반올림에서 점수가 나빠졌고, 다른 두 집단은 0.33 단위에서야 나빠졌다 [Mellers et al. 2015; Friedman et al. 2018].
- 일반 상식 문항 과제: 실험실 보정 연구는 두 개 중 답을 고르고 확신(50~100%)을 적게 한 뒤, 확신 구간별 정답률과 비교한다. 실험자가 문항을 어떻게 골랐는지가 과신을 만든다는 비판이 있다(Juslin 1994 의 제목이 이 주장이다).
헷갈리는 개념과의 차이
| 개념 | 무엇이 다른가 | |---|---| | 정확도(accuracy) 전체 | Brier 점수는 보정·해상도·변동성을 합친 값. 보정은 그중 "말한 확률이 발생률과 맞는가" 하나다. 기저율만 말하는 사람은 보정이 좋아도 해상도가 0이라 쓸모가 적다 [Murphy 1973; Mellers et al. 2014] | | 과신(overconfidence) | 보정 실패의 한 방향. 과대평가·과대배치·과잉정밀로 나뉘며 서로 다른 과제에서 반대로 나타난다 [Moore & Healy 2008] | | 베이즈 갱신 | 새 증거로 확률을 고치는 규칙. 보정은 그 결과가 장기적으로 맞았는지를 사후에 채점하는 기준이다 | | 사후확증 편향(hindsight bias) | 결과를 안 뒤 판단이 바뀌는 현상. 예측 기록을 남기는 이유 중 하나다 [Fischhoff 1975] |
주요 후속 연구·메타분석
### Mellers et al. (2014) — 훈련·팀·상위자 묶기가 예측을 개선했다 Psychological Science, 25(5), 1106-1115. DOI: 10.1177/0956797614524255 (전문 확인)
- 설계: 2년 대회. 1년 차 2,246명(설문 1,593명, 예측시장 653명)을 3(훈련 없음·시나리오 훈련·확률 훈련) × 4(혼자·군중 분포 보기·팀·예측시장) 조건에 무작위 배정했다. 훈련은 약 45분. 2년 차에는 1년 차 상위 2% 를 정예 팀으로 묶었다. 199개 지정학 질문.
- 결과: 훈련이 1년 차 Brier 점수를 개선했고(F(2, 1586) = 14.29, p < .001) 확률 훈련이 시나리오 훈련보다 나았다. 팀 조건이 군중 분포 조건보다, 군중 분포 조건이 혼자 조건보다 정확했다. 팀 안에서 댓글을 많이 단 사람일수록 정확했다(r = −.19, −.22). 정예 팀은 2년 차에 평균 회귀 없이 모든 집단을 앞섰다. 슈퍼예측가는 질문당 평균 7.8회 예측했다(일반 팀 1.6회). 보정과 해상도가 모두 개선됐고, 슈퍼예측가의 우위는 주로 해상도에서 나왔다.
- 의미와 한계: 예측은 통계 문제만이 아니고 행동 개입으로 좋아진다. 참가자가 학사 이상·남성 83%·미국인 76% 로 치우친 자원자 집단이다. 2년 차 무훈련 조건에는 1년 차에 시나리오 훈련을 받은 사람이 섞여 훈련 효과를 작게 볼 여지가 있다고 저자들이 밝혔다.
### Mellers et al. (2015) — 슈퍼예측가는 찾아내기도 하고 길러내기도 한다 Perspectives on Psychological Science, 10(3), 267-281. DOI: 10.1177/1745691615577794 (전문 확인)
- 설계: 1·2년 차 성적으로 12개 조건마다 상위 5명씩 60명을 뽑아 12명씩 5개 정예 팀으로 편성하고 3년 차까지 추적했다. 차상위 팀원·나머지와 비교했다.
- 결과: 슈퍼예측가는 2·3년 차에 오히려 더 정확해졌고, 비교 집단은 평균 회귀를 보였다. AUC 96%(차상위 84%, 나머지 75%). 0.10 단위 반올림에서 이들만 점수가 나빠졌다. 슈퍼예측가는 유동 지능·열린 사고 척도에서 더 높았다.
- 의미와 한계: 저자들은 운이라는 가설을 3년 차 재현으로 기각했다. 슈퍼예측가는 정예 팀이라는 환경도 함께 받았고, 저자들은 일반 팀에 남은 상위자(차상위 팀원)를 비교 집단으로 두어 이를 견줬다.
### Chang et al. (2016) — 1시간 미만 훈련의 4년 효과 Judgment and Decision Making, 11(5), 509-526. DOI: 10.1017/S1930297500004599 (전문 확인)
- 설계: 4년 대회에서 개인 예측자를 훈련 조건과 통제 조건에 배정했다. 훈련 모듈 "CHAMPS KNOW"는 비교 집단(기저율) 찾기, 정보 탐색, 예측 갱신, 수학·통계 모형, 사후 검토 등 확률 추론 원칙과 정치 추론 원칙으로 구성됐다.
- 결과: 훈련군이 해마다 Brier 점수에서 앞섰다. 1년 차 확률 훈련 10%·시나리오 훈련 11%, 2년 차 12%(훈련 205명 vs 통제 194명, t(395) = 5.95, p < .001), 3년 차 6%, 4년 차 7% 개선. 훈련·연습·인지 능력은 서로 독립적으로 정확도에 기여했고, 인지 동기까지 넣은 예측 변수들이 합쳐서 정확도 분산의 10~20%를 설명했다. 설명문에 비교 집단(C)·수학 모형(M)·질문 고르기(S) 원칙을 쓴 예측이 더 정확했다.
- 의미와 한계: 짧은 훈련으로도 효과가 있으므로 저자들은 이를 하한 추정치로 봤다. 어느 원칙이 어떤 문제에서 효과적인지는 분리하지 못했다.
### Satopää et al. (2021) — 정확도 향상의 큰 몫은 잡음 감소 Management Science, 67(12), 7599-7618. DOI: 10.1287/mnsc.2020.3882 (초록 확인)
- 설계: 4년 GJP 자료에 베이즈 BIN 모형(편향 Bias·정보 Information·잡음 Noise)을 적용해, 훈련·팀·상위자 묶기가 어느 성분을 바꿔 정확도를 올렸는지 분해했다.
- 결과: 세 개입 모두에서 잡음 감소가 놀랄 만큼 일관된 역할을 했다(초록에 수치 없음).
- 의미와 한계: "잘 보정된 예측"을 만드는 경로에 편향 교정 말고 판단의 들쭉날쭉함 줄이기가 크다는 근거다. 모형 가정에 기댄 분해이고, 초록 수준에서는 성분별 크기를 확인하지 못했다.
### Gigerenzer, Hoffrage & Kleinbölting (1991) — 과신은 조건에 따라 사라지고 뒤집힌다 Psychological Review, 98(4), 506-528. DOI: 10.1037/0033-295X.98.4.506 (초록 확인)
- 설계: 확률적 정신 모형(PMM) 이론을 제안하고 두 실험으로 검증했다.
- 결과: 이론은 과신 효과와 어려움-쉬움 효과를 설명하고, 두 효과가 나타나거나 사라지거나 뒤집히는 조건을 예측했다. 새 현상인 확신-빈도 효과(한 문항 확신과 장기 정답 빈도 판단의 체계적 차이)를 예측했고 실험이 이를 지지했다.
- 의미와 한계: "사람은 원래 과신한다"는 해석에 대한 대표 반론이다. 실험실 상식 문항 과제에 대한 이론이라, 실제 사건 예측에서 GJP 예측자들이 보인 과신(갱신 부족 등)을 모두 설명하지는 않는다.
### Mellers et al. (2017) — 좋은 판단은 과제를 넘어 일반화되는가 Judgment and Decision Making, 12(4), 369-381. DOI: 10.1017/S1930297500006240 (전문 확인)
- 설계: 두 차례 설문(1차: 슈퍼예측가 173명·일반 예측자 75명·학부생 92명, 2차: 67명·90명·186명)으로 일관성·판별·정합성(확률 규칙 준수) 과제를 비교했다.
- 결과: 슈퍼예측가는 모든 과제에서 다른 집단과 같거나 나았다. 예: 일치 편향 과제에서 더 진단적인 검사를 골랐다(t(124.6) = 2.19, p = .030). 베이즈 문제에서 틀린 슈퍼예측가의 오차는 다른 집단만큼 컸다.
- 의미와 한계: 좋은 판단이 여러 측면에서 함께 움직인다는 근거. 응답률이 47~69%로 선택 편향 여지가 있다.
- 그 밖의 문헌
- Murphy, A. H. (1973). A new vector partition of the probability score. Journal of Applied Meteorology, 12(4), 595-600. https://doi.org/10.1175/1520-0450(1973)012<0595:ANVPOT2.0.CO;2 — Brier 점수의 성분 분해.
- Murphy, A. H., & Winkler, R. L. (1977). Reliability of subjective probability forecasts of precipitation and temperature. Applied Statistics, 26(1), 41-47. https://doi.org/10.2307/2346866 — 기상 예보관의 주관적 확률 예보 보정.
- Moore, D. A., & Healy, P. J. (2008). The trouble with overconfidence. Psychological Review, 115(2), 502-517. https://doi.org/10.1037/0033-295X.115.2.502 — 과신의 세 종류. 어려운 과제에서는 과대평가하면서 남보다 못하다고 믿고, 쉬운 과제에서는 반대. 과잉정밀이 가장 끈질김.
- Atanasov, P., Rescober, P., Stone, E., Swift, S. A., et al. (2017). Distilling the wisdom of crowds: Prediction markets vs. prediction polls. Management Science, 63(3), 691-706. https://doi.org/10.1287/mnsc.2015.2374 — 2,400명 이상·261개 사건. 통계적으로 집계한 팀 예측 조사가 예측시장을 앞섰다. 장기 질문 초반에서 우위가 가장 컸다.
- Friedman, J. A., Baker, J. D., Mellers, B. A., Tetlock, P. E., & Zeckhauser, R. (2018). The value of precision in probability assessment: Evidence from a large-scale geopolitical forecasting tournament. International Studies Quarterly, 62(2), 410-422. https://doi.org/10.1093/isq/sqx078 — 888,328건 예측. 확률을 말 표현 수준으로 뭉개면 일관되게 정확도가 떨어졌고, 극단 확률·짧은 기간·특정 점수 규칙에 좌우되지 않았다.
- Fischhoff, B. (1975). Hindsight ≠ foresight: The effect of outcome knowledge on judgment under uncertainty. Journal of Experimental Psychology: Human Perception and Performance, 1(3), 288-299. https://doi.org/10.1037/0096-1523.1.3.288 — 사후확증 편향의 원전.
- Juslin, P. (1994). The overconfidence phenomenon as a consequence of informal experimenter-guided selection of almanac items. Organizational Behavior and Human Decision Processes, 57(2), 226-246. https://doi.org/10.1006/obhd.1994.1013 — 제목 그대로, 실험자가 상식 문항을 비공식적으로 고르는 방식이 과신을 만든다는 주장.
- Erev, I., Wallsten, T. S., & Budescu, D. V. (1994). Simultaneous over- and underconfidence: The role of error in judgment processes. Psychological Review, 101(3), 519-527. https://doi.org/10.1037/0033-295X.101.3.519 — 원문·초록 미확보. 내용은 아래 두 논평의 초록에 요약된 범위로만 적는다.
- Brenner, L. (2000). Should observed overconfidence be dismissed as a statistical artifact? Critique of Erev, Wallsten, and Budescu (1994). Psychological Review, 107(4), 943-946. https://doi.org/10.1037/0033-295X.107.4.943 — 과신을 "참 판단"과 "오차 인공물"로 나누는 분해를 비판(초록 확인).
- Wallsten, T. S., Erev, I., & Budescu, D. V. (2000). The importance of theory: Response to Brenner (2000). Psychological Review, 107(4), 947-949. https://doi.org/10.1037/0033-295X.107.4.947 — Brenner 비판에 대한 원 저자 응답(초록 확인).
- Gneiting, T., & Katzfuss, M. (2014). Probabilistic forecasting. Annual Review of Statistics and Its Application, 1, 125-151. https://doi.org/10.1146/annurev-statistics-062713-085831 — 확률 예측 평가(적정 점수 규칙) 리뷰.
비판·한계
재현성
- 슈퍼예측가 우위는 같은 연구진 안에서 해마다 재현됐다. 1년 차 선발자는 2·3년 차에, 2년 차 선발자는 3년 차에 평균 회귀 없이 성적을 유지했다 [Mellers et al. 2015].
- 훈련 효과는 4년 연속 유의했고 연도별 개선 폭은 6~12% 였다 [Chang et al. 2016].
- 다만 증거 대부분이 GJP 한 프로그램 자료다. 다른 연구진이 다른 질문 집합으로 독립 재현한 대규모 결과는 이 카드 문헌에 없다.
- 기상 예보관의 좋은 보정은 GJP 와 독립된 오래된 근거다 [Murphy & Winkler 1977].
대표 반론
- "과신은 실험실 과제의 산물이다" — Gigerenzer et al. (1991) 은 확률적 정신 모형 이론으로 과신과 어려움-쉬움 효과가 나타나고, 사라지고, 뒤집히는 조건을 예측하고 두 실험으로 지지했다. 한 문항 확신과 장기 정답 빈도 판단이 체계적으로 다르다는 확신-빈도 효과도 보고했다. Juslin (1994) 도 제목에서 과신을 실험자의 비공식 문항 선택 결과로 규정했다. 과신 쪽 응답: Moore & Healy (2008) 는 과대평가와 과대배치의 역전이 과제 종류에 따라 체계적으로 갈린다는 이론으로 모순을 정리했고, 과잉정밀은 가장 끈질기다고 봤다. GJP 의 실제 사건 예측에서도 보정 곡선이 대각선 아래(과신)에 있었고, 훈련이 이를 줄였다 [Mellers et al. 2014].
- "과신 일부는 판단 오차가 만든 통계 인공물이다" — Erev, Wallsten & Budescu (1994) 는 같은 확률 판단 자료가 분석 방식에 따라 과신으로도 과소신뢰로도 보인다는 점을 보였다. 이를 설명하려고 겉으로 낸 응답을 "참 판단"에 오차가 더해진 값으로 보는 모형을 세웠고, 관찰된 과신·과소신뢰를 참 성분과 오차에서 생긴 인공물 성분으로 나눌 수 있다고 결론지었다 [Erev et al. 1994, Brenner 2000 초록의 요약으로 확인]. Brenner (2000) 는 정의가 모호한 모형 구성물(참 판단)을 관찰 자료보다 앞세운 분해라서 부적절하다고 반박했다. 원 저자들은 자료 해석에 모형이 필요하다는 입장을 지켰고, "참 판단"·"오차"라는 이름이 잘 붙지 않았다는 점은 인정했으며, 로그 승산 척도에 특별한 지위가 있다고 주장한 적은 없다고 답했다 [Wallsten et al. 2000]. 보정 곡선이 한쪽으로 치우쳤다고 곧바로 과신이라 부르기 전에, 자료를 어느 축(예측자가 낸 확률인지, 실제 정답 여부인지)으로 묶어 분석했는지 확인한다.
- "잘 맞힌 건 운이다" — 1년 차 성적만 보면 반박하기 어렵다. Mellers et al. (2015) 는 선발자가 2·3년 차에 평균 회귀하지 않은 결과로 대응했다. 정예 팀 환경의 몫은 일반 팀에 남은 상위자와 비교해 따로 봤다.
- "정보기관보다 30% 정확" — 널리 인용되는 이 수치는 동료 심사 논문이 아닌 언론 보도·대중서에서 나왔고, 비교 대상도 분석가 개인이 아닌 정보기관 예측시장이었다 [Tetlock & Gardner 2015].
- 질문 선택의 편향 — 대회 질문은 운영자가 고른다. 실험실 판단 과제로 확인한 일반화 연구가 있으나 [Mellers et al. 2017], 다른 종류의 판단 전체로 넓히려면 따로 검증해야 한다.
쓰면 안 되는 상황
- 몇 번 안 되는 예측으로 사람의 실력을 판정할 때 — 보정은 확률 구간마다 예측이 쌓여야 계산된다. GJP 보정 곡선은 조건마다 수천~수만 건으로 그렸다 [Mellers et al. 2014].
- 결과가 확정되지 않는 질문 — 보정은 몇 달 안에 참·거짓이 갈리는 질문으로 잰다. 수십 년짜리 질문이나 결과 정의가 모호한 질문은 채점할 수 없다 [Mellers et al. 2015; Tetlock 2005].
- 깊은 불확실성 — 장기·복잡계 문제에서는 정확한 확률보다 여러 시나리오에서 버티는 견고한 전략이 더 중요할 수 있다.
- 수치가 가치 판단을 가릴 때 — 확률 숫자가 윤리·가치의 선택을 대신하지 않는다.
- 비판 문헌
- Tetlock, P. E. (2005). Expert Political Judgment: How Good Is It? How Can We Know? Princeton University Press. — 전문가 예측의 기준선, 여우형·고슴도치형.
- Mellers, B., Baker, J. D., Chen, E., Mandel, D. R., & Tetlock, P. E. (2017). How generalizable is good judgment? A multi-task, multi-benchmark study. Judgment and Decision Making, 12(4), 369-381. https://doi.org/10.1017/S1930297500006240
관련 모델
- 베이즈 사고, 기저율 무시, 평균 회귀, 사후확증 편향(hindsight bias), 깊은 불확실성(deep uncertainty)
사고 도구 다른 글