베이즈 사고 (Bayesian Thinking)
처음 실린 날 2026-05-23 · 마지막으로 고친 날 2026-09-27
다른 이름: 베이지안 사고 · 베이즈주의 · 베이즈적 사고 · Bayesian Thinking
한 줄 정의
새 증거를 만났을 때 기존 믿음을 사전 확률(prior)로 두고 조건부 갱신하는 추론 방식. 절대적 단정 대신 확률 분포로 사고한다.
일상 한 줄
0/100 단정 대신 "이 정도 가능성"으로 사고하고, 새 정보를 만나면 조금씩 조정한다.
흔한 장면
- 첫인상으로 "저 사람 별로다" 단정 → 새 단서가 와도 평가가 안 바뀜.
- 뉴스 한 건으로 "역시 X는 다 그래" 결론.
- 친구 사과 한 마디로 모든 의심을 풀어버림 (역방향).
- 면접 첫 5분으로 채용 결정 (45분의 새 정보 무시).
왜 빠지나
- 새 증거를 덜 반영한다 — 주머니·공 뽑기 실험 16편에서 사전 확률이 같은 문제만 보면, 사람들이 증거에 준 가중치는 베이즈 기준의 약 5분의 1(0.20)이었다 [Benjamin 2019]. 새 단서에도 평가가 잘 안 바뀌는 장면과 닮았다. 다만 첫인상이나 면접 초반 판단이 굳는 데는 이 카드가 다루지 않는 다른 기제(한번 세운 믿음을 근거가 사라져도 붙드는 경향 등)도 끼어들 수 있고, 여기 근거는 주머니·공 과제에서 나왔다.
- 사전 빈도를 잊는다 — 인물 묘사 하나를 주면 집단 안의 비율(30%냐 70%냐)을 거의 반영하지 않았다 [Kahneman & Tversky 1973]. 뉴스 한 건에 휘둘리는 쪽이다. 두 오류는 같은 실험 자료 안에서 함께 나타난다 [Benjamin 2019]. 이 결과는 실험별 평균을 묶은 회귀 추정이라, 한 사람이 두 오류를 동시에 보인다는 증거는 아니다.
- 확률 형식이 어렵다 — "양성률 5%" 같은 조건부 확률은 계산이 번거롭다. 같은 정보를 "1,000명 중 50명" 같은 빈도로 주면 베이즈식 풀이가 늘었다 [Gigerenzer & Hoffrage 1995].
빠져나오는 법
1. "지금 얼마나 확신하지?" — 결정 전 70%? 90%? 숫자로 적는다. 비슷한 사례가 평균적으로 얼마나 되는지(참조 집단)부터 떠올린다. 이 요소가 든 약 45분짜리 확률 훈련이 예측 정확도를 올렸다 [Mellers et al. 2014]. — 근거: 무작위 배정 현장 실험 [Mellers et al. 2014]. 훈련 요소가 여럿이라 숫자 적기 하나의 효과는 따로 가를 수 없음 2. 새 증거 강도 평가 — "내 생각이 맞을 때 이 증거가 나올 확률, 틀릴 때 나올 확률은 각각 얼마인가?" 둘이 비슷하면 약한 증거다. 확률을 "100명 중 몇 명"으로 바꿔 계산하면 쉬워진다 [Gigerenzer & Hoffrage 1995; Sedlmeier & Gigerenzer 2001]. — 근거: 실험 [Gigerenzer & Hoffrage 1995] + 훈련 실험 [Sedlmeier & Gigerenzer 2001] + 메타분석 [McDowell & Jacobs 2017]. "두 확률을 따로 묻기" 자체는 식을 옮긴 것이고 따로 검증한 연구는 없음 3. 한 단계씩 조정 — 한 번에 0→100 가지 말고, 새 증거 정도만큼 조금씩 자주 옮긴다. 대회에서 가장 정확한 예측가는 작게 자주 고쳤고, 실력이 낮은 예측가는 첫 판단을 고수하거나 드물게 크게 고쳤다 [Atanasov et al. 2020]. — 근거: 관찰 자료(예측 대회 기록) [Atanasov et al. 2020]. 사람들은 평균적으로 증거를 덜 반영했으므로 [Benjamin 2019], 고칠 때마다 새 증거의 세기만큼은 옮긴다
함께 쓰기 좋은 도구
- 확증 편향 — 베이즈 갱신을 막는 주요 적
- 사전부검 — 결정 전 실패 시나리오를 미리 적기
- 평균 회귀 — 극단값에서 사전으로의 자연 수축
통념이 무너지는 순간
"한 가지 증거만 보면 진실을 알 수 있다"
⚠ 흔한 말: "양성 검사 나왔으면 병이다" — 한 검사 결과로 단정. ✓ 학술: 기저율 무시(base rate neglect)의 대표 실험은 Kahneman & Tversky (1973) 의 엔지니어·변호사 문제다. 참가자는 인물 묘사가 얼마나 전형적인지만 보고, 집단 안의 엔지니어 비율(30% 또는 70%)은 거의 반영하지 않았다. 의학 검사 예시의 원형은 Casscells, Schoenberger & Graboys (1978) 로, 병원 의사·학생에게 양성 검사의 뜻을 물었더니 다수가 사전 확률을 빼고 답했다. 계산해 보면 검사 정확도가 99%(민감도·특이도 모두)이고 유병률이 0.1%일 때 양성이 나온 사람 중 실제 환자는 약 9%다. 베이즈 정리 P(H|E) = P(E|H)·P(H)/P(E) 에서 사전 확률 P(H) 를 빼면 답이 크게 빗나간다.
### "주관적 확률은 비과학적이다 — 객관 데이터만 봐야 한다" ⚠ 흔한 말: 통계 교과서의 빈도주의 정통. ✓ 학술: Cox (1946) 는 믿음의 정도가 몇 가지 일관성 조건을 지키면 확률의 계산 규칙을 따라야 한다고 보였다(콕스 정리). 다만 Halpern (1999) 은 경우의 수가 유한한 영역에서 이 정리가 추가 가정 없이는 성립하지 않는 반례를 냈다. Jaynes (2003) 는 사전 확률을 "증거를 보기 전에 이미 가진 정보를 숫자로 적은 것"으로 다룬다. 빈도주의와 베이즈는 둘 다 쓰이는 방법이고, 데이터가 많아지면 두 방법의 추정은 대체로 가까워진다.
"베이즈 갱신은 머릿속에서 자연히 일어난다"
⚠ 흔한 말: "사람은 새 정보에 합리적으로 적응한다." ✓ 학술: 연구는 두 방향의 어긋남을 보고한다. 보수성(conservatism) 은 새 증거에 베이즈 기준보다 덜 움직이는 경향으로, Phillips & Edwards (1966) 의 주머니·공 뽑기 실험에서 나왔다. 기저율 무시 는 반대로 사전 확률을 덜 쓰고 눈앞의 증거에 끌려가는 경향이다(Kahneman & Tversky 1973). 어느 쪽이 나타나는지는 과제 형식에 따라 갈린다(Benjamin 2019 가 두 갈래 실험을 함께 정리). 훈련 효과의 1차 근거는 Mellers et al. (2014) 다. 2년짜리 지정학 예측 대회에서 확률 추론 훈련(참조 집단 쓰기, 여러 추정 평균하기 등)을 받은 예측가가 보정(calibration: 말한 확률과 실제 적중률이 맞는 정도)과 변별 모두에서 나아졌다. 이 훈련은 베이즈 갱신만 가르친 것은 아니다.
### "사후 확률이 높으면 그게 진실이다" ⚠ 흔한 말: 90% 확신이면 단정해도 된다는 인식. ✓ 학술: 사후 확률은 하나의 점이 아니고 가능성의 분포다. 90% 확신이 잘 보정돼 있어도 그런 판단 10번 중 1번은 틀린다. 베이즈 사고는 확률을 숫자로 적어 두고 새 증거가 올 때마다 다시 고치는 절차다. 90%에서 멈추고 더 고치지 않으면 그 뒤 증거를 반영할 길이 막힌다.
빠져나오는 절차
(상세는 위의 "빠져나오는 법" 섹션 참조.)
1차 출처
- Thomas Bayes (1763, 사후 출판). "An essay towards solving a problem in the doctrine of chances." Philosophical Transactions of the Royal Society of London, 53, 370-418. Richard Price 편집·발표. DOI 10.1098/rstl.1763.0053.
- Pierre-Simon Laplace (1774; 1812). Théorie analytique des probabilités. 베이즈와 따로 같은 원리에 이르렀고, 더 일반적인 형태로 정리했다.
- 현대 표준 교과서: E. T. Jaynes (2003, 사후 출판). Probability Theory: The Logic of Science. Cambridge University Press.
- 의사결정 응용: Savage (1954). The Foundations of Statistics. Wiley.
- 무료 접근:
- Bayes 1763: 퍼블릭 도메인. Royal Society Publishing 무료 다운
- Laplace 1812: 퍼블릭 도메인. archive.org
- Jaynes 2003: 부분 초고 bayes.wustl.edu (Wash U 사후 공개)
원문 핵심 인용
"Given the number of times in which an unknown event has happened and failed: Required the chance that the probability of its happening in a single trial lies somewhere between any two degrees of probability that can be named." — Bayes (1763), 문제 정의 verbatim 검증: 2026-09-27, 공개 원문(원문 스캔 OCR) 131~133행 대조 — OCR 오타 외 일치
핵심 수식 (베이즈 정리):
P(H|E) = P(E|H) · P(H) / P(E)
P(H) = 사전 확률, P(E|H) = 우도, P(H|E) = 사후 확률.
핵심 정의·메커니즘
원전 정의
Bayes (1763)는 "사건이 일어난 횟수와 일어나지 않은 횟수가 주어졌을 때, 한 번 시행에서 그 사건이 일어날 확률이 지정한 두 값 사이에 있을 가능성"을 구하는 문제를 세웠다. 오늘날 쓰는 식 P(H|E) = P(E|H)·P(H)/P(E) 은 Laplace (1774·1812)가 일반화한 형태다.
- 사전 확률 P(H): 증거를 보기 전 가설 H에 둔 믿음의 정도
- 우도 P(E|H): H가 참일 때 증거 E가 나올 확률
- 사후 확률 P(H|E): 증거를 반영한 뒤의 믿음
작동 기제
식을 승산(odds, 일어날 확률 ÷ 안 일어날 확률) 꼴로 쓰면 사후 승산 = 사전 승산 × 우도비, 우도비는 P(E|H)/P(E|¬H) 다. 갱신은 세 단계로 나뉜다.
1. 사전 확률 정하기: 증거를 보기 전 기저율(그 일이 평균적으로 얼마나 흔한가)을 숫자로 둔다. 2. 증거의 세기 재기: 우도비 하나가 증거의 세기다. 우도비가 1에 가까운 증거는 사전 확률을 거의 움직이지 못한다. 3. 곱해서 옮기기: 사전 승산에 우도비를 곱한다. 증거가 여러 개면 곱셈을 반복한다.
사람의 실제 갱신은 두 단계 모두에서 기준에서 벗어난다. Benjamin (2019)의 메타분석은 사람의 갱신을 사후 로그승산 = d × 사전 로그승산 + c × 로그우도비 로 놓고 두 가중치를 추정했다. 베이즈 기준은 c = d = 1이다. 주머니·공 뽑기 실험 16편의 자료에서, 사전 확률이 같은 문제만 골라 추정한 증거 가중치 c는 0.20(표준오차 0.063)이었다. 사전 확률이 다른 문제까지 넣어 추정한 사전 확률 가중치 d는 0.60(표준오차 0.066)이었다. 두 값은 같은 16편 자료의 서로 다른 부분에서 나왔다. 사람들은 증거도 덜 쓰고(보수성, 저자는 underinference라 부른다) 사전 확률도 덜 쓴다(기저율 무시). 두 오류는 서로 모순되지 않고 같은 실험 자료 안에서 함께 나타난다. 다만 실험별 평균 응답을 묶은 추정이라 개인 단위의 동시 발생을 보인 것은 아니다.
왜 틀리나 — 사람 쪽 근거
- 증거를 덜 쓴다: 주머니·공 과제에서 참가자의 사전·사후 추정 차이는 베이즈 기준보다 작았고, 데이터가 늘어도 이 보수성이 그대로였다 [Phillips & Edwards 1966]. Benjamin (2019)은 이것이 가장 흔한 방향의 편향이고, 정답 추론이 강할수록 더 심해진다고 정리했다.
- 사전 확률을 덜 쓴다: 인물 묘사를 주면 엔지니어 비율 30%·70% 조건에서 판단이 거의 같았다 [Kahneman & Tversky 1973].
- 조건부 확률 형식이 계산을 어렵게 한다: 같은 정보를 빈도로 주면 베이즈 계산이 단순해지고 정답이 늘었다 [Gigerenzer & Hoffrage 1995]. Barbey & Sloman (2007)은 사람들이 문제 속 집합 관계(전체 중 환자, 환자 중 양성)를 제대로 떠올리지 못해 연상에 기대기 때문이라고 설명했다.
언제 강해지고 언제 약해지나
- 제시 형식: 조건부 확률 대신 자연 빈도("1,000명 중 50명")로 주면 베이즈식 풀이가 늘었다 [Gigerenzer & Hoffrage 1995]. 35편·226개 추정치를 묶은 메타분석에서 짧은 메뉴 형식(결합 사건만 보여 주는 간단한 표현)과 시각 자료가 조절 효과가 가장 컸고, 두 형식 모두에서 성과를 올렸다 [McDowell & Jacobs 2017].
- 기저율의 성격: 기저율을 경험으로 익혔거나 빈도로 표현할 수 있을 때, 믿을 만하고 개별 정보보다 진단력이 있을 때 사람들은 기저율을 더 썼다 [Koehler 1996].
- 보상 구조: 보상이 있을 때 학습이 더 일어났고, 로그 척도로 승산을 답하게 하면 추정이 베이즈에 가장 가까웠다 [Phillips & Edwards 1966]. 반면 Benjamin (2019)의 메타분석에서 보상이 있는 실험만 따로 보면 사전 확률 가중치 d가 0.43으로 더 낮았다.
- 증거의 진단력: 데이터 하나하나의 진단력이 낮을수록 보수성이 줄었다 [Phillips & Edwards 1966].
- 훈련: 빈도 표현을 그리는 법을 가르친 훈련이 공식에 숫자를 넣는 훈련보다 즉시 학습 효과가 크고 오래갔다. 새 문제로 옮겨 쓰는 효과는 둘이 비슷했다 [Sedlmeier & Gigerenzer 2001].
어떻게 재나
- 엔지니어·변호사 문제 [Kahneman & Tversky 1973]: 기저율만 바꾸고 인물 묘사는 같게 주어 판단이 얼마나 달라지는지 본다.
- 의학 검사 문제 [Casscells et al. 1978; Gigerenzer & Hoffrage 1995]: 유병률·민감도·위양성률을 주고 양성 예측도를 묻는다. 형식(확률 대 빈도)을 조작한다.
- 주머니·공 뽑기 과제 [Phillips & Edwards 1966]: 두 주머니 중 하나에서 공을 뽑을 때마다 "이 주머니일 확률"을 받는다. 사후 로그승산을 로그우도비와 사전 로그승산에 회귀해 가중치 c·d를 추정한다 [Benjamin 2019].
- 예측 대회 채점: 브라이어 점수(Brier score, 확률 예측과 실제 결과의 제곱 오차, 0이 최고·2가 최저)로 정확도를 재고 보정과 변별로 나눈다 [Mellers et al. 2014]. 갱신의 빈도·크기·첫 판단 고수 경향을 따로 잰다 [Atanasov et al. 2020].
헷갈리는 개념과의 차이
- 기저율 무시: 베이즈 갱신에서 사전 확률 쪽 가중치가 1보다 작은 경우다. 베이즈 사고 전체에서 한 부분의 오류다 [Benjamin 2019].
- 보수성: 증거 쪽 가중치가 1보다 작은 경우다. 기저율 무시와 방향이 반대처럼 보이지만 두 가중치가 따로 움직이므로 동시에 나타날 수 있다 [Phillips & Edwards 1966; Benjamin 2019].
- 확증 편향: 가설에 맞는 증거를 찾거나 더 무겁게 읽는 경향이다. 베이즈 틀에서는 우도비를 가설 쪽으로 기울여 읽는 오류로 볼 수 있다. 증거를 공정하게 읽어도 생기는 보수성과는 원인이 다르다.
- 예측 보정(calibration): 말한 확률과 실제 적중률이 맞는 정도로, 갱신 절차의 결과를 사후에 채점하는 지표다. 보정이 좋아도 갱신 규칙이 베이즈를 따랐다는 보장은 없다 [Mellers et al. 2014].
- 빈도주의 통계: 모수를 고정된 값으로 두고 데이터가 반복될 때의 성질로 추론한다. 베이즈 통계는 모수 자체의 불확실성을 분포로 둔다. 개인의 믿음 갱신을 다루는 "베이즈 사고"와 통계 방법론으로서의 베이즈 통계는 같은 식을 쓰지만 다루는 대상이 다르다.
주요 후속 연구·메타분석
### Gigerenzer & Hoffrage (1995) — 빈도로 주면 베이즈 추론이 쉬워진다 Psychological Review, 102(4), 684-704. DOI: 10.1037/0033-295X.102.4.684
- 설계: 통계를 배우지 않은 참가자에게 같은 베이즈 문제를 확률 형식과 빈도 형식으로 주고, 수천 개의 풀이 과정을 분석해 어떤 계산 방법을 썼는지 분류했다.
- 결과: 빈도 형식에서 참가자들이 최대 50%의 추론을 베이즈식으로 풀었다. 베이즈가 아닌 풀이에는 피셔식·네이만-피어슨식 추론의 단순형이 섞여 있었다.
- 의미와 한계: "사람 마음에는 베이즈 계산 능력이 없다"는 기저율 무시 연구의 결론이 정보 형식에 달려 있음을 보였다. 형식이 왜 효과를 내는지(빈도 자체인지, 집합 관계가 드러나서인지)는 이후 논쟁이 됐다 [Barbey & Sloman 2007].
### McDowell & Jacobs (2017) — 자연 빈도 효과 메타분석 Psychological Bulletin, 143(12), 1273-1312. DOI: 10.1037/bul0000126
- 설계: 20년 치 연구에서 논문 35편, 성과 추정치 226개를 모아 두 형식(조건부 확률 대 자연 빈도)의 평균 정답률을 동시에 추정하는 이변량 혼합효과 모형으로 묶었다. 조절 변수로 수리력·전문성 같은 개인 특성, 보상·채점 기준 같은 방법 차이, 짧은 메뉴 형식·시각 자료 같은 표현 방식을 검사했다.
- 결과: 자연 빈도 형식이 조건부 확률 형식보다 정답률이 높았다. 짧은 메뉴 형식과 시각 자료가 가장 강한 조절 효과를 보였고, 두 형식 모두에서 성과를 올렸다. 두 형식을 모두 접하게 하는 설계 같은 방법 요인도 정답률을 바꿨다. (형식별 평균 정답률 수치는 초록에 없어 적지 않는다. 1차 수정 때 적었던 "약 4% → 약 24%"는 2차 인용에서 온 값이라 이번에 뺐다.)
- 의미와 한계: 저자들은 베이즈 추론의 성공 기준을 계산 정답에서 선택과 과정까지 넓히자고 제안했다. 교과서식 서술형 문제에 한정된 결과다.
### Benjamin (2019) — 확률 추론 오류의 리뷰와 메타분석 Handbook of Behavioral Economics, Vol. 2, 69-186. DOI: 10.1016/bs.hesbe.2018.11.002 (전문은 2018년 워킹페이퍼판으로 읽음)
- 설계: 주머니·공 뽑기 같은 두 상태 갱신 실험 16편의 추론 문제를 모아, 사후 로그승산을 로그우도비(증거)와 사전 로그승산(사전 확률)에 회귀해 두 가중치 c·d를 추정했다. 순차 표본 실험 5편은 따로 묶었다.
- 결과: 증거 가중치 c = 0.20(표준오차 0.063, 사전 확률이 같은 문제로 추정), 사전 확률 가중치 d = 0.60(표준오차 0.066, 사전 확률이 다른 문제를 포함한 회귀). 보상이 걸린 실험만 보면 d = 0.43(표준오차 0.086). 보수성(저자 용어로 과소추론)이 가장 흔한 방향이고, 정답 추론이 강할수록, 표본이 클수록 더 심했다. 기저율 무시도 주머니·공 실험에서 확인됐다.
- 의미와 한계: "보수성이냐 기저율 무시냐"는 양자택일이 아니며 같은 실험 자료 안에서 둘이 함께 나타난다고 정리했다. 실험별 평균(또는 중앙값) 응답을 모은 자료라 개인 차원의 결론은 아니다. 매 문제 뒤 정답 사후 확률을 알려 주는 피드백의 효과를 다룬 연구는 두 편뿐이었고 결과가 엇갈렸다.
### Mellers et al. (2014) — 지정학 예측 대회의 훈련·팀·선발 Psychological Science, 25(5), 1106-1115. DOI: 10.1177/0956797614524255 (전문)
- 설계: 미국 정보기관 후원 2년 예측 대회. 1년 차 2,246명, 2년 차 1,648명이 지정학 질문에 0~100% 확률을 냈다. 약 45분짜리 훈련 모듈(확률 훈련: 참조 집단 쓰기, 여러 추정 평균하기 / 시나리오 훈련 / 훈련 없음)과 작업 방식(혼자 / 남의 예측 분포를 보며 혼자 / 팀)을 무작위로 배정했다. 1년 차 상위 2%를 2년 차에 정예 팀으로 묶었다.
- 결과: 1년 차 훈련 효과 F(2, 1586) = 14.29, p < .001. 확률 훈련이 시나리오 훈련보다, 시나리오 훈련이 무훈련보다 브라이어 점수가 좋았다. 2년 차에도 확률 훈련 집단이 더 정확했다. 팀 안에서 댓글을 많이 단 사람일수록 정확했다(r = –.19, –.22, 점수가 낮을수록 정확). 훈련·팀·선발 모두 보정과 변별을 높였다.
- 의미와 한계: 짧은 확률 훈련이 긴 기간에 걸쳐 효과를 냈다. 훈련 내용은 베이즈 갱신만이 아니어서 어느 요소가 효과를 냈는지 가를 수 없다. 참가자가 질문을 골라 풀었기 때문에 질문별로 점수를 표준화했다.
### Atanasov et al. (2020) — 작게 자주 고치는 사람이 더 정확하다 Proceedings of the 21st ACM Conference on Economics and Computation (EC '20). DOI: 10.1145/3391403.3399540
- 설계: 4년짜리 예측 대회에서 약 500개 지정학 질문에 대한 40만 건 넘는 확률 예측을 분석했다. 갱신을 빈도·크기·첫 판단을 고수하는 경향 셋으로 나눴다.
- 결과: 가장 정확한 예측가는 작게 자주 고쳤다. 실력이 낮은 예측가는 첫 판단을 고수하거나 드물게 크게 고쳤다. 자주 고치는 사람은 결정성 지능·열린 사고 점수가 높고 정보를 더 많이 찾았다. 작게 고치는 사람은 유동성 지능이 높았다. 갱신 크기가 훈련 → 정확도의 인과 효과를 매개했다.
- 의미와 한계: "새 증거만큼만 조금씩 옮긴다"는 처방을 받치는 현장 자료다. 학회 발표용 2쪽 확장 초록(873-874쪽)이라 효과크기 수치가 없다.
### Sedlmeier & Gigerenzer (2001) — 두 시간 안에 베이즈 추론 가르치기 Journal of Experimental Psychology: General, 130(3), 380-400. DOI: 10.1037/0096-3445.130.3.380
- 설계: 컴퓨터 튜토리얼로 빈도 표현을 스스로 만드는 법을 가르친 "표현 훈련"과 베이즈 공식에 확률을 넣는 "규칙 훈련"을 두 연구에서 비교했다. 기준은 즉시 학습, 새 문제로의 전이, 장기 유지였다.
- 결과: 전이는 두 훈련이 비슷했다. 즉시 학습 효과와 시간이 지난 뒤의 유지는 표현 훈련이 더 컸다. (초록에 수치 없음)
- 의미와 한계: 베이즈 추론을 가르쳐도 효과가 적다는 이전 교육 연구와 다른 결과다. 학생 표본이고 교과서형 문제에서 잰 결과다.
### Zhu, Sanborn & Chater (2020) — 표본으로 어림하는 베이즈 모형이 판단의 비일관성을 설명한다 Psychological Review, 127(5), 719-748. DOI: 10.1037/rev0000190 (전문)
- 설계: 사람이 확률을 표본의 상대 빈도로 어림하되 일반적인 사전 분포로 보정한다는 모형을 제안하고, 확률 이론 + 잡음 모형과 비교했다. 실험 1에서 워릭대 학생 59명이 "영국의 아무 날에 날씨가 얼어붙을 확률" 같은 단순·결합·분리·조건부 확률 질문 40개에 세 번씩 0~100으로 답했다. 실험 2는 다른 날씨 쌍으로 같은 설계를 되풀이했다.
- 결과: 두 모형은 단순·결합·분리 사건의 평균 예측이 같았고, 조건부 확률과 응답 분포에서 갈렸다. 평균 판단에서는 베이즈 표본추출기가 정성적·정량적으로 더 잘 맞았다. 개인 응답 분포에서는 가정한 표본 크기가 작을 때 표본추출기가 낫고, 크게 허용하면 두 모형이 비슷했다.
- 의미와 한계: 사람의 확률 판단이 베이즈 규범에서 벗어나는 방식을 "잡음"이 아닌 표본 기반 어림의 부산물로 설명하려는 흐름이다. 판단 오류를 설명하는 모형이고, 갱신 훈련의 효과를 다루지는 않는다. 학생 표본의 날씨 질문이다.
그 밖의 문헌:
- Cox, R. T. (1946). Probability, frequency and reasonable expectation. American Journal of Physics, 14(1), 1-13. DOI 10.1119/1.1990764 — 믿음의 정도가 일관성 조건을 지키면 확률 규칙을 따라야 한다는 콕스 정리.
- Phillips, L. D., & Edwards, W. (1966). Conservatism in a simple probability inference task. Journal of Experimental Psychology, 72(3), 346-354. DOI 10.1037/h0023653 — 실험 3개. 사전·사후 추정 차이가 베이즈 기준보다 작았고(보수성), 사전 확률과 무관했으며 데이터가 늘어도 그대로였다. 로그 척도로 승산을 답하게 하면 베이즈에 가장 가까웠다.
- Kahneman, D., & Tversky, A. (1973). On the psychology of prediction. Psychological Review, 80(4), 237-251. DOI 10.1037/h0034747 — 엔지니어 비율 30%·70% 조건에서 판단이 거의 같았다(기저율 무시).
- Casscells, W., Schoenberger, A., & Graboys, T. B. (1978). Interpretation by physicians of clinical laboratory results. New England Journal of Medicine, 299(18), 999-1001. DOI 10.1056/NEJM197811022991808 — 의사들도 양성 검사의 뜻을 물으면 유병률을 빼고 답했다.
- Mellers, B., Stone, E., Murray, T., et al. (2015). Identifying and cultivating superforecasters as a method of improving probabilistic predictions. Perspectives on Psychological Science, 10(3), 267-281. DOI 10.1177/1745691615577794 — 해마다 상위 예측가를 정예 팀으로 묶자 평균 회귀 예상과 달리 2년 연속 높은 정확도를 유지했다. 인지 능력·과제 기술·동기·풍부한 환경 네 설명을 지지했다.
- Koehler, J. J. (1996). The base rate fallacy reconsidered: Descriptive, normative, and methodological challenges. Behavioral and Brain Sciences, 19(1), 1-17. DOI 10.1017/S0140525X00041157 — 기저율 무시가 과장됐다는 반론. 기저율은 거의 항상 쓰이며 쓰는 정도는 과제 구조와 표현에 달렸다고 주장.
- Barbey, A. K., & Sloman, S. A. (2007). Base-rate respect: From ecological rationality to dual processes. Behavioral and Brain Sciences, 30(3), 241-254. DOI 10.1017/S0140525X07001653 — 기저율 무시를 집합 구조를 표상하지 못한 연상적 판단으로 설명하는 이중과정 모형.
- Jones, M., & Love, B. C. (2011). Bayesian fundamentalism or enlightenment? Behavioral and Brain Sciences, 34(4), 169-188. DOI 10.1017/S0140525X10003134 — 인지를 베이즈 최적 모델로 설명하는 연구 흐름 비판.
- Halpern, J. Y. (1999). A counter example to theorems of Cox and Fine. Journal of Artificial Intelligence Research, 10, 67-85. DOI 10.1613/jair.536 — 유한 영역에서 콕스 정리의 반례.
- 교과서·단행본: Pearl, J. (2009). Causality (2판). Cambridge University Press. — 베이즈 네트워크와 인과 추론. McElreath, R. (2020). Statistical Rethinking (2판). CRC Press. — 현대 베이즈 통계 교과서. Tetlock, P. E., & Gardner, D. (2015). Superforecasting. Crown. — Mellers et al. 2014 대회의 대중서 판.
비판·한계
재현성
- 기저율 무시의 엔지니어·변호사 결과는 여러 번 재현됐다고 Benjamin (2019)이 정리했다. 주머니·공 과제의 보수성도 16편 메타분석에서 일관됐다(증거 가중치 c = 0.20).
- 자연 빈도 효과는 35편·226개 추정치의 메타분석에서 방향이 일관됐다 [McDowell & Jacobs 2017]. 다만 효과 크기는 제시 방식·채점 기준 같은 방법 요인에 따라 크게 달라졌다.
- 예측 훈련 효과는 2년 연속 나타났다 [Mellers et al. 2014]. 같은 대회 자료를 쓴 후속 분석이 대부분이어서 다른 예측 환경에서의 독립 재현은 제한적이다.
대표 반론
- 기저율 무시가 과장됐다 (Koehler 1996): 문헌을 다시 보면 사람들은 기저율을 거의 항상 쓰며, 그 정도는 과제 구조와 표현에 달려 있다고 주장했다. 현실의 기저율은 모호하고 불안정해서 교과서식 베이즈 기준을 기계적으로 대면 판단의 목표·가정을 놓친다고 봤다. 원 주장 쪽 응답에 해당하는 것이 Benjamin (2019)의 메타분석이다. 보상이 걸린 실험에서도 사전 확률 가중치가 0.43으로 1보다 한참 작았다.
- 자연 빈도 효과의 원인 (Barbey & Sloman 2007): 빈도 형식 자체보다 집합 관계를 드러내는 표현이 효과를 낸다는 이중과정 설명을 내놓았다. 생태적 합리성 쪽(Gigerenzer 계열)은 빈도가 자연 표집 방식과 맞아 계산이 쉬워진다고 본다. McDowell & Jacobs (2017)는 두 관점에서 나온 조절 변수를 모두 검사했고, 짧은 메뉴 형식과 시각 자료가 두 형식 모두에서 효과를 냈다.
- 인지를 베이즈 모델로 설명하는 연구 비판 (Jones & Love 2011): 사전 확률을 사후에 맞춰 넣으면 무엇이든 설명할 수 있다는 비판이다. 사람 행동을 베이즈 최적으로 설명하는 연구 흐름에 대한 것이고, 베이즈 갱신을 규범으로 쓰는 일과는 구별된다.
- 표본추출로 보는 최근 흐름 (Zhu, Sanborn & Chater 2020): Jones & Love 이후 한 갈래는 뇌가 확률을 직접 계산하지 않고 기억·시뮬레이션에서 뽑은 적은 표본으로 어림한 뒤 일반적인 사전 확률로 보정한다고 본다("베이즈 표본추출기"). 이 모형에서는 극단값을 피하는 보수적 확률 판단이 작은 표본에 대한 합리적 보정으로 나오고, 결합 오류 같은 비일관성도 같은 틀에서 나온다. 저자들은 날씨 확률 질문 실험 2개(실험 1은 59명이 40개 질문에 세 번씩 답함)에서 이 모형이 평균 판단을 경쟁 모형(확률 이론 + 잡음)보다 잘 맞췄다고 보고했다. 개인 응답 분포에서는 표본 크기를 얼마로 가정하느냐에 따라 우열이 갈렸다. 여기서 말하는 보수성은 확률값이 0·1 쪽 극단을 피하는 경향이라, 주머니·공 과제의 "증거를 덜 반영하는" 보수성과는 같은 말이 다른 현상을 가리킨다.
- 콕스 정리의 단서 (Halpern 1999): 경우의 수가 유한한 영역에서는 추가 가정 없이 콕스 정리가 성립하지 않는 반례가 있다.
쓰면 안 되는 상황
- 기저율 자료가 없는데 사전 확률을 지어낼 때: 계산이 정교해 보여도 결과는 지어낸 사전 확률을 되풀이한다.
- 과거 빈도가 미래를 대표하지 못할 때: 드물고 영향이 큰 사건(블랙 스완)처럼 분포 자체가 바뀌는 영역.
- 증거끼리 독립이 아닐 때: 같은 출처를 여러 번 본 증거를 따로 곱하면 우도비를 중복 계산한다.
- 데이터가 적고 사전 선택이 결론을 좌우할 때: 제프리스 사전·최대 엔트로피·전문가 사전 등 방법에 합의가 없다. 사전을 바꿔 결론이 뒤집히는지 확인해야 한다.
관련 모델
- 평균 회귀 (Regression to the Mean) — 극단값에 대한 사후 수축의 다른 표현
- 기저율 무시 (Base Rate Neglect, Kahneman & Tversky 1973)
- 사전·사후 분리 사고 — "이걸 보기 전 나는 얼마나 확신했나?"
- 확증 편향 (Confirmation Bias) — 베이즈 갱신을 막는 주요 적
- 사전부검 (Pre-mortem)
사고 도구 다른 글