오컴의 면도날 (Occam's Razor)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 오캄의 면도날 · Occam's Razor
한 줄 정의
같은 현상을 설명하는 가설이 여럿일 때, 불필요한 가정을 더 적게 요구하는 설명을 잠정적으로 우선하라는 원칙. 14세기 윌리엄 오브 오컴의 "필요 없이 복수(複數)를 상정하지 말라"에서 유래했다 [Ockham, Sentences commentary].
일상 한 줄
설명이 복잡할수록 그럴듯해 보이지만, 같은 설명에 가정을 하나 얹으면(A만 vs A와B) 그 전체가 참일 확률은 곱해져 낮아진다 [Tversky & Kahneman 1983] — 서로 배타적인 설명끼리 비교할 때는 가정 수만으로 확률 순위가 정해지지 않는다. "거대한 음모"보다 "그냥 실수·우연"이 먼저 검토할 설명인 경우가 대부분이다. 단, 면도날은 단순한 쪽이 참이라고 보장하지 않는다. 어디부터 의심할지 정하는 순서 규칙으로 쓴다 [Sober 2015].
이 카드의 핵심 주장은 1차 출처에 근거합니다. 원문을 직접 대조하지 못한 인용은 그렇다고 표시했습니다(그래서 confidence B).
흔한 장면
- 음모론 vs 단순 설명: 항공기 사고·정전·배송 지연을 두고 "조직적 은폐"를 떠올리지만, 보통은 정비 누락·과부하·시스템 오류 같은 적은 가정의 설명이 맞다.
- 인간관계 오해: 연락이 끊긴 친구를 두고 "나를 손절했다"는 복잡한 서사 대신 "바빴다/까먹었다"가 가정이 더 적다.
- 버그 디버깅: "프레임워크 내부 버그"보다 "내 오타·환경변수 누락"이 먼저 의심할 후보. 흔한 원인이 먼저다.
- 의료 진단: 두통+피로를 두고 희귀병부터 떠올리기보다 흔한 원인(수면 부족·탈수)을 먼저 배제 — "말발굽 소리에 얼룩말 말고 말을 떠올려라"(1940년대 미국 의사 Theodore Woodward가 퍼뜨린 격언으로 알려짐). 반대로 "환자는 여러 병을 동시에 가질 수 있다"는 히컴의 격언(Hickam's dictum)이 진단의 균형추로 함께 쓰인다.
- 제품·기획 회의: 지표 하락을 "복합적 거시 요인"으로 설명하려 들지만, 배포 직후라면 "방금 그 배포"가 가정 가장 적은 설명.
- 과한 이론 만들기: 데이터의 모든 점을 맞추려 변수를 계속 추가하면, 설명력은 늘어 보여도 새 데이터에서 무너진다(과적합).
왜 빠지나 (메커니즘)
- 설명의 그럴듯함 ≠ 확률: 가정을 더할수록 이야기는 구체적이고 생생해져 더 그럴듯하게 느껴지지만, 그 가정이 기존 설명 위에 덧붙는 관계(A vs A∧B)라면 연언(連言) 확률은 곱해져 더 낮아진다 — 결합 규칙(conjunction rule) 자체가 그렇다 [Tversky & Kahneman 1983, Psychological Review]. 서로 포함 관계가 아닌 두 설명(예: "배송 오류" vs "결제 오류")을 비교할 때는 가정 수가 적다고 확률이 자동으로 높아지지 않는다. 면도날은 전자(같은 설명에 가정을 덧붙이는 경우)의 착시를 교정하는 장치.
- 과적합 = 복잡성의 대가: 통계적으로 자유 파라미터가 많은 모델은 기존 데이터를 더 잘 맞추지만 새 데이터 예측력은 떨어진다. 면도날은 모델 선택에서 복잡성에 페널티를 매기는 형식으로 정량화된다 [Sober 2015, 모델선택 paradigm; Akaike 1974, AIC].
- 베이즈의 자동 면도날: 베이즈 추론에서 모델 증거(marginal likelihood)는 별도 규칙 없이도 과도하게 복잡한 모델에 자동으로 페널티를 준다. 넓은 가설 공간에 확률을 분산시킨 모델은 실제 관측에 낮은 확률을 배정하기 때문 [MacKay 2003, ch.28; paraphrase — 아래 인용 주의].
빠져나오는 법
1. 가정 세기: 경쟁 설명마다 "추가로 참이라고 가정해야 하는 것"의 개수를 적는다. 적은 쪽을 먼저 검증(기각하기 쉬운 것부터). — 근거: 확률 규칙(같은 설명에 가정을 덧붙이면 확률이 낮아짐) [Tversky & Kahneman 1983]. 이 절차 자체의 효과를 잰 연구는 없음 2. 흔한 것부터(기저율, base rate): 빈도가 높은 원인을 먼저 배제한다 — 진단에서의 절약(parsimony) 원칙. 얼룩말(희귀)은 말(흔함)을 배제한 다음에 본다. — 근거 수준: 경험칙(진단 교육의 관행, 이 카드에서 직접 검증 연구 확인 못 함) 3. 반증 가능성으로 정렬: 단순 가설일수록 검증·반증이 빠르다. 면도날은 "검증 순서" 도구로 쓴다. Popper는 단순한 이론일수록 반증 가능성이 높다고 봤다 [Popper 1959]. — 근거 수준: 철학 논증 [Popper 1959], 경험 검증 없음 4. 단순함을 맹신하지 않기: 면도날은 설명력이 비슷할 때 쓰는 동점 규칙(tie-breaker)이다. 단순한 설명이 데이터를 덜 설명하면 무효 — 복잡성을 정당화하는 증거가 있으면 복잡한 쪽을 택한다 [Sober 2015]. 반대로 원인이 많고 길다는 이유만으로 설명을 더 믿는 경향도 있으니, 복잡함에도 같은 기준을 댄다 [Zemla et al. 2017]. — 근거: 실험(사람은 확률 증거보다 단순성에 기울기도 하고 [Lombrozo 2007], 일상 설명에서는 복잡성에 기울기도 함 [Zemla et al. 2017]), 통계 이론 [Forster & Sober 1994]
함께 쓰기 좋은 도구
- 반증가능성 (falsifiability) — 단순한 가설일수록 반증 부담이 작아 먼저 시험할 수 있다.
- 제1원리 사고 (first-principles) — 가정을 분해해 "정말 필요한 전제"만 남기는 작업과 직결.
- 기저율 무시 (base-rate-neglect) — "흔한 원인 먼저"의 통계적 짝.
- 결합 오류 (conjunction fallacy) — 가정 추가가 왜 확률을 낮추는지의 직접 근거 [Tversky & Kahneman 1983].
통념이 무너지는 순간
"더 단순한 설명이 항상 옳다"
⚠ 흔한 말: "오컴의 면도날 = 제일 간단한 답이 정답." ✓ 학술: Sober는 절약성(parsimony)이 그 자체로 참을 보증하지 않고, 주제별 경험적 가정이 있을 때만 정당화된다고 본다 [Sober 2015]. 면도날에는 경험과 무관한(a priori) 단일 정당화가 없고, 베이즈·모델선택 같은 맥락별 정당화만 있다. 단순함은 잠정적 우선순위다. 사람은 단순한 설명에 더 높은 사전확률을 주는 경향이 있어서, 복잡한 설명이 채택되려면 확률 증거가 과하게 많이 필요했다 [Lombrozo 2007].
### "단순한 모델이 늘 더 잘 맞힌다" ⚠ 흔한 말: "복잡한 주장은 보통 헛소리고, 단순한 쪽이 늘 이겼다." ✓ 학술: 기계학습 문헌을 검토한 Domingos는 "단순한 모델이 새 데이터에서 더 정확하다"는 두 번째 면도날이 일반적으로 성립하지 않는다고 정리했다 [Domingos 1999]. 데이터를 완벽히 맞출 만큼 큰 신경망이 오히려 시험 데이터에서 더 잘 맞히는 이중 하강(double descent) 현상도 여러 모델·데이터에서 보고됐다 [Belkin et al. 2019]. 단순성은 판단 순서를 정할 뿐, 예측 정확도를 보장하지 않는다.
### "오컴이 '엔티아 논 순트 물티플리칸다'라고 말했다" ⚠ 흔한 말: 가장 자주 인용되는 라틴 문구가 오컴의 말로 통한다. ✓ 학술: 그 문구("Entia non sunt multiplicanda praeter necessitatem")는 오컴의 현존 저작에 없다 — "Although the sentiment is certainly Ockham's, this particular formulation is nowhere to be found in his texts" [Spade, Panaccio & Pelletier, "William of Ockham", Stanford Encyclopedia of Philosophy]. 이 문구의 역사를 추적한 Thorburn은 17세기 스코투스 주석가 존 펀치(John Punch, 1639)를 명문화 출처로 지목했다 [Thorburn 1918]. 펀치의 문장은 "Non sunt multiplicanda entia sine necessitate"로 전해지고, 널리 통용되는 "Entia non… praeter necessitatem"은 그 후대 변형이다(라틴 원문 직접 대조 못 함 — 2차 출처 기반). 오컴 본인의 표현은 "Numquam ponenda est pluralitas sine necessitate" 등.
### "면도날은 절대 규칙(법칙)이다" ⚠ 흔한 말: "면도날에 위배되면 틀린 거다." ✓ 학술: 면도날은 휴리스틱(어림 규칙)이다. Sober는 면도날에 단일 a priori 정당화가 없고 맥락별 정당화(우도·모델선택)만 있다고 본다 [Sober 2015]. 모델을 세울 때 안내하는 발견법으로 쓰고, 완성된 이론 사이의 최종 심판으로 쓰지 않는다.
1차 출처
- William of Ockham (c.1287–1347). 핵심 표현은 Ordinatio(Sentences 주석) lib. I, dist. 27, qu. 2의 "Numquam ponenda est pluralitas sine necessitate"(필요 없이 복수를 상정하지 말라)와 Summa Logicae의 "Frustra fit per plura quod potest fieri per pauciora"(더 적은 것으로 될 일을 더 많은 것으로 함은 헛되다)로 전해진다.
- Spade, P. V., Panaccio, C., & Pelletier, J. (2024). "William of Ockham." Stanford Encyclopedia of Philosophy (Fall 2024 ed.; substantive revision 2024-09-11). plato.stanford.edu/entries/ockham (접근 2026-09). — "Entia non…" 정식화가 오컴 텍스트에 없음을 명시. 면도날의 역사에 관한 2차 문헌으로 Brampton(1964)·Maurer(1978, 1984)를 든다.
- John Punch (Johannes Poncius) (1639). 흔히 인용되는 라틴 문구를 명문화한 출처로 지목된다 [Thorburn 1918]. 오컴 본인의 문구가 아니다.
- Thorburn, W. M. (1918). The myth of Occam's razor. Mind, 27(3), 345–353. DOI: 10.1093/mind/XXVII.3.345. — 유명 라틴 문구가 오컴 저작에 없고 후대에 붙었음을 추적한 논문.
- Sober, E. (2015). Ockham's Razors: A User's Manual. Cambridge University Press. ISBN 978-1-107-06849-0. — 현대 철학에서 절약성(parsimony)을 정리한 단행본.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms, ch.28 "Model Comparison and Occam's Razor". Cambridge University Press. — 베이즈 증거가 자동으로 복잡성에 페널티를 준다는 "베이즈 오컴 면도날" 정식화.
- Tversky, A., & Kahneman, D. (1983). Extensional versus intuitive reasoning: The conjunction fallacy in probability judgment. Psychological Review, 90(4), 293–315. DOI: 10.1037/0033-295X.90.4.293. — 가정 추가가 확률을 낮추는 메커니즘(결합 오류).
- Popper, K. R. (1959). The Logic of Scientific Discovery. Hutchinson. — 단순성을 반증 가능성의 정도로 해석(7장).
원문 핵심 인용
"Although the sentiment is certainly Ockham's, this particular formulation is nowhere to be found in his texts." — Spade, Panaccio & Pelletier, "William of Ockham", SEP 본문 (verbatim 검증: 2026-09, SEP 페이지 원문)
"simpler explanations are assigned a higher prior probability, with the consequence that disproportionate probabilistic evidence is required before a complex explanation will be favored over a simpler alternative." — Lombrozo (2007), Cognitive Psychology 55(3), 초록 (verbatim 검증: 2026-09, Europe PMC 초록)
"Numquam ponenda est pluralitas sine necessitate." ("필요 없이는 결코 복수를 상정해서는 안 된다.") — William of Ockham, Ordinatio I, dist. 27, qu. 2 (원문 대조 못 함 — 2차 출처 기반. 비평본 쪽수 미확인)
"Frustra fit per plura quod potest fieri per pauciora." ("더 적은 것으로 할 수 있는 일을 더 많은 것으로 함은 헛되다.") — William of Ockham, Summa Logicae (원문 대조 못 함 — 2차 출처 기반)
핵심 정의·메커니즘
원전 정의
| 항목 | 내용 | |---|---| | 규범 진술 | 설명력이 비슷할 때, 가정·존재자(entity)를 더 적게 요구하는 가설을 우선 | | 오컴 본인 표현 | "pluralitas non est ponenda sine necessitate" 계열 (현존 저작) | | 유명 라틴 문구 | "Entia non sunt multiplicanda…" → John Punch 1639 (오컴 저작에 없음) | | 통계적 형식화 | 모델선택(AIC·BIC·MDL): 적합도 + 복잡성 페널티 / 베이즈: 주변우도(marginal likelihood)가 자동 페널티 | | 지위 | 휴리스틱. 동점 규칙이자 검증 순서 도구 |
- 두 가지 단순성: 존재자의 수를 줄이는 존재론적 절약(ontological parsimony)과, 이론의 서술·매개변수를 줄이는 구문적 단순성(elegance)은 다른 개념이다. 오컴 본인의 관심은 앞쪽(불필요한 형이상학적 존재자 거부)이었다 [Spade et al. 2024].
작동 기제
- 1단계 — 심리적 사전확률: 확률 정보가 없는 상태에서 원인 1개 설명과 2개 설명 중 고르게 하면 참가자 48명 중 96%가 단순한 쪽을 골랐다 [Lombrozo 2007, 실험 1].
- 2단계 — 불균형한 증거 요구: 확률 정보(기저율)를 함께 주자 단순한 설명 선택 비율은 71%로 낮아졌지만, 복잡한 대안이 10배 더 그럴듯한 조건에서도 1/3 넘게 여전히 단순한 쪽을 골랐다(참가자 144명, χ²(7)=25, p<.01). 이 선택 패턴을 로지스틱 회귀로 되짚으면, 참가자 집단은 단순한 설명에 암묵적으로 약 79%(95% CI 69~86%)의 사전확률을 미리 부여한 것과 같다 — 복잡한 쪽이 이기려면 그만큼 더 많은 증거가 쌓여야 한다 [Lombrozo 2007, 실험 2].
- 3단계 — 통계적 정당화: 자유 매개변수가 많은 모델은 기존 데이터를 더 잘 맞추지만(적합도↑), 잡음까지 맞춰 새 데이터 예측력은 떨어진다(일반화 오차↑). AIC는 로그우도에서 매개변수 수를 빼 기대 예측 정확도를 추정해 이 손실을 벌점화한다 [Akaike 1974; Forster & Sober 1994].
- 4단계 — 베이즈의 자동 벌점: 베이즈 추론에서 모델 증거(주변우도)는 넓은 가설 공간에 확률을 나눠 가진 유연한 모델에 자동으로 낮은 값을 배정한다. 매개변수 수와 매개변수 공간의 크기가 모두 벌점 요인이고, 사람의 직관적 확률·설명 판단도 이 두 요인 모두에 반응했다(참가자들이 값의 범위가 넓은 자유 매개변수를 가진 가설일수록 더 낮게 평가) [Blanchard et al. 2018; MacKay 2003].
언제 강해지고 언제 약해지나
- 강해짐 — 확률 정보가 모호할 때: 참가자가 결합확률을 스스로 계산해야 하는 조건에서는 단순성 선호가 뚜렷했다 [Lombrozo 2007, 실험 2·3].
- 약해짐 — 결합확률이 숫자로 주어질 때: 두 가설의 결합확률을 숫자로 알려준 조건(실험 4)에서 단순한 설명을 고른 비율은 17%로, 같은 확률비(2:3)였던 실험 2의 61%보다 유의하게 낮았다(χ²(1)=8.85, p<.01). 한 실험 안의 전후 비교가 아니라 실험 간 비교다 [Lombrozo 2007, 실험 2·4].
- 약해짐 — 완결된 일상 설명을 평가할 때: 원인 하나를 고르는 과제가 아니라 인과 설명 전체의 질을 평가하게 하면, 사람들은 원인이 많고 복잡한 설명을 더 좋게 봤다 [Zemla et al. 2017]. 단순성 선호는 결정론적 맥락·물리 체계에서 강하고, 확률적 맥락·사회 체계에서 약했다 [Johnson et al. 2019].
- 강해짐 — 경쟁 가설의 자유도가 커질 때: 경쟁 가설이 가질 수 있는 자유 매개변수 값의 범위가 없음→중간→큼으로 커질수록, 확률 판단과 설명 선호 모두 더 단순한 가설 쪽으로 쏠렸다(실험1 F(2,178)=48.90, p<.001, ηp²=.363; 실험2 F(2,180)=26.95, p<.001, ηp²=.236) [Blanchard et al. 2018].
- 약해짐 — 훈련 오차가 같다고 가정할 때("제2 면도날"): "훈련 데이터를 똑같이 잘 맞추면 더 단순한 모델이 새 데이터에서도 낫다"는 명제는 문헌 검토에서 일반적으로 지지되지 않았다. 단일 규칙(1R) 알고리즘은 평균적으로 C4.5보다 5.7% 낮은 정확도를 보였을 뿐이라 "단순함의 손실이 작다"는 근거일 뿐 "더 낫다"는 근거는 아니다 [Domingos 1999, Holte 1993 재인용].
- 약해짐 — 모델 용량이 보간점을 넘을 때: 신경망처럼 매개변수 수가 훈련 표본 수를 넘어 데이터를 정확히 보간(interpolate)하는 지점을 지나면, 고전적 편향-분산 U자 곡선과 달리 시험 오차가 다시 낮아지는 이중 하강(double descent)이 여러 모델·데이터셋에서 확인됐다 [Belkin et al. 2019].
어떻게 재나
- 선택 과제(택 1): 참가자에게 가상의 외계 행성 질병 시나리오를 주고, 증상을 설명하는 원인 1개 가설과 원인 2개 가설 중 "가장 만족스러운 설명"을 고르게 한다. 조건마다 두 가설의 사전확률(질병 기저율)을 조작해 선택률 변화를 본다 [Lombrozo 2007].
- 비교강도 평정(6점 척도): 두 가설(H1·H2) 중 어느 쪽이 더 그럴듯한지/더 나은 설명인지를 1(H1이 훨씬 낫다)~6점으로 평정시키고, 경쟁 가설의 자유 매개변수 수·값의 범위를 조건으로 조작한다(Amazon Mechanical Turk 표본) [Blanchard et al. 2018].
- 모델선택 시뮬레이션: 인공 데이터로 여러 차수의 모델을 적합시키고, AIC 등 정보 기준이 실제로 더 낮은 일반화 오차를 갖는 모델을 골라내는지 시험 데이터로 확인한다 [Forster & Sober 1994; Myung 2000].
- 이중 하강 곡선 측정: 모델 용량(매개변수 수·신경망 폭)을 점진적으로 늘려가며 훈련 오차와 시험 오차를 함께 그려, 보간점 전후의 U자·재하강 패턴을 관찰한다 [Belkin et al. 2019].
헷갈리는 개념과의 차이
- 결합 오류(conjunction fallacy)와의 차이: 결합 오류는 "A"와 "A와 B"처럼 한쪽이 다른 쪽을 포함하는 관계에서만 성립하는 확률 법칙이다(포함하는 쪽이 항상 확률이 낮거나 같다). 면도날은 이런 포함 관계가 아닌, 서로 배타적인 설명들 사이의 잠정적 우선순위 규칙이라 결합 오류의 확률 계산을 그대로 적용할 수 없다 [Tversky & Kahneman 1983].
- 기저율(base rate)과의 차이: "흔한 원인 먼저"는 실제 발생 빈도(경험적 사실)에 근거하지만, 면도날은 가정의 개수(구조적 단순성)에 근거한다. 흔한 원인이 오히려 가정이 많은 설명일 수도 있다(여러 병이 겹친 상태가 흔한 고령 환자군 등 — 진단의 히컴 격언).
- 과적합(overfitting)과의 차이: 과적합은 특정 데이터셋에 대한 모델의 통계적 실패 양상(훈련 오차↓·일반화 오차↑)을 가리키는 결과 개념이고, 면도날은 그 실패를 막기 위해 사전에 복잡성을 제한하는 처방 개념이다.
- 경계 조건: 면도날은 경쟁 가설의 설명력이 비슷할 때만 작동한다. 데이터가 복잡한 쪽을 명확히 지지하면 적용하지 않는다.
주요 후속 연구·메타분석
### Lombrozo (2007) — 단순한 설명에 사람은 더 높은 사전확률을 준다 Cognitive Psychology, 55(3), 232–257. DOI: 10.1016/j.cogpsych.2006.09.006
- 설계: 실험 4개. 미국 명문대 학부생·여름학교 학생(실험1 48명, 실험2 144명 등)에게 가상 외계 행성의 질병·증상 시나리오를 주고, 원인 1개 설명과 원인 2개 설명 중 하나를 고르게 함. 조건마다 두 설명의 사전확률(기저율) 또는 결합확률 제시 여부를 조작.
- 결과: 확률 정보가 없으면 96%가 단순한 설명 선택(실험1). 기저율을 줘도 71%가 단순한 쪽 선택, 복잡한 쪽이 10배 더 그럴듯한 조건에서도 1/3 이상이 단순한 쪽 선택(χ²(7)=25, p<.01, 실험2). 로지스틱 회귀로 추정한 암묵적 사전확률은 단순한 설명 쪽으로 약 79%(95% CI 69~86%). 단순하지만 불확실한 설명을 택한 참가자는 그 원인의 실제 빈도를 유의하게 과대추정(1:2 조건 19% vs 8%, t(14.6)=2.18, p<.05; F(1,50)=7.93, p<.01, 실험3). 결합확률을 숫자로 직접 제시한 실험 4의 단순한 설명 선택률은 17%로, 같은 확률비(2:3)였던 실험 2의 61%보다 유의하게 낮았다(실험 간 비교, χ²(1)=8.85, p<.01).
- 의미와 한계: 확률 정보를 무시하지 않으면서도 사전확률 자체를 단순한 설명 쪽으로 높게 잡는 방식으로 단순성 선호가 작동함을 보임. 표본이 미국 명문대 학부생·여름학교 학생에 국한돼 일반화 범위는 제한적(저자도 명시).
### Blanchard, Lombrozo & Nichols (2018) — 사람의 직관 판단은 베이즈 면도날의 예측과 맞아떨어진다 Cognitive Science, 42(4), 1345–1359. DOI: 10.1111/cogs.12573
- 설계: 실험 2개. Amazon Mechanical Turk 성인 표본(실험1 178명, 실험2 180명). 경쟁 가설 H1(고정 매개변수)과 H2(자유 매개변수, 값의 범위를 없음/중간/큼으로 조작)를 제시하고 1~6점 척도로 상대적 확률·설명 강도를 평정.
- 결과: 매개변수 조건의 주효과 유의(실험1 F(2,178)=48.90, p<.001, ηp²=.363; 실험2 F(2,180)=26.95, p<.001, ηp²=.236). H2의 자유 매개변수 범위가 커질수록 H1 지지가 강해짐(H1 평균 강도 4.62[없음]→3.95[중간]→2.55[큼], 실험1). 확률 판단과 설명 판단 사이 유의한 차이 없음.
- 의미와 한계: "매개변수 개수"와 "매개변수 공간의 크기" 둘 다 벌점 대상이 된다는, 단순 개수 셈법보다 정교한 베이즈 면도날 예측을 지지. 자기보고 정당화에서 "유연성"을 직접 언급한 사례는 소수(N=11)라, 명시적 추론인지 암묵적 처리인지는 이 결과만으로 가르기 어려움.
### Zemla, Sloman, Bechlivanidis & Lagnado (2017) — 일상 설명에서는 원인이 많은 설명을 더 좋게 본다 Psychonomic Bulletin & Review, 24(5), 1488–1500. DOI: 10.3758/s13423-017-1258-z
- 설계: 실험 1은 Reddit "Explain Like I'm Five" 게시판 등에서 고른 질문 8개(역사·공중보건·법·사회정책)에 각각 설명 3개, 모두 24개 설명을 MTurk 참가자 235명에게 보여 주고, 설명의 질과 복잡성·일관성·전문성 등 여러 기준을 평정하게 했다. 연구진은 설명마다 인과 그래프를 그려 뿌리 원인(root cause) 수를 셌다. 실험 2(90명)는 질문 6개마다 서로 다른 기제를 내세운 설명 A·B와 둘을 이어 붙인 AB를 만들어, 한 사람이 질문마다 셋 중 하나를 평가하게 했다.
- 결과: 실험 1에서 복잡하다고 평정된 설명일수록 좋은 설명으로 평가됐다(상관 R = .49, p = .03). 뿌리 원인 수도 설명의 질을 예측했고(R = .64, p = .005), 설명이 다루는 결과의 수와 설명 범위를 통제해도 유지됐다(R = .63). 설명 길이도 질과 상관했지만(R = .60), 문장이 잘 짜였는지(articulation)를 함께 넣으면 길이 효과는 사라졌다. 실험 2에서는 여섯 질문 모두에서 AB가 A·B보다 높은 평가를 받았고, 참가자 90명 중 75명이 평균적으로 AB를 더 높게 평가했다(이항검정 p < .001).
- 의미와 한계: 단순성 선호를 보인 Lombrozo 계열 실험과 반대 방향의 결과다. 저자들은 두 결과의 차이를 과제에서 찾는다. 기존 실험은 원인 한두 개 중 하나를 고르게 했고, 이 연구는 완결된 인과 설명 전체를 평가하게 했다. 저자들은 사람들이 결과가 "일어날 수밖에 없었다"고 느낄 만큼 원인을 모으려 한다고 해석했다. 실험 1의 자연 설명은 복잡성 외에도 여러 면에서 달라 상관 결과만으로는 인과를 가르기 어렵다는 점을 저자들도 적었고, 실험 2는 그 보완이다.
### Johnson, Valenti & Keil (2019) — 단순성과 복잡성, 두 휴리스틱이 맞선다 Cognitive Psychology, 113, 101222. DOI: 10.1016/j.cogpsych.2019.05.004
- 설계: 연구 5개. 사람들이 단순한 설명을 사전확률의 단서로, 복잡한 설명을 데이터 적합도의 단서로 쓰는지 검증했다(연구 1). 이어 인과 체계가 결정론적인지 확률적인지(연구 2·3), 물리 체계인지 사회 체계인지(연구 4·5)를 바꿔 어느 쪽 선호가 커지는지 봤다. 초록만 읽었다.
- 결과: 연구 1에서 단순성은 사전확률, 복잡성은 적합도의 단서로 쓰인다는 직접 증거가 나왔다. 단순성 선호는 확률적 맥락보다 결정론적 맥락에서, 사회 체계보다 물리 체계에서 더 강했다. 초록에 표본 수·효과크기는 없다.
- 의미와 한계: 사람의 설명 판단이 단순성 한쪽으로 치우친다는 그림(Lombrozo 2007)과 복잡성 선호(Zemla et al. 2017)를 한 틀로 묶는다. 어떤 맥락에서 어느 휴리스틱이 이기는지가 분석 대상이 된다.
### Domingos (1999) — "훈련 오차가 같으면 단순한 모델이 더 잘 일반화한다"는 통념은 근거가 약하다 Data Mining and Knowledge Discovery, 3(4), 409–425. DOI: 10.1023/A:1009868929893
- 설계: 문헌 검토. 이론적 결과(Schaffer의 일반화 성능 보존 법칙, Wolpert의 no-free-lunch)와 경험적 결과(가지치기 실험, 단일규칙 알고리즘 비교)를 종합.
- 결과: 가지치기(pruning)는 정확도를 높이기도(Mingers 1989) 낮추기도(Schaffer 1993) 함. Holte(1993)의 단일 규칙(1R) 알고리즘은 평균적으로 C4.5보다 5.7% 낮은 정확도 — "단순 모델도 크게 뒤지지 않는다" 정도이지 "더 낫다"는 근거는 아님.
- 의미와 한계: 모델을 세울 때 쓰는 "제1 면도날"(같은 성능이면 단순한 쪽 선호 — 계산 비용·해석 가능성으로 정당)과, 모델 선택 기준으로 쓰는 "제2 면도날"(단순함 자체가 일반화를 보장)을 구분해야 한다고 정리. 검토 논문이라 새 실험 데이터는 없음.
### Forster & Sober (1994) — AIC가 단순성 선호에 예측 정확도라는 경험적 근거를 준다 British Journal for the Philosophy of Science, 45(1), 1–35. DOI: 10.1093/bjps/45.1.1
- 설계: 곡선맞춤(curve-fitting) 문제에 대한 철학적 논증. 새 실험 데이터는 없음(초록만 확인, 원문 전체는 미확인).
- 결과(요지): "데이터가 곡선의 형태를 직접 지시하지 않는다"는 전통적 견해에 맞서, Akaike(1973)의 결과가 "이 모델이 미래 데이터를 얼마나 정확히 예측할지"를 데이터에서 추정할 근거를 제공한다고 논증.
- 의미와 한계: 절약성(parsimony)·통일성(unification) 같은 이론적 미덕을 예측 정확도 추정과 연결해, 면도날에 경험적(비-선험적) 정당화를 제공한 대표 논문. 초록 수준만 확인해 구체적 수치는 없음(철학 논문 성격상 해당 없음).
### Belkin, Hsu, Ma & Mandal (2019) — 모델을 데이터에 완전히 맞출 만큼 키우면 성능이 다시 좋아지는 이중 하강 PNAS, 116(32), 15849–15854. DOI: 10.1073/pnas.1903070116
- 설계: 여러 모델·데이터셋에 걸쳐 모델 용량(자유 매개변수 수)을 점진적으로 늘리며 훈련·시험 오차 곡선을 관찰(초록 기준, 구체적 모델·데이터셋 목록은 원문 미확인).
- 결과: 훈련 데이터를 정확히 보간(interpolate)하는 지점을 지나 용량을 더 키우면, 고전적 편향-분산 U자 곡선과 달리 시험 오차가 다시 낮아지는 이중 하강(double descent) 현상을 폭넓은 모델·데이터셋에서 재현.
- 의미와 한계: 자유 매개변수 수만으로 일반화 성능을 예측하는 고전적 논리(제2 면도날)의 반례. 왜 이런 일이 생기는지의 메커니즘은 논문 자체가 "가설(posit)" 수준으로만 제시. 구체적 오차 수치는 초록에 없어 미확인.
### Valle-Pérez, Camargo & Louis (2018) — 딥러닝의 단순성 편향은 함수 공간에서 작동한다 International Conference on Learning Representations (ICLR 2019) 학회 발표. arXiv:1805.08522 (학회 논문이라 DOI 없음. 게재 정보는 Semantic Scholar·DBLP 색인 conf/iclr/PerezCL19로 확인)
- 설계: 알고리즘 정보이론(AIT)에서 유도한 확률-복잡도 부등식을, 불리언 함수를 흉내 낸 소형 신경망과 CIFAR-10·MNIST에 적용한 대형 완전연결·합성곱 신경망에 적용.
- 결과: 매개변수 공간에서 균등하게 샘플링해도 신경망이 실제로 표현하는 함수는 단순한 함수 쪽에 지수적으로 쏠린다는 것을 이론·실험 양쪽에서 제시하고, 이를 근거로 PAC-베이즈 일반화 오차 상한을 계산.
- 의미와 한계: Belkin et al.(2019)의 이중 하강에 대해, 면도날의 적용 공간을 매개변수 개수에서 함수 공간으로 옮겨야 한다는 재해석을 제시. ICLR 2019 동료심사를 거쳤다.
나머지 문헌(한 줄): Akaike, H. (1974). IEEE Trans. Automatic Control, 19(6), 716–723. DOI: 10.1109/TAC.1974.1100705 — AIC 공식화. Schwarz, G. (1978). Annals of Statistics, 6(2), 461–464. DOI: 10.1214/aos/1176344136 — BIC. Rissanen, J. (1978). Automatica, 14(5), 465–471. DOI: 10.1016/0005-1098(78)90005-5 — 최소 서술 길이(MDL). Myung, I. J. (2000). Journal of Mathematical Psychology, 44(1), 190–204. DOI: 10.1006/jmps.1999.1283 — 적합도만으로 모델을 고르면 해석 불가능할 만큼 복잡한 모델을 택해 과적합하게 됨을 정리한 개념 논문(초록 기준, 수치 없음).
면도날의 "효과"를 합친 메타분석은 성격상 없다. 규범 원칙이라 실증 대상은 사람들의 단순성 선호(심리학)와 모델선택 기준의 예측 성능(통계)으로 갈린다.
비판·한계
재현성
- Lombrozo(2007)의 실험 3은 실험 2의 핵심 결과(단순한 설명에 대한 사전확률 편향)를 경험 빈도 제시라는 다른 형식으로 재현했고, Blanchard et al.(2018)의 실험 2도 실험 1과 다른 시나리오(할로윈 사탕 vs 외계 생물)로 같은 방향의 결과를 반복했다. 다만 두 경우 모두 저자 자신의 논문 내 반복이고, 독립 연구실의 대규모 재현(다기관 재현·Registered Replication Report)은 이번 작업에서 확인하지 못했다.
- 딥러닝의 이중 하강(Belkin et al. 2019)은 이후 여러 모델·데이터셋에서 폭넓게 보고된 현상으로 소개되지만(초록 기준), 개별 재현 논문의 구체적 수치까지는 원문 미확인.
대표 반론
- 찬성(제1 면도날): Forster & Sober(1994)·Akaike(1974)는 AIC를 통해 "단순한 모델이 왜 미래 데이터를 더 정확히 예측할 잠재력이 있는가"에 통계적 근거를 준다.
- 반론(제2 면도날 무효화): Domingos(1999)는 "훈련 오차가 같으면 단순한 쪽이 일반화도 낫다"는 명제가 이론적으로도(Schaffer의 보존 법칙, Wolpert의 no-free-lunch), 경험적으로도(1R 대 C4.5, 가지치기 실험) 일반적으로 성립하지 않는다고 반박한다.
- 응답(함수 공간 재해석): Belkin et al.(2019)의 이중 하강 — 매개변수 수를 늘려도 성능이 다시 좋아지는 현상 — 은 Domingos의 반박을 더 강하게 확인하는 사례로 보인다. 그러나 Valle-Pérez et al.(2018)은 신경망이 실제로 표현하는 함수 공간에서는 단순성 편향이 여전히 작동한다고 재해석해, 논쟁의 초점을 면도날의 타당성에서 적용 공간의 선택으로 옮긴다.
- 심리학 쪽 반론(사람은 복잡한 설명도 선호한다): Lombrozo(2007)는 사람이 단순한 설명에 과도한 사전확률을 준다고 봤다. Zemla et al.(2017)은 일상 설명 24개와 통제된 설명 쌍에서 원인이 많은 설명이 더 좋게 평가된다는 반대 결과를 냈다. Johnson et al.(2019)은 단순성은 사전확률, 복잡성은 적합도의 단서로 함께 쓰이며 맥락이 어느 쪽을 키울지 정한다고 정리했다. 과제 형식(원인 고르기 대 설명 전체 평가)이 결과를 가르는 변수로 보인다.
- 귀속 오류: 대중적으로 오컴의 말로 인용되는 핵심 문구가 실제로는 17세기 정식화다 [Thorburn 1918].
쓰면 안 되는 상황
- 설명력이 비슷하지 않은데 "더 간단하니까"로 증거가 많은 설명을 기각할 때 [Sober 2015].
- 여러 원인이 동시에 작용하는 것이 흔한 영역(만성질환 진단, 복잡계 장애)에서 단일 원인만 찾을 때 — 히컴의 격언이 균형추.
- 모델 선택에서 "훈련 오차가 같다"는 전제 자체가 성립하지 않을 때(제2 면도날의 전제 위반) [Domingos 1999].
- 모델 용량이 보간점을 넘어서는 영역(현대 딥러닝)에서 "매개변수가 적을수록 일반화가 낫다"고 단순 적용할 때 [Belkin et al. 2019].
- "단순"의 정의가 모호할 때: 무엇이 "더 단순한가"는 척도·표현 방식에 따라 달라진다(존재자 수? 매개변수 수? 서술 길이?). AIC·BIC·MDL도 같은 데이터에 서로 다른 모델을 고를 수 있다 [Schwarz 1978] [Rissanen 1978].
- 사람의 과잉 적용: 사람은 확률 증거와 무관하게 단순한 설명을 선호하고, 그 결과 단순한 원인의 빈도를 과대추정한다(1:2 조건 19% vs 8%, t(14.6)=2.18, p<.05) [Lombrozo 2007]. 면도날을 휘두르는 쪽도 편향을 가진다.
관련 모델
- 반증가능성 (Falsifiability, Popper) — 단순 가설일수록 반증이 빠름.
- 제1원리 사고 (First-Principles) — 불필요한 가정을 걷어내는 작업.
- 기저율 무시 (Base-Rate Neglect) — "흔한 원인 먼저"의 통계 근거.
- 결합 오류 (Conjunction Fallacy) — 가정 추가가 확률을 낮춘다는 메커니즘.
- 과적합 (Overfitting) — 복잡성의 통계적 대가.
사고 도구 다른 글