페르미 추정 (Fermi Estimation)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 페르미 어림법 · Fermi Estimation
한 줄 정의
정확한 데이터가 없는 양(量)을, 문제를 알 수 있는 작은 조각으로 분해하고 각 조각을 자릿수(order of magnitude) 수준으로 추정해 곱·나눗셈으로 합쳐 빠르게 근사하는 방법. 물리학자 엔리코 페르미(Enrico Fermi)가 "데이터가 거의 없어도 좋은 근사 계산을 한다"는 평판으로 유명해 그의 이름이 붙었다 [von Baeyer 1988].
일상 한 줄
"전혀 모르겠는데?" 싶은 숫자도, 아는 것부터 쪼개 곱하면 자릿수는 맞출 수 있다. 결정에 필요한 정밀도가 자릿수 수준이면 이걸로 충분하다. 시카고에 피아노 조율사가 몇 명이냐는 질문에 인구·가구·피아노 보유율·조율 빈도만으로 약 150명을 추정하는 것이 표준 예제다 [von Baeyer 1988] (조율사 문제는 페르미에게 전통적으로 귀속되나 1차 기록은 없음).
페르미 본인이 "페르미 추정"이라는 논문을 남긴 적은 없다. 방법은 후대가 그의 이름으로 정리했고, 분해 추정의 정확도는 판단·예측 연구(MacGregor et al. 1988 등)가 따로 실험했다.
흔한 장면
- 시장 규모 짐작: "이 동네에 카페를 열면 손님이 얼마나 올까?" — 유동 인구 × 카페 이용률 × 우리 가게 점유율로 분해.
- 면접·컨설팅 케이스: "서울의 미용실 수는?", "비행기에 골프공 몇 개?" 같은 추정 질문. 면접관은 분해 논리를 본다.
- 업무 견적: "이 기능 개발에 며칠?" — 화면 수 × 화면당 작업 × 버퍼로 쪼개 자릿수부터.
- 건강·재무 감각: "내가 평생 마신 커피값은?", "출퇴근에 1년에 며칠 쓰나?" — 빈도 × 단가 × 기간.
- 뉴스 숫자 검증(스멜 테스트): 보도된 통계가 자릿수부터 말이 되는지 역으로 추정해 본다.
- 연구·실험 설계: 실험을 돌리기 전에 결과의 크기 자릿수를 먼저 가늠해 타당성을 점검 [Weinstein & Adam 2008].
왜 빠지나 (메커니즘)
여기서 "빠지나"는 왜 이 추정이 통하는가의 메커니즘을 다룬다.
- 각 조각은 전체보다 잡기 쉽다 [MacGregor et al. 1988; MacGregor 2001] — "미국 우편물 연간 처리량"은 감이 없어도 "주 수", "주당 우체국 수", "하루 처리량"은 짐작이 된다. 분해가 이기는 이유는 조각마다의 오차가 전체를 한 번에 찍을 때보다 작기 때문이다.
- 오차 일부 상쇄(error cancellation) [von Baeyer 1988; MacGregor 2001] — 항들이 서로 독립으로 과대·과소 빗나가면 곱할 때 일부 상쇄된다. 단계가 많을수록 안정되지는 않는다. 로그로 보면 곱의 오차는 항별 오차의 합이라, 독립이면 오차 폭이 항 수의 제곱근에 비례해 커진다.
- 자릿수 사고(order-of-magnitude) — "정확히 몇" 대신 "10⁵냐 10⁶냐"만 따진다. 교재는 페르미 문제를 "정당화된 추측과 그 상·하한(variance)을 만드는" 훈련으로 소개한다 Weinstein & Adam 2008. 자릿수로만 답하게 하면 추정이 더 안정된다는 것을 직접 잰 실험은 이 카드 문헌에 없다. 분해 실험들이 보인 것은 목표값이 일곱 자리 이상으로 클 때 분해가 오차비를 줄였다는 점이다 [MacGregor & Armstrong 1994].
- 분해(decomposition)·"Fermi-ize" [Tetlock & Gardner 2015, Superforecasting] — 답을 모르는 큰 질문을 아는/모르는 부분으로 쪼개면 무지가 드러나고 가정이 검사 가능해진다. 테틀록은 슈퍼예측가들이 이 방법을 즐겨 쓴다고 보고했다.
- 외부 관점 결합 [Tetlock & Gardner 2015] — 분해된 하위 질문에 기저율(외부 관점)을 먼저 적용하고, 내부 정보로 조심스럽게 조정한다. 페르미 추정과 기저율(base-rate) 사고가 만나는 지점.
빠져나오는 법 (잘 쓰는 법)
1. 질문을 곱셈 사슬로 분해한다. 구하려는 양 = A × B × C … 형태로. (예: 조율사 수 = 피아노 수 × 연 조율 횟수 ÷ 조율사 1인 연 처리량) — 근거: 실험 Armstrong et al. 1975; MacGregor & Armstrong 1994 2. 각 항을 자릿수로만 잡는다. 정확한 값 대신 "대략 10⁴" 식으로. 모르면 상한·하한을 잡고 기하평균(√(상한×하한))을 쓴다. — 근거 수준: 경험칙(카드 제안, 직접 검증 연구 없음) 3. 단위·차원을 맞춘다. 교재는 페르미 문제를 차원 분석(dimensional analysis, 단위가 맞는지로 식을 점검하는 방법) 훈련으로도 쓴다 [Weinstein & Adam 2008]. — 근거 수준: 경험칙(교재 서술·본문 미대조, 직접 검증 연구 없음) 4. 곱한 뒤 자릿수를 점검한다. "factor of 10 안"이면 성공으로 본다(피아노 조율사 추정의 통상 기준) [von Baeyer 1988; NASA GRC]. — 근거 수준: 경험칙(관행 기준, 직접 검증 연구 없음) 5. 실측치와 대조해 보정(calibration)한다. 가능하면 정답을 찾아 어느 항이 빗나갔는지 복기한다. — 근거 수준: 경험칙(카드 제안, 복기 효과를 직접 잰 분해 연구는 이 카드에 없다) 6. 불확실성이 작은 양은 쪼개지 않는다. 이미 자릿수를 아는 양을 억지로 쪼개면 조각 하나의 불확실성이 전체보다 커져 오히려 틀린다. 네 자리 이하 문제 4개 중 3개에서 분해가 더 틀렸고, 일곱 자리 이상 문제 6개 중 5개에서는 분해가 더 맞았다 [MacGregor & Armstrong 1994]. — 근거: 실험 [MacGregor & Armstrong 1994] 7. 여러 사람이 따로 추정해 중앙값을 쓴다. 같은 분해를 여러 사람이 풀면 개인 간 편차가 크지만, 항마다 여러 사람 추정의 중앙값을 넣으면 오차가 더 줄었다 [MacGregor 2001]. — 근거: 실험 요약 MacGregor 2001
함께 쓰기 좋은 도구
- base-rate-neglect — 분해된 하위 항에 기저율을 넣는 것이 추정의 출발점.
- forecast-calibration — 페르미 추정의 결과를 확률·구간으로 표현하고 사후 검증으로 보정.
- first-principles — 데이터 대신 기본 사실에서 쌓아 올린다는 점에서 형제 도구.
- second-order-thinking — 추정값이 결정에 미칠 2차 효과까지 보는 단계.
통념이 무너지는 순간
"데이터가 없으면 추정도 무의미하다"
⚠ 흔한 말: "근거 자료가 없는데 숫자를 어떻게 내. 그건 그냥 찍는 거지." ✓ 학술: 페르미 문제는 데이터가 거의 없는 상태에서 "정당화된 추측과 그 상·하한"을 만드는 훈련으로 정의된다 [Weinstein & Adam 2008]. 찍기와 다른 점은 분해·차원검사·자릿수 논리가 있다는 것. 실험에서도 분해해 추정한 쪽이 한 번에 찍은 쪽보다 정답에 가까웠다. 세 연구를 모은 요약에서 분해 추정의 정확도가 대략 5배 좋았다(정확도 지표는 추정값과 정답의 배수 차이인 오차비) [MacGregor 2001].
"추정이 거칠수록 결과도 엉망일 것이다"
⚠ 흔한 말: "각 단계가 다 어림짐작이면 오차가 눈덩이처럼 불어나겠지." ✓ 학술: 항 수가 늘면 오차 폭도 커진다. 그래도 분해가 이기는 경우가 많은 이유는 각 항을 전체보다 훨씬 정확히 잡을 수 있고, 독립인 과대·과소 오차가 일부 상쇄(error cancellation) 되기 때문이다 [von Baeyer 1988; MacGregor 2001]. MacGregor, Lichtenstein & Slovic(1988)의 고불확실성 문제 6개를 다시 분석하니 한 번에 찍은 추정의 오차비는 99.3, 분해 추정은 3.0이었다 [MacGregor & Armstrong 1994]. 반대로 자릿수를 이미 아는 쉬운 문제에서는 분해가 정확도를 떨어뜨렸다 [MacGregor 2001].
### "정밀한 계산이 항상 더 낫다" ⚠ 흔한 말: "이왕 할 거면 정확히 계산해야지, 대충 하면 프로답지 못하다." ✓ 학술: 페르미의 트리니티 실험 일화 — 폭발 후 종잇조각을 떨어뜨려 약 2.5m 밀린 것을 보고 폭발력을 약 10킬로톤으로 즉석 추정했다. 당시 방사화학 추정은 약 21킬로톤, 2021년 재평가는 24.8±2킬로톤으로 같은 자릿수다(10킬로톤은 재평가값의 약 40%) [Fermi 1945 트리니티 메모; Katz 2021; Selby et al. 2021]. 빠른 자릿수 추정이 결정·검산에 충분할 때가 많다.
### "이건 물리학자나 면접용 트릭이지 일상엔 안 쓴다" ⚠ 흔한 말: "피아노 조율사 문제 같은 건 퀴즈일 뿐." ✓ 학술: 테틀록은 굿 저지먼트 프로젝트의 슈퍼예측가들이 실제 지정학·경제 질문을 "Fermi-ize"(분해 추정) 한다고 보고했다 [Tetlock & Gardner 2015, Superforecasting]. 판단·예측 연구에서도 분해는 수량 추정을 돕는 원칙으로 정리됐다 [MacGregor 2001].
1차 출처
- von Baeyer, H. C. (1988). "How Fermi Would Have Fixed It." The Sciences, 28(5), 2-4. DOI: 10.1002/j.2326-1951.1988.tb03037.x. (후에 "The Fermi Solution"으로 개제, 1993년 에세이집 The Fermi Solution: Essays on Science에 수록; Dover 재간 ISBN 0486417077). 시카고 피아노 조율사 문제를 대중화한 표준 에세이. — 서지·DOI 확인. 본문은 대조하지 못함.
- Weinstein, L., & Adam, J. A. (2008). Guesstimation: Solving the World's Problems on the Back of a Cocktail Napkin. Princeton University Press. ISBN 978-0-691-12949-5. — 페르미 추정(분해·자릿수·상하한)을 다룬 표준 교재. 서지 확인. 본문은 대조하지 못함.
- 트리니티 일화 (1차): Enrico Fermi, "My Observations During the Explosion at Trinity on July 16, 1945" — 페르미 본인의 Manhattan Project 관찰 메모. 전문 공개: atomicarchive.com. 폭풍파 도달 시 종잇조각 변위(약 2.5m)로 폭발력을 약 1만 톤(10kt)으로 즉석 추정. 2차 분석: Katz, J. I. (2021). Fermi at Trinity. Nuclear Technology, 207(sup1), S326-S334. DOI 10.1080/00295450.2021.1927627 (arXiv 2103.05784). 위력 재평가: Selby, H. D., Hanson, S. K., Meininger, D., Oldham, W. J., et al. (2021). A new yield assessment for the Trinity nuclear test, 75 years later. Nuclear Technology, 207(sup1), 321-325. DOI 10.1080/00295450.2021.1932176 — 24.8 ± 2 kt(종전 DOE 공표값 21 kt).
- Tetlock, P. E., & Gardner, D. (2015). Superforecasting: The Art and Science of Prediction. Crown. ("Fermi-ize"/분해 추정과 예측).
- 참고(2차): NASA GRC "Fermi's Piano Tuner Problem". 조율사 worked example 교차 참고용(1차 아님). 조율사 문제는 페르미에게 전통적으로 귀속될 뿐 페르미가 직접 출제했다는 1차 기록은 없다.
원문 핵심 인용
"About 40 seconds after the explosion the air blast reached me. I tried to estimate its strength by dropping from about six feet small pieces of paper before, during and after the passage of the blast wave." "The shift was about 2½ meters, which, at the time, I estimated to correspond to the blast that would be produced by ten thousand tons of T.N.T." — Enrico Fermi, "My Observations During the Explosion at Trinity on July 16, 1945" (atomicarchive.com 전문과 대조, 2026-09) 정의·기법의 표준 출처(von Baeyer 1988·Guesstimation 2008) 본문은 대조하지 못했다 → confidence B.
핵심 정의·메커니즘
원전 정의
페르미 본인이 방법을 정의한 글은 없다. 교재는 페르미 문제를 데이터가 거의 없는 양을 분해·자릿수 추정·차원 분석으로 근사해 "정당화된 추측과 그 상·하한"을 내는 훈련으로 정리한다 [Weinstein & Adam 2008]. 판단 연구에서는 같은 절차를 분해(decomposition)라고 부른다. 1975년 첫 실험은 "문제를 하위 문제로 쪼개 각각 답을 구한 뒤 결합한다"는 과학적 방법의 기본 원리를 수량 추정에 옮겼다 [Armstrong et al. 1975]. MacGregor(2001)는 이를 "추정 과제를 더 쉽게 추정할 수 있는 구성 요소로 나누고, 그 추정값을 결합해 목표값을 얻는 방법"으로 정의하고, 곱으로 잇는 곱셈 분해와 덧셈으로 나누는 분할(segmentation)을 구분했다.
| 항목 | 내용 | |---|---| | 목표 정밀도 | 자릿수(order of magnitude). 통상 기준: 정답의 10배 이내면 성공 [von Baeyer 1988] | | 핵심 기법 | (1) 곱셈 사슬 분해 (2) 항별 자릿수·상하한 (3) 차원·단위 검사 (4) 오차 상쇄 활용 | | 산출물 | 점추정 + 합리적 구간. 슈퍼예측에선 확률로 바꿔 보정 [Tetlock & Gardner 2015] |
시카고 피아노 조율사 풀이 [von Baeyer 1988; NASA GRC]: 인구 약 300만 명 → 가구당 4명이면 약 75만 가구 → 5가구 중 1가구가 피아노 보유면 약 15만 대 → 1대당 연 1회 조율이면 연 15만 회 → 조율사 1인은 하루 4대 × 주 5일 × 연 50주 ≈ 연 1,000대 → 15만 ÷ 1,000 = 약 150명. 이 풀이가 보여 주는 것은 분해 논리와 자릿수다(시카고의 실제 조율사 수와 비교한 1차 자료는 이 카드에 없다).
작동 기제
1. 전체를 한 번에 찍으면 큰 수에서 크게 빗나간다. 사람들은 수백만 단위 이상의 수를 다루기 어려워하고, 감이 없으면 "그럴듯한" 작은 수를 고르는 경향이 있다 [MacGregor & Armstrong 1994]. 1975년 실험의 담배 생산량 문제에서 한 번에 추정한 답의 64%가 정답과 10배 이상 차이 났다 [Armstrong et al. 1975]. 2. 조각은 전체보다 잘 안다. 분해는 "주의 수"·"우체국 하루 처리량"처럼 더 확신할 수 있는 하위 값으로 바꿔 묻는다. MacGregor 등(1988)의 구성 요소 추정 22개 중 21개가 목표값의 한 번에 추정보다 정확했다 [MacGregor 2001]. 3. 곱하면서 오차가 일부 상쇄된다. Q = A×B×C 이면 log Q = log A + log B + log C 이고, 항별 로그 오차가 서로 독립이면 전체 오차는 √(Σσᵢ²)로 자란다. 과대·과소가 섞이면 상쇄된다. 두 항이 같은 방향으로 20%씩 틀리면 결과는 44% 틀린다(1.2×1.2 = 1.44) [MacGregor & Armstrong 1994]. 4. 따라서 분해는 "조각의 오차 < 전체의 오차"이고 오차끼리 독립일 때만 이긴다. MacGregor와 Armstrong(1994)은 이 두 조건과 "목표값이 추정하기 어려울 것"을 분해가 통하는 세 조건으로 명시했다. 확률 분해를 수식으로 분석한 Ravinder 등(1988)도 같은 결론을 냈다. 구성 요소의 무작위 오차가 직접 추정과 같을 때 최선이면 오차가 30% 이상 줄지만, 조건이 나쁘면 오히려 커진다. 구성 요소 오차가 직접 추정보다 50% 크면 조건 사건 2개로는 개선이 불가능했다.
언제 강해지고 언제 약해지나
- 목표값의 크기와 불확실성: 일곱 자리 이상이고 사람마다 답이 크게 갈리는 문제에서 분해 이득이 컸다. 1994년 실험의 극단값 문제 6개 중 5개에서 분해가 더 정확했고(오차 감소 4.10~91.47배), 중앙값으로는 약 20배(19.78) 개선됐다. 네 자리 이하 문제 4개 중 3개에서는 분해가 더 틀렸고, 오차 중앙값이 458% 커졌다 [MacGregor & Armstrong 1994].
- 조각이 정말 더 쉬운가: 아르헨티나 이민자 수 문제는 조각마다 불확실성이 목표값만큼 컸다. 분해 오차비 46.77로, 한 번에 추정(4.89)보다 약 10배 나빴다 [MacGregor & Armstrong 1994].
- 오차의 상관: 조건부 추정마다 같은 출발값(직접 추정값)에 닻을 내리고 조정하면 오차끼리 양의 상관이 생겨 분해 효과가 줄었다 [Ravinder et al. 1988].
- 누가 분해를 만드나: 효과를 확인한 실험은 대부분 연구자가 만든 분해를 줬다. 대학생들은 간단한 안내와 예시만으로는 스스로 분해를 잘 만들지 못했고, 글로 된 지도를 받은 뒤에는 13.5%만 의미 있는 분해를 못 만들었다 [MacGregor 2001].
- 여러 사람: 같은 분해를 여러 사람이 풀면 개인 편차가 컸다. 항마다 여러 사람 추정의 중앙값을 넣는 방식은 고불확실성 6문제에서 오차비를 2.98 → 2.78, 담배 소비량 문제에서 2.0 → 1.19로 낮췄다 [MacGregor 2001].
- 점추정 대 확률 분포: 확률 분포를 분해로 매긴 연구는 개선 없음(Henrion 등 1993)과 보정 개선(Hora 등 1993)이 섞여 있다 [MacGregor 2001].
어떻게 재나
- 알마낙형 질문 비교 실험: 정답이 연감에 있는 양("1970년 미국 가구 수", "1969년 미국 담배 생산량 파운드")을 두고, 참가자를 무작위로 나눠 한쪽은 한 번에 추정하게 하고 다른 쪽은 "인구는? 흡연자 비율은? 1인당 하루 개비는?" 식의 분해 질문지를 풀게 한다 [Armstrong et al. 1975].
- 오차비(error ratio): 추정값과 정답 중 큰 쪽을 작은 쪽으로 나눈 값(항상 1 이상). 정답 10에 2와 50을 답하면 둘 다 5다. 문제마다 크기가 달라도 비교할 수 있고, 과대·과소 추정에 똑같이 벌점을 준다 [Armstrong et al. 1975]. 문제별 중앙값이나 기하평균으로 요약한다 [MacGregor & Armstrong 1994].
- 불확실성 측정: 참가자 추정의 사분위 범위(로그 단위)와 자릿수. MacGregor 등(1988)의 16문제에서 정답 자릿수와 사분위 범위의 상관은 약 +0.75였다 [MacGregor & Armstrong 1994].
헷갈리는 개념과의 차이
- 봉투 뒷면 계산·차원 분석: 봉투 뒷면 계산은 손으로 하는 빠른 어림 계산 전반을 가리킨다. 차원 분석은 단위가 맞는지 확인하는 검산 도구다. 페르미 추정은 곱셈 분해로 모르는 양을 만들어 내는 절차이고, 차원 분석을 그 안의 점검 단계로 쓴다 [Weinstein & Adam 2008].
- 기저율 기반 외부 관점: 외부 관점은 비슷한 사례 집단의 실제 분포(기저율)에서 출발한다. 페르미 추정은 대상의 구조를 조각으로 나눠 안에서 쌓는다. 테틀록은 둘을 함께 쓰라고 권한다. 하위 질문마다 기저율을 먼저 넣고 내부 정보로 조정한다 [Tetlock & Gardner 2015].
- 앵커링(anchoring): 앵커링은 주어진 출발값에서 충분히 조정하지 못하는 편향이다 [Tversky & Kahneman 1974]. 페르미 추정을 망치는 요인이다. 첫 항이나 직접 추정값에 모든 항이 끌려가면 오차가 같은 방향으로 쌓여 상쇄가 일어나지 않는다 [Ravinder et al. 1988].
주요 후속 연구·메타분석
분해 추정 연구에는 공식 메타분석이 없다. 세 실험을 한데 모은 MacGregor(2001)의 요약이 그 역할을 한다. 대규모 다기관 재현은 찾지 못했다.
### Armstrong, Denniston & Gordon (1975) — 분해 원리를 수량 추정에 적용한 첫 실험 Organizational Behavior and Human Performance, 14(2), 257-263. DOI: 10.1016/0030-5073(75)90028-8
- 설계: 와튼 스쿨 학부·대학원생 151명을 수업마다 무작위로 둘로 나눠, 한쪽은 한 번에 추정하고 다른 쪽은 분해 질문지를 풀게 했다. 문제 5개(가구 수·고교 중퇴자 수·폴라로이드 필름 소비·담배 생산량·엽서 응모 수), 세 집단에서 지시문·보상·문항 순서를 바꿔 가며 반복했다.
- 결과: 13개 비교 중 분해가 못한 것은 1개, 9개는 분해가 유의하게 더 정확했다(중앙값 검정, .05). 담배 문제에서 10배 이상 빗나간 답은 한 번에 추정 64%, 분해 20%. 보상 유무는 정확도에 영향이 없었다.
- 의미와 한계: 가장 어려운 문제에서 이득이 컸다는 관찰이 이후 "불확실성이 높을 때만" 조건의 출발점이 됐다. 분해는 연구자가 만들어 줬다. 저자들이 나중에 밝힌 대로, 이 논문 초판은 엽서 수 6,650만을 66.5 billion으로 잘못 적었고 아무도 지적하지 않았다 [MacGregor & Armstrong 1994].
### MacGregor & Armstrong (1994) — 분해는 언제 통하나 International Journal of Forecasting, 10(4), 495-506. DOI: 10.1016/0169-2070(94)90018-3
- 설계: 앞선 두 연구를 다시 분석하고, 오리건 대학 신문 광고로 모은 280명에게 문제 10개(네 자리 이하 4개, 일곱 자리 이상 6개)를 한 번에 또는 분해로 추정하게 했다. 추정 1,078개.
- 결과: 재분석에서 극단·고불확실 문제 9개는 분해가 오차를 평균 68.3배 줄였고, 나머지 6개에서는 효과가 없었다. 새 실험에서 극단값 문제 오차 중앙값은 약 20배(19.78) 줄었고(p < .001), 네 자리 이하 문제는 458% 늘었다(p < .05).
- 의미와 한계: "분해는 안전한 전략"이라는 통념을 경계 조건으로 바꿨다. 실무 지침으로 "상위 사분위 기하평균이 일곱 자리 이상이면 분해를 고려하고, 구성 요소의 범위가 전체보다 좁을 때만 분해하라"를 제시했다. 저자들은 문제끼리 독립이 아니어서 유의성이 과대평가됐다고 밝혔다.
### MacGregor (2001) — 분해 원리 종합 Principles of Forecasting (J. S. Armstrong 편), 107-123. Springer. DOI: 10.1007/978-0-306-47630-36
- 설계: 곱셈 분해 실험 세 편(Armstrong 등 1975, MacGregor 등 1988, MacGregor & Armstrong 1994)의 문제별 오차비 중앙값을 모아 비교하고, 분할·확률 분포 분해·여러 추정자 연구를 원칙별로 평가한 문헌 종합.
- 결과: 알마낙형 문제 전반에서 분해로 정확도가 약 5배 좋아졌다. 극단값 문제에서는 12~15배 이상, 일부는 100배 가까이 개선됐고, 네 자리 이하 문제에서는 대체로 나빠졌다. 담배 소비량 문제 하나에서 개인 오차비 중앙값은 393.3(한 번에) → 8.86(분해)였고, 두 분포는 상당히 겹쳤다.
- 의미와 한계: 저자 스스로 "어떤 문제를 어떤 형태로 분해할지 정하는 이론이 없다"고 적었다. 증거는 거의 전부 연구자가 만든 분해에서 나왔고, 중간 불확실성 구간의 효과는 모른다.
### Ravinder, Kleinmuntz & Dyer (1988) — 분해가 오차를 줄이는 수학적 조건 Management Science, 34(2), 186-199. DOI: 10.1287/mnsc.34.2.186
- 설계: 심리측정 모형(관측값 = 참값 + 무작위 오차)으로 조건부 확률 분해 추정의 오차 분산을 식으로 구하고, 직접 추정과 비교했다. 실험 자료 없이 해석적으로 분석했다.
- 결과: 구성 요소 오차가 직접 추정과 같을 때 최선이면 30% 이상 감소, 최악이면 큰 증가. 조건 사건 4개 예시에서 이상적 배치면 44% 감소, 사건 확률을 한쪽에 몰면 24%, 조건부 확률 하나를 0.45 바꾸면 4%로 줄었다. 구성 요소 오차가 50% 크면 사건 2개로는 개선 불가. 조건부 오차에 양의 상관이 있으면(같은 닻에서 조정) 이득이 깎였다.
- 의미와 한계: "잘게 쪼갤수록 좋다"를 반박한다. 조각이 너무 적어도 많아도 손해이고, 정확히 알 수 있는 조각을 고르는 것이 핵심이다. 분석 대상은 조건부 확률로 나누는 확률 분해이고 곱셈 분해는 다루지 않았다. 또 무작위 오차만 다루며 체계적 편향은 다루지 않는다. (MIT 워킹페이퍼 판 전문과 학술지 초록을 읽었다.)
### Segura & Ferrando (2023) — 페르미 문제를 푸는 유연성 Educational Studies in Mathematics, 113(2), 207-227. DOI: 10.1007/s10649-023-10220-5
- 설계: 예비 교사 224명이 페르미 문제 여러 개를 풀 때 저지른 오류를 분석해 수행 수준을 나누고, 문제마다 다른 풀이 방식을 쓰는 유연성 수준과의 관계를 봤다.
- 결과: 유연성 수준과 오류의 수·심각도 사이에 유의한 관계가 있었다(초록에 효과크기는 없다).
- 의미와 한계: 교육 연구 쪽에서 "상황을 어떤 모델로 구조화하느냐"가 병목이라는 앞선 관찰 [Albarracín & Gorgorió 2014]을 이어 받는다. 정확도 대신 오류 유형을 봤다.
- 그 밖의 문헌
- MacGregor, D. G., Lichtenstein, S., & Slovic, P. (1988). Structuring knowledge retrieval: An analysis of decomposed quantitative judgments. Organizational Behavior and Human Decision Processes, 42(3), 303-323. https://doi.org/10.1016/0749-5978(88)90003-9 — 16문제 분해 실험. 고불확실 6문제 재분석 오차비 99.3 → 3.0 [MacGregor & Armstrong 1994 재분석].
- Albarracín, L., & Gorgorió, N. (2014). Devising a plan to solve Fermi problems involving large numbers. Educational Studies in Mathematics, 86(1), 79-96. https://doi.org/10.1007/s10649-013-9528-9 — 학생들의 풀이 계획 분석. 현실을 곱셈 구조로 모델링하는 단계가 병목.
- Ärlebäck, J. B., & Albarracín, L. (2019). The use and potential of Fermi problems in the STEM disciplines to support the development of twenty-first century competencies. ZDM, 51(6), 979-990. https://doi.org/10.1007/s11858-019-01075-3 — STEM 교과별 페르미 문제 활용 문헌 검토. 모델링과 양 추정 학습의 매개로 정리.
- Kalyan, A., Kumar, A., Chandrasekaran, A., Sabharwal, A., & Clark, P. (2021). How much coffee was consumed during EMNLP 2019? Fermi problems: A new reasoning challenge for AI. Proceedings of EMNLP 2021, 7318-7328. https://doi.org/10.18653/v1/2021.emnlp-main.582 — 실제 페르미 문제 1천 개 자료집. 미세조정한 대형 언어모델도 평균 두 자릿수(100배) 가량 빗나갔다.
- Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124-1131. https://doi.org/10.1126/science.185.4157.1124 — 출발값에서의 조정(앵커링) 휴리스틱.
- 예측 연구: Good Judgment Project에서 분해(Fermi-ize)를 슈퍼예측가의 습관으로 기술 [Tetlock & Gardner 2015]. 예측 대회에서 분해 효과를 따로 검증한 학술지 연구는 찾지 못했다.
비판·한계
재현성
- 핵심 결과(분해 이득은 고불확실 문제에 한정)는 세 연구에서 같은 방향으로 나왔다. 서로 다른 참가자 집단(와튼 학생, 오리건 지역 모집)과 문제 세트였다 [Armstrong et al. 1975; MacGregor & Armstrong 1994].
- 다른 연구팀이 확률 분해를 측정 모형으로 분석한 결과도 방향이 같았다. 구성 요소의 오차가 작고 서로 독립일 때만 분해가 오차를 줄였다 [Ravinder et al. 1988]. 이 분석은 수식 모형이고 수량 추정 실험은 아니다.
- 다만 실험 세 편은 모두 한두 연구팀(Armstrong·MacGregor)에서 나왔고, 사전 등록된 대규모 재현은 없다. 여러 추정자·확장 분해의 이득은 문제 하나(우편물·담배)에서 확인됐을 뿐이다 [MacGregor 2001].
대표 반론
- "분해는 안전하다"에 대한 반론: 초기 연구는 분해가 정확도를 떨어뜨릴 일이 거의 없다고 봤다 [Armstrong et al. 1975]. 같은 저자들이 자릿수가 작은 문제에서는 분해가 오히려 해롭다는 결과를 냈다 [MacGregor & Armstrong 1994]. 원 주장은 "불확실성이 높을 때" 조건을 붙이는 쪽으로 수정됐다.
- 오차 상쇄 가정: 곱셈 분해는 오차가 독립이라는 가정 위에 서 있다. 같은 사람이 모든 항을 추정하면 같은 닻에서 조정해 오차가 양의 상관을 갖기 쉽다 [Ravinder et al. 1988]. 곱셈 분해는 상관된 오차에 특히 민감하다 [MacGregor 2001].
- 분해 형식의 임의성: 같은 문제도 여러 방식으로 쪼갤 수 있고, 어떤 분해가 나은지 고르는 이론이 없다 [MacGregor 2001]. 분할(덧셈 분해)은 모델 기반 예측에서는 도움이 됐지만 판단 예측에서는 일관된 이득이 없었다 [MacGregor 2001].
쓰면 안 되는 상황
- 자릿수를 이미 아는 양: 네 자리 이하·익숙한 수는 한 번에 답하는 쪽이 더 정확했다 [MacGregor & Armstrong 1994].
- 조각이 전체보다 더 모호할 때: 구성 요소의 불확실성이 목표값만큼 크면 분해가 오차를 키운다 [MacGregor & Armstrong 1994; Ravinder et al. 1988].
- ±2배가 치명적인 결정: 가격 책정·안전 마진처럼 자릿수 정밀도로 부족한 결정. 분해 추정도 오차비 3 안팎이 흔했다 [MacGregor & Armstrong 1994].
- 확률 구간이 필요할 때: 분해가 확률 분포의 보정을 좋게 한다는 증거는 섞여 있다 [MacGregor 2001]. 깔끔한 숫자가 나오면 불확실성을 잊기 쉬우니 예측 보정(forecast-calibration)과 함께 쓴다.
관련 모델
- base-rate-neglect (기저율 무시) — 하위 항 추정에 기저율을 넣어야 함
- forecast-calibration (예측 보정) — 추정을 확률·구간으로 만들고 사후 검증
- first-principles (제1원리 사고) — 데이터 대신 기본 사실에서 쌓기
- anchoring (앵커링) — 첫 추정치에 닻 내리는 편향, 페르미 추정 시 주의점
사고 도구 다른 글