반증 가능성 (Falsifiability)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: falsifiable · 반증주의 · 포퍼의 반증가능성 · Falsifiability
한 줄 정의
어떤 주장이 과학적이려면 "이런 결과가 나오면 이 주장은 틀린 것"이라고 말할 수 있어야 한다. 어떤 결과로도 반박될 수 없는 주장은 세상에 대해 아무것도 말하지 않는다 [Popper 1963].
일상 한 줄
"무슨 일이 일어나도 다 맞는 말"은 똑똑해 보이지만 사실 아무것도 말하지 않는다. 좋은 주장은 자기가 틀릴 수 있는 조건을 스스로 내건다. 그 조건이 없으면 점쟁이의 화법이다 [Popper 1963].
흔한 장면
- "거봐, 내 말이 맞지"의 무한 적용: 결과가 어떻게 나오든 자기 이론의 증거로 흡수한다. 오르면 "예측대로", 내려도 "조정 국면이라 예측대로". 어떤 데이터도 틀렸다는 신호가 되지 못한다.
- 점성술·운세: "당신은 신중하지만 때로는 과감합니다." 누구에게나, 어떤 상황에서도 맞는 말이라 틀릴 수가 없다. 누구에게나 들어맞는 성격 묘사를 자기 얘기로 믿는 현상은 Forer (1949) 가 교실 실험으로 보였다(바넘 효과). Popper 는 점성술이 예측을 흐리게 만들어 시험을 피한다고 비판했다 [Popper 1963].
- 음모론: 증거가 없는 것이 곧 "은폐가 그만큼 철저하다"는 증거가 된다. 반증을 시도할수록 음모의 크기만 커진다.
- 사이비·유사의학: "효과가 없었다면 믿음이 부족했기 때문." 실패가 항상 환자 탓으로 돌아가, 치료법 자체는 결코 반박되지 않는다.
- 사후 합리화: 일이 벌어진 뒤에야 "그럴 줄 알았다"고 한다. 사전에 어떤 결과를 배제했는지 말한 적이 없다.
- 빠져나갈 구멍을 미리 만든 예언: "올해 안에 큰 변화가 있을 것"처럼 충분히 모호하면 거의 실패할 수 없다 [Popper 1963].
왜 빠지나 (메커니즘)
- 확증은 너무 쉽다 [Popper 1963] — "It is easy to obtain confirmations, or verifications, for nearly every theory—if we look for confirmations." 우리는 맞는 사례를 찾는 데 능숙하고, 그래서 거의 모든 이론이 "증거가 많아" 보인다. 확증의 양은 진리의 신호가 아니다.
- 모든 것을 설명하는 이론의 매력 [Popper 1963] — Freud·Adler의 정신분석은 "simply non-testable, irrefutable. There was no conceivable human behaviour which could contradict them." 어떤 행동이든 설명해 내는 능력이 강점처럼 보이지만, Popper는 "this apparent strength was in fact their weakness"라고 썼다. 다 설명하는 이론은 과학적으로는 아무것도 말하지 않는다.
- 임시방편(ad hoc) 가정으로 반증 회피 [Popper 1959] — 예측이 빗나가면 이론을 버리는 대신 임시방편 가정을 덧붙여 빠져나간다. Popper는 이렇게 이론을 구제하는 행위가 그 이론의 과학적 지위를 떨어뜨린다고 봤다.
- 모호함이 반박을 막는다 [Popper 1963] — "It is a typical soothsayer's trick to predict things so vaguely that the predictions can hardly fail: that they become irrefutable." 예측을 충분히 흐리게 하면 실패할 수가 없고, 그 대가로 내용도 사라진다.
- 사람은 원래 맞는 사례부터 찾는다 [Wason 1960] — 숫자 규칙 맞히기 과제에서 29명 중 처음부터 정답에 이른 사람은 6명뿐이었다. 틀린 결론을 두 번 이상 낸 사람들은 자기 가설을 시험하지 못했거나 시험하려 하지 않았다. 다만 이 습관(가설에 맞을 것 같은 사례부터 시험하기)이 늘 틀리지는 않는다. 2-4-6 과제는 이 습관으로는 반증이 나올 수 없게 짜인 과제였고, 드문 현상을 다루는 많은 현실 조건에서는 같은 습관이 반증을 더 잘 찾는다는 분석이 있다 [Klayman & Ha 1987].
빠져나오는 법
1. "무엇이 관찰되면 내가 틀린 것인가"를 먼저 적는다. 답이 "어떤 것도 아니다"라면 그 말은 검증할 수 있는 주장이 못 되고 신념으로 남는다 [Popper 1963: irrefutability is a vice]. — 근거 수준: 철학적 기준(Popper 1963), 이 습관의 효과를 잰 실험은 없음 2. 위험한 예측을 한다 [Popper 1963]. Popper는 좋은 검증이란 곧 반증 시도라고 봤다 — "Every genuine test of a theory is an attempt to falsify it, or to refute it." 빗나가면 명백히 드러나는, 구체적이고 좁은 예측을 하라. — 근거 수준: 철학적 기준(Popper 1963), 직접 검증 연구 없음 3. 결과를 보기 전에 기준을 적어 둔다. 연구에서는 이를 사전등록(preregistration)이라 한다. 결과를 본 뒤에 기준을 정하면 사후 설명이 예측처럼 보이게 된다 [Nosek et al. 2018]. 첫 가설이 지지된 비율은 일반 논문 96%, 결과 전에 게재를 정한 등록 보고서 44%였다 [Scheel et al. 2021]. — 근거: 관찰 비교 연구 [Scheel et al. 2021] 4. 확증 사냥을 멈추고 반례를 찾는다. 내 주장을 깰 데이터를 의도적으로 찾아본다. 못 깨고 살아남았을 때만 그 확증이 의미를 가진다. 단, "반례를 찾아라"는 다짐만으로는 부족하다. 2-4-6 과제에서 반증 지시는 규칙 발견을 개선하지 못했고, 매 단계 여러 가설을 세우게 하자 수행이 오히려 나빠졌다. 수행이 크게 오른 것은 과제를 서로 맞물린 두 규칙(DAX·MED)을 찾는 형태로 바꿨을 때다 [Tweney et al. 1980]. 일상에 옮기면 "내 가설에 맞지 않는 사례들은 어떤 규칙을 따르는가"에 이름을 붙여 두고 그 규칙도 함께 시험하는 방식이다(이 옮김은 카드 제안). — 근거: 실험 [Tweney et al. 1980], 일상 적용은 경험칙 5. 모호어를 수치·기한·조건으로 바꾼다. "큰 변화" → "6개월 내 매출 20% 이상 하락"처럼, 틀릴 수 있게 좁힌다. — 근거 수준: 경험칙(직접 검증 연구 없음)
함께 쓰기 좋은 도구
- 인식론적 경계심 (epistemic-vigilance) — 정보의 출처와 반박 가능성을 함께 의심하는 습관. 반증 가능성은 그 판단의 핵심 잣대.
- 제1원리 사고 (first-principles) — 주장을 검증 가능한 기본 전제로 분해. 반증 가능한 단위까지 쪼갠다.
- 허위정보 면역 (misinformation-inoculation) — 음모론·사이비의 "반박 불가" 구조를 미리 노출해 면역시키는 기법.
통념이 무너지는 순간
"어떤 일이 일어나도 다 들어맞는 이론이 강한 이론이다"
⚠ 흔한 말: "이 이론은 뭐든 설명할 수 있어서 대단해." ✓ 학술: Popper는 정반대로 봤다. "A theory which is not refutable by any conceivable event is non-scientific. Irrefutability is not a virtue of a theory (as people often think) but a vice." 반박할 수 없다는 성질을 그는 결함으로 쳤다 [Popper 1963].
"증거(확증)가 많을수록 맞는 이론이다"
⚠ 흔한 말: "맞는 사례가 이렇게 많은데 어떻게 틀리겠어." ✓ 학술: "It is easy to obtain confirmations ... for nearly every theory—if we look for confirmations." 확증은 거의 모든 이론에서 쉽게 모을 수 있다 [Popper 1963]. 확증이 의미를 가지려면 이론을 반증하려는 진지한 시도 끝에 살아남은 것이어야 한다.
"점성술도 맞는 경우가 있으니 과학과 다를 바 없다"
⚠ 흔한 말: "운세도 가끔 맞잖아. 결국 다 비슷한 거 아냐?" ✓ 학술: Popper의 경계 기준(demarcation, 과학과 비과학을 가르는 선)은 "틀릴 수 있느냐"를 묻는다. 점성술은 예측을 흐리게 만들어 "In order to escape falsification they destroyed the testability of their theory" [Popper 1963]. Popper 의 기준으로는 반증 가능성의 유무가 과학과 사이비를 가른다. 다만 과학철학에서는 단일 경계 기준만으로 둘을 가를 수 없다는 반론도 있다 [Laudan 1983].
### "반증주의는 검증주의(verification)와 같은 말이다" ⚠ 흔한 말: "결국 둘 다 사실 확인하자는 거 아니야?" ✓ 학술: Popper의 핵심 전환은 둘을 명확히 가른 데 있다 — "not the verifiability but the falsifiability of a system is to be taken as a criterion of demarcation" [Popper 1959]. 아무리 많이 확인해도 보편 명제는 증명되지 않지만, 단 하나의 반례로 반박될 수는 있다는 논리적 비대칭이 출발점이다.
1차 출처
- Popper, K. R. (1959). The Logic of Scientific Discovery. London: Hutchinson. (독일어 원본 Logik der Forschung, Wien: Springer. 1934년 말 출간, 판권면 연도 1935년. 1959년판은 저자 자신의 영어 번역 증보판) — demarcation 기준으로서의 falsifiability를 정식화.
- Popper, K. R. (1963). Conjectures and Refutations: The Growth of Scientific Knowledge. London: Routledge & Kegan Paul. 1장 "Science: Conjectures and Refutations" (pp. 33-39, 원래 1953년 강연) — astrology·Marxism·정신분석을 사례로 반증 가능성 기준을 대중적으로 제시.
- Forer, B. R. (1949). The fallacy of personal validation: A classroom demonstration of gullibility. Journal of Abnormal and Social Psychology, 44(1), 118-123. https://doi.org/10.1037/h0059240 — 누구에게나 맞는 성격 묘사 실험(흔한 장면의 운세 예시 근거).
- Wason, P. C. (1960). On the failure to eliminate hypotheses in a conceptual task. Quarterly Journal of Experimental Psychology, 12(3), 129-140. https://doi.org/10.1080/17470216008416717 — 사람이 반증 대신 확증을 찾는 경향을 보인 2-4-6 과제.
Popper 인용은 Conjectures and Refutations 1장의 OA 발췌본("Science as Falsification")과 대조했다.
원문 핵심 인용
"The criterion of the scientific status of a theory is its falsifiability, or refutability, or testability." — Popper (1963), Conjectures and Refutations, ch. 1 "A theory which is not refutable by any conceivable event is non-scientific. Irrefutability is not a virtue of a theory (as people often think) but a vice." — 같은 곳 "In order to escape falsification they [astrologers] destroyed the testability of their theory." — 같은 곳 (astrology 사례) "Every genuine test of a theory is an attempt to falsify it, or to refute it." — 같은 곳 "Not the verifiability but the falsifiability of a system is to be taken as a criterion of demarcation." — Popper (1959), The Logic of Scientific Discovery, §6 (원문 대조 못 함 — 2차 출처 기반) 대조: 2026-09, Conjectures and Refutations 1장 OA 발췌본("Science as Falsification", 1963)과 앞의 네 인용을 글자 단위로 대조.
핵심 정의·메커니즘
원전 정의
경험 과학의 체계는 경험적 시험으로 반박될 수 있는 논리 형식을 가져야 한다(Popper 1959, §6). 한 이론의 과학적 지위를 가르는 기준은 "its falsifiability, or refutability, or testability"다(Popper 1963, ch. 1).
- 경계 문제(demarcation): 무엇이 경험 과학이고 무엇이 비과학(형이상학·사이비)인가를 가르는 기준. Popper의 답은 반증 가능성이다. 그는 비과학이 곧 무의미하다고 보지 않았다. 이 점에서 논리실증주의의 의미 기준과 갈린다.
- 논리적 비대칭: 보편 명제("모든 백조는 희다")는 아무리 많은 확증으로도 증명되지 않지만, 하나의 반례("검은 백조 1마리")로 반박된다. 후건 긍정은 무효이고 후건 부정(modus tollens)은 유효하다.
- 반증 가능성의 정도: 금지하는 관찰이 많을수록(경험적 내용이 클수록) 더 반증 가능하고 더 위험한 이론이다. Popper는 개연성이 낮은 대담한 이론을 선호했다(Popper 1963: "there are degrees of testability").
- 입증(corroboration): 반증 시도를 견딘 이론은 "입증되었다"고 할 뿐 참으로 증명되지는 않는다.
- 방법론적 규칙: 빗나간 예측을 임시방편 가정으로 막지 않는다는 규약. 확률 명제처럼 논리적으로는 반증되지 않는 진술은 "일정 조건의 재현 가능한 결과가 나오면 반증된 것으로 취급한다"는 방법론적 결정으로 다뤘다(Popper 1959, ch. 8).
작동 기제
반증 가능성은 주장을 평가하는 규범이다. 그래서 기제는 두 층으로 본다. 하나는 반증 가능한 주장이 왜 더 많은 것을 말하는가(논리), 다른 하나는 사람이 왜 반증을 잘 안 시도하는가(심리)다.
논리 쪽. 주장이 금지하는 관찰을 늘린다 → 그 관찰이 나오면 틀린다는 위험을 진다 → 반증 시도를 견디면 입증 정도가 올라간다 [Popper 1959; Popper 1963]. 반대로 모호하게 말하거나 빗나갈 때마다 임시방편 가정을 붙이면 반증은 피하지만 금지하는 관찰이 사라져 주장의 내용도 함께 준다.
심리 쪽. 1. 사람은 지금 가설에 맞을 것 같은 사례부터 시험한다. Wason (1960) 의 2-4-6 과제에서 29명 중 처음부터 정답에 이른 사람은 6명이었고, 틀린 결론을 두 번 이상 낸 9명은 자기 가설을 시험하지 못했거나 시험하려 하지 않았다 [Wason 1960]. 2. 이 경향은 늘 오류로 이어지지는 않는다. Klayman & Ha (1987) 는 이를 양성 검사 전략(positive test strategy, 가설이 "해당된다"고 예상하는 사례를 시험하는 습관)이라 부르고, 확증만 찾는 태도와 구별했다. 2-4-6 과제에서는 사람들의 가설("2씩 증가")이 정답 규칙("증가하는 수")에 통째로 포함돼 있어, 가설에 맞는 사례는 항상 "맞다"는 답만 돌려준다. 이 구조에서는 가설 밖의 사례를 시험해야만 반증이 나온다 [Klayman & Ha 1987]. 3. 대상 현상이 드물고 가설의 범위가 현상과 비슷한 크기이면, 오히려 가설에 맞는 사례를 시험할 때 반증이 더 잘 나온다고 계산했다. 저자들은 현실의 가설 검증이 대체로 이런 드문 현상을 다룬다고 봤다 [Klayman & Ha 1987]. 4. 결과를 본 뒤에는 사후 설명을 예측으로 착각하기 쉽다. 사후확증 편향 같은 평범한 추론 편향 때문에 예측과 사후 설명을 실제로 가르기 어렵다 [Nosek et al. 2018].
언제 강해지고 언제 약해지나
- 과제 구조: 가설이 정답 규칙 안에 포함된 구조(2-4-6)에서는 양성 검사만 하면 반증을 영영 못 만난다. 가설이 정답보다 넓으면 반대로 가설 밖 사례만 시험하는 사람이 속는다 [Klayman & Ha 1987].
- 반증하라는 지시의 효과: 2-4-6 과제에서 반증 전략은 지시로 쉽게 끌어낼 수 있었지만 규칙 발견 효율은 오르지 않았다. 강한 가설을 세운 뒤에 반증 가능성을 알려 줘도 마찬가지였고, 매 단계 여러 가설을 세우게 하자 수행이 오히려 나빠졌다. 과제를 두 규칙(DAX·MED)을 찾는 형태로 바꾸자 수행이 크게 올랐다 [Tweney et al. 1980].
- 시험의 위험 수준: 귀무가설은 거의 언제나 조금은 틀리므로, "유의한 차이" 여부만 보는 시험은 표본만 크면 통과한다. 수치 예측이나 곡선 모양처럼 좁은 예측을 걸수록 시험이 위험해진다 [Meehl 1978].
- 결과 공개 전 고정 여부: 심사와 게재 결정을 결과 전에 하는 등록 보고서(Registered Reports)에서는 첫 가설의 긍정 결과 비율이 44%로, 일반 논문의 96%보다 낮았다 [Scheel et al. 2021].
어떻게 재나
- 2-4-6 규칙 발견 과제: 실험자가 "2, 4, 6"이 규칙에 맞는다고 알려 주면, 참가자는 숫자 세 개를 직접 만들어 규칙에 맞는지 묻고 피드백을 받는다. 확신이 서면 규칙을 발표한다. 연구자는 참가자가 가설에 맞는 수열(+H 검사)과 맞지 않는 수열(−H 검사)을 얼마나 시험했는지, 틀린 발표를 몇 번 했는지를 센다 [Wason 1960; Tweney et al. 1980].
- 분야 수준의 측정: 게재 논문의 첫 가설이 지지됐는지 코딩해 긍정 결과 비율을 비교하거나 [Scheel et al. 2021], 원 연구를 같은 절차로 다시 해서 효과가 다시 나오는지 본다 [Open Science Collaboration 2015].
- 연구 실천: 사전등록·등록 보고서는 결과를 보기 전에 가설과 분석 계획을 고정해 사후 설명이 예측으로 둔갑하는 것을 막는다 [Nosek et al. 2018].
헷갈리는 개념과의 차이
| 개념 | 핵심 | 반증 가능성과 다른 점 | |---|---|---| | 검증 가능성(verifiability) | 관찰로 참임을 확인할 수 있어야 의미 있는 명제 | Popper 는 보편 명제가 확인으로는 증명되지 않는다는 비대칭을 근거로 경계 기준을 반증 쪽으로 옮겼다 [Popper 1959] | | 확증 편향(confirmation bias) | 믿음을 지지하는 증거를 더 찾고 무겁게 보는 경향 | 반증 가능성은 주장에 대한 규범이고 확증 편향은 사람에 대한 기술이다. 또 가설에 맞는 사례를 시험하는 습관(양성 검사)은 확증 편향과 같지 않다 [Klayman & Ha 1987] | | 엄격한 시험(severe testing) | 주장이 틀렸다면 드러났을 시험을 통과했을 때만 그 주장을 받아들인다 | Mayo (2018) 는 반증 발상을 통계적 추론으로 넓혀, 오류를 걸러 낼 만한 일이 거의 없었다면 그 주장은 엄격한 시험을 통과하지 못한 것으로 본다. 확률을 믿음의 정도로 쓰는 베이즈식 입증 이론과는 확률의 역할을 두고 입장이 다르다 [Mayo 2018] |
주요 후속 연구·메타분석
### Wason (1960) — 사람들은 자기 가설을 깨 볼 사례를 시험하지 않았다 Quarterly Journal of Experimental Psychology, 12(3), 129-140. DOI: 10.1080/17470216008416717
- 설계: 지적인 젊은 성인 29명에게 "2, 4, 6"이 따르는 규칙을 찾게 했다. 가능한 수열이 무한하고 정답 규칙이 흔히 떠올리는 여러 규칙을 포함하도록 설계해, 확증 증거만 모으면 거의 틀리게 만들었다.
- 결과: 틀린 발표 없이 정답에 이른 사람 6명, 한 번 틀린 사람 13명, 두 번 이상 틀린 사람 9명, 결론을 못 낸 사람 1명. 두 번 이상 틀린 사람들은 자기 가설을 시험하지 못했거나 시험하려 하지 않았다.
- 의미와 한계: 반증을 시도하지 않는 경향을 처음 실험으로 보였다. 과제가 확증 전략이 실패하도록 짜였다는 점이 이후 해석 논쟁의 출발점이 됐다 [Klayman & Ha 1987].
### Tweney, Doherty, Worner 외 (1980) — 반증하라고 시켜도 규칙 발견은 나아지지 않았다 Quarterly Journal of Experimental Psychology, 32(1), 109-123. DOI: 10.1080/00335558008248237
- 설계: 2-4-6 과제로 실험 4개. (1) 반증 전략을 쓰라고 지시, (2) 확증으로 강한 가설을 세운 뒤에야 반증 가능성을 소개, (3) Platt 의 강한 추론식으로 매 단계 여러 가설을 세우게 함, (4) 서로 얽힌 두 규칙을 찾게 과제 구조를 바꿈.
- 결과: 반증 전략은 쉽게 유도됐지만 규칙 발견 효율은 오르지 않았다(실험 1). 실험 2도 효율 변화 없음. 실험 3은 수행이 오히려 나빠졌다. 두 규칙 과제(실험 4)에서 수행이 크게 올랐다. 초록에는 수치가 없다.
- 의미와 한계: "반례를 찾아라"는 지시만으로는 가설 검증이 좋아지지 않았다. 틀린 정보를 대안 규칙과 연결할 수 있는 구조를 주었을 때 효과가 났다는 해석을 저자들이 제시했다.
### Klayman & Ha (1987) — 양성 검사 전략은 확증 편향과 같지 않다 Psychological Review, 94(2), 211-228. DOI: 10.1037/0033-295X.94.2.211
- 설계: 이론 분석. 가설 집합과 정답 집합의 관계(포함·겹침·둘러쌈·분리·일치) 다섯 가지에서 +H 검사와 −H 검사가 반증을 낼 확률을 따지고, 기존 실험 결과를 이 틀로 다시 해석했다.
- 결과: 2-4-6 과제는 가설이 정답 안에 포함된 경우라 +H 검사로는 반증이 나올 수 없다. 대상 현상의 기저율이 .5보다 낮고 가설 크기가 현상과 비슷하면 +H 검사의 반증 확률이 −H 검사보다 높다. 저자들은 2-4-6의 정답 규칙도 넓은 수 범위에서 고르면 해당 비율이 약 1/6이라고 계산했다.
- 의미와 한계: 사람들의 기본 전략은 현실의 여러 조건에서 쓸 만한 휴리스틱이고, 특정 과제 구조에서 체계적 오류를 낸다. "반례를 찾으라"는 처방은 과제 구조에 따라 맞기도 틀리기도 한다. 사람들이 과제 조건에 따라 전략을 바꾸는지는 열린 문제로 남겼다.
### Meehl (1978) — 유의성 별표는 위험한 시험이 되지 못한다 Journal of Consulting and Clinical Psychology, 46(4), 806-834. DOI: 10.1037/0022-006X.46.4.806
- 설계: 이론 논문. "무른" 심리학 분야의 이론이 반박되지도 입증되지도 않고 관심이 식어 사라지는 이유를 따졌다.
- 결과: 주제 자체의 어려움 20가지와 함께 유의성 검정에 대한 지나친 의존을 원인으로 들었다. 귀무가설은 거의 언제나 틀리므로 "유의한 차이" 표는 검정력의 산물에 가깝다고 봤다. 대안으로 수치 점 예측이 여러 경로에서 맞는지 보는 일관성 검사를 제안했고, 자신의 분류 모형에 적용한 일관성 검사에서 94% 성공, 거짓 음성 0건을 보고했다.
- 의미와 한계: Popper 의 발상을 통계 관행에 적용한 대표 논문. 94%는 저자 한 모형의 결과라 일반화 근거는 아니다.
### Open Science Collaboration (2015) — 심리학 연구 100편 대규모 재현 Science, 349(6251), aac4716. DOI: 10.1126/science.aac4716
- 설계: 심리학 학술지 3곳에 실린 실험·상관 연구 100편을 검정력을 높인 설계와 가능한 한 원래 자료로 다시 수행했다.
- 결과: 원 연구의 97%가 유의했는데 재현은 36%만 유의했다. 재현 효과크기는 원래의 절반. 원 효과크기가 재현 95% 신뢰구간 안에 든 비율 47%, 주관적으로 재현됐다고 평가된 비율 39%. 재현 성공은 연구팀 특성보다 원 연구 증거의 강도로 더 잘 예측됐다.
- 의미와 한계: 게재된 "통과한 시험"이 같은 절차로 다시 하면 절반 이상 통과하지 못했다. 재현 판정 기준(유의성·신뢰구간·주관 평가)에 따라 성공 비율이 36~47%로 달라진다.
### Scheel, Schijen & Lakens (2021) — 틀릴 조건을 먼저 고정하면 긍정 결과가 절반 아래로 Advances in Methods and Practices in Psychological Science, 4(2). DOI: 10.1177/25152459211007467
- 설계: 2018년 11월까지 나온 심리학 등록 보고서 71편과 일반 가설 검증 논문 무작위 표본 152편에서 첫 가설의 지지 여부를 비교.
- 결과: 긍정 결과 비율이 일반 논문 96%, 등록 보고서 44%.
- 의미와 한계: 결과 전에 게재를 정하면 "가설이 맞았다"는 보고가 크게 줄었다. 저자들은 여러 설명을 논의한 뒤 출판 편향과 1종 오류 부풀림이 줄어든 것을 그럴듯한 요인으로 들었다. 초록만으로는 다른 요인의 몫을 가를 수 없다.
그 밖의 문헌
- Evans, J. St. B. T. (2016). Reasoning, biases and dual processes: The lasting impact of Wason (1960). Quarterly Journal of Experimental Psychology, 69(10), 2076-2092. https://doi.org/10.1080/17470218.2014.914547 — 2-4-6 과제 연구가 지금도 이어진다고 정리한 회고. Evans 는 Wason 의 이 과제와 뒤이은 네 카드 선택 과제가 추론의 이중 과정 이론(빠른 직관 과정과 느린 숙고 과정을 나누는 이론)이 처음 생겨난 출발점이었다고 본다(초록 확인).
- Kuhn, T. S. (1962). The Structure of Scientific Revolutions. University of Chicago Press. — 정상 과학 시기의 과학자는 변칙을 만나도 패러다임을 버리지 않는다는 역사적 반론.
- Lakatos, I. (1970). Falsification and the methodology of scientific research programmes. In I. Lakatos & A. Musgrave (Eds.), Criticism and the Growth of Knowledge (pp. 91-196). Cambridge University Press. https://doi.org/10.1017/CBO9781139171434.009 — 단일 이론 대신 "연구 프로그램"을 평가 단위로 삼는다. 핵심부(hard core)는 보조가설의 보호대(protective belt)가 지키고, 새 사실을 예측하면 진보적, 사후 땜질만 하면 퇴행적 프로그램.
- Nosek, B. A., Ebersole, C. R., DeHaven, A. C., & Mellor, D. T. (2018). The preregistration revolution. PNAS, 115(11), 2600-2606. https://doi.org/10.1073/pnas.1708274114 — 예측(prediction)과 사후 설명(postdiction)을 가르는 사전등록 제안.
- Mayo, D. G. (2018). Statistical Inference as Severe Testing: How to Get Beyond the Statistics Wars. Cambridge University Press. https://doi.org/10.1017/9781107286184 — 엄격한 시험 틀.
- Duhem, P. (1906). La théorie physique: son objet et sa structure. Paris: Chevalier & Rivière.
- Quine, W. V. O. (1951). Two dogmas of empiricism. The Philosophical Review, 60(1), 20-43. https://doi.org/10.2307/2181906
- Laudan, L. (1983). The demise of the demarcation problem. In R. S. Cohen & L. Laudan (Eds.), Physics, Philosophy and Psychoanalysis (Boston Studies in the Philosophy of Science, pp. 111-127). Reidel. https://doi.org/10.1007/978-94-009-7055-76
- Popper, K. R. (1978). Natural selection and the emergence of mind. Dialectica, 32(3-4), 339-355. https://doi.org/10.1111/j.1746-8361.1978.tb01321.x
비판·한계
재현성
- 반증 가능성은 철학적 기준이라 재현 대상이 되는 효과가 없다. 재현성 논의는 이 기준을 연구 관행에 적용했을 때의 결과로 나타난다.
- 심리학 연구 100편 재현에서 유의한 재현은 36%, 재현 효과크기는 원래의 절반이었다 [Open Science Collaboration 2015].
- 등록 보고서의 긍정 결과 비율은 44%로 일반 논문(96%)보다 낮았다 [Scheel et al. 2021].
- 2-4-6 과제의 기본 현상(가설에 맞는 사례 위주로 시험)은 후속 연구에서 반복 관찰됐다 [Tweney et al. 1980; Klayman & Ha 1987]. 과제 연구는 발표 후 반세기 넘게 이어지고 있다 [Evans 2016].
대표 반론
- 실제 과학사와의 불일치 — 과학자들은 반례 하나로 이론을 버리지 않고, 변칙은 한동안 보류된다. 해왕성 발견처럼 보조가설을 덧붙여 이론을 지킨 것이 옳았던 사례도 있다 [Kuhn 1962; Lakatos 1970]. Lakatos 는 평가 단위를 연구 프로그램으로 옮겨 새 사실을 예측하는지로 진보와 퇴행을 갈랐다 [Lakatos 1970].
- Duhem–Quine 문제 — 관찰은 이론과 보조가정 묶음을 함께 시험한다. "무엇이 반증됐는가"가 논리적으로 떨어지지 않는다 [Duhem 1906; Quine 1951]. Popper 쪽은 보조가정을 임시방편으로 바꾸지 않는다는 방법론 규약으로 대응했다 [Popper 1959].
- 경계 문제 자체에 대한 회의 — 과학과 비과학을 가르는 단일 필요충분 기준은 없다는 반론이 있고, 이후 과학철학은 여러 기준을 함께 쓰는 쪽으로 옮겨 갔다 [Laudan 1983]. Mayo (2018) 는 반증 발상을 통계 추론의 "엄격한 시험" 기준으로 다시 세워 과학과 사이비의 구별 문제에 적용했다 [Mayo 2018].
- 반증 지시의 심리학적 한계 — "반례를 찾으라"는 처방은 2-4-6 과제에서 규칙 발견을 개선하지 못했고 [Tweney et al. 1980], 가설에 맞는 사례를 시험하는 습관은 많은 현실 조건에서 반증을 찾는 데 오히려 유리할 수 있다 [Klayman & Ha 1987].
- 확률·통계 명제 — 개별 관측으로 반증되지 않으므로 Popper도 방법론적 규약을 따로 둬야 했다. 유의성 검정 관행은 이 규약을 약하게 만든다 [Popper 1959; Meehl 1978].
- 적용 오류 사례: 진화론 — Popper는 한때 다윈주의를 "형이상학적 연구 프로그램"이라 불렀다가 1978년에 이를 거둬들이고 자연선택 이론이 시험 가능하다고 밝혔다. 반증 기준을 기계적으로 적용하면 정상 과학에도 잘못된 딱지를 붙일 수 있다 [Popper 1978].
쓰면 안 되는 상황
- 형성기의 가설이나 아직 측정 도구가 없는 이론을 "반증 불가라 비과학"으로 곧장 버리지 않는다.
- 반례 하나로 잘 입증된 이론 전체를 폐기하는 근거로 쓰지 않는다. 먼저 측정과 보조가정을 점검한다.
- 드문 현상을 다루는데 가설 범위가 적절하다면, "가설 밖 사례만 시험하라"는 식으로 기계적으로 적용하지 않는다. 가설에 맞는 사례를 시험하는 편이 반증을 더 잘 찾을 수 있다 [Klayman & Ha 1987].
관련 모델
- 확증 편향 (Confirmation Bias) — 확증만 모으는 인지 경향. 반증 가능성은 이를 교정하는 규범.
- 베이즈 사고 (Bayesian Thinking) — 증거에 따라 믿음을 갱신. 반례를 더 무겁게 다루는 점에서 연결.
- 제1원리 사고 (First Principles) — 주장을 검증 가능한 단위로 분해.
- 오컴의 면도날 (Occam's Razor) — 불필요한 ad hoc 가정 추가를 경계한다는 점에서 짝.
사고 도구 다른 글