더닝-크루거 효과 (Dunning-Kruger Effect)
처음 실린 날 2026-05-23 · 마지막으로 고친 날 2026-09-27
다른 이름: 자신감 곡선 · 자신감 그래프 · 무지의 곡선 · 우매함의 봉우리 · Dunning-Kruger Effect
한 줄 정의
특정 영역의 실력이 낮은 사람일수록 자기 실력을 과대평가하는 경향. 실력 부족이 자기 평가에 필요한 메타인지(자기 생각을 점검하는 능력)까지 떨어뜨린다는 것이 원논문의 주장이다. 단, 효과의 상당 부분이 통계 인공물이라는 비판이 있다.
일상 한 줄
잘 모르는 영역에서는 자기 부족함을 보는 능력도 같이 부족하다.
흔한 장면
- 새 분야를 처음 접할 때는 오히려 조심스럽다. 몇 번 해 보고 나서 "이제 감 잡았다"며 자신감이 실력보다 먼저 치솟는다.
- 더 배우면서 세운 이론이 여러 번 틀리면 자신감이 잠시 멈춘다. 크게 무너지지는 않고, 실력이 붙으면서 다시 오른다.
- 실력자는 자기 순위를 오히려 낮게 본다. 원논문은 그 이유를 "남들도 이 정도는 하겠지"라고 남의 실력을 과대평가하는 데서 찾았다.
- 운전·요리·연애 같은 영역에서 "나는 평균 이상"이라고 다수가 말함.
왜 빠지나
- 자기 평가도 메타인지 능력 — 답이 맞았는지 가려내는 능력이 과제 실력과 같은 지식에 기댄다.
- 모르는 걸 모른다 — 무엇을 모르는지 알려면 어느 정도 알아야 한다.
- 남을 봐도 못 고친다 — 남의 답안을 봐도 무엇이 잘한 것인지 가려낼 실력이 없어, 하위권은 자기 평가를 고치지 못했다 [Kruger & Dunning 1999].
빠져나오는 법
1. "감 잡았다" 순간을 의심: 몇 번 해 보고 자신감이 치솟을 때가 과신이 가장 빨리 커지는 때다. 방금 세운 규칙이 몇 번의 경험에서 나왔는지 세어 본다. — 근거: 실험 Sanchez & Dunning 2018 2. 실력을 키워 판별력을 얻기: 원논문에서 하위권의 자기 평가를 바로잡은 개입은 10분짜리 논리 훈련이었다. 훈련을 받은 하위권은 자기 답 10개 중 정오를 맞힌 개수가 9.3개로, 훈련을 받지 않은 하위권(3.5개)보다 많았고 자기 평가도 실제에 가까워졌다 [Kruger & Dunning 1999]. 돈이나 책임을 걸어 "정직하게 평가하라"고 해서는 나아지지 않았다 [Ehrlinger et al. 2008]. — 근거: 실험 [Kruger & Dunning 1999 Study 4; Ehrlinger et al. 2008] 3. 채점된 점수로 확인하기: 자기 느낌 대신 정답으로 채점된 점수, 정답을 아는 사람의 평가와 맞춰 본다. 남의 답안을 구경하는 것으로는 부족하다. 원논문에서 남의 답안 5개를 채점한 뒤 상위권은 자기 순위 추정을 올려 실제에 가까워졌지만, 하위권은 자기 평가를 고치지 않았다 [Kruger & Dunning 1999]. — 근거 수준: 남의 답안 보기는 실험 [Kruger & Dunning 1999 Study 3]에서 하위권에 효과가 없었다. 채점 피드백이 하위권 자기 평가를 고치는지 직접 시험한 연구는 이 카드에서 확인하지 못했다(경험칙) 4. 무지의 영역 명시: "이 분야에서 내가 확실히 모르는 3가지"를 적는다. — 근거 수준: 경험칙(직접 검증 연구 없음)
통념이 무너지는 순간
이 멘탈모델은 학계에서 가장 격렬하게 비판받는 것 중 하나이고, 동시에 대중에게 가장 왜곡되어 전파되는 모델입니다.
"자신감 곡선 — 산봉우리에서 절망 골짜기를 거쳐 안정 평원으로"
⚠ 흔히 봄: 인터넷·자기계발 슬라이드에서 자주 등장하는 그래프. "낮은 실력=산봉우리(자신감 최고), 중간=절망 골짜기, 높은 실력=안정 평원." ✓ 학술: 이 곡선은 Kruger & Dunning (1999) 원논문에 없다. 후세에 만들어진 인포그래픽이 밈처럼 퍼진 것이다. 원논문의 그림은 실력 사분위별로 실제 백분위와 스스로 추정한 백분위를 잇는 선 그래프다. 하위 25%는 실제로는 12백분위였는데 자신을 62백분위로 추정했다(원문 초록). 학습 중 자신감을 실제로 잰 연구에서는 첫 봉우리 대신 겸손한 출발이 나왔고, 조금 배운 뒤 과신이 치솟았다가 잠시 평평해진 뒤 다시 올랐다. 크게 꺼지는 "절망 골짜기"는 나타나지 않았다 [Sanchez & Dunning 2018].
"초보일수록 자신감이 크고 전문가일수록 자신감이 낮다"
⚠ 흔한 말: 더닝-크루거의 대중적 요약으로 가장 자주 나오는 표현. ✓ 학술: 상당 부분이 통계 산물일 가능성. 누구나 자기를 평균보다 낫다고 보는 경향(평균 이상 효과)과 평균으로의 회귀(regression to the mean)만으로도 같은 모양의 그림이 나온다 [Krueger & Mueller 2002]. 무작위 숫자로 만든 가짜 자료에서도 Kruger-Dunning 그림이 재현됐다 [Nuhfer et al. 2016]. 지능 자기평가 929명 자료를 이분산 검정·비선형 회귀로 분석하자 효과가 나타나지 않았다(Gignac & Zajenkowski 2020, 논문 제목 "The Dunning-Kruger effect is (mostly) a statistical artefact"). 반대 방향 증거도 있다. 약 4,000명씩 두 번 재현한 연구는 통계 인공물을 모형으로 통제한 뒤에도 저득점자가 자기 답이 맞는지 가려내는 능력이 낮다는 쪽을 지지했다 [Jansen et al. 2021]. 효과의 일부는 실재할 수 있지만, 크기는 통념보다 작고 "초보는 자신만만, 전문가는 겸손"이라는 단순화는 근거가 약하다.
"더닝-크루거 효과는 똑똑한 사람과 멍청한 사람을 구분한다"
⚠ 흔한 말: 인터넷에서 자기 우월감의 도구로 쓰이는 해석. ✓ 학술: 원논문의 중심 주장은 이중 부담이다. 실력이 부족하면 틀린 결론을 내리고, 같은 부족 때문에 틀렸다는 것도 알아채지 못한다. 대상도 유머·문법·논리처럼 특정 과제 영역이다. 네 연구 중 Study 4에서는 논리 문제 푸는 법을 짧게 가르치자 하위권의 자기평가가 더 정확해졌다. 자기 평가 능력은 영역 지식과 함께 바뀌는 것이고, 사람을 똑똑한 쪽과 멍청한 쪽으로 가르는 기준으로 쓸 수 없다.
빠져나오는 절차
(상세는 위의 "빠져나오는 법" 섹션 참조.)
함께 쓰기 좋은 도구
- 메타인지 — 자기 인지에 대한 인지
- 평균 회귀 — 더닝-크루거 곡선을 만들 수 있는 통계 효과
- 평균 이상 효과 — 누구나 자기를 평균보다 낫다고 보는 경향. 더닝-크루거 그림의 일부를 만든다
1차 출처
- Justin Kruger & David Dunning (1999). "Unskilled and unaware of it: How difficulties in recognizing one's own incompetence lead to inflated self-assessments." Journal of Personality and Social Psychology, 77(6), 1121-1134.
- DOI: 10.1037/0022-3514.77.6.1121
원문 핵심 인용
"People tend to hold overly favorable views of their abilities in many social and intellectual domains. The authors suggest that this overestimation occurs, in part, because people who are unskilled in these domains suffer a dual burden: Not only do these people reach erroneous conclusions and make unfortunate choices, but their incompetence robs them of the metacognitive ability to realize it." — Kruger & Dunning (1999), abstract verbatim 검증: 2026-09-27 재대조, PubMed abstract(PMID 10626367). 초기 카드의 "When people are incompetent in the strategies they adopt..."는 원문에 없는 풀어쓰기였음 → 실제 abstract 원문으로 교체.
"Although their test scores put them in the 12th percentile, they estimated themselves to be in the 62nd." — Kruger & Dunning (1999), abstract (verbatim 검증: 2026-09-27, 같은 PubMed 초록)
핵심 정의·메커니즘
원전 정의
- Kruger & Dunning (1999)은 실력이 부족한 사람이 "dual burden"(이중 부담)을 진다고 정의했다. 틀린 결론을 내리고 나쁜 선택을 하는 데 더해, 같은 무능 때문에 그것을 알아챌 메타인지 능력까지 잃는다 [Kruger & Dunning 1999].
- 여기서 메타인지는 "the capacity to distinguish accuracy from error", 곧 맞은 답과 틀린 답을 가려내는 능력이다 [Kruger & Dunning 1999].
- 근거는 유머·문법·논리 시험 4개 연구다. 하위 25%는 실제 12백분위였지만 자신을 62백분위로 추정했다(원문 초록). 역설적으로, 참가자의 실력을 키워 주자 자기 능력의 한계를 더 잘 알아봤다 [Kruger & Dunning 1999].
- 상위권은 자기 순위를 낮게 봤다. 원저자들은 이것을 다른 원인으로 설명한다. 시험이 쉽게 느껴지니 남들도 쉬웠으리라 여겨 남의 실력을 높게 잡은 탓이고, Study 3에서 문법 시험 상위권 19명과 하위권 17명에게 몇 주 뒤 남의 답안 5개를 채점하게 하자, 상위권은 자기 시험 백분위 추정을 69.5에서 79.7로 올렸다(실제 88.7). 하위권은 60.5에서 65.4로 오히려 조금 올렸고(유의하지 않음, 실제 10.1) 자기 평가를 고치지 못했다. 남의 답안 점수를 매기는 정확도도 하위권이 낮았다(실제 점수와의 평균 상관 r = .37 대 .66) [Kruger & Dunning 1999].
작동 기제
원저자 쪽 설명(메타인지 결손)과 비판 쪽 설명(통계·판단 잡음)이 같은 그림을 두고 경쟁한다.
1. 메타인지 경로: 실력 부족 → 자기 답의 정오를 못 가림 → 자기가 고른 답은 그럴듯해 보이므로 잘했다고 믿음 → 과대평가. 원저자들은 문법 문장을 맞게 쓰는 데 필요한 지식과, 그 문장이 맞는지 알아보는 데 필요한 지식이 같다는 예로 설명한다 [Ehrlinger et al. 2008]. 논리 훈련을 받은 학생은 정오 구분 능력과 수행이 함께 좋아졌다 [Kruger & Dunning 1999]. 2. 통계 경로: 누구나 자기를 평균보다 낫다고 보는 경향(평균 이상 효과) + 실력 측정의 잡음 때문에 생기는 평균으로의 회귀 → 하위권은 과대평가, 상위권은 과소평가처럼 보임. 두 요인 중 하나만 통계적으로 빼도 비대칭이 사라졌다 [Krueger & Mueller 2002]. 3. 잡음 + 편향 경로: 모든 실력 수준이 비슷한 크기의 판단 오차를 갖고, 과제 난이도가 전체 추정을 한쪽으로 민다 → 쉬운 과제에서는 하위권이, 어려운 과제에서는 상위권이 더 틀리게 보임 [Burson et al. 2006]. 4. 합리적 베이즈 경로: 모두가 "대략 70%는 맞히겠지" 같은 사전 믿음을 갖고, 문항별 확신이 흐릿하면 추정이 그 사전 믿음 쪽으로 당겨진다. 저득점자는 이 당김 때문에 메타인지가 정상이어도 과대평가한다 [Jansen et al. 2021; Mazor & Fleming 2021]. 5. 판정: 약 4,000명씩 두 번 재현한 자료에서는 4번 경로만으로는 양 끝(최저·최고 득점자)의 자료를 설명하지 못했고, 저득점자일수록 자기 정오 판단이 흐리다는 모형이 더 잘 맞았다 [Jansen et al. 2021]. 다만 그 흐림이 별도의 메타인지 결손인지, 수행이 낮으면 저절로 따라오는 불확실성인지는 아직 가려지지 않았다 [Mazor & Fleming 2021].
언제 강해지고 언제 약해지나
- 과제 난이도: 12개 과제를 쓴 연구에서 중간 난이도 과제는 최상위·최하위의 정확도 차이가 거의 없었고, 어려운 과제에서는 최상위가 더 부정확했다 [Burson et al. 2006]. 어려운 과제에서는 자기 점수는 과대평가하면서 남과 비교한 순위는 낮게 보고, 쉬운 과제에서는 그 반대다 [Moore & Healy 2008].
- 학습 단계: 완전 초보는 과신하지 않는다. 몇 번 배운 뒤 성급한 이론을 세우면서 "초보자 거품"으로 자신감이 급등하고, 이후 자신감이 잠시 평평해졌다가 다시 오른다 [Sanchez & Dunning 2018].
- 유인은 효과를 줄이지 못했다: 정확히 맞히면 돈을 주거나(총기 동호회 퀴즈에서 10달러), 교수 면담에서 답의 근거를 설명하게 해도 저득점자의 과대평가는 줄지 않았다 [Ehrlinger et al. 2008].
- 실력 차이를 없애면 사라진다: 과제 난이도를 사람마다 조절해 모두 같은 성공률로 맞추자 더닝-크루거 패턴이 없어졌다 [McIntosh et al. 2019].
- 분석 방법: 같은 자료도 사분위 그림으로 보면 효과가 있어 보이고(η² = 0.20), 개인차 통계로 보면 사라졌다 [Gignac & Zajenkowski 2020].
어떻게 재나
- 사분위 그림(원전 방식): 시험을 본 뒤 "동료 100명 중 몇 등쯤인가"(백분위)와 맞힌 개수를 추정하게 하고, 실제 점수 사분위별로 실제·추정 평균을 그린다 [Kruger & Dunning 1999]. 평균 이상 효과와 회귀가 섞여 해석이 어렵다 [Gignac & Zajenkowski 2020].
- 신뢰도 보정 회귀: 같은 수업의 두 번째 시험 점수로 검사-재검사 신뢰도를 구하고, 측정이 완벽했다면 회귀 기울기가 어땠을지 다시 계산한다 [Ehrlinger et al. 2008].
- 개인차 통계: 지능 검사(레이븐 행렬) 점수에 자기평가를 회귀시킨 뒤, 잔차 절댓값이 실력과 상관이 있는지(Glejser 이분산 검정), 관계가 곡선인지(이차 회귀) 본다 [Gignac & Zajenkowski 2020].
- 시행별 메타인지 측정: 점을 가리키거나 위치를 기억하는 단순 과제에서 매 시행 "맞혔다/빗나갔다"를 판단하게 해 보정·민감도를 따로 잰다 [McIntosh et al. 2019].
- 학습 곡선 추적: 가상의 "좀비 병"을 증상으로 진단하는 식의 확률 학습 과제를 여러 번 반복하며, 매 판단의 확신과 실제 정답률을 함께 기록한다 [Sanchez & Dunning 2018].
헷갈리는 개념과의 차이
- 과신의 세 종류: 과신은 ① 자기 실제 수행을 높게 보는 과대추정(overestimation) ② 남과 비교해 자기 자리를 높게 보는 과대배치(overplacement) ③ 자기 믿음을 지나치게 확신하는 과대정밀(overprecision)로 나뉜다 [Moore & Healy 2008]. 원전의 "62백분위"는 과대배치, "맞힌 개수 과대평가"는 과대추정에 해당한다. 더닝-크루거 주장의 핵심은 과신 자체보다 그 크기가 실력에 따라 달라진다는 부분이다.
- 평균 이상 효과: 실력과 무관하게 대부분이 자기를 평균 위로 보는 경향이다. 929명 자료에서 지능에 대한 평균 이상 효과는 d = 1.71로 컸다 [Gignac & Zajenkowski 2020]. 이것만으로도 사분위 그림의 일부가 만들어진다 [Krueger & Mueller 2002].
- 평균으로의 회귀: 극단값이 다시 재면 평균 쪽으로 가는 통계 현상이다. 원저자들은 신뢰도를 보정해도 저득점자의 과대평가가 남았다고 반박했다 [Ehrlinger et al. 2008].
- 임포스터 신드롬: 실력 있는 사람이 자기 능력을 의심하는 현상이다. 원전의 상위권 과소평가는 자기 의심보다 남의 실력을 높게 잡은 데서 나왔다고 설명되고, 남의 답안을 보자 줄었다 [Kruger & Dunning 1999].
주요 후속 연구·메타분석
더닝-크루거 효과만 모은 독립 메타분석은 찾지 못했다. 원저자 논문 안의 소규모 메타분석 [Ehrlinger et al. 2008], 대규모 재현 [Jansen et al. 2021], 방법론 비판이 그 역할을 한다.
### Ehrlinger, Johnson, Banner, Dunning & Kruger (2008) — 원저자 쪽: 현장·유인·신뢰도 보정 뒤에도 남는다 Organizational Behavior and Human Decision Processes, 105(1), 98-121. DOI: 10.1016/j.obhdp.2007.05.002
- 설계: 연구 5개. 실제 대학 시험(Study 1), 토론 대회(Study 2), 총기 동호회 안전 퀴즈에 정확도 보상 10달러(Study 3), 금전 유인(Study 4), 지도 교수 면담에서 답의 근거를 설명해야 하는 책임(Study 5, 42명). 검사-재검사 신뢰도로 회귀 기울기를 보정하고, 여러 연구 자료로 과대평가가 자기 추정 오류에서 오는지 남 추정 오류에서 오는지 가르는 메타분석을 했다.
- 결과: Study 1 전체 참가자는 과목 숙달 수준을 71백분위로 봤지만 실제는 49백분위였다. 신뢰도를 보정해도 저득점자의 과대평가는 남았다. 총기 퀴즈 참가자는 맞힌 문항 수를 평균 2.06개 더 많게 추정했다. 돈이나 책임 같은 유인은 정확도를 높이지 못했다. 메타분석에서는 저득점자의 과대평가가 남의 수행을 잘못 본 탓보다 자기 오류를 못 본 탓이었다.
- 의미와 한계: "통계 인공물"과 "그냥 좋게 말하고 싶어서"라는 두 대안 설명에 대한 원저자 측의 체계적 응답이다. 분석 틀은 여전히 사분위 비교를 쓰고, 원저자 연구실의 자료라는 한계가 있다.
### Krueger & Mueller (2002) — 반대 결과: 평균 이상 효과 + 회귀로 비대칭이 설명된다 Journal of Personality and Social Psychology, 82(2), 180-188. DOI: 10.1037/0022-3514.82.2.180
- 설계: 원논문을 재현하면서 메타인지 등 여러 매개 후보 변수를 함께 쟀고, 회귀와 평균 이상 효과를 각각 통계적으로 제거해 비대칭이 남는지 봤다(초록 기준).
- 결과: 어떤 후보 변수에서도 매개 효과가 나오지 않았다. 회귀나 평균 이상 효과 중 하나를 빼면 오차가 더는 비대칭이 아니었다. 오히려 고득점자가 자기 순위를 예측할 때 남에 대한 자기 추정을 무시해 오류를 더 많이 냈다.
- 의미와 한계: 메타인지 결손 없이도 같은 그림이 나올 수 있음을 처음 정면으로 보인 연구다. 원저자들은 측정 신뢰도를 보정해도 효과가 남는다고 반박했다 [Ehrlinger et al. 2008]. 초록만 읽어 표본 수·효과크기는 확인하지 못했다.
### Burson, Larrick & Klayman (2006) — 난이도에 따라 누가 틀리는지가 뒤집힌다 Journal of Personality and Social Psychology, 90(1), 60-77. DOI: 10.1037/0022-3514.90.1.60
- 설계: 연구 3개, 과제 12개. 쉬워 보이거나 어려워 보이게 만든 과제에서 자기 상대 순위를 추정하게 했다.
- 결과: 중간 난이도 과제에서는 최상위와 최하위의 정확도 차이가 거의 없었고, 더 어려운 과제에서는 최상위가 최하위보다 더 부정확했다.
- 의미와 한계: 모든 실력 수준이 비슷한 판단 오차를 가진다는 "잡음 + 편향" 모형으로 원전 패턴을 설명한다. 원전이 쓴 과제가 대체로 쉬운 쪽이었다면 하위권 과대평가가 두드러질 수밖에 없다. 초록만 읽어 효과크기는 확인하지 못했다.
### Gignac & Zajenkowski (2020) — 개인차 통계로 보면 (대부분) 사라진다 Intelligence, 80, 101449. DOI: 10.1016/j.intell.2020.101449
- 설계: 일반인 929명이 자기 지능을 평가하고 레이븐 고급 행렬 검사를 봤다. 사분위 그림과 함께, Glejser 이분산 검정과 이차 회귀로 다시 분석했다.
- 결과: 사분위로 나누면 자기평가와 실제 점수 차이가 하위로 갈수록 커졌다(η² = 0.20). 그러나 Glejser 상관은 r = −0.05 (95% CI −0.11~0.02, p = .132)로 유의하지 않았고, 이차 항도 유의하지 않았다(준편상관 0.02, p = .545). 자기평가와 실제 지능의 상관은 r = 0.28, 평균 이상 효과는 d = 1.71이었다.
- 의미와 한계: 흔한 그림 방식이 효과를 만들어 낼 수 있음을 같은 자료로 보였다. 저자들은 일부 기술에서는 효과가 어느 정도 있을 수 있지만 기존 보고보다 훨씬 작을 것이라고 결론지었다. 지능 한 영역이고, 레이븐 검사가 지능 전체와 같지 않다는 점을 저자도 인정했다.
### Jansen, Rafferty & Griffiths (2021) — 대규모 재현: 저득점자는 자기 정답 여부를 덜 가린다 Nature Human Behaviour, 5(6), 756-763. DOI: 10.1038/s41562-021-01057-0
- 설계: 자기평가를 합리적(베이즈) 모형으로 만들고, 원논문을 약 4,000명씩 두 번 재현해 문법·논리 영역에서 두 모형 변형을 비교했다. ① 사전 믿음의 영향만 있는 모형 ② 수행이 낮을수록 문항별 정오 판단도 흐린 모형.
- 결과: 저득점자가 자기 답의 정오를 덜 가려낸다는 모형 ②가 지지됐다. 해설 논평에 따르면 두 모형의 예측은 대체로 같고 최저·최고 득점자에서만 갈리는데, 표본이 커서 이 양 끝을 볼 수 있었다 [Mazor & Fleming 2021].
- 의미와 한계: 효과를 집단 수준의 통계 인공물이나 합리적 추정의 부산물로 다 설명할 수 없다는 대표 재반론이다. Mazor & Fleming은 저득점자의 "흐린 정오 판단"이 별도의 메타인지 결손인지, 낮은 수행에 원래 따라오는 불확실성인지(이중 부담 대신 한 가지 부담이 두 곳에 드러나는 것)는 아직 모른다고 지적했다. 원논문은 초록만, 해설은 전문을 읽었다.
### Sanchez & Dunning (2018) — 학습 곡선 실측: 초보는 처음엔 겸손하고, 조금 배운 뒤 과신한다 Journal of Personality and Social Psychology, 114(1), 10-28. DOI: 10.1037/pspa0000102
- 설계: 연구 6개. 4개는 여러 단서로 확률을 판단하는 학습 과제(예: 신체 증상으로 가상의 "좀비 병" 진단)를 반복하며 확신과 정답률을 추적했다. 2개는 성인 생애 전반의 금융 지식 자기평가와 실제 지식을 비교했다.
- 결과: 초보는 처음에는 과신하지 않았다. 몇 번의 학습 경험 뒤 성급하고 오류투성이인 이론을 세우면서 "초보자 거품"으로 과신이 빠르게 커졌다. 이후 시행이 이론을 바로잡으면서 자신감이 잠시 평평해졌고(수행은 조금씩 향상), 그 뒤 다시 오르기 시작했다. 금융 지식 자기평가도 젊은 성인기에 급등하고 중년에 평평하다가 노년에 다시 올랐고, 실제 지식은 그보다 느리게 꾸준히 올랐다.
- 의미와 한계: 인터넷 "자신감 곡선"의 첫 봉우리와 달리 출발점은 겸손했고, 자신감이 크게 떨어지는 "절망 골짜기" 대신 일시 정체가 관찰됐다. 초록만 읽어 효과크기는 확인하지 못했다. 생애 자료는 나이대별 응답자를 비교한 것으로, 같은 사람을 따라간 자료가 아니다.
나머지 문헌(한 줄)
- Mazor, M., & Fleming, S. M. (2021). The Dunning-Kruger effect revisited. Nature Human Behaviour, 5(6), 677-678. DOI: 10.1038/s41562-021-01101-z — Jansen 등 연구의 해설. 베이즈 수축으로 생기는 과대평가와 수행 의존 잡음을 설명하고, 시행별 확신 자료로 메타인지 효율을 따로 재야 한다고 제안.
- Moore, D. A., & Healy, P. J. (2008). The trouble with overconfidence. Psychological Review, 115(2), 502-517. DOI: 10.1037/0033-295X.115.2.502 — 과신을 과대추정·과대배치·과대정밀 셋으로 나누고, 어려운 과제에서 과대추정과 과소배치가 함께 나타나는 이유를 설명.
- McIntosh, R. D., Fowler, E. A., Lyu, T., & Della Sala, S. (2019). Wise up: Clarifying the role of metacognition in the Dunning-Kruger effect. Journal of Experimental Psychology: General, 148(11), 1882-1897. DOI: 10.1037/xge0000579 — 시행별 판단으로 잰 메타인지는 실력과 관련 있었지만 효과에 대한 순기여는 약했고, 성공률을 맞추자 패턴이 사라졌다. 메타인지 차이는 효과에 기여할 수 있지만 필요조건도 충분조건도 되지 못한다는 모형 제시.
- Pennycook, G., Ross, R. M., Koehler, D. J., & Fugelsang, J. A. (2017). Dunning–Kruger effects in reasoning: Theoretical implications of the failure to recognize incompetence. Psychonomic Bulletin & Review, 24(6), 1774-1784. DOI: 10.3758/s13423-017-1242-7 — 인지 반성 검사(CRT)에서 오답이 가장 많은 사람은 자기 점수를 3배 넘게 과대평가했고, 고득점자는 과소평가했다.
- Dunning, D. (2011). The Dunning–Kruger effect: On being ignorant of one's own ignorance. Advances in Experimental Social Psychology, 44, 247-296. DOI: 10.1016/B978-0-12-385522-0.00005-6 — 원저자의 후속 종합.
- Nuhfer, E., Cogan, C., Fleischer, S., Gaze, E., & Wirth, K. (2016). Random number simulations reveal how random noise affects the measurements and graphical portrayals of self-assessed competency. Numeracy, 9(1), Article 4. DOI: 10.5038/1936-4660.9.1.4 — 무작위 숫자 모의실험으로, 사분위 선 그래프·(y−x) 대 x 그림 같은 관행이 인공물을 만든다고 보임.
- Nuhfer, E., Fleischer, S., Cogan, C., Wirth, K., & Gaze, E. (2017). How random noise and a graphical convention subverted behavioral scientists' explanations of self-assessment data: Numeracy underlies better alternatives. Numeracy, 10(1), Article 4. DOI: 10.5038/1936-4660.10.1.4 — 과학 소양 자기평가 1,154명 자료. 자기평가는 대체로 실제 역량을 반영했고, 전문가가 초보보다 자기평가가 정확했다.
- Magnus, J. R., & Peresetsky, A. A. (2022). A statistical explanation of the Dunning–Kruger effect. Frontiers in Psychology, 13, 840180. DOI: 10.3389/fpsyg.2022.840180 — 점수 범위의 경계(0점·만점)를 반영한 단순 통계 모형이 심리적 설명 없이 자료를 거의 완벽하게 맞췄다.
비판·한계
재현성
- 패턴 자체는 잘 재현된다: 해설 논평은 원전 결과를 사회심리학에서 가장 재현이 잘 되는 결과 중 하나로 소개했고 [Mazor & Fleming 2021], 약 4,000명씩 두 번 재현에서도 저득점자의 과대평가가 나왔다 [Jansen et al. 2021]. 대학 시험·토론 대회·총기 동호회 같은 현장에서도 반복됐다 [Ehrlinger et al. 2008].
- 다투는 것은 해석이다: 같은 그림이 평균 이상 효과 + 회귀 [Krueger & Mueller 2002], 난이도에 따른 잡음 [Burson et al. 2006], 점수 경계 [Magnus & Peresetsky 2022], 무작위 숫자 [Nuhfer et al. 2016]로도 만들어진다. 929명 개인차 분석에서는 효과가 나타나지 않았다 [Gignac & Zajenkowski 2020].
대표 반론
- 반론 — 대부분 통계 인공물이다: 회귀나 평균 이상 효과를 빼면 비대칭이 사라지고 [Krueger & Mueller 2002], 이분산·곡선 검정에서 효과가 없으며 [Gignac & Zajenkowski 2020], 성공률을 맞추면 패턴이 사라진다 [McIntosh et al. 2019]. 과학 소양 1,154명 자료에서는 자기평가가 대체로 실제 역량을 반영했다 [Nuhfer et al. 2017].
- 원 주장 쪽 응답: 측정 신뢰도를 보정해도, 돈이나 책임 같은 유인을 줘도 저득점자의 과대평가는 남았고, 그 원인은 남이 아닌 자기 오류를 못 본 데 있었다 [Ehrlinger et al. 2008]. 인공물을 모형으로 통제한 대규모 재현도 저득점자의 정오 판단이 흐리다는 쪽을 지지했다 [Jansen et al. 2021].
- 현재 합의에 가까운 선: 저득점자의 자기평가가 더 부정확하다는 현상은 있는 쪽이 우세하다. 그 크기는 사분위 그림이 보여 주는 것보다 작고 [Gignac & Zajenkowski 2020], 그것을 "별도의 메타인지 결손"으로 불러야 하는지는 열려 있다 [Mazor & Fleming 2021; McIntosh et al. 2019].
쓰면 안 되는 상황
- 사람을 판정할 때: 상대를 "더닝-크루거"라 부르며 논증을 대신하는 것. 원전은 특정 과제의 자기평가를 쟀고 사람의 지능을 판정하지 않는다 [Kruger & Dunning 1999].
- "초보일수록 자신만만" 슬로건: 완전 초보는 처음에 과신하지 않았다 [Sanchez & Dunning 2018]. 어려운 과제에서는 오히려 상위권이 더 틀린다 [Burson et al. 2006].
- 인터넷 자신감 곡선을 근거로 쓸 때: 산봉우리 → 절망 골짜기 → 평원 그래프는 원논문에 없고, 학습 궤적을 실제로 잰 연구에서도 골짜기는 나타나지 않았다 [Sanchez & Dunning 2018].
- 사분위 그림 하나로 효과를 주장할 때: 같은 자료가 사분위로는 효과가 있어 보이고 개인차 통계로는 사라질 수 있다 [Gignac & Zajenkowski 2020].
관련 모델
- 평균 회귀 (Regression to the Mean) — 더닝-크루거 효과의 통계 비판의 핵심
- 메타인지 (Metacognition) — 자기 인지에 대한 인지
- 과신 편향 (Overconfidence Bias) — 자기 능력·예측에 대한 과대평가의 더 넓은 범주. 과대추정·과대배치·과대정밀로 나뉜다 [Moore & Healy 2008]
- 임포스터 신드롬 (Impostor Syndrome) — 실력 있는 사람이 자기 능력을 의심하는 현상. 더닝-크루거 상위권의 과소평가(남의 실력을 과대평가한 탓)와는 원인이 다르다
사고 도구 다른 글