노이즈 감사 / 판단 위생 (Noise Audit)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 판단 위생 · 잡음 감사 · Noise Audit
한 줄 정의
같은 기준을 적용해야 하는 판단들이 사람, 시간, 순서, 기분에 따라 불필요하게 달라지는 정도(노이즈)를 측정하고 줄이는 사고도구. 노이즈는 "같은 문제에 대한 판단의 바람직하지 않은 변동"이다 [Kahneman, Sibony & Sunstein 2021].
일상 한 줄
사격으로 치면 편향은 탄착이 표적에서 한쪽으로 몰려 빗나간 것이고, 노이즈는 탄착이 서로 흩어진 것이다 [Kahneman et al. 2021]. 두 금융 서비스 조직의 노이즈 감사에서 같은 사례를 본 전문가 두 명의 판단은 평균 48%와 60% 차이가 났다. 경영진은 5~10%를 예상했다 [Kahneman, Rosenfield, Gandhi & Blaser 2016].
흔한 장면
- 같은 이력서를 평가자마다 전혀 다르게 평가한다.
- 같은 잘못에 징계 수위가 회의 분위기마다 달라진다.
- 견적, 리뷰, 성과평가가 기준보다 담당자 성향에 좌우된다.
- 오전과 오후의 판단이 다르지만 아무도 기록하지 않는다.
왜 빠지나 (메커니즘)
- 레벨 노이즈(level noise, 수준 차이) [Kahneman et al. 2021] — 평가자마다 전반적으로 엄격하거나 관대하다. 모든 사례에 걸쳐 평균이 다른 사람보다 높거나 낮다.
- 패턴 노이즈(pattern noise, 사례별 반응 차이) [Kahneman et al. 2021] — 같은 평가자라도 특정 유형 사례에만 남들과 다르게 반응한다(평가자×사례 상호작용). 여기에는 그 사람의 안정된 취향에서 오는 부분과, 그날그날 달라지는 부분이 섞여 있다.
- 상황 노이즈(occasion noise, 그때그때 차이) [Kahneman et al. 2021] — 패턴 노이즈 가운데 일시적인 부분이다. 같은 사람이 같은 사례를 봐도 시간·기분·순서에 따라 판단이 달라진다.
- 분산은 숨겨진다 [Kahneman et al. 2016] — 평균적으로 공정해 보여도 개별 판단의 흩어짐은 드러나지 않는다. 한 사례를 한 사람만 맡으면 다른 사람이 어떻게 판단했을지 볼 기회가 없다. 감사 전 경영진은 5~10% 차이를 예상했지만 실제 노이즈 지수는 조직 A 평균 48%, 조직 B 평균 60%였다. 5년 이상 경력자끼리도 46%와 62%였다. 책은 한 보험사 감사에서 인수심사역 두 명의 견적 차이 중앙값이 55%로, 경영진 예상(약 10%)을 크게 넘었다고 소개했다 Kahneman et al. 2021.
- 직관에 대한 과신 [Highhouse 2008] — 채용 등에서 사람들이 구조화된 절차보다 자기 직관·종합 판단을 고집하며 그 일관성을 과대평가한다.
빠져나오는 법
1. 같은 사례를 여러 사람이 독립 평가하게 한다. — 근거: 현장 감사 사례 Kahneman et al. 2016 2. 평가 전 기준과 가중치를 고정한다. — 근거: 메타분석 Grove et al. 2000; Kuncel et al. 2013, 구조화 면접이 선발 타당도 1위 [Sackett et al. 2022] 3. 평가자 간 분산을 확인한다. — 근거 수준: 경험칙(분산 확인만으로 노이즈가 준다는 직접 검증 연구 없음). 재는 방법은 [Kahneman et al. 2016] 4. 큰 차이가 나는 항목은 기준을 구체화한다. — 근거 수준: 경험칙(직접 검증 연구 없음). 편향이 큰 판단이면 기준을 좁히기 전에 편향부터 점검한다 [Szreder 2022] 5. 최종 판단 전에 독립 판단을 평균하거나 구조화한다. 두 판단이 정답 양쪽에 걸치는 일이 한 번이라도 있으면 평균은 평균적인 한 사람보다 정확하다(오차 절댓값 기준). 사람들은 이 이득을 흔히 과소평가한다 [Larrick & Soll 2006]. — 근거: 실험 [Larrick & Soll 2006]
함께 쓰기 좋은 도구
- 앵커링 — 첫 정보가 판단을 끌고 가는 문제
- 집단 사고 — 독립 판단이 사라지는 문제
- 심리적 안전 — 평가 기준에 이견 제기
- 인센티브 호환성 — 평가자가 왜곡할 동기
통념이 무너지는 순간
"공정한 사람을 뽑으면 공정한 판단이 나온다"
⚠ 흔한 말: "선의의 전문가에게 맡기면 일관된 판단이 나온다." ✓ 학술: 두 금융 서비스 조직에서 같은 사례를 본 전문가 두 명의 판단 차이(노이즈 지수)는 조직 A 평균 48%(사례별 34~62%), 조직 B 평균 60%(46~70%)였다. 경력 5년 이상끼리도 차이가 줄지 않았다 [Kahneman et al. 2016]. 같은 자격·지침이어도 판단은 흩어진다. 공정한 판단에는 좋은 사람과 함께 좋은 절차(판단 위생, decision hygiene)가 필요하다.
"편향만 줄이면 된다"
⚠ 흔한 말: "판단 오류는 곧 편향이니 편향만 잡으면 된다." ✓ 학술: 오류에는 방향성 있는 편향과 무작위적 흩어짐인 노이즈가 모두 있다 [Kahneman et al. 2021]. 전체 오차(평균제곱오차)는 편향² + 노이즈²로 나뉘므로, 편향과 노이즈는 같은 크기만큼 오차를 늘린다. 평균이 맞아도 노이즈가 크면 개별 판단은 틀린다.
"어디나 판단은 있지만 노이즈는 큰 문제가 아니다"
⚠ 흔한 말: "사람마다 조금씩 다른 건 당연하고 큰 비용은 아니다." ✓ 학술: 판단이 있는 곳엔 생각보다 많은 노이즈가 있다고 책은 정리했다 [Kahneman et al. 2021]. HBR 감사의 한 조직은 판단이 틀렸을 때의 비용을 추정했는데, 1년 치를 합치면 노이즈 비용이 수십억 달러 단위였다 [Kahneman et al. 2016].
"직관으로 보는 종합 판단이 기계적 점수보다 낫다"
⚠ 흔한 말: "사람을 직접 보고 종합적으로 판단해야 진짜다." ✓ 학술: 채용·입학 선발 메타분석에서 전문가가 자료를 종합 판단으로 합치면 기계적 공식으로 합칠 때보다 예측 타당도가 일관되게 떨어졌고, 직무 수행 예측에서 기계적 방식이 50% 넘게 더 나았다 [Kuncel et al. 2013]. 그런데도 실무자는 직관적 종합 판단을 고집한다 [Highhouse 2008].
1차 출처
- Kahneman, D., Rosenfield, A. M., Gandhi, L., & Blaser, T. (2016). "Noise: How to overcome the high, hidden cost of inconsistent decision making." Harvard Business Review, October 2016. 노이즈 감사 절차와 노이즈 지수를 처음 제시.
- Kahneman, D., Sibony, O., & Sunstein, C. R. (2021). Noise: A Flaw in Human Judgment. Little, Brown Spark. 노이즈의 분해(레벨·패턴·상황)와 판단 위생을 정리한 책.
원문 핵심 인용
- 노이즈의 정의 [Kahneman et al. 2016]: "We call the chance variability of judgments noise. It is an invisible tax on the bottom line of many companies." (verbatim 검증: 2026-09, HBR 전문)
- 노이즈 감사 결과 [Kahneman et al. 2016]: "The noise index ranged from 34% to 62% for the six cases in organization A, and the overall average was 48%. In the four cases in organization B, the noise index ranged from 46% to 70%, with an average of 60%." 감사 전 경영진은 "to range from 5% to 10%" 로 예상했다. (verbatim 검증: 2026-09, HBR 전문)
- 노이즈 비용 [Kahneman et al. 2016]: "Aggregated over the assessments made every year, the cost of noise was measured in billions" (verbatim 검증: 2026-09, HBR 전문)
- 노이즈 정의(책) [Kahneman et al. 2021]: "undesirable variability in judgments of the same problem" (같은 문제에 대한 판단의 바람직하지 않은 변동). (원문 대조 못 함 — 2차 출처 기반)
- decision hygiene [Kahneman et al. 2021]: "the use of various techniques that can reduce noise in human judgment." (원문 대조 못 함 — 2차 출처 기반)
핵심 정의·메커니즘
원전 정의
- 노이즈: Kahneman 등은 HBR 글에서 "판단의 우연한 변동을 노이즈라 부른다"고 정의했다. 같은 사례면 같아야 할 판단이 판단자·시점에 따라 흩어지는 정도다. 모든 판단이 한쪽으로 치우치는 편향과 구분한다 [Kahneman et al. 2016].
- 측정상의 특징: 같은 글은 "편향과 달리 노이즈는 정답을 몰라도 잴 수 있다"고 적었다. 판단끼리 얼마나 어긋나는지만 보면 되기 때문이다 [Kahneman et al. 2016].
- 오차 방정식: 평균제곱오차(MSE) = 편향² + 노이즈². 책은 이 식을 "이 책의 지적 토대"라 부르고, 같은 크기만큼 줄이면 편향이든 노이즈든 MSE에 같은 효과를 낸다고 썼다 [Kahneman et al. 2021; Szreder 2022 인용].
- 노이즈의 분해 [Kahneman et al. 2021]: 시스템 노이즈² = 레벨 노이즈² + 패턴 노이즈². 레벨 노이즈는 판단자별 평균의 차이(엄격/관대), 패턴 노이즈는 판단자×사례의 상호작용이다. 패턴 노이즈 안에는 같은 사람이 때에 따라 달라지는 상황 노이즈가 들어 있다.
작동 기제
1. 판단은 규칙이 아닌 경험·일반 원칙으로 한다 → 의사·대출 심사역·판사·임원의 판단은 엄격한 규칙보다 비공식 경험에 기댄다. 그래서 같은 자료를 봐도 사람마다 무게를 다르게 준다 [Kahneman et al. 2016]. 2. 사례는 사람에게 무작위로 배정된다 → 신용평가·응급실·보험 심사처럼 담당자가 우연히 정해지면, 판단자 사이의 차이가 곧 당사자가 받는 결과의 차이가 된다 [Kahneman et al. 2016]. 미국 난민 심사에서는 같은 사무소·같은 출신국 신청자를 많이 본 심사관끼리도 인정률이 크게 달랐고, 저자들은 "신청서가 어느 심사관에게 무작위로 배정되는 순간"이 사건에서 가장 중요한 순간인 경우가 많다고 적었다 [Ramji-Nogales et al. 2007]. 3. 피드백이 느리면 경력이 노이즈를 못 줄인다 → 경력은 자신감만 높인다. 빠른 피드백이 없으면 자신감은 정확성도 합의도 보장하지 않는다. 감사에서 5년 이상 경력자의 평균 불일치도 46%·62%로 전체 평균과 비슷했다 [Kahneman et al. 2016]. 4. 자기 판단의 신뢰도를 모른다 → 감사 전 경영진은 판단 차이를 5~10%로 예상했지만 실제는 평균 48%·60%였다 [Kahneman et al. 2016]. 5. 여러 판단을 합치면 노이즈가 줄어드는데, 사람들은 이걸 과소평가한다 → 두 판단이 정답의 양쪽에 걸치면(bracketing) 평균은 두 판단자의 평균 오차보다 반드시 정확하다(오차를 절댓값으로 잴 때). 그런데 세 실험의 참가자들은 "두 사람 평균은 평균적인 한 사람보다 나을 게 없다"고 흔히 믿었다 [Larrick & Soll 2006].
언제 강해지고 언제 약해지나
- 판단자가 여럿이고 배정이 우연일 때 커진다: 레벨 노이즈가 결과 차이로 바로 이어진다 [Kahneman et al. 2016; Ramji-Nogales et al. 2007].
- 면접 같은 임상 자료가 섞일 때 커진다: 임상 판단은 예측 변수에 임상 면접 자료가 들어갈 때 기계적 예측보다 상대적으로 더 못했다 [Grove et al. 2000].
- 판단을 공식으로 합치면 줄어든다: 판단자 자신의 판단을 회귀식으로 옮긴 모형도 판단자보다 정확했다(임상심리학자 29명의 MMPI 진단) [Goldberg 1970]. 같은 가중치의 단순 선형 모형도 임상 직관보다 나았다 [Dawes 1979].
- 편향이 노이즈보다 훨씬 크면 노이즈 축소의 이득이 작거나 거꾸로 된다: 판단 분포가 정답에서 비켜 있을 때 분산을 줄이면 정답 근처에 떨어지는 판단의 확률은 오히려 줄어든다 [Szreder 2022].
어떻게 재나
- 노이즈 감사(noise audit): 한 부서 전문가들이 실제와 같은 사례 여러 건을 서로 모르게 독립 평가한다. 담합을 막으려고 신뢰도 연구라는 사실은 알리지 않는다. 사례마다 무작위 두 사람의 판단 차이를 둘의 평균으로 나눈 값(노이즈 지수)을 모든 쌍에 대해 평균한다. 예: $600과 $1,000 → 차이 $400 / 평균 $800 = 50% [Kahneman et al. 2016].
- 평가자 간·평가자 내 신뢰도: 같은 대상을 여러 평가자가 매긴 점수의 상관(평가자 간), 같은 평가자가 시간을 두고 다시 매긴 점수의 상관(평가자 내)으로 레벨·패턴·상황 성분을 가른다. 직무 수행 평정 메타분석에서 상사 평정의 평가자 간 신뢰도 평균은 .52였고, 모든 경우에 평가자 간 신뢰도가 평가자 내 신뢰도보다 낮았다 [Viswesvaran et al. 1996].
- 행정 기록 분석: 우연히 배정된 판단자별 결정 비율을 비교한다. 미국 난민 심사관 884명의 결정 13만 3천 건, 이민 판사 225명의 결정 14만 건 등 네 단계 기록을 분석했다 [Ramji-Nogales et al. 2007].
헷갈리는 개념과의 차이
- 편향: 판단 평균이 정답에서 한쪽으로 비켜 있는 것. 정답을 알아야 잴 수 있다. 노이즈는 판단끼리의 흩어짐이라 정답 없이도 잰다 [Kahneman et al. 2016].
- 집단 지성(군중의 지혜): 서로 독립인 판단의 흩어짐을 평균으로 상쇄하는 방법. 노이즈를 없애는 도구로 쓰인다 [Larrick & Soll 2006]. 토론으로 합의를 구하면 집단 극화 같은 사회적 영향이 새 노이즈를 만들 수 있다 [Szreder 2022].
- 바람직한 다양성: 창작 평가·아이디어 발굴처럼 정답이 없고 서로 다른 관점이 가치인 판단의 변동. 책의 정의는 "바람직하지 않은" 변동만 노이즈로 부른다 [Kahneman et al. 2021].
주요 후속 연구·메타분석
### Kahneman, Rosenfield, Gandhi & Blaser (2016) — 경영진 예상 5~10%, 실제 불일치 48~60% Harvard Business Review, 2016년 10월호. (DOI 없음)
- 설계: 금융서비스 두 조직의 전문가(조직 A 약 70명, 조직 B 약 50명)가 실제와 같은 사례(A 6건, B 4건)를 독립 평가. 무작위 두 사람 판단 차이를 평균으로 나눈 노이즈 지수를 계산.
- 결과: 조직 A 사례별 노이즈 지수 34~62%, 평균 48%. 조직 B 46~70%, 평균 60%. 경영진 사전 예상은 5~10%. 5년 이상 경력자의 불일치도 46%·62%로 줄지 않았다.
- 의미와 한계: 노이즈를 정답 없이 싸게 재는 절차를 제시했다. 두 조직뿐이라 산업 전체 수준으로 일반화할 수 없고, 동료심사 논문이 아닌 경영지 기고다.
### Grove, Zald, Lebow, Snitz & Nelson (2000) — 공식이 사람보다 평균 10% 정확하다 Psychological Assessment, 12(1), 19–30. DOI: 10.1037/1040-3590.12.1.19
- 설계: 인간의 건강·행동을 예측한 연구들에서 임상(사람이 종합) 예측과 기계적(공식·통계) 예측의 정확도를 비교한 메타분석.
- 결과: 기계적 예측이 평균 약 10% 더 정확했다. 기계가 크게 앞선 연구는 분석에 따라 33~47%, 임상이 크게 앞선 연구는 6~16%. 과제·판단자 유형·경력·자료 유형과 관계없이 일관됐다.
- 의미와 한계: 사람이 같은 자료를 매번 다르게 합치는 노이즈가 정확도를 깎는다는 해석과 맞는다. 임상이 공식과 비슷한 연구도 많았다.
### Kuncel, Klieger, Connelly & Ones (2013) — 채용·입학에서 종합 판단은 타당도를 잃는다 Journal of Applied Psychology, 98(6), 1060–1072. DOI: 10.1037/a0034156
- 설계: 채용·입학 결정에서 같은 자료를 공식으로 합칠 때와 사람이 종합 판단으로 합칠 때의 예측력 메타분석. 준거는 승진·상사 평정·훈련 성과·학점.
- 결과: 직무와 조직을 잘 아는 전문가가 합쳐도 여러 준거에서 타당도가 일관되고 크게 떨어졌다. 직무 수행 예측에서 기계적 결합의 개선 폭은 50%를 넘었다.
- 의미와 한계: 현장 실무자가 여전히 종합 판단을 선호한다는 점을 저자들이 문제로 짚었다. 초록 기준 서술이며 개별 타당도 계수는 초록에 없다.
### Sackett, Zhang, Berry & Lievens (2022) — 보정을 고쳐도 구조화 면접이 선발 타당도 1위 Journal of Applied Psychology, 107(11), 2040–2068. DOI: 10.1037/apl0000994
- 설계: 인사 선발 절차의 예측 타당도에 관한 기존 메타분석 결론을 다시 검토했다. 범위 제한(range restriction, 합격자만 성과가 관찰돼 상관이 작아지는 현상)을 보정할 때 흔히 쓰던 다섯 가지 방식을 하나씩 비판하고, 보정을 고쳐 타당도를 다시 추정했다. 선발 절차별 흑인-백인 평균 차이도 함께 제시했다.
- 결과: 다섯 방식 모두 과잉 보정 문제가 있어 많은 선발 절차의 타당도가 크게 부풀려져 있었다고 결론지었다. 다시 추정해도 기존 상위 절차 대부분은 상위에 남았지만 평균 타당도는 .10~.20 낮아졌다. 구조화 면접이 1위 선발 절차로 나왔다. 절차별 계수는 초록에 없다.
- 의미와 한계: 질문과 채점 기준을 미리 고정한 면접이 가장 잘 예측한다는 결과는 "평가 전 기준을 고정하라"는 판단 위생 처방과 방향이 같다. 다만 이 연구가 잰 것은 예측 타당도이고, 평가자 간 노이즈가 줄었는지를 직접 잰 연구는 아니다. 초록만 읽었다.
### Ramji-Nogales, Schoenholtz & Schrag (2007) — 난민 심사는 누구에게 배정되느냐의 제비뽑기 Stanford Law Review, 60(2), 295쪽부터. (DOI 없음)
- 설계: 미국 난민 심사 네 단계의 결정 기록. 심사관 884명의 13만 3천 건(7년), 이민 판사 225명의 14만 건(4년 반), 이민항소위원회 12만 6천 건(6년), 연방항소법원 4,215건(2004~2005).
- 결과: 같은 사무소에서 같은 나라 신청자를 많이 본 심사관끼리도 인정률 격차가 유의하게 컸다. 변호인 유무, 판사의 성별, 임용 전 경력이 인정 가능성과 강하게 관련됐다.
- 의미와 한계: 레벨 노이즈가 행정 현장에서 사람의 운명을 가르는 사례다. 저자들은 할당제를 권하지 않고 교육 강화·독립적 항소 심사 등 전문화 개혁을 제안했다. 초록 기준 서술이며 격차의 구체 수치는 초록에 없다.
### Larrick & Soll (2006) — 평균의 힘을 사람들은 믿지 않는다 Management Science, 52(1), 111–127. DOI: 10.1287/mnsc.1050.0459
- 설계: 네 실험. 요약 자료(실험 1), 구체 사례(실험 2), 개념 수준(실험 3)에서 "두 사람 추정의 평균이 평균적인 한 사람보다 나은가"를 판단하게 했다. 실험 4는 추론 규칙과 외연적 추론 능력을 쟀다.
- 결과: 두 판단이 정답 양쪽에 걸치는 경우가 있으면 평균이 평균적 판단자보다 반드시 낫다(오차 절댓값 기준). 그런데 참가자 다수가 평균이 나을 게 없다고 잘못 믿었다. 양쪽에 걸치는 비율이 높거나 그 사실이 잘 보일 때 오해가 줄었다.
- 의미와 한계: "독립 판단을 모아 평균하라"는 처방이 왜 현장에서 안 쓰이는지 설명한다. 평균의 이득 크기는 초록에 수치로 없다.
### Danziger, Levav & Avnaim-Pesso (2011) — 상황 노이즈의 대표 사례와 그 반론 PNAS, 108(17), 6889–6892. DOI: 10.1073/pnas.1018033108
- 설계: 이스라엘 가석방 심사의 연속 결정. 하루 두 번의 식사 휴식으로 나뉜 세 회기 안에서 결정 순서에 따른 가석방 허가 비율을 분석.
- 결과: 허가 비율이 회기 초 약 65%에서 회기 끝 거의 0으로 떨어졌다가 휴식 뒤 약 65%로 돌아왔다.
- 의미와 한계: 반론이 두 갈래로 나왔다. 사건 순서가 무작위가 아니었다는 지적: 한 교도소 사건을 모두 끝내고 쉬며, 변호인 없는 수감자가 회기 끝에 몰리고(허가율 15% vs 변호인 있을 때 35%), 연기 결정을 기각과 합쳐 셌다 [Weinshall-Margel & Shapard 2011]. 허가 결정이 기각보다 오래 걸린다는 점만으로도 비슷한 크기의 패턴이 생긴다는 시뮬레이션도 있다 [Glöckner 2016].
나머지 문헌(한 줄)
- Viswesvaran, C., Ones, D. S., & Schmidt, F. L. (1996). Comparative analysis of the reliability of job performance ratings. Journal of Applied Psychology, 81(5), 557–574. DOI: 10.1037/0021-9010.81.5.557. — 상사의 전반적 직무 수행 평정의 평가자 간 신뢰도 평균 .52. 평가자 간 신뢰도는 모든 경우 평가자 내 신뢰도보다 낮았다.
- Dawes, R. M. (1979). The robust beauty of improper linear models in decision making. American Psychologist, 34(7), 571–582. DOI: 10.1037/0003-066X.34.7.571. — 직관·판단자 모사·같은 가중치로 정한 "부적절한" 선형 모형도 임상 직관보다 나았다.
- Goldberg, L. R. (1970). Man versus model of man. Psychological Bulletin, 73(6), 422–432. DOI: 10.1037/h0029230. — 임상심리학자 29명의 MMPI 진단에서 판단자를 본뜬 모형이 대체로 판단자보다 타당했다. 적은 사례로 만든 모형을 새 사례에 써도 같았다.
- Szreder, M. (2022). Noise and bias – some controversies raised by the book 'Noise: A Flaw in Human Judgment'. Przegląd Statystyczny, 69(1), 39–49. DOI: 10.5604/01.3001.0015.8792. — 편향이 있을 때 노이즈를 줄이면 정답 근처 판단 확률이 줄 수 있다는 통계학 쪽 비판.
- Gilhooly, K. J., & Sleeman, D. H. (2022). To differ is human: A reflective commentary on "Noise". Applied Cognitive Psychology, 36(3), 724–730. DOI: 10.1002/acp.3941. — 책의 기여를 노이즈의 보편성 환기·분류 체계·축소 방법으로 정리하고, 사회적 판단 이론(SJT)의 선형 결합 접근과 비교.
- Weinshall-Margel, K., & Shapard, J. (2011). Overlooked factors in the analysis of parole decisions. PNAS, 108(42). DOI: 10.1073/pnas.1110910108.
- Glöckner, A. (2016). The irrational hungry judge effect revisited: Simulations reveal that the magnitude of the effect is overestimated. Judgment and Decision Making, 11(6), 601–610. DOI: 10.1017/S1930297500004812.
- Highhouse, S. (2008). Stubborn reliance on intuition and subjectivity in employee selection. Industrial and Organizational Psychology, 1(3), 333–342. DOI: 10.1111/j.1754-9434.2008.00058.x. — 채용에서 직관적 종합 판단에 대한 과신이 구조화 절차 채택을 막는다는 논의.
- Weijers & Dierynck (2025). "Noise in Audit Judgments." SSRN 워킹페이퍼(동료심사 전). DOI: 10.2139/ssrn.5116490. — 회계감사 판단에 노이즈 개념을 적용한 보조 자료.
비판·한계
재현성
- 노이즈 감사 자체는 두 조직 결과뿐이고 동료심사를 거친 대규모 재현은 이 카드에서 확인하지 못했다 [Kahneman et al. 2016].
- 임상 대 기계 예측의 우열은 여러 메타분석에서 같은 방향으로 반복됐다 [Grove et al. 2000; Kuncel et al. 2013].
- 상황 노이즈의 간판 사례인 "배고픈 판사" 결과는 사건 순서 문제와 통계적 인공물 반론을 받았다 [Weinshall-Margel & Shapard 2011; Glöckner 2016]. 상황 노이즈가 있다는 점보다 그 크기를 조심해서 읽는다.
대표 반론
- "편향과 노이즈는 같은 무게" 비판: MSE 기준으로는 맞지만, 판단이 정답 근처에 떨어질 확률을 기준으로 삼으면 편향이 있을 때 노이즈 축소가 오히려 손해일 수 있다. 책의 "편향이 노이즈보다 훨씬 크면 노이즈 축소는 우선순위가 낮다"는 문장은 이 문제를 우선순위 문제로만 다뤘다는 지적이다 [Szreder 2022]. 책 쪽 입장은 두 성분 모두 MSE를 같은 비율로 늘린다는 것이다.
- 정답 없는 판단의 적용 범위: 가상 시나리오·장기 예측처럼 정확도를 확인할 수 없는 판단은 평가 자체가 어렵다. 책은 확인 가능하면 결과와 비교하고, 동시에 판단 과정의 질을 보라고 제안한다 [Szreder 2022 요약]. 노이즈는 정답 없이 잴 수 있지만, 그 노이즈가 "바람직하지 않은" 변동인지는 정답이나 합의된 기준이 있어야 가린다.
- 구조화의 비용: 규칙·알고리즘은 사례의 고유 사정을 놓칠 수 있고, 학습 자료의 편향을 일관되게 재생산한다. 노이즈가 줄어도 편향은 남는다. 책 쪽 응답은 사람도 편향과 노이즈를 함께 지니므로 비교 대상은 완벽한 판단이 아닌 실제 사람 판단이라는 것이다 [Kahneman et al. 2016].
쓰면 안 되는 상황
- 정답도 합의된 기준도 없는 판단: 창작 평가·혁신 아이디어처럼 다양한 관점이 가치인 곳에서 변동을 줄이는 것 자체가 목표가 되면 안 된다.
- 편향이 노이즈보다 훨씬 큰 판단: 모두가 같은 방향으로 틀리는 상황에서 흩어짐만 줄이면 틀린 답으로 더 단단히 모인다 [Szreder 2022]. 편향 점검을 먼저 한다.
- 건수가 적고 되돌릴 수 있는 일상 결정: 감사 비용이 이익보다 크다. 고위험·반복 판단(채용·보험·대출·의료·양형·난민 심사)부터 적용한다.
관련 모델
- 앵커링, 집단 사고, 심리적 안전, 인센티브 호환성, 기저율 무시
사고 도구 다른 글