AI 신뢰 보정 (AI Trust Calibration)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: AI 신뢰도 보정 · AI Trust Calibration
한 줄 정의
AI·알고리즘·자동화 시스템의 조언을 과신하지도, 작은 오류 하나 때문에 과소신뢰하지도 않도록 신뢰 수준을 보정하는 사고도구.
일상 한 줄
AI가 맞았는지 틀렸는지 한 번으로 판단하지 말고, 작업별 정확도·검증 비용·오류 비용에 맞춰 신뢰도를 조절한다.
흔한 장면
- 내비게이션이 알려준 길을 위험해 보여도 그대로 따른다.
- AI가 한 번 틀린 뒤 모든 답을 쓸모없다고 판단한다.
- 자동 추천 점수 때문에 사람의 정성 평가를 무시한다.
- 의료·채용·투자처럼 고위험 영역에서 자동화 결과를 "객관적"이라고 착각한다.
왜 빠지나
- 자동화 결과는 숫자·차트·확률로 나오기 때문에 객관적으로 보이고, 주의 깊은 정보 탐색을 휴리스틱으로 대체하게 만든다. [Goddard 2012]
- 사람은 기계가 틀린 장면을 보면 인간보다 더 빨리 신뢰를 거두어 알고리즘 회피에 빠진다. [Dietvorst 2015]
- 시스템의 평균 정확도와 내 사례의 오류 비용을 구분하지 못한다 — 모델이 인간보다 정확해도(MBA 예측 과제에서 사람이 모델보다 15~29% 더 큰 오차) 한 번의 실수가 회피를 부른다. [Dietvorst 2015]
- 혼자서는 맞혔을 판단을 틀린 조언을 보고 바꾼 경우가 임상 의사결정지원 전향 연구에서 판단의 6~11%였다. 업무량·과제 복잡도·시간 압박이 클수록 이런 과의존이 늘고, 사용자에게 판단 책임을 강조하면 줄어든다. [Goddard 2012]
빠져나오는 법
1. 이 시스템이 어떤 데이터와 목표로 만들어졌는지 확인한다. (근거 수준: 경험칙. 신뢰의 특정성 이론 [Lee & See 2004]에서 끌어냄) 2. 내 상황이 학습 데이터와 비슷한지 묻는다. (근거 수준: 경험칙. 직접 검증 연구 없음) 3. 틀렸을 때 비용이 낮으면 자동화 조언을 더 활용한다. (근거 수준: 경험칙. 직접 검증 연구 없음) 4. 틀렸을 때 비용이 높으면 독립 검증 또는 인간 전문가 판단을 붙인다. (근거 수준: 경험칙. 1~4번을 직접 시험한 실험은 없다. AI가 사람보다 나은 과제에서는 사람이 개입한 조합이 AI 단독보다 못했다 [Vaccaro 2024]) 5. 한 번의 성공·실패 대신 쌓인 성능 기록으로 신뢰도를 갱신한다. 시스템이 자기 확신도(confidence)를 조언과 함께 표시하면 적정 의존이 개선된다는 보고가 있다 [Goddard 2012; Steyvers 2025]. 106개 실험 메타분석에서는 확신도 표시의 효과가 유의하지 않았다 [Vaccaro 2024]. (근거: 실험 [Steyvers 2025]과 체계적 고찰 [Goddard 2012]은 효과 있음, 메타분석 [Vaccaro 2024]은 유의하지 않음. 엇갈린다) 6. 조언을 화면에서 덜 두드러지게 두고, 권고보다 참고 정보 형태로 받으면 자동화 편향이 줄어든다. [Goddard 2012] (근거: 체계적 고찰. 임상 의사결정지원 연구) 7. AI 답을 보기 전에 내 답을 먼저 정해 두면, 틀린 추천을 그대로 받아들이는 일이 줄어든다. [Buçinca 2021] (근거: 실험 N = 199. 참가자 만족도는 가장 낮았다) 8. AI 출력을 조금이라도 고칠 수 있게 해 두면, 한 번 틀렸다고 AI를 통째로 버리는 반응이 줄어든다. [Dietvorst 2018] (근거: 실험. 예측 과제)
함께 쓰기 좋은 도구
- AI 위임 경계선 — 어떤 작업을 맡길지 판단
- AI 검증 루프 — 산출물 검증
- 권위 편향 — 자동화 권위에 대한 과신 점검
- 예측 보정 — 확률 판단 기록과 보정
통념이 무너지는 순간
"알고리즘은 사람보다 객관적이다 — 숫자니까 믿을 만하다"
⚠ 흔한 말: "AI/모델이 낸 점수는 사람 감정이 안 들어가니 더 공정하다." ✓ 학술: Goddard, Roudsari & Wyatt (2012) — 임상 의사결정지원(CDSS) 사용 시 자동화 조언을 "주의 깊은 정보 탐색·처리의 휴리스틱 대체물"로 받아들이며, 전향적 연구에서 조언 전에는 맞았던 판단을 조언을 본 뒤 틀린 답으로 바꾼 부정적 자문(negative consultation)이 사례의 6~11%였다. 숫자로 나온 출력도 틀릴 수 있고, 사람은 그 출력을 확인 없이 받아들이는 쪽으로 기운다. [Goddard 2012]
"알고리즘이 한 번 틀렸으니 더는 믿으면 안 된다"
⚠ 흔한 말: "AI가 틀리는 걸 봤다 — 역시 사람한테 맡기는 게 낫다." ✓ 학술: Dietvorst, Simmons & Massey (2015) — 5개 실험에서 모델과 사람의 예측을 모두 본 참가자 대부분(5개 연구 합산 741명 중 610명, 83%)은 연습 단계에서 모델이 사람보다 잘 맞히는 것을 봤다. 그런데도 모델이 틀리는 장면을 본 집단은 그러지 않은 집단보다 모델을 덜 골랐다. 사람의 오류를 본 것은 사람 선택을 유의하게 줄이지 않았다. 같은 실수에도 알고리즘에 더 가혹하다. [Dietvorst 2015]
1차 출처
- Goddard, K., Roudsari, A., & Wyatt, J. C. (2012). "Automation bias: a systematic review of frequency, effect mediators, and mitigators." Journal of the American Medical Informatics Association, 19(1), 121-127. DOI: 10.1136/amiajnl-2011-000089.
- Parasuraman, R., & Riley, V. (1997). "Humans and automation: Use, misuse, disuse, abuse." Human Factors, 39(2), 230-253. DOI: 10.1518/001872097778543886.
- Lee, J. D., & See, K. A. (2004). "Trust in automation: Designing for appropriate reliance." Human Factors, 46(1), 50-80. DOI: 10.1518/hfes.46.1.5030392. — '신뢰 보정' 개념의 원전.
- Dietvorst, B. J., Simmons, J. P., & Massey, C. (2015). "Algorithm aversion: People erroneously avoid algorithms after seeing them err." Journal of Experimental Psychology: General, 144(1), 114-126. DOI: 10.1037/xge0000033.
원문 핵심 인용
"We show that people are especially averse to algorithmic forecasters after seeing them perform, even when they see them outperform a human forecaster. This is because people more quickly lose confidence in algorithmic than human forecasters after seeing them make the same mistake." — Dietvorst, Simmons & Massey (2015), 초록 (verbatim 검증: 2026-05-31, Wharton OA PDF에서 텍스트 추출·대조)
"... over-accept computer output 'as a heuristic replacement of vigilant information seeking and processing.' ... The proportion of decisions which demonstrated this ranged from 6% to 11% of cases in prospective empirical studies." — Goddard, Roudsari & Wyatt (2012), 본문 (verbatim 검증: 2026-09-27, PMC3240751 본문에서 재대조)
핵심 정의·메커니즘
- ### 원전 정의
- 신뢰 보정(calibration of trust) — Lee & See (2004): 사람이 자동화에 거는 신뢰가 그 자동화의 실제 능력과 맞는 정도. 신뢰가 능력보다 높으면 과신(overtrust), 낮으면 불신(distrust). 여기에 해상도(resolution, 능력 차이를 신뢰 차이로 얼마나 가려내나)와 특정성(specificity, 기능별·시점별로 신뢰를 나눠 주나)을 더해 적정 신뢰를 정의했다. 초록의 표현으로 신뢰는 "복잡하고 예상 못 한 상황 때문에 자동화를 완전히 이해하기 어려울 때" 의존을 이끈다.
- 사용·오용·불용 — Parasuraman & Riley (1997): 자동화를 지나치게 믿고 기대는 오용(misuse)과, 쓸 만한 자동화를 믿지 않아 쓰지 않는 불용(disuse). 이 카드의 두 함정인 자동화 편향과 알고리즘 회피가 각각 여기에 해당한다.
- 알고리즘 회피(algorithm aversion) — Dietvorst, Simmons & Massey (2015): 사람은 알고리즘 예측자가 일하는 것을 본 뒤 특히 피한다. "같은 실수를 봐도 사람보다 알고리즘에 대한 확신을 더 빨리 잃기 때문" 이다.
- 적정 의존(appropriate reliance)의 조작적 정의 — Schemmer et al. (2023)은 의존의 적절성(Appropriateness of Reliance, AoR)을 두 비율로 쪼갰다. 상대적 AI 의존(RAIR) = 내가 처음 틀렸고 AI가 맞았을 때 AI를 따라 고친 비율. 상대적 자기 의존(RSR) = 내가 처음 맞았고 AI가 틀렸을 때 내 답을 지킨 비율. 둘 다 1이면 이상적이다.
### 작동 기제 1. 신뢰 형성: 세 층 → 신뢰는 성향 신뢰(개인 기질), 상황 신뢰(과제·환경), 학습된 신뢰(시스템을 겪으며 쌓인 경험) 세 층에서 흔들린다 [Hoff & Bashir 2015]. 이 요인들을 양적으로 모은 메타분석에서 요인 전체의 신뢰 형성 효과는 중간 크기였고(ḡ = +0.48), 사람 쪽 요인(ḡ = +0.49)과 자동화 쪽 요인(ḡ = +0.53)이 비슷했다. 환경 쪽 요인은 연구가 모자라 계산하지 못했다 [Schaefer 2016]. 신뢰는 분석·유추·감정 과정을 거쳐 형성된다 [Lee & See 2004]. 2. 출력이 확신 있어 보임 → 과신 → LLM의 기본 설명을 본 사용자는 LLM 정확도를 실제보다 높게 봤고, 설명이 길수록 정확도가 같아도 더 믿었다 [Steyvers 2025]. 숫자·확률로 나온 출력은 주의 깊은 정보 탐색을 대신하는 휴리스틱으로 쓰인다 [Goddard 2012]. 3. 인지 자원 부족 → 확인 없이 수용 → 업무량·과제 복잡도·시간 압박이 클수록 자동화 편향이 커졌다. 임상 전향 연구에서 조언 전에 맞았던 판단을 조언 뒤 틀리게 바꾼 사례가 6~11% 였다 [Goddard 2012]. 4. 오류를 직접 봄 → 신뢰를 급히 거둠 → 같은 실수라도 알고리즘에 더 가혹해, 더 정확한 모델을 두고 덜 정확한 사람을 골랐다 [Dietvorst 2015]. 5. 오류를 보기 전 → 반대로 알고리즘 선호 → 같은 조언이라도 알고리즘이 냈다고 하면 더 반영했다 [Logg 2019].
- ### 언제 강해지고 언제 약해지나
- 오류를 봤는지: 보기 전에는 알고리즘 조언 반영 비율(WOA)이 0.45로 사람 출처 0.30보다 높았다(d = 0.42) [Logg 2019, 실험 1A]. 오류를 본 뒤에는 모델이 사람보다 오차가 작았는데도(MBA 과제에서 사람 오차가 15~29% 더 큼, 항공 승객 과제에서 90~97% 더 큼) 모델을 덜 골랐다 [Dietvorst 2015].
- 비교 대상이 내 판단일 때: 알고리즘과 남의 판단 사이에서는 알고리즘을 골랐지만, 알고리즘과 내 판단 사이에서는 선호가 약해졌다 [Logg 2019, 실험 3].
- 판단자의 전문성: 미국 국가안보 분야 전문가 70명은 일반인보다 조언 전반을 덜 반영했고(d = 0.60), 그 때문에 정확도를 잃었다 [Logg 2019, 실험 4].
- 조금이라도 고칠 수 있을 때: 알고리즘 예측을 조금만 수정할 수 있어도 불완전한 알고리즘을 쓰는 비율이 크게 늘고 성과도 좋아졌다. 수정 폭의 크기에는 거의 반응하지 않았다 [Dietvorst 2018].
- 불확실성 표현과 설명 길이: 설명 속 확신 표현("잘 모르겠다" / "어느 정도 확신한다" / "확신한다")에 따라 사용자 확신이 단계적으로 달라졌다. 설명을 모델 내부 확신에 맞추자 보정 간격과 판별 간격이 모두 줄었다 [Steyvers 2025].
- 사람과 AI의 상대 실력: 사람이 AI보다 나은 과제에서는 조합이 이득(g = 0.46), AI가 나은 과제에서는 손해(g = −0.54) [Vaccaro 2024].
- ### 어떻게 재나
- 신뢰와 의존을 따로 잰다 — 신뢰는 설문 태도, 의존은 실제로 따랐는지 [Lee & See 2004].
- 조언 반영 비율(WOA) — 판단자-조언자 과제에서 (최종 답 − 처음 답) ÷ (조언 − 처음 답). 0 = 무시, 1 = 그대로 채택. Logg et al.은 사진 속 사람 몸무게 추정, 노래 순위 예측 등에 썼다.
- 선택률 — 보상이 걸린 예측에서 모델과 자기(또는 다른 사람) 예측 중 무엇에 보너스를 걸지 고르게 한다 [Dietvorst 2015].
- RAIR·RSR — 먼저 혼자 답하고, AI 조언을 본 뒤 다시 답하는 순차 과제에서 두 비율을 계산한다. Schemmer et al.은 가짜 호텔 리뷰와 실제 리뷰를 가려내는 과제를 썼다.
- 보정 간격·판별 간격 — 참가자가 "이 LLM 답이 맞을 확률" 을 매기게 한 뒤, 사람 확신과 모델 확신 각각의 기대 보정 오차(ECE, 확신과 실제 정답률 차이의 평균)와 AUC(맞는 답과 틀린 답을 가려내는 정도, 0.5 = 우연)를 비교한다 [Steyvers 2025].
- 과의존 비율 — AI가 틀린 문항에서 AI를 따른 비율 [Buçinca 2021]. 임상에서는 조언 전후 판단이 맞음 → 틀림으로 바뀐 비율(negative consultation) [Goddard 2012].
### 헷갈리는 개념과의 차이 | 개념 | 무엇을 재나 | 신뢰 보정과의 관계 | |---|---|---| | 신뢰 보정 | 신뢰가 실제 능력에 맞나 | 이 카드의 목표 상태 | | 자동화 편향 | 틀린 기계 조언을 따르는 경향 | 과신 쪽 실패(오용) | | 알고리즘 회피 | 오류를 본 뒤 더 정확한 알고리즘을 피함 | 불신 쪽 실패(불용) | | 알고리즘 선호 | 오류를 보기 전 알고리즘 조언을 더 반영 | 보정이 아닌 출처 효과. 오류를 보면 뒤집힐 수 있음 | | AI 위임 경계선 | 작업의 어느 부분을 넘길까 | 신뢰의 크기가 아닌 작업 분할 문제 |
주요 후속 연구·메타분석
### Steyvers et al. (2025) — 사람은 LLM이 아는 것보다 LLM을 더 믿는다 Nature Machine Intelligence, 7(2), 221–231. DOI: 10.1038/s42256-024-00976-7
- 설계: 참가자 301명. GPT-3.5·PaLM2의 객관식 답과 GPT-4o의 단답형 답을 설명과 함께 보여 주고, 답이 맞을 확률을 매기게 했다. 실험 2에서는 설명 속 확신 표현(3단계)과 길이(3단계)를 조작했다.
- 결과: 모델 자신의 확신은 맞는 답과 틀린 답을 잘 갈랐다(AUC 0.746~0.781). 기본 설명을 본 사람은 겨우 우연보다 나았다(AUC 0.589~0.602). 객관식에서 사람의 보정 오차는 주로 과신이었다. 긴 설명은 짧은 설명보다 확신을 높였지만(BF = 25) 판별력은 높이지 못했다(AUC 0.54 대 0.57). 설명을 모델 확신에 맞춰 바꾸자 두 간격이 줄었다.
- 의미와 한계: LLM 시대의 보정 실패를 수치로 보인 연구. 유창하고 긴 답이 신뢰를 부풀린다. 퀴즈형 문제이고 참가자는 해당 분야 비전문가다. (arXiv 저자 원고 전문 대조)
### Schemmer, Kühl, Benz, Bartos & Satzger (2023) — 적정 의존을 두 비율로 재기 Proceedings of the 28th International Conference on Intelligent User Interfaces (IUI '23), 410–422. DOI: 10.1145/3581641.3584066
- 설계: 참가자 200명이 호텔 리뷰가 가짜인지 가려냈다. 먼저 혼자 답하고 AI 조언을 본 뒤 다시 답했다. 대조군과 특징 중요도 설명 제공군을 비교.
- 결과: 대조군 RAIR 29.59%, RSR 71.87%. 설명을 주자 RAIR가 38.87%로 올랐고(t = −1.95, p = .05) RSR은 69.45%로 유의한 차이가 없었다. AI 도움 정확도와 혼자 정확도 차이는 설명군 +2.45%p, 대조군 −1.56%p.
- 의미와 한계: 과신과 과소신을 한 숫자로 섞지 않고 따로 재는 틀. 이 과제에서는 과소의존이 컸다. 과제 하나, 설명 방식 하나, p = .05 경계의 결과다. (arXiv 저자 원고 전문 대조)
### Dietvorst, Simmons & Massey (2015) — 오류를 본 뒤 더 정확한 알고리즘을 버린다 Journal of Experimental Psychology: General, 144(1), 114–126. DOI: 10.1037/xge0000033
- 설계: 연구 5편. 참가자는 모델 예측, 사람 예측, 둘 다, 또는 아무것도 보지 않은 뒤 보너스를 모델과 사람 중 어느 쪽 예측에 걸지 골랐다. MBA 지원자 성적 예측, 주별 항공 승객 순위 예측.
- 결과: 모델은 사람보다 정확했다(사람 오차가 MBA 과제 15~29%, 항공 과제 90~97% 더 큼). 모델과 사람을 모두 본 참가자의 83%(741명 중 610명)가 모델이 더 나은 것을 봤는데도, 모델을 본 집단은 모델을 덜 골랐다. 사람의 오류를 본 것은 사람 선택을 유의하게 줄이지 않았다.
- 의미와 한계: 불용 쪽 실패의 대표 실험. 예측 과제와 온라인·실험실 표본이다. (전문 대조)
### Logg, Minson & Moore (2019) — 오류를 보기 전에는 알고리즘을 더 따른다 Organizational Behavior and Human Decision Processes, 151, 90–103. DOI: 10.1016/j.obhdp.2018.12.005
- 설계: 실험 6개. 사진 속 몸무게 추정, 노래 인기·연애 매력 예측 등에서 같은 조언을 "알고리즘" 또는 "사람" 출처로 제시하고 WOA를 쟀다.
- 결과: 실험 1A에서 WOA 알고리즘 0.45, 사람 0.30(d = 0.42). 연구자들은 반대 결과를 예측했다(실험 1D). 내 판단과 견줄 때(실험 3)와 국가안보 전문가(실험 4)에서는 선호가 약해졌고, 전문가는 조언을 덜 받아 정확도를 잃었다.
- 의미와 한계: "사람은 알고리즘을 싫어한다" 는 일반화를 뒤집는 결과. 조언의 오류를 보여 주지 않은 조건이다. (전문 대조)
### Vaccaro, Almaatouq & Malone (2024) — 사람+AI 조합의 메타분석 Nature Human Behaviour, 8(12), 2293–2303. DOI: 10.1038/s41562-024-02024-1
- 설계: 사전등록 메타분석. 사람 단독·AI 단독·조합을 모두 잰 실험 106편, 효과크기 370개(2020-01~2023-06).
- 결과: 조합은 사람 혼자보다 나았고(g = 0.64) 더 나은 쪽 단독보다는 못했다(g = −0.23, 95% CI −0.39 ~ −0.07). 사람이 더 나은 과제 g = 0.46, AI가 더 나은 과제 g = −0.54. 설명·확신도 표시 여부는 유의한 조절 변수가 아니었다.
- 의미와 한계: 사람이 AI보다 나을 때 "언제 AI를 따를지" 도 잘 고른다는 저자 해석은 보정의 중요성을 뒷받침한다. 이질성이 매우 크다(I² = 97.7%). (전문 대조)
### Schaefer, Chen, Szalma & Hancock (2016) — 자동화 신뢰를 만드는 요인의 메타분석 Human Factors, 58(3), 377–400. DOI: 10.1177/0018720816634228
- 설계: 사람-로봇 상호작용에 한정했던 저자들의 앞선 메타분석을 자동화 전반으로 넓혔다. 연구 30편에서 짝 비교 효과크기 164개, 연구 16편에서 상관 효과크기 63개를 모았다.
- 결과: 모든 요인을 합친 신뢰 형성 효과는 ḡ = +0.48, 상관으로는 r̄ = +0.34로 둘 다 중간 크기였다. 사람 쪽 요인은 ḡ = +0.49(r̄ = +0.16), 자동화 쪽 요인(성능·신뢰도 등)은 ḡ = +0.53(r̄ = +0.41)이었다. 환경 쪽 요인은 효과크기 수가 모자라 따로 계산하지 못했다.
- 의미와 한계: Hoff & Bashir(2015)의 서술형 3층 모형에 양적 크기를 붙인 연구다. 상관 기준으로는 자동화 쪽 요인이 사람 쪽보다 컸다. 신뢰의 크기를 예측할 뿐, 그 신뢰가 실제 성능에 맞는지(보정)는 재지 않았다. LLM 이전 자동화 연구를 모았다. 요인별 세부 효과크기는 초록에 없다. (초록만 읽음)
- ### 그 밖의 문헌
- Hoff, K. A., & Bashir, M. (2015). Trust in automation: Integrating empirical evidence on factors that influence trust. Human Factors, 57(3), 407–434. DOI: 10.1177/0018720814547570 — 2002~2013년 논문 101편(연구 127개) 체계적 고찰. 성향·상황·학습 신뢰 3층 모형.
- Mahmud, H., Islam, A. K. M. N., Ahmed, S. I., & Smolander, K. (2022). What influences algorithmic decision-making? A systematic literature review on algorithm aversion. Technological Forecasting and Social Change, 175, 121390. DOI: 10.1016/j.techfore.2021.121390 — 실증 연구 80편. 회피 요인을 알고리즘·개인·과제·상위(조직·사회) 네 갈래로 나눴고, 과제·상위 요인 연구가 적다고 지적.
- Parasuraman, R., & Manzey, D. H. (2010). Human Factors, 52(3), 381–410. DOI: 10.1177/0018720810376055 — 자만과 자동화 편향의 주의 통합 모형. 전문가에게도 나타나고 훈련으로 쉽게 없어지지 않는다.
- Dietvorst, B. J., Simmons, J. P., & Massey, C. (2018). Management Science, 64(3), 1155–1170. DOI: 10.1287/mnsc.2016.2643 — 조금만 고칠 수 있어도 불완전한 알고리즘을 더 쓴다.
- Burton, J. W., Stein, M.-K., & Jensen, T. B. (2020). Journal of Behavioral Decision Making, 33(2), 220–239. DOI: 10.1002/bdm.2155 — 알고리즘 회피 체계적 고찰 61편.
- Bansal, G., et al. (2021). CHI 2021, 1–16. DOI: 10.1145/3411764.3445717 — 설명은 AI가 틀려도 수용 확률을 높였다.
- Buçinca, Z., Malaya, M., & Gajos, K. Z. (2021). Proc. ACM HCI, 5(CSCW1), 1–21. DOI: 10.1145/3449287 — N = 199. 인지 강제 개입이 과의존을 줄였지만 만족도는 가장 낮았다.
비판·한계
- ### 재현성
- 알고리즘 회피와 알고리즘 선호는 둘 다 여러 실험에서 반복 관찰됐지만 조건이 다르다(오류를 봤는지, 비교 대상이 누구인지) [Dietvorst 2015; Logg 2019]. 체계적 고찰 두 편은 정의와 원인이 분야마다 달라 통합 이론이 필요하다고 결론 냈다 [Burton 2020; Mahmud 2022].
- 사람-AI 조합 실험의 효과크기 이질성이 매우 크다(I² = 97.7%) [Vaccaro 2024]. 한 실험의 결과를 다른 과제로 옮기기 어렵다.
- ### 대표 반론
- "확신도·설명을 보여 주면 보정된다" 대 "효과 없다": 설명을 모델 확신에 맞추면 보정·판별 간격이 줄었고 [Steyvers 2025], 설명은 과소의존(RAIR)을 줄였다 [Schemmer 2023]. 반대로 설명은 AI가 틀려도 수용을 늘렸고 [Bansal 2021], 106개 실험 메타분석에서는 설명·확신도 표시가 조합 성과를 유의하게 바꾸지 못했다 [Vaccaro 2024]. 설명이 모델의 실제 불확실성을 담는지가 갈림길로 보이지만, 이를 직접 비교한 메타분석은 아직 없다.
- "사람은 알고리즘을 싫어한다" 대 "좋아한다": 오류를 본 뒤의 회피 [Dietvorst 2015]와 보기 전의 선호 [Logg 2019]가 공존한다. 두 결과를 가르는 조건은 오류를 봤는지와 비교 대상이 누구인지다. 체계적 고찰은 회피의 원인을 다섯 갈래로 나누고 이론 통합이 필요하다고 결론 냈다 [Burton 2020].
- "사람이 최종 확인하면 안전하다": AI가 사람보다 나은 과제에서는 사람이 개입한 조합이 AI 단독보다 못했다 [Vaccaro 2024].
- ### 쓰면 안 되는 상황
- AI가 확실히 더 정확한 판단 과제에서 매번 사람이 뒤집는 설계 — 조합이 손해였다 [Vaccaro 2024].
- AI의 실제 정확도를 모르는 새 영역 — 다른 과제의 성적으로 신뢰를 정하지 않는다(특정성) [Lee & See 2004].
- 설명의 길이·유창함으로 신뢰를 정할 때 — 길이는 확신만 높이고 판별력은 높이지 않았다 [Steyvers 2025].
- 아는 것만으로 고쳐진다고 볼 때 — 자동화 편향은 전문가에게도 나타나고 훈련·지시로 막히지 않는다 [Parasuraman & Manzey 2010]. 과의존을 줄이는 개입은 사용자가 싫어한다 [Buçinca 2021].
관련 모델
- 권위 편향, AI 위임 경계선, 정보 비대칭, 예측 보정, 전문가 연결
사고 도구 다른 글