AI 검증 루프 (AI Verification Loop)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: AI 결과 검증 · AI Verification Loop
한 줄 정의
생성형 AI가 만든 답을 그대로 쓰지 않고, 별도의 검증 질문과 독립 확인 절차로 사실성·출처·논리·실행 가능성을 점검하는 사고도구.
"AI 검증 루프"는 이 사이트가 붙인 카드 이름이고 학술 용어가 아니다. 내용은 환각(hallucination, AI가 그럴듯하지만 틀린 내용을 만들어 내는 현상) 연구, 검증 사슬(Chain-of-Verification, CoVe), 샘플링 일관성 검사 연구로 구성했다.
일상 한 줄
AI 답변은 검증을 거쳐야 쓸 수 있는 초안이다.
흔한 장면
- AI가 없는 논문 DOI를 만들어냈는데 그대로 보고서에 넣는다. ChatGPT에 문헌 검토를 쓰게 한 연구에서 참고문헌 중 GPT-3.5는 55%, GPT-4는 18%가 존재하지 않는 논문이었다 [Walters 2023].
- 코딩 답변이 알려 준 패키지가 실제로는 없는데 설치 명령을 그대로 실행한다. 코드 생성 모델 16개를 조사한 연구에서 없는 패키지를 추천한 비율이 상용 모델 평균 5.2% 이상, 공개 모델 평균 21.7% 이상이었다 [Spracklen 2025].
- 법률·세금·의료 답변을 최신 규정 확인 없이 따른다. 검색 결합(RAG)을 쓴다는 상용 법률 AI 도구도 질문의 17~33%에서 환각을 냈다 [Magesh 2025].
- AI가 요약한 글만 보고 원문을 읽지 않는다.
왜 빠지나 (메커니즘)
- 확신에 찬 설명에 사람이 넘어감: 사람 80명의 사실 확인 실험에서 ChatGPT 설명이 틀린 주장에 대한 정확도는 0.35로, 아무 도움 없이 판단할 때(0.49)보다 낮았다 [Si 2024].
- 확신에 찬 말투(자기 검토의 한계): 외부 피드백 없이 모델에게 스스로 고치게 하면 추론 문제에서 성능이 좋아지지 않고 때로 떨어진다 [Huang 2024]. 모델이 자기 초안을 보면서 검증하면 초안의 환각을 되풀이하기 쉬워서, CoVe는 검증 질문에 초안과 떨어진 상태로 답하게 한다 [Dhuliawala 2024].
- 출처 형식 모방: 모델은 제목·저자·저널·DOI 형식을 갖춘 가짜 참고문헌을 만든다. 실제 논문을 가리키는 참고문헌에도 서지 오류가 섞인다(실재 인용 중 GPT-3.5 43%, GPT-4 24%) [Walters 2023]. 형식만 보고는 실재 문헌과 가짜를 가를 수 없다.
- 검증을 비용으로 느낌: 자동화 편향(automation bias, 자동화된 조언에 지나치게 기대는 경향) 연구 74편을 모은 체계적 문헌고찰에서 업무량·과제 복잡도·시간 압박이 과잉 의존을 키웠다 [Goddard 2012]. 바쁠수록 검증을 건너뛰기 쉬우므로, 틀렸을 때 비용이 큰 주장부터 검증한다. 생성형 AI를 쓰는 지식 노동자 319명 설문에서도 AI를 더 믿는 사람일수록 비판적 사고를 덜 했다고 답했고, 자기 실력을 더 믿는 사람은 더 했다고 답했다 [Lee 2025]. 자기보고 자료다.
- 무엇을 검증할지 모름: 모르는 분야일수록 어느 주장이 틀리기 쉬운지 짚기 어렵다. SelfCheckGPT는 외부 DB 없이도 같은 질문을 여러 번 샘플링해 응답이 서로 모순되는 문장을 환각으로 표시해 준다 [Manakul 2023].
빠져나오는 법
CoVe의 4단계 구조를 뼈대로 쓴다 — (i) 초안 → (ii) 검증 질문 계획 → (iii) 독립 답변 → (iv) 검증된 최종 답 [Dhuliawala 2024]. CoVe 논문은 모델 하나만으로 네 단계를 돌렸고 검색·도구는 쓰지 않았다. 아래 3단계의 DOI 조회·실행 확인은 사람이 덧붙이는 외부 확인이다.
1. AI에게 먼저 답(초안)을 만들게 하되, 출처와 불확실성을 분리해서 요구한다. (CoVe 1단계 차용. 모델 실험) 2. 답변에서 사실 확인 가능한 주장만 뽑아 검증 질문으로 만든다. (CoVe 2단계 차용. 응답을 쪼개면 검증이 생성보다 쉬워진다 [Kamoi 2024]) 3. 각 검증 질문을 원래 답과 떨어진 새 대화에서 따로 묻고, DOI 조회·공식 문서·로컬 실행·여러 번 샘플링으로 확인한다 [Dhuliawala 2024; Manakul 2023]. (모델 실험의 차용 + 외부 피드백 [Kamoi 2024]. 사람의 사실 확인에서는 AI 설명보다 검색 원문을 읽는 쪽이 틀린 답에 덜 속았다 [Si 2024]) 4. 검증 실패한 항목은 삭제하거나 "미확인"으로 표시한다. (근거 수준: 경험칙. 직접 검증 연구 없음) 5. 최종 답변은 검증된 주장만으로 다시 쓴다. (CoVe 4단계 차용)
1~5단계를 사람이 실행했을 때의 효과를 시험한 연구는 없다. 가장 가까운 사람 대상 근거는 AI 답을 보기 전에 자기 답을 먼저 정하게 한 실험으로, 한 하위 과제에서 틀린 AI 답을 따르는 비율이 0.64 → 0.48로 줄었다 [Buçinca 2021].
함께 쓰기 좋은 도구
- AI 위임 경계선 — 검증 불가능한 작업은 위임 제한
- 인식론적 경계 — 출처 신뢰도 평가
- 비판적 무시 — 검증 가치 없는 정보 차단
- 인과 DAG 사고 — 그럴듯한 원인 설명 검증
- AI 신뢰 보정 — 검증 결과로 AI에 대한 신뢰 수준을 조정
통념이 무너지는 순간
"출처를 달라고 하면 hallucination이 사라진다"
⚠ 흔한 말: "출처 붙여 달라고 했으니까 이건 검증된 거지." ✓ 학술: Walters & Wilder(2023) — ChatGPT가 쓴 문헌 검토 84편의 참고문헌 636개를 데이터베이스에서 찾아보니 GPT-3.5 인용의 55%, GPT-4 인용의 18%가 존재하지 않는 논문이었다. 출처 요청은 시작이고, DOI·URL을 열어 원문이 그 주장을 담는지 따로 확인해야 한다. [Walters 2023]
"AI가 스스로 검토하면 충분하다"
⚠ 흔한 말: "한 번 더 검토해 달라고 하면 알아서 고쳐주잖아." ✓ 학술: Huang et al.(2024) — 외부 피드백 없는 자기 교정에서 모델은 추론 답을 잘 고치지 못했고, 교정 후 성능이 떨어지기도 했다. Dhuliawala et al.(2024)은 자기 초안의 환각을 보면서 검증하면 그 환각을 되풀이하는 경향을 보고했고, 그래서 검증 질문에 "다른 응답에 편향되지 않도록 독립적으로(independently so the answers are not biased by other responses)" 답하게 했다. [Huang 2024; Dhuliawala 2024]
"사실 검증은 외부 데이터베이스가 있어야 한다"
⚠ 흔한 말: "대조할 정답 DB가 없으면 hallucination은 못 잡는다." ✓ 학술: Manakul et al.(2023) — SelfCheckGPT는 외부 DB 없이(zero-resource) 같은 질문을 여러 번 샘플링해, 응답이 "서로 갈라지고 모순되면(diverge and contradict)" hallucination으로 판정한다. 단, 모델이 매번 똑같이 틀리는 오류는 이 방식으로 잡히지 않는다 [Farquhar 2024]. [Manakul 2023]
1차 출처
- Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., & Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), Article 248, 1–38. DOI: 10.1145/3571730.
- Dhuliawala, S., Komeili, M., Xu, J., Raileanu, R., Li, X., Celikyilmaz, A., & Weston, J. (2024). Chain-of-Verification reduces hallucination in large language models. In Findings of the Association for Computational Linguistics: ACL 2024, 3563–3578. DOI: 10.18653/v1/2024.findings-acl.212. (arXiv:2309.11495, 2023)
- Manakul, P., Liusie, A., & Gales, M. J. F. (2023). SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 9004–9017. DOI: 10.18653/v1/2023.emnlp-main.557. (arXiv:2303.08896)
원문 핵심 인용
- Dhuliawala et al., arXiv:2309.11495 초록 (게재본 Findings of ACL 2024): "the model first (i) drafts an initial response; then (ii) plans verification questions to fact-check its draft; (iii) answers those questions independently so the answers are not biased by other responses; and (iv) generates its final verified response." (2026-09 arXiv 초록과 대조)
- Manakul, Liusie & Gales, arXiv:2303.08896 초록 (게재본 EMNLP 2023): "if an LLM has knowledge of a given concept, sampled responses are likely to be similar and contain consistent facts. However, for hallucinated facts, stochastically sampled responses are likely to diverge and contradict one another." (2026-09 arXiv 초록과 대조)
- Ji et al., arXiv:2202.03629 (ACM Computing Surveys 게재 원고), 2.1절: "Intrinsic Hallucinations: The generated output that contradicts the source content." / "Extrinsic Hallucinations: The generated output that cannot be verified from the source content" (2026-09 arXiv 원고 PDF와 대조. ACM 출판본은 대조 못 함)
핵심 정의·메커니즘
- ### 원전 정의
- 환각(hallucination)의 두 갈래 [Ji 2023]: 원래 자료와 모순되는 출력(intrinsic)과 원래 자료로 확인할 수 없는 출력(extrinsic). 요약·번역처럼 입력 자료가 있는 과제에서 나온 구분이다. 대화형 AI가 입력 없이 답할 때는 "세상의 사실과 맞는가(사실성, factuality)" 로 정의가 넓어졌다 [Huang 2025].
- 검증 사슬(Chain-of-Verification, CoVe) [Dhuliawala 2024]: 모델이 "(i) 초안을 쓰고, (ii) 초안을 사실 확인할 검증 질문을 계획하고, (iii) 다른 응답에 편향되지 않도록 그 질문에 독립적으로 답한 뒤, (iv) 검증된 최종 답을 만든다". 모델 하나만 쓰고 검색·도구는 쓰지 않는다.
- 자기 교정(self-correction) [Kamoi 2024]: 추론 중에 LLM을 써서 자기 응답을 다듬는 방법. 피드백을 모델 스스로 만드는 내재적(intrinsic) 방식과 검색·코드 실행 같은 외부 피드백을 쓰는 방식으로 나뉜다.
- 이 카드의 "AI 검증 루프" 는 사람이 위 절차를 빌려 AI 답을 확인하는 사용법이다. 학술 용어는 아니다.
### 작동 기제 1. AI 답이 유창함 → 사람이 틀린 설명도 믿음 → 사람 80명이 까다로운 주장의 참·거짓을 가렸다. ChatGPT 설명이 맞을 때 정답률은 0.87이었지만, 설명이 틀릴 때는 0.35로 아무 도움 없이 판단한 기준 조건(0.49)보다 낮았다. 설명이 틀린 주장에도 비슷한 시간을 써, 틀린 것을 알아채지 못했음을 보여 줬다 [Si 2024]. 2. 모델이 자기 초안을 보며 검토 → 오류를 되풀이 → 외부 피드백 없는 자기 교정에서 GPT-3.5의 CommonSenseQA 정답률은 75.8 → 38.1(1회차)로 떨어졌고, GPT-4의 GSM8K는 95.5 → 89.0(2회차)으로 떨어졌다 [Huang 2024]. CoVe 논문도 초안을 문맥에 둔 채 검증하면 환각을 되풀이한다고 보고해, 검증 질문을 초안과 떼어 답하게 했다 [Dhuliawala 2024]. 3. 검증이 생성보다 쉬운 형태로 쪼갬 → 교정이 됨 → 여러 답을 나열하는 과제("뉴욕 출신 정치인을 대라")는 답 하나하나의 확인으로 쪼갤 수 있어, 외부 도움 없이도 자기 교정이 통하는 드문 경우다. CoVe가 여기에 해당한다 [Kamoi 2024]. Llama 65B의 Wikidata 목록 질문 정밀도는 0.17 → 0.36, 장문 전기 FactScore는 55.9 → 71.4로 올랐다 [Dhuliawala 2024]. 4. 외부 신호 붙임 → 교정이 믿을 만해짐 → 검색·코드 실행처럼 믿을 만한 외부 피드백을 쓸 수 있는 과제에서 자기 교정이 잘 됐다 [Kamoi 2024]. 5. 여러 번 뽑아 비교 → 모순이 드러남 → 같은 질문을 여러 번 샘플링해 응답이 갈라지면 환각으로 본다 [Manakul 2023]. 뜻이 같은 답을 한 묶음으로 세는 의미 엔트로피는 30개 과제·모델 조합에서 평균 AUROC 0.790으로 단순 엔트로피(0.691)보다 높았다 [Farquhar 2024].
- ### 언제 강해지고 언제 약해지나
- AI 설명이 맞는지에 따라 사람 정확도가 뒤집힘: 설명이 맞으면 검색 결과를 읽는 것보다 정확했고(0.87 대 0.79), 틀리면 검색 결과보다 못했다(0.35 대 0.54) [Si 2024].
- 찬반 설명을 함께 보여 주면 과의존이 줄어듦: ChatGPT에게 주장이 참인 이유와 거짓인 이유를 모두 쓰게 해 보여 주자, 원래 설명이 틀린 주장에서 정확도가 0.56으로 올랐다. 대신 원래 설명이 맞는 주장에서는 0.73으로 검색(0.79)보다 낮았다 [Si 2024].
- 답을 먼저 정하게 하면 과의존이 줄어듦: AI 제안을 보기 전 자기 답을 먼저 정하거나, 제안을 늦게 보여 주거나, 요청해야 보여 주는 인지 강제 설계에서 탄수화물 원천 찾기의 과의존 비율이 0.64 → 0.48로 줄었다(d = .36). 전체 결정 수준에서는 줄어든 폭이 유의하지 않았다(0.30 → 0.26) [Buçinca 2021].
- 샘플링 검사는 일관된 오답을 놓침: 매번 똑같이 틀리는 오류는 일관되게 보여 통과한다 [Farquhar 2024].
- 검색 결합(RAG)도 환각을 없애지 못함: 상용 법률 AI 도구 환각률 17~33% [Magesh 2025].
- 사람 쪽 조건: 업무량·시간 압박이 크면 자동화된 조언을 덜 확인한다. 책임 강조·훈련이 이를 줄였다 [Goddard 2012].
- ### 어떻게 재나
- 사람의 사실 확인 실험 [Si 2024] — 반박하기 어렵게 만든 주장 모음(FoolMeTwice)을 보여 주고, 참가자가 도움 없이 / 위키백과 검색 결과 10단락 / ChatGPT 설명 / 찬반 설명 / 검색+설명 중 한 조건에서 참·거짓을 판정한다. 정확도와 주장당 시간을 잰다.
- 과의존 비율 [Buçinca 2021] — AI가 틀린 문항에서 참가자가 AI 답을 그대로 따른 비율.
- 모델 쪽 지표 — 목록 질문 정밀도, 장문 전기를 원자 사실로 쪼개 검색 결과와 대조한 FactScore [Dhuliawala 2024], 문장 단위 환각 탐지의 AUC-PR [Manakul 2023], 의미 엔트로피 AUROC [Farquhar 2024].
- 실재 여부 조회 — 참고문헌을 데이터베이스로 하나씩 조회 [Walters 2023], 생성 코드의 패키지 이름을 공식 저장소와 대조 [Spracklen 2025].
### 헷갈리는 개념과의 차이 | 개념 | 누가 | 무엇을 검증하나 | 이 카드와의 관계 | |---|---|---|---| | AI 검증 루프(이 카드) | 사용자 | AI 답 속 주장 하나하나 | 사람이 외부 출처로 확인 | | AI 신뢰 보정 | 사용자 | 이 AI를 얼마나 믿을지 | 검증 결과가 신뢰 수준을 갱신 | | 측면 읽기(lateral reading)·팩트체킹 | 사람 | 정보 출처 자체 | 이 카드 3단계의 외부 확인과 같은 계열. 대상이 AI 답이 아닌 웹 정보 일반 | | 모델 내부 자기 일관성 검사 | 모델 | 자기 응답끼리의 모순 | 사람 개입 없음. 일관된 오답은 못 잡음 [Farquhar 2024] | | 자기 교정 | 모델 | 자기 응답의 오류 | 외부 신호가 없으면 잘 안 됨 [Huang 2024; Kamoi 2024] |
주요 후속 연구·메타분석
환각 탐지·검증 기법의 효과크기를 모은 메타분석은 아직 없다(2026-09 기준). 연구마다 벤치마크·지표가 달라 아래는 개별 연구의 수치다. 사람을 대상으로 검증 개입의 효과를 잰 연구는 이 카드에서 Si et al.(2024)과 Buçinca et al.(2021) 두 편뿐이고, 둘 다 표본이 수백 명 이하인 온라인 실험이다. 사람 쪽 근거의 대표성은 낮다.
### Si et al. (2024) — AI 설명은 사람의 사실 확인을 빠르게 하지만 틀린 설명엔 속는다 Proceedings of NAACL 2024 (Long Papers), 1459–1474. DOI: 10.18653/v1/2024.naacl-long.81
- 설계: 크라우드워커 80명(조건당 16명)이 반박하기 어렵게 만든 주장(FoolMeTwice)의 참·거짓을 판정했다. 조건: 도움 없음 / 검색 결과 / ChatGPT 설명 / 찬반 대조 설명 / 검색+설명.
- 결과: 정확도는 설명 0.74, 검색 0.73, 도움 없음 0.59. 설명 조건은 주장당 1.01분으로 검색(2.53분)보다 빨랐다. 설명이 틀린 주장에서는 정확도 0.35로 도움 없음(0.49)·검색(0.54)보다 낮았다. 찬반 설명은 이 경우를 0.56으로 끌어올렸지만 검색보다 유의하게 낫지 않았다. 검색과 설명을 같이 보여 줘도 검색만 보는 것보다 이득이 없었다.
- 의미와 한계: 사람 쪽 검증의 직접 근거. 저자 결론은 "검색 결과를 시간 들여 읽는 쪽이 여전히 더 믿을 만하다" 이다. 표본이 작고, 위키백과 기반 퀴즈형 주장이다. (전문 대조)
### Huang et al. (2024) — 외부 피드백 없는 자기 교정은 추론 성능을 떨어뜨리기도 한다 International Conference on Learning Representations (ICLR 2024). arXiv:2310.01798
- 설계: GPT-3.5·GPT-4에게 GSM8K(수학), CommonSenseQA(상식), HotpotQA(다단계 질의응답) 답을 스스로 검토·수정하게 했다. 정답 라벨로 멈출 시점을 알려 준 기존 실험 방식과도 비교했다.
- 결과: 외부 피드백이 없으면 GPT-3.5 CommonSenseQA 75.8 → 38.1(1회차), GPT-4 GSM8K 95.5 → 89.0(2회차)으로 떨어졌다. 정답 라벨을 쓴 설정에서만 큰 개선이 나왔다.
- 의미와 한계: "다시 검토해 줘" 로 끝내는 검증이 약하다는 근거. 추론 과제에 한정된 결론이다. (전문 대조)
### Kamoi et al. (2024) — 자기 교정은 언제 되는가 Transactions of the Association for Computational Linguistics, 12, 1417–1440. DOI: 10.1162/tacla00713
- 설계: 자기 교정 연구를 비판적으로 검토한 고찰. 정답 정보를 몰래 쓰거나 초기 응답을 일부러 약하게 만든 "불공정한" 평가를 가려냈다.
- 결과: 모델 스스로 만든 피드백으로 교정에 성공한 사례는 일반 과제에서 없었다. 예외는 응답을 쪼개 확인할 수 있는 과제(CoVe가 다룬 목록형 질문 등)였다. 믿을 만한 외부 피드백을 쓸 수 있는 과제에서는 자기 교정이 잘 됐고, 대규모 미세조정도 자기 교정을 가능하게 했다.
- 의미와 한계: Huang et al.의 "못 한다" 와 CoVe의 "된다" 를 조건으로 나눠 정리했다. 이 카드가 사람이 외부 출처를 붙이라고 권하는 근거. 실험이 아닌 문헌 고찰이다. (전문 대조)
### Dhuliawala et al. (2024) — 검증 질문을 초안과 떼어 답하면 환각이 준다 Findings of ACL 2024, 3563–3578. DOI: 10.18653/v1/2024.findings-acl.212
- 설계: Llama 65B에 Wikidata 목록 질문, 닫힌 책 질의응답(MultiSpanQA), 장문 전기 생성을 시키고 CoVe의 여러 변형(joint, two-step, factored, factor+revise)을 비교했다.
- 결과: 목록 질문 정밀도 0.17(few-shot) → 0.36(two-step). 장문 전기 FactScore 55.9 → 71.4(factor+revise). 검증 질문을 한 프롬프트에 몰아 넣은 joint보다 떼어 답한 방식이 나았다.
- 의미와 한계: 초안과 검증을 떼는 설계의 근거. 모델 하나만 쓰고 검색을 쓰지 않아, 모델이 모르는 사실은 검증 질문에도 틀리게 답할 수 있다. (전문 대조)
### Buçinca, Malaya & Gajos (2021) — 답을 먼저 정하게 하면 AI 과의존이 준다 Proceedings of the ACM on Human-Computer Interaction, 5(CSCW1), Article 188, 1–21. DOI: 10.1145/3449287
- 설계: 참가자 199명이 음식 사진을 보고 탄수화물을 줄일 재료를 골랐다. 정확도 75%로 설정한 모의 AI. 단순 설명 조건과 인지 강제 조건(답 먼저 정하기, 대기, 요청 시 보기)을 비교.
- 결과: AI가 틀린 문항에서 탄수화물 원천 찾기의 과의존 비율이 단순 설명 0.64, 인지 강제 0.48(d = .36)이었다. 전체 결정 수준의 과의존은 0.30 대 0.26으로 유의하지 않았다. 과의존을 가장 많이 줄인 설계는 사용자 평가가 가장 낮았다.
- 의미와 한계: 사람 쪽 개입이 틀린 AI 답의 수용을 얼마나 줄이는지 보여 주는 드문 수치. LLM 이전의 모의 AI이고 과제 하나다. (전문 대조)
### Farquhar, Kossen, Kuhn & Gal (2024) — 뜻 단위로 세는 불확실성 Nature, 630(8017), 625–630. DOI: 10.1038/s41586-024-07421-0
- 설계: 여러 LLM의 답을 여러 번 샘플링해 뜻이 같은 답끼리 묶고, 묶음 분포의 엔트로피로 작화(confabulation)를 탐지했다.
- 결과: 30개 과제·모델 조합 평균 AUROC 0.790. 단순 엔트로피 0.691, P(True) 0.698, 임베딩 회귀 0.687.
- 의미와 한계: 외부 DB 없는 검사의 성능 근거. 저자들은 매번 같게 틀리는 오류는 이 방법으로 잡히지 않는다고 밝혔다. (전문 대조)
### Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks & Wilson (2025) — AI를 믿을수록 비판적 사고를 덜 한다고 답했다 Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems, 1–22. DOI: 10.1145/3706598.3713778
- 설계: 업무에 생성형 AI를 쓰는 지식 노동자 319명 설문. 참가자는 AI를 업무에 쓴 실제 사례 936건을 적고, 그때 비판적 사고를 했는지와 얼마나 애썼는지 답했다.
- 결과: 과제·사용자 요인을 함께 넣었을 때, 과제에 대한 자기 확신과 AI에 대한 확신이 비판적 사고 여부와 노력을 예측했다. AI를 더 믿을수록 비판적 사고가 줄고, 자기 확신이 높을수록 늘었다. 질적 분석에서는 AI가 비판적 사고의 내용을 정보 검증, 응답 통합, 과제 관리 쪽으로 옮겼다. 초록에 효과크기는 없다.
- 의미와 한계: "왜 빠지나" 의 "검증을 비용으로 느낌" 을 LLM 사용 현장에서 확인한 자료다. 모두 자기보고이고 한 시점 설문이라 인과 방향은 알 수 없다. 실제 검증 행동을 관찰하지 않았다. (초록만 읽음)
- ### 그 밖의 문헌
- Walters, W. H., & Wilder, E. I. (2023). Scientific Reports, 13(1), 14045. DOI: 10.1038/s41598-023-41032-5 — 참고문헌 636개 중 날조 비율 GPT-3.5 55%, GPT-4 18%.
- Spracklen, J., et al. (2025). 34th USENIX Security Symposium. arXiv:2406.10279 — 없는 패키지 추천 비율 상용 모델 평균 5.2% 이상, 공개 모델 21.7% 이상.
- Magesh, V., et al. (2025). Journal of Empirical Legal Studies, 22(2), 216–242. DOI: 10.1111/jels.12413 — RAG 기반 상용 법률 도구 환각 17~33%.
- Manakul, P., Liusie, A., & Gales, M. J. F. (2023). EMNLP 2023, 9004–9017. DOI: 10.18653/v1/2023.emnlp-main.557 — SelfCheckGPT.
- Huang, L., et al. (2025). ACM Transactions on Information Systems, 43(2), Article 42. DOI: 10.1145/3703155 — LLM 환각 고찰.
- Goddard, K., Roudsari, A., & Wyatt, J. C. (2012). JAMIA, 19(1), 121–127. DOI: 10.1136/amiajnl-2011-000089 — 자동화 편향 체계적 고찰 74편.
비판·한계
- ### 재현성
- 모델 쪽 수치는 모델 세대마다 바뀐다(참고문헌 날조율 GPT-3.5 55% → GPT-4 18%) [Walters 2023]. 특정 모델의 수치를 지금 쓰는 모델에 옮기면 안 된다.
- 사람 쪽 검증 실험은 표본이 작다(조건당 16명 [Si 2024], 199명 [Buçinca 2021]). 대규모 재현은 이번 작업에서 찾지 못했다.
- ### 대표 반론
- "LLM은 스스로 못 고친다" 대 "고친다": 외부 피드백 없는 자기 교정은 성능을 떨어뜨리기도 했다 [Huang 2024]. 반대로 CoVe는 목록 질문과 장문 전기에서 환각을 줄였다 [Dhuliawala 2024]. Kamoi et al. (2024)은 양쪽을 조건으로 갈랐다. 응답을 쪼개 확인할 수 있는 과제나 믿을 만한 외부 피드백이 있는 과제에서는 되고, 일반 과제에서 모델 스스로의 피드백만으로 된 사례는 없었다. 긍정 결과 일부는 정답 정보를 쓰는 등 평가가 불공정했다고 지적했다.
- "AI 설명을 읽으면 검증이 된다" 대 "원문을 읽어야 한다": 설명은 검색과 정확도가 비슷하고 2.5배 빨랐지만, 틀린 설명 앞에서는 도움 없이 판단한 것보다 못했다 [Si 2024]. 찬반 설명으로 일부 막을 수 있었으나 검색을 넘지 못했다.
- 사람 개입의 효과 크기: 인지 강제는 한 하위 과제에서 과의존을 0.64 → 0.48로 줄였지만 전체 결정에서는 유의하지 않았고, 사용자는 이런 설계를 싫어했다 [Buçinca 2021]. 이 카드의 5단계 절차 자체를 사람에게 시험한 연구는 없다.
- ### 쓰면 안 되는 상황
- 검증 수단이 없는 영역 — 공식 출처가 없거나 규정이 빠르게 바뀌는 곳에서는 검증도 불완전하다. AI 답을 결정 근거로 쓰지 말고 전문가 확인으로 넘긴다.
- 모델 자기 검토만으로 끝낼 때 — 외부 신호 없는 재검토는 오류를 늘릴 수 있다 [Huang 2024].
- 샘플링 일관성만 믿을 때 — 일관된 오답은 통과한다 [Farquhar 2024].
- 모든 답에 같은 강도로 적용할 때 — 시간 비용이 커서 생산성이 떨어진다. 틀렸을 때 비용이 큰 주장(법률·의료·금전·배포 명령)부터 검증한다. 이 원칙은 카드의 권고이고 따로 실험된 규칙은 아니다.
관련 모델
- 인식론적 경계, AI 신뢰 보정, 확증 편향, 기저율 무시, 전문가 연결
사고 도구 다른 글