굿하트의 법칙 / 지표 게임 (Metric Gaming)
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 지표 게임 · 지표 조작 · Goodhart's Law · Metric Gaming
한 줄 정의
측정 지표가 목표가 되는 순간, 사람과 조직이 그 지표를 개선하는 방향으로 행동을 바꾸면서 원래 목표가 왜곡되는 현상.
일상 한 줄
점수가 목표가 되면, 사람은 점수를 최적화한다.
흔한 장면
- 고객 만족(CSAT) 게이밍: 점수를 올리려고 불만 고객에게는 설문 링크를 아예 보내지 않는다 — 분모를 손본다.
- 조회수가 목표가 된 콘텐츠: 클릭률(CTR)을 KPI로 걸자 자극적 제목·낚시 썸네일이 늘고, 정작 끝까지 본 비율은 떨어진다.
- 병원 평가 지표 좁히기: 평가표에 잡히는 항목(대기시간 등)만 개선하고, 측정 안 되는 진료 질은 방치된다. 2000년대 잉글랜드 공공의료의 목표 관리를 분석한 연구는 보고된 성과 뒤에 측정 문제와 게이밍이 섞여 있었다고 정리했다 [Bevan & Hood 2006].
- 학교 시험 점수 맞춤(teaching to the test): 시험에 나오는 것만 가르쳐 점수는 오르지만 실제 학력 신호는 약해진다 — Campbell이 시험 점수의 부패로 든 대표 사례 [Campbell 1976].
- 콜센터 통화 시간 단축: "평균 처리 시간"을 줄이라 하니 해결 안 된 문의를 빨리 끊어 재문의가 늘어난다.
- 영업 분기말 밀어내기: 분기 매출 목표를 채우려 다음 분기 주문을 당겨와, 지표는 맞지만 실수요는 왜곡된다.
왜 빠지나 (메커니즘)
- 대리지표 최적화: 실제 목표는 측정이 어려워 대리지표(proxy)를 쓰는데, 압력이 붙으면 proxy 자체를 최적화한다 [Manheim & Garrabrant 2018].
- 회귀적(Regressional) 게이밍: 불완전한 proxy를 고르면 신호와 함께 잡음(noise)까지 같이 선택된다 — proxy 만점이 목표 만점이 아니다 [Manheim & Garrabrant 2018].
- 극단(Extremal) 게이밍: proxy를 극단값까지 밀면 원래 성립하던 proxy-목표 관계가 깨지는 영역으로 분포가 이동한다 [Manheim & Garrabrant 2018].
- 적대적(Adversarial) 게이밍: 규제자와 목표가 다른 행위자가 평가 방식을 알고 그에 맞춰 행동을 조정한다 — 보상이 붙은 지표는 선택 압력이 된다 [Manheim & Garrabrant 2018].
- 부패 압력(corruption pressure): 양적 지표가 사회적 의사결정에 쓰일수록 그 지표와 지표가 감시하려던 과정 자체가 왜곡된다 [Campbell 1976].
- 측정되지 않는 것의 소외: 측정 안 되는 중요한 요소는 회의·보상에서 밀리고, 사람은 평가받는 방식에 합리적으로 적응한다 [Strathern 1997]. 경제학에서는 일이 여러 갈래일 때 측정되는 과업에만 보상을 걸면 측정 안 되는 과업의 노력이 줄어든다는 모형으로 설명한다 [Holmström & Milgrom 1991].
빠져나오는 법
1. 이 지표가 대리하는 실제 목표를 적는다. — 근거 수준: 경험칙(직접 검증 연구 없음) 2. 지표가 목표가 되면 어떤 부작용이 생길지 묻는다. — 근거 수준: 경험칙(직접 검증 연구 없음) 3. 단일 지표보다 균형 지표와 질적 검토를 함께 둔다. — 근거: 이론 모형 [Holmström & Milgrom 1991] 4. 지표 개선과 실제 목표 개선을 주기적으로 분리 검증한다. — 근거 수준: 경험칙(개입 효과 연구 없음). 지표와 실제 결과가 갈라지는 현상 자체는 관찰 연구로 확인됨 [Dranove et al. 2003] 5. 지표를 공개·보상하기 전에 gaming 가능성을 검토하고, 감사에 무작위성을 섞는다. — 근거 수준: 사례 분석에 기반한 제안 [Bevan & Hood 2006], 개입 효과 연구 없음
이 5단계 중 이론 근거가 있는 것은 3번뿐이다. 측정 가능한 과업에 강한 성과급을 걸수록 측정 안 되는 과업이 희생된다는 다중 과업 모형은, 처방으로 "성과급을 약하게 하거나 여러 지표를 함께 본다"를 내놓는다 [Holmström & Milgrom 1991] — 균형 지표·질적 검토(3번)는 이 처방과 같은 방향이다. 5번의 무작위 감사는 Bevan & Hood가 과속 카메라에 빗대 "감시 과정에 어느 정도 불확실성을 두어야 한다"고 제안한 것이고, 효과를 잰 결과는 아니다 [Bevan & Hood 2006]. 1·2·4·5번이 실제로 게이밍을 줄이는지 개입 전후 게이밍 빈도를 비교한 연구는 이번에 찾지 못했다.
함께 쓰기 좋은 도구
- 인센티브 호환성 — 보상 구조 점검
- 정보 비대칭 — 숨겨진 행동과 사적 정보
- 시스템 사고 — 피드백 루프와 부작용
- 파레토 원칙 — 핵심 소수 지표의 위험
통념이 무너지는 순간
### "측정하면 개선된다" ⚠ 흔한 말: "측정할 수 없으면 관리할 수 없다 — 일단 KPI부터 걸자." ✓ 학술: Goodhart는 영국 통화 관리 경험을 두고, 통제 목적으로 압력을 가하면 관찰된 통계적 규칙성이 무너지는 경향이 있다고 적었다. Strathern은 이를 "측정이 목표가 되는 순간 좋은 측정이기를 멈춘다"로 정식화했다. [Goodhart 1975] [Strathern 1997]
### "숫자는 객관적이다" ⚠ 흔한 말: "감이 아니라 데이터로 말하자, 숫자는 거짓말을 안 한다." ✓ 학술: 양적 지표가 의사결정에 쓰일수록 부패 압력에 노출되고, 지표가 감시하려던 과정 자체를 왜곡한다 — 객관적 형식이 객관적 결과를 보장하지 않는다. [Campbell 1976]
### "지표가 좋아졌으니 일이 잘되고 있다" ⚠ 흔한 말: "대시보드가 다 초록불인데 뭐가 문제냐." ✓ 학술: 불완전한 proxy를 극단까지 최적화하면 proxy-목표 관계가 성립하던 영역을 벗어나(Extremal Goodhart), 지표는 개선돼도 목표는 악화될 수 있다. [Manheim & Garrabrant 2018]
1차 출처
- Goodhart, C. A. E. (1975). "Problems of Monetary Management: The U.K. Experience." Papers in Monetary Economics, Vol. I, Reserve Bank of Australia. Goodhart's law의 원 정식화.
- Campbell, D. T. (1976). "Assessing the Impact of Planned Social Change." Occasional Paper Series #8, The Public Affairs Center, Dartmouth College. (1979년 Evaluation and Program Planning 2(1):67–90으로 재간행, DOI: 10.1016/0149-7189(79)90048-X.) Campbell's law의 고전 출처.
- Manheim, D., & Garrabrant, S. (2018). "Categorizing Variants of Goodhart's Law." arXiv:1803.04585. Goodhart 효과를 4유형(Regressional·Extremal·Causal·Adversarial)으로 형식화.
- Lucas, R. E. (1976). Econometric policy evaluation: A critique. Carnegie-Rochester Conference Series on Public Policy, 1, 19–46. DOI: 10.1016/S0167-2231(76)80003-6. 정책이 바뀌면 추정된 관계가 바뀐다는 거시경제학의 인접 논리.
- Strathern, M. (1997). "'Improving ratings': audit in the British University system." European Review, 5(3), 305–321. DOI: 10.1002/(SICI)1234-981X(199707)5:3<305::AID-EURO1843.0.CO;2-4. 오늘날 가장 널리 쓰이는 Goodhart식 정식화의 출처.
원문 핵심 인용
- Goodhart (1975), Manheim & Garrabrant 2018, p.1에서 재인용: "any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes."
- Strathern (1997), p.308: "When a measure becomes a target, it ceases to be a good measure." (Goodhart을 일반화한 정식화 — Goodhart 원 문장과 다른 Strathern의 재정식화.) (원문 대조 못 함 — 2차 출처 기반)
- Campbell (1976): "the more any quantitative social indicator … is used for social decision-making, the more subject it will be to corruption pressures and the more apt it will be to distort and corrupt the social processes it is intended to monitor." (원문 대조 못 함 — 2차 출처 기반)
- Manheim & Garrabrant (2018), p.1: "a Goodhart effect is when optimization causes a collapse of the statistical relationship between a goal which the optimizer intends and the proxy used for that goal."
핵심 정의·메커니즘
원전 정의
Goodhart는 영국 통화 관리 경험을 두고, 통제 목적으로 압력을 가하면 관찰된 통계적 규칙성이 무너지는 경향이 있다고 적었다 [Goodhart 1975]. Campbell은 양적 사회 지표가 의사결정에 많이 쓰일수록 부패 압력을 받고 그 지표가 감시하려던 과정 자체를 왜곡한다고 적었다 [Campbell 1976]. 둘은 통화 정책과 사회 프로그램 평가라는 서로 다른 맥락에서 따로 나왔고, 오늘날 널리 쓰이는 "측정이 목표가 되는 순간 좋은 측정이기를 멈춘다"는 정식화는 Strathern이 둘을 일반화한 표현이다 [Strathern 1997].
- 용어
- Proxy measure(대리지표): 직접 측정하기 어려운 목표를 대신하는 지표.
- Gaming(게이밍): 지표 개선이 실제 목표 개선 없이 일어나는 행동. 보고 조작, 분모 조정, 대상 선별, 시점 이동이 대표 형태다.
작동 기제
1. 실제 목표는 직접 측정하기 어려워, 조직은 이를 대신할 대리지표(proxy)를 쓴다. 2. 그 대리지표에 성과급·공개 순위 같은 보상·처벌이 붙으면, 행위자는 대리지표 자체를 최적화하기 시작한다 [Manheim & Garrabrant 2018]. 3. 이 최적화는 네 갈래 중 하나로 대리지표-목표 관계를 깬다 [Manheim & Garrabrant 2018] — Regressional(불완전한 proxy를 고르면 신호와 함께 잡음까지 선택됨), Extremal(proxy를 극단값으로 밀면 관계가 성립하던 영역을 벗어남), Causal(proxy와 목표가 간접 경로·공통 원인으로만 이어져 있을 때 proxy에 직접 개입하면 관계가 끊김 — 이때는 극단적 개입이 온건한 개입보다 효과가 작을 수 있다고 논문은 적었다), Adversarial(목표가 다른 행위자가 평가 방식을 알고 역이용함). 4. 일이 여러 과업으로 이뤄지고 일부만 측정될 때는, 측정되는 과업에 강한 성과급이 걸리는 순간 노력이 그쪽으로 쏠리고 측정 안 되는 과업이 희생된다(다중 과업 모형) — 이 경우 약한 성과급이나 고정급이 더 나을 수 있다 [Holmström & Milgrom 1991]. 조직론에서는 이를 "B를 바라면서 A에 보상하는" 설계 오류로 정리했다 [Kerr 1975]. 5. 지표가 사회적 의사결정에 계속 쓰이면 그 지표와 지표가 감시하려던 과정 자체가 되먹임 고리를 타고 함께 부패한다 [Campbell 1976] — 지표가 행동을 바꾸고, 바뀐 행동이 지표의 의미를 다시 바꾼다.
정책이 바뀌면 사람들의 기대와 행동이 함께 바뀌어 과거 자료로 추정한 관계가 새 정책 아래서 성립하지 않는다는 Lucas 비판은, 같은 시기 거시경제학에서 나온 인접한 논리다(아래 구별 표 참고) [Lucas 1976].
언제 강해지고 언제 약해지나
- 지표에 보상·처벌이 얼마나 강하게 붙는가(성과급 강도, 공개 순위).
- 행위자가 측정 방식을 얼마나 알고 조작할 수 있는가(자기 보고인지, 외부 측정인지).
- 문턱값(bright line) 규칙이 있는가 — 문턱이 있으면 문턱 바로 위로 몰리는 행동이 생긴다 [Jacob & Levitt 2003].
- 측정 안 되는 과업이 얼마나 중요한가 [Holmström & Milgrom 1991].
- 감사·모니터링의 촘촘함: 잉글랜드 155개 병원 자료로 응급실 4시간 대기 목표의 역기능 가설을 검증한 연구는 그 증거를 찾지 못했다 [Kelman & Friedman 2009] — 같은 잉글랜드 NHS 체계 안에서도 구급차 대응시간·수술 대기명단처럼 게이밍이 확인된 지표 [Bevan & Hood 2006]와 달리, 이 지표에서는 효과가 나타나지 않아 지표·감사 방식에 따라 세기가 달라짐을 보여준다.
어떻게 재나
- 이상 패턴 통계 탐지: 시카고 공립학교 자료에서 학급별 예상 밖 점수 급등과 옆자리 학생 간 의심스러운 답안 일치 패턴을 결합한 알고리즘으로 교사·관리자의 시험 부정을 추정했다 [Jacob & Levitt 2003].
- 자연실험(전후 비교): 뉴욕·펜실베이니아의 심장수술 성적표(사망률 공개) 도입을 계기로, Medicare 심장질환 환자 전국 자료에서 도입 전후로 시술률·의료비·건강결과가 어떻게 바뀌었는지 이중차분으로 비교했다 [Dranove et al. 2003].
- 빈도 분포 대조: 잉글랜드 구급차 대응시간 보고값의 분포를 그려, 8분 문턱 직전에 부자연스럽게 튀어 오르는 "스파이크"가 있는지 대응시간이 완만하게 줄어드는 조직과 비교했다 [Bevan & Hood 2006].
헷갈리는 개념과의 차이
이웃 개념은 "측정이 대상을 바꾼다"는 점에서 닮았지만 무엇이 왜 바뀌는지가 다르다.
| 개념 | 무엇이 바뀌나 | 대표 맥락 | 출처 | |---|---|---|---| | Goodhart 효과 (지표 게임) | 지표에 압력을 걸면 지표-목표의 통계적 관계 자체가 무너진다 | 통화 관리, 조직 성과지표 | [Goodhart 1975] [Manheim & Garrabrant 2018] | | Campbell의 법칙 | 양적 사회지표를 의사결정에 많이 쓸수록 그 지표와 지표가 감시하려던 과정이 부패한다 | 사회 프로그램 평가 | [Campbell 1976] | | Lucas 비판 | 정책(규칙) 자체가 바뀌면 사람들의 기대가 함께 바뀌어, 과거 자료로 추정한 구조 모수가 새 정책 아래서는 성립하지 않는다. 행위자가 지표를 전략적으로 최적화하지 않아도, 정책 변경을 예상하는 것만으로 관계가 깨진다 | 거시경제 정책 평가 | [Lucas 1976] | | 측정 반응성(reactivity) / 순위 효과 | 사람이 평가·관찰·측정받는다는 사실 자체에 반응해 행동을 바꾼다. 자기실현적 예언과 공약수화(commensuration, 서로 다른 대상을 하나의 척도로 줄세우기)라는 두 기제로 일어나며, 허위 보고 없이도 발생한다 | 로스쿨 언론 순위 발표 뒤 학교들이 지원자 선발·자원 배분 기준을 순위 산식에 맞춰 재구성 | [Espeland & Sauder 2007] | | 호손 효과(Hawthorne effect) | 관찰·연구 대상이 된다는 사실 자체가 결과를 바꾼다. 전략적 조작 없이, 관찰당한다는 인식만으로 생기는 효과다. 치매 신약 위약대조 시험에서 방문·평가를 더 자주 받은 집단이 그렇지 않은 집단보다 인지기능 점수가 유의하게 더 좋았다(ADAS-Cog 평균차 −2.018, 95% CI −3.914~−0.121) | 임상시험 대조군 설계 | [McCarney et al. 2007] | | 대리 종말점(surrogate endpoint) | 측정이 쉬운 대리 지표(종양 크기, 콜레스테롤 수치 등)로 측정이 어려운 결과(사망·실명)를 추정하려다, 개입이 대리 지표와 다른 인과 경로로 실제 결과에 영향을 줘 둘 사이가 어긋난다. 인과 경로 자체가 여러 갈래라는 설계 문제다 | 신약 임상 3상 설계 | [Fleming & DeMets 1996] |
Goodhart·Campbell·Lucas는 모두 지표-목표 관계가 무너지는 결과를 낳는다. Goodhart와 Campbell은 행위자의 전략적 대응(게이밍)이 원인이고, Lucas는 정책 자체의 구조 변화가 원인이다. 반응성·호손 효과는 허위 보고 없이 관찰당한다는 사실만으로 행동이 바뀌므로 게이밍보다 넓은 범주에 속한다. 대리 종말점 문제는 전략적 반응과 무관하게, 대리 지표와 목표 사이의 인과 경로가 여럿이라는 설계 결함에서 나온다.
2018년 이후에는 이 논리가 기계학습·AI 정렬(alignment) 문헌으로도 확장됐다. Goodhart 4유형을 정식화한 논문 자체가 "최적화 능력이 커질수록 Goodhart 효과가 커지므로 AI 분야에서 특히 중요하다"고 명시했고 [Manheim & Garrabrant 2018], 이후 보상함수를 문자 그대로 최적화해 설계자의 의도와 다른 방식으로 점수를 올리는 현상을 reward hacking(보상 해킹)·specification gaming(명세 게이밍)이라 부르며 같은 문제로 다룬다. 이 과정을 곡선으로 잰 연구도 있다. 사람 선호를 흉내 낸 대리 보상모델(proxy reward model)을 강화학습이나 best-of-n(n개 답 중 대리 점수 최고를 고르기)으로 최적화하면, 기준 역할을 하는 '정답' 보상모델 점수는 처음에 오르다가 최적화가 더 진행되면 떨어졌다. 대리 보상모델이 크거나 학습 자료가 많을수록 정답 점수가 전반적으로 높았고 과최적화가 덜했으며, 이 관계는 최적화량(초기 정책과의 KL 거리)에 대한 간단한 함수식으로 맞았다 [Gao, Schulman & Hilton 2023]. 지표를 세게 밀어붙일수록 지표와 목표가 벌어진다는 Extremal Goodhart를 기계학습 환경에서 정량으로 보인 결과다.
주요 후속 연구·메타분석
### Jacob & Levitt (2003) — 시카고 공립학교 답안 패턴으로 교사 부정을 추정하다 Quarterly Journal of Economics, 118(3), 843–877. DOI: 10.1162/00335530360698441
- 설계: 시카고 공립학교 초등학급의 표준화 시험 답안지 자료에서, 학급별 예상 밖 점수 급등과 옆자리 학생 간 의심스러운 답안 일치 패턴을 결합한 통계 알고리즘으로 교사·관리자의 시험 부정 가능성을 추정했다.
- 결과: 심각한 부정이 매년 초등 학급의 최소 4~5%에서 일어난 것으로 추정됐고, 관찰된 부정 빈도는 비교적 작은 인센티브 변화에도 강하게 반응했다.
- 의미와 한계: 저자들은 선명한 문턱 규칙이 붙은 강한 인센티브가 부정 같은 예상 밖 왜곡을 부를 수 있다고 결론지었다. 수치는 "최소" 추정이고, 알고리즘은 통계적 이상 패턴을 찾는 도구다(초록 기준).
### Dranove, Kessler, McClellan & Satterthwaite (2003) — 심장수술 성적표가 부른 환자 선별 Journal of Political Economy, 111(3), 555–588. DOI: 10.1086/374180
- 설계: 미국 Medicare 심장질환(AMI) 환자 전국 자료를 이용해, 뉴욕·펜실베이니아의 심장수술(CABG) 성적표(병원·의사별 사망률 공개) 도입 전후로 시술률·의료비·건강결과가 다른 주와 비교해 어떻게 바뀌었는지 이중차분으로 분석했다.
- 결과: 성적표 도입 뒤 평균 AMI 환자가 1년 안에 CABG를 받을 확률이 0.60~0.91%p 늘었고(기저 13.1%), 이 증가분은 전부 병이 덜 심한 환자(발병 전 1년간 입원 이력이 없는 환자)에서 나왔다. PTCA(혈관성형술) 1년 시술률은 전체 AMI 환자에서 1.22~1.69%p 줄었고(기저 12.43%), 중증 환자만 보면 1.50~1.72%p 줄었다. 평균 환자의 심부전 재입원율은 약 0.5%p, 중증 환자군은 약 2.3%p(기저 9.4%) 높아졌고, 한 모형에서는 중증 환자 사망률이 0.82%p 유의하게 늘었다.
- 의미와 한계: 공개 지표가 병원의 환자 선별(고위험 환자 회피)을 유도해, 지표 자체는 개선돼도 가장 아픈 환자의 결과가 나빠질 수 있음을 보였다. 저자들은 적어도 단기적으로는 이 성적표가 환자·사회 후생을 낮췄다고 결론지었다.
### Bevan & Hood (2006) — 잉글랜드 목표관리 체제의 게이밍 증거 Public Administration, 84(3), 517–538. DOI: 10.1111/j.1467-9299.2006.00600.x
- 설계: 2000년대 잉글랜드 공공의료의 목표·처벌 체제를, 구급차 대응시간·응급실 대기·수술 대기명단 세 지표의 보고자료와 감사보고서(Commission for Health Improvement, National Audit Office 등)로 점검했다.
- 결과: 구급차 조직의 3분의 1에서 대응시간이 8분 문턱 직전에 몰리는 보정 패턴이 발견됐고, 인용된 여러 연구에서 반응적 게이밍을 한 것으로 나타난 조직 비율은 7~33%였다. 안과 외래 사례에서는 후속 예약을 취소·지연해 대기시간 목표를 채운 결과 25명의 환자가 2년 사이 시력을 잃었다.
- 의미와 한계: 문턱이 있는 목표에서 보고값을 문턱 안쪽으로 밀어 넣는 임계값 게이밍이 반복 관찰됐다. 저자들은 중앙 감사가 사후적·산발적이어서 게이밍 발견이 우연에 의존했다고 지적한다.
### Cerasoli, Nicklin & Ford (2014) — 내재 동기·외적 인센티브 메타분석 Psychological Bulletin, 140(4), 980–1008. DOI: 10.1037/a0035661
- 설계: 내재 동기-외적 인센티브-수행 관계를 다룬 40년간의 연구 k=183편(N=212,468)을 메타분석했다.
- 결과: 내재 동기는 수행을 중간~강하게 예측했고(ρ=.21–.45), 외적 인센티브는 수행의 '양'을, 내재 동기는 수행의 '질'을 상대적으로 더 잘 예측했다. 인센티브가 수행에 직접 묶이면 내재 동기의 예측력이 줄었다(구축 효과).
- 의미와 한계: 측정하기 쉬운 양에 보상을 걸면 양이 움직인다는 결과는 게이밍 논리와 방향이 같다. 다만 이 메타분석은 게이밍 자체를 측정하지 않았고 인센티브-수행 관계를 다룬 간접 근거다.
### Gao, Schulman & Hilton (2023) — 대리 보상을 세게 최적화할수록 실제 점수가 꺾인다 Proceedings of the 40th International Conference on Machine Learning (ICML), PMLR 202, 10835–10866. arXiv:2210.10760, DOI: 10.48550/arXiv.2210.10760
- 설계: 사람 평가 대신 60억 매개변수 보상모델을 '정답'(gold)으로 정하고, 이 정답 모델이 매긴 비교 10만 쌍으로 크기 300만~30억 매개변수의 대리 보상모델을 학습시켰다. 12억 매개변수 GPT-3 계열 정책을 대리 보상모델에 맞춰 강화학습(PPO)과 best-of-n 표집으로 최적화하면서, 최적화량(초기 정책과의 KL 거리의 제곱근, d)에 따라 정답 점수가 어떻게 변하는지 측정했다.
- 결과: 두 방법 모두 정답 점수가 처음 오르다 뒤에 떨어졌다. 정답 점수는 best-of-n에서 R = d(α − βd), 강화학습에서 R = d(α − β·log d) 꼴로 맞았고, 계수는 대리 보상모델 크기에 따라 대략 로그 추세로 매끄럽게 변했다. 보상모델이 클수록, 학습 자료가 많을수록 정답 점수가 전반적으로 높았다. best-of-n 식은 n=1,000까지의 자료로 정한 뒤 n=60,000(KL 약 10 nats)까지 늘린 실험으로 사전 예측을 확인했다. 강화학습에 KL 벌점을 넣으면 대리 점수는 올랐지만 정답 점수와 KL 거리의 관계는 측정 가능할 만큼 나아지지 않았다.
- 의미와 한계: 지표와 목표가 처음에는 함께 움직이다 최적화 압력이 커지면 갈라진다는 Goodhart 효과를 곡선의 모양까지 잰 드문 결과다. 저자들은 합성 설정(정답도 모델)이라 실제 사람 평가로 옮겨지는지, 다른 환경에서도 성립하는지는 검증되지 않았고, KL 벌점 결과는 하이퍼파라미터에 민감할 수 있다고 적었다. 사람의 실제 의도와 평가 라벨 사이의 어긋남은 이 설정에 들어 있지 않다.
### Kelman & Friedman (2009) — 반증: 응급실 대기 목표의 역기능을 찾지 못하다 Journal of Public Administration Research and Theory, 19(4), 917–946. DOI: 10.1093/jopart/mun028
- 설계: 잉글랜드 155개 병원의 응급실 4시간 대기시간 목표 도입 전후 자료로, 측정 안 되는 차원의 노력을 줄이는 노력 대체와, 실제보다 좋아 보이게 만드는 게이밍이라는 두 종류의 역기능 가설을 검증했다.
- 결과: 2003~2006년 대기시간 성과는 크게 좋아졌고, 이 목표와 관련해 제기된 역기능 가설 어느 것도 증거를 찾지 못했다.
- 의미와 한계: 목표관리가 언제나 게이밍으로 성과를 갉아먹는다는 서사에 대한 대표 반증 사례다. 같은 잉글랜드 NHS 체계에서 구급차 대응시간·수술 대기명단은 게이밍 증거가 확인됐으므로 [Bevan & Hood 2006], 게이밍 여부는 지표별로 갈릴 수 있다. 저자들도 역기능이 언제 나타나고 언제 안 나타나는지를 논의했다.
- 나머지 문헌(한 줄)
- Gao, L., Schulman, J., & Hilton, J. (2023). Scaling laws for reward model overoptimization. Proceedings of the 40th International Conference on Machine Learning, PMLR 202, 10835–10866. arXiv:2210.10760. — 위 해설 참조.
- Kerr, S. (1975). On the folly of rewarding A, while hoping for B. Academy of Management Journal, 18(4), 769–783. DOI: 10.5465/255378. — 정치·의료·기업 사례로, 원하는 행동과 보상하는 행동이 어긋나는 보상 설계를 정리한 조직론 고전.
- Holmström, B., & Milgrom, P. (1991). Multitask principal–agent analyses: Incentive contracts, asset ownership, and job design. Journal of Law, Economics, & Organization, 7(special issue), 24–52. DOI: 10.1093/jleo/7.specialissue.24. — 측정 가능한 과업에 노력이 쏠리는 이유를 보인 이론 모형. 측정이 어려운 과업이 중요하면 성과급을 약하게 하는 편이 낫다.
- Ordóñez, L. D., Schweitzer, M. E., Galinsky, A. D., & Bazerman, M. H. (2009). Goals gone wild: The systematic side effects of overprescribing goal setting. Academy of Management Perspectives, 23(1), 6–16. DOI: 10.5465/amp.2009.37007999. — 목표 설정이 좁은 초점·비윤리 행동·위험 추구를 부를 수 있다고 경고.
- Locke, E. A., & Latham, G. P. (2009). Has goal setting gone wild, or have its attackers abandoned good scholarship? Academy of Management Perspectives, 23(1), 17–23. DOI: 10.5465/amp.2009.37008000. — 위 논문에 대한 반박.
- Muller, J. Z. (2018). The Tyranny of Metrics. Princeton University Press. — 의료·교육·치안·군 등에서 지표화(metric fixation)의 조직적 부작용을 사례로 종합.
- Hoskin, K. (1996). The "awful idea of accountability": Inscribing people into the measurement of objects. In R. Munro & J. Mouritsen (Eds.), Accountability: Power, Ethos and the Technologies of Managing (pp. 265–282). International Thomson Business Press. — 회계·감사 맥락에서 Goodhart 일반화의 선행 논의(Strathern이 응답·재정식화한 대상).
- Espeland, W. N., & Sauder, M. (2007). Rankings and reactivity: How public measures recreate social worlds. American Journal of Sociology, 113(1), 1–40. DOI: 10.1086/517897. — 로스쿨 순위를 사례로 측정 반응성(reactivity) 개념을 자기실현적 예언·공약수화 두 기제로 정식화. 게이밍과 구별되는 이웃 개념.
- McCarney, R., Warner, J., Iliffe, S., van Haselen, R., Griffin, M., & Fisher, P. (2007). The Hawthorne effect: A randomised, controlled trial. BMC Medical Research Methodology, 7, 30. DOI: 10.1186/1471-2288-7-30. — 치매 위약대조 시험에서 관찰 빈도 자체가 결과를 바꾸는 호손 효과를 정량화.
- Fleming, T. R., & DeMets, D. L. (1996). Surrogate end points in clinical trials: Are we being misled? Annals of Internal Medicine, 125(7), 605–613. DOI: 10.7326/0003-4819-125-7-199610010-00011. — 대리 종말점이 실제 임상 결과와 어긋나는 사례를 정리, 게이밍과 다른 설계 결함으로서 대리지표 문제를 논의.
비판·한계
재현성
- 잉글랜드 155개 병원 자료로 다기관 검증한 연구는 응급실 4시간 대기 목표의 역기능 가설에 대한 증거를 찾지 못했다 [Kelman & Friedman 2009]. 같은 체계에서도 지표별로 결과가 갈린다 — 구급차 대응시간·수술 대기명단은 게이밍이 확인됐고 [Bevan & Hood 2006], 응급실 대기는 확인되지 않았다.
- "지표 게이밍" 전체를 하나로 묶은 효과크기 메타분석은 없다. 증거는 분야별 사례연구와 준실험에 흩어져 있고, 인센티브-수행 메타분석 [Cerasoli et al. 2014] 은 간접 근거다.
대표 반론
- 반론: 목표 설정을 과도하게 처방하면 좁은 초점, 비윤리 행동, 위험 추구 같은 부작용이 체계적으로 따른다 [Ordóñez et al. 2009].
- 원 주장 쪽 응답: 목표설정 이론 연구자들은 이 반론이 일화 중심 사례에 기대고 있고, 목표의 난이도·구체성 같은 조절 조건을 무시했다고 반박했다 [Locke & Latham 2009]. 구체적이고 어려운 목표가 수행을 높인다는 누적 증거와 게이밍 경고는 함께 읽어야 한다는 것이 이들의 결론이다.
쓰면 안 되는 상황
- 게이밍 가능성만으로 측정 자체를 거부하는 근거로 쓰면 안 된다.
- 과업이 단순하고 결과를 직접 측정할 수 있으면(예: 생산량이 곧 목표인 일) 대리지표 문제가 작다 [Holmström & Milgrom 1991].
- 지표를 버리고 정성 평가로 전환하면 불투명성과 평가자 편파가 커질 수 있다 — 게이밍 위험과 정성 평가로 옮겨갈 때의 비용을 함께 따져야 한다.
관련 모델
- 인센티브 호환성, 정보 비대칭, 시스템 사고, 2차 사고, 파레토 원칙
사고 도구 다른 글