굿하트의 법칙 / 지표 게임 (Metric Gaming)

처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27

다른 이름: 지표 게임 · 지표 조작 · Goodhart's Law · Metric Gaming

한 줄 정의

측정 지표가 목표가 되는 순간, 사람과 조직이 그 지표를 개선하는 방향으로 행동을 바꾸면서 원래 목표가 왜곡되는 현상.

일상 한 줄

점수가 목표가 되면, 사람은 점수를 최적화한다.

흔한 장면

왜 빠지나 (메커니즘)

빠져나오는 법

1. 이 지표가 대리하는 실제 목표를 적는다. — 근거 수준: 경험칙(직접 검증 연구 없음) 2. 지표가 목표가 되면 어떤 부작용이 생길지 묻는다. — 근거 수준: 경험칙(직접 검증 연구 없음) 3. 단일 지표보다 균형 지표와 질적 검토를 함께 둔다. — 근거: 이론 모형 [Holmström & Milgrom 1991] 4. 지표 개선과 실제 목표 개선을 주기적으로 분리 검증한다. — 근거 수준: 경험칙(개입 효과 연구 없음). 지표와 실제 결과가 갈라지는 현상 자체는 관찰 연구로 확인됨 [Dranove et al. 2003] 5. 지표를 공개·보상하기 전에 gaming 가능성을 검토하고, 감사에 무작위성을 섞는다. — 근거 수준: 사례 분석에 기반한 제안 [Bevan & Hood 2006], 개입 효과 연구 없음

이 5단계 중 이론 근거가 있는 것은 3번뿐이다. 측정 가능한 과업에 강한 성과급을 걸수록 측정 안 되는 과업이 희생된다는 다중 과업 모형은, 처방으로 "성과급을 약하게 하거나 여러 지표를 함께 본다"를 내놓는다 [Holmström & Milgrom 1991] — 균형 지표·질적 검토(3번)는 이 처방과 같은 방향이다. 5번의 무작위 감사는 Bevan & Hood가 과속 카메라에 빗대 "감시 과정에 어느 정도 불확실성을 두어야 한다"고 제안한 것이고, 효과를 잰 결과는 아니다 [Bevan & Hood 2006]. 1·2·4·5번이 실제로 게이밍을 줄이는지 개입 전후 게이밍 빈도를 비교한 연구는 이번에 찾지 못했다.

함께 쓰기 좋은 도구

통념이 무너지는 순간

### "측정하면 개선된다" ⚠ 흔한 말: "측정할 수 없으면 관리할 수 없다 — 일단 KPI부터 걸자." ✓ 학술: Goodhart는 영국 통화 관리 경험을 두고, 통제 목적으로 압력을 가하면 관찰된 통계적 규칙성이 무너지는 경향이 있다고 적었다. Strathern은 이를 "측정이 목표가 되는 순간 좋은 측정이기를 멈춘다"로 정식화했다. [Goodhart 1975] [Strathern 1997]

### "숫자는 객관적이다" ⚠ 흔한 말: "감이 아니라 데이터로 말하자, 숫자는 거짓말을 안 한다." ✓ 학술: 양적 지표가 의사결정에 쓰일수록 부패 압력에 노출되고, 지표가 감시하려던 과정 자체를 왜곡한다 — 객관적 형식이 객관적 결과를 보장하지 않는다. [Campbell 1976]

### "지표가 좋아졌으니 일이 잘되고 있다" ⚠ 흔한 말: "대시보드가 다 초록불인데 뭐가 문제냐." ✓ 학술: 불완전한 proxy를 극단까지 최적화하면 proxy-목표 관계가 성립하던 영역을 벗어나(Extremal Goodhart), 지표는 개선돼도 목표는 악화될 수 있다. [Manheim & Garrabrant 2018]

1차 출처

원문 핵심 인용

핵심 정의·메커니즘

원전 정의

Goodhart는 영국 통화 관리 경험을 두고, 통제 목적으로 압력을 가하면 관찰된 통계적 규칙성이 무너지는 경향이 있다고 적었다 [Goodhart 1975]. Campbell은 양적 사회 지표가 의사결정에 많이 쓰일수록 부패 압력을 받고 그 지표가 감시하려던 과정 자체를 왜곡한다고 적었다 [Campbell 1976]. 둘은 통화 정책과 사회 프로그램 평가라는 서로 다른 맥락에서 따로 나왔고, 오늘날 널리 쓰이는 "측정이 목표가 되는 순간 좋은 측정이기를 멈춘다"는 정식화는 Strathern이 둘을 일반화한 표현이다 [Strathern 1997].

작동 기제

1. 실제 목표는 직접 측정하기 어려워, 조직은 이를 대신할 대리지표(proxy)를 쓴다. 2. 그 대리지표에 성과급·공개 순위 같은 보상·처벌이 붙으면, 행위자는 대리지표 자체를 최적화하기 시작한다 [Manheim & Garrabrant 2018]. 3. 이 최적화는 네 갈래 중 하나로 대리지표-목표 관계를 깬다 [Manheim & Garrabrant 2018] — Regressional(불완전한 proxy를 고르면 신호와 함께 잡음까지 선택됨), Extremal(proxy를 극단값으로 밀면 관계가 성립하던 영역을 벗어남), Causal(proxy와 목표가 간접 경로·공통 원인으로만 이어져 있을 때 proxy에 직접 개입하면 관계가 끊김 — 이때는 극단적 개입이 온건한 개입보다 효과가 작을 수 있다고 논문은 적었다), Adversarial(목표가 다른 행위자가 평가 방식을 알고 역이용함). 4. 일이 여러 과업으로 이뤄지고 일부만 측정될 때는, 측정되는 과업에 강한 성과급이 걸리는 순간 노력이 그쪽으로 쏠리고 측정 안 되는 과업이 희생된다(다중 과업 모형) — 이 경우 약한 성과급이나 고정급이 더 나을 수 있다 [Holmström & Milgrom 1991]. 조직론에서는 이를 "B를 바라면서 A에 보상하는" 설계 오류로 정리했다 [Kerr 1975]. 5. 지표가 사회적 의사결정에 계속 쓰이면 그 지표와 지표가 감시하려던 과정 자체가 되먹임 고리를 타고 함께 부패한다 [Campbell 1976] — 지표가 행동을 바꾸고, 바뀐 행동이 지표의 의미를 다시 바꾼다.

정책이 바뀌면 사람들의 기대와 행동이 함께 바뀌어 과거 자료로 추정한 관계가 새 정책 아래서 성립하지 않는다는 Lucas 비판은, 같은 시기 거시경제학에서 나온 인접한 논리다(아래 구별 표 참고) [Lucas 1976].

언제 강해지고 언제 약해지나

어떻게 재나

헷갈리는 개념과의 차이

이웃 개념은 "측정이 대상을 바꾼다"는 점에서 닮았지만 무엇이 왜 바뀌는지가 다르다.

| 개념 | 무엇이 바뀌나 | 대표 맥락 | 출처 | |---|---|---|---| | Goodhart 효과 (지표 게임) | 지표에 압력을 걸면 지표-목표의 통계적 관계 자체가 무너진다 | 통화 관리, 조직 성과지표 | [Goodhart 1975] [Manheim & Garrabrant 2018] | | Campbell의 법칙 | 양적 사회지표를 의사결정에 많이 쓸수록 그 지표와 지표가 감시하려던 과정이 부패한다 | 사회 프로그램 평가 | [Campbell 1976] | | Lucas 비판 | 정책(규칙) 자체가 바뀌면 사람들의 기대가 함께 바뀌어, 과거 자료로 추정한 구조 모수가 새 정책 아래서는 성립하지 않는다. 행위자가 지표를 전략적으로 최적화하지 않아도, 정책 변경을 예상하는 것만으로 관계가 깨진다 | 거시경제 정책 평가 | [Lucas 1976] | | 측정 반응성(reactivity) / 순위 효과 | 사람이 평가·관찰·측정받는다는 사실 자체에 반응해 행동을 바꾼다. 자기실현적 예언과 공약수화(commensuration, 서로 다른 대상을 하나의 척도로 줄세우기)라는 두 기제로 일어나며, 허위 보고 없이도 발생한다 | 로스쿨 언론 순위 발표 뒤 학교들이 지원자 선발·자원 배분 기준을 순위 산식에 맞춰 재구성 | [Espeland & Sauder 2007] | | 호손 효과(Hawthorne effect) | 관찰·연구 대상이 된다는 사실 자체가 결과를 바꾼다. 전략적 조작 없이, 관찰당한다는 인식만으로 생기는 효과다. 치매 신약 위약대조 시험에서 방문·평가를 더 자주 받은 집단이 그렇지 않은 집단보다 인지기능 점수가 유의하게 더 좋았다(ADAS-Cog 평균차 −2.018, 95% CI −3.914~−0.121) | 임상시험 대조군 설계 | [McCarney et al. 2007] | | 대리 종말점(surrogate endpoint) | 측정이 쉬운 대리 지표(종양 크기, 콜레스테롤 수치 등)로 측정이 어려운 결과(사망·실명)를 추정하려다, 개입이 대리 지표와 다른 인과 경로로 실제 결과에 영향을 줘 둘 사이가 어긋난다. 인과 경로 자체가 여러 갈래라는 설계 문제다 | 신약 임상 3상 설계 | [Fleming & DeMets 1996] |

Goodhart·Campbell·Lucas는 모두 지표-목표 관계가 무너지는 결과를 낳는다. Goodhart와 Campbell은 행위자의 전략적 대응(게이밍)이 원인이고, Lucas는 정책 자체의 구조 변화가 원인이다. 반응성·호손 효과는 허위 보고 없이 관찰당한다는 사실만으로 행동이 바뀌므로 게이밍보다 넓은 범주에 속한다. 대리 종말점 문제는 전략적 반응과 무관하게, 대리 지표와 목표 사이의 인과 경로가 여럿이라는 설계 결함에서 나온다.

2018년 이후에는 이 논리가 기계학습·AI 정렬(alignment) 문헌으로도 확장됐다. Goodhart 4유형을 정식화한 논문 자체가 "최적화 능력이 커질수록 Goodhart 효과가 커지므로 AI 분야에서 특히 중요하다"고 명시했고 [Manheim & Garrabrant 2018], 이후 보상함수를 문자 그대로 최적화해 설계자의 의도와 다른 방식으로 점수를 올리는 현상을 reward hacking(보상 해킹)·specification gaming(명세 게이밍)이라 부르며 같은 문제로 다룬다. 이 과정을 곡선으로 잰 연구도 있다. 사람 선호를 흉내 낸 대리 보상모델(proxy reward model)을 강화학습이나 best-of-n(n개 답 중 대리 점수 최고를 고르기)으로 최적화하면, 기준 역할을 하는 '정답' 보상모델 점수는 처음에 오르다가 최적화가 더 진행되면 떨어졌다. 대리 보상모델이 크거나 학습 자료가 많을수록 정답 점수가 전반적으로 높았고 과최적화가 덜했으며, 이 관계는 최적화량(초기 정책과의 KL 거리)에 대한 간단한 함수식으로 맞았다 [Gao, Schulman & Hilton 2023]. 지표를 세게 밀어붙일수록 지표와 목표가 벌어진다는 Extremal Goodhart를 기계학습 환경에서 정량으로 보인 결과다.

주요 후속 연구·메타분석

### Jacob & Levitt (2003) — 시카고 공립학교 답안 패턴으로 교사 부정을 추정하다 Quarterly Journal of Economics, 118(3), 843–877. DOI: 10.1162/00335530360698441

### Dranove, Kessler, McClellan & Satterthwaite (2003) — 심장수술 성적표가 부른 환자 선별 Journal of Political Economy, 111(3), 555–588. DOI: 10.1086/374180

### Bevan & Hood (2006) — 잉글랜드 목표관리 체제의 게이밍 증거 Public Administration, 84(3), 517–538. DOI: 10.1111/j.1467-9299.2006.00600.x

### Cerasoli, Nicklin & Ford (2014) — 내재 동기·외적 인센티브 메타분석 Psychological Bulletin, 140(4), 980–1008. DOI: 10.1037/a0035661

### Gao, Schulman & Hilton (2023) — 대리 보상을 세게 최적화할수록 실제 점수가 꺾인다 Proceedings of the 40th International Conference on Machine Learning (ICML), PMLR 202, 10835–10866. arXiv:2210.10760, DOI: 10.48550/arXiv.2210.10760

### Kelman & Friedman (2009) — 반증: 응급실 대기 목표의 역기능을 찾지 못하다 Journal of Public Administration Research and Theory, 19(4), 917–946. DOI: 10.1093/jopart/mun028

비판·한계

재현성

대표 반론

쓰면 안 되는 상황

관련 모델

사고 도구 다른 글