반복게임 (Iterated Game) — tit-for-tat, commitment
처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27
다른 이름: 반복게임 · Iterated Game · Repeated Game
한 줄 정의
같은 상대와 되풀이해 마주치는 상호작용. 한 번만 하는 죄수의 딜레마에서는 배신이 합리적이지만, 다시 만날 가능성이 충분히 크면 먼저 협력하고, 배신엔 갚고, 돌아오면 용서하는 단순 규칙이 강해진다. Axelrod 의 두 차례 컴퓨터 토너먼트(1980)에서 이런 규칙인 tit-for-tat(받은 대로 갚기: 첫 수는 협력, 그다음부터는 상대가 직전에 한 수를 따라 함)이 두 번 모두 우승했다 [Axelrod 1980a; Axelrod 1980b].
일상 한 줄
다시 안 볼 사람과는 당장의 이익이 크게 보인다. 다시 볼 사람이면 평판이 자산이다. 한 번 보고 말 사람처럼 굴면 두 번째 만남부터 그 값을 치른다.
흔한 장면
- 거래처·고객 관계: 한 번의 가격 협상에서 끝까지 짜낼 것인가, 다음 거래까지 보고 적당히 양보할 것인가. 한 번 짜내면 다음 거래부터 상대도 정보를 숨긴다.
- 친구 사이의 부탁: 매번 들어주기만 하면 착취당하기 쉽고, 처음부터 거절하면 관계가 식는다. tit-for-tat 식으로 옮기면 "처음 부탁은 들어준다 → 그다음부터는 친구가 내 직전 부탁에 한 대로 한다(들어줬으면 들어주고, 거절했으면 한 번 거절한다) → 친구가 다시 들어주면 나도 바로 들어준다"가 된다. 실험·시뮬레이션의 규칙을 사람 사이에 옮긴 이론 유추다.
- 회사 동료: 정보 공유와 비공유가 되풀이된다. tit-for-tat 이라면 정보를 숨긴 동료에게 다음 한 번은 똑같이 숨긴다. 오해일 가능성이 있으면 한 번 더 협력해 본다(tit-for-two-tats, 두 번 당해야 한 번 갚기). 잡음이 있는 반복게임 실험에서 성과가 좋았던 전략은 첫 배신에 바로 보복하지 않는 "관대한" 전략이었다 [Fudenberg, Rand & Dreber 2012].
- 부부: 실수 한 번이 보복의 주고받기로 이어지는 루프(tit-for-tat 의 메아리 효과)에 빠지면, 가끔 먼저 손을 내미는 generous tit-for-tat(너그러운 받은 대로 갚기)으로 끊는다. 컴퓨터 토너먼트·시뮬레이션 결과 [Wu & Axelrod 1995]를 가족 관계로 옮긴 이론 유추이며, 부부 관계에서 시험한 연구는 아니다.
- 임대인-세입자 장기 관계: 보증금·수리·계약 갱신이 반복되는 관계. 한 번의 부당한 요구가 다음 갱신·평판으로 돌아옴. 첫 거래의 신뢰가 장기 비용을 좌우한다.
통념이 무너지는 순간
### "처음에는 강하게 나가야 만만하게 안 본다" ⚠ 흔한 말: "초장에 잡아야 한다." ✓ 학술: Axelrod 토너먼트에서 상위권 전략은 모두 먼저 배신하지 않는(nice) 전략이었다. 첫수 배신은 그 판에서 몇 점을 더 얻지만, 받은 대로 갚는 상대는 다음 판부터 배신으로 응해 협력이 끊긴다. Axelrod 가 정리한 우승 전략의 속성은 먼저 배신하지 않기(nice)·배신엔 갚기(retaliatory)·돌아오면 용서하기(forgiving)·읽기 쉬움(clear) 네 가지다 [Axelrod 1984].
### "한 번 당하면 평생 갚아야 한다" ⚠ 흔한 말: "복수는 길게." ✓ 학술: tit-for-tat의 forgiving 속성 — 상대가 협력으로 돌아오면 바로 협력으로 응답한다 [Axelrod 1984]. 영구 처벌(grim trigger, 한 번 배신당하면 끝까지 배신)은 실수에 약하다. 실수 한 번에 협력으로 돌아갈 길이 닫힌다. 실수가 섞이는 환경에서는 가끔 용서하는 generous tit-for-tat 이 진화 시뮬레이션에서 더 잘 버텼다 [Nowak & Sigmund 1992; Wu & Axelrod 1995]. tit-for-two-tats(두 번 당해야 한 번 갚기)도 실수에는 강하지만, 이를 노리는 상대에게 착취당해 Axelrod 의 두 번째 토너먼트에서 순위가 낮았다 [Axelrod 1984].
### "장기적 관계에서는 무조건 협력해야 한다" ⚠ 흔한 말: "참고 양보가 미덕." ✓ 학술: Axelrod의 retaliatory 속성 — 배신에는 바로 갚는다. 무조건 협력(always-C)은 착취당한다. tit-for-tat은 "협력하면 협력, 배신하면 배신"이라는 규칙이 읽기 쉬워, 상대가 협력하는 편이 낫다는 것을 금방 알아차리게 만든다 [Axelrod 1984].
### "반복게임이면 commitment는 필요 없다" ⚠ 흔한 말: "관계만 길면 알아서 협력하게 된다." ✓ 학술: 끝나는 판이 정해진 반복게임에서 이론은 마지막 판부터 거꾸로 따져(역진귀납) 첫 판부터 배신을 예측한다. 그런데 상대가 협력형일 가능성이 조금만 있어도 합리적 참가자가 거의 끝까지 협력하는 균형이 생긴다 [Kreps et al. 1982]. 실제 실험에서는 초반엔 협력하다 끝 무렵에 무너지고, 경험이 쌓일수록 무너지는 시점이 앞당겨졌다 [Selten & Stoecker 1986]. 관계가 길다는 것만으로는 부족하고, 끝이 불확실하거나 평판이 걸려 있어야 협력이 버틴다. 이와 별도로 Schelling (1960)은 계약·공개 약속처럼 자기 선택지를 일부러 묶는 약속(commitment)이 상대의 신뢰를 산다고 보았다.
왜 강한가 (메커니즘)
- 읽기 쉬운 신호 [Axelrod 1984] — tit-for-tat 은 규칙이 단순해 상대가 금방 패턴을 알아챈다. 지나치게 복잡한 전략은 상대가 무작위로 움직이는 것처럼 보여 협력을 끌어내지 못했다.
- 미래의 그림자 — 다음 판의 무게(할인인자, 다음 판이 있을 확률 포함)가 충분히 크면 협력이 균형 중 하나로 가능해진다(folk theorem). 협력이 유일한 균형은 아니고, 배신만 하는 균형도 여전히 있다 [Fudenberg & Maskin 1986]. 불완전 정보(상대 유형에 대한 불확실성)가 있으면 끝이 정해진 반복에서도 비슷한 결과가 나온다 [Kreps et al. 1982; Fudenberg & Maskin 1986].
- 약속 장치(commitment device) [Schelling 1960] — 자기 선택지를 일부러 묶으면(환불 불가 계약, 공개 약속) 상대가 내 행동을 믿을 수 있다. 선택지를 줄이는 것이 협상력이 되는 역설이다.
- 잡음 처리 [Wu & Axelrod 1995] — 현실의 신호에는 실수가 섞인다. 두 tit-for-tat 이 만나 한쪽이 실수하면 배신이 번갈아 메아리친다. 너그러움을 더한 generous tit-for-tat, 자기 실수 뒤엔 한 번 참는 contrite tit-for-tat 이 이 문제를 줄인다. Pavlov(이기면 유지, 지면 바꾸기)는 이 토너먼트에서 강건하지 않았다.
빠져나오는 법 / 적용 단계
1. 이 관계가 한 번인지 반복인지 적어 본다: 다시 만날 가능성이 높고, 배신으로 얻는 추가 이익이 작을수록 협력 쪽이 낫다. 협력이 이론상 가능한 조건이어도 사람들은 협력이 전략적 불확실성에 충분히 강할 때만 높은 비율로 협력했다 [Dal Bó & Fréchette 2018]. — 근거: 실험 메타 자료 [Dal Bó & Fréchette 2018], 통제 실험 [Dal Bó 2005] 2. 첫수는 협력: 새 관계의 첫 거래는 가벼운 협력 신호로 연다. 먼저 배신하면 평판이 바로 상한다. — 근거: 컴퓨터 토너먼트 [Axelrod 1980a; 1980b] (먼저 배신하지 않는 전략이 상위권). 사람 관계로 옮긴 것은 유추 3. 배신에는 같은 크기로 갚되 한 번에 그친다: 영구 처벌은 실수에 약하다. 한 번 갚은 뒤 상대가 협력하면 바로 협력으로 돌아간다 [Axelrod 1980b]. 실수·오해가 섞이는 환경에서는 첫 배신은 넘기는 편이 성과가 좋았다 [Fudenberg, Rand & Dreber 2012]. — 근거: 컴퓨터 토너먼트 [Axelrod 1980b], 잡음 있는 사람 실험 [Fudenberg, Rand & Dreber 2012] 4. 실수 가능성이 있으면 한 번 더 기회: 오해·실수가 잦은 환경에서는 가끔 먼저 용서한다(generous tit-for-tat). — 근거: 잡음 토너먼트 [Wu & Axelrod 1995], 진화 모형 [Nowak & Sigmund 1992] 5. 약속을 보이게 만든다: 계약·공개 약속·환불 불가 조건으로 자기 행동을 묶어 상대의 신뢰를 산다 [Schelling 1960]. — 근거 수준: 이론 [Schelling 1960] (효과를 잰 실험은 이 카드의 문헌에 없음)
1~5 가운데 1과 3은 실험실 반복게임 결과, 2·4·5는 토너먼트·이론을 사람 관계로 옮긴 유추다. 연인·가족·친구 관계에 이 절차를 적용해 효과를 시험한 연구는 이 카드의 문헌에 없다.
함께 쓰기 좋은 도구
- 2차 사고 — 이 한 수가 다음 판에 어떤 영향을 줄까?
- BATNA — 반복게임이라도 BATNA 없으면 협력 강제됨 (구조적 약점).
- information-asymmetry — 정보 격차 큰 반복게임에서는 commitment device가 더 중요.
1차 출처
- Axelrod, R. (1980a). Effective choice in the Prisoner's Dilemma. Journal of Conflict Resolution, 24(1), 3–25. DOI: 10.1177/002200278002400101 — 첫 컴퓨터 토너먼트(전략 14개 제출, 주최 측이 무작위로 협력·배신하는 RANDOM 을 더해 겨룸. 우승 tit-for-tat 은 Anatol Rapoport 제출. 전문 확인).
- Axelrod, R. (1980b). More effective choice in the Prisoner's Dilemma. Journal of Conflict Resolution, 24(3), 379–403. DOI: 10.1177/002200278002400301 — 두 번째 토너먼트(62명 참가). 첫 대회 결과를 알고 설계한 전략들 사이에서도 tit-for-tat 이 다시 우승.
- Axelrod, R., & Hamilton, W. D. (1981). The evolution of cooperation. Science, 211(4489), 1390–1396. DOI: 10.1126/science.7466396 — 진화적으로 안정한 전략으로서의 호혜.
- Axelrod, R. (1984). The Evolution of Cooperation. Basic Books. — 두 차례 토너먼트 종합과 우승 전략의 네 속성.
- Schelling, T. C. (1960). The Strategy of Conflict. Harvard University Press. — 약속 장치(commitment) 개념.
- Fudenberg, D., & Maskin, E. (1986). The folk theorem in repeated games with discounting or with incomplete information. Econometrica, 54(3), 533–554. DOI: 10.2307/1911307
- Nowak, M. A., & Sigmund, K. (1992). Tit for tat in heterogeneous populations. Nature, 355, 250–253. DOI: 10.1038/355250a0 — 잡음 환경에서 generous tit-for-tat 우위.
원문 핵심 인용
"The results of the tournament demonstrate that there are subtle reasons for an individualistic pragmatist to cooperate as long as the other side does, to be somewhat forgiving, and to be optimistic about the other side's responsiveness." — Axelrod (1980a), J. Conflict Resolution 24(1), 3 (abstract)
"Deductions from the model, and the results of a computer tournament show how cooperation based on reciprocity can get started in an asocial world, can thrive while interacting with a wide range of other strategies, and can resist invasion once fully established." — Axelrod & Hamilton (1981), Science 211, 1390 (abstract)
"However, the fact that cooperation can be supported in equilibrium does not imply that most subjects will cooperate." — Dal Bó & Fréchette (2018), J. Economic Literature 56(1), 60 (abstract)
verbatim 검증: 2026-09-27, 세 인용 모두 CrossRef/OpenAlex 에 실린 출판사 초록과 대조.
핵심 정의·메커니즘
원전 정의
- 반복게임(repeated game) — 같은 단판 게임(stage game)을 같은 상대와 여러 번 하는 게임. 각 판의 보수를 할인해 더한 것이 전체 보수다. 죄수의 딜레마 보수는 T(배신 유혹) R(서로 협력) P(서로 배신) S(혼자 협력한 쪽)이고, Axelrod 토너먼트는 T=5, R=3, P=1, S=0 을 썼다 [Axelrod 1984].
- tit-for-tat(받은 대로 갚기) — Axelrod (1980b) 초록의 정의: "the rule which cooperates on the first move and then does what the other player did on the previous move." 첫 수는 협력, 그다음은 상대의 직전 수를 그대로 따라 한다. 한 번 갚고 나면 상대가 협력으로 돌아오는 즉시 협력한다.
- 무한 반복과 유한 반복 — 매 판 끝에 일정 확률 δ로 게임이 이어지면 언제 끝날지 모르는 "무한 반복"이 되고, 몇 판에 끝나는지 알려져 있으면 "유한 반복"이다. 두 경우의 이론 예측이 다르다(아래 표).
작동 기제
1. 오늘의 배신이 내일의 보복을 부른다 → 상대가 조건부로 협력하면, 배신으로 얻는 한 번의 이득(T−R)과 이후 잃는 협력의 흐름을 비교하게 된다. 2. 미래가 충분히 무거우면 협력이 계산에 맞는다 → 다음 판이 이어질 확률(할인인자 δ)이 크면 협력이 균형 중 하나가 된다(folk theorem). 협력이 유일한 균형은 아니고 배신만 하는 균형도 남는다 [Fudenberg & Maskin 1986]. 방아쇠 전략 기준으로 δ ≥ (T−R)/(T−P) 이다. 3. 균형이 여럿이면 실제로 무엇이 나올지는 전략적 불확실성이 정한다 → 상대가 협력할지 모를 때 협력이 손해를 덜 보는 조건이어야 사람들이 협력한다. 실험에서 협력은 균형으로 가능할 때 늘었지만, 높은 협력률은 협력이 전략적 불확실성에 매우 강한 조건에서만 나왔다 [Dal Bó & Fréchette 2011; 2018]. 4. 읽기 쉬운 규칙이 상대의 학습을 돕는다 → tit-for-tat 은 규칙이 단순해 상대가 금방 패턴을 알아채고 협력하는 편이 낫다는 것을 배운다 [Axelrod 1984]. 두 번째 토너먼트 분석은 먼저 배신하지 않기, 어느 정도 용서하기, 그리고 배신에 반응하기(provocable)의 가치를 보였다 [Axelrod 1980b]. 5. 잡음이 메아리를 만든다 → 한쪽의 실수 한 번에 두 tit-for-tat 이 배신을 번갈아 주고받는다. 너그러움(가끔 용서)이나 뉘우침(자기 실수 뒤 한 번 참기)을 더하면 이를 줄인다 [Wu & Axelrod 1995]. 사람 실험에서도 잡음이 있을 때 성공한 전략은 첫 배신에 보복하지 않는 "관대한(lenient)" 전략, 보복 뒤 협력으로 돌아가는 "용서하는(forgiving)" 전략이었다 [Fudenberg, Rand & Dreber 2012].
반복게임의 핵심 변수
| 변수 | 협력에 주는 영향 | 근거 | |---|---|---| | 다음 판의 무게(δ, 계속될 확률) | 클수록 협력 가능. 방아쇠 전략 기준 δ ≥ (T−R)/(T−P) | Fudenberg & Maskin 1986; Dal Bó 2005 | | 협력의 견고함(전략적 불확실성에 대한) | 클수록 실제 협력률이 높다 | Dal Bó & Fréchette 2018 | | 잡음(실수·오해) | 순수 tit-for-tat 을 약하게 만든다. 관대하고 용서하는 변형이 낫다 | Wu & Axelrod 1995; Fudenberg, Rand & Dreber 2012 | | 평판·상대 유형 불확실성 | 끝이 정해진 반복에서도 협력을 가능하게 한다 | Kreps et al. 1982; Andreoni & Miller 1993 | | 끝나는 판이 알려짐 | 이론상 첫 판부터 붕괴. 실험에서는 끝 무렵 붕괴, 경험이 쌓일수록 붕괴 시점이 앞당겨짐 | Selten & Stoecker 1986; Embrey, Fréchette & Yuksel 2018 | | 배신 유혹(temptation)의 크기 | 유한 반복 게임의 협력률 차이를 가장 잘 설명 | Mengel 2018 | | 참가자 수 | 많아질수록 호혜만으로 협력을 유지하기 어렵다 | Boyd & Richerson 1988 |
언제 강해지고 언제 약해지나
- 다음 판이 이어질 확률이 클 때 강해진다 — 무작위 종료 규칙 실험에서 "미래의 그림자"는 기회주의적 행동을 유의하게 줄였고, 그 효과는 이론 예측을 가까이 따랐다 [Dal Bó 2005].
- 균형으로 가능하다고 충분하지 않다 — 협력이 이어질 조건은 부분게임 완전균형 조건은 물론 위험 우월(risk dominance) 조건보다도 까다로웠다 [Dal Bó & Fréchette 2011].
- 끝이 알려져 있으면 끝 무렵에 약해진다 — 사람들은 정해진 판까지 조건부로 협력하다 끊는 "문턱 전략"으로 수렴했고, 경험이 쌓일수록 첫 배신 판이 앞당겨졌다. 반복게임의 매개변수(보수 등)는 역진귀납 예측과 달리 첫 판의 협력에 유의한 영향을 주었다 [Embrey, Fréchette & Yuksel 2018].
- 상대가 협력형일지 모를 때 강해진다 — 평판을 쌓을 수 있는지와 상대가 비합리적·이타적이라고 믿는지를 조작한 실험에서, 결과는 평판을 고려한 순차균형 예측을 강하게 지지했다. 참가자들이 원래 가진 협력 성향("homemade altruism")도 역할을 했다 [Andreoni & Miller 1993].
- 실수가 섞이면 순수 tit-for-tat 이 약해진다 — 상대가 잡음에 적응하지 않았으면 generous tit-for-tat, 적응했으면 contrite tit-for-tat 이 더 효과적이었고, Pavlov(이기면 유지, 지면 바꾸기)는 강건하지 않았다 [Wu & Axelrod 1995].
- 여러 사람이 얽히면 약해진다 — 집단이 커지면 직접 호혜만으로는 협력이 진화하기 어렵다 [Boyd & Richerson 1988].
어떻게 재나
- 컴퓨터 토너먼트 — 게임 이론·심리학·정치학·경제학·사회학·수학 전문가들에게 전략(결정 규칙)을 제출받아 모두 한 번씩 맞붙이고 평균 점수로 순위를 매긴다 [Axelrod 1980a]. 두 번째 대회에는 첫 대회 결과를 본 62명이 참가했다 [Axelrod 1980b]. 생태 시뮬레이션은 점수에 따라 다음 세대 비율을 바꾼다.
- 무작위 종료 실험(무한 반복) — 참가자들이 짝을 지어 죄수의 딜레마를 하고, 매 판 끝에 확률 δ로 게임을 이어 간다. 유한 반복 세션을 대조군으로 두고, 한 세션에 참가자를 많이 둬 전염 효과 없이 학습할 수 있게 한다 [Dal Bó 2005; Dal Bó & Fréchette 2011].
- 잡음 넣기 — 참가자가 고른 행동이 일정 확률로 의도와 다르게 실행되게 해, 실수가 있는 세계에서 어떤 전략이 쓰이고 이기는지 본다 [Fudenberg, Rand & Dreber 2012].
- 전략 추정 — 참가자의 선택 순서에서 어떤 전략(tit-for-tat, grim, 항상 배신 등)을 썼는지 통계적으로 추정한다 [Dal Bó & Fréchette 2018].
- 메타 자료 분석 — 여러 실험실의 원자료를 모아 δ·보수 조건별 협력률을 비교한다 [Dal Bó & Fréchette 2018; Embrey, Fréchette & Yuksel 2018; Mengel 2018].
헷갈리는 개념과의 차이
| 개념 | 누가 갚나 | 필요한 조건 | 근거 | |---|---|---|---| | 직접 호혜(반복게임) | 도움받은 그 사람이 나중에 갚는다 | 같은 상대와 다시 만날 확률이 충분히 큼(w c/b) | Nowak 2006 | | 간접 호혜(평판) | 제3자가 갚는다. "내가 너를 도우면 다른 누군가가 나를 돕는다" | 남의 과거 행동을 보거나 전해 들어 평판이 퍼져야 함 | Nowak & Sigmund 2005; Nowak 2006 | | 이타적 처벌(강한 호혜) | 배신자를 자기 비용을 들여 벌한다. 물질적 이득 없음 | 다시 볼 일이 없거나 평판 이득이 작아도 작동 | Fehr & Gächter 2002 | | 약속 장치(commitment) | 갚는 사람이 없다. 자기 선택지를 미리 묶는다 | 상대가 그 묶임을 확인할 수 있어야 함 | Schelling 1960 |
- 직접 호혜는 자기 경험에 기대고, 간접 호혜는 남의 경험까지 쓴다 [Nowak & Sigmund 2005]. 간접 호혜에서는 같은 두 사람이 많아야 한 번 만나므로, 배신한 사람을 피해자가 직접 갚을 수 없다.
- 이타적 처벌 실험에서는 처벌이 가능할 때 협력이 번성했고 처벌을 없애면 무너졌다. 배신자에 대한 부정적 감정이 처벌의 직접 원인으로 보였다 [Fehr & Gächter 2002].
주요 후속 연구·메타분석
### Axelrod (1980b) — 두 번째 토너먼트에서도 tit-for-tat 우승 Journal of Conflict Resolution, 24(3), 379–403. DOI: 10.1177/002200278002400301
- 설계: 반복 죄수의 딜레마 컴퓨터 토너먼트 2회차. 참가자 62명이 1회차 결과와 교훈을 알고 전략을 설계해 냈다.
- 결과: 다시 tit-for-tat 이 우승했다. 특정 유형의 규칙이 빠지는 함정들이 드러났고, 먼저 배신하지 않기, 어느 정도 용서하기, 배신에 반응하기의 가치가 확인됐다. 가상의 대안 토너먼트 분석에서도 결과가 강건했다.
- 의미와 한계: "두 번 모두 우승"의 원전이다. 우승은 참가 전략 구성에 달린 상대적 성적이고, 잡음이 없는 조건이었다. 확률적 전략이 섞인 진화 시뮬레이션에서는 다른 전략이 앞섰다 [Nowak & Sigmund 1993].
### Dal Bó (2005) — 미래의 그림자가 협력을 늘린다는 통제 실험 American Economic Review, 95(5), 1591–1604. DOI: 10.1257/000282805775014434
- 설계: 2001~2002년 참가자 390명(세션당 평균 48.75명). 무작위 종료 규칙으로 다음 판이 이어질 확률 δ 를 0(단판)·1/2·3/4 로 두고, 같은 기대 길이의 유한 반복(1판·2판·4판) 세션을 대조군으로 뒀다. 보수표 두 가지(예: 서로 협력 65·65, 혼자 배신 100 대 10, 서로 배신 35·35 점, 200점 = 1달러). 한 사람과 두 번 짝지어지지 않게 해 전염 효과를 막았다(워킹페이퍼 전문).
- 결과: 4~10번째 게임의 전체 판 협력률은 단판 9% 남짓, δ = 1/2 에서 27% 이상, δ = 3/4 에서 37% 이상이었다. δ = 3/4 협력률은 단판의 거의 네 배였다. 첫 판 협력률은 끝이 4판으로 정해진 게임 34.58%, 같은 기대 길이의 무한 반복(δ = 3/4) 46.20%로, 끝이 보이면 덜 협력했다(p = 0.005).
- 의미와 한계: 저자는 그 전까지의 실증 증거가 적고 결론이 엇갈렸다고 보고, 유한 반복 대조군과 큰 세션으로 설계를 보완했다. 이론이 방향은 맞힌다는 근거가 된다. 다만 협력이 균형으로 가능한 δ = 3/4 에서도 협력률은 절반에 못 미쳤다. 수치는 2004년 워킹페이퍼 판 기준이다.
### Dal Bó & Fréchette (2018) — 무한 반복 실험 메타 자료 분석 Journal of Economic Literature, 56(1), 60–114. DOI: 10.1257/jel.20160980
- 설계: 무한 반복 죄수의 딜레마 실험 15편의 원자료(32개 처치, 141세션, 참가자 2,415명, 선택 157,170회)를 모은 메타 데이터셋 분석과 문헌 리뷰. 협력의 견고함은 sizeBAD 로 쟀다. 상대가 grim(한 번 배신당하면 끝까지 배신) 전략을 쓸 확률이 이 값 이하이면 항상 배신이 최선이 되는 문턱이다. 클수록 협력이 전략적 불확실성에 약하다. 불완전 감시, 상대 바꾸기, 개인 특성, 사용 전략도 정리했다.
- 결과: 무한 반복은 협력에 영향을 주고, 협력이 균형으로 가능할 때 더 잘 나타났다. 그러나 균형으로 가능하다고 대다수가 협력하지는 않았다. 높은 협력률은 협력이 전략적 불확실성에 매우 강한 매개변수에서만 나왔다. 주로 쓰인 전략은 항상 배신, grim, tit-for-tat 이었다. 이 세 전략이 17개 처치 중 15개에서 과반을, 11개에서 70% 이상을 설명했다. 첫 판 협력에 대한 sizeBAD 의 한계효과는 협력이 위험 우월일 때 −0.902(7번째 게임)·−1.139(15번째 게임)로 컸고, 위험 우월이 아닐 때는 −0.429·−0.342 로 작거나 유의하지 않았다(표 8).
- 의미와 한계: folk theorem 의 "여러 균형" 문제에 경험적 답(어느 균형이 실제로 나오는가)을 준다. 세 전략 가운데 grim 과 항상 배신은 벌이 꼭 믿을 만하지 않은(부분게임 완전하지 않은) 형태도 섞여 있다고 저자들이 정리했다. 대부분 대학생 실험실 자료다.
### Embrey, Fréchette & Yuksel (2018) — 유한 반복에서 협력은 끝 무렵부터 무너진다 Quarterly Journal of Economics, 133(1), 509–551 (온라인 2017). DOI: 10.1093/qje/qjx033
- 설계: 유한 반복 죄수의 딜레마 선행 실험 7편 중 자료를 구한 5편의 메타분석과 새 실험. 새 실험은 보수표 두 가지(배신 유혹이 큰 "어려운" D, 작은 "쉬운" E)와 길이 두 가지(4판·8판)를 곱한 네 처치, 처치마다 세 세션, 세션마다 20~30개 게임이었다. 첫 판의 협력(협력의 형성)과 협력의 붕괴를 나눠 보고, 개인 단위 학습 모형을 추정해 장기 동학을 시뮬레이션했다.
- 결과: 역진귀납 예측과 달리 반복게임의 매개변수가 첫 판 협력에 유의한 영향을 주었다(항상 배신 전략의 끌림 영역 크기로 상당 부분 설명). 그러면서도 행동의 변화는 모든 조건에서 역진귀납의 붕괴 논리와 맞았다. 참가자들은 정해진 판까지 조건부로 협력하는 문턱 전략으로 수렴했고, 협력이 성립한 경우 첫 배신 판이 경험과 함께 앞당겨졌다.
- 수치(표 III, 1~15번째 게임 → 16~30번째 게임): 첫 판 협력률은 D4 29.1% → 19.5%, D8 49.3% → 57.1%, E4 49.0% → 45.2%, E8 79.7% → 88.2%. 마지막 판 협력률은 D4 4.1% → 3.2%, D8 7.9% → 4.0%, E4 10.4% → 3.8%, E8 9.0% → 3.0%로, 초반 게임에서는 E4 만 10%를 넘었고 후반 게임에서는 모든 처치가 4% 이하였다. 메타분석 회귀에서 sizeBAD 는 첫 판 협력에 −0.24(표준오차 0.025)의 한계효과를 보였다(2017년 워킹페이퍼 판).
- 의미와 한계: "끝이 정해져 있으면 처음부터 배신한다"는 이론 예측과 "끝까지 협력한다"는 기대 사이의 실제 모습을 보인다. 유혹이 작고 길이가 길면 첫 판 협력은 경험과 함께 오히려 올랐고(E8), 유혹이 크고 짧으면 내려갔다(D4). 마지막 판은 어느 조건에서든 거의 모두 배신했다.
### Mengel (2018) — 위험과 유혹이 협력률을 설명한다 Economic Journal, 128(616), 3182–3209 (온라인 2017). DOI: 10.1111/ecoj.12548
- 설계: 죄수의 딜레마 연구 96편, 참가자 3,500명 이상의 메타 연구. 혼자 협력할 때의 "위험"과 협력자를 배신할 "유혹"을 따로 지수로 만들었다.
- 결과: 위험은 혼자 협력했다 배신당할 때의 손실 비율((d−b)/d), 유혹은 협력하는 상대를 배신할 때의 이득 비율((c−a)/c)로 정의했다. 단판 게임의 협력률 차이는 위험 지수가, 유한 반복 게임의 협력률 차이는 유혹 지수가 가장 잘 설명했다. 단판 게임 연구들에서 위험 지수의 계수는 −0.197~−0.290 으로 일관되게 유의했고 유혹 지수는 유의하지 않았다. 반복 게임 연구에서는 반대로 유혹 지수의 계수가 −0.208·−0.263 이었는데, 첫 게임 첫 판만 볼 때 10% 수준에서 유의했다. 반복 게임 연구 수가 14~23개로 적어 검정력이 낮다고 저자가 밝혔다(표 1, 게재 승인 원고). 평균적으로 성별 차이는 없었고, 위험이 낮으면 여성이 평균 남성보다 더 협력적, 높으면 덜 협력적이었다.
- 의미와 한계: 반복 관계에서 협력을 흔드는 것은 "배신하면 얼마나 더 얻나"다. 보수 구조를 바꿔 유혹을 줄이는 설계가 중요하다는 근거가 된다. 표 1 회귀의 설명력(R²)은 모형에 따라 0.33~0.48 이었다.
### Fudenberg, Rand & Dreber (2012) — 잡음이 있으면 늦게 화내고 빨리 용서하는 쪽이 이긴다 American Economic Review, 102(2), 720–749. DOI: 10.1257/aer.102.2.720
- 설계: 참가자가 고른 행동이 일정 확률로 다르게 실행되는 잡음 있는 반복 죄수의 딜레마 실험. 협력이 균형인 조건과 아닌 조건을 비교했다.
- 결과: 협력이 균형인 조건에서 참가자들이 훨씬 더 협력했다. 모든 조건에서 전략이 다양해 참가자들이 상대 전략 분포를 다 배우지 못한 것으로 보였다. 협력이 균형인 조건에서는 협력적 전략이 비협력적 전략보다 보수가 높았고, 성공한 전략은 첫 배신에 보복하지 않는 "관대한" 전략이었으며, 많은 전략이 벌을 준 뒤 협력으로 돌아가는 "용서하는" 전략이었다.
- 의미와 한계: 컴퓨터 토너먼트의 generous tit-for-tat 결과 [Wu & Axelrod 1995]를 사람 실험에서 확인한 셈이다. 실험실 금전 보수 게임이며 인간관계에 그대로 옮긴 연구는 아니다.
- 그 밖의 문헌
- Kreps, D. M., Milgrom, P., Roberts, J., & Wilson, R. (1982). Rational cooperation in the finitely repeated prisoners' dilemma. Journal of Economic Theory, 27(2), 245–252. 10.1016/0022-0531(82)90029-190029-1) — 상대가 tit-for-tat 형일 작은 가능성만 있어도 끝 무렵까지 협력하는 균형이 생긴다.
- Selten, R., & Stoecker, R. (1986). End behavior in sequences of finite Prisoner's Dilemma supergames: A learning theory approach. Journal of Economic Behavior & Organization, 7(1), 47–70. 10.1016/0167-2681(86)90021-190021-1) — 참가자 35명이 매번 상대를 바꿔 10판짜리 게임을 25번 했다(전문 확인). 끝 무렵 붕괴가 나타났고 경험이 쌓이며 붕괴 시점이 앞당겨졌다.
- Andreoni, J., & Miller, J. H. (1993). Rational cooperation in the finitely repeated prisoner's dilemma: Experimental evidence. Economic Journal, 103(418), 570쪽부터. 10.2307/2234532 — 평판을 쌓을 기회와 상대에 대한 믿음을 조작한 실험. 순차균형 평판 가설을 강하게 지지했고, 참가자 고유의 협력 성향도 역할을 했다.
- Dal Bó, P., & Fréchette, G. R. (2011). The evolution of cooperation in infinitely repeated games: Experimental evidence. American Economic Review, 101(1), 411–429. 10.1257/aer.101.1.411 — 경험이 쌓이면 협력이 자리 잡을 수 있지만, 그 조건은 부분게임 완전균형 조건이나 위험 우월 조건보다 까다로웠다.
- Boyd, R., & Richerson, P. J. (1988). The evolution of reciprocity in sizable groups. Journal of Theoretical Biology, 132(3), 337–356. 10.1016/S0022-5193(88)80219-480219-4) — 집단이 커지면 호혜 전략이 진화하기 어려워진다.
- Nowak, M., & Sigmund, K. (1993). A strategy of win-stay, lose-shift that outperforms tit-for-tat in the Prisoner's Dilemma game. Nature, 364, 56–58. 10.1038/364056a0 — 확률적 전략의 진화 시뮬레이션에서 win-stay, lose-shift(Pavlov)가 tit-for-tat 을 앞섰다.
- Wu, J., & Axelrod, R. (1995). How to cope with noise in the iterated Prisoner's Dilemma. Journal of Conflict Resolution, 39(1), 183–189. 10.1177/0022002795039001008 — 잡음 대처법 세 가지(너그러움·뉘우침·Pavlov) 비교.
- Nowak, M. A. (2006). Five rules for the evolution of cooperation. Science, 314(5805), 1560–1563. 10.1126/science.1133755 — 혈연 선택, 직접 호혜, 간접 호혜, 네트워크 호혜, 집단 선택 다섯 경로와 각각의 단순 임계 조건. 직접 호혜는 다음 판이 있을 확률 w 가 비용/편익 비보다 클 때(w c/b) 협력이 진화한다.
- Nowak, M. A., & Sigmund, K. (2005). Evolution of indirect reciprocity. Nature, 437(7063), 1291–1298. 10.1038/nature04131 — 직접 호혜와 간접 호혜(평판)의 차이, 평판 모형과 실험 리뷰.
- Fehr, E., & Gächter, S. (2002). Altruistic punishment in humans. Nature, 415(6868), 137–140. 10.1038/415137a — 자기 비용으로 배신자를 벌하는 이타적 처벌이 가능하면 협력이 번성하고, 없애면 무너졌다.
- Dal Bó, P., & Fréchette, G. R. (2019). Strategy choice in the infinitely repeated prisoner's dilemma. American Economic Review, 109(11), 3929–3952. 10.1257/aer.20181480 — 참가자에게 전략(행동 계획)을 직접 적게 했다. tit-for-tat·grim·항상 배신 세 전략이 모든 처치에서 65% 넘게, 두 처치에서 80%까지 차지했다. δ = 1/2·서로 협력 보수 32 에서는 항상 배신이 58%, δ = 9/10·보수 32 에서는 tit-for-tat 34.5%·항상 배신 15.5%였다(표 3, 전문).
- Press, W. H., & Dyson, F. J. (2012). Iterated Prisoner's Dilemma contains strategies that dominate any evolutionary opponent. PNAS, 109(26), 10409–10413. 10.1073/pnas.1206569109 — 자기와 상대 점수 사이의 선형 관계를 일방적으로 강제하는 zero-determinant(ZD) 전략.
- Stewart, A. J., & Plotkin, J. B. (2013). From extortion to generosity, evolution in the Iterated Prisoner's Dilemma. PNAS, 110(38), 15348–15353. 10.1073/pnas.1306246110 — 진화하는 집단에서는 착취형 ZD 전략이 밀리고 너그러운 ZD 전략이 우세했다.
비판·한계
재현성
- 무한 반복 협력 실험은 여러 실험실 원자료를 모은 메타 데이터셋에서 "균형으로 가능할 때 협력이 늘지만 견고할 때만 높다"는 패턴으로 모였다 [Dal Bó & Fréchette 2018].
- 유한 반복에서 선행 연구들의 결과가 엇갈려 보였지만, 메타분석과 새 실험으로 "문턱 전략 + 경험에 따른 붕괴 시점 앞당김"이라는 일관된 패턴이 확인됐다 [Embrey, Fréchette & Yuksel 2018]. 1986년 실험의 끝 무렵 붕괴 [Selten & Stoecker 1986]와 같은 방향이다.
- 96편 3,500명 이상의 메타 연구가 보수 구조(위험·유혹)로 협력률 차이를 설명했다 [Mengel 2018].
- 사전등록 다기관 재현(예: Many Labs 형식)은 찾지 못했다.
대표 반론
- "tit-for-tat 이 최선이다" 대 "환경에 따라 다르다" — Axelrod 두 토너먼트에서 우승했지만 [Axelrod 1980a; 1980b], 확률적 전략을 넣은 진화 시뮬레이션에서는 win-stay, lose-shift 가 앞섰고 [Nowak & Sigmund 1993], 잡음이 있는 토너먼트에서는 너그럽거나 뉘우치는 변형이 낫고 Pavlov 는 강건하지 않았다 [Wu & Axelrod 1995]. 사람 실험에서도 잡음이 있으면 관대한 전략이 이겼다 [Fudenberg, Rand & Dreber 2012]. 어떤 환경에서나 최선인 전략은 없다.
- "상대를 착취하는 전략이 이긴다" 대 "큰 집단에서는 너그러운 쪽이 이긴다" — Press & Dyson (2012) 은 한쪽이 자기 점수와 상대 점수 사이의 선형 관계를 일방적으로 강제하는 zero-determinant(ZD) 전략을 보였다. 착취형 ZD 를 쓰는 쪽에게 상대가 진화적으로 적응만 하면(상대의 마음을 읽지 않으면) 최선은 착취를 받아들이는 것이다. Stewart & Plotkin (2013) 은 착취형이 일대일 대결에서는 잘하지만 크고 진화하는 집단에서는 성과가 나쁘고, 집단이 아주 작을 때가 아니면 협력하고 배신을 용서하는 너그러운 전략이 착취형을 대체해 우세해진다고 보고했다. 두 결과는 모두 이론·시뮬레이션이다.
- "반복되면 협력한다" 대 "가능하다고 협력하지는 않는다" — folk theorem 은 협력이 여러 균형 중 하나로 가능하다는 것이다 [Fudenberg & Maskin 1986]. 실험에서는 부분게임 완전균형 조건보다 까다로운 조건에서만 협력이 자리 잡았다 [Dal Bó & Fréchette 2011; 2018].
- "끝이 정해지면 처음부터 무너진다" 대 "끝 무렵까지 협력한다" — 역진귀납은 첫 판부터 배신을 예측하지만, 상대 유형에 대한 불확실성이 있으면 끝 무렵까지 협력하는 균형이 생긴다 [Kreps et al. 1982]. 실험은 평판 가설을 지지했고 [Andreoni & Miller 1993], 협력이 끝 무렵에 무너지며 경험과 함께 그 시점이 앞당겨졌다 [Selten & Stoecker 1986; Embrey, Fréchette & Yuksel 2018]. 양쪽 모두 부분적으로 맞다.
- "직접 호혜로 인간 협력을 설명한다" 대 "다른 기제가 필요하다" — 큰 집단에서는 직접 호혜가 약하고 [Boyd & Richerson 1988], 사람들은 다시 볼 일이 없는 낯선 사람과도 협력하며 이타적 처벌이 이를 떠받쳤다 [Fehr & Gächter 2002]. 평판(간접 호혜)도 따로 작동한다 [Nowak & Sigmund 2005].
쓰면 안 되는 상황
- 다시 만날 가능성이 낮은 한 번의 거래 — 직접 호혜가 작동할 조건(w c/b)이 성립하지 않는다 [Nowak 2006]. 평판이 퍼지는 곳이면 간접 호혜로 따로 본다.
- 여러 사람이 얽힌 공동 과제 — 양자 호혜 전략만으로는 무임승차를 막기 어렵다 [Boyd & Richerson 1988].
- 실수·오해가 잦은 관계에 순수 tit-for-tat 을 그대로 쓸 때 — 보복의 메아리가 생긴다 [Wu & Axelrod 1995]. 첫 배신을 넘기는 관대한 규칙이 낫다 [Fudenberg, Rand & Dreber 2012].
- 배신 유혹이 큰 구조 — 반복되더라도 협력률이 낮다 [Mengel 2018]. 규칙보다 보수 구조를 먼저 바꾼다.
- 연인·가족·친구 관계에 실험 결과를 처방처럼 옮길 때 — 이 카드의 근거는 컴퓨터 토너먼트와 금전 보수 실험이다. 감정·체면·정체성이 개입하는 관계에서 같은 규칙이 같은 결과를 낸다는 연구는 이 카드의 문헌에 없다.
관련 모델
- 2차 사고, BATNA, commitment device, social proof, 신뢰의 진화 (Nowak)
사고 도구 다른 글