인과 DAG 사고 (Causal DAG Thinking)

처음 실린 날 2026-05-31 · 마지막으로 고친 날 2026-09-27

다른 이름: 인과 다이어그램 · 방향성 비순환 그래프 · Causal DAG · DAG 사고

한 줄 정의

상관관계를 원인으로 착각하지 않도록, 원인·결과·공통원인(confounder)·매개변수(mediator)·충돌변수(collider)를 방향 그래프(DAG)의 화살표 구조로 분리해 "무엇을 조정하고 무엇을 조정하면 안 되는지"를 먼저 판단하는 사고도구 [Pearl 1995].

일상 한 줄

데이터를 보기 전에 "무엇이 무엇을 일으키는가"를 화살표 그림으로 먼저 가정한다. 인과 결론은 데이터에서 저절로 나오지 않고, 그릴 때 넣은 인과 가정에서 나온다 [Pearl 2009].

흔한 장면

왜 빠지나 (메커니즘)

빠져나오는 법

1. 질문을 "X가 Y에 미치는 인과 효과"로 명확히 적고, 결과(Y)와 원인(X)을 먼저 분리한다. "X를 봤을 때"와 "X를 바꿨을 때"를 구분해 묻는다. 사람들은 이 둘을 어느 정도 구별하지만(결과를 관찰하면 원인의 단서로 쓰고, 결과를 누군가 바꿔 놓았으면 단서로 쓰지 않았다) [Sloman & Lagnado 2005], 자료 분석에서는 흔히 섞인다. — 근거 수준: 방법론 규범 [Pearl 1995]. 관찰·개입 구별은 실험 [Sloman & Lagnado 2005] 2. X와 Y 둘 다에 화살표를 보내는 공통원인(confounder) 을 찾는다 — 이것이 backdoor path를 만든다. — 근거 수준: 방법론 규범(수학적 규칙) [Pearl 1995] 3. backdoor criterion으로 막아야 할(조정해야 할) 변수 집합 Z 를 고른다 [Pearl 1995]: Z는 X의 후손이 아니어야 하고, X로 화살표가 들어오는 모든 경로를 차단해야 한다. — 근거 수준: 수학적으로 증명된 규칙 [Pearl 1995]. 적용 결과는 DAG가 맞을 때만 옳다 4. X→…→Y로 가는 중간 경로의 매개변수(mediator) 와, X·Y의 공통 결과인 충돌변수(collider) 는 조정 대상에서 제외한다(조정하면 효과가 사라지거나 가짜 관계가 생긴다). 처치보다 먼저 생긴 변수라도 두 숨은 원인의 공통 결과라면 충돌변수다(M-편향). 좋은 통제·나쁜 통제의 전형 사례 목록은 Cinelli, Forney & Pearl (2022) 이 정리했다. — 근거: 실제 자료 사례 [Hernández-Díaz et al. 2006] + 편향 크기 비교 [Greenland 2003]. 처치 이전 충돌변수 편향은 대개 고전적 교란보다 훨씬 작았다 [Greenland 2003] 5. 손으로 따지기 어려우면 DAGitty 같은 도구에 그래프를 넣어 조정 집합을 계산한다(Textor et al. 2016). — 근거 수준: 도구 권고, 효과 비교 연구 없음 6. 데이터를 보기 전에 DAG를 먼저 그려 가정을 드러내고, 분석 후 데이터와 충돌하는 부분만 수정한다(가정 → 검증 → 수정). 그린 DAG와 조정 집합을 함께 적어 둔다. — 근거 수준: 방법론 권고. 보고 실태는 감사 연구 [Tennant et al. 2021]가 DAG를 쓴 논문의 절반 정도만 조정 집합을 보고했다고 밝혔다

근거의 성격: 위 6단계는 인과추론 방법론의 규범(백도어 기준 등 수학적으로 증명된 규칙)이다. "DAG를 그리게 하면 판단이 나아진다"는 교육·개입 효과를 무작위 비교로 잰 연구는 이번 확인에서 찾지 못했다. DAG를 썼다는 보건 논문도 절반 정도만 조정 집합을 보고했다 [Tennant et al. 2021].

함께 쓰기 좋은 도구

통념이 무너지는 순간

"상관관계는 인과관계가 아니다, 이것만 알면 충분하다"

⚠ 흔한 말: "상관≠인과, 이 한 문장이면 데이터 함정은 피한다." ✓ 학술: 이 슬로건은 출발점이다. Pearl은 인과 개념(confounding·intervention 등)은 분포만으로 정의조차 불가능하다고 못박는다 — "Every claim invoking causal concepts must rely on some premises that invoke such concepts; it cannot be inferred from or even defined in terms [of] statistical associations alone." 실제 판단에는 어떤 변수를 조정하고 어떤 변수는 조정하면 안 되는지(backdoor criterion)를 알아야 한다 [Pearl 2009].

"데이터가 많으면 인과가 드러난다"

⚠ 흔한 말: "표본만 충분히 크면 진짜 인과가 보인다." ✓ 학술: confounding 같은 인과량은 "they cannot be computed from the data alone, regardless of sample size" — 표본 크기와 무관하게 데이터만으로는 계산 불가 [Pearl 2009]. 관찰 데이터는 아무리 많아도 인과 가정(설계) 없이는 인과 질문에 답하지 못한다.

"관련 있는 변수는 일단 다 통제하면 안전하다"

⚠ 흔한 말: "혼동 막으려면 변수는 많이 넣을수록 좋다." ✓ 학술: collider를 조정하면 없던 상관이 생긴다(collider bias). backdoor criterion은 조정 집합 Z가 "no node in Z is a descendant of Xi"여야 함을 명시한다 [Pearl 1995] — X의 후손(매개·충돌변수)을 통제하면 오히려 편향이 생긴다. 처치보다 먼저 생긴 변수도 두 숨은 원인의 공통 결과라면 통제할 때 편향이 생긴다(M-편향, Greenland 2003). 다만 Greenland (2003) 의 계산에서 이런 처치 이전 충돌변수의 편향은 대개 고전적 교란보다 훨씬 작았다. "관련되면 통제"는 confounder에만 맞는 규칙이다.

"DAG를 그리면 객관적 인과를 증명한 것이다"

⚠ 흔한 말: "전문가가 그린 인과 다이어그램이니 검증된 사실이다." ✓ 학술: DAG는 가정을 드러내고 소통하는 도구다. 증명은 하지 못한다. 가장 강한 가정은 빠진 화살표에 들어 있다 — "causal assumptions are encoded not in the links but, rather, in the missing links… a missing arrow represents a claim of zero influence" [Pearl 2009]. 개별 인과 가정은 검증 불가하고, 모델 전체의 조건부 독립만 일부 검증 가능하다.

1차 출처

backdoor criterion·do-operator·intervention의 그래프 기반 형식화를 세운 표준 논문. 백도어 기준은 Pearl (1993) 코멘트에서 먼저 나왔고, 1995년 Biometrika 논문이 이를 프런트도어 기준·do-계산법(do-calculus)과 함께 정식화·체계화했다. 2009년 책·개관 논문이 전체 프레임워크를 정리했다. 경로 그림으로 인과를 따지는 발상 자체는 Sewall Wright (1921) 의 경로 분석(path analysis)까지 거슬러 올라간다.

원문 핵심 인용

"DEFINITION 3 (Back-door criterion). A set of variables Z satisfies the back-door criterion relative to an ordered pair of variables (Xi, Xj) in a directed acyclic graph G if: (i) no node in Z is a descendant of Xi, and (ii) Z blocks every path between Xi and Xj which contains an arrow into Xi." — Pearl (1995), Biometrika 82(4), p. 670 (UCLA R-218-B 사본 verbatim 재검증, 2026-09-27 — OCR 잡음 외 일치)

"Every claim invoking causal concepts must rely on some premises that invoke such concepts; it cannot be inferred from or even defined in terms [of] statistical associations alone." — Pearl, Causal inference in statistics: An overview (2009), §1.1 (UCLA R-355 사본 verbatim 재검증, 2026-09-27 — 사본에 'of' 가 빠져 있어 [of] 로 보충)

"causal assumptions are encoded not in the links but, rather, in the missing links… a missing arrow represents a claim of zero influence, while a missing double arrow represents a claim of zero covariance." — Pearl (2009), 같은 논문 (UCLA R-355 사본 verbatim 재검증, 2026-09-27)

핵심 정의·메커니즘

원전 정의

Pearl (1995)은 인과 다이어그램을 변수(노드)와 직접 인과 영향(화살표)으로 이뤄진 방향 비순환 그래프(DAG, directed acyclic graph)로 정의하고, 관찰 자료에서 개입 효과 P(Y | do(X))를 계산할 수 있는 조건을 그래프로 적었다. 대표가 백도어 기준이다. 조정 집합 Z가 "(i) Z의 어떤 노드도 X의 후손이 아니고, (ii) X로 들어오는 화살표를 가진 X-Y 사이 모든 경로를 막으면" Z로 조정해 인과 효과를 식별할 수 있다.

작동 기제

DAG로 판단이 바뀌는 과정은 네 단계다.

1. 가정을 그림으로 적는다: 도메인 지식으로 화살표를 긋는다. 강한 가정은 그리지 않은 화살표(= 영향 0)에 담긴다 [Pearl 2009]. 2. 경로를 분류한다 (d-분리): 경로 위의 비충돌 노드를 조건화하거나, 충돌 노드와 그 후손을 조건화하지 않으면 그 경로는 막힌다. 모든 경로가 막히면 두 변수는 조건부 독립이다. 3. 조정 집합을 고른다: 백도어 경로는 막고, 매개변수·충돌변수와 그 후손은 건드리지 않는 집합 Z를 고른다. 역학의 전통적 교란 판정 기준은 여러 후보 변수를 한꺼번에 다룰 때 이 판단을 틀리게 만들 수 있다 [Greenland et al. 1999]. 4. 틀린 조정이 결론을 뒤집는 경로를 피한다: 충돌변수를 조건화하면 원인끼리 가짜 관계가 생긴다. 출생체중 역설이 대표 사례다. 흡연 산모의 아기는 저체중과 영아 사망 위험이 모두 높았지만, 저체중아만 놓고 보면 흡연 산모의 아기 사망률이 더 낮았다(비율비(relative rate) 0.79) [Hernández-Díaz et al. 2006]. 출생체중은 흡연의 영향을 받고 선천 기형 같은 다른 사망 원인과 공통 원인을 가진 충돌변수라서, 흡연의 이로운 효과가 없어도 이런 역전이 생긴다.

사람은 왜 그래프 없이 틀리나

언제 강해지고 언제 약해지나

어떻게 재나

헷갈리는 개념과의 차이

주요 후속 연구·메타분석

### Hernández-Díaz, Schisterman & Hernán (2006) — 출생체중 역설 American Journal of Epidemiology, 164(11), 1115-1120. DOI: 10.1093/aje/kwj275

### Greenland (2003) — 고전적 교란과 충돌변수 편향의 크기 비교 Epidemiology, 14(3), 300-306. DOI: 10.1097/01.EDE.0000042804.12056.6C

### Rottman & Hastie (2016) — 사람은 인과 구조를 합리적으로 추론하는가 Cognitive Psychology, 87, 88-134. DOI: 10.1016/j.cogpsych.2016.05.002

### Sloman & Lagnado (2005) — 사람은 관찰과 개입을 구별하는가 Cognitive Science, 29(1), 5-39. DOI: 10.1207/s15516709cog29012

### Tennant et al. (2021) — 보건 연구에서 DAG는 어떻게 쓰이나 International Journal of Epidemiology, 50(2), 620-632. DOI: 10.1093/ije/dyaa213

### Elwert & Winship (2014) — 내생적 선택 편향 Annual Review of Sociology, 40, 31-53. DOI: 10.1146/annurev-soc-071913-043455

### Imbens (2020) — 잠재적 결과와 DAG, 경제학 실무에서의 쓸모 Journal of Economic Literature, 58(4), 1129-1179. DOI: 10.1257/jel.20191597

그 밖의 문헌:

비판·한계

재현성

대표 반론

쓰면 안 되는 상황

관련 모델

사고 도구 다른 글