패널 자료를 받아 놓고 “프로그램에 참여한 사람과 참여하지 않은 사람의 결과를 비교하겠다”고 쓰면 심사에서 곧바로 같은 질문이 돌아온다. “참여한 사람들이 원래 달랐던 것 아닙니까?” 실제로 그렇다. 자발적으로 참여한 사람은 더 동기가 높고, 더 여유가 있고, 대개 결과 변수의 출발점부터 다르다. 두 집단의 사후 평균을 그냥 비교하면 그 차이는 프로그램 효과가 아니라 애초에 누가 참여했는가를 재는 것이 된다.
이 선택편의(selection bias)를 관측된 변수의 범위 안에서 정면으로 다루는 방법이 성향점수매칭(Propensity Score Matching, PSM)이다. Rosenbaum과 Rubin이 1983년에 제안한 이래 정책 평가, 보건의료 코호트 분석, 교육 종단자료 분석의 표준 도구가 되었다.
이 글은 PSM을 세 부분으로 정리한다. (가) 언제 이 방법을 고르는가, (나) 공변량 선택부터 민감도 분석까지의 절차와 각 단계의 결정, (다) 논문에 무엇을 어떻게 보고하는가.
성향점수란 무엇인가
성향점수는 관측된 공변량이 주어졌을 때 그 사람이 처치를 받을 조건부 확률이다. 나이·성별·학력·소득·사전 점수 같은 변수를 알고 있을 때, 이 사람이 프로그램에 참여할 확률이 얼마인가를 하나의 숫자로 압축한 값이다.
이 압축이 왜 유용한가. 통제해야 할 변수가 열 개라면 열 개 차원에서 짝을 찾아야 하는데, 표본이 아무리 커도 열 개 변수가 모두 비슷한 짝은 거의 없다. 이것이 이른바 차원의 저주다. Rosenbaum과 Rubin의 핵심 정리는 성향점수 하나만 맞추면 그 열 개 변수의 분포가 통째로 균형을 이룬다는 것이다. 다차원 문제가 1차원 문제로 줄어든다.
세 가지 전제
- 조건부 독립성(무교란성) — 관측된 공변량을 통제하면 처치 배정이 잠재적 결과와 독립이다. 쉽게 말해 측정하지 못한 교란변수가 없다는 가정이며, 검증할 수 없는 가정이라는 점이 PSM의 근본적 약점이다.
- 공통지지(common support) — 어떤 공변량 조합에서도 처치를 받을 확률이 0이나 1이 아니어야 한다. 비교 대상이 아예 존재하지 않는 영역에서는 효과를 추정할 수 없다.
- SUTVA — 한 사람의 처치가 다른 사람의 결과에 영향을 주지 않는다. 같은 학급에서 절반만 프로그램을 받았다면 이 가정이 위태롭다.
(가) 언제 성향점수매칭을 고르는가
이 방법이 맞는 상황
- 이미 수집된 2차 자료로 효과를 추정해야 할 때 — 국내에서 가장 흔한 용례다. 패널조사, 행정자료, 병원 전자의무기록처럼 연구자가 배정에 개입할 수 없었던 자료. 원자료 확보 절차는 공공 마이크로데이터 2차분석 튜토리얼에 정리되어 있다.
- 비교집단 후보가 처치집단보다 훨씬 많을 때 — 매칭은 비교집단 풀에서 닮은 사례를 골라내는 작업이므로, 풀이 클수록 좋은 짝을 찾는다. 처치집단 대비 비교집단이 최소 3배는 되어야 여유가 생긴다.
- 배정에 영향을 준 변수를 대체로 측정해 두었을 때 — 조건부 독립성 가정을 그나마 방어할 수 있는 유일한 조건이다.
이 방법을 고르면 안 되는 경우
- 배정의 핵심 요인을 측정하지 못했을 때 — 참여 여부를 가른 것이 ‘동기’인데 동기를 재지 않았다면, 매칭을 아무리 정교하게 해도 편의는 그대로 남는다. 이때는 도구변수나 이중차분법 같은 다른 식별 전략을 검토해야 한다.
- 배정 규칙이 명시적 절단점으로 정해져 있을 때 — 회귀불연속 설계가 훨씬 강한 추론을 준다. 이 갈림길은 준실험설계의 유형 선택에서 함께 정리했다.
- 처치집단 표본이 너무 작을 때 — 처치집단이 30명 안팎이면 매칭 후 검정력이 거의 남지 않는다.
- 무작위 배정이 가능할 때 — 당연하지만 자주 잊힌다. 매칭은 차선책이다.
(나) 절차: 여섯 단계와 각 단계의 결정
1단계: 공변량을 고른다 — 여기서 논문의 절반이 결정된다
PSM에서 가장 많은 오류가 나오는 곳이 이 단계다. 규칙은 세 가지다.
- 넣어야 할 것 — 처치 이전에 측정되었고, 결과에 영향을 주는 변수. 결과와 처치 둘 다에 관련된 변수는 반드시 넣어야 한다.
- 절대 넣으면 안 되는 것 — 처치 이후에 측정된 변수, 처치의 결과로 바뀐 변수, 처치와 결과 사이의 매개변수. 이런 변수를 넣으면 처치효과의 일부가 통제되어 효과가 축소된다. 무엇이 매개이고 무엇이 통제인지 헷갈린다면 독립·종속·매개·조절·통제변수의 구분을 먼저 확정해야 한다.
- 넣지 않는 편이 나은 것 — 처치와만 강하게 관련되고 결과와는 무관한 변수(도구변수 성격). 성향점수의 분산을 키워 추정을 불안정하게 만든다.
변수 선택의 근거는 통계적 유의성이 아니라 이론과 선행연구여야 한다. “단계적 선택으로 유의한 변수만 넣었다”는 서술은 지적 대상이 된다.
2단계: 성향점수를 추정한다
표준은 로지스틱 회귀다. 종속변수는 처치 여부(0/1), 독립변수는 앞에서 고른 공변량이다. 여기서 중요한 인식 전환이 필요하다. 이 로지스틱 회귀는 예측 모형이 아니다. 계수의 유의성이나 모형 적합도를 해석할 필요가 없고, 논문에 계수표를 실을 필요도 없다. 이 회귀의 유일한 목적은 매칭 후 공변량 균형이 잡히는 점수를 만들어 내는 것이며, 성공 여부는 4단계의 균형 진단으로만 판정한다. 균형이 안 잡히면 제곱항이나 상호작용항을 추가해 모형을 다시 만든다.
3단계: 매칭 방식을 고른다

선택지가 여럿이고, 정답은 자료 구조에 따라 다르다.
- 최근접이웃 매칭 — 가장 널리 쓰인다. 1:1이 기본이고 1:2나 1:3으로 늘리면 표본이 늘어 검정력이 오르는 대신 짝의 질이 떨어진다.
- 캘리퍼 — 짝으로 인정할 최대 거리를 정하는 장치다. 캘리퍼 없이 최근접이웃만 쓰면 아무리 먼 사례도 짝이 되어 버린다. 관행적으로 성향점수 로짓의 표준편차 × 0.2가 널리 쓰인다.
- 복원 여부 — 비교집단 한 사례를 여러 번 쓸 수 있게 할 것인가. 비교집단 풀이 작으면 복원이 짝의 질을 지켜 주지만, 표준오차 계산이 복잡해진다.
- 커널 매칭·반경 매칭 — 한 명이 아니라 여러 사례에 가중치를 주어 활용한다. 표본 손실이 적다.
- 역확률가중(IPTW) — 매칭 대신 성향점수의 역수로 가중치를 주어 전체 표본을 유지한다. 극단적 가중치가 생기면 절단이 필요하다.
어떤 방식을 골랐든 왜 골랐는지를 논문에 적어야 한다. 그리고 다른 방식으로 돌린 결과가 크게 다르지 않다는 것을 민감도 분석으로 보여 주면 설득력이 크게 올라간다.
4단계: 균형을 진단한다 — t-검정을 쓰지 말 것

매칭이 성공했는지는 표준화 평균차(standardized mean difference, SMD)로 판정한다. 두 집단의 평균 차이를 통합 표준편차로 나눈 값이며, 관례적으로 절댓값 0.1 미만이면 균형이 확보된 것으로 본다.
여기서 흔한 실수가 매칭 후 t-검정이나 카이제곱 검정으로 균형을 판정하는 것이다. 매칭 후에는 표본 수가 크게 줄어 검정력이 떨어지므로, 실제 차이가 남아 있어도 유의하지 않게 나오기 쉽다. 즉 표본이 작아진 덕분에 균형이 잡힌 것처럼 보이는 착시가 생긴다. 표준화 평균차는 표본 크기의 영향을 받지 않으므로 이런 착시가 없다. 여기에 분산비와 성향점수 분포 그림을 함께 제시하면 근거가 단단해진다.
5단계: 처치효과를 추정한다
매칭이 기본적으로 추정하는 것은 ATT(처치집단에 대한 평균 처치효과)다. “이 프로그램에 실제로 참여한 사람들에게 프로그램이 준 평균 효과”이며, “전체 인구가 참여했다면 얼마의 효과가 있었을까”를 뜻하는 ATE와는 다르다. 정책 확대를 논하려면 ATE가 필요하지만 매칭에서 자연스럽게 나오는 값은 ATT이므로, 어느 쪽을 추정했는지 명시하고 그에 맞게 결론을 써야 한다.
표준오차 계산에서도 주의가 필요하다. 매칭된 자료를 독립 표본처럼 다루면 표준오차가 과소추정된다. 매칭 구조를 반영하는 추정량을 쓰거나, 짝을 고려한 대응표본 검정을 적용하거나, 부트스트랩을 쓴다. 어떤 검정을 어떤 순서로 적용할지는 논문 통계 분석 기법 선택과 결과 해석의 흐름을 참고하면 정리된다. 매칭 후에도 잔여 불균형이 남은 공변량이 있다면 회귀모형에 함께 투입하는 이중 강건 추정을 쓰는 것이 최근의 권장 방식이다.
6단계: 민감도 분석을 한다
조건부 독립성 가정은 검증할 수 없다. 그래서 대신 묻는다. “측정하지 못한 교란변수가 얼마나 강해야 이 결론이 뒤집히는가?” Rosenbaum 경계는 이 질문에 숫자로 답한다. 미관측 변수가 처치 확률을 몇 배까지 바꿔 놓아야 유의성이 사라지는지를 계산하며, 그 배수가 클수록 결과가 튼튼하다는 뜻이다. 국내 학위논문에서 이 절차까지 수행한 논문은 많지 않아, 넣으면 그 자체로 차별점이 된다.
(다) 논문에 어떻게 보고하는가
연구방법 절에 들어갈 여덟 가지
- 자료원과 처치·비교 집단의 정의(누가 처치집단인지의 판정 기준)
- 공변량 목록과 각 변수를 넣은 근거, 그리고 측정 시점(처치 이전임을 명시)
- 성향점수 추정 모형(로지스틱 회귀 등)
- 매칭 방식·비율·캘리퍼 폭·복원 여부
- 공통지지영역 처리 방식
- 균형 진단 지표와 판정 기준(표준화 평균차 0.1 등)
- 추정 대상(ATT인지 ATE인지)과 표준오차 산출 방식
- 민감도 분석 방법
결과 절에 넣을 표와 그림
- 표 1 — 매칭 전후 공변량별 평균·표준편차·표준화 평균차. 이 표가 PSM 논문의 핵심이다.
- 그림 1 — 매칭 전후 성향점수 분포(히스토그램 또는 밀도 곡선).
- 표 2 — 표본 흐름: 원표본 수, 공통지지영역 밖 제외 수, 매칭 성공 수, 최종 분석 수.
- 표 3 — 처치효과 추정 결과: 처치집단 평균, 비교집단 평균, 차이, 표준오차, 유의확률, 효과크기.
- 표 4 — 민감도 분석 결과.
바로 쓸 수 있는 모범 문장
본 연구는 프로그램 참여의 자기선택으로 인한 선택편의를 완화하기 위해 성향점수매칭(propensity score matching)을 적용하였다. 성향점수는 관측된 공변량이 주어졌을 때 처치를 받을 조건부 확률로, 이를 기준으로 처치집단과 유사한 비교집단을 구성하였다.
공변량은 선행연구에서 참여 여부와 결과 변수 모두에 영향을 미치는 것으로 보고된 변수 중 처치 시점 이전에 측정된 12개를 선정하였다. 처치 이후에 측정된 변수와 처치의 결과로 변화할 수 있는 변수는 제외하였다.
성향점수는 이분형 로지스틱 회귀로 추정하였으며, 매칭은 캘리퍼를 적용한 1:1 최근접이웃 비복원 매칭으로 수행하였다. 캘리퍼 폭은 성향점수 로짓 표준편차의 0.2배로 설정하였다. 공통지지영역을 벗어난 사례는 분석에서 제외하였다.
매칭의 적절성은 공변량별 표준화 평균차로 확인하였다. 매칭 전 12개 공변량 중 7개에서 표준화 평균차의 절댓값이 0.1을 초과하였으나(최대 .482), 매칭 후에는 모든 공변량이 0.1 미만으로 감소하여(최대 .061) 두 집단의 균형이 확보되었다.
원표본 3,418명 중 공통지지영역을 벗어난 96명을 제외하고 처치집단 412명과 비교집단 412명이 매칭되어 총 824명이 최종 분석에 포함되었다. 추정 대상은 처치집단에 대한 평균 처치효과(ATT)이며, 표준오차는 매칭 구조를 반영하여 산출하였다.
본 연구의 성향점수매칭은 관측된 공변량에 대한 균형만을 보장하므로, 측정되지 않은 교란변수에 의한 편의 가능성은 배제할 수 없다. 이에 Rosenbaum 경계를 이용한 민감도 분석을 수행하였으며, 미관측 교란변수가 처치 확률을 1.6배 이상 변화시킬 경우에 한해 결론이 달라지는 것으로 나타났다.
심사에서 자주 지적되는 다섯 가지
- 처치 이후 변수를 공변량에 넣었다 — 효과가 통제되어 과소추정된다. 가장 치명적인 오류다.
- 매칭 후 균형을 t-검정으로 판정했다 — 표본 축소로 인한 착시를 균형으로 착각한다.
- 캘리퍼를 설정하지 않았다 — 거리가 먼 사례끼리 짝이 되어도 걸러지지 않는다.
- 표본 손실을 보고하지 않았다 — 몇 명이 왜 빠졌는지 없으면 일반화 범위를 알 수 없다.
- 결론을 무작위 실험처럼 단정한다 — 미관측 교란에 대한 언급이 한 줄도 없다.
자주 묻는 질문
성향점수매칭을 하면 무작위 실험과 같아지나요?
같아지지 않습니다. 매칭은 자료에 들어 있는 관측된 공변량의 분포만 맞춰 줄 뿐, 측정하지 못한 교란변수는 그대로 남습니다. 무작위 배정은 관측 여부와 무관하게 모든 교란을 확률적으로 균형 잡는다는 점에서 근본적으로 다릅니다. 따라서 성향점수매칭 논문에서는 결론을 무작위 실험 수준으로 단정하지 말고, 미관측 교란의 가능성과 민감도 분석 결과를 함께 제시해야 합니다.
매칭 후 균형은 t-검정으로 확인하면 되나요?
권장되지 않습니다. 매칭 후에는 표본 수가 줄어 검정력이 떨어지므로, 실제 차이가 남아 있어도 t-검정은 유의하지 않게 나오기 쉽습니다. 표본 크기에 영향을 받지 않는 표준화 평균차를 쓰는 것이 표준이며, 절댓값 0.1 미만이면 균형이 확보된 것으로 봅니다. 여기에 분산비와 성향점수 분포 그림을 함께 제시하면 근거가 더 단단해집니다.
공변량으로 무엇을 넣고 무엇을 빼야 하나요?
처치 이전에 측정되었고 결과에 영향을 주는 변수를 넣습니다. 처치 이후에 측정된 변수, 처치의 결과로 바뀐 변수, 처치와 결과 사이의 매개변수는 절대 넣으면 안 됩니다. 넣는 순간 효과의 일부가 통제되어 처치효과가 축소됩니다. 처치와만 강하게 관련되고 결과와는 무관한 변수도 넣지 않는 편이 낫습니다. 분산을 키워 추정을 불안정하게 만들기 때문입니다.
매칭되지 않은 사례가 많이 빠졌는데 괜찮나요?
결과의 해석 범위가 달라진다는 점을 반드시 밝혀야 합니다. 공통지지영역 밖의 사례가 제외되면 남은 표본은 원래 모집단과 다른 집단이 되므로, 추정된 효과는 그 좁혀진 집단에 대한 것이 됩니다. 제외된 사례 수와 그 특성을 표로 제시하고, 일반화 범위가 어떻게 좁아졌는지를 고찰의 한계에 적어야 합니다.
정리
성향점수매칭은 강력하지만 만능이 아니다. 이 방법이 지우는 것은 관측된 교란뿐이며, 그 사실을 논문에 명시하는 것이 방법을 제대로 이해했다는 증거가 된다. 실무적으로 기억할 것은 세 가지다. 공변량은 반드시 처치 이전 시점의 것만 쓴다. 균형은 t-검정이 아니라 표준화 평균차로 판정한다. 그리고 표본 손실과 미관측 교란의 가능성을 숨기지 않는다. 이 세 가지가 지켜진 PSM 논문은 방법론 심사에서 흔들리지 않는다. 통제와 타당도의 기본 개념이 흔들린다면 신뢰도와 타당도 완전 가이드를 함께 읽어 두기를 권한다.
