평가 기준이 다섯 개인데 “무엇이 더 중요한가”를 숫자로 말해야 하는 상황이 있다. 역량 모델을 만들거나, 정책 대안의 우선순위를 정하거나, 교육과정 요소의 상대적 비중을 산출해야 할 때다. 리커트 척도로 각 항목의 중요도를 5점씩 받아 평균을 내면 대개 모든 항목이 4점대에 몰려 변별이 되지 않는다. 이 문제를 정면으로 다루는 방법이 AHP(Analytic Hierarchy Process, 계층분석적 의사결정)다. 핵심 아이디어는 단순하다. 항목을 한꺼번에 평가하게 하지 말고 둘씩 짝지어 비교하게 하고, 그 판단이 서로 모순되지 않는지를 계산으로 검증하는 것이다.
이 글은 AHP를 세 부분으로 정리한다. (가) 언제 이 방법을 고르는가, (나) 계층 구조화부터 가중치 산출까지의 절차와 각 단계의 결정, (다) 논문의 연구방법과 결과에 무엇을 어떻게 쓰는가.
(가) 언제 AHP를 고르는가
이 방법이 맞는 연구 질문
- 상대적 중요도를 수치로 요구하는 질문 — “간호관리자 핵심역량 중 무엇이 가장 중요한가”처럼 순위와 가중치가 결과물이어야 하는 경우.
- 평가 항목이 이미 확정되어 있는 경우 — 문헌고찰이나 델파이로 항목을 뽑아 놓은 다음 단계.
- 판단의 근거가 일반인이 아니라 전문가에게 있는 경우 — 대규모 표본을 확률적으로 뽑는 것이 의미 없는 영역.
- 평가지표나 배점표를 실제로 만들어야 하는 경우 — 산출된 가중치를 그대로 배점으로 쓸 수 있다.
AHP를 고르면 안 되는 경우
- 항목이 아직 정해지지 않았을 때 — 무엇을 평가할지부터 합의해야 한다면 델파이 기법의 전문가 합의 도출 절차를 먼저 거쳐야 한다. AHP는 항목을 만들어 주지 않는다.
- 일반 집단의 인식 분포를 알고 싶을 때 — 모집단 추정이 목적이라면 확률 표본에 기반한 설문조사 설계가 맞는다. AHP는 대표성을 주장하는 방법이 아니다.
- 주관성의 유형을 찾고 싶을 때 — 사람들이 어떻게 서로 다르게 생각하는지, 그 유형이 궁금하다면 Q방법론의 Q소트 절차가 목적에 맞는다. AHP는 평균적 가중치 하나를 만드는 방법이다.
- 요소들이 서로 영향을 주고받을 때 — 기준 간 독립성이 무너진다면 네트워크 구조를 허용하는 ANP를 검토해야 한다.
(나) 절차: 다섯 단계와 각 단계의 결정
1단계: 문제를 계층으로 구조화한다
맨 위에 최종 목표를 두고, 그 아래에 평가기준(상위 요인), 필요하면 그 아래에 하위기준, 맨 아래에 대안을 배치한다. 대안 비교가 목적이 아니라 가중치 산출 자체가 목적이라면 대안 층을 두지 않고 기준 층에서 끝내도 된다. 국내 학위논문에서는 이 형태가 오히려 더 흔하다.
이 단계에서 가장 중요한 결정은 한 묶음 안에 몇 개를 넣을 것인가다. 항목이 n개면 쌍대비교 횟수는 n(n−1)÷2회다. 5개면 10회지만 9개면 36회가 되고, 응답자는 지쳐서 아무렇게나 찍기 시작한다. 그 결과가 일관성 붕괴다. 한 묶음은 7개 이하, 가능하면 4~5개로 유지하고 필요하면 계층을 한 단 더 만들라. 이것이 AHP 설계에서 가장 실질적인 조언이다.
또 하나의 조건은 같은 층 요소들이 서로 배타적이어야 한다는 것이다. ‘의사소통 능력’과 ‘팀 협업 능력’처럼 개념이 겹치면 응답자가 무엇을 비교하는지 알 수 없게 되고, 겹친 만큼 가중치가 나뉘어 두 항목 모두 과소평가된다. 계층도를 확정하기 전에 각 항목의 정의를 한 문장씩 써 보고, 두 정의가 서로를 포함하지 않는지 확인하는 절차를 반드시 거쳐야 한다.
2단계: 쌍대비교 설문지를 만든다

척도는 Saaty의 9점 척도를 쓴다. 1은 두 항목이 동등하게 중요함, 3은 약간 더 중요함, 5는 중요함, 7은 매우 중요함, 9는 절대적으로 중요함이며 2·4·6·8은 그 중간값이다. 설문지는 좌우 양 끝에 두 항목을 놓고 가운데를 1로 하는 양방향 척도로 만드는 것이 표준이며, 응답 부담을 줄이고 방향 혼동을 막는다.
실무적으로는 두 가지를 반드시 넣어야 한다. 첫째, 예시 문항과 해설이다. AHP 쌍대비교는 일반 설문과 응답 방식이 달라서 설명 없이 배포하면 오응답이 쏟아진다. 둘째, 각 항목의 조작적 정의다. 응답자마다 용어를 다르게 이해하면 가중치가 의미를 잃는다. 문항 배치와 배포 방식의 기본기는 설문지 만드는 법 7단계 튜토리얼을 그대로 적용하면 된다.
문항 순서에도 결정이 필요하다. 같은 묶음의 비교를 연속으로 배치하면 응답자가 앞선 판단을 참조하기 쉬워 일관성이 올라가지만, 그만큼 기계적 응답의 위험도 커진다. 학위논문 수준에서는 묶음별로 모아 배치하되 묶음 안에서는 항목의 좌우 위치를 번갈아 놓아 방향 편향을 줄이는 방식이 무난하다.
3단계: 가중치를 산출한다
행렬에서 가중치를 뽑는 방법은 두 가지가 널리 쓰인다. 하나는 최대 고유치에 대응하는 고유벡터를 구하는 원래 방식이고, 다른 하나는 각 행의 값들을 기하평균 내어 정규화하는 방식이다. 후자는 스프레드시트로도 계산할 수 있어 실무에서 흔히 쓰이며, 두 방법의 결과는 대개 거의 같다. 전용 소프트웨어가 없어도 엑셀로 자료를 정리하는 방식을 익혀 두면 행렬 계산까지 무리 없이 처리할 수 있다.
계층이 여러 단이면 국지가중치(local weight)와 종합가중치(global weight)를 구분해야 한다. 국지가중치는 같은 상위 요인 아래의 형제 항목들 사이에서의 상대적 비중이고, 종합가중치는 여기에 상위 요인의 가중치를 곱한 값이다. 전체 순위는 반드시 종합가중치로 매긴다. 국지가중치로 순위를 매긴 표는 흔한 오류이며, 상위 요인 비중이 작은데 그 아래에서 1위인 항목이 전체 1위로 둔갑한다.
4단계: 일관성을 검정한다

AHP를 다른 중요도 조사와 구별하는 결정적 장치가 이것이다. A가 B보다 3배 중요하고 B가 C보다 2배 중요하다면 A는 C보다 대략 6배 중요해야 한다. 이 논리적 정합성이 얼마나 지켜졌는지를 수치로 잰다.
먼저 일관성지수(CI)를 (λmax − n) ÷ (n − 1)로 계산하고, 이를 항목 수에 대응하는 무작위지수(RI)로 나누어 일관성비율(CR)을 얻는다. RI는 항목 수에 따라 정해진 상수로, 3개면 0.58, 4개면 0.90, 5개면 1.12, 6개면 1.24, 7개면 1.32가 널리 쓰이는 값이다.
판정 기준은 CR ≤ 0.1이다. Saaty는 항목이 3개일 때는 0.05, 4개일 때는 0.08, 5개 이상일 때 0.1을 권했으나 실무에서는 0.1을 통용 기준으로 쓴다. 0.2까지 허용했다고 쓴 논문도 있는데, 그 경우 근거를 명시하지 않으면 지적을 피하기 어렵다. 유의할 점은 일관성이 타당성을 보장하지 않는다는 사실이다. 응답자가 항목을 잘못 이해한 채 일관되게 답했다면 일관성비율은 낮게 나오지만 결과는 무의미하다. 일관성은 최소 요건이지 품질의 증명이 아니다.
5단계: 전문가 판단을 통합한다
응답자가 여러 명이면 통합 방식을 정해야 한다. 개별 판단값을 기하평균으로 합쳐 하나의 행렬을 만든 뒤 가중치를 구하는 방식이 가장 널리 쓰인다. 여기서 반드시 지켜야 할 것은 산술평균이 아니라 기하평균이라는 점이다. 쌍대비교값은 역수 관계로 이루어져 있어 산술평균을 쓰면 그 역수 관계가 깨진다. 3과 1/3의 산술평균은 1.67이지만 기하평균은 1이며, 후자가 ‘두 판단이 상쇄되어 동등하다’는 의미에 맞는다.
대안적으로 전문가별 가중치를 각각 구한 뒤 그 가중치들을 평균할 수도 있다. 이 방식은 전문가 집단 간 차이(예: 학계와 현장의 우선순위 차이)를 별도로 보여 줄 수 있다는 장점이 있어, 집단 비교가 연구 질문에 포함된다면 이쪽이 낫다.
(다) 논문에 어떻게 보고하는가
연구방법 절에 반드시 들어갈 일곱 가지
- 계층 구조도(그림)와 그 구조를 확정한 근거(문헌고찰인지 델파이인지 전문가 자문인지)
- 각 층의 요소 수와 총 쌍대비교 문항 수
- 사용한 척도(9점 척도임을 명시)
- 전문가 패널의 구성·선정 기준·인원, 소속 유형별 분포와 평균 경력
- 자료 수집 기간과 방식(대면·온라인·우편)
- 가중치 산출 방법(고유벡터법인지 기하평균법인지)과 사용 도구
- 일관성비율 판정 기준과 기준 초과 응답의 처리 방침
결과 절에 넣을 표
- 표 1 — 전문가 패널의 일반적 특성.
- 표 2 — 상위 요인의 가중치, 순위, 일관성비율.
- 표 3 — 하위 요인별 국지가중치, 종합가중치, 전체 순위, 요인별 일관성비율.
- 표 4(선택) — 집단별 가중치 비교. 학계와 현장의 우선순위가 갈리는 지점이 있다면 이 표가 고찰의 핵심 재료가 된다.
가중치는 소수점 셋째 자리까지 제시하고, 각 묶음의 합이 1.000이 되는지 확인한다. 반올림 때문에 0.999나 1.001이 되면 각주로 밝힌다.
가중치를 배점표로 옮길 때
AHP의 결과물이 실제 평가도구가 되는 경우가 많다. 종합가중치에 총점을 곱하면 항목별 배점이 나오지만, 여기서 두 가지 실무적 결정이 추가로 필요하다. 첫째, 반올림 원칙이다. 소수점 배점은 현장에서 쓸 수 없으므로 정수로 만들어야 하고, 반올림 후 합계가 총점과 어긋나면 어느 항목에서 조정할지를 미리 정해 논문에 적어야 한다. 둘째, 지나치게 작은 가중치의 처리다. 종합가중치가 .01에도 못 미치는 항목은 100점 만점에서 1점도 배정받지 못한다. 그런 항목을 상위 항목에 통합할지, 배점 없이 정성 평가 항목으로 남길지를 결정하고 그 판단 근거를 밝혀야 도구의 완결성이 확보된다.
바로 쓸 수 있는 모범 문장
본 연구는 평가 요인의 상대적 중요도를 산출하기 위해 Saaty가 제안한 계층분석적 의사결정(AHP) 기법을 적용하였다. AHP는 복잡한 의사결정 문제를 계층으로 분해하고 요소 간 쌍대비교를 통해 가중치를 도출하며, 응답의 논리적 일관성을 수치로 검증할 수 있다는 점에서 다수의 평가 요인을 다루는 본 연구의 목적에 부합한다.
계층은 선행연구 분석과 3라운드 델파이 조사를 통해 확정하였으며, 1계층은 최종 목표, 2계층은 4개의 상위 요인, 3계층은 총 16개의 하위 요인으로 구성하였다. 쌍대비교 문항은 상위 요인 6문항과 하위 요인 24문항으로 총 30문항이었다.
조사 대상은 해당 분야 5년 이상 경력의 전문가 24명으로, 학계 9명, 현장 실무자 10명, 정책 담당자 5명으로 구성하였다. 자료 수집은 2026년 4월 6일부터 4월 24일까지 온라인 설문으로 진행하였다.
가중치는 각 행의 기하평균을 정규화하는 방식으로 산출하였고, 응답자 간 판단은 개별 쌍대비교값의 기하평균으로 통합하였다. 일관성비율은 0.1을 기준으로 판정하였으며, 기준을 초과한 3명의 응답을 제외하여 최종 21명의 자료를 분석에 사용하였다. 모든 비교 행렬의 일관성비율은 0.1 미만이었다(범위 .012~.078).
분석 결과 상위 요인의 가중치는 A요인 .384, B요인 .271, C요인 .203, D요인 .142 순으로 나타났다. 하위 요인의 종합가중치를 기준으로 한 전체 순위에서는 A-2 요인이 .162로 가장 높았다.
심사에서 자주 지적되는 다섯 가지
- 일관성비율을 보고하지 않는다 — AHP를 쓴 근거 자체가 사라진다.
- 국지가중치로 전체 순위를 매긴다 — 종합가중치와 혼동한 표가 매우 흔하다.
- 한 묶음에 9개 이상을 넣었다 — 응답 부담이 커져 일관성이 무너진 것을 응답자 탓으로 돌린다.
- 전문가 선정 기준이 없다 — “관련 분야 전문가 20명”만 쓰여 있고 경력과 소속 유형이 없다.
- 산술평균으로 판단을 통합했다 — 역수 관계가 깨져 가중치가 왜곡된다.
자주 묻는 질문
AHP 설문에 전문가가 몇 명 필요한가요?
AHP는 확률 표본을 전제하지 않으므로 통계적 표본 크기 공식이 적용되지 않습니다. 국내 학위논문에서는 대체로 10명에서 30명 사이가 보고되며, 중요한 것은 인원수보다 패널 구성의 정당성입니다. 학계·현장·정책 등 관점이 다른 집단을 균형 있게 포함했는지, 각 전문가의 경력과 선정 기준이 무엇인지를 표로 제시해야 합니다. 일관성비율을 통과하지 못한 응답을 제외한 뒤의 최종 인원도 함께 밝혀야 합니다.
일관성비율이 0.1을 넘으면 어떻게 하나요?
세 가지 선택지가 있습니다. 첫째, 해당 응답자에게 재응답을 요청합니다. 둘째, 그 응답을 분석에서 제외합니다. 셋째, 비교 항목 수가 너무 많아 일관성이 무너진 경우라면 계층을 다시 나누어 한 묶음의 항목 수를 줄입니다. 어느 쪽을 택했든 처리 방침과 제외된 응답 수를 논문에 반드시 밝혀야 하며, 일관성비율을 계산조차 하지 않은 AHP 논문은 심사에서 바로 지적됩니다.
AHP와 델파이는 어떻게 다르고, 함께 쓸 수 있나요?
델파이는 무엇이 중요한 항목인지에 대한 합의를 만들어 내는 방법이고, AHP는 이미 확정된 항목들 사이의 상대적 가중치를 계산하는 방법입니다. 목적이 다르므로 순서대로 결합하는 설계가 널리 쓰입니다. 델파이 2~3라운드로 평가 항목과 계층을 확정한 뒤 그 계층을 그대로 AHP 쌍대비교 설문으로 옮기는 방식이며, 국내 논문에서 매우 흔한 조합입니다.
여러 전문가의 판단은 어떻게 하나로 합치나요?
두 가지 방식이 있습니다. 개별 판단값 자체를 기하평균으로 합친 뒤 하나의 행렬로 가중치를 구하는 방식과, 전문가별로 가중치를 각각 구한 뒤 그 가중치들을 평균하는 방식입니다. 전자가 더 널리 쓰이며, 이때 산술평균이 아니라 반드시 기하평균을 써야 합니다. 쌍대비교값이 역수 관계로 이루어져 있어 산술평균을 쓰면 역수 관계가 깨지기 때문입니다.
AHP로 구한 가중치를 배점표로 바로 쓸 수 있나요?
쓸 수 있습니다. 종합가중치에 총점을 곱하면 항목별 배점이 되며, 이것이 AHP가 정책·평가 연구에서 널리 쓰이는 이유입니다. 다만 소수점 배점은 실무에서 쓰기 어려우므로 반올림이 필요하고, 반올림 후 합계가 총점과 어긋나면 조정 원칙을 미리 정해 논문에 밝혀야 합니다. 가중치가 지나치게 낮은 항목은 배점 1점도 받지 못할 수 있어, 그런 항목을 유지할지 통합할지도 함께 논의해야 합니다.
정리
AHP의 성패는 계산이 아니라 계층을 얼마나 잘 잘랐는가에서 갈린다. 한 묶음에 항목을 너무 많이 넣으면 응답이 무너지고, 항목끼리 개념이 겹치면 가중치가 흩어진다. 설문을 배포하기 전에 계층도를 놓고 “이 네 개는 서로 배타적인가”, “이 묶음을 비교하는 데 몇 번을 물어야 하는가”를 확인하는 30분이 나중의 몇 주를 아낀다. 그리고 논문에는 일관성비율과 그 처리 방침을 반드시 쓴다. 그 한 문단이 AHP를 단순한 중요도 설문과 구별해 주는 유일한 증거이기 때문이다. 연구방법 전체 지형에서 이 기법이 어디에 놓이는지는 연구방법론 완전 가이드에서 확인할 수 있다.
