SPSS 상관분석 실전 튜토리얼 2026: Pearson·Spearman 선택부터 하삼각 APA 표까지

논문 4장에서 회귀분석이나 구조방정식으로 넘어가기 전, 거의 모든 양적 논문에는 주요 변인 간 상관관계 표가 하나 들어갑니다. 심사위원이 결과 절에서 가장 먼저 눈으로 훑는 표이기도 합니다. 여기서 변수 간 관계의 방향과 크기가 한눈에 보이지 않으면, 뒤에 나오는 회귀 결과의 설득력이 함께 떨어집니다.

이 글은 상관분석 하나만 다룹니다. Pearson과 Spearman을 언제 갈라 쓰는지, 산점도를 왜 반드시 먼저 봐야 하는지, 상관계수 크기를 어떤 기준으로 해석하는지, 그리고 하삼각 상관행렬 표를 APA 형식으로 만들어 결과 문장까지 쓰는 방법을 순서대로 정리합니다. SPSS 기본 조작이 낯설다면 SPSS 사용법 6단계 기본 가이드부터 보고 오십시오.

상관계수는 무엇을 말하고 무엇을 말하지 않는가

Pearson 상관계수 r은 두 연속변수의 선형 관계의 방향과 강도를 −1에서 +1 사이의 값으로 요약합니다. 부호는 방향이고, 절댓값은 강도입니다. 여기서 강조해야 할 단어는 ‘선형’입니다. 두 변수가 뚜렷한 곡선 관계를 이루더라도 r은 0에 가깝게 나올 수 있습니다.

말하지 않는 것도 분명합니다.

  • 인과를 말하지 않습니다. r이 .70이어도 어느 쪽이 원인인지, 제3의 변수가 둘을 함께 움직이는 것인지 상관계수는 구분하지 못합니다.
  • 기울기를 말하지 않습니다. “X가 1 오르면 Y가 얼마 오르는가”는 회귀계수의 몫입니다.
  • 표본의 구성을 말하지 않습니다. 성적 상위권만 모은 자료에서는 실제로 강한 관계도 약하게 나옵니다(범위 제한).

대신 아주 유용한 부산물이 하나 있습니다. r²는 두 변수가 공유하는 분산의 비율입니다. r = .30이면 r² = .09, 즉 공유하는 부분이 9%에 불과합니다. “상관이 .30이나 되는데”라는 인상을 냉정하게 교정해 주는 숫자라 해석할 때 함께 언급하면 좋습니다.

이 글에서 계속 쓸 예시

대학생 212명을 대상으로 학업스트레스·학업소진·자기효능감·학업성취 네 변인을 측정한 자료입니다. 모두 5점 리커트 척도로 측정했습니다.

1단계 — Pearson·Spearman·Kendall 중 무엇을 고를 것인가

세 계수의 선택 기준은 척도와 분포입니다.

표 1. 상관계수 세 가지의 선택 기준
계수 쓰는 상황 보는 관계 이상치에
Pearson r 두 변수가 연속형이고 대략 정규분포 선형 관계 민감함
Spearman ρ 서열 자료이거나 정규성이 깨졌을 때 단조 관계 강건함
Kendall τ 표본이 작고 동점(같은 값)이 많을 때 순위 일치 강건함

실무적으로는 합산 척도 점수는 Pearson, 단일 문항이나 순위 자료는 Spearman이 기본 선택입니다. 정규성이 깨졌을 때의 판단 기준 전반은 정규성 위배와 비모수 검정 전환에서 다룬 원칙이 그대로 적용됩니다. 둘 다 돌려 보고 결과가 거의 같다면 Pearson을 보고하고 “Spearman으로도 동일한 패턴이 확인되었다”는 한 문장을 덧붙이는 방식이 안전합니다.

2단계 — 상관계수를 계산하기 전에 산점도를 본다

이 단계를 건너뛰는 것이 상관분석에서 가장 흔한 실수입니다. 숫자 하나로 요약된 r은 자료의 모양을 숨깁니다. 완전히 다른 네 가지 자료가 똑같은 r 값을 낼 수 있다는 것은 통계학에서 오래된 교훈입니다.

선형·곡선·이상치 주도·집단 혼합 네 가지 산점도 형태를 비교한 도식
같은 상관계수라도 자료의 모양은 전혀 다를 수 있다 — 산점도를 보지 않으면 이 차이를 영영 모른다.

SPSS에서 산점도를 그리는 경로는 <그래프 → 레거시 대화상자 → 산점도/점도표 → 단순 산점도>입니다. 변수를 X축과 Y축에 넣고 확인을 누른 뒤, 출력된 그림에서 다음 넷을 확인합니다.

  1. 선형인가. 곡선이면 Pearson r은 관계를 과소평가합니다.
  2. 혼자 멀리 떨어진 점이 있는가. 이상치 하나가 r을 통째로 뒤집을 수 있습니다.
  3. 덩어리가 두 개로 나뉘어 있는가. 성별처럼 숨은 집단이 섞여 있으면 전체 상관과 집단 내 상관의 부호가 반대로 나오는 일이 생깁니다.
  4. 한쪽 끝이 잘려 있는가. 범위 제한이 있으면 상관이 실제보다 작게 나옵니다.

이상치를 어떻게 처리할지의 원칙은 분석 전에 정해 두어야 하며, 처리했다면 처리 전후 상관을 함께 보고하는 것이 정직한 방식입니다.

상관을 왜곡하는 네 가지 상황

산점도에서 잡아야 할 문제를 조금 더 구체적으로 정리해 두겠습니다. 논문에서 실제로 사고가 나는 경우는 대개 이 넷 중 하나입니다.

  1. 제3변수. 아이스크림 판매량과 익사 사고 건수가 함께 오르는 것은 둘 다 기온을 따라 움직이기 때문입니다. 연구 자료에서도 학년이나 학교 특성 같은 변수가 두 변인을 동시에 밀어 올리는 일이 흔합니다. 의심되면 편상관으로 확인합니다.
  2. 집단 혼합. 전체 표본에서는 정적 상관인데 남녀를 나누어 보면 각각 부적 상관인 경우가 실제로 생깁니다. 집단 변수가 있다면 <데이터 → 파일 분할>로 나누어 한 번 더 확인해 보는 것이 안전합니다.
  3. 범위 제한. 특정 대학 재학생만, 또는 상위 성적자만 모은 자료에서는 변량 자체가 좁아져 상관이 실제보다 작게 나옵니다. 표본의 동질성이 높은 연구라면 이 점을 한계로 밝히는 편이 좋습니다.
  4. 이상치 주도. 200개 점이 뭉쳐 있고 한 점만 멀리 떨어져 있을 때, 그 한 점이 r을 .05에서 .45로 끌어올릴 수 있습니다. 해당 사례를 뺀 상관을 함께 계산해 보면 금방 드러납니다.

3단계 — 클릭 순서

  1. 분석(Analyze) → 상관분석(Correlate) → 이변량 상관계수(Bivariate)를 클릭합니다.
  2. 관심 변수들을 변수(Variables) 칸으로 한꺼번에 옮깁니다. 네 개를 넣으면 4×4 행렬이 한 번에 나옵니다.
  3. 상관계수 영역에서 Pearson을 체크합니다. 필요하면 Spearman을 함께 켜 두어도 됩니다.
  4. 유의성 검정은 양쪽(Two-tailed)으로 둡니다.
  5. 옵션(Options)에서 평균과 표준편차를 체크합니다. 논문 표의 왼쪽 열이 여기서 나옵니다. 결측값은 목록별 결측값 제외를 고르면 모든 상관이 같은 표본에서 계산되어 표가 일관됩니다.
  6. 확인(OK)을 누릅니다.

흔한 실수. 결측값 처리를 대응별 제외로 두면 상관마다 N이 달라져 표 아래에 N을 하나로 적을 수 없게 됩니다. 표를 깔끔하게 만들려면 목록별을 권합니다. 다만 결측이 많아 표본이 크게 줄어든다면 그 사실을 밝혀야 합니다.

한국어로 같은 절차와 논문 표 작성을 시연한 영상이 있으니 화면을 대조해 보십시오.

4단계 — 출력 읽기와 해석 기준

출력된 상관행렬의 각 칸에는 Pearson 상관계수, 유의확률(양측), N 세 줄이 들어 있습니다. 대각선은 항상 1이고, 대각선을 기준으로 위아래가 완전히 대칭이므로 절반만 읽으면 됩니다. 논문 표에서 하삼각만 채우는 이유가 여기 있습니다.

크기 해석에는 Cohen의 관례가 가장 널리 쓰입니다. 절댓값 기준으로 .10 작음, .30 중간, .50 큼입니다. 이보다 세분한 기준(.00~.19 매우 약함, .20~.39 약함, .40~.59 보통, .60~.79 강함, .80 이상 매우 강함)을 쓰는 분야도 있습니다. 어느 쪽이든 채택한 기준을 밝히고 일관되게 적용하는 것이 핵심입니다.

그리고 반드시 구분해야 할 것이 유의성과 크기입니다. 유의확률은 “모집단에서 상관이 0이 아니다”만 말할 뿐 크기를 말하지 않습니다. 표본이 300명이면 r = .13도 유의해집니다(p = .024). 하지만 r²는 1.7%에 불과합니다. 유의하다는 이유로 “의미 있는 관계가 확인되었다”고 쓰는 것은 과장입니다.

다변량 상관은 회귀의 예고편이기도 하다

상관행렬을 볼 때 독립변수들끼리의 상관도 함께 확인해 두면 뒤에 나올 회귀분석의 문제를 미리 예측할 수 있습니다. 독립변수 간 상관이 .80을 넘으면 다중공선성 진단과 해결 단계에서 반드시 걸립니다. 반대로 종속변수와의 상관이 모두 .10 아래라면 회귀에서 유의한 계수가 나오기 어렵습니다.

두 상관계수의 크기를 비교하고 싶을 때

“자기효능감과 학업성취의 상관(.45)이 학업소진과 학업성취의 상관(−.29)보다 유의하게 큰가”처럼 두 상관계수를 비교해야 할 때가 있습니다. 눈으로 크기만 견주는 것은 근거가 되지 않습니다. 이런 비교에는 상관계수를 Fisher의 z로 변환해 차이를 검정하는 절차가 필요하며, 무료 온라인 계산기나 R 패키지로 간단히 수행할 수 있습니다. 같은 표본 안에서 겹치는 변수를 공유하는 두 상관을 비교할 때는 종속표본용 공식을 써야 한다는 점도 함께 기억해 두십시오. 논문에서 “A가 B보다 더 강하게 관련되었다”고 주장할 계획이라면 이 검정을 근거로 붙여야 심사에서 버팁니다.

편상관 — 제3변수를 통제하고 싶을 때

“학업소진을 통제하고도 두 변수의 관계가 남는가”를 보고 싶다면 <분석 → 상관분석 → 편상관계수>를 씁니다. 통제할 변수를 <제어변수> 칸에 넣고 실행하면 됩니다. 자유도는 N − 2 − 통제변수 수가 되므로 예시에서는 209입니다.

예시 자료로 두 경우를 실제로 계산해 보면 이 분석의 쓸모가 분명해집니다.

  • 관계가 살아남는 경우. 자기효능감과 학업성취의 상관은 .45였습니다. 학업소진을 통제한 편상관은 .38로 다소 줄었지만 여전히 유의했습니다(p < .001). 두 변수의 관계가 학업소진을 경유하는 부분이 일부 있지만, 그것을 걷어내고도 고유한 관계가 남는다는 뜻입니다.
  • 관계가 사라지는 경우. 학업스트레스와 학업성취의 상관은 −.21로 유의했습니다. 그런데 학업소진을 통제한 편상관은 −.04로 떨어지고 유의성도 사라집니다. 즉 “스트레스가 높으면 성취가 낮다”는 관계는 거의 전부 학업소진을 통해서만 설명되고 있었던 것입니다.

두 번째 결과는 고찰에서 한 문단을 통째로 얻을 수 있는 재료입니다. 다만 표현에 주의해야 합니다. 편상관이 0에 가까워졌다는 사실은 매개를 시사하는 정황이지 매개를 검증한 것이 아닙니다. “학업소진이 매개한다”가 아니라 “학업소진을 통제하면 관계가 유의하지 않아, 학업소진을 경유하는 경로일 가능성을 시사한다”로 씁니다. 실제 매개 검증은 부트스트랩 기반 간접효과 검정이 필요합니다.

변수가 많을 때의 다중비교 문제

상관행렬은 검정을 한 번 하는 것이 아니라 쌍의 개수만큼 하는 것입니다. 변수가 k개면 쌍은 k(k − 1) / 2개입니다. 예시처럼 변수 4개면 6쌍이지만, 변수 10개면 45쌍이 됩니다.

쌍마다 유의수준 .05를 그대로 적용하면 적어도 하나가 우연히 유의해질 확률이 빠르게 올라갑니다. 6쌍이면 약 26%, 45쌍이면 약 90%입니다. 상관행렬에 별표가 흩뿌려져 있을 때 그중 일부는 통계적 우연일 가능성이 상당하다는 뜻입니다.

대응은 두 갈래이고, 어느 쪽이 옳다기보다 목적에 따라 갈립니다.

  • 보정하지 않는 쪽. 상관행렬을 기술통계 목적으로 제시하는 경우, 즉 “변수들이 대체로 이런 관계에 있다”를 보여 주고 본검정은 뒤의 회귀에서 하는 경우입니다. 국내 논문의 대다수가 여기에 해당하며 별도 보정 없이 제시하는 것이 관행입니다.
  • 보정하는 쪽. 특정 상관 자체를 가설로 명시하고 검정 결과로 주장하는 경우입니다. 이때는 Bonferroni 방식으로 유의수준을 쌍의 수로 나누어(45쌍이면 .05 ÷ 45 = .0011) 적용하거나, 덜 보수적인 순차적 보정을 씁니다.

실무적인 절충은 이렇습니다. 가설로 세운 상관만 검정 대상으로 명시하고, 나머지 쌍은 기술 목적임을 표 아래 주에 한 줄로 밝히는 것입니다. 그러면 보정을 하지 않은 이유가 설명되고, 우연히 유의한 값을 두고 사후에 이야기를 만들 여지도 줄어듭니다.

5단계 — APA 상관행렬 표 만들기

대각선 아래만 채운 하삼각 상관행렬 표의 구조를 나타낸 도식
APA 상관행렬은 하삼각만 채우고, 왼쪽에 평균과 표준편차를 붙인다.

규칙은 다섯 가지입니다. ① 대각선 위쪽은 비운다. ② 대각선에는 1을 넣거나, 신뢰도 계수를 넣기도 한다. ③ 소수점 앞의 0은 생략한다. ④ 유의수준은 별표로 표시하고 범례를 표 아래에 단다. ⑤ 평균과 표준편차 열을 함께 제시한다.

표 2. 주요 변인의 기술통계와 상관관계 (N = 212)
변인 M SD 1 2 3 4
1. 학업스트레스 3.42 0.71 1
2. 학업소진 3.05 0.68 .62** 1
3. 자기효능감 3.61 0.62 −.34** −.41** 1
4. 학업성취 3.78 0.55 −.21** −.29** .45** 1

주. ** p < .01. 대각선의 1은 자기 자신과의 상관을 뜻한다.

대각선에 신뢰도 계수를 넣는 형식도 흔합니다. 그 경우 “대각선은 Cronbach’s α”라고 주에 밝혀야 하며, 계수 산출 절차는 SPSS 신뢰도 분석(Cronbach’s α) 실전 튜토리얼에 있습니다.

6단계 — 결과 서술 문장 템플릿

상관 결과는 표를 그대로 읽어 주면 지루해집니다. 가장 강한 관계, 가설과 관련된 관계, 예상 밖의 관계 순으로 골라 서술하는 것이 요령입니다.

① 주요 변인 간의 관계를 확인하기 위해 Pearson 적률상관분석을 실시하였다. 분석에 앞서 산점도를 통해 변인 간 관계가 선형임을 확인하였다.

② 분석 결과 학업스트레스는 학업소진과 유의한 정적 상관을 보였으며(r = .62, p < .01), 이는 본 연구에서 확인된 가장 강한 관계였다.

③ 자기효능감은 학업스트레스(r = −.34, p < .01) 및 학업소진(r = −.41, p < .01)과 유의한 부적 상관을, 학업성취와는 유의한 정적 상관을 보였다(r = .45, p < .01).

④ 학업스트레스와 학업성취의 상관은 유의하였으나 그 크기는 작았으며(r = −.21, p < .01), 두 변인이 공유하는 분산은 4.4%에 그쳤다.

⑤ 한편 독립변인 간 상관은 모두 .62 이하로 나타나 이후 회귀분석에서 다중공선성 문제가 발생할 가능성은 낮은 것으로 판단되었다.

④의 문장이 좋은 습관입니다. 유의하지만 작은 상관을 작다고 그대로 적는 것이 오히려 신뢰를 얻습니다. 여기서 확인된 관계를 인과 경로로 확장하려면 별도의 절차가 필요하며, 그 과정은 매개효과·조절효과 분석과 PROCESS 매크로에서 다룹니다.

표는 완성했는데 세 문단이 계속 같은 문장으로 끝날 때

상관 서술은 “~와 유의한 정적 상관을 보였다”가 열 번 반복되기 쉬운 자리입니다. Tesify AI 학술 에디터로 결과 문단의 표현과 연결어를 다듬으면 같은 정보를 훨씬 읽기 좋게 배치할 수 있습니다. 어떤 관계를 먼저 말할지, 크기를 어떻게 평가할지 같은 판단은 연구자가 내리고, 문장을 학술 문체로 정돈하는 작업만 맡기는 방식이 안전합니다.

심사에서 자주 지적되는 실수

  1. 산점도를 보지 않은 것. 곡선 관계나 이상치 주도 상관을 놓치면 결론 자체가 틀립니다.
  2. 인과로 서술하는 것. “스트레스가 소진을 증가시킨다”가 아니라 “정적 상관이 있었다”가 정확합니다.
  3. 유의성만 보고 크기를 말하지 않는 것. 표본이 크면 거의 모든 상관이 유의해집니다.
  4. 상삼각까지 채운 표를 싣는 것. 같은 정보를 두 번 싣는 셈입니다.
  5. 별표 범례를 빠뜨리는 것. 별 하나와 둘의 뜻을 밝히지 않으면 표가 읽히지 않습니다.
  6. Spearman을 썼는데 ‘상관분석’이라고만 적는 것. 어떤 계수를 썼는지 반드시 명시합니다.

자주 묻는 질문

상관이 유의하지 않으면 회귀분석을 하면 안 되나요?

그렇지 않습니다. 다른 변수를 통제하면 유의해지는 억제 관계가 존재할 수 있고, 반대로 상관은 유의했는데 회귀에서 사라지기도 합니다. 다만 모든 독립변수가 종속변수와 거의 무상관이라면 회귀에서 좋은 결과를 기대하기 어렵습니다.

리커트 척도에 Pearson을 써도 되나요?

여러 문항을 평균 낸 합산 척도라면 관례적으로 Pearson을 씁니다. 단일 문항의 5점 응답이라면 Spearman이 더 안전하다는 견해가 있습니다.

상관계수가 −.85인데 다중공선성 문제인가요?

독립변수끼리의 상관이라면 강한 경고 신호입니다. 부호는 상관없고 절댓값이 중요합니다. 다만 최종 판단은 VIF와 상태지수를 함께 보고 내립니다.

변수가 열 개면 표가 너무 커집니다.

변수 열 개면 하삼각만 해도 45개 칸입니다. 이럴 때는 핵심 변인만 본문 표에 넣고 전체 행렬은 부록으로 돌리거나, 하위 요인 대신 총점을 쓰는 방식으로 줄입니다.

상관행렬에 변수가 많은데 유의수준을 보정해야 하나요?

상관행렬을 기술통계 목적으로 제시하고 본검정은 회귀에서 한다면 보정 없이 제시하는 것이 관행입니다. 반면 특정 상관 자체를 가설로 세워 주장한다면 Bonferroni 등으로 보정하거나, 검정 대상으로 삼은 쌍이 무엇인지 표 아래에 명시해야 합니다. 변수 10개면 45쌍이고, 보정 없이는 적어도 하나가 우연히 유의할 확률이 약 90%에 이릅니다.

Pearson과 Spearman 결과가 다르면 어느 쪽을 씁니까?

둘이 크게 다르다면 이상치나 비선형 관계가 있다는 신호입니다. 산점도로 원인을 확인한 뒤, 원인을 설명하면서 더 적절한 쪽을 보고하십시오. 두 결과를 모두 제시하는 것도 좋은 선택입니다.

정리

척도와 분포를 보고 계수를 고르고(1단계), 계산 전에 산점도로 자료의 모양을 확인하고(2단계), 이변량 상관계수 메뉴에서 평균·표준편차와 목록별 결측 제외를 켜고(3단계), 대각선 아래만 읽으면서 유의성과 크기를 구분해 해석하고(4단계), 하삼각 형식의 APA 표로 조판한 뒤(5단계) 강한 관계부터 골라 서술하면(6단계) 끝납니다. 이 표가 잘 만들어져 있으면 뒤이어 나오는 다중회귀분석 결과가 훨씬 자연스럽게 읽힙니다.

AI와 함께 학위논문 쓰기

구조 설계부터 집필, APA 참고문헌 정리까지 — 학문적 진실성을 지키며. 무료 가입, 신용카드 불필요.

Tesify 무료로 시작하기 →

카테고리