연구계획서 심사에서 가장 자주 나오는 질문 하나가 “그래서 몇 명을 조사할 겁니까, 근거는요?”입니다. 대답이 “선배가 200명쯤 했다고 해서요”이면 그 자리에서 계획서가 되돌아옵니다.
표본 크기를 정하는 일은 감이 아니라 계산이고, 계산 도구는 여러 개가 있습니다. 문제는 그 도구들이 서로 다른 질문에 답한다는 점입니다. 인터넷에서 흔히 보이는 “신뢰수준 95%, 오차범위 ±5%”짜리 계산기와 G*Power는 아예 다른 계산을 합니다. 둘을 혼동한 채 계산기 숫자를 계획서에 적으면, 심사위원이 정확히 그 지점을 짚습니다.
이 글은 국내 대학원생이 실제로 쓰는 네 가지 경로 — G*Power, 웹 기반 온라인 계산기, R 패키지, 통계 프로그램 내장 기능 — 을 여섯 기준으로 비교하고, 각각 언제 쓰는 도구인지 한 줄로 정리합니다. 마지막에는 계산 결과를 심사에서 방어되는 문장으로 옮기는 방법까지 다룹니다.
먼저 갈라야 할 두 가지 질문

표본 크기 계산에는 성격이 다른 두 계보가 있습니다.
- 추정의 정밀도를 묻는 계산. “우리 대학 학생의 만족도가 몇 퍼센트인지 오차범위 ±5퍼센트 안에서 알고 싶다”는 질문입니다. 입력값은 모집단 크기, 신뢰수준, 허용 오차, 예상 비율입니다. 여론조사와 실태조사가 이 계보에 속하고, 인터넷 표본 크기 계산기 대부분이 이것을 계산합니다.
- 검출력을 묻는 계산. “두 집단의 평균 차이가 실제로 존재한다면 그것을 통계적으로 잡아내려면 몇 명이 필요한가”라는 질문입니다. 입력값은 검정 종류, 효과크기, 유의수준, 목표 검정력입니다. 가설을 세우고 검정하는 학위논문은 거의 전부 이쪽입니다.
연구모형에 가설이 있고 t검정·분산분석·회귀·상관을 돌릴 계획이라면 두 번째 계보의 도구를 써야 합니다. 첫 번째 계보의 계산기 숫자를 적어 두면, “귀하의 연구는 비율 추정이 목적이 아닌데요”라는 지적을 받습니다. 가설이 어떤 형태여야 검정과 연결되는지는 연구 가설 설정과 검정 연결하기에 정리되어 있습니다.
계산기를 열기 전에 정해 두어야 할 다섯 가지
도구가 무엇이든 입력값을 못 정하면 계산이 시작되지 않습니다. 아래 다섯 가지를 종이에 먼저 적어 두면 실제 계산은 5분입니다.
- 주 가설에 대응하는 검정 하나. 논문 전체에서 가장 중요한 가설 하나를 고르고, 그 가설을 검정하는 방법(독립표본 t검정, 일원배치 분산분석, 다중회귀 등)을 확정합니다. 검정이 여러 개면 가장 많은 표본을 요구하는 검정을 기준으로 삼습니다.
- 유의수준과 방향. 관례적으로 .05를 쓰되, 단측 검정을 쓸 근거가 명확한지 확인합니다. 근거 없이 단측을 쓰면 표본 수를 줄이려는 시도로 읽힙니다.
- 목표 검정력. .80이 관례이고, 임상이나 정책 판단이 걸린 연구에서는 .90을 쓰기도 합니다.
- 효과크기와 그 출처. 다음 절에서 따로 다룹니다. 여기서 근거가 갈립니다.
- 집단 수와 배분 비율. 두 집단을 같은 수로 모을 수 있는지, 한쪽이 구조적으로 적은지에 따라 필요한 총원이 달라집니다.
이 비교의 평가 기준 여섯 가지
- 지원하는 검정 범위 — 내가 쓸 분석이 목록에 있는가.
- 효과크기 입력의 실질성 — 효과크기를 넣으라고만 하는가, 넣는 것을 도와주는가.
- 계산 유형 — 사전(a priori)뿐 아니라 민감도(sensitivity), 사후(post hoc), 절충(compromise) 분석까지 되는가.
- 논문에 넣을 산출물 — 그래프와 수치를 그대로 근거로 제시할 수 있는가.
- 비용과 설치 — 무료인가, 설치가 필요한가, 어떤 운영체제에서 되는가.
- 학습 부담 — 처음 쓰는 사람이 한 시간 안에 원하는 숫자를 얻을 수 있는가.
한눈에 보는 네 경로 비교표
| 기준 | G*Power | 온라인 계산기 | R 패키지 | jamovi·JASP 내장 |
|---|---|---|---|---|
| 비용 | 무료 | 대개 무료 | 무료 | 무료 |
| 설치 | 필요(윈도우·macOS) | 불필요 | R 설치 필요 | 본체 설치 필요 |
| 검정 범위 | t·F·카이제곱·z 검정과 일부 정확검정까지 폭넓음 | 비율 추정, 단순 평균 비교 중심 | 패키지에 따라 매우 넓음 | 모듈에 따라 제한적 |
| 계산 유형 | 사전·사후·민감도·절충 | 사전 위주 | 패키지에 따라 다양 | 주로 사전 |
| 효과크기 도우미 | 있음(원자료 값으로 환산) | 거의 없음 | 직접 계산 필요 | 제한적 |
| 그래프 산출 | 검정력 곡선 제공 | 대개 없음 | 직접 그림 | 제한적 |
| 심사 신뢰도 | 가장 높음(관례적 표준) | 낮음(출처 불명확한 경우 많음) | 높음(코드 공개 가능) | 보통 |
| 학습 부담 | 중간 | 매우 낮음 | 높음 | 낮음 |
G*Power — 사실상의 표준
G*Power는 하인리히하이네 뒤셀도르프 대학교의 연구진(Axel Buchner, Edgar Erdfelder, Franz Faul, Albert-Georg Lang)이 만든 검정력 분석 프로그램입니다. t검정, F검정, 카이제곱 검정, z검정과 일부 정확검정에 대한 검정력 분석을 제공하고, 효과크기를 계산해 주며 결과를 그래프로 보여 줍니다.
강점
- 완전 무료입니다. 개발진은 상업적 환경에서 일하는 사람까지 포함해 누구에게나 무료라고 명시하고 있습니다.
- 국내외 학위논문의 표본 수 산정 근거로 가장 널리 인용됩니다. 심사위원이 이름을 알고, 절차를 설명하는 데 드는 문장이 짧습니다.
- 사전 분석뿐 아니라 민감도 분석까지 됩니다. 자료를 이미 모았을 때 “이 표본에서 검출 가능한 최소 효과크기”를 제시하는 정직한 대안을 만들 수 있습니다.
- 효과크기를 직접 모를 때 평균과 표준편차 같은 원자료 값을 넣어 환산해 주는 보조 창이 있습니다.
- 단순 상관, 종속 상관 비교, 단순·다중 선형회귀, 로지스틱 회귀, 포아송 회귀까지 다룹니다.
약점
- 인터페이스가 낡았습니다. 최신 배포가 윈도우용 3.1.9.7(2020년 3월 17일), macOS용 3.1.9.6(2020년 2월 21일)이라 화면이 요즘 프로그램 같지 않습니다. macOS는 10.7부터 26까지 지원한다고 안내되어 있습니다.
- 한국어 인터페이스가 없고, 검정 이름이 통계학 영문 용어로 되어 있어 처음에는 내 분석이 어느 항목인지 찾기 어렵습니다.
- 구조방정식, 다층모형처럼 최근 논문의 복잡한 모형은 다루지 않습니다.
- 입력값을 잘못 넣어도 숫자는 나옵니다. 결과가 그럴듯하다고 맞는 것이 아닙니다.
이런 사람에게 맞습니다: t검정·분산분석·회귀·상관으로 가설을 검정하는 대부분의 학위논문 연구자. 특별한 이유가 없다면 여기서 시작하는 것이 맞습니다.
온라인 계산기 — 빠르지만 근거로는 약하다
브라우저에서 숫자 몇 개만 넣으면 결과가 나오는 웹 계산기들이 있습니다. 설치가 필요 없고 한국어 화면인 경우도 있어 접근성은 가장 좋습니다.
강점
- 5분이면 대략적인 규모를 잡을 수 있습니다. 연구를 설계하는 초기 단계에서 “300명 규모인가 3천 명 규모인가”를 가늠하는 데 유용합니다.
- 설문조사에서 모집단 비율을 추정하는 것이 실제 목적이라면, 그 계보의 계산으로는 정확한 도구입니다.
- 설치와 계정이 필요 없습니다.
약점
- 어떤 공식을 쓰는지 밝히지 않는 경우가 많습니다. 근거를 인용할 수 없는 숫자는 심사에서 근거가 되지 못합니다.
- 대부분 비율 추정 계보의 계산기입니다. 가설 검정이 목적인 연구에는 맞지 않습니다.
- 검정 종류를 고를 수 없거나 선택지가 매우 좁습니다.
- 사이트가 사라지면 출처 자체가 없어집니다. 몇 년 뒤 재현이 불가능합니다.
이런 사람에게 맞습니다: 아직 설계 단계에서 규모만 가늠하는 사람, 또는 비율 추정이 실제 연구 목적인 실태조사 연구자. 최종 근거로는 G*Power나 R로 다시 계산하는 편이 안전합니다.
R 패키지 — 재현 가능한 근거를 남긴다
R에는 검정력 분석 전용 패키지들이 있습니다. 기본적인 검정부터 다층모형·구조방정식 계열까지 확장 가능하고, 무엇보다 계산 과정이 코드로 남습니다.
강점
- 스크립트가 그대로 근거가 됩니다. 논문 부록에 코드를 넣으면 “어떤 값으로 어떻게 계산했는지”가 완전히 재현됩니다.
- G*Power가 다루지 않는 모형까지 확장됩니다. 다층모형이나 매개모형의 검정력을 시뮬레이션으로 추정하는 방법도 있습니다.
- 여러 조건을 한 번에 돌려 표로 만들 수 있습니다. “효과크기가 작을 때·중간일 때·클 때 각각 몇 명”을 표로 제시하면 계획서의 설득력이 크게 올라갑니다.
- 무료이고 졸업 후에도 그대로 씁니다.
약점
- R을 모르면 시작할 수 없습니다. 표본 크기 계산 하나 때문에 R을 배우는 것은 비효율적입니다.
- 패키지마다 인자 이름과 효과크기 정의가 달라, 잘못 넣어도 오류 없이 틀린 값이 나옵니다.
- 한국어 자료가 얇습니다.
이런 사람에게 맞습니다: 이미 R로 분석하는 연구자, 여러 시나리오를 표로 제시하려는 사람, 박사과정. R을 포함한 무료 통계 도구 전반은 무료 통계 프로그램 비교에서 다룹니다.
jamovi·JASP 내장 기능 — 분석 도구 안에서 바로
클릭형 통계 프로그램에도 검정력 분석 기능이 모듈로 제공됩니다. 이미 그 프로그램으로 분석할 예정이라면 도구를 하나 더 배우지 않아도 됩니다.
강점
- 분석과 계산이 같은 화면에서 이루어져 맥락이 끊기지 않습니다.
- 화면이 현대적이고 입력값 설명이 친절합니다.
- 결과 표를 그대로 복사해 문서에 붙일 수 있습니다.
약점
- 지원 검정 범위가 G*Power보다 좁습니다. 필요한 검정이 없을 확률이 있습니다.
- 모듈 설치가 필요하고, 모듈에 따라 기능 폭이 크게 다릅니다.
- 심사 관행에서는 여전히 G*Power 이름이 더 자주 등장합니다.
이런 사람에게 맞습니다: 이미 jamovi나 JASP로 분석하고, 필요한 검정이 단순한 t검정·분산분석 수준인 연구자.
효과크기를 모를 때 — 실제로 쓰는 세 가지 방법

검정력 계산에서 막히는 지점은 언제나 같습니다. 효과크기를 넣으라는데 그걸 어떻게 아느냐는 것입니다. 순서대로 다음 셋을 시도하세요.
- 선행연구에서 가져옵니다. 같은 척도로 비슷한 집단을 조사한 연구의 효과크기를 쓰고 그 논문을 인용합니다. 가장 강한 근거이고, 심사에서 추가 질문이 거의 나오지 않습니다. 선행연구에 효과크기가 안 적혀 있어도 평균과 표준편차, 표본 수가 있으면 역산할 수 있습니다.
- 관례적 기준을 쓰고 출처를 밝힙니다. 중간 정도의 효과크기를 가정한다고 적고, 그 기준의 출처를 명시합니다. 근거로는 첫 번째보다 약하지만 아무 근거 없이 숫자를 적는 것과는 다릅니다.
- 민감도 분석으로 뒤집어 접근합니다. 현실적으로 확보 가능한 인원이 이미 정해져 있다면(예: 해당 병동 환자 전수가 120명), 그 표본 수에서 유의수준과 목표 검정력을 만족하며 검출할 수 있는 최소 효과크기를 계산합니다. “이 연구는 중간 크기 이상의 효과만 검출할 수 있으며, 이는 연구의 한계”라고 적으면 오히려 신뢰를 얻습니다. 연구의 한계점을 신뢰로 바꾸는 서술 방식에 이런 문장의 구조가 정리되어 있습니다.
사후 검정력의 함정
자료를 다 모으고 분석했더니 결과가 유의하지 않게 나왔습니다. 이때 관측된 효과크기를 그대로 넣어 검정력을 계산해 “검정력이 부족해서 유의하지 않았다”고 쓰고 싶어집니다. 이 계산은 새로운 정보를 주지 않습니다. 관측된 효과크기로 계산한 사후 검정력은 유의확률을 다른 방식으로 표현한 값에 가깝기 때문입니다. p가 크면 검정력은 낮게 나오도록 되어 있습니다. 순환 논증입니다.
대신 쓸 수 있는 것이 앞서 말한 민감도 분석입니다. “이 표본 크기에서는 Cohen의 d가 0.5 이상인 차이만 검출할 수 있었고, 관측된 차이는 그보다 작았다”는 서술은 정보가 있고 방어됩니다. 두 문장의 차이가 심사에서 크게 갈립니다.
계산 결과를 논문 문장으로 옮기기
계산은 5분이고, 그 결과를 방법 장에 어떻게 적느냐가 심사를 통과시킵니다. 다음 여섯 요소를 순서대로 넣으세요.
- 사용한 프로그램과 버전
- 어떤 검정을 기준으로 계산했는지
- 유의수준(양측·단측 여부 포함)
- 목표 검정력
- 가정한 효과크기와 그 출처
- 산출된 최소 표본 수와, 탈락률·불성실 응답을 고려해 실제로 모집한 인원
여섯 번째가 특히 중요합니다. 계산 결과가 128명인데 150명을 모았다면, 왜 22명을 더 모았는지(예상 탈락률 15퍼센트)를 적어야 합니다. 이 문장이 없으면 “왜 150명입니까”라는 질문이 또 나옵니다. 설문 배포와 회수 과정의 설계 자체는 설문조사 방법 완벽 가이드와 설문지 만드는 법 7단계에서 다루고, 표집 방식(확률·비확률)의 선택은 표본 추출 방법 완전 가이드에 정리되어 있습니다. 표본 수와 표집 방식은 별개의 문제이며, 둘 다 방법 장에 적어야 합니다.
상황별 최종 추천
| 상황 | 추천 | 이유 |
|---|---|---|
| t검정·분산분석·회귀로 가설 검정 | G*Power | 무료, 관례적 표준, 심사 설명 부담이 가장 적음 |
| 모집단 비율 추정이 실제 목적 | 온라인 계산기 | 그 계보의 계산에는 정확 |
| 여러 시나리오를 표로 제시 | R | 조건을 바꿔 가며 일괄 계산 |
| 다층모형·구조방정식의 검정력 | R(시뮬레이션) | G*Power가 다루지 않는 영역 |
| 이미 jamovi로 분석 중, 단순 검정 | jamovi 모듈 | 도구를 늘리지 않아도 됨 |
| 자료를 이미 다 모았음 | G*Power 민감도 분석 | 사후 검정력 대신 검출 가능 최소 효과크기 제시 |
숫자는 나왔는데 방법 장 문장이 안 써질 때
Tesify는 표본 크기를 대신 계산해 주지 않습니다. 계산이 끝난 뒤 그 근거를 학술 문체의 방법 장 문장으로 옮기고, 인용할 선행연구를 APA·KCI 형식으로 정리하고, 제출 전 독창성을 스스로 점검하는 단계를 돕는 AI 학술 도구입니다.
방법 장은 선행연구의 표현을 거의 그대로 따라가기 쉬운 구간입니다. 제출 전 Tesify 표절 검사기로 독창성 자가 점검을 한 번 돌려 두세요.
자주 묻는 질문
G*Power는 무료인가요?
무료입니다. 하인리히하이네 뒤셀도르프 대학교 연구진이 개발했고 상업적 환경에서 일하는 사람까지 포함해 누구나 무료로 쓸 수 있다고 명시하고 있습니다. 윈도우와 macOS용 설치 파일을 공식 페이지에서 내려받을 수 있습니다.
설문조사 표본 크기 계산기와 G*Power는 무엇이 다른가요?
묻는 질문 자체가 다릅니다. 신뢰수준과 오차범위를 넣는 계산기는 “모집단의 비율을 얼마나 정확히 추정할 것인가”를 계산합니다. G*Power는 “집단 간 차이나 관계를 통계적으로 검출하려면 몇 명이 필요한가”를 계산합니다. 가설 검정이 있는 학위논문은 후자가 맞습니다.
효과크기를 모르면 어떻게 하나요?
세 가지 방법이 있습니다. 첫째, 같은 척도를 쓴 선행연구의 효과크기를 인용해 사용합니다. 이것이 가장 강한 근거입니다. 둘째, 관례적인 중간 효과크기 기준을 쓰고 그 출처를 밝힙니다. 셋째, 확보 가능한 표본 수를 먼저 정하고 그 조건에서 검출 가능한 최소 효과크기를 계산하는 민감도 분석을 제시합니다.
자료를 다 모은 뒤에 검정력을 계산해도 되나요?
관측된 효과크기를 그대로 넣어 계산하는 사후 검정력은 유의확률을 다시 표현한 값에 가까워 새로운 정보를 주지 않습니다. 유의하지 않은 결과를 검정력 부족으로 설명하려는 용도로 쓰면 심사에서 지적받기 쉽습니다. 이미 자료를 모은 뒤라면 민감도 분석으로 “이 표본에서 검출 가능한 최소 효과크기”를 제시하는 편이 정직하고 유용합니다.
계산 결과를 논문에 어떻게 써야 하나요?
사용한 프로그램과 버전, 검정 종류, 유의수준, 목표 검정력, 가정한 효과크기와 그 출처, 산출된 최소 표본 수, 탈락률을 고려해 실제로 모집한 인원을 순서대로 적습니다. 이 여섯 요소가 모두 있으면 심사에서 표본 수에 대한 질문은 대부분 정리됩니다.
