계산 방법

계산 방법

이 페이지가 있는 이유

무엇을 계산했는지 밝히지 않는 통계 계산기는 얻지 못한 신뢰를 요구하는 셈입니다. 이 페이지는 본 사이트가 사용하는 모든 알고리즘과 그 정확도, 그리고 그것이 적절하지 않은 경우를 정리합니다. 결과를 좌우하는 선택 — Student 방식이냐 Welch 방식이냐, 카이제곱에 수정을 넣느냐 마느냐 — 은 묻어 두지 않고 그 선택과 결과를 함께 밝힙니다.

수치 계산 방법

대상방법정확도
정규분포 누적분포함수 Φ(z)오차함수에 대한 Abramowitz & Stegun 7.1.26 유리 근사절대오차 약 1.5 × 10⁻⁷
정규분포 누적분포함수의 역함수Acklam의 알고리즘상대오차 약 1.15 × 10⁻⁹
t분포와 F분포정규화 불완전 베타 함수상대 허용오차 10⁻¹⁴
카이제곱 분포정규화된 하부 불완전 감마 함수상대 허용오차 10⁻¹⁴
ln Γ(x)Lanczos 근사상대오차 약 10⁻¹⁵

불완전 베타 함수와 불완전 감마 함수는 인수의 크기에 따라 급수 전개 또는 연분수 전개를 골라 씁니다. Numerical Recipes의 표준적인 처리를 따랐으며 반복 횟수는 500회로 제한합니다. 표시는 모두 소수점 이하 두 자리(p값은 세 자리)이며, 이는 위 어떤 방법의 오차보다도 충분히 성긴 수준이라 본 사이트가 보여 주는 값에서 근사가 제약이 되는 일은 없습니다.

결과를 좌우하는 선택

이표본 t검정: Welch가 아닌 Student

이표본 검정은 모분산이 같다고 가정하고 분산을 합칩니다. 현재의 방법론은 대체로 Welch 검정을 기본값으로 권합니다. 분산이 같을 때도 검정력 손실이 거의 없고, 다를 때는 훨씬 믿을 만하기 때문입니다. 두 집단의 표준편차가 대략 두 배 넘게 차이 나거나, 분산도 표본 수도 모두 다르다면 여기서 나오는 p값은 틀립니다. 그것도 낙관적인 쪽으로 틀릴 수 있습니다.

2×2 카이제곱: 연속성 수정 없음

수정을 넣지 않은 Pearson 통계량을 표시합니다. 기대빈도가 대략 5 아래로 내려가면 이 방법은 비보수적입니다 — 너무 쉽게 유의해집니다 — 이 경우 Fisher의 정확검정이 알맞은 대안입니다.

검정력 분석: 정규근사

표본 크기와 검정력은 비중심 t분포와 F분포에 의한 정확 계산이 아니라 Cohen(1988)의 정규근사법을 씁니다. G*Power와 비교하면 대개 집단당 1~2명 차이가 나며, 표본이 작고 검정력이 낮을수록 그 차이가 큽니다. 반드시 올림하시고, 연구비 신청·연구윤리 심의·사전등록에 수치를 제출하기 전에는 전용 소프트웨어로 확인하십시오.

효과크기 환산: 집단 표본 수가 같다고 가정

d ↔ r 환산에는 r = d / √(d² + 4)를 씁니다. 상수 4는 a = (n₁ + n₂)² / (n₁ n₂)에 해당하며, 이 값이 4가 되는 것은 두 집단의 크기가 같을 때뿐입니다. 표본 수가 크게 치우친 설계라면 실제 집단 크기로 a를 계산하십시오.

사분위수: 선형 보간

사분위수는 선형 보간법으로 구하며 R의 type 7, Excel의 QUARTILE.INC와 일치합니다. 다른 소프트웨어는 다른 방식을 쓰기도 하므로 표본이 작을 때 사분위수와 IQR 값이 조금 다를 수 있습니다.

히스토그램 구간: 스터지스 공식

구간 수는 ⌈log₂(n) + 1⌉입니다. 표본이 크거나(대략 200 초과) 분포가 치우친 자료에서는 구간이 부족해집니다. 그런 자료에는 Freedman–Diaconis 공식이 대체로 낫습니다.

상자 그림 이상치: Tukey의 1.5 × IQR

가까운 쪽 사분위수에서 1.5 × IQR을 넘어 떨어진 점을 표시합니다. 참으로 정규인 자료에서도 약 0.7%의 점이 우연히 걸리므로, 표시가 붙었다는 것은 살펴보라는 신호이지 오류의 증거가 아닙니다.

입시 참고 자료

입시 페이지에는 세 종류의 정보가 섞여 있고, 그 무게는 서로 다릅니다.

  1. 공표된 환산 규칙 — JUPAS 점수 체계, 헨사치 공식, 수능 표준점수 공식, 오표(五標)의 백분위 정의. 확정된 공개 정보이며 그대로 옮겼습니다.
  2. 검증된 학과별 수치 — 각 대학이 공표한 문서에서 직접 가져온 소수의 구체적인 합격 통계이며, 행마다 출처 링크가 있습니다. 출처가 어긋난 항목은 맞추지 않고 뺐습니다.
  3. 합격선 구간 — 공개 자료를 바탕으로 정리한 대략적인 범위입니다. 공식 자료가 아니며 해마다 달라지고, 이를 보여 주는 모든 페이지에 그렇게 표시해 두었습니다.

참고 자료에는 마지막 검증 시점과 재확인 주기를 기록한 신선도 표시가 붙어 있습니다. 분기마다 예정된 작업이 점검 주기를 넘긴 항목을 찾아내므로, 오래된 수치가 조용히 남아 있는 일은 없습니다.

의도적으로 두지 않은 기능

  • 가오카오 환산기가 없습니다. 성마다 문제와 총점, 합격선이 달라 성을 넘나드는 타당한 환산이 없습니다. 가오카오 페이지는 대신 대학 등급 체계를 설명하고 각 성의 성적 조회로 연결합니다.
  • 비모수 검정이 없습니다. Mann–Whitney, Wilcoxon 부호순위, Kruskal–Wallis 검정은 구현하지 않았습니다. 검정 마법사가 필요할 때 이름을 알려 주고 다른 곳으로 안내합니다.
  • 분산분석 이후의 사후 검정이 없습니다. 분산분석이 유의하다는 것은 어떤 집단 쌍에 차이가 있다는 뜻일 뿐 어느 쌍인지는 알려 주지 않습니다. Tukey의 HSD 등은 제공하지 않습니다.
  • 효과크기의 신뢰구간이 없습니다. 점추정만 제공합니다.

오류 제보

본 사이트의 공식이나 수치, 출처에 잘못이 있으면 문의 페이지로 알려 주십시오. 계산 자체의 오류는 긴급 사안으로 다루며, 참고 자료의 오류는 고친 뒤 검증 날짜를 갱신합니다.

주요 참고문헌

  • Abramowitz, M. & Stegun, I. A. (1964). Handbook of Mathematical Functions. National Bureau of Standards.
  • Acklam, P. J. (2003). An algorithm for computing the inverse normal cumulative distribution function.
  • Press, W. H., Teukolsky, S. A., Vetterling, W. T. & Flannery, B. P. (2007). Numerical Recipes (3rd ed.). Cambridge University Press.
  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Lawrence Erlbaum.
  • Tukey, J. W. (1977). Exploratory Data Analysis. Addison-Wesley.
  • Delacre, M., Lakens, D. & Leys, C. (2017). Why psychologists should by default use Welch's t-test. International Review of Social Psychology, 30(1), 92–101.
  • Hyndman, R. J. & Fan, Y. (1996). Sample quantiles in statistical packages. The American Statistician, 50(4), 361–365.