본문 바로가기
빅데이터분석기사

[빅분기] 9.6. 비모수 통계

by Point-Nemo 2025. 8. 27.

1. 개요

1) 모수적 방법

- 검정하고자 하는 모집단의 분포에 대한 가정을 하고, 그 가정 하에서 검정통계량과 검정통계량의 분포를 유도해 검정을 실시

 

2) 비모수적 방법

- 자료가 추출된 모집단의 분포에 대한 아무 제약을 가하지 않고 검정을 실시

- 관측된 자료가 특정 분포를 따른다고 가정할 수 없는 경우에 이용

- 관측된 자료의 수가 많지 않거나, 자료가 개체간의 서열관계를 나타내는 경우에 이용

 

3) 모수적 검정과 비모수 검정의 차이

  모수적 검정 비모수 검정
가설 설정 가정된 분포의 모수에 대해 가설을 설정 가정된 분포가 없으므로 가설은 단지 분포의 형태가 동일 하다 / 분포의 형태가 동일하지 않다와 같이 분포의 형태에 대해 설정
검정 방법 관측된 자료를 이용해 구한 표본평균, 표본분산 이용 관측값의 절대적인 크기에 의존하지 않는 관측값들의 순위나 두 관측 값 차이의 부호 등을 이용

 


2. Kolmogorov-Smirnov 검정 (단일 표본)

1) 개념

- 관측치들이 정규분포, 포아송분포 등과 같은 특정한 분포를 따르는지에 대해 검정하는 방법

- 정규성을 가정하는 통계 기법 이전에 사용하기 유용

 

2) 조건

- 데이터는 순위자료 이상이어야 하며, 연속적 분포를 가정할 수 있어야 함

 

3) 가설

- 귀무가설: 주어진 자료의 분포는 00분포를 따른다

- 대립가설: 주어진 자료의 분포는 00분포를 따르지 않는다

- 검정통계량이 작을수록 귀무가설을 기각 X


3. 일표본 비모수 검정

1) 부호검정

- 일표본 t-검정에서 정규성을 만족하지 못할 경우 사용되며, 평균이 아닌 위치모수에 대한 검정 방법 

- 관측값과 설정한 기준값(θ)의 차이(Xi - θ0)를 통해 부호를 계산한 후 이를 바탕으로 검정통계량 값을 계산

- 표본의 크기 n이 큰 경우 이항분포를 따르며 정규근사에 표본화된 통계량을 통해 검정 가능

 

2) 윌콕슨의 부호 순위 검정

- 윌콕슨의 부호 순위 검정은 부호뿐만 아니라 상대적 크기도 고려함

- 모집단의 중앙값을 중심으로 대칭인 연속분포에서 표본이 추출되었다고 가정

- 차이 값인 Z를 계산한 후, 절대값을 씌워 해당 |Z|의 순위를 바탕으로 검정통계량 값을 계산

 

3) 일표본 비모수 검정 요약

검정단계 일표본 부호검정 일표본 윌콕슨 부호 순위 검정
1단계: 가설설정 - 모수: 모중위수 (θ)
- 귀무가설: 모중위수의 값은 θ0 (설정한 기준값)
- 대립가설: 모중위수의 값은 θ0이 아님 / 큼 / 작음
2단계: 유의수준 설정 - 유의 수준을 설정
3단계: 검정통계량의 값 및 유의확률 계산    
4단계: 귀무가설의 기각여부 판단  

 


4. 이표본 비모수 검정

1) 윌콕슨의 부호 순위 검정 - 대응표본

- 대응표본 t-검정에서 표본의 크기 n이 작고 정규성을 만족하지 못하는 경우에 사용

- 두 표본의 차이의 절대값의 순위를 계산

 

2) 윌콕슨 순위합 검정

- 독립표본 t-검정에서 크기 n이 작고 정규성을 만족하지 못할 경우 사용

- 두 모집단의 중심위치 차이에 대한 검정

- 두 모집단으로부터 서로 독립인 랜덤 표본을 통해 두 모집단의 분포는 동일하고, △만큼 위치 변화가 있다는 가정

- 두 표본을 혼합한 후 순서대로 나열한 다음, 표본 Y들의 순위를 계산하여 통계량 계산

 

3) 만-휘트니 U 검정

- 윌콕슨의 순위합 검정과 동일한 가설을 진행

- 최소한의 연속적 서열 변인을 가정하여 두 표본을 혼합한 후 순서대로 나열한 집단별로 그 순위의 합을 계산하여 두 집단의 순위합 크기의 차이를 검정

 

- 위의 세 검정의 모수는 두 개의 모중위수 사이의 차이 △ = θx - θy


5. 크루스칼-왈리스 H 검정

1) 설명

- 크루스칼-왈리스 검정은 만-휘트니 U 검정을 확장한 것으로 세 집단 이상의 분포가 동일한 지를 검정

- 일원배치 분산분석에서 표본의 크기가 작고 정규성을 만족하지 못할 경우 사용 (등분산 여부와 상관 X)

 

2) 비모수 검정

a. 모집단 1개: 부호검정/부호순위검정 (<-> 단일표본 t검정)

b. 모집단 2개: 순위합검정/맨휘트니U검정 (<-> 독립표본 t검정)

c. 모집단 전후: 부호순위검정 (<-> 대응표본 t검정)

d. 모집단 3개 이상: 크루스칼왈리스H검정 (<-> ANOVA)


6. 런 검정

1) 개념

- 일련의 연속적인 관측값들이 임의적으로 나타난 것인지를 검정하는 방법 (우연성 검정)

- 런은 한 종류의 부호 또는 한 집단이 시작하여 끝날 때까지의 한 덩어리를 의미 즉, 동일한 부호나 집단의 관측값이 연속적으로 이어진 것

- a a a b b a b b b a가 있을 경우 aaa/bb/a/bbb/a의 5개의 런이 만들어질 수 있음

 

- 시계열에선 양의 계열상관이 있으면 이전 시전의 값이 이후에도 지속되는 경향을 보이고, 음의 계열상관이 있으면 이전의 값과 반대되는 값이 나오는 경향을 보임

- 런, 즉 연속적으로 관측된 품질 특성 통계량이 특정한 경향이나 규칙을 갖고있는지 조사하여 관리도 검정을 할 수 있음

- 런이 중앙성은 기준으로 얼마나 빈번하게 교차하는가를 볼 때, 교차가 매우 적게 일어나거나 너무 많이 일어나면 표본의 독립성이 보장된다고 볼 수 없음

- 표본이 독립이라는 귀무가설이 참이라면 런의 수 R은 근사적으로 정규분포를 따름

 

2) 가설

- 귀무가설: 일련의 관측치는 랜덤이다 (표본은 독립이다)

- 대립가설: 일련의 관측치는 랜덤이 아니다 (표본은 독립적이지 않다)

'빅데이터분석기사' 카테고리의 다른 글

[빅분기] 10.2. 연관분석  (2) 2025.08.28
[빅분기] 10.1. 분류분석  (7) 2025.08.28
[빅분기] 9.5. 시계열 분석  (3) 2025.08.26
[빅분기] 9.4. 다변량 분석  (3) 2025.08.26