본문 바로가기
빅데이터분석기사

[빅분기] 9.2. 범주형 자료 분석

by Point-Nemo 2025. 8. 26.

1. 범주형 자료 분석

a. 범주 -> 범주 : 카이제곱 검정, 분할표 분석

b. 범주 -> 연속 : T-검정, 분산분석

c. 연속 -> 범주 : 로지스틱 회귀분석 


2. 분할표 분석

1) 개요

- 여러 개의 범주형 변수를 기준으로 빈도를 표 형태로 나타낸 것

https://pmxsg.tistory.com/97

- 행은 설명변수, 열은 반응변수를 의미

 

2) 상대위험도

- 상대위험도란 관심 집단의 위험률/비교 집단의 위험률을 의미하며 위험률이란 특정 사건이 발생할 비율을 의미함

https://syj9700.tistory.com/54

- 상대위험도(RR) : 위험인자에 노출된 환자의 비율 / 위험인자에 노출되지 않은 환자의 비율 = (a/a+b) / (c/c+d)

 

3) 오즈비

- 오즈란 성공확률/실패확률로, 성공할 확률이 실패할 확률의 몇 배인지를 나타냄

- 오즈비란 오즈의 각 범주별 비율

구분 16강 성공 확률 16강 실패 확률
브라질 0.8 0.2
한국 0.1 0.9

- Odds(브라질) = 0.8/(1-0.8) = 4

- Odds(한국) = 0.1/(1-0.1) = 1/9

- Odds ratio = Odds(브라질) / Odds(한국) = 36

- 즉, 브라질의 16강 진출 확률이 한국의 16강 진출 확률보다 36배 높다고 해석가능


3. 교차분석

1) 카이제곱 검정

- 범주형 자료인 두 변수 간의 관계를 알아보기 위해 실시하는 분석

 

2) 교차표

https://sysiphe0.tistory.com/6

4. 적합성 검정

1) 적합성 검정

- 실험에서 얻어진 관측값들이 예상한 이론과 일치하는지 아닌지를 검정하는 방법

- 관측값들이 어떠한 이론적 분포를 따르고 있는지를 알아봄

 

2) 가설 설정

- n개의 표본 자료를 k개의 범주로 분류한 뒤, 각 범주의 관측도수(O)와 주어진 확률 분포에 대해 각 범주에 속하는 기대도수(E)들이 적합하는지의 여부를 검정

- 귀무가설: 실제 분포와 이론적 분포 간에는 차이가 없다 (두 분포가 일치한다)

- 대립가설: 실제 분포와 이론적 분포 간에는 차이가 있다

 

3) 검정통계량

- 카이제곱 값은 sigma (O-E)^2 / E로 나타남

요일 월 화 수  목 금 토 일
관측도수 O 50 65 80 74 85 90 56
기대도수 E 70 70 70 70 70 70 70
(O-E)^2 / E 5.71 0.36 1.43 0.23 3.21 5.71 2.80

- 카이제곱 통계량이 큰 경우, 관찰도수와 기대도수의 차이가 크며, 적합도가 낮다 즉, 예상 이론과 일치한다고 볼 수 없다

 

4) 자유도

- df = k-1 


5. 독립성 검정

1) 독립성 검정

- 모집단이 두 개의 변수 A,B에 의해 범주화되었을 때, 이 두 변수들 사이의 관계가 독립인지 아닌지를 검정하는 것

  가 (변수A) 나 (변수A) 다 (변수A) 합
TRUE (변수B) 30 20 50 100
FALSE (변수B) 50 70 60 180
합 80 90 110 280

- A는 가,나,다 B는 T/F를 가질 수 있다고 가정

- 변수 A가 '가'일 확률은 80/280, 변수 B가 'TRUE'일 확률은 100/280

- 만약 A와 B가 독립이라면 변수A가 '가'이면서 변수 B가 'TRUE'일 확률은 80/280 * 100/280

 

2) 가설 설정

- A,B가 서로 독립적으로 관측값에 영향을 미치는지 검정

- 귀무가설: 두 변수 사이에는 연관이 없다 (독립이다)

- 대립가설: 두 변수 사이에는 연관이 있다 (종속이다)

 

3) 검정통계량

 

4) 자유도

- df = (R-1) * (C-1)  

- R= 행의 수, C = 열의 수


6. 동질성 검정

1) 동질성 검정

- 모집단이 임의의 변수에 따라 R개의 속성으로 범주화되었을 때, R개의 부분 모집단에서 추출한 각 표본인 C개의 범주화된 집단의 분포가 서로 동일한지를 검정하는 것

- 독립성 검정 방법과 똑같이 진행

 

2) 가설 설정

- j = 1, 2 , ..., c이다

- 귀무가설: P_1j = P_2j = ... = Prj (모든 P_nj는 동일하다)

- 대립가설: Not H0 (P_nj 중 다른 값이 하나 이상 존재한다)

 

3) 검정통계량

 

4) 자유도

- df = (R-1) * (C-1)

- R= 행의 수, C = 열의 수