본문 바로가기
빅데이터분석기사

[빅분기] 6.2. 추론통계 (2)

by Point-Nemo 2025. 8. 23.

3. 최대 우도 추정법

- 최대 우도 측정법은 모수가 미지의 θ인 확률분포에서 뽑은 표본 x들을 바탕으로 θ를 추정하는 기법

- 우도란 이미 주어진 표본 x들에 비추어 봤을 때 모집단의 모수 θ에 대한 추정이 그럴듯한 정도

 

1) 우도 함수

- 확률분포 x에 대한 확률밀도함수 또는 확률질량함수를 p(x; θ)로 표기

- 확률밀도함수에서는 θ는 상수, x는 변수가 됨

- 모수 추정에선 반대로 θ는 변수, x가 상수가 됨

- 이렇게 확률밀도함수에서 모수 θ를 변수로 보는 경우에 이 함수를 우도 함수라고 하며 L(θ;x)로 표기

- 임의표본의 관측치 x1, ..., xn 들의 결합 확률분포함수로서 우도 함수는, 확률분포 (f(x)) 함수에서 나타난 각 확률들의 곱과 같음

- 각 표본들은 서로 독립이기에 각 사건 확률의 곱으로 표현이 가능한 것

- 앞에 배치된 값들을 이미 알고 있는 상수, 뒤에 배치된 값들을 변수로 생각하면 됨

- 즉, 우도 함수는 x가 이미 정해져 있는 상황에서 θ값의 상대적 확률을 나타내는 것

 

2) 로그 우도 함수

- 최대 우도 추정법을 통해 우도가 최대가 되는 θ를 계산하려면 수치적 최적화를 해야함

- 일반적으론 우도를 직접 사용하지 않고 로그 변환한 로그-우도 함수를 많이 이용 

- 이유는 결합 확률밀도 함수가 함수의 곱으로 되어있는 경우가 많기 때문에, 로그 변환시 덧셈 계산으로 바뀌어 단순해지기 때문

- 또한, log는 단조 증가함수이므로 우도 L(θ)를 최대화하는 θ는 logL(θ)에서도 최대가 되기 때문

 

3) 최대 우도 추정법

- 파라미터 θ = (θ1, ... θn)으로 구성된 어떤 확률밀도함수 p(x|θ)에서 관측된 표본 데이터 집합을 x = (x1, ..., xn)이라 할 때, 이 표본들에서 파라미터 θ = (θ1, ... , θn)을 추정하는 방법

우도 L(θ) 혹은 로그-우도 logL(θ)를 최대화하는 θ_hat = θ

L(θ)가 θ에 대해 1차 미분 가능하고 오목함수이면 d/dθ l(θ) =0의 해 θ_hat = θ는 모수 θ의 최대 우도 측정량

 

4) 분포별 최대 우도 추정법

a. 베르누이 분포

b. 기하 분포

c. 포아송 분포

d. 정규 분포

e. 지수 분포


4. 가설검정

1) 가설 설정

- 가설은 모수에 대하여 설정

 

2) 검정통계량

- 가설검정에서 관찰된 표본으로부터 구하는 통계량

- 검정통계량 T(X)의 값이 나타날 가능성이 크면 귀무가설 H0을 채택하고 나타날 가능성이 작으면 H0을 기각

 

3) 유의수준

- 귀무가설이 참일 때, H0을 기각하는 확률 (a = 0.05라면 귀무가설이 사실인데도 5% 확률로 기각할 수 있음) 직관적으론, 얼마나 극단적인 결과를 받아들일지 미리 정해놓은 기준선

 

4) 기각역

https://blog.naver.com/iotsensor/222183920706

- 검정통계량 T(X)의 분포에서 확률이 유의수준 a에 속하는 부분

- 검정통계량이 기각역 C에 속할 확률이 바로 유의수준

 

5) P값

- 귀무가설이 참이라는 가정 하에, 값이 극단적으로 나타날 확률 

- 관측된 검정통계량 값에 따라 귀무가설의 기각이 가능한 최소 유의수준 확률

- P-value가 유의수준보다 작으면 귀무가설을 기각

 

6) 대립가설 H1과 기각역 C

- 검정통계량의 분포에서 유의수준 a에 의해 기각역 C의 크기가 결정됨

 

7) 가설검정 단계

- 1: 귀무가설과 대립가설 설정

- 2: 검정통계량 T(X)를 구하고 분포를 구함

- 3: 유의수준 a를 결정하고 대립가설의 형태(양측/단측)에 따라 기각역을 설정

- 4: 귀무가설이 옳다는 전제하에서 표본관찰에 의한 검정통계량 T(X)의 값을 구함

- 5: T(X)의 값이 기각역 C에 속하는가를 판단하여 기각역에 속하면 귀무가설을 기각

 

8) 1종 오류와 2종 오류

a. 제 1종 오류

- 귀무가설 H0이 옳은데도 불구하고 H0을 기각하는 오류 (1종 오류가 나타날 확률은 유의수준 a와 같음)

 

b. 제 2종 오류

- 귀무가설 H0이 옳지 않은데도 H0을 채택하는 오류 (2종 오류가 나타날 확률은 b로 표현)


5. 통계분석 방법론

https://nexus21.tistory.com/260

- 모집단의 모수에 대해 추정을 한 후에는 모집단에 대해 어떤 가설을 설정한 후 그 가설의 타당성 여부를 검정함

 

1) 단일 모수의 검정

a. 모평균 µ의 검정(t-검정)

 

● 일표본 t-검정

- 단일모집단에서 관심이 있는 연속형 변수의 평균값을 특정 기준값과 비교하고자 할 때 사용

- 예를 들어, A 과수원에서 생산되는 사과의 평균 무게가 200g이라고 알려져 있을 때 실제로 그럴지 알아보는 것

 

● 일표본 t-검정의 가정

- 모집단의 구성요소들이 정규분포를 이룸 (표본이 30개 이상이면 정규분포를 따른다고 가정)

- 종속변수는 연속형 변수여야 하며, 검증하고자 하는 기준값이 있어야 함

 

● 일표본 t-검정의 단계

- 1단계: 가설 설정

모수: 모평균(µ)

귀무가설: 모평균(µ)의 값은 설정한 기준값인 µ0이다

대립가설: 모평균(µ)의 값은 µ0이 아니다 / 크다 / 작다

 

- 2단계: 유의수준 설정

- 3단계: 검정통계량의 값 및 유의확률 계산

- 4단계: 귀무가설의 기각여부 판단 및 의사결정 

https://m.blog.naver.com/sendmethere/221333164258

 

2) 대응표본 t-검정

a. 대응표본 t-검정이란?

- 단일 모집단에 대해 두 번의 처리를 가했을 때, 두 개의 처리에 따른 평균의 차이를 비교하고자 할 때 사용

- 하나의 모집단에서 크기가 n개인 하나의 표본을 추출한 후, 표본 내의 개체들에 대해 두 번의 측정 실행

- 모집단과 표본은 하나지만, 모수는 두 개

 

b. 대응표본 t-검정의 가정

- 모집단의 관측값이 정규성을 만족해야함

- 종속변수는 연속형 변수이어야 함

 

c. 대응표본 t-검정의 단계

- 1단계: 가설 설정

● 모수: 두 개의 모평균 사이의 차이 (D)

● 귀무가설: 두 개의 모평균 간에는 차이가 없다

● 대립가설: 두 개의 모평균 간에는 차이가 있다 / 0보다 크다 / 0보다 작다

 

- 2단계: 유의수준 설정

- 3단계: 검정통계량의 값 및 유의 확률 계산 (위 그림에서 X_bar,를 D_bar, µ를 D0으로 변경) (D0은 귀무가설에서 설정한 차이값)

- 4단계: 귀무가설의 기각여부 판단 및 의사결정

 

3) 독립표본 t-검정 (두 모수의 동일성 검정)

a. 독립표본 t-검정이란?

- 두 개의 독립된 모집단의 평균을 비교하고자 할 때 사용하는 검정 방법

- ex) 성별에 따른 출근 준비 시간에 차이가 있는지

- 모집단, 모수, 표본이 모두 두 개씩 존재

 

b. 독립표본 t-검정의 가정

- 두 모집단은 정규성을 만족해야함

- 두 모집단은 서로 독립적이어야 함

- 두 모집단의 분산이 서로 같다는 등분산성 가정을 확인해야함 (여부에 따라 서로 다른 계산 방법 사용)

 

c. 독립표본 t-검정의 단계

- 1단계: 가설 설정

● 모수: 서로 독립된 두 모집단의 평균 (µ1, µ2)

● 귀무가설: 두 개의 모평균에는 차이가 없다 

● 대립가설: 두 개의 모평균에는 차이가 있다 / µ1 > µ2 / µ1 < µ2

 

- 2단계: 유의수준 설정

- 3단계: 등분산 검정

● 귀무가설: 두 집단의 분산이 동일하다

● 대립가설: 두 집단의 분산이 동일하지 않다 

 

- 4단계: 검정통계량의 값 및 유의확률 계산 

- µ0 = 귀무가설에서 설정한 모평균 간의 차이 (여기서는 0)

 

- 5단계: 귀무가설의 기각여부 판단 및 의사결정

'빅데이터분석기사' 카테고리의 다른 글

[빅분기] 8.1. 분석 모형 구축  (5) 2025.08.25
[빅분기] 7.1. 분산분석  (0) 2025.08.23
[빅분기] 6.2. 추론통계  (6) 2025.08.23
[빅분기] 6.1. 기술통계 (2)  (4) 2025.08.22