3. 최대 우도 추정법
- 최대 우도 측정법은 모수가 미지의 θ인 확률분포에서 뽑은 표본 x들을 바탕으로 θ를 추정하는 기법
- 우도란 이미 주어진 표본 x들에 비추어 봤을 때 모집단의 모수 θ에 대한 추정이 그럴듯한 정도
1) 우도 함수
- 확률분포 x에 대한 확률밀도함수 또는 확률질량함수를 p(x; θ)로 표기
- 확률밀도함수에서는 θ는 상수, x는 변수가 됨
- 모수 추정에선 반대로 θ는 변수, x가 상수가 됨
- 이렇게 확률밀도함수에서 모수 θ를 변수로 보는 경우에 이 함수를 우도 함수라고 하며 L(θ;x)로 표기

- 임의표본의 관측치 x1, ..., xn 들의 결합 확률분포함수로서 우도 함수는, 확률분포 (f(x)) 함수에서 나타난 각 확률들의 곱과 같음
- 각 표본들은 서로 독립이기에 각 사건 확률의 곱으로 표현이 가능한 것
- 앞에 배치된 값들을 이미 알고 있는 상수, 뒤에 배치된 값들을 변수로 생각하면 됨
- 즉, 우도 함수는 x가 이미 정해져 있는 상황에서 θ값의 상대적 확률을 나타내는 것
2) 로그 우도 함수


- 최대 우도 추정법을 통해 우도가 최대가 되는 θ를 계산하려면 수치적 최적화를 해야함
- 일반적으론 우도를 직접 사용하지 않고 로그 변환한 로그-우도 함수를 많이 이용
- 이유는 결합 확률밀도 함수가 함수의 곱으로 되어있는 경우가 많기 때문에, 로그 변환시 덧셈 계산으로 바뀌어 단순해지기 때문
- 또한, log는 단조 증가함수이므로 우도 L(θ)를 최대화하는 θ는 logL(θ)에서도 최대가 되기 때문
3) 최대 우도 추정법
- 파라미터 θ = (θ1, ... θn)으로 구성된 어떤 확률밀도함수 p(x|θ)에서 관측된 표본 데이터 집합을 x = (x1, ..., xn)이라 할 때, 이 표본들에서 파라미터 θ = (θ1, ... , θn)을 추정하는 방법
| 우도 L(θ) 혹은 로그-우도 logL(θ)를 최대화하는 θ_hat = θ |


| L(θ)가 θ에 대해 1차 미분 가능하고 오목함수이면 d/dθ l(θ) =0의 해 θ_hat = θ는 모수 θ의 최대 우도 측정량 |
4) 분포별 최대 우도 추정법
a. 베르누이 분포
b. 기하 분포
c. 포아송 분포
d. 정규 분포
e. 지수 분포
4. 가설검정
1) 가설 설정
- 가설은 모수에 대하여 설정
2) 검정통계량
- 가설검정에서 관찰된 표본으로부터 구하는 통계량
- 검정통계량 T(X)의 값이 나타날 가능성이 크면 귀무가설 H0을 채택하고 나타날 가능성이 작으면 H0을 기각
3) 유의수준
- 귀무가설이 참일 때, H0을 기각하는 확률 (a = 0.05라면 귀무가설이 사실인데도 5% 확률로 기각할 수 있음) 직관적으론, 얼마나 극단적인 결과를 받아들일지 미리 정해놓은 기준선
4) 기각역

- 검정통계량 T(X)의 분포에서 확률이 유의수준 a에 속하는 부분
- 검정통계량이 기각역 C에 속할 확률이 바로 유의수준
5) P값
- 귀무가설이 참이라는 가정 하에, 값이 극단적으로 나타날 확률
- 관측된 검정통계량 값에 따라 귀무가설의 기각이 가능한 최소 유의수준 확률
- P-value가 유의수준보다 작으면 귀무가설을 기각
6) 대립가설 H1과 기각역 C
- 검정통계량의 분포에서 유의수준 a에 의해 기각역 C의 크기가 결정됨
7) 가설검정 단계
- 1: 귀무가설과 대립가설 설정
- 2: 검정통계량 T(X)를 구하고 분포를 구함
- 3: 유의수준 a를 결정하고 대립가설의 형태(양측/단측)에 따라 기각역을 설정
- 4: 귀무가설이 옳다는 전제하에서 표본관찰에 의한 검정통계량 T(X)의 값을 구함
- 5: T(X)의 값이 기각역 C에 속하는가를 판단하여 기각역에 속하면 귀무가설을 기각
8) 1종 오류와 2종 오류
a. 제 1종 오류
- 귀무가설 H0이 옳은데도 불구하고 H0을 기각하는 오류 (1종 오류가 나타날 확률은 유의수준 a와 같음)
b. 제 2종 오류
- 귀무가설 H0이 옳지 않은데도 H0을 채택하는 오류 (2종 오류가 나타날 확률은 b로 표현)
5. 통계분석 방법론

- 모집단의 모수에 대해 추정을 한 후에는 모집단에 대해 어떤 가설을 설정한 후 그 가설의 타당성 여부를 검정함
1) 단일 모수의 검정
a. 모평균 µ의 검정(t-검정)
● 일표본 t-검정
- 단일모집단에서 관심이 있는 연속형 변수의 평균값을 특정 기준값과 비교하고자 할 때 사용
- 예를 들어, A 과수원에서 생산되는 사과의 평균 무게가 200g이라고 알려져 있을 때 실제로 그럴지 알아보는 것
● 일표본 t-검정의 가정
- 모집단의 구성요소들이 정규분포를 이룸 (표본이 30개 이상이면 정규분포를 따른다고 가정)
- 종속변수는 연속형 변수여야 하며, 검증하고자 하는 기준값이 있어야 함
● 일표본 t-검정의 단계
- 1단계: 가설 설정
모수: 모평균(µ)
귀무가설: 모평균(µ)의 값은 설정한 기준값인 µ0이다
대립가설: 모평균(µ)의 값은 µ0이 아니다 / 크다 / 작다
- 2단계: 유의수준 설정
- 3단계: 검정통계량의 값 및 유의확률 계산
- 4단계: 귀무가설의 기각여부 판단 및 의사결정

2) 대응표본 t-검정
a. 대응표본 t-검정이란?
- 단일 모집단에 대해 두 번의 처리를 가했을 때, 두 개의 처리에 따른 평균의 차이를 비교하고자 할 때 사용
- 하나의 모집단에서 크기가 n개인 하나의 표본을 추출한 후, 표본 내의 개체들에 대해 두 번의 측정 실행
- 모집단과 표본은 하나지만, 모수는 두 개
b. 대응표본 t-검정의 가정
- 모집단의 관측값이 정규성을 만족해야함
- 종속변수는 연속형 변수이어야 함
c. 대응표본 t-검정의 단계
- 1단계: 가설 설정
● 모수: 두 개의 모평균 사이의 차이 (D)
● 귀무가설: 두 개의 모평균 간에는 차이가 없다
● 대립가설: 두 개의 모평균 간에는 차이가 있다 / 0보다 크다 / 0보다 작다
- 2단계: 유의수준 설정
- 3단계: 검정통계량의 값 및 유의 확률 계산 (위 그림에서 X_bar,를 D_bar, µ를 D0으로 변경) (D0은 귀무가설에서 설정한 차이값)
- 4단계: 귀무가설의 기각여부 판단 및 의사결정
3) 독립표본 t-검정 (두 모수의 동일성 검정)
a. 독립표본 t-검정이란?
- 두 개의 독립된 모집단의 평균을 비교하고자 할 때 사용하는 검정 방법
- ex) 성별에 따른 출근 준비 시간에 차이가 있는지
- 모집단, 모수, 표본이 모두 두 개씩 존재
b. 독립표본 t-검정의 가정
- 두 모집단은 정규성을 만족해야함
- 두 모집단은 서로 독립적이어야 함
- 두 모집단의 분산이 서로 같다는 등분산성 가정을 확인해야함 (여부에 따라 서로 다른 계산 방법 사용)
c. 독립표본 t-검정의 단계
- 1단계: 가설 설정
● 모수: 서로 독립된 두 모집단의 평균 (µ1, µ2)
● 귀무가설: 두 개의 모평균에는 차이가 없다
● 대립가설: 두 개의 모평균에는 차이가 있다 / µ1 > µ2 / µ1 < µ2
- 2단계: 유의수준 설정
- 3단계: 등분산 검정
● 귀무가설: 두 집단의 분산이 동일하다
● 대립가설: 두 집단의 분산이 동일하지 않다
- 4단계: 검정통계량의 값 및 유의확률 계산

- µ0 = 귀무가설에서 설정한 모평균 간의 차이 (여기서는 0)
- 5단계: 귀무가설의 기각여부 판단 및 의사결정
'빅데이터분석기사' 카테고리의 다른 글
| [빅분기] 8.1. 분석 모형 구축 (5) | 2025.08.25 |
|---|---|
| [빅분기] 7.1. 분산분석 (0) | 2025.08.23 |
| [빅분기] 6.2. 추론통계 (6) | 2025.08.23 |
| [빅분기] 6.1. 기술통계 (2) (4) | 2025.08.22 |