본문 바로가기
빅데이터분석기사

[빅분기] 6.1. 기술통계 (2)

by Point-Nemo 2025. 8. 22.

3) 확률분포 - 연속형 확률분포

a. 균일분포 (Uniform Distribution)

https://m.blog.naver.com/mykepzzang/220841578412

- 확률변수가 정의되는 구간에서 확률밀도함수의 갑싱 모두 동일하게 정의되는 분포 

- E(X) = (a+b)/2 

- V(X) = (b-a)^2 /2

- a = 0, b=1인 경우엔 표준 균일분포라고 부름

- f(x) = 1/(b-a), 구간 내 특정 x 지점의 확률은 x/(b-a)

 

b. 정규분포

- 평균이 µ이고 표준편차가 σ인 x의 확률밀도함수

- 평균이 0이고 분산이 1인 정규분포를 표준 정규분포라고 함

 

c. 감마분포

- 먼저, 지수분포는 어떤 사건이 발생할 때까지 경과시간에 대한 연속확률분포로, 지속시간과 관련된 현상을 나타냄

- 감마분포는 지수분포를 일반화한 분포로 두 개 이상의 지수 분포가 합쳐져 어떤 사건이 k번 발생할 때까지(발생률이 λ 인) 경과시간에 대한 분포

 

- E(X) = a/ λ  , V(X) = a^2/ λ 

 

d. t- 분포

● t- 분포의 개념과 특징

- 표준정규분포와 같이 평균 0을 중심으로 좌우가 동일한 분포

- 신뢰구간과 가설검정에서 사용되는 분포

- 표본의 크기가 작을 때, 표준정규분포를 눌러 놓은 것과 같은 형태지만, 표본의 크기가 늘어나면 표준정규분포와 거의 같아짐

- 모표준편차를 모르며, 표본의 크기가 30보다 작고, 집단 간 평균을 비교하고자 할 때 t- 분포 사용

 

● t-분포표

https://www.genspark.ai/spark/t%EB%B6%84%ED%8F%AC%EB%A5%BC-%EC%9D%B4%EC%9A%A9%ED%95%9C-%ED%8F%89%EA%B7%A0%EC%B0%A8%EC%9D%B4-%EA%B2%80%EC%A0%95-%EC%9D%B4%ED%95%B4%ED%95%98%EA%B8%B0/d4be19b2-e94a-4ec5-8acc-ab42b355f62b

- 확률 a와 표본의 개수가 주어졌을 때 이를 바탕으로 그래프의 t값을 예측할 수 있음

- 표본이 10개고, a=0.05라면, 우선 자유도는 9, a=0.05인 지점을 찾는다. 해당 t값은 1.833

- 만약 왼쪽, 음수 t값을 찾으려면 그래프가 좌우 대칭이기에 마이너스만 붙힘

 

e. 카이 제곱 분포

http://www.ktword.co.kr/test/view/view.php?m_temp1=2365

● 분포의 개념과 특징

- 모평균과 모분산이 알려지지 않은 모집단의 모분산에 대한 가설 검정에 사용

- 두 집단 간의 동질성 검정에 사용 (범주형)

- 분산의 특징을 나타낸 분포로, 그래프 상에서 양의 값만 존재하고 오른쪽 꼬리가 긴 비대칭 형태를 가짐

- 자유도가 클수록 대칭에 가까워짐

- t- 분포표와 비슷하게 x축인 a는 확률, y축은 자유도를 포함

- 하지만, 대칭이 아니기 때문에 왼쪽 값을 구할 땐 1-a로 구함

 

- ex) 양쪽을 다 구할 때 

자유도가 7이고 a = 0.1일 때 양쪽 카이제곱 값은?

오른쪽은 0.05(a/2)이고, 왼쪽은 0.95(1-a/2)가 됨

 

f. F-분포

https://yerimoh.github.io/R16/

● 분포의 개념과 특징

- 두 집단간 분산의 동일성 검정에 사용

- 비대칭이며, 카이제곱 분포와 달리 자유도를 2개 가지고 있으며 자유도가 커질수록 정규분포에 가까워짐

- 분포표의 x축은 분자의 자유도(n1-1), y축은 분모의 자유도(n2-1)를 다룸

- 보통 분산이 더 큰 집단을 분자에 둠

 

- ex) 집단 1의 표본 분산은 20이고 n=9, 집단 2의 표본 분산은 30이고 n=6, 이때, a = 0.1에 해당하는 F값은?

n1-1 = 5, n2-1 = 8

즉, x가 5, y가 8인 지점을 찾는다

 

- 만약, 왼쪽 값을 찾고 싶다면 분모와 분자의 위치를 바꾼 후, f 값에 역수를 취한다. 

- 양측 값을 구할 땐 a를 2로 나누어 찾는다 (이때도 왼쪽 값은 역수로 구한다)


3. 표본분포

1) 확률표본

- 확률 변수 X가 특정 확률 분포를 따른다고 할 때, 이 확률분포로부터 각각 독립적으로 관측된 n개의 표본을 확률표본이라 함

- 이 표본을 X1, X2, ...., Xn이라 할 때 이들은 확률변수로 상호독립이며, 각각은 X와 동일한 분포를 가짐

- 확률표본의 각 원소는 확률변수이기에 확률표본으로부터 구한 통계량 역시 확률변수가 됨 

- 이런 통계량 중 모수를 추정하는 통계량을 추정량이라 하며, 구체적인 표본에 근거해 구한 추정량의 값을 추정치라 함

 

2) 표본분포

- 한 모집단에서 같은 크기로 뽑을 수 있는 모든 표본에서 통계량을 계산할 때 통계량이 이루는 확률분포

- 선택된 표본이 포함하고 있는 오차의 정도를 측정할 수 있게 해줌

'빅데이터분석기사' 카테고리의 다른 글

[빅분기] 6.2. 추론통계 (2)  (7) 2025.08.23
[빅분기] 6.2. 추론통계  (6) 2025.08.23
[빅분기] 6.1. 기술통계 (1)  (4) 2025.08.21
[빅분기] 5.2. 고급 데이터 탐색  (1) 2025.08.21