1. 데이터 탐색 개요
1) 탐색적 데이터 분석(EDA)
- 다양한 차원과 값을 조합해가며 특이한 점이나 의미 있는 사실을 도출하고 분석의 최종 목적을 달성해가는 과정
- 도표, 그래프, 통계 요약 등
- 이상치나 결측치를 찾기 위해서도 필요
| 탐색적 자료분석(EDA) | 확증적 자료분석(CDA) | |
| 조사 종류 | 탐색조사 | 전략조사 |
| 목적 | 통찰을 얻어 방향 설정 | 마케팅 행동안에 평가로 채택 여부 결정 |
| 사용되는 통계 | 기술통계 | 가설 검정에 사용되는 추론 통계 |
| 결과물 | 평균, 퍼센트, 분포도에 의한 요약 표상관계수에 의한 변수간 연관성 파악 그래프에 의한 자료의 시각화 |
통계검정에서 얻은 유의확률과 신뢰구간 |
2) EDA의 4가지 주제
a. 저항성의 강조
- 데이터의 일부가 파손되었을 때 영향을 적게 받는 성질
- 저항성 강조는 데이터의 이상치, 결측치, 입력 오류에 영향을 받지 않는 도구를 사용한다는 뜻
- 중앙값은 이상치의 영향을 받지 않음
b. 잔차의 해석
- 잔차는 각 개별 관측값이 주요 경향으로부터 얼마나 벗어나 있는지를 알려주는 지표
- 데이터의 경향 파악 가능
c. 데이터의 재표현
- 데이터 분석을 단순화하여 해석하는데 도움이 되도록 원자료의 척도를 적당히 변환하는 것
- 로그 변환, 제곱근 변환 등
d. 데이터의 현시성
- 데이터 안에 숨어있는 정보를 효율적으로 보여주기 위해 시각화하는 것
2. 기초통계량 추출 및 이해
1) 기초통계량의 필요성
- 정리되지 않은 대량의 데이터 자체는 별 가치가 없음
- 기술통계는 데이터를 의미있는 정보로 체계화하고, 요약하고, 표현하는 방법
2) 기초통계량의 이해
- 중심경향도 / 산포도 / 비대칭도 등의 세가지 특성을 나타내는 기술통계량
a. 중심 경향도
- 평균
- 중앙값
- 최빈값 : 양적/질적 자료에 상관없이 모두 이용 가능
- 세 통계량의 위치를 통해 자료의 분포 모양을 대략적으로 파악 가능
b. 산포도
- 데이터의 흩어진 정도에 대해서 파악
- 범위: 관측치 중 가장 큰 값과 가장 작은 값의 차이 (정확한 정보는 제공x, 오류 찾는 데엔 도움 O)
- 분산: 자료가 퍼져있는 정도
- 표준편차: 분산의 제곱근
- 사분범위(IQR): Q3-Q1으로, 자료 중간 50%를 의미, 사분범위보다 분포가 짧으면 밀집된 분포라고 생각 가능
- 평균의 표준오차: 모평균과 표본 평균의 차이를 나타내는 통계량, 작을수록 좋음 , 표본평균 X_bar가 모평균 u의 추정치로서 어느 정도 확실한가를 나타냄
- 변동계수: 변수의 표준편차를 산술평균으로 나눈 값으로, 측정 단위가 서로 다른 자료를 비교하고자할 때 쓰임. 단위가 달라도 퍼진 정도를 파악 가능
c. 자료 분포의 비대칭도
- 중심경향도와 산포도로 관측된 자료의 중심과 분산은 설명할 수 있지만, 치우쳐진 정도는 파악 불가능
- 이러한 자료 분포의 형태를 설명해주는 통계량이 '왜도'와 '첨도'
- 정규분포를 기준으로 설명, 정규분포는 왜도와 첨도가 0
- 왜도(skewness): 분포가 비대칭 정도와, 비대칭의 방향을 보여주는 통계량. 오른쪽으로 긴 꼬리를 가지면 왜도가 0보다 큼
- 첨도(kurtosis): 분포의 중심에서 뾰족한 정도와 꼬리 부분의 길이에 대한 정보. 첨도가 0보다 크면 정규분포보다 더 뾰족하고 긴 꼬리를 가짐
3. 시각적 데이터 탐색
1) 막대그래프와 원그래프
- 관측치의 도수를 표현하는 데 사용
- 각 계급의 비교시 사용
2) 도수분포표와 히스토그램
- 자료의 분포까지 파악 가능
- 중심 경향도, 산포도, 비대칭도
3) 줄기-잎 그림
- 히스토그램과 유사하지만, 관측치의 정확한 정보까지 얻을 수 있고, 쉽게 파악 가능
4) 상자그림
- 사분 범위 Q1, Q2, Q3를 사용해 자료의 특성을 나타냄
- 최솟값과 Q1 사이의 폭이 최대값과 Q3 사이의 폭보다 넓다면, 높은 쪽에 자료가 많이 분포되어있다는 것
5) 도수다각형

- 연속형 자료를 일정 크기의 계급으로 묶었을 때 각 계급의 중간점에서 해당 도수를 표시한 후 그 점들을 직선으로 연결한 그래프
- 분포의 모양을 보여주는 꺾은선 그래프
6) 선그래프
- 연속형 변수에 해당하는 X축의 변화에 따른 Y축의 변화를 선으로 나타내는 그래프
- x축이 시간이라면 시계열 그래프가 됨
7) 산점도
- 두 변수 사이의 관계를 시각화하는 방법
- 상관관계와 분포, 이상치 등을 시각적으로 파악 가능
4. 상관관계 분석
1) 상관분석의 필요성
- 각각의 데이터/정보 속에서 특정한 관계를 발견해 인사이트를 획득
- 변수 간 선형 관계 정도를 분석하는 것
2) 공분산 분석
- 두 변수 사이의 연관성을 분석할 땐 분포를 동시에 고려해야함
- 이때 두 변수의 공통된 분포를 나타내는 분산을 공분산이라고 하며 두 변수 사이의 선형관게를 측정하는 대표적 모수
- 동시에 두 개의 변수값을 갖는 개별 관측치들이 각 변수의 평균으로부터 어느 정도 떨어져 있는가를 나타냄
- 양수면 두 변수는 같은 방향으로 움직이고, 음수면 다른 방향으로 움직임, 0이면 서로 독립
- 측정 단위에 따라 차이가 심하기 때문에, 이 측정단위를 표준화한 것이 바로 피어슨 상관계수가 됨
3) 상관계수 분석
a. 피어슨 상관계수
- 두 변수가 얼마나 밀접한 관련성을 갖고 변화하는지를 파악
- 연속형 변수
- 0.3이상이면 약한 관계, 0.5 이상이면 중간 관계, 0.7 이상이면 강한 관계
- 정규성이 가정되어야함
b. 스피어만 상관계수
- 서열척도 변수 간의 상관관계를 표현
4) 상관계수의 유의성 검정
- 상관분석을 통해 얻은 상관계수를 일반화하여 사용하려면 통계적 유의성을 검정해야함
a. 가설 설정

- 피어슨 상관계수의 유의성 검정은 표본으로부터 얻은 상관계수가 통계적으로 유의한가를 판단해야함
- 이를 위해 모상관계수 p에 대한 귀무가설(H0)과 대립가설(H1)을 설정함
- H0: p=0, 두 변수 간에는 선형관계가 존재하지 않는다
- H1: p!=0, 두 변수 간에는 선형관계가 존재한다
b. 검정통계량
- 가설 검정에 t 통계량을 사용하며, 이때 검정통계량은 자유도가 n-2인 t 분포를 따름
c. 유의성 검정
- t 검정으로 통계적 유의성을 검정함
'빅데이터분석기사' 카테고리의 다른 글
| [빅분기] 6.1. 기술통계 (1) (4) | 2025.08.21 |
|---|---|
| [빅분기] 5.2. 고급 데이터 탐색 (1) | 2025.08.21 |
| [빅분기] 4.2. 분석 변수 처리 (9) | 2025.08.20 |
| [빅분기] 4.1. 데이터 전처리 (3) | 2025.08.17 |