본문 바로가기
빅데이터분석기사

[빅분기] 5.1. 데이터 탐색

by Point-Nemo 2025. 8. 21.

1. 데이터 탐색 개요

1) 탐색적 데이터 분석(EDA)

- 다양한 차원과 값을 조합해가며 특이한 점이나 의미 있는 사실을 도출하고 분석의 최종 목적을 달성해가는 과정

- 도표, 그래프, 통계 요약 등

- 이상치나 결측치를 찾기 위해서도 필요

  탐색적 자료분석(EDA) 확증적 자료분석(CDA)
조사 종류 탐색조사 전략조사
목적 통찰을 얻어 방향 설정 마케팅 행동안에 평가로 채택 여부 결정
사용되는 통계 기술통계 가설 검정에 사용되는 추론 통계
결과물 평균, 퍼센트, 분포도에 의한 요약
표상관계수에 의한 변수간 연관성 파악
그래프에 의한 자료의 시각화
통계검정에서 얻은 유의확률과 신뢰구간

 

2) EDA의 4가지 주제

a. 저항성의 강조

- 데이터의 일부가 파손되었을 때 영향을 적게 받는 성질

- 저항성 강조는 데이터의 이상치, 결측치, 입력 오류에 영향을 받지 않는 도구를 사용한다는 뜻

- 중앙값은 이상치의 영향을 받지 않음

 

b. 잔차의 해석

- 잔차는 각 개별 관측값이 주요 경향으로부터 얼마나 벗어나 있는지를 알려주는 지표

- 데이터의 경향 파악 가능

 

c. 데이터의 재표현

- 데이터 분석을 단순화하여 해석하는데 도움이 되도록 원자료의 척도를 적당히 변환하는 것

- 로그 변환, 제곱근 변환 등

 

d. 데이터의 현시성

- 데이터 안에 숨어있는 정보를 효율적으로 보여주기 위해 시각화하는 것


2. 기초통계량 추출 및 이해

1) 기초통계량의 필요성

- 정리되지 않은 대량의 데이터 자체는 별 가치가 없음

- 기술통계는 데이터를 의미있는 정보로 체계화하고, 요약하고, 표현하는 방법

 

2) 기초통계량의 이해

- 중심경향도 / 산포도 / 비대칭도 등의 세가지 특성을 나타내는 기술통계량

 

a. 중심 경향도

- 평균

- 중앙값

- 최빈값 : 양적/질적 자료에 상관없이 모두 이용 가능

- 세 통계량의 위치를 통해 자료의 분포 모양을 대략적으로 파악 가능

 

b. 산포도

- 데이터의 흩어진 정도에 대해서 파악

 

- 범위: 관측치 중 가장 큰 값과 가장 작은 값의 차이 (정확한 정보는 제공x, 오류 찾는 데엔 도움 O)

- 분산: 자료가 퍼져있는 정도

- 표준편차: 분산의 제곱근

- 사분범위(IQR): Q3-Q1으로, 자료 중간 50%를 의미, 사분범위보다 분포가 짧으면 밀집된 분포라고 생각 가능

- 평균의 표준오차: 모평균과 표본 평균의 차이를 나타내는 통계량, 작을수록 좋음 , 표본평균 X_bar가 모평균 u의 추정치로서 어느 정도 확실한가를 나타냄

- 변동계수: 변수의 표준편차를 산술평균으로 나눈 값으로, 측정 단위가 서로 다른 자료를 비교하고자할 때 쓰임. 단위가 달라도 퍼진 정도를 파악 가능

 

c. 자료 분포의 비대칭도

- 중심경향도와 산포도로 관측된 자료의 중심과 분산은 설명할 수 있지만, 치우쳐진 정도는 파악 불가능

- 이러한 자료 분포의 형태를 설명해주는 통계량이 '왜도'와 '첨도'

- 정규분포를 기준으로 설명, 정규분포는 왜도와 첨도가 0

 

- 왜도(skewness): 분포가 비대칭 정도와, 비대칭의 방향을 보여주는 통계량. 오른쪽으로 긴 꼬리를 가지면 왜도가 0보다 큼

 

- 첨도(kurtosis): 분포의 중심에서 뾰족한 정도와 꼬리 부분의 길이에 대한 정보. 첨도가 0보다 크면 정규분포보다 더 뾰족하고 긴 꼬리를 가짐


3. 시각적 데이터 탐색

1) 막대그래프와 원그래프

- 관측치의 도수를 표현하는 데 사용

- 각 계급의 비교시 사용

 

2) 도수분포표와 히스토그램

- 자료의 분포까지 파악 가능

- 중심 경향도, 산포도, 비대칭도

 

3) 줄기-잎 그림

- 히스토그램과 유사하지만, 관측치의 정확한 정보까지 얻을 수 있고, 쉽게 파악 가능

 

4) 상자그림

- 사분 범위 Q1, Q2, Q3를 사용해 자료의 특성을 나타냄

- 최솟값과 Q1 사이의 폭이 최대값과 Q3 사이의 폭보다 넓다면, 높은 쪽에 자료가 많이 분포되어있다는 것

 

5) 도수다각형

출처: https://m.blog.naver.com/periwinkle59/222184724674

- 연속형 자료를 일정 크기의 계급으로 묶었을 때 각 계급의 중간점에서 해당 도수를 표시한 후 그 점들을 직선으로 연결한 그래프

- 분포의 모양을 보여주는 꺾은선 그래프

 

6) 선그래프

- 연속형 변수에 해당하는 X축의 변화에 따른 Y축의 변화를 선으로 나타내는 그래프 

- x축이 시간이라면 시계열 그래프가 됨

 

7) 산점도

- 두 변수 사이의 관계를 시각화하는 방법

- 상관관계와 분포, 이상치 등을 시각적으로 파악 가능


4. 상관관계 분석

1) 상관분석의 필요성

- 각각의 데이터/정보 속에서 특정한 관계를 발견해 인사이트를 획득

- 변수 간 선형 관계 정도를 분석하는 것

 

2) 공분산 분석

- 두 변수 사이의 연관성을 분석할 땐 분포를 동시에 고려해야함

- 이때 두 변수의 공통된 분포를 나타내는 분산을 공분산이라고 하며 두 변수 사이의 선형관게를 측정하는 대표적 모수

- 동시에 두 개의 변수값을 갖는 개별 관측치들이 각 변수의 평균으로부터 어느 정도 떨어져 있는가를 나타냄

- 양수면 두 변수는 같은 방향으로 움직이고, 음수면 다른 방향으로 움직임, 0이면 서로 독립

- 측정 단위에 따라 차이가 심하기 때문에, 이 측정단위를 표준화한 것이 바로 피어슨 상관계수가 됨

 

3) 상관계수 분석

a. 피어슨 상관계수

- 두 변수가 얼마나 밀접한 관련성을 갖고 변화하는지를 파악

- 연속형 변수

- 0.3이상이면 약한 관계, 0.5 이상이면 중간 관계, 0.7 이상이면 강한 관계

- 정규성이 가정되어야함

 

b. 스피어만 상관계수

- 서열척도 변수 간의 상관관계를 표현

 

4) 상관계수의 유의성 검정

- 상관분석을 통해 얻은 상관계수를 일반화하여 사용하려면 통계적 유의성을 검정해야함

 

a. 가설 설정

- 피어슨 상관계수의 유의성 검정은 표본으로부터 얻은 상관계수가 통계적으로 유의한가를 판단해야함

- 이를 위해 모상관계수 p에 대한 귀무가설(H0)과 대립가설(H1)을 설정함

- H0: p=0, 두 변수 간에는 선형관계가 존재하지 않는다

- H1: p!=0, 두 변수 간에는 선형관계가 존재한다

 

b. 검정통계량

- 가설 검정에 t 통계량을 사용하며, 이때 검정통계량은 자유도가 n-2인 t 분포를 따름

 

c. 유의성 검정

- t 검정으로 통계적 유의성을 검정함