본문 바로가기
빅데이터분석기사

[빅분기] 2.1. 분석 방안 수립(3)

by Point-Nemo 2025. 8. 13.

6. 데이터 분석 방안

1) 분석 방법론 개요

 

a. 개요

- 데이터 분석이 효과적으로 기업 내에 정착하기 위해선 이를 체계화한 절차와 방법이 정리된 데이터 분석 방법론의 수립이 필수적

 

b. 데이터 기반 의사결정의 필요성

- 데이터 기반 의사결정은 급변하는 현실 상황을 감안할 때 더이상 개인의 경험과 감에 의존하는 의사결정이 아닌 사실에 입각한 데이터에 기반한 경영의 추구를 위한 개념

 

c. 방법론의 생성과정

출처: https://needjarvis.tistory.com/507

- 방법론은 학습과 경험으로 개인에게 체화되어 겉으로는 드러나지 않는 암묵지와 형식화를 통해 문서나 매뉴얼처럼 외부로 표출되어 여러 사람이 공유할 수 있는 형식지로 나타남

 

d. 방법론의 적용 업무의 특성에 따른 모델

 

가) 폭포수 모델

출처: https://freemoa-blog.com/930

- 전통적인 개발 모델로 요구분석/설계/구현/테스트/유지보수의 각 단계가 하향식으로 진행되며 병행되거나 거슬러 반복되지 않는 방법

- 각 단계가 끝날 때마다 그 결과를 확인한 후에 다음 단계로 진행될 수 있으며, 관리가 용이하고 체계적인 문서화가 가능

 

 

나) 프로토타입 모델

출처: https://freemoa-blog.com/930

- 폭포수 모델의 단점을 보완하기 위해 점진적으로 개발해나가는 접근 방식으로, 사용자의 기본적 요구사항에 따른 프로토타입을 신속히 개발하여 사용자의 의견을 바탕으로 개선해나가는 모델

- 프로토타입을 활용한 사용자와의 의사소통을 통해 요구사항 도출의 어려움을 해결하고, 개발의 타당성을 점검하고 성능을 평가할 수 있음

 

다) 나선형 모델

출처: https://freemoa-blog.com/930

- 진화적 프로토타입 모델의 대표적 형태로 사용자의 초기 요구분석 후 위험분석 단계를 거쳐 프로토타입 개발하고, 사용자 평가 후 추가 또는 수정 요구를 받아들여 다시 위험 분석을 거쳐 2차 프로토타입을 만듦, 이러한 과정을 수차례 거치는 동안 사용자의 요구가 충분히 반영됨

- 폭포수 모델과 프로토타입 모델의 장점에 위험분석 단계를 추가하여 문제를 식별하고, 그 해결 방법을 강조한 반복적 개발 모델

- 관리 체계가 효과적이지 못한 경우 복잡도가 상승하여 프로젝트 진행이 어려울 수 있음

 

e. 빅데이터 분석 방법론의 계층적 프로세스

 

출처: https://curieux.tistory.com/290

가) 단계

- 프로세스 그룹을 통하여 완성된 단계별 산출물이 생성됨 

- 각 단계는 기준선(Baseline)으로 설정되어 관리되어야 하고 버전 관리 등을 통해 통제가 이루어져야 함

 

나) 테스크

- 각 단계는 여러 테스크로 구성되며, 각 테스크는 단계를 구성하는 단위 활동이며 품질 검토의 대상 

 

다) 스텝

- WBS의 워크 패키지에 해당되고, 입력자료, 처리 및 도구, 출력자료로 구성된 단위 프로세스 


2) 일반적인 빅데이터 분석 방법론

출처: https://m.blog.naver.com/cathy-apiacere/222083766240

a. 분석 기획

- 비즈니스 도메인과 문제점을 인식하고 분석 계획 및 프로젝트 수행계획을 수립함

- 프로젝트 수행시 발생가능한 위험 상황에 대처하기 위한 계획 수립

 

b. 데이터 준비

- 비즈니스 요구사항과 데이터 분석에 필요한 원천 데이터를 정의하고 준비하는 단계

- 필요한 데이터를 수집하고 수집한 데이터에 대한 정합성을 점검

 

c. 데이터 분석

- 원천 데이터를 분석용 데이터 셋으로 편성하고 다양한 분석 기법과 알고리즘을 이용해 데이터 분석

- 분석 모델 설정, 모델 평가

- 추가적인 데이터 확보가 필요한 경우 데이터 준비 단계로 다시 돌아가 반복하여 진행

 

d. 시스템 구현

- 분석 기획에 맞는 모델을 도출하고 이를 운영중인 가동 시스템에 적용하거나 프로토타입 시스템 구현

- 프로토타입을 통해 검증한 후 시스템 수정 및 보완을 반복하여 최종 시스템을 구현

 

e. 평가 및 전개

- 데이터 분석 및 시스템 구현 단계를 수행한 후 프로젝트의 성과를 평가하고 정리, 모델의 발전 계획 수립


3) KDD 분석 방법론

 

a. 개요

- KDD(Knowledge Discovery in Database)는 1996년 Fayyad가 프로파일링 기술을 기반으로 데이터로부터 패턴이나 지식을 찾기 위해 정리한 데이터 마이닝 프로세스로, 데이터 마이닝 / 기계학습 / 인공지능 / 패턴인식 등에서 응용될 수 있는 구조를 가지고 있음

 

b. KDD 분석 절차

출처: https://www.2e.co.kr/news/articleView.html?idxno=301010

가) 데이터셋 선택

 

나) 데이터 전처리

 

다) 데이터 변환

 

라) 데이터 마이닝

 

마) 데이터 마이닝 평가


4) CRISP-DM 분석 방법론

 

a. 개요

- CRISP-DM(Cross Industry Standard Process for Data Mining)은 1996년 유럽연합의 ESPRIT에서 있었던 프로젝트에서 시작되었으며, 주요한 5개의 업체들이 주도함

 

b. CRISP-DM의 4레벨 구조

출처: https://kun-hee.tistory.com/entry/CRISP-DM-%EB%B6%84%EC%84%9D-%EB%B0%A9%EB%B2%95%EB%A1%A0

- 최상위 레벨은 여러 개의 단계(Phases)로 구성되고 각 단계는 일반화 테스크(Generic Tasks)를 포함함 

- 일반화 테스크는 데이터 마이닝의 단일 프로세스를 완전하게 수행하는 단위이며 이는 세분화 테스크(Specialized Tasks)로 구성됨

- 예를 들어, 데이터 정제라는 일반화 테스크는 범주형 데이터 정제와 연속형 데이터 정제와 같은 세분화 테스크로 구성됨

- 마지막 레벨인 프로세스 실행(Process Instances)은 데이터 마이닝을 위한 구체적인 실행

 

c. CRISP-DM의 프로세스

출처: https://www.2e.co.kr/news/articleView.html?idxno=301010

- 6단계로 구성되어 있으며 KDD 방법론과는 달리 단계 간 피드백을 통해 단계별 완성도를 높임

 

단계 내용 수행업무
업무 이해 - 비즈니스 관점에서 프로젝트의 목적과 요구사항을 이해
- 도메인 지식을 데이터 분석응ㄹ 위한 문제 정의로 변경하고 초기 프로젝트 계획 수립
- 업무 목적 파악, 상황 파악, 목표 설정, 계획 수립
데이터 이해 - 데이터를 수집하고 데이터 속성을 이해
- 데이터 품질에 대한 문제점을 식별하고 숨겨진 인사이트 발견
- 초기 데이터 수집, 데이터 기술 분석, 데이터 탐색
데이터 준비 - 분석 기법에 적합한 데이터를 편성 (많은 시간 소요) -분석용 데이터셋 선택, 데이터 정제, 데이터 통합
모델링 - 다양한 모델링 기법과 알고리즘을 선택하고 모델링 과정에서 사용되는 파라미터를 최적화
- 데이터 셋이 추가로 필요한 경우 데이터 준비 단계를 반복 수행 가능
- 모델링 기법 선택, 평가
평가 - 모델링 결과가 프로젝트 목적에 부합하는지 평가  - 분석 결과 평가
전개 - 완성된 모델을 실 업무에 적용하기 위한 계획을 수립
- 모니터링과 모델의 유지보수 계획 마련 (모델의 생명주기가 다양)
- 모니터링과 유지보수 계획 수립, 리뷰

5) KDD와 CRISP-DM의 단계 비교

KDD CRISP-DM
분석 대상 비즈니스 이해 업무 이해
데이터셋 선택 데이터 이해
데이터 전처리 데이터 이해
데이터 변환 데이터 준비
데이터 마이닝 모델링
데이터 마이닝 결과 평가 평가
데이터 마이닝 활용 전개

 


6) SEMMA 분석 방법론

 

a. 개요

- SEMMA(Sampling Exploration Modification Modeling Assessment)는 SAS사의 주도로 만들어진 데이터 마이닝 방법론으로 기술 중심, 통계 중심의 방법론이며 자사의 기술로 구성하여 쉽게 데이터 마이닝이 되도록 하는 특징이 있음

 

b. SEMMA 분석 절차

단계 내용 세부요소/산출물
샘플링 - 분석 데이터 생성
- 모델 평가용 데이터 준비
통계적 추출
조건 추출
탐색 - 분석 데이터 탐색
- 데이터 오류 검색
- 비즈니스 이해
그래프, 기초 통계
클러스터링
변수 유의성 및 상관분석
수정 - 분석 데이터 수정 및 변환
- 데이터 정보 표현 극대화
- 다양한 형태의 변수 생성
수량화
표준화
변환
모델링 - 다양한 통계 기법을 이용한 모델 구축
- 패턴 발견, 모델링과 알고리즘 적용
신경망
의사결정나무
로지스틱 회귀
검증 - 모델 평가 및 검증
- 서로 다른 모델 동시 비교
보고서
피드백