6. 데이터 분석 방안
1) 분석 방법론 개요
a. 개요
- 데이터 분석이 효과적으로 기업 내에 정착하기 위해선 이를 체계화한 절차와 방법이 정리된 데이터 분석 방법론의 수립이 필수적
b. 데이터 기반 의사결정의 필요성
- 데이터 기반 의사결정은 급변하는 현실 상황을 감안할 때 더이상 개인의 경험과 감에 의존하는 의사결정이 아닌 사실에 입각한 데이터에 기반한 경영의 추구를 위한 개념
c. 방법론의 생성과정

- 방법론은 학습과 경험으로 개인에게 체화되어 겉으로는 드러나지 않는 암묵지와 형식화를 통해 문서나 매뉴얼처럼 외부로 표출되어 여러 사람이 공유할 수 있는 형식지로 나타남
d. 방법론의 적용 업무의 특성에 따른 모델
가) 폭포수 모델

- 전통적인 개발 모델로 요구분석/설계/구현/테스트/유지보수의 각 단계가 하향식으로 진행되며 병행되거나 거슬러 반복되지 않는 방법
- 각 단계가 끝날 때마다 그 결과를 확인한 후에 다음 단계로 진행될 수 있으며, 관리가 용이하고 체계적인 문서화가 가능
나) 프로토타입 모델

- 폭포수 모델의 단점을 보완하기 위해 점진적으로 개발해나가는 접근 방식으로, 사용자의 기본적 요구사항에 따른 프로토타입을 신속히 개발하여 사용자의 의견을 바탕으로 개선해나가는 모델
- 프로토타입을 활용한 사용자와의 의사소통을 통해 요구사항 도출의 어려움을 해결하고, 개발의 타당성을 점검하고 성능을 평가할 수 있음
다) 나선형 모델

- 진화적 프로토타입 모델의 대표적 형태로 사용자의 초기 요구분석 후 위험분석 단계를 거쳐 프로토타입 개발하고, 사용자 평가 후 추가 또는 수정 요구를 받아들여 다시 위험 분석을 거쳐 2차 프로토타입을 만듦, 이러한 과정을 수차례 거치는 동안 사용자의 요구가 충분히 반영됨
- 폭포수 모델과 프로토타입 모델의 장점에 위험분석 단계를 추가하여 문제를 식별하고, 그 해결 방법을 강조한 반복적 개발 모델
- 관리 체계가 효과적이지 못한 경우 복잡도가 상승하여 프로젝트 진행이 어려울 수 있음
e. 빅데이터 분석 방법론의 계층적 프로세스

가) 단계
- 프로세스 그룹을 통하여 완성된 단계별 산출물이 생성됨
- 각 단계는 기준선(Baseline)으로 설정되어 관리되어야 하고 버전 관리 등을 통해 통제가 이루어져야 함
나) 테스크
- 각 단계는 여러 테스크로 구성되며, 각 테스크는 단계를 구성하는 단위 활동이며 품질 검토의 대상
다) 스텝
- WBS의 워크 패키지에 해당되고, 입력자료, 처리 및 도구, 출력자료로 구성된 단위 프로세스
2) 일반적인 빅데이터 분석 방법론

a. 분석 기획
- 비즈니스 도메인과 문제점을 인식하고 분석 계획 및 프로젝트 수행계획을 수립함
- 프로젝트 수행시 발생가능한 위험 상황에 대처하기 위한 계획 수립
b. 데이터 준비
- 비즈니스 요구사항과 데이터 분석에 필요한 원천 데이터를 정의하고 준비하는 단계
- 필요한 데이터를 수집하고 수집한 데이터에 대한 정합성을 점검
c. 데이터 분석
- 원천 데이터를 분석용 데이터 셋으로 편성하고 다양한 분석 기법과 알고리즘을 이용해 데이터 분석
- 분석 모델 설정, 모델 평가
- 추가적인 데이터 확보가 필요한 경우 데이터 준비 단계로 다시 돌아가 반복하여 진행
d. 시스템 구현
- 분석 기획에 맞는 모델을 도출하고 이를 운영중인 가동 시스템에 적용하거나 프로토타입 시스템 구현
- 프로토타입을 통해 검증한 후 시스템 수정 및 보완을 반복하여 최종 시스템을 구현
e. 평가 및 전개
- 데이터 분석 및 시스템 구현 단계를 수행한 후 프로젝트의 성과를 평가하고 정리, 모델의 발전 계획 수립
3) KDD 분석 방법론
a. 개요
- KDD(Knowledge Discovery in Database)는 1996년 Fayyad가 프로파일링 기술을 기반으로 데이터로부터 패턴이나 지식을 찾기 위해 정리한 데이터 마이닝 프로세스로, 데이터 마이닝 / 기계학습 / 인공지능 / 패턴인식 등에서 응용될 수 있는 구조를 가지고 있음
b. KDD 분석 절차

가) 데이터셋 선택
나) 데이터 전처리
다) 데이터 변환
라) 데이터 마이닝
마) 데이터 마이닝 평가
4) CRISP-DM 분석 방법론
a. 개요
- CRISP-DM(Cross Industry Standard Process for Data Mining)은 1996년 유럽연합의 ESPRIT에서 있었던 프로젝트에서 시작되었으며, 주요한 5개의 업체들이 주도함
b. CRISP-DM의 4레벨 구조

- 최상위 레벨은 여러 개의 단계(Phases)로 구성되고 각 단계는 일반화 테스크(Generic Tasks)를 포함함
- 일반화 테스크는 데이터 마이닝의 단일 프로세스를 완전하게 수행하는 단위이며 이는 세분화 테스크(Specialized Tasks)로 구성됨
- 예를 들어, 데이터 정제라는 일반화 테스크는 범주형 데이터 정제와 연속형 데이터 정제와 같은 세분화 테스크로 구성됨
- 마지막 레벨인 프로세스 실행(Process Instances)은 데이터 마이닝을 위한 구체적인 실행
c. CRISP-DM의 프로세스

- 6단계로 구성되어 있으며 KDD 방법론과는 달리 단계 간 피드백을 통해 단계별 완성도를 높임
| 단계 | 내용 | 수행업무 |
| 업무 이해 | - 비즈니스 관점에서 프로젝트의 목적과 요구사항을 이해 - 도메인 지식을 데이터 분석응ㄹ 위한 문제 정의로 변경하고 초기 프로젝트 계획 수립 |
- 업무 목적 파악, 상황 파악, 목표 설정, 계획 수립 |
| 데이터 이해 | - 데이터를 수집하고 데이터 속성을 이해 - 데이터 품질에 대한 문제점을 식별하고 숨겨진 인사이트 발견 |
- 초기 데이터 수집, 데이터 기술 분석, 데이터 탐색 |
| 데이터 준비 | - 분석 기법에 적합한 데이터를 편성 (많은 시간 소요) | -분석용 데이터셋 선택, 데이터 정제, 데이터 통합 |
| 모델링 | - 다양한 모델링 기법과 알고리즘을 선택하고 모델링 과정에서 사용되는 파라미터를 최적화 - 데이터 셋이 추가로 필요한 경우 데이터 준비 단계를 반복 수행 가능 |
- 모델링 기법 선택, 평가 |
| 평가 | - 모델링 결과가 프로젝트 목적에 부합하는지 평가 | - 분석 결과 평가 |
| 전개 | - 완성된 모델을 실 업무에 적용하기 위한 계획을 수립 - 모니터링과 모델의 유지보수 계획 마련 (모델의 생명주기가 다양) |
- 모니터링과 유지보수 계획 수립, 리뷰 |
5) KDD와 CRISP-DM의 단계 비교
| KDD | CRISP-DM |
| 분석 대상 비즈니스 이해 | 업무 이해 |
| 데이터셋 선택 | 데이터 이해 |
| 데이터 전처리 | 데이터 이해 |
| 데이터 변환 | 데이터 준비 |
| 데이터 마이닝 | 모델링 |
| 데이터 마이닝 결과 평가 | 평가 |
| 데이터 마이닝 활용 | 전개 |
6) SEMMA 분석 방법론
a. 개요
- SEMMA(Sampling Exploration Modification Modeling Assessment)는 SAS사의 주도로 만들어진 데이터 마이닝 방법론으로 기술 중심, 통계 중심의 방법론이며 자사의 기술로 구성하여 쉽게 데이터 마이닝이 되도록 하는 특징이 있음
b. SEMMA 분석 절차
| 단계 | 내용 | 세부요소/산출물 |
| 샘플링 | - 분석 데이터 생성 - 모델 평가용 데이터 준비 |
통계적 추출 조건 추출 |
| 탐색 | - 분석 데이터 탐색 - 데이터 오류 검색 - 비즈니스 이해 |
그래프, 기초 통계 클러스터링 변수 유의성 및 상관분석 |
| 수정 | - 분석 데이터 수정 및 변환 - 데이터 정보 표현 극대화 - 다양한 형태의 변수 생성 |
수량화 표준화 변환 |
| 모델링 | - 다양한 통계 기법을 이용한 모델 구축 - 패턴 발견, 모델링과 알고리즘 적용 |
신경망 의사결정나무 로지스틱 회귀 |
| 검증 | - 모델 평가 및 검증 - 서로 다른 모델 동시 비교 |
보고서 피드백 |
'빅데이터분석기사' 카테고리의 다른 글
| [빅분기] 2.2. 분석의 유형 (0) | 2025.08.15 |
|---|---|
| [빅분기] 2.2. 분석 작업 계획(1) (3) | 2025.08.15 |
| [빅분기] 2.1. 분석 방안 수립(2) (7) | 2025.08.08 |
| [빅분기] 2.1. 분석 방안 수립(1) (4) | 2025.08.04 |