1. 데이터 적재
1) ETL 프로세스 설계 중 적재 방안
- 데이터 적재 과정에서는 데이터의 신뢰성 확보를 위한 데이터 오류 대책 방안 및 데이터 검증 방안을 마련해야 함
2. 데이터 저장
1) 빅데이터 저장 기술
a. 분산 파일 시스템: 여러 컴퓨터에 자료를 분산 저장하여 마치 로컬 시스템에서 사용하는 것처럼 동작하게 하는 시스템
- 하둡: 분산 컴퓨팅 환경을 지원하는 도구
- 하둡 분산 파일 시스템: 클라우드 컴퓨팅 환경을 구축하기 위해 이용하며 대용량 데이터의 분산 저장이 가능, 관계형 DBMS에 비해 시스템 구축 비용이 저렴, 자바로 구현되어 다양한 서버에서 구동 가능, 직접 접근 권한은 지원 X
- 구글 파일 시스템(GFS): 구글의 대규모 클러스터 서비스 플랫폼의 기반이 되는 시스템, 저렴한 범용 컴퓨터들로 구성되며 이런 환경에서도 하드웨어 안정성이 보장됨
b. NoSQL: RDBMS 중심의 데이터 저장 기술로는 비정형 데이터의 저장과 관리가 힘들다는 한계로 인해 등장한 데이터 저장 기술, 키 값을 이용해 데이터를 간단하게 저장하고 데이터 저장 및 관리시 SQL을 사용하지 않음
- Cassandra: 대용량의 데이터 저장 및 처리가 가능한 NoSQL 공개 소프트웨어
- HBase: 자바 기반의 비관계형 데이터베이스, 스키마 지정 및 변경 없이 데이터 저장이 가능하며 HDFS에서 동작함
- MongoDB: DBMS로, 테이블과 행 대신 유연한 문서를 활용해 다양한 데이터 형식을 처리하고 저장, RDBMS를 필요로 하지 않으므로, 다변량 데이터를 손쉽게 저장하고 쿼리할 수 있음
2) 빅데이터 저장을 위한 고려 사항
- 비용 문제가 가장 대두됨
- 장비 구입비뿐만 아니라 운영 및 유지보수에 대한 비용까지 고려할 수 있는 '총소유비용'을 실현해야 함
- 비정형의 반구조적, 비구조적 데이터들도 수집 및 관리되어야 하기 떄문에 RDBMS 방법으로는 관리가 어려움
- 저장 용량을 쉽게 확장할 수 있어야 함
3) 데이터 거버넌스
a. 데이터 거버넌스의 개요
- 전사 차원의 모든 데이터에 대하여 정책 및 지침, 운영조직 및 책임 등의 표준화된 관리 체계를 수립하고 운영을 위한 프레임워크 및 저장소를 구축하는 것
- 기업은 데이터 거버넌스를 구축함으로써 데이터의 가용성, 유용성, 통합성, 보안성, 안정성을 확보 가능
b. 데이터 거버넌스 구성요소
- 구성요소인 원칙, 조직, 프로세스는 유기적으로 조합하고 효과적으로 관리하여 데이터를 목적에 부합하도록 함
- 원칙: 데이터를 유지/관리하기 위한 지침과 가이드 (보안, 품질기준)
- 조직: 데이터를 관리할 조직의 역할과 책임 (데이터 관리자)
- 프로세스: 데이터 관리를 위한 활동과 체계 (모니터링)
c. 데이터 거버넌스 체계
| 데이터 표준화 | - 데이터 표준 용어 설정, 명명 규칙 수립, 메타 데이터 구축, 데이터 사전 구축 - 명명 규칙은 필요시 언어별로 작성되어 매핑 상태를 유지해야 함 |
| 데이터 관리체계 | - 데이터 정합성 및 활용의 효율성을 위해 표준 데이터를 포함한 메타 데이터와 데이터 사전의 관리 원칙 수립 - 데이터의 생명 주기 관리방안을 수립하지 않으면 데이터 양의 급증에 따른 가용성 및 관리 비용 증대 문제에 처함 |
| 데이터 저장소 관리 | - 메타데이터 및 표준 데이터를 관리하기 위한 전사 차원의 저장소를 구성 - 저장소는 데이터 관리 체계 지원을 위한 워크플로우 및 관리용 응용 소프트웨어를 지원해야함 |
| 표준화 활동 | - 데이터 거버넌스 체계를 구축한 후 표준 준수 여부를 주기적으로 점검하고 모니터링을 실시함 |
'빅데이터분석기사' 카테고리의 다른 글
| [빅분기] 4.2. 분석 변수 처리 (9) | 2025.08.20 |
|---|---|
| [빅분기] 4.1. 데이터 전처리 (3) | 2025.08.17 |
| [빅분기] 3.1. 데이터 수집 및 전환 (5) | 2025.08.16 |
| [빅분기] 2.2. 분석의 유형 (0) | 2025.08.15 |