본문 바로가기
빅데이터분석기사

[빅분기] 3.2. 데이터 적재 및 저장

by Point-Nemo 2025. 8. 17.

1. 데이터 적재

1) ETL 프로세스 설계 중 적재 방안

- 데이터 적재 과정에서는 데이터의 신뢰성 확보를 위한 데이터 오류 대책 방안 및 데이터 검증 방안을 마련해야 함

 

2. 데이터 저장

1) 빅데이터 저장 기술 

a. 분산 파일 시스템: 여러 컴퓨터에 자료를 분산 저장하여 마치 로컬 시스템에서 사용하는 것처럼 동작하게 하는 시스템

 

- 하둡: 분산 컴퓨팅 환경을 지원하는 도구

- 하둡 분산 파일 시스템: 클라우드 컴퓨팅 환경을 구축하기 위해 이용하며 대용량 데이터의 분산 저장이 가능, 관계형 DBMS에 비해 시스템 구축 비용이 저렴, 자바로 구현되어 다양한 서버에서 구동 가능, 직접 접근 권한은 지원 X

- 구글 파일 시스템(GFS): 구글의 대규모 클러스터 서비스 플랫폼의 기반이 되는 시스템, 저렴한 범용 컴퓨터들로 구성되며 이런 환경에서도 하드웨어 안정성이 보장됨

 

b. NoSQL: RDBMS 중심의 데이터 저장 기술로는 비정형 데이터의 저장과 관리가 힘들다는 한계로 인해 등장한 데이터 저장 기술, 키 값을 이용해 데이터를 간단하게 저장하고 데이터 저장 및 관리시 SQL을 사용하지 않음

 

- Cassandra: 대용량의 데이터 저장 및 처리가 가능한 NoSQL 공개 소프트웨어

- HBase: 자바 기반의 비관계형 데이터베이스, 스키마 지정 및 변경 없이 데이터 저장이 가능하며 HDFS에서 동작함

- MongoDB: DBMS로, 테이블과 행 대신 유연한 문서를 활용해 다양한 데이터 형식을 처리하고 저장, RDBMS를 필요로 하지 않으므로, 다변량 데이터를 손쉽게 저장하고 쿼리할 수 있음

 

2) 빅데이터 저장을 위한 고려 사항

- 비용 문제가 가장 대두됨

- 장비 구입비뿐만 아니라 운영 및 유지보수에 대한 비용까지 고려할 수 있는 '총소유비용'을 실현해야 함

- 비정형의 반구조적, 비구조적 데이터들도 수집 및 관리되어야 하기 떄문에 RDBMS 방법으로는 관리가 어려움

- 저장 용량을 쉽게 확장할 수 있어야 함

 

3) 데이터 거버넌스

a. 데이터 거버넌스의 개요

- 전사 차원의 모든 데이터에 대하여 정책 및 지침, 운영조직 및 책임 등의 표준화된 관리 체계를 수립하고 운영을 위한 프레임워크 및 저장소를 구축하는 것

- 기업은 데이터 거버넌스를 구축함으로써 데이터의 가용성, 유용성, 통합성, 보안성, 안정성을 확보 가능

 

b. 데이터 거버넌스 구성요소

- 구성요소인 원칙, 조직, 프로세스는 유기적으로 조합하고 효과적으로 관리하여 데이터를 목적에 부합하도록 함

- 원칙: 데이터를 유지/관리하기 위한 지침과 가이드 (보안, 품질기준)

- 조직: 데이터를 관리할 조직의 역할과 책임 (데이터 관리자)

- 프로세스: 데이터 관리를 위한 활동과 체계 (모니터링)

 

c. 데이터 거버넌스 체계

데이터 표준화 - 데이터 표준 용어 설정, 명명 규칙 수립, 메타 데이터 구축, 데이터 사전 구축
- 명명 규칙은 필요시 언어별로 작성되어 매핑 상태를 유지해야 함
데이터 관리체계 - 데이터 정합성 및 활용의 효율성을 위해 표준 데이터를 포함한 메타 데이터와 데이터 사전의 관리 원칙 수립
- 데이터의 생명 주기 관리방안을 수립하지 않으면 데이터 양의 급증에 따른 가용성 및 관리 비용 증대 문제에 처함
데이터 저장소 관리 - 메타데이터 및 표준 데이터를 관리하기 위한 전사 차원의 저장소를 구성 
- 저장소는 데이터 관리 체계 지원을 위한 워크플로우 및 관리용 응용 소프트웨어를 지원해야함
표준화 활동 - 데이터 거버넌스 체계를 구축한 후 표준 준수 여부를 주기적으로 점검하고 모니터링을 실시함