빅 데이터는 기존 도구로는 처리하기 너무 크거나 복잡한 데이터 세트를 의미합니다. 데이터의 양(Volume)은 하나의 차원이며, 속도(Velocity)는 센서, 로그, 클릭 스트림 등에서 실시간으로 유입되는 데이터의 양을 나타냅니다. 다양성(Variety)은 정형화된 표, 비정형 텍스트, 이미지, 비디오 등 다양한 형태의 데이터가 혼합되어 있음을 의미합니다. 이 세 가지 V는 오랫동안 빅 데이터의 표준 정의로 사용되어 왔습니다. 일부에서는 여기에 데이터의 신뢰성 여부인 정확성(Veracity)을 추가하기도 합니다.
데이터 규모에 맞춰 도구들이 발전해 왔습니다. 하둡은 일반 서버에 분산 저장 및 처리를 제공했고, 스파크는 속도 향상을 위해 인메모리 연산 기능을 추가했습니다. NoSQL 데이터베이스는 관계형 시스템이 처리하기 어려웠던 비정형 데이터를 처리했으며, 클라우드 플랫폼은 빅데이터 인프라를 서비스 형태로 제공했습니다. 빅데이터 열풍은 2015년경 정점에 달했습니다. 모든 기업이 데이터 레이크를 원했고, 실제로 구축했지만 데이터를 제대로 활용하지 못한 기업도 많았습니다. 기술 자체는 효과적이지만, 올바른 질문을 던지고 그에 대한 답을 찾는 것이 어렵습니다. 빅데이터는 단순히 규모가 크다는 이유만으로 가치가 있는 것이 아닙니다. 작은 데이터셋으로는 발견할 수 없는 중요한 정보를 드러낼 때 비로소 가치가 있습니다. 대부분의 경우, 잘 설계된 샘플 데이터가 무질서한 전체 데이터셋보다 훨씬 효과적입니다.
빅데이터의 차원
- 용량 — 테라바이트에서 페타바이트까지
- 속도 — 실시간 또는 거의 실시간 스트림
- 다양성 — 구조화된, 반구조화된, 그리고 비구조화된
- 진실성 — 정확성과 신뢰성
- 가치 — 비용을 정당화하는 통찰력
빅데이터는 도구일 뿐 목표가 아닙니다. 목표는 더 나은 의사결정을 내리는 것입니다. 단순히 데이터 양만으로는 더 나은 의사결정을 내릴 수 없습니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment