아무도 아이에게 소리를 분류하기 전에 어떤 소리가 어떤 언어에 속하는지 알려주지 않습니다. 비지도 학습도 마찬가지입니다. 알고리즘은 레이블이 없는 데이터를 입력받아 스스로 구조를 찾아야 합니다. 검증할 정답은 없고, 데이터 자체의 형태에서 드러나는 패턴만 있을 뿐입니다.
클러스터링은 대표적인 예입니다. 소매업체는 1년치 구매 기록을 클러스터링 알고리즘에 입력하여 이전에 정의하지 않았던 다섯 개의 서로 다른 고객 그룹을 발견할 수 있습니다. 차원 축소도 또 다른 예입니다. 수백 개의 측정값을 의미 있는 관계를 유지하면서 2차원 맵으로 압축하는 것입니다.
그것이 제 역할을 하는 곳
- 마케팅을 위한 고객 세분화
- 네트워크 트래픽 또는 제조 과정에서의 이상 탐지
- 대규모 문서 모음에서 주제 발견
- 후속 지도 학습 작업을 위한 사전 학습 표현
레이블이 없다는 것은 자유이면서 동시에 부담이기도 합니다. 정답 데이터가 없으면 결과 평가는 주관적이며, 클러스터링이 타당한지 여부를 사람이 직접 해석해야 하는 경우가 많습니다. 하지만 레이블을 지정하는 것이 불가능하거나 비용이 너무 많이 드는 경우, 비지도 학습 방식만이 데이터에 숨겨진 의미를 파악할 수 있는 유일한 방법입니다.
Comments (2)
Leave a comment