스팸인가 아닌가. 악성인가 양성인가. 사기인가 합법적인가. 분류는 입력값을 미리 정의된 여러 범주 중 하나에 할당하며, 이는 실제 머신러닝의 상당 부분을 뒷받침합니다.
모델은 레이블이 지정된 예제로부터 결정 경계를 학습합니다. 이진 분류는 두 개의 클래스를 구분합니다. 다중 클래스 분류는 여러 개의 클래스를 구분하는 것으로 확장됩니다. 다중 레이블 분류는 여러 개의 레이블을 동시에 지정할 수 있으며, 범주들이 상호 배타적이지 않을 때 유용합니다.
일반적인 분류자
- 로지스틱 회귀
- 의사결정 트리와 랜덤 포레스트
- 서포트 벡터 머신
- 신경망
- 나이브 베이즈
클래스 불균형이 있는 경우 정확도만으로는 충분한 지표가 되지 못합니다. 사기가 드문 데이터셋에서 아무것도 탐지하지 못하는 사기 탐지기는 99.9%의 정확도를 달성하지만, 이는 무용지물입니다. 정밀도, 재현율, F1 점수가 더 정확한 정보를 제공합니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment