Thư rác hay không phải thư rác? Độc hại hay lành tính? Gian lận hay hợp pháp? Phân loại gán các đầu vào vào một trong số các danh mục được xác định trước, và nó là nền tảng của phần lớn ứng dụng thực tiễn trong học máy.
Các mô hình học được ranh giới quyết định từ các ví dụ đã được gán nhãn. Phân loại nhị phân tách hai lớp. Phân loại đa lớp mở rộng ra nhiều lớp hơn. Phân loại đa nhãn cho phép nhiều nhãn đồng thời, hữu ích khi các danh mục không loại trừ lẫn nhau.
Các bộ phân loại thông thường
- Hồi quy logistic
- Cây quyết định và rừng ngẫu nhiên
- Máy hỗ trợ vectơ
- Mạng nơ-ron
- Naive Bayes
Chỉ số độ chính xác thôi là chưa đủ khi các lớp dữ liệu không cân bằng. Một công cụ phát hiện gian lận không phát hiện ra bất kỳ dấu hiệu bất thường nào nhưng vẫn đạt độ chính xác 99,9% trên một tập dữ liệu mà gian lận rất hiếm gặp, tuy nhiên nó lại vô dụng. Độ chính xác (precision), độ thu hồi (recall) và điểm F1 sẽ cho thấy bức tranh trung thực hơn.
Comments
No comments yet. Be the first to share a thought.
Leave a comment