Khai thác dữ liệu tìm ra các mẫu trong các tập dữ liệu lớn. Nó sử dụng thống kê, học máy và các kỹ thuật cơ sở dữ liệu để khám phá các mối quan hệ không dễ nhận thấy. Một nhà bán lẻ phát hiện ra rằng khách hàng mua tã cũng mua bia vào tối thứ Sáu. Một ngân hàng nhận thấy rằng một số mô hình giao dịch nhất định có thể dự đoán gian lận. Một bệnh viện xác định các yếu tố rủi ro dẫn đến tái nhập viện. Các mẫu này là có thật. Việc chúng có hữu ích hay không phụ thuộc vào việc bạn sử dụng chúng như thế nào.
Khai thác dữ liệu không giống với phân tích dữ liệu. Phân tích kiểm tra các giả thuyết. Khai thác tạo ra chúng. Bạn không biết mình đang tìm kiếm điều gì. Thuật toán tìm ra các mối tương quan và sự bất thường. Sau đó, con người quyết định những mối tương quan và sự bất thường nào quan trọng. Bước cuối cùng đó rất quan trọng. Tương quan không phải là nhân quả. Một mô hình có thể là giả tạo. Nó có thể phản ánh một biến gây nhiễu. Nó có thể là một hiện tượng giả tạo trong dữ liệu. Khai thác tạo ra các ứng viên, chứ không phải kết luận. Các kỹ thuật bao gồm phân cụm, phân loại, hồi quy, luật liên kết và phát hiện bất thường. Mỗi kỹ thuật phù hợp với các vấn đề khác nhau. Các công cụ đã trở nên dễ tiếp cận. Thư viện Python và dịch vụ đám mây cho phép các nhà phân tích chạy các thuật toán phức tạp mà không cần chuyên môn sâu. Rủi ro là việc sử dụng sai. Chạy hàng nghìn mô hình và chọn mô hình có kết quả tốt nhất không phải là khám phá. Đó là hiện tượng quá khớp dữ liệu. Mô hình phải đúng với dữ liệu mới để được coi là có thật.
Kỹ thuật khai thác dữ liệu
- Phân nhóm — nhóm các bản ghi tương tự lại với nhau
- Phân loại — gán bản ghi vào các danh mục
- Quy tắc liên kết — tìm các mục xuất hiện cùng nhau
- Hồi quy — mô hình hóa mối quan hệ giữa các biến số
- Phát hiện bất thường — xác định các bản ghi bất thường
Khai thác dữ liệu giúp tìm ra các mẫu. Con người quyết định ý nghĩa của chúng. Thuật toán là một công cụ, không phải là một nhà tiên tri.
Comments
No comments yet. Be the first to share a thought.
Leave a comment