Mỗi mô hình là một phản ánh thu nhỏ của những gì nó được cung cấp. Dữ liệu huấn luyện chính là "chế độ ăn" đó: tập hợp các ví dụ mà một hệ thống học máy nghiên cứu trước khi được yêu cầu thực hiện bất kỳ nhiệm vụ hữu ích nào. Một mô hình nhận dạng khuôn mặt có thể học từ hàng triệu bức chân dung được gắn nhãn. Một chương trình chơi cờ vua học từ hàng triệu ván cờ. Một bộ phân loại y tế học từ các bản quét được chú thích bởi các bác sĩ X quang.
Số lượng ảnh có ích, nhưng bố cục quan trọng hơn. Nếu ảnh chân dung chủ yếu là người da trắng và nam giới, mô hình sẽ không hoạt động tốt với người da sẫm màu và phụ nữ. Nếu dữ liệu trò chơi chỉ đến từ người chơi nghiệp dư, công cụ sẽ bị chững lại. Các nhà nghiên cứu gọi đây là sự thay đổi phân bố, và đó là một trong những lý do phổ biến nhất khiến một mô hình trông tuyệt vời trong phòng thí nghiệm lại gặp khó khăn khi sử dụng thực tế.
Mối quan tâm thực tế
- Chất lượng nhãn: các chú thích nhiễu hoặc thiên vị làm hỏng mô hình.
- Sự đồng ý và cấp phép: dữ liệu thu thập từ web có thể tiềm ẩn rủi ro pháp lý.
- Bảo mật thông tin: thông tin cá nhân thường phải được loại bỏ hoặc ẩn danh.
- Tính đại diện: các nhóm hiếm cần được lấy mẫu quá mức một cách có chủ đích.
Việc làm sạch và sắp xếp dữ liệu thường chiếm từ 60 đến 80% thời gian của một dự án máy học. Phần hấp dẫn là kiến trúc; phần quyết định là tập dữ liệu.
Comments
No comments yet. Be the first to share a thought.
Leave a comment