Dữ liệu huấn luyện dùng để dạy mô hình máy học. Mô hình sẽ xem các ví dụ và học được mối quan hệ giữa đầu vào và đầu ra. Đối với bộ lọc thư rác, dữ liệu huấn luyện là các email được dán nhãn là thư rác hoặc không phải thư rác. Đối với bộ phân loại hình ảnh, đó là các bức ảnh được dán nhãn kèm nội dung. Đối với mô hình ngôn ngữ, đó là một lượng lớn văn bản. Mô hình điều chỉnh các tham số nội bộ của nó để giảm thiểu sự khác biệt giữa dự đoán của nó và các nhãn chính xác. Chất lượng và số lượng dữ liệu huấn luyện quyết định hiệu suất của mô hình.
Dữ liệu huấn luyện có một số yêu cầu. Nó phải đại diện cho dữ liệu thực tế mà mô hình sẽ gặp phải. Một mô hình chỉ được huấn luyện trên ảnh chụp ban ngày sẽ thất bại khi xử lý ảnh chụp ban đêm. Dữ liệu phải được dán nhãn chính xác. Các ví dụ được dán nhãn sai sẽ dạy cho mô hình các mẫu sai. Dữ liệu phải đủ lớn để nắm bắt sự biến đổi trong dữ liệu. Quá ít dữ liệu dẫn đến hiện tượng quá khớp, trong đó mô hình ghi nhớ các ví dụ huấn luyện thay vì học các mẫu tổng quát. Dữ liệu phải không có thành kiến, nếu không mô hình sẽ học và khuếch đại thành kiến đó. Dữ liệu huấn luyện cũng là một vấn đề về quyền riêng tư. Các mô hình được huấn luyện trên dữ liệu cá nhân có thể ghi nhớ và sao chép nó. Các khung pháp lý ngày càng yêu cầu tài liệu hóa về nguồn và quá trình xử lý dữ liệu huấn luyện. Dữ liệu không chỉ là đầu vào. Nó vừa là trách nhiệm pháp lý vừa là tài sản. Mô hình chỉ tốt khi dữ liệu mà nó học được tốt.
Yêu cầu dữ liệu đào tạo
- Mang tính đại diện — phản ánh sự biến đổi trong thế giới thực
- Đã dán nhãn — thông tin chính xác thực tế
- Số lượng lớn — đủ ví dụ để khái quát hóa
- Không thiên vị — không có sự sai lệch có hệ thống
- Đã được ghi chép đầy đủ — nguồn gốc và quy trình chế biến đã được biết rõ.
Dữ liệu huấn luyện đóng vai trò là người thầy. Mô hình học hỏi từ những gì dữ liệu thể hiện. Dữ liệu xấu sẽ dạy những bài học xấu.
Comments
No comments yet. Be the first to share a thought.
Leave a comment