Một đứa trẻ chưa từng nhìn thấy ngựa vằn vẫn có thể nhận ra nó sau khi được cho biết nó trông giống như một con ngựa có sọc. Học không cần huấn luyện (zero-shot learning) yêu cầu máy móc làm điều tương tự: xử lý các lớp hoặc nhiệm vụ mà chúng chưa từng được huấn luyện, sử dụng thông tin bổ trợ như mô tả thuộc tính hoặc mối quan hệ ngữ nghĩa.
Trong phân loại hình ảnh, một mô hình không cần huấn luyện (zero-shot model) có thể được huấn luyện trên hình ảnh mèo và chó nhưng được yêu cầu nhận dạng một con sói. Nếu mô hình đã học được các thuộc tính như "có lông", "có tai nhọn" và "sống theo bầy đàn", nó có thể kết hợp những thuộc tính đó để tạo ra hình ảnh đại diện của một con sói mà không cần nhìn thấy nó bao giờ. Cầu nối giữa các lớp đã thấy và chưa thấy thường là một không gian ngữ nghĩa chung, thường được xây dựng từ các mô tả bằng văn bản hoặc đồ thị tri thức.
Tại sao điều đó lại quan trọng
- Các danh mục mới liên tục xuất hiện và việc gắn nhãn cho chúng diễn ra chậm.
- Một số loại rất hiếm hoặc không thể sưu tập với số lượng lớn.
- Các mô hình ngôn ngữ lớn hiện nay thực hiện nhiều tác vụ mà không cần huấn luyện gì từ một lời nhắc lệnh.
- Điều này giúp giảm chi phí triển khai mô hình sang các lĩnh vực mới.
Hiệu năng của học không cần huấn luyện vẫn kém hơn so với học có giám sát trên hầu hết các bộ dữ liệu chuẩn. Khoảng cách này thu hẹp lại khi các mô tả bổ trợ phong phú và các lớp chưa được thấy gần với phân bố dữ liệu huấn luyện. Khi chúng cách xa nhau, mô hình dự đoán kém chính xác và thường đưa ra dự đoán quá tự tin.
Comments (2)
Leave a comment