Hãy tưởng tượng bạn đang đi xuống một ngọn đồi phủ đầy sương mù, cảm nhận độ dốc dưới chân và bước theo hướng đi xuống. Thuật toán gradient descent cũng làm điều tương tự với một hàm mất mát. Nó tính toán độ dốc, thực hiện một bước và lặp lại cho đến khi hàm mất mát không còn cải thiện nữa.
Tốc độ học kiểm soát kích thước bước. Quá lớn sẽ khiến bạn vượt quá điểm tối thiểu. Quá nhỏ thì quá trình huấn luyện sẽ mất rất nhiều thời gian. Momentum, Adam và các thuật toán tối ưu hóa khác điều chỉnh tốc độ trong quá trình huấn luyện để tăng tốc độ hội tụ.
Các biến thể phổ biến
- Thuật toán giảm độ dốc theo lô sử dụng tất cả dữ liệu
- Thuật toán giảm độ dốc ngẫu nhiên sử dụng một mẫu
- Thuật toán giảm độ dốc theo lô nhỏ sử dụng các nhóm nhỏ.
- Động lực và các phương pháp thích ứng như Adam
Các bề mặt mất mát không lồi khiến hành trình trở nên khó khăn. Các điểm yên ngựa, cực tiểu địa phương và vùng bằng phẳng đều làm chậm tiến độ. Trên thực tế, các phương pháp ngẫu nhiên thoát khỏi những cạm bẫy nông và tìm ra các giải pháp tốt ngay cả khi không có đảm bảo về tính tối ưu toàn cục.
Comments
No comments yet. Be the first to share a thought.
Leave a comment