Wstępne trenowanie zapewnia modelowi ogólną wiedzę. Dostrajanie go specjalizuje. Proces kontynuuje trenowanie na mniejszym, specyficznym dla danego zadania zbiorze danych, dostosowując wagi, aby model działał dobrze w domenie docelowej.
Pełne dostrajanie aktualizuje każdy parametr, co jest kosztowne w przypadku dużych modeli. Metody efektywne pod względem parametrów, takie jak LoRA i adaptery, aktualizują tylko niewielki podzbiór, osiągając porównywalne wyniki przy ułamku mocy obliczeniowej.
Typowe scenariusze dostrajania
- Dostosowywanie modelu języka do domeny
- Nauczanie modelu wizji nowych kategorii
- Dopasowanie modelu do preferencji człowieka
- Poprawa wydajności w określonym teście porównawczym
Dostrajanie może również powodować problemy. Model może nadmiernie dopasować się do nowych danych, tracąc ogólne możliwości. Katastrofalne zapominanie usuwa wiedzę z wstępnego treningu. Ostrożne tempo uczenia się, łączenie danych i ewaluacja pomagają zminimalizować ryzyko.
Comments (3)
Leave a comment