Model wytrenowany do rozpoznawania kotów i psów wie już coś o krawędziach, fakturach i futrze. Wykorzystanie transferu wiedzy w uczeniu: zamiast zaczynać od losowych wag, zaczynasz od sieci, która uczy się z dużego zbioru danych i dostrajasz ją do mniejszego, szczegółowego problemu. Wiedza zdobyta w pierwszym zadaniu przenosi się do drugiego.
To podejście stało się standardem, ponieważ dane z etykietami są rzadkie, a obliczenia kosztowne. Trenowanie modelu widzenia od podstaw na podstawie 5000 obrazów medycznych rzadko się sprawdza. Często się to udaje, gdy sieć jest wstępnie wytrenowana w ImageNet i ponownie trenuje jej warstwy końcowe. Wczesne warstwy wykrywają cechy generyczne; późniejsze warstwy się specjalizują.
Typowe strategie
- Ekstrakcja cech: zamroź wstępnie wyszkolone warstwy i wytrenuj tylko nową głowicę klasyfikatora
- Dokładne dostrajanie: odmroź niektóre lub wszystkie warstwy i kontynuuj szkolenie z małą szybkością uczenia się
- Adaptacja domeny: dostosowanie modelu z jednego rozkładu danych do innego, np. z syntetycznego do rzeczywistego
Duże modele językowe posunęły ten problem jeszcze dalej. Pojedynczy, wstępnie wytrenowany model można dostosować do pisania tekstów prawniczych, kodowania medycznego lub obsługi klienta po niewielkim dodatkowym szkoleniu. Problemem jest negatywny transfer: jeśli zadania źródłowe i docelowe są zbyt różne, wstępnie wytrenowane wagi mogą zaszkodzić, a nie pomóc.
Comments
No comments yet. Be the first to share a thought.
Leave a comment