Wagi są uczone. Hiperparametry są wybierane. Do tej kategorii należą: tempo uczenia, wielkość partii, liczba warstw, wskaźnik rezygnacji i siła regularyzacji. Kontrolują one przebieg uczenia i strukturę modelu.
Błędne ich odczytanie marnuje czas i obliczenia. Zbyt wysokie tempo uczenia się powoduje rozbieżności. Zbyt niskie powoduje pełzanie. Rozmiar wsadu wpływa na szum gradientowy i wykorzystanie pamięci. Głębokość i szerokość określają pojemność, która musi być dostosowana do złożoności zadania i rozmiaru danych.
Typowe metody strojenia
- Przeszukiwanie siatki w ustalonym zbiorze
- Losowe wyszukiwanie w celu uzyskania szerszego zasięgu
- Optymalizacja bayesowska dla wydajności
- Szkolenie oparte na populacji
- Strojenie ręczne kierowane intuicją
Strojenie jest kosztowne. Każda konfiguracja wymaga pełnego treningu, a przestrzeń wyszukiwania szybko rośnie. Doświadczeni praktycy zawężają przestrzeń, wykorzystując wiedzę domenową przed automatyzacją, co często jest skuteczniejsze niż wyszukiwanie siłowe.
Comments (2)
Leave a comment