Etykiety są drogie. Surowe dane są tanie. Uczenie półnadzorowane łączy mały zbiór oznaczonych danych z dużym zbiorem nieoznaczonym, wykorzystując strukturę nieoznaczonych danych do poprawy generalizacji wykraczającej poza możliwości samych etykiet.
Podejścia są różne. Samouczenie oznacza nieoznakowane przykłady modelem, a następnie ponownie trenuje na połączonym zestawie. Regularyzacja spójności wymusza na modelu generowanie podobnych wyników dla zaburzonych wersji tych samych danych wejściowych. Metody oparte na grafach propagują etykiety poprzez sieci podobieństwa.
Typowe techniki półnadzorowane
- Samokształcenie i pseudoetykietowanie
- Regularyzacja spójności
- Minimalizacja entropii
- Propagacja etykiet oparta na grafie
- Kontrastowe wstępne szkolenie z późniejszym dostrojeniem
Wyniki w dużej mierze zależą od danych. Jeśli przykłady bez etykiet pochodzą z innego rozkładu niż te z etykietami, wydajność może spaść. Staranna walidacja i dopasowanie domen są równie ważne, jak algorytm.
Comments
No comments yet. Be the first to share a thought.
Leave a comment