Etiketter är dyra. Rådata är billiga. Semiövervakad inlärning kombinerar en liten märkt mängd med en stor omärkt mängd, och använder strukturen hos omärkta data för att förbättra generaliseringen utöver vad enbart etiketter skulle kunna uppnå.
Metoderna varierar. Självträning märker omärkta exempel med en modell och tränar sedan om på den kombinerade mängden. Konsistensregularisering tvingar modellen att producera liknande utdata för störda versioner av samma indata. Grafbaserade metoder sprider etiketter genom likhetsnätverk.
Vanliga halvövervakade tekniker
- Självträning och pseudo-märkning
- Konsekvensreglering
- Entropiminimering
- Grafbaserad etikettförökning
- Kontrastiv förträning följt av finjustering
Resultaten är starkt beroende av data. Om omärkta exempel kommer från en annan distribution än märkta exempel kan prestandan försämras. Noggrann validering och domänmatchning är lika viktig som algoritmen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment