Een model dat getraind is om katten en honden te herkennen, weet al iets over randen, texturen en vacht. Transfer learning maakt daar gebruik van: in plaats van te beginnen met willekeurige gewichten, begin je met een netwerk dat heeft geleerd van een grote dataset en verfijn je dat op jouw kleinere, specifieke probleem. De kennis die is opgedaan bij de eerste taak wordt overgedragen naar de tweede.
Deze aanpak is standaard geworden omdat gelabelde data schaars is en rekenkracht duur is. Het trainen van een computervisiemodel vanaf nul met 5000 medische afbeeldingen werkt zelden. Het hertrainen van de laatste lagen van een netwerk dat is getraind op ImageNet werkt vaak wel. De eerste lagen detecteren generieke kenmerken; de latere lagen specialiseren zich.
Algemene strategieën
- Kenmerkextractie: bevries de voorgegetrainde lagen en train alleen een nieuwe classifier-kop.
- Fijn afstellen: deblokkeer sommige of alle lagen en ga verder met trainen met een kleine leerfrequentie.
- Domeinadaptatie: het aanpassen van een model van de ene dataverdeling naar de andere, bijvoorbeeld van synthetische naar reële data.
Grote taalmodellen hebben dit verder gebracht. Een enkel voorgegetraind model kan met slechts een bescheiden hoeveelheid extra training worden aangepast aan juridische teksten, medische codering of klantenservice. Het probleem is negatieve transfer: als de bron- en doeltaken te veel van elkaar verschillen, kunnen de voorgegetrainde gewichten meer kwaad dan goed doen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment