Un model antrenat să recunoască pisicile și câinii știe deja ceva despre margini, texturi și blană. Învățarea prin transfer exploatează acest lucru: în loc să pornești de la ponderi aleatorii, începi cu o rețea care a învățat dintr-un set mare de date și o ajustezi fin la problema ta specifică, mai mică. Cunoștințele dobândite în prima sarcină se transferă la a doua.
Abordarea a devenit standard deoarece datele etichetate sunt rare, iar calculul este costisitor. Antrenarea unui model vizual de la zero pe 5.000 de imagini medicale rareori funcționează. Luarea unei rețele pre-antrenate pe ImageNet și re-antrenarea straturilor finale ale acesteia funcționează adesea. Straturile timpurii detectează caracteristici generice; straturile ulterioare se specializează.
Strategii comune
- Extragerea caracteristicilor: înghețarea straturilor pre-antrenate și antrenarea doar a unui nou cap de clasificare
- Reglare fină: dezghețați unele sau toate straturile și continuați antrenamentul cu o rată mică de învățare
- Adaptarea domeniului: ajustarea unui model de la o distribuție de date la alta, cum ar fi sintetic la real
Modelele lingvistice mari au dus acest lucru și mai departe. Un singur model pre-antrenat poate fi adaptat la redactarea de texte juridice, codarea medicală sau asistența clienți cu o instruire suplimentară modestă. Problema este transferul negativ: dacă sarcinile sursă și țintă sunt prea diferite, ponderile pre-antrenate pot dăuna în loc să ajute.
Comments
No comments yet. Be the first to share a thought.
Leave a comment