Ein Modell, das darauf trainiert wurde, Katzen und Hunde zu erkennen, kennt bereits Kanten, Texturen und Fell. Transferlernen nutzt dieses Wissen: Anstatt mit zufälligen Gewichten zu beginnen, verwendet man ein Netzwerk, das anhand eines großen Datensatzes gelernt hat, und optimiert es für das kleinere, spezifische Problem. Das bei der ersten Aufgabe gewonnene Wissen lässt sich auf die zweite übertragen.
Dieser Ansatz hat sich als Standard etabliert, da gelabelte Daten rar und Rechenleistung teuer sind. Ein Bildverarbeitungsmodell von Grund auf mit 5.000 medizinischen Bildern zu trainieren, ist selten erfolgreich. Ein auf ImageNet vortrainiertes Netzwerk zu verwenden und dessen letzte Schichten neu zu trainieren, führt hingegen oft zum Erfolg. Die frühen Schichten erkennen allgemeine Merkmale, die späteren Schichten spezialisieren sich.
Gemeinsame Strategien
- Merkmalsextraktion: Die vortrainierten Schichten werden eingefroren und nur ein neuer Klassifikatorkopf trainiert.
- Feinabstimmung: Einige oder alle Ebenen wieder freigeben und das Training mit einer kleinen Lernrate fortsetzen.
- Domänenanpassung: Anpassung eines Modells von einer Datenverteilung an eine andere, z. B. von synthetischen an reale Daten.
Große Sprachmodelle haben diese Entwicklung weiter vorangetrieben. Ein einzelnes vortrainiertes Modell lässt sich mit geringem zusätzlichem Training an juristische Texte, medizinische Kodierung oder Kundensupport anpassen. Der Haken dabei ist der negative Transfer: Sind Quell- und Zielaufgabe zu unterschiedlich, können die vortrainierten Gewichte eher schaden als nutzen.
Comments
No comments yet. Be the first to share a thought.
Leave a comment