Model vycvičený k rozpoznávání koček a psů již ví něco o hranách, texturách a srsti. Transferové učení toho využívá: místo vycházení z náhodných vah začínáte se sítí, která se učila z velké datové sady, a dolaďujete ji na vašem menším, specifickém problému. Znalosti získané v prvním úkolu se přenášejí do druhého.
Tento přístup se stal standardem, protože označených dat je málo a výpočetní výkon je drahý. Trénování modelu vidění od nuly na 5 000 lékařských snímcích zřídkakdy funguje. Často to jde přetrénováním sítě předem na ImageNet a jejích finálních vrstev. První vrstvy detekují obecné rysy; pozdější vrstvy se specializují.
Běžné strategie
- Extrakce prvků: zmrazení předtrénovaných vrstev a trénování pouze nové hlavy klasifikátoru
- Jemné doladění: rozmrazení některých nebo všech vrstev a pokračování v učení s malou rychlostí učení
- Adaptace domény: úprava modelu z jedné distribuce dat na jinou, například ze syntetické na reálnou
Rozsáhlé jazykové modely tento problém posunuly ještě dále. Jeden předtrénovaný model lze s mírným dodatečným tréninkem přizpůsobit pro právní psaní, lékařské kódování nebo zákaznickou podporu. Háček je v negativním přenosu: pokud se zdrojový a cílový úkol příliš liší, předtrénované váhy mohou spíše uškodit než pomoci.
Comments
No comments yet. Be the first to share a thought.
Leave a comment