Popisky jsou drahé. Nezpracovaná data jsou levná. Polo-supervizované učení kombinuje malou označenou množinu s velkou neoznačenou množinou a využívá strukturu neoznačených dat ke zlepšení zobecnění nad rámec toho, čeho by samotné popisky mohly dosáhnout.
Přístupy se liší. Samotrénování označuje neoznačené příklady modelem a poté se provádí retrénování na kombinované sadě. Regularizace konzistence nutí model produkovat podobné výstupy pro perturbované verze stejného vstupu. Metody založené na grafech šíří označení prostřednictvím sítí podobnosti.
Běžné techniky s polosupervizí
- Samotrénování a pseudo-nálepkování
- Regularizace konzistence
- Minimalizace entropie
- Šíření štítků na základě grafů
- Kontrastivní předtrénink následovaný jemným doladěním
Výsledky silně závisí na datech. Pokud neoznačené příklady pocházejí z jiné distribuce než označené, může se výkon snížit. Pečlivá validace a porovnávání domén jsou stejně důležité jako algoritmus.
Comments
No comments yet. Be the first to share a thought.
Leave a comment