Trénovací data učí model strojového učení. Model vidí příklady a učí se vztah mezi vstupy a výstupy. Pro spamový filtr jsou trénovacími daty e-maily označené jako spam nebo nespam. Pro klasifikátor obrázků jsou to fotografie označené jejich obsahem. Pro jazykový model jsou to obrovské množství textu. Model upravuje své interní parametry tak, aby minimalizoval rozdíl mezi svými predikcemi a správnými označeními. Kvalita a množství trénovacích dat určují, jak dobře model funguje.
Trénovací data mají několik požadavků. Musí být reprezentativní pro reálná data, se kterými se model setká. Model trénovaný pouze na denních fotografiích selhává na nočních fotografiích. Musí být přesně označena. Špatně označené příklady učí model nesprávným vzorcům. Data musí být dostatečně velká, aby zachytila variaci v datech. Příliš málo dat vede k přeučení, kdy si model pamatuje trénovací příklady, místo aby se učil obecné vzorce. Data nesmí být zkreslená, jinak se model naučí a toto zkreslení zesílí. Trénovací data představují také problém s ochranou soukromí. Modely trénované na osobních datech si je mohou zapamatovat a reprodukovat. Regulační rámce stále častěji vyžadují dokumentaci zdrojů a zpracování trénovacích dat. Data nejsou jen vstupem. Jsou to jak závazek, tak i přínos. Model je jen tak dobrý, jako data, ze kterých se učil.
Požadavky na tréninková data
- Reprezentativní – odráží variace z reálného světa
- Označeno – přesná pravdivá informace
- Rozsáhlé – dostatek příkladů k zobecnění
- Nestranné – žádné systematické zkreslení
- Zdokumentováno – původ a zpracování známé
Trénovací data jsou učitelem. Model se učí to, co data ukazují. Špatná data učí špatné lekce.
Comments
No comments yet. Be the first to share a thought.
Leave a comment