Minden modell a kapott táplálék tömörített tükörképe. A betanítási adatok jelentik ezt az étrendet: a példák gyűjteményét, amelyeket egy gépi tanulási rendszer tanulmányoz, mielőtt bármilyen hasznos feladat elvégzésére kérnék. Egy arcfelismerő modell több millió címkézett portréból tanulhat. Egy sakkmotor több millió játékból tanulhat. Egy orvosi osztályozó radiológusok által jegyzett szkennelésekből tanul.
A hangerő segít, de a kompozíció jobban számít. Ha a portrék fehér és férfi színekben ferdék, a modell sötétebb bőrű és női modelleken nem fog működni. Ha a játékadatok csak amatőr játékosoktól származnak, a motor stagnálni fog. A kutatók ezt eloszlásbeli eltolódásnak nevezik, és ez az egyik leggyakoribb oka annak, hogy egy laboratóriumban briliánsnak tűnő modell megbotlik a vadonban.
Gyakorlati aggályok
- Címkeminőség: a zajos vagy elfogult annotációk mérgezik a modellt
- Hozzájárulás és licencelés: a webről kinyert adatok jogi kockázattal járhatnak
- Adatvédelem: a személyes adatokat gyakran törölni vagy anonimizálni kell
- Reprezentáció: a ritka csoportok szándékos túlmintavételezést igényelnek
Az adatok tisztítása és gondozása jellemzően egy gépi tanulási projekt idejének 60-80 százalékát teszi ki. A legvonzóbb rész az architektúra; a döntő rész pedig az adathalmaz.
Comments
No comments yet. Be the first to share a thought.
Leave a comment