Elk model is een gecomprimeerde weerspiegeling van wat het is aangeleverd. Trainingsdata is dat dieet: de verzameling voorbeelden die een machine learning-systeem bestudeert voordat het gevraagd wordt iets nuttigs te doen. Een gezichtsherkenningsmodel kan leren van miljoenen gelabelde portretten. Een schaakprogramma leert van miljoenen partijen. Een medisch classificatiesysteem leert van scans die door radiologen zijn geannoteerd.
Volume is belangrijk, maar compositie is nog belangrijker. Als de portretten overwegend wit en mannelijk zijn, zal het model falen bij een donkere huidskleur en vrouwen. Als de spelgegevens alleen afkomstig zijn van amateurspelers, zal de engine stagneren. Onderzoekers noemen dit een verschuiving in de verdeling, en het is een van de meest voorkomende redenen waarom een model dat in het lab briljant presteert, in de praktijk tekortschiet.
Praktische overwegingen
- Kwaliteit van de labels: ruisende of bevooroordeelde annotaties vergiftigen het model.
- Toestemming en licenties: via webscraping verkregen gegevens kunnen juridische risico's met zich meebrengen.
- Privacy: persoonlijke gegevens moeten vaak worden verwijderd of geanonimiseerd.
- Representatie: zeldzame groepen vereisen doelbewuste oversampling.
Het opschonen en ordenen van data neemt doorgaans 60 tot 80 procent van de tijd van een machine learning-project in beslag. Het aantrekkelijke gedeelte is de architectuur; het cruciale onderdeel is de dataset.
Comments
No comments yet. Be the first to share a thought.
Leave a comment