Reinforcement learning traint robots door middel van vallen en opstaan. De robot voert acties uit, ontvangt beloningen en past zijn gedrag aan om de beloning te maximaliseren. Zo leert een hond bijvoorbeeld zitten voor een snoepje. De robot heeft geen gelabelde voorbeelden nodig. Hij heeft een manier nodig om succes te meten.
Het raamwerk is een Markov-beslissingsproces. De robot observeert een toestand, kiest een actie, ontvangt een beloning en gaat over naar een nieuwe toestand. Het doel is een beleid dat toestanden koppelt aan acties om de cumulatieve beloning te maximaliseren. Deep reinforcement learning gebruikt neurale netwerken om het beleid en de waardefunctie weer te geven. Het heeft spellen zoals Go en Atari opgelost en robots getraind om te lopen, grijpen en vliegen.
Uitdagingen van versterkingsleren
- Efficiëntie van de steekproef: robots hebben miljoenen proeven nodig.
- Beloningsontwerp: het bedenken van de juiste beloning is lastig.
- Overdracht van simulatie naar realiteit: beleidsregels die in een simulatie zijn getraind, kunnen op de hardware falen.
- Veiligheid: verkennen kan de robot beschadigen.
- Erkenning van de beloning: welke actie leidde tot de beloning?
Het meeste reinforcement learning voor robots vindt eerst in simulatie plaats. De robot oefent duizenden levenscycli in een physics engine en past het beleid vervolgens toe in de echte wereld. Domeinrandomisatie, variërende wrijving, massa en sensorruis in de simulatie maken het beleid robuuster. Toch blijft de kloof tussen simulatie en realiteit bestaan. Een beleid dat perfect werkt in de simulatie, kan in de praktijk falen. Onderzoekers gebruiken systeemidentificatie, adaptieve besturing en residual learning om deze kloof te dichten. Reinforcement learning is krachtig omdat het oplossingen kan vinden die mensen niet zouden bedenken. Het is echter ook onvoorspelbaar. Een robot die met RL is getraind, kan een slimme of een gevaarlijke oplossing vinden. Het waarborgen van de veiligheid tijdens het leerproces is een open vraagstuk.
Comments
No comments yet. Be the first to share a thought.
Leave a comment