Forsterkende læring trener roboter gjennom prøving og feiling. Roboten utfører handlinger, mottar belønninger og justerer atferden sin for å maksimere belønningen. Det er slik en hund lærer å sitte for å få en godbit. Roboten trenger ikke merkede eksempler. Den trenger en måte å måle suksess på.
Rammeverket er en Markov-beslutningsprosess. Roboten observerer en tilstand, velger en handling, mottar en belønning og går over til en ny tilstand. Målet er en policy som knytter tilstander til handlinger for å maksimere kumulativ belønning. Dyp forsterkningslæring bruker nevrale nettverk for å representere policy- og verdifunksjonen. Den har løst spill som Go og Atari og trent roboter til å gå, gripe og fly.
Utfordringer med forsterkende læring
- Eksempel på effektivitet: roboter trenger millioner av forsøk.
- Belønningsdesign: det er vanskelig å utforme riktig belønning.
- Overføring fra simulering til reell: policyer trent i simulering kan mislykkes på maskinvare.
- Sikkerhet: utforskning kan skade roboten.
- Poengtildeling: hvilken handling førte til belønningen?
Mesteparten av forsterkningslæring for roboter skjer først i simulering. Roboten øver på tusenvis av levetider i en fysikkmotor, og overfører deretter policyen til den virkelige verden. Domenetilfeldighet, varierende friksjon, masse og sensorstøy i simulering, gjør policyen mer robust. Likevel består gapet mellom simulering og virkelighet. En policy som fungerer perfekt i simulering kan falle på ekte maskinvare. Forskere bruker systemidentifikasjon, adaptiv kontroll og restlæring for å lukke gapet. Forsterkningslæring er kraftig fordi den kan oppdage løsninger som mennesker ikke ville designet. Den er også uforutsigbar. En robot trent med RL kan finne en smart løsning eller en farlig en. Å sikre sikkerhet under læring er et åpent problem.
Comments
No comments yet. Be the first to share a thought.
Leave a comment