EN - FR - DE - ES - IT - PT -

LexiconDream

🎮 Forstærkningslæring

Træning af robotter gennem trial and error med belønninger.

Forstærkningslæring

Forstærkningslæring træner robotter gennem trial and error. Robotten udfører handlinger, modtager belønninger og justerer sin adfærd for at maksimere belønningen. Det er sådan en hund lærer at sidde for at få en godbid. Robotten behøver ikke mærkede eksempler. Den har brug for en måde at måle succes på.

Rammen er en Markov-beslutningsproces. Robotten observerer en tilstand, vælger en handling, modtager en belønning og overgår til en ny tilstand. Målet er en politik, der knytter tilstande til handlinger for at maksimere den kumulative belønning. Dyb forstærkningslæring bruger neurale netværk til at repræsentere politik- og værdifunktionen. Den har løst spil som Go og Atari og trænet robotter til at gå, gribe og flyve.

Udfordringer med forstærkning af læring

Det meste af forstærkningslæringen for robotter sker først i simulering. Robotten øver sig i tusindvis af levetider i en fysikmotor og overfører derefter politikken til den virkelige verden. Domænerandomisering, varierende friktion, masse og sensorstøj i simulering, gør politikken mere robust. Alligevel forbliver kløften mellem simulering og virkelighed stadig til stede. En politik, der fungerer perfekt i simulering, kan falde på rigtig hardware. Forskere bruger systemidentifikation, adaptiv kontrol og residual læring til at lukke kløften. Forstærkningslæring er kraftfuld, fordi den kan opdage løsninger, som mennesker ikke ville designe. Den er også uforudsigelig. En robot trænet med RL kan finde en smart løsning eller en farlig en. At sikre sikkerhed under læring er et åbent problem.

Comments

No comments yet. Be the first to share a thought.

Leave a comment