A aprendizagem por reforço treina robôs através de tentativa e erro. O robô executa ações, recebe recompensas e ajusta o seu comportamento para maximizar essa recompensa. É assim que um cão aprende a sentar-se para ganhar uma guloseima. O robô não necessita de exemplos rotulados. Ele precisa de uma forma de medir o sucesso.
A estrutura é um processo de decisão de Markov. O robô observa um estado, escolhe uma ação, recebe uma recompensa e transita para um novo estado. O objetivo é uma política que mapeie os estados para as ações de forma a maximizar a recompensa cumulativa. A aprendizagem por reforço profundo utiliza redes neuronais para representar a política e a função de valor. Já resolveu jogos como Go e Atari e treinou robôs para andar, agarrar e voar.
Desafios de aprendizagem por reforço
- Eficiência da amostra: os robôs precisam de milhões de tentativas.
- Design de recompensas: criar a recompensa certa é difícil.
- Transferência da simulação para a realidade: as políticas treinadas em simulação podem falhar no hardware.
- Segurança: a exploração pode danificar o robô.
- Atribuição de crédito: que ação levou à recompensa?
A maior parte da aprendizagem por reforço para robôs ocorre primeiro em simulação. O robô pratica milhares de ciclos de vida num motor de física e depois transfere a política para o mundo real. A randomização do domínio, variando o atrito, a massa e o ruído dos sensores na simulação, torna a política mais robusta. Ainda assim, o fosso entre a simulação e a realidade persiste. Uma política que funciona perfeitamente na simulação pode falhar no hardware real. Os investigadores usam a identificação de sistemas, o controlo adaptativo e a aprendizagem residual para reduzir esta lacuna. A aprendizagem por reforço é poderosa porque pode descobrir soluções que os humanos não projetariam. Também é imprevisível. Um robô treinado com aprendizagem por reforço pode encontrar uma solução inteligente ou uma perigosa. Garantir a segurança durante a aprendizagem é um problema em aberto.
Comments
No comments yet. Be the first to share a thought.
Leave a comment