Os pesos são aprendidos. Os hiperparâmetros são escolhidos. A taxa de aprendizagem, o tamanho do lote, o número de camadas, a taxa de dropout e a intensidade da regularização enquadram-se nesta categoria. Controlam como o treino prossegue e como o modelo é estruturado.
Errar na escolha das taxas de aprendizagem desperdiça tempo e poder computacional. Uma taxa de aprendizagem demasiado elevada causa divergência. Uma taxa muito baixa provoca lentidão. O tamanho do lote afeta o ruído do gradiente e a utilização de memória. A profundidade e a largura determinam a capacidade, que deve ser compatível com a complexidade da tarefa e o tamanho dos dados.
Métodos comuns de ajustamento
- Pesquisa em grelha sobre um conjunto fixo
- Pesquisa aleatória para cobertura mais ampla
- Otimização Bayesiana para eficiência
- Formação baseada na população
- Afinação manual guiada pela intuição
O ajuste fino é caro. Cada configuração requer uma execução completa de treino, e o espaço de pesquisa cresce rapidamente. Os profissionais experientes restringem o espaço com conhecimento do domínio antes de automatizar, o que é geralmente mais eficaz do que a pesquisa por força bruta.
Comments (2)
Leave a comment