Um modelo treinado para reconhecer gatos e cães já possui algum conhecimento sobre bordas, texturas e pelos. A aprendizagem por transferência explora este conhecimento: em vez de começar com pesos aleatórios, parte de uma rede que aprendeu com um grande conjunto de dados e ajusta-a para o seu problema específico e mais pequeno. O conhecimento adquirido na primeira tarefa é transferido para a segunda.
Esta abordagem tornou-se padrão porque os dados rotulados são escassos e o poder computacional é elevado. Treinar um modelo de visão a partir do zero com 5.000 imagens médicas raramente funciona. Utilizar uma rede pré-treinada no ImageNet e voltar a treinar as suas camadas finais geralmente funciona. As primeiras camadas detetam características genéricas; as camadas posteriores especializam-se.
Estratégias comuns
- Extração de características: congele as camadas pré-treinadas e treine apenas uma nova camada de classificação.
- Ajuste fino: descongele algumas ou todas as camadas e continue o treino com uma taxa de aprendizagem baixa.
- Adaptação de domínio: ajustar um modelo de uma distribuição de dados para outra, como por exemplo de dados sintéticos para dados reais.
Grandes modelos de linguagem alargaram ainda mais esse alcance. Um único modelo pré-formado pode ser adaptado para a redação jurídica, codificação médica ou apoio ao cliente com uma formação adicional modesta. A desvantagem é a transferência negativa: se as tarefas de origem e de destino forem muito diferentes, os pesos pré-treinados podem prejudicar em vez de ajudar.
Comments
No comments yet. Be the first to share a thought.
Leave a comment