Todo o modelo é um reflexo comprimido daquilo que lhe foi fornecido. Os dados de treino são essa dieta: a coleção de exemplos que um sistema de aprendizagem automática estuda antes de lhe ser pedido para realizar qualquer tarefa útil. Um modelo de reconhecimento facial pode aprender com milhões de retratos rotulados. Um motor de xadrez aprende com milhões de partidas. Um classificador médico aprende com exames de imagem anotados pelos radiologistas.
O volume ajuda, mas a composição importa ainda mais. Se os retratos forem predominantemente de pessoas brancas e masculinas, o modelo terá dificuldades com peles mais escuras e mulheres. Se os dados do jogo vierem apenas de jogadores amadores, o mecanismo atingirá um patamar. Os investigadores chamam-lhe uma mudança de distribuição, e é um dos motivos mais comuns pelos quais um modelo que parece brilhante em laboratório apresenta problemas em situações reais.
Questões práticas
- Qualidade dos rótulos: anotações ruidosas ou enviesadas prejudicam o modelo.
- Consentimento e licenciamento: os dados extraídos da web podem acarretar riscos legais.
- Privacidade: as informações pessoais têm frequentemente de ser apagadas ou anonimizadas.
- Representatividade: grupos raros necessitam de sobreamostragem deliberada.
A limpeza e a curadoria de dados consomem normalmente 60 a 80% do tempo de um projeto de aprendizagem automática. A parte glamorosa é a arquitetura; a parte decisiva é o conjunto de dados.
Comments
No comments yet. Be the first to share a thought.
Leave a comment