Os dados de treino ensinam um modelo de aprendizagem automática. O modelo observa exemplos e aprende a relação entre as entradas e as saídas. Para um filtro de spam, os dados de formação são e-mails classificados como spam ou não spam. Para um classificador de imagens, são fotos rotuladas com o seu conteúdo. Para um modelo de linguagem, são grandes quantidades de texto. O modelo ajusta os seus parâmetros internos para minimizar a diferença entre as suas previsões e os rótulos corretos. A qualidade e a quantidade dos dados de treino determinam o desempenho do modelo.
Os dados de treino têm vários requisitos. Devem ser representativos dos dados do mundo real que o modelo irá encontrar. Um modelo treinado apenas com fotos diurnas falha com fotos noturnas. Devem ser rotulados com precisão. Exemplos rotulados incorretamente ensinam padrões errados ao modelo. Devem ser suficientemente grandes para captar a variação dos dados. Poucos dados levam ao sobreajuste (overfitting), onde o modelo memoriza os exemplos de treino em vez de aprender padrões gerais. Devem estar isentos de enviesamento, ou o modelo aprenderá e amplificará esse enviesamento. Os dados de treino são também uma preocupação com a privacidade. Os modelos treinados com dados pessoais podem memorizá-los e reproduzi-los. As estruturas regulamentares exigem cada vez mais a documentação das fontes e do processamento dos dados de treino. Os dados não são apenas uma entrada. São um passivo e um ativo. O modelo é tão bom quanto os dados com que aprendeu.
Requisitos de dados de formação
- Representativo — reflete a variação do mundo real
- Etiquetado — verdade fundamental precisa
- Grande — exemplos suficientes para generalizar
- Imparcial — sem distorção sistemática
- Documentado — proveniência e processamento conhecidos
Os dados de formação são os professores. O modelo aprende o que os dados mostram. Os maus dados ensinam lições ruins.
Comments
No comments yet. Be the first to share a thought.
Leave a comment