Os rótulos são caros. Os dados brutos são baratos. A aprendizagem semissupervisionada combina um pequeno conjunto rotulado com um grande conjunto não rotulado, utilizando a estrutura dos dados não rotulados para melhorar a generalização para além do que os rótulos por si só poderiam alcançar.
As abordagens variam. O autotreino rotula os exemplos não rotulados com um modelo e depois retreina-o no conjunto combinado. A regularização de consistência obriga o modelo a produzir saídas semelhantes para versões perturbadas da mesma entrada. Os métodos baseados em grafos propagam rótulos através de redes de similaridade.
Técnicas semi-supervisionadas comuns
- Autoaprendizagem e pseudo-rotulagem
- Regularização de consistência
- Minimização da entropia
- Propagação de rótulos baseada em grafos
- Pré-treino contrastivo seguido de ajuste fino
Os resultados dependem muito dos dados. Se os exemplos não rotulados provierem de uma distribuição diferente da dos exemplos rotulados, o desempenho poderá ser prejudicado. A validação cuidadosa e a correspondência de domínios são tão importantes como o algoritmo.
Comments
No comments yet. Be the first to share a thought.
Leave a comment