Uma criança que nunca viu uma zebra ainda consegue reconhecê-la depois de lhe dizerem que se parece com um cavalo listrado. A aprendizagem zero-shot pede às máquinas que façam algo semelhante: lidar com classes ou tarefas para as quais nunca foram treinadas, utilizando informação auxiliar como descrições de atributos ou relações semânticas.
Na classificação de imagens, um modelo zero-shot pode ser treinado com gatos e cães, mas solicitado a identificar um lobo. Se o modelo aprendeu atributos como "tem pelo", "tem orelhas pontiagudas" e "vive em matilhas", pode compô-los numa representação de lobo sem nunca ter visto um. A ponte entre as classes vistas e não vistas é, geralmente, um espaço semântico partilhado, frequentemente construído a partir de descrições textuais ou grafos de conhecimento.
Por que razão isso importa
- Novas categorias surgem constantemente e rotulá-las é lento.
- Algumas classes são raras ou impossíveis de colecionar em grande escala.
- Os grandes modelos de linguagem executam agora muitas tarefas automaticamente a partir de um único estímulo.
- Isto reduz o custo de implementação de um modelo em novos domínios.
O desempenho da aprendizagem zero-shot ainda fica atrás da aprendizagem supervisionada na maioria dos benchmarks. Esta diferença diminui quando as descrições auxiliares são ricas e as classes não vistas estão próximas da distribuição de treino. Quando estão muito afastados, o modelo faz más suposições e, frequentemente, com muita confiança.
Comments (2)
Leave a comment