As imagens possuem estrutura. Os pixéis próximos relacionam-se entre si, e os padrões repetem-se ao longo da imagem. As redes convolucionais exploram isto deslizando pequenos filtros pela entrada, partilhando pesos e detetando características locais onde quer que apareçam.
Uma arquitetura típica empilha camadas de convolução, funções de ativação e pooling. As primeiras camadas detetam arestas e texturas. As camadas mais profundas combinam estes dados em partes e objetos. Um classificador final mapeia as características aprendidas para rótulos.
Elementos fundamentais
- Filtros de convolução com pesos treináveis
- Agrupamento para reduzir as dimensões espaciais
- Passo e espaçamento para controlar o tamanho da saída
- Camadas totalmente conectadas para classificação
As redes neuronais convolucionais (CNNs) dominaram o processamento da visão durante uma década, começando com a AlexNet em 2012. Os transformadores de visão competem agora em muitos benchmarks, mas as CNNs continuam a ser eficientes e amplamente utilizadas em sistemas embebidos e móveis.
Comments
No comments yet. Be the first to share a thought.
Leave a comment