Las imágenes tienen estructura. Los píxeles cercanos se relacionan entre sí y los patrones se repiten a lo largo del fotograma. Las redes neuronales convolucionales aprovechan esto deslizando pequeños filtros sobre la entrada, compartiendo pesos y detectando características locales dondequiera que aparezcan.
Una arquitectura típica combina capas de convolución, funciones de activación y agrupamiento (pooling). Las primeras capas detectan bordes y texturas. Las capas más profundas las combinan para formar partes y objetos. Un clasificador final asigna las características aprendidas a etiquetas.
Componentes básicos
- Filtros de convolución con pesos entrenables
- Agrupación para reducir las dimensiones espaciales
- Zancada y acolchado para controlar el tamaño de salida
- Capas totalmente conectadas para la clasificación
Las redes neuronales convolucionales (CNN) dominaron el campo de la visión artificial durante una década, comenzando con AlexNet en 2012. Actualmente, los transformadores de visión artificial compiten en numerosos parámetros de referencia, pero las CNN siguen siendo eficientes y ampliamente utilizadas en sistemas integrados y móviles.
Comments
No comments yet. Be the first to share a thought.
Leave a comment