Les réseaux de neurones convolutifs ont des difficultés avec l'orientation. Si l'on fait pivoter un visage, un réseau de neurones convolutif peut toujours détecter le nez, mais il perd la relation spatiale entre le nez et la bouche. Les réseaux à capsules tentent de préserver cette information en regroupant les neurones en capsules qui produisent des vecteurs plutôt que des scalaires.
Chaque capsule encode à la fois la présence d'une caractéristique et ses propriétés, telles que sa pose ou son orientation. Le routage dynamique permet aux capsules de niveau inférieur d'envoyer leur sortie aux capsules de niveau supérieur qui les partagent, établissant ainsi des relations partie-tout.
Avantages potentiels
- Meilleure gestion de la rotation et du point de vue
- Préservation des hiérarchies spatiales
- Moins besoin de grands ensembles d'entraînement
- Des représentations internes plus interprétables
L'adoption des réseaux de capsules reste limitée. Leur entraînement est lent et ils n'ont pas égalé les CNN sur les benchmarks à grande échelle. Ils constituent toujours un axe de recherche actif plutôt qu'une norme de production.
Comments
No comments yet. Be the first to share a thought.
Leave a comment