Obrázky mají strukturu. Blízké pixely spolu souvisejí a vzory se v celém snímku opakují. Konvoluční sítě toho využívají k posouvání malých filtrů na vstup, sdílení vah a detekci lokálních prvků, ať se objeví kdekoli.
Typická architektura kombinuje konvoluční vrstvy, aktivační funkce a sdružování. První vrstvy detekují hrany a textury. Hlubší vrstvy je kombinují do částí a objektů. Finální klasifikátor mapuje naučené prvky na popisky.
Klíčové stavební bloky
- Konvoluční filtry s učitelnými váhami
- Sdružování pro zmenšení prostorových rozměrů
- Krok a odsazení pro ovládání velikosti výstupu
- Plně propojené vrstvy pro klasifikaci
CNN dominovaly v oblasti vidění po desetiletí, počínaje AlexNetem v roce 2012. Transformátory vidění nyní konkurují v mnoha kritériích, ale CNN zůstávají efektivní a široce používané v embedded a mobilních systémech.
Comments
No comments yet. Be the first to share a thought.
Leave a comment