Imaginile au o structură. Pixelii din apropiere se leagă între ei, iar modelele se repetă pe întreg cadrul. Rețelele convoluționale exploatează acest lucru prin glisarea unor filtre mici pe intrare, partajarea ponderilor și detectarea caracteristicilor locale oriunde apar acestea.
O arhitectură tipică suprapune straturi de convoluție, funcții de activare și pooling. Straturile inițiale detectează muchii și texturi. Straturile mai profunde le combină în părți și obiecte. Un clasificator final mapează caracteristicile învățate la etichete.
Elemente constitutive cheie
- Filtre de convoluție cu ponderi învățabile
- Combinând pentru a reduce dimensiunile spațiale
- Pas și amortizare pentru controlul dimensiunii ieșirii
- Straturi complet conectate pentru clasificare
CNN-urile au dominat tehnologia viziunii timp de un deceniu, începând cu AlexNet în 2012. Transformatoarele de imagine concurează acum pe multe criterii de referință, dar CNN-urile rămân eficiente și utilizate pe scară largă în sistemele integrate și mobile.
Comments
No comments yet. Be the first to share a thought.
Leave a comment