Billeder har struktur. Nærliggende pixels relaterer sig til hinanden, og mønstre gentages på tværs af billedet. Konvolutionelle netværk udnytter dette ved at skubbe små filtre hen over inputtet, dele vægte og detektere lokale funktioner, uanset hvor de optræder.
En typisk arkitektur stabler konvolutionslag, aktiveringsfunktioner og pooling. Tidlige lag registrerer kanter og teksturer. Dybere lag kombinerer dem til dele og objekter. En endelig klassifikator knytter de lærte funktioner til etiketter.
Vigtige byggesten
- Konvolutionsfiltre med lærbare vægte
- Samling for at reducere rumlige dimensioner
- Skridt og polstring for at kontrollere outputstørrelsen
- Fuldt forbundne lag til klassificering
CNN'er dominerede vision i et årti, startende med AlexNet i 2012. Visiontransformere konkurrerer nu på mange benchmarks, men CNN'er er fortsat effektive og bredt anvendte i indlejrede og mobile systemer.
Comments
No comments yet. Be the first to share a thought.
Leave a comment