Bilder har struktur. Nærliggende piksler forholder seg til hverandre, og mønstre gjentar seg på tvers av bildet. Konvolusjonelle nettverk utnytter dette ved å skyve små filtre over inngangen, dele vekter og oppdage lokale funksjoner uansett hvor de vises.
En typisk arkitektur stabler konvolusjonslag, aktiveringsfunksjoner og pooling. Tidlige lag oppdager kanter og teksturer. Dypere lag kombinerer dem til deler og objekter. En siste klassifikator kartlegger de lærte funksjonene til etiketter.
Viktige byggesteiner
- Konvolusjonsfiltre med lærbare vekter
- Samling for å redusere romlige dimensjoner
- Skrittlengde og polstring for å kontrollere utdatastørrelsen
- Fullt tilkoblede lag for klassifisering
CNN-er dominerte visjon i et tiår, med start fra AlexNet i 2012. Visjonstransformatorer konkurrerer nå på mange benchmarks, men CNN-er er fortsatt effektive og mye distribuert i innebygde og mobile systemer.
Comments
No comments yet. Be the first to share a thought.
Leave a comment