Objektgjenkjenning identifiserer hva som er i et bilde eller en sensorskanning. Er det en person, en bil, en kaffekopp eller en defekt? Roboten må vite hva den ser på før den kan bestemme seg for hva den skal gjøre. Gjenkjenning er det første trinnet i persepsjon.
Tidlige systemer brukte håndlagde funksjoner: kanter, hjørner, teksturer. De fungerte for spesifikke objekter i kontrollert belysning. Dyp læring forandret alt. Konvolusjonelle nevrale nettverk lærer funksjoner fra merkede data. Et nettverk trent på millioner av bilder kan gjenkjenne tusenvis av objektkategorier med overmenneskelig nøyaktighet på benchmarktester. I den virkelige verden synker ytelsen når belysningen endres, objekter overlapper hverandre eller kameraet beveger seg.
Objektgjenkjenningsoppgaver
- Klassifisering: hva er på bildet?
- Deteksjon: hvor er den, og hva er den?
- Segmentering: hvilke piksler tilhører objektet?
- Posisjonsestimering: hvordan er den orientert?
- Sporing: hvor beveger den seg over tid?
En robot kan bruke gjenkjenning til å plukke en bestemt del fra en beholder, unngå en fotgjenger eller inspisere en sveis for defekter. Utfordringen er generalisering. Et nettverk trent på bilder fra solfylt dagslys kan svikte om natten. Et nettverk trent på deler fra én fabrikk kan svikte på deler fra en annen. Datainnsamling og utvidelse er like viktig som modellarkitekturen. De beste systemene kombinerer dyp læring med geometrisk resonnement og sensorfusjon. Et kamera kan gjenkjenne objektet. Lidar bekrefter posisjonen. Kraftsensorer bekrefter grepet. Gjenkjenning handler ikke bare om å se. Det handler om å forstå hva roboten trenger å vite.
Comments
No comments yet. Be the first to share a thought.
Leave a comment