Az objektumfelismerés azonosítja a képen vagy az érzékelő által letapogatott képet. Az egy személy, egy autó, egy kávéscsésze vagy egy hiba? A robotnak tudnia kell, hogy mit néz, mielőtt eldönthetné, mit tegyen. A felismerés az érzékelés első lépése.
A korai rendszerek kézzel készített jellemzőket használtak: éleket, sarkokat, textúrákat. Ezek meghatározott objektumok esetén dolgoztak szabályozott megvilágításban. A mélytanulás mindent megváltoztatott. A konvolúciós neurális hálózatok címkézett adatokból tanulják meg a jellemzőket. Egy több millió képen betanított hálózat emberfeletti pontossággal képes felismerni több ezer objektumkategóriát a benchmark tesztek során. A való világban a teljesítmény csökken, amikor a megvilágítás változik, az objektumok átfedik egymást, vagy a kamera elmozdul.
Objektumfelismerési feladatok
- Besorolás: Mi látható a képen?
- Észlelés: hol van, és mi az?
- Szegmentáció: mely pixelek tartoznak az objektumhoz?
- Pózbecslés: hogyan orientálódik?
- Követés: merre mozog az idő múlásával?
Egy robot felismerést használhat arra, hogy kiválasszon egy adott alkatrészt egy ládából, elkerüljön egy gyalogost, vagy hibákat keressen egy hegesztésben. A kihívás az általánosítás. Egy napsütéses nappal készült képeken betanított hálózat éjszaka meghibásodhat. Egy gyár alkatrészein betanított hálózat egy másik gyárának alkatrészein meghibásodhat. Az adatgyűjtés és -kiegészítés ugyanolyan fontos, mint a modell architektúrája. A legjobb rendszerek ötvözik a mélytanulást a geometriai érveléssel és az érzékelőfúzióval. Egy kamera felismerheti az objektumot. A Lidar megerősíti a pozícióját. Az erőérzékelők megerősítik a megfogást. A felismerés nem csak a látásról szól. Arról is szól, hogy megértsük, mit kell tudnia a robotnak.
Comments
No comments yet. Be the first to share a thought.
Leave a comment