A számítógépes látás képessé teszi a robotokat a vizuális információk értelmezésére. A kamerák képeket rögzítenek. Az algoritmusok jelentést nyernek ki belőlük: élek, formák, tárgyak, arcok, mozgás. A robot ezt a jelentést használja navigálásra, kiválasztásra, ellenőrzésre vagy nyomon követésre.
A korai számítógépes látás kézzel kódolt szabályokra támaszkodott. Éleket kereshet, sablonokat illeszthet, távolságokat mérhet. Szabályozott megvilágításban működött, de mindenhol máshol kudarcot vallott. A mélytanulás ezt megváltoztatta. A konvolúciós neurális hálózatok címkézett képekből tanulnak jellemzőket. Felismerhetnek egy macskát, egy repedést egy hegesztésben vagy egy érett epret anélkül, hogy megmondanák nekik, mit kell keresniük.
Mit tesz lehetővé a számítógépes látás?
- Objektumdetektálás és osztályozás.
- Pózbecslés megragadáshoz.
- Vizuális szervovezérlés a precíz beállítás érdekében.
- Hibafelderítés a gyártásban.
- Egyidejű lokalizáció és térképezés (SLAM).
A látás nehézkes, mert a világ kaotikus. A világítás változik. A tárgyak átfedésben vannak. A tükröződések összezavarják a kamerákat. Egy robot, amely jól lát a laborban, a gyártócsarnokban meghibásodhat. A mérnökök több kamerát, strukturált fényt és mélységérzékelőket használnak a robusztusság növelése érdekében. Emellett a valós környezetből származó adatokon is tanulnak, nem csak tiszta adathalmazokon. A számítógépes látás nem véletlenül a robotika legaktívabb kutatási területe. Ha egy robot lát, akkor szinte bármit meg tud tenni. Ha nem, akkor vakon, ismétlődő mozgásra korlátozódik.
Comments
No comments yet. Be the first to share a thought.
Leave a comment