Datorseende ger robotar möjligheten att tolka visuell information. Kameror fångar bilder. Algoritmer extraherar betydelse: kanter, former, objekt, ansikten, rörelse. Roboten använder den betydelsen för att navigera, plocka, inspektera eller spåra.
Tidig datorseende förlitade sig på handkodade regler. Hitta kanter, matcha mallar, mät avstånd. Det fungerade i kontrollerad belysning men misslyckades överallt annars. Djupinlärning förändrade det. Konvolutionella neurala nätverk lär sig funktioner från märkta bilder. De kan känna igen en katt, en spricka i en svets eller en mogen jordgubbe utan att bli tillsagda vad de ska leta efter.
Vad datorseende möjliggör
- Objektdetektering och klassificering.
- Poseuppskattning för gripande.
- Visuell servostyrning för exakt uppriktning.
- Feldetektering i tillverkning.
- Samtidig lokalisering och mappning (SLAM).
Syn är svårt eftersom världen är rörig. Ljus förändras. Objekt överlappar varandra. Reflektioner förvirrar kameror. En robot som ser bra i labbet kan misslyckas på fabriksgolvet. Ingenjörer använder flera kameror, strukturerat ljus och djupsensorer för att öka robustheten. De tränar också på data från den verkliga miljön, inte bara rena datamängder. Datorseende är det mest aktiva forskningsområdet inom robotik av en anledning. Om en robot kan se kan den göra nästan vad som helst. Om den inte kan det är den begränsad till blind, repetitiv rörelse.
Comments
No comments yet. Be the first to share a thought.
Leave a comment