Распознавание объектов определяет, что находится на изображении или сканированном датчике. Это человек, автомобиль, кофейная чашка, дефект? Роботу необходимо знать, на что он смотрит, прежде чем он сможет принять решение. Распознавание — это первый шаг в восприятии.
Ранние системы использовали созданные вручную признаки: края, углы, текстуры. Они работали для конкретных объектов при контролируемом освещении. Глубокое обучение изменило все. Сверточные нейронные сети обучаются признакам на основе размеченных данных. Сеть, обученная на миллионах изображений, может распознавать тысячи категорий объектов со сверхчеловеческой точностью в тестах производительности. В реальном мире производительность снижается при изменении освещения, перекрытии объектов или движении камеры.
задачи распознавания объектов
- Классификация: что изображено на картинке?
- Обнаружение: где оно находится и что оно собой представляет?
- Сегментация: какие пиксели принадлежат объекту?
- Оценка позы: как она ориентирована?
- Отслеживание: куда оно перемещается с течением времени?
Робот может использовать распознавание для выбора определенной детали из контейнера, избегания пешехода или проверки сварного шва на наличие дефектов. Проблема заключается в обобщении. Нейронная сеть, обученная на изображениях, полученных при солнечном дневном свете, может оказаться неэффективной ночью. Нейронная сеть, обученная на деталях одного завода, может оказаться неэффективной на деталях другого. Сбор и расширение данных так же важны, как и архитектура модели. Лучшие системы сочетают глубокое обучение с геометрическим мышлением и объединением данных с датчиков. Камера может распознать объект. Лидар подтверждает его положение. Датчики силы подтверждают захват. Распознавание — это не просто визуальное восприятие. Это понимание того, что роботу необходимо знать.
Comments
No comments yet. Be the first to share a thought.
Leave a comment