Ученые МФТИ создали алгоритм, позволяющий роботам видеть мир без слепых зон

Международный научный коллектив с участием учёных МФТИ представил новую технологию стереозрения Un-ViTAStereo, которая определяет расстояние до объектов, не используя для обучения дорогостоящие лидары и ручную разметку. Она точна даже там, где «слепнут» современные алгоритмы: перед гладкими стенами, в густой листве или тумане.

Технология может применяться в том числе для безопасности беспилотных автомобилей и автономных роботов. Исследование опубликовано в IEEE Transactions on Circuits and Systems for Video Technology.

Каждую секунду наш мозг сопоставляет два немного разных изображения – от левого и правого глаза – и на основе разницы между ними строит трёхмерную карту мира. Стереосистемы роботов и беспилотных автомобилей устроены подобно зрению человека. Только вместо глаз они используют камеры, а вместо мозга – алгоритмы.

Но этот механизм срабатывает не везде. Например, при встрече с идеально белой стеной или зоной с повторяющимися узорами, алгоритму не хватает визуальных зацепок, чтобы верно сопоставить изображения.

Новый фреймворк для обучения нейросетей помогает преодолеть этот барьер. Учёные вводят в процесс обучения «наставника» – модель Depth Anything V2. Она умеет оценивать относительную глубину только с помощью «одного глаза» – одного изображения.

Иллюстрация работы алгоритма оценки достоверности диспаратности (DDCV).Иллюстрация работы алгоритма оценки достоверности диспаратности (DDCV).

«Модель Depth Anything V2 постоянно передаёт различные подсказки стереосистеме. Например: «Я не знаю, на сколько метров эта машина ближе дерева, но она точно ближе, и граница между ними должна быть резкой» или «На этой стене, где нет контраста, глубина должна меняться плавно»», – пояснил Александр Дворкович, руководитель проекта Научно-технического центра телекоммуникаций МФТИ.

Система работает в три этапа. Сначала алгоритм оценки диспаратности проверяет каждый пиксель, соответствуют ли его данные подсказкам «наставника», и помечает их зелёным (верно) и красным (ошибка) цветом.

Затем функция потерь на основе локального ранжирования глубины ищет вокруг каждой красной точки несколько зеленых соседей. Подобно маякам, они задают границы и сдвигают красный пиксель на нужное место.

Наконец, алгоритм «Двойная функция потерь сглаживания диспаратности» помогает построить контуры. Она убирает цифровой шум там, где «наставник» говорит, что цвет должен быть равномерным, и наоборот.

Работу системы уже протестировали на стандартных датасетах. Результат – абсолютное превосходство Un-ViTAStereo среди всех аналогов на бенчмарке.

«На тесте беспилотников KITTI 2015 долю грубых ошибок удалось снизить до 5%. Это значит, что при движении будет на 23% меньше опасных ошибок в определении расстояний до объектов (бордюра или пешехода)», – добавил Александр Дворкович.

Экспериментальные результаты работы систем и данной работы на стереодатасетах KITTI, MiddEval, ETH3D. Изображения в первом ряду каждого метода представляют оценочные карты глубины, а изображения во втором ряду демонстрируют визуализации ошибки.Экспериментальные результаты работы систем и данной работы на стереодатасетах KITTI, MiddEval, ETH3D. Изображения в первом ряду каждого метода представляют оценочные карты глубины, а изображения во втором ряду демонстрируют визуализации ошибки.

Текущая версия Un-ViTAStereo – только начало. На ее основе учёные планируют создать самообучающуюся нейросеть, которая сможет адаптироваться под специфику разных сред – от городских улиц до заводских цехов.

Также исследователи хотят использовать редкие, но точные измерения лидаров в качестве «супер-маяков» для обучения, что еще больше повысит точность системы.

Источник: МФТИ

Оцените новость 0 0 0 0 0 0 0

  • Unvitastereo
  • Стереозрение
  • Беспилотники
  • Depthanythingv2
  • Мфти
  • Ieee

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *