Международный научный коллектив с участием учёных МФТИ представил новую технологию стереозрения Un-ViTAStereo, которая определяет расстояние до объектов, не используя для обучения дорогостоящие лидары и ручную разметку. Она точна даже там, где «слепнут» современные алгоритмы: перед гладкими стенами, в густой листве или тумане.
Технология может применяться в том числе для безопасности беспилотных автомобилей и автономных роботов. Исследование опубликовано в IEEE Transactions on Circuits and Systems for Video Technology.
Каждую секунду наш мозг сопоставляет два немного разных изображения – от левого и правого глаза – и на основе разницы между ними строит трёхмерную карту мира. Стереосистемы роботов и беспилотных автомобилей устроены подобно зрению человека. Только вместо глаз они используют камеры, а вместо мозга – алгоритмы.
Но этот механизм срабатывает не везде. Например, при встрече с идеально белой стеной или зоной с повторяющимися узорами, алгоритму не хватает визуальных зацепок, чтобы верно сопоставить изображения.
Новый фреймворк для обучения нейросетей помогает преодолеть этот барьер. Учёные вводят в процесс обучения «наставника» – модель Depth Anything V2. Она умеет оценивать относительную глубину только с помощью «одного глаза» – одного изображения.
Иллюстрация работы алгоритма оценки достоверности диспаратности (DDCV).
«Модель Depth Anything V2 постоянно передаёт различные подсказки стереосистеме. Например: «Я не знаю, на сколько метров эта машина ближе дерева, но она точно ближе, и граница между ними должна быть резкой» или «На этой стене, где нет контраста, глубина должна меняться плавно»», – пояснил Александр Дворкович, руководитель проекта Научно-технического центра телекоммуникаций МФТИ.
Система работает в три этапа. Сначала алгоритм оценки диспаратности проверяет каждый пиксель, соответствуют ли его данные подсказкам «наставника», и помечает их зелёным (верно) и красным (ошибка) цветом.
Затем функция потерь на основе локального ранжирования глубины ищет вокруг каждой красной точки несколько зеленых соседей. Подобно маякам, они задают границы и сдвигают красный пиксель на нужное место.
Наконец, алгоритм «Двойная функция потерь сглаживания диспаратности» помогает построить контуры. Она убирает цифровой шум там, где «наставник» говорит, что цвет должен быть равномерным, и наоборот.
Работу системы уже протестировали на стандартных датасетах. Результат – абсолютное превосходство Un-ViTAStereo среди всех аналогов на бенчмарке.
«На тесте беспилотников KITTI 2015 долю грубых ошибок удалось снизить до 5%. Это значит, что при движении будет на 23% меньше опасных ошибок в определении расстояний до объектов (бордюра или пешехода)», – добавил Александр Дворкович.
Экспериментальные результаты работы систем и данной работы на стереодатасетах KITTI, MiddEval, ETH3D. Изображения в первом ряду каждого метода представляют оценочные карты глубины, а изображения во втором ряду демонстрируют визуализации ошибки.
Текущая версия Un-ViTAStereo – только начало. На ее основе учёные планируют создать самообучающуюся нейросеть, которая сможет адаптироваться под специфику разных сред – от городских улиц до заводских цехов.
Также исследователи хотят использовать редкие, но точные измерения лидаров в качестве «супер-маяков» для обучения, что еще больше повысит точность системы.
Источник: МФТИ
Оцените новость 0 0 0 0 0 0 0
- Unvitastereo
- Стереозрение
- Беспилотники
- Depthanythingv2
- Мфти
- Ieee