Syntidata
Главная / Блог / Компьютерное зрение / Семантическая и инстанс-сегментация: в чём разница

Семантическая и инстанс-сегментация: в чём разница

Компьютерное зрение

Сегментация часто звучит как одна задача, но на деле их несколько, и они решают разные вопросы. Объясняем различия на примерах и подсказываем, что выбрать для вашего проекта.

Семантическая и инстанс-сегментация: в чём разница

Зачем вообще нужна сегментация

Рамка вокруг объекта подходит, когда важно знать, где он примерно находится. Но во многих задачах рамки грубы. Нужно измерить площадь коррозии на металле, отделить плод от листвы, найти свободное место на полке, рассчитать захват для манипулятора или определить границу дороги. Рамка включает в себя фон, а у вытянутых и наклонных предметов этого фона больше, чем самого предмета.

Сегментация присваивает метку каждому пикселю. Результат называется маской. Из маски легко получить рамку, площадь, контур, центр масс и ориентацию, поэтому сегментация даёт больше информации, чем детекция, но и стоит дороже в разметке.

Три основных вида

Семантическая сегментация

Каждому пикселю присваивается класс, но экземпляры не различаются. Если на кадре три автомобиля, все их пиксели получат один и тот же класс «автомобиль» и сольются в общее пятно. Такой подход подходит там, где важны области, а не отдельные предметы: дорога, небо, растительность, зона дефекта.

Инстанс-сегментация

Модель находит каждый отдельный объект и для каждого строит свою маску. Три автомобиля дадут три маски с разными идентификаторами. Фоновые области без чётких границ, такие как небо или трава, в этой задаче обычно не размечаются. Подход нужен, когда объекты нужно считать, измерять по отдельности или отслеживать.

Паноптическая сегментация

Объединяет оба подхода: счётные объекты получают отдельные маски, а фон разбивается на семантические области. Это самая полная карта сцены, и самая дорогая в разметке. Применяется в беспилотном транспорте, робототехнике, картографии.

Сравнение на конкретном примере

Возьмём склад с паллетами и коробками. Что получим при разных постановках?

ЗадачаЧто на выходеДля чего пригодно
ДетекцияРамки вокруг коробокГрубый подсчёт, поиск зон
Семантическая сегментацияОбласть «коробки», область «пол», область «стеллаж»Оценка занятости площади
Инстанс-сегментацияОтдельная маска на каждую коробкуТочный подсчёт плотно стоящих коробок, захват роботом
ПаноптическаяМаски коробок плюс области пола и стеллажейПолная схема склада

Видно, что при плотной укладке коробок рамки сильно перекрываются, а маски остаются чистыми. Именно поэтому инстанс-сегментация часто выигрывает в логистике и розничной торговле, где объекты стоят вплотную. О применении в магазинах читайте в статье про распознавание товаров на полке.

Как выбрать задачу под цель

Задайте себе четыре вопроса.

  1. Нужно ли считать отдельные объекты? Если да, берите инстанс-сегментацию или детекцию.
  2. Нужна ли форма или площадь? Если да, рамки недостаточны, нужна маска.
  3. Есть ли «безобъектные» области, важные для решения, как дорога, фон, зона допуска? Тогда пригодится семантическая или паноптическая постановка.
  4. Какой у вас бюджет на разметку и вычисления? Маски на порядок дороже рамок, а модели тяжелее.

Если сомневаетесь, начните с детекции, оцените результат и перейдите к сегментации, когда упрётесь в потолок рамок. Основы детекции описаны в статье про путь от задачи к модели.

Как устроены маски в данных

Существует несколько способов хранить сегментацию, и от выбора зависит удобство работы.

  • Растровая маска. Изображение того же размера, где значение пикселя — идентификатор класса или экземпляра. Удобна для семантической сегментации.
  • Полигоны. Набор точек, очерчивающих контур. Компактны, удобны для ручной разметки, но теряют мелкие детали.
  • Кодирование длин серий. Сжатое представление растровой маски, популярное в формате COCO.
  • Многослойные маски. Отдельная бинарная маска на каждый экземпляр, нужна при сильных перекрытиях.

Особенности форматов описаны в обзоре форматов аннотаций. Заранее договоритесь, какой формат принимает ваш конвейер обучения, чтобы не конвертировать тысячи файлов вручную.

Разметка масок: где возникают сложности

Ручная разметка масок трудоёмка: на один сложный объект уходят минуты, на загруженный кадр — десятки минут. При этом качество зависит от аккуратности и единообразия правил.

Типичные проблемы

  • Границы с размытием. Волосы, шерсть, листва, прозрачные материалы не имеют чёткого края. Нужно решить, где проходит граница, и записать правило.
  • Перекрытия. Закрытая часть объекта размечается или нет? Для большинства задач размечается только видимая часть, но для некоторых нужна полная форма.
  • Тонкие структуры. Провода, антенны, ручки легко теряются при упрощении полигонов.
  • Неоднозначные классы. Что считать деталью, а что отдельным объектом: колесо и автомобиль, ручка и чашка?
  • Усталость разметчиков. К концу смены контуры становятся грубее, поэтому нужен выборочный контроль, о котором мы писали в статье про контроль качества разметки.

Часть проблем снимается чёткой инструкцией. Как её составить, подробно разобрано в материале об инструкциях для разметчиков.

Маски из 3D: точность до пикселя

Есть другой путь получить маски: не рисовать, а вычислять. Если изображение создаётся рендером 3D-сцены, система знает, какому объекту принадлежит каждый пиксель. Маска строится автоматически, учитывает перекрытия, тонкие детали, полупрозрачность и совпадает с изображением идеально.

Такой подход даёт несколько практических преимуществ.

  1. Нет шума разметки. Все границы определены одним правилом.
  2. Любые виды аннотаций сразу. Вместе с масками выдаются рамки, карты глубины, нормали, ключевые точки.
  3. Полные и видимые маски. Можно получить как видимую часть, так и форму объекта целиком, включая закрытую часть.
  4. Масштаб. Тысячи и десятки тысяч кадров размечаются без роста затрат на людей.

Мы выдаём такие аннотации в рамках услуги по разметке датасетов, а сами сцены строятся на основе 3D-моделирования и визуализации.

Для задач, где граница объекта критична, например измерение площади или захват роботом, точность масок важнее объёма данных. Именно здесь синтетическая разметка даёт заметное преимущество.

Модели и метрики

Для инстанс-сегментации часто используют расширения детекторов: модель предсказывает рамку и маску внутри неё. Семантическая сегментация опирается на архитектуры «кодировщик-декодировщик» и трансформерные модели. Универсальные модели-основы, способные выделять объекты по подсказке, ускоряют разметку, но не заменяют обучение под вашу задачу.

Основные метрики

  • IoU для масок. Отношение площади пересечения предсказанной и эталонной маски к площади их объединения.
  • Средний IoU по классам. Стандартная метрика для семантической сегментации.
  • Средняя точность по порогам IoU. Основная метрика для инстанс-сегментации.
  • Качество границ. Отдельная оценка точности контура, важная для измерительных задач.

Определения IoU и точности есть в статье про метрики детекции; для масок используется тот же принцип, но считается по пикселям, а не по рамкам.

Типичные ошибки при работе с сегментацией

  • Брать сегментацию там, где хватило бы детекции, и платить за разметку впустую.
  • Размечать маски без зафиксированных правил и получать несогласованный набор.
  • Сжимать изображения до малого размера и терять тонкие структуры.
  • Оценивать только средние метрики и не смотреть границы.
  • Забывать про отрицательные примеры: кадры без объектов, чтобы модель не придумывала маски на фоне.

Практические примеры выбора

Чтобы закрепить различия, разберём три обезличенные ситуации.

Агротехнологии

Нужно оценить долю поражённой листвы на растении. Рамка бессмысленна: лист неправильной формы, пятно занимает часть листа. Подойдёт семантическая сегментация с классами «здоровая ткань», «поражённая ткань» и «фон». Метрика — доля площади, поэтому критична точность границ, а не количество найденных объектов.

Складская логистика

Нужно посчитать упаковки в плотном штабеле и подсказать роботу, какую взять. Здесь пригодится инстанс-сегментация: каждая коробка получает собственную маску, по маске вычисляется верхняя грань и точка захвата. Если коробки частично закрыты, важно, размечается ли только видимая часть. Для захвата достаточно видимой, для оценки загрузки нужна полная форма.

Автомобильные сцены

Для помощи водителю необходимо знать проезжую часть, разметку, тротуар, а также отдельные автомобили и пешеходов. Это типичная паноптическая постановка: дорога и тротуар как области, транспорт и люди как отдельные экземпляры.

Во всех трёх случаях решение определяется не модным названием модели, а тем, какое измерение или решение нужно получить из маски.

Что делать дальше

Определите, какой вид сегментации нужен для вашего решения, оцените объём данных и способ разметки. Если ручная разметка масок выглядит неподъёмной, а объекты можно смоделировать, посмотрите, как работают синтетические датасеты. Напишите нам на [email protected]: опишите объекты и условия, и мы предложим формат масок и тестовый набор по запросу.


Читайте также