Виды разметки изображений: обзор
Разметка данныхОт выбора вида разметки зависит и стоимость датасета, и то, чему в итоге научится модель. Разбираем основные виды аннотаций, их плюсы и ограничения и даём простую схему выбора.

Зачем различать виды разметки
Разметка превращает набор картинок в обучающий датасет: она сообщает модели, что именно нужно найти и где. Одно и то же изображение можно аннотировать по-разному: одной меткой на весь кадр, рамкой вокруг предмета, точной маской по контуру или набором точек на суставах. Чем детальнее разметка, тем дороже она в ручной работе и тем больше возможностей получает модель. Но избыточная точность не нужна: если задача сводится к подсчёту объектов, пиксельные маски только увеличат бюджет.
Для синтетических данных вопрос стоит иначе. Рендер сам знает геометрию каждого объекта, поэтому рамки, маски, глубину и ключевые точки можно получить одновременно и безошибочно, без дополнительных затрат на людей. Это одно из главных преимуществ нашего подхода, подробнее о нём на странице разметки: маски и баундинг-боксы. Но чтобы выбрать нужный набор аннотаций, всё равно нужно понимать, чем они отличаются.
Классификация изображения
Самый простой вид: каждому кадру присваивается одна или несколько меток. «На фото кошка», «деталь с дефектом», «на снимке автомобиль и пешеход». Положение объекта неважно.
Когда использовать:
- сортировка потока изображений по категориям;
- бинарные проверки вроде «годная или бракованная деталь», если дефект крупный;
- предварительная фильтрация данных перед более дорогой разметкой.
Ограничения очевидны. Модель не скажет, где объект, не посчитает количество экземпляров и не отличит один предмет от нескольких. Если на кадре могут быть разные объекты одновременно, нужна многометочная классификация, где каждая метка независима. Стоимость разметки самая низкая: несколько секунд на кадр.
Ограничивающие рамки
Прямоугольник вокруг объекта с указанием класса. Это основа детекции и самый распространённый вид разметки. Формат несложен: четыре числа, задающие положение и размер рамки. Модели вроде YOLO обучаются именно на таких аннотациях, о чём мы рассказывали в статье про обучение YOLO.
Преимущества: быстрая ручная разметка (5-15 секунд на объект), понятные метрики, широкая поддержка в библиотеках. Недостатки: рамка захватывает фон, особенно у наклонных и вытянутых объектов; перекрывающиеся предметы дают пересекающиеся рамки, из которых нельзя однозначно выделить пиксели каждого. Единые правила построения рамок вынесены в отдельный материал: правила разметки ограничивающих рамок.
Повёрнутые рамки
Для объектов на аэрофотоснимках, кораблей, текста и деталей на конвейере применяют рамки с углом поворота. Они плотнее прилегают к форме и меньше захватывают фон. Цена: пять параметров вместо четырёх и менее распространённые форматы.
Полигоны и маски сегментации
Если нужен точный контур, объект обводят многоугольником или закрашивают пикселями. Различают два режима:
- Семантическая сегментация. Каждому пикселю присваивается класс: дорога, небо, здание. Отдельные экземпляры не различаются.
- Инстанс-сегментация. Каждый экземпляр объекта получает собственную маску, и два соседних предмета одного класса можно разделить.
Различие подробно разобрано в статье про семантическую и инстанс-сегментацию. Ручная разметка масок трудоёмка: на сложный объект уходит от 30 секунд до нескольких минут, поэтому для реальных фотографий её стараются заменять полуавтоматическими инструментами. Для синтетики же маска, побочный продукт рендера, и качество определяется только точностью геометрии и разрешением. Тонкости описаны в материале про маски сегментации.
Паноптическая сегментация объединяет оба режима: каждому пикселю присваивается класс, а для «считаемых» объектов ещё и номер экземпляра. Её применяют в автономном транспорте и робототехнике.
Ключевые точки и скелеты
Размечаются отдельные характерные точки: суставы человека, углы корпуса детали, глаза и нос на лице. Точки соединяются в скелет или граф, который описывает форму и положение объекта. Для каждой точки указывается видимость: видна, закрыта или за пределами кадра.
Применение: оценка позы людей и животных, контроль положения детали для захвата роботом, анализ жестов. Подробнее мы описали это в статье про позы и ключевые точки. Ручная разметка здесь особенно утомительна: 17 точек на человека умножаются на количество людей в кадре, и точность важнее скорости. Синтетика даёт точки автоматически, потому что скелет модели известен.
Карты глубины, нормали и другие плотные аннотации
Помимо классических меток, существуют аннотации, которые вручную получить практически невозможно, зато из рендера они доступны бесплатно:
- Карта глубины. Для каждого пикселя расстояние до камеры. Нужна для оценки глубины, 3D-реконструкции, управления роботом.
- Карта нормалей. Направление поверхности в каждом пикселе. Используется при оценке формы и освещения.
- Оптический поток. Смещение каждого пикселя между кадрами; для видео и отслеживания движения.
- Карта визуальной видимости. Показывает, какая доля объекта видна, а какая закрыта другими. Помогает отфильтровать тяжёлые случаи.
- Позиция и ориентация 6D. Положение и поворот объекта в пространстве камеры, основа для захвата и сборки.
В реальных датасетах такие данные требуют лидаров, стереокамер или специализированных стендов, и всё равно содержат ошибки. В синтетических они точны по определению.
Сводная таблица: что выбрать
| Вид разметки | Трудоёмкость вручную | Что даёт модели | Типичная задача |
|---|---|---|---|
| Классификация | очень низкая | метка кадра | сортировка, фильтрация |
| Рамки | низкая | положение и размер | детекция, подсчёт |
| Полигоны и маски | высокая | точная форма | сегментация, измерения |
| Ключевые точки | высокая | поза и структура | оценка позы, захват |
| Глубина и нормали | практически невозможна вручную | геометрия сцены | робототехника, 3D |
Как выбрать вид разметки под задачу
Схема из трёх вопросов помогает не переплачивать.
- Что должна выдавать модель? Если достаточно ответа «да или нет», берите классификацию. Если нужно положение и количество, нужны рамки. Если площадь, форма, контур, маски. Если направление, поза, точки.
- Насколько точной должна быть граница? Подсчёт товаров на полке допускает неидеальные рамки. Измерение площади дефекта или обрезка фона требуют пиксельной точности.
- Какой бюджет разметки? Ручная маска стоит в 5-10 раз дороже рамки. Если бюджет ограничен, можно разметить маски на небольшой части выборки, а остальное сделать рамками. Однако при использовании синтетических данных этот компромисс часто снимается.
Типичная ошибка: брать самый детальный вид разметки «на всякий случай». Он замедляет проект, повышает вероятность ошибок и требует более сложных инструкций для разметчиков. Не менее частая обратная ошибка: сэкономить на рамках, а потом понять, что без масок нужную метрику посчитать нельзя. Переразметка всего датасета обойдётся дороже, чем разметка с запасом на старте.
Хорошее правило: разметка должна содержать ровно ту информацию, которую модель обязана выдать, плюс небольшой запас на будущие потребности, если он почти ничего не стоит.
Комбинированные наборы аннотаций
Часто полезно иметь несколько видов разметки на одном кадре: рамки для быстрого обучения детектора, маски для уточнения контуров, глубина для оценки расстояния. При ручной разметке такой набор обходится дорого, а при генерации из 3D выдаётся единым пакетом. Один и тот же рендер даёт цветное изображение, карту экземпляров, карту глубины, список рамок и положения ключевых точек. Какие форматы использовать для хранения и обмена, мы разобрали в статье про форматы аннотаций.
Типичные ошибки при выборе вида разметки
Чаще всего встречаются три сценария. Первый: команда начинает с рамок, а через два месяца выясняется, что для измерений нужны контуры, и весь датасет приходится размечать заново. Второй: заказывают паноптическую сегментацию там, где хватило бы семантической, и платят втрое больше за различия между экземплярами, которые никто не использует. Третий: смешивают в одном датасете разные соглашения, например часть кадров с видимыми рамками, а часть с полными, и модель получает противоречивые сигналы.
Чтобы избежать этого, перед стартом полезно сделать мини-прототип: разметить 30-50 кадров выбранным способом, обучить на них простую модель и посмотреть, отвечает ли результат на исходный вопрос бизнеса. Если нет, лучше узнать об этом сейчас, а не после разметки десятков тысяч изображений.
Итог
Вид разметки определяет, что модель будет уметь, сколько стоит датасет и как проверять качество. Начинайте с вопроса о результате, а не об инструменте, и сразу решайте, что можно получить автоматически. Если вы планируете задачу с рамками, масками или картами глубины и хотите понять, какая комбинация аннотаций оптимальна, напишите нам на [email protected], и мы подготовим пример на тестовом датасете. Ориентиры по стоимости собраны на странице цен.
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Разметка данныхСколько стоит ручная разметка и как её сократить
Ручная разметка почти всегда оказывается самой дорогой и самой недооценённой статьёй бюджета проекта по компьютерному зрению. Разбираем, из чего складывается цена, и как её сократить.
Разметка данныхАвтоматическая разметка: когда человек больше не нужен
Ручная разметка дорога и медленна, поэтому автоматизацию хочется применять везде. Разбираем четыре подхода к автоматической разметке, их реальные ограничения и ситуации, в которых без человека всё-таки не обойтись.
Разметка данныхФорматы аннотаций: COCO, YOLO, Pascal VOC и другие
Формат аннотаций кажется технической мелочью, пока обучение не падает с ошибкой или рамки не съезжают на пол-кадра. Объясняем, как устроены популярные форматы, чем отличаются и как безопасно конвертировать.