Сколько стоит ручная разметка и как её сократить
Разметка данныхРучная разметка почти всегда оказывается самой дорогой и самой недооценённой статьёй бюджета проекта по компьютерному зрению. Разбираем, из чего складывается цена, и как её сократить.

Почему бюджет на разметку почти всегда занижают
Когда команда планирует проект по компьютерному зрению, в смете обычно есть строки на сбор изображений, обучение модели и инфраструктуру. Разметка идёт отдельной маленькой строкой: «ну, нарисовать рамки на нескольких тысячах кадров». На практике именно она растягивается на недели, съедает от 30 до 70 процентов бюджета и становится главным источником задержек.
Причина в том, что разметка выглядит простой операцией, но на деле состоит из множества скрытых действий: подготовка инструкции, обучение разметчиков, пилотная партия, проверка, исправления, повторная проверка, конвертация форматов. Каждое из них стоит времени, а время разметчика и проверяющего складывается в итоговую цифру. Если закладывать только чистое время рисования рамок, реальная стоимость окажется в полтора-два раза выше.
Вторая причина занижения: аппетиты растут по ходу проекта. Сначала нужны только рамки, потом выясняется, что для точности требуются маски, затем добавляются атрибуты вроде «объект частично закрыт» или «объект повреждён». Каждое такое уточнение умножает трудоёмкость на каждый объект, а не на каждое изображение.
Из чего складывается стоимость
Цена разметки определяется не количеством картинок, а количеством объектов и типом аннотации. Изображение с одним крупным предметом и изображение с шестьюдесятью мелкими деталями стоят несоизмеримо по-разному, хотя в счёте это одна «единица».
Ориентиры по времени на объект
Цифры ниже — усреднённые ориентиры, которыми мы пользуемся при первой оценке. Реальные значения зависят от сложности сцены и квалификации исполнителей.
| Тип разметки | Время на один объект | Комментарий |
|---|---|---|
| Классификация изображения | 2–5 секунд | один тег на кадр |
| Ограничивающая рамка | 8–20 секунд | для чётких, крупных объектов |
| Многоугольная маска | 40–120 секунд | зависит от сложности контура |
| Попиксельная семантическая сегментация | 5–20 минут на кадр | сильно зависит от числа классов |
| Ключевые точки скелета | 30–90 секунд | на один экземпляр |
| Рамка плюс набор атрибутов | 20–40 секунд | атрибуты почти удваивают время |
Из таблицы видно главное: переход от рамок к маскам увеличивает стоимость в пять-десять раз. Поэтому первый вопрос при планировании звучит не «сколько картинок», а «какой вид аннотации действительно нужен модели». Подробнее о типах аннотаций мы рассказывали в обзоре видов разметки изображений.
Накладные расходы
Помимо чистого времени разметки в стоимость входят:
- Подготовка инструкции и пилот. Обычно это два-четыре рабочих дня аналитика и небольшая пилотная партия на 50–100 изображений.
- Проверка. Выборочная проверка требует примерно 10–20 процентов от времени разметки, полная двойная проверка — все 100 процентов.
- Исправления. После первой проверки в среднем возвращается на доработку 10–25 процентов объектов.
- Инструменты. Лицензии платформы разметки, хранилище, выгрузка в нужные форматы.
- Управление. Распределение задач, ответы на вопросы разметчиков, сверка статистики. Для больших проектов это отдельная роль.
Как быстро прикинуть бюджет
Простая формула, которая хорошо работает на старте: умножьте количество изображений на среднее число объектов на изображении, затем на время разметки одного объекта, добавьте 30 процентов на проверку и 15 процентов на исправления и умножьте на часовую ставку.
Например, нужно разметить 10 000 кадров, на каждом в среднем по восемь объектов, рамки по 12 секунд. Это 80 000 объектов и около 267 часов чистой работы. С проверкой и исправлениями получается порядка 390 часов. Если нужны маски по 70 секунд на объект, та же выборка превращается в 1 555 часов чистой работы, и бюджет вырастает почти в шесть раз. Именно такие расчёты помогают вовремя понять, что часть задач выгоднее решить другим путём.
Перед запуском большой партии всегда размечайте пилот на 50–100 кадров и замеряйте реальное время на объект. Расхождение с теоретической оценкой на этом этапе стоит копейки, а на полном объёме стоит месяцы.
Где деньги теряются незаметно
Опыт показывает, что наибольшие потери дают не медленные разметчики, а процессные ошибки. Вот самые частые.
- Размытая инструкция. Разметчики по-разному трактуют, что считать объектом, как обводить частично закрытые предметы, что делать с мелкими деталями. Итог — переразметка уже готовых данных. Как этого избежать, описано в материале про инструкции для разметчиков.
- Избыточная точность. Если модель всё равно работает на изображениях, уменьшенных до небольшого разрешения, обводка контура с точностью до пикселя бессмысленна.
- Лишние классы. Двадцать классов вместо шести кратно усложняют решения разметчика и увеличивают долю ошибок.
- Разметка «про запас». Размечают все собранные кадры, хотя половина из них — почти дубликаты. Модель от этого лучше не становится, а счёт растёт.
- Поздний контроль. Ошибки обнаруживаются после разметки всего объёма, и исправлять приходится всё сразу. Системный подход к проверке описан в статье про контроль качества разметки.
Семь способов сократить стоимость
Отбирать данные, а не размечать всё подряд
Активное обучение и простая дедупликация по эмбеддингам позволяют выбросить 30–60 процентов почти одинаковых кадров. Разметке подлежат те изображения, на которых модель ошибается или сомневается. Это один из самых дешёвых способов сэкономить без потери качества.
Использовать предразметку моделью
Если уже есть хотя бы слабая модель, она может нарисовать черновые рамки, а человек только исправляет их. Исправление рамки занимает 3–6 секунд вместо 12–15 на рисование с нуля. Для масок выигрыш ещё заметнее: предложенные алгоритмом контуры правятся быстрее, чем рисуются. Подробнее о границах применимости этого подхода — в материале про автоматическую разметку.
Упростить схему аннотации
Спросите себя, нужна ли маска там, где достаточно рамки. Для подсчёта объектов и грубой локализации рамок хватает почти всегда. Маски оправданы, когда требуется точная геометрия: измерение площади, захват, сортировка по форме.
Сократить число классов и атрибутов
Объединяйте классы, которые модель всё равно не различит на целевом разрешении. Атрибуты вроде «объект закрыт на треть» заменяйте автоматическим вычислением по маскам, если они вообще нужны.
Разделить труд по сложности
Простые кадры отдаются недорогим исполнителям, спорные — опытным. Такая маршрутизация снижает среднюю стоимость, потому что дорогой специалист не тратит время на очевидные случаи.
Автоматизировать проверку
Часть ошибок ловится скриптами: рамки нулевого размера, выход за границы кадра, пересечения, подозрительные пропорции, объекты вне допустимых классов. Каждая автоматически пойманная ошибка — это сэкономленные минуты проверяющего.
Заменить часть реальных данных синтетикой
Это самый радикальный способ. При генерации синтетического датасета разметка получается автоматически и без ошибок: рамки, маски, карты глубины и ключевые точки вычисляются прямо из 3D-сцены. Стоимость разметки на единицу данных стремится к нулю и не растёт вместе с объёмом. Преимущество особенно заметно на больших датасетах, где ручной подход упирается в бюджет. Как это устроено, рассказано на странице синтетических датасетов.
Когда ручная разметка всё равно нужна
Полностью отказываться от человека не стоит. Реальные данные необходимы для валидации: тестовая выборка должна быть размечена вручную и тщательно, потому что именно по ней вы измеряете качество. Обычно достаточно нескольких сотен кадров с двойной проверкой. Кроме того, ручной труд остаётся оправданным, когда:
- объекты уникальны и не поддаются моделированию;
- условия съёмки слишком сложны и не воспроизводятся в рендере;
- нужна экспертная оценка, например медицинская или материаловедческая;
- проект небольшой, и настройка автоматизации обойдётся дороже самой разметки.
На практике лучше всего работает гибрид: основной объём даёт синтетика с автоматической разметкой, небольшая реальная выборка размечается вручную и служит для проверки и дообучения.
Как мы подходим к оценке
Мы начинаем с вопроса о задаче, а не с вопроса о цене: какую метрику нужно получить, в каких условиях будет работать модель, какие ошибки критичны. После этого подбираем минимально достаточную схему аннотации и считаем два варианта: полностью ручной и гибридный. Разница обычно оказывается существенной, особенно когда речь идёт о десятках тысяч изображений.
Пример расчёта: два сценария для одного проекта
Допустим, нужно подготовить датасет для детектора деталей на конвейере: 20 000 изображений, в среднем по шесть объектов, четыре класса. Первый сценарий полностью ручной: рамки по 12 секунд на объект, проверка 20 процентов, исправления для 15 процентов объектов. Это около 400 часов чистой разметки плюс 100 часов проверки и исправлений. Второй сценарий гибридный: 3 000 реальных кадров размечаются вручную и идут на валидацию и дообучение, остальной объём генерируется синтетически с автоматическими аннотациями. Ручной труд сокращается примерно в шесть раз, а полнота покрытия редких ракурсов и условий освещения оказывается выше, потому что сцену можно варьировать как угодно.
Важная деталь: в гибридном сценарии растут расходы на подготовку 3D-моделей, но они единовременные. Каждый следующий десяток тысяч изображений обходится практически только в вычислительное время рендера. В ручном сценарии стоимость растёт линейно вместе с объёмом, и любое изменение схемы классов означает переразметку.
Если вы хотите понять, сколько будет стоить ваш проект, пришлите описание задачи и несколько примеров изображений на [email protected]. Ориентировочные рамки по ценам собраны на странице цен, а по запросу мы можем подготовить тестовый датасет, чтобы вы сравнили результат на своих данных.
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Разметка данныхАвтоматическая разметка: когда человек больше не нужен
Ручная разметка дорога и медленна, поэтому автоматизацию хочется применять везде. Разбираем четыре подхода к автоматической разметке, их реальные ограничения и ситуации, в которых без человека всё-таки не обойтись.
Разметка данныхПравила разметки ограничивающих рамок
Рамки кажутся простейшей разметкой, но именно несогласованность правил делает датасет шумным: один разметчик рисует вплотную, другой с запасом. Собрали правила, которые мы используем сами и рекомендуем заказчикам.
Разметка данныхКонтроль качества разметки
Ошибки в разметке незаметно съедают качество модели: она честно учится на неверных ответах. Рассказываем, как выстроить многоуровневый контроль, какие метрики считать и как находить ошибочные метки уже после разметки.