Контроль качества разметки
Разметка данныхОшибки в разметке незаметно съедают качество модели: она честно учится на неверных ответах. Рассказываем, как выстроить многоуровневый контроль, какие метрики считать и как находить ошибочные метки уже после разметки.

Почему ошибки в разметке так дороги
Модель не знает, что разметчик ошибся. Она учится воспроизводить то, что ей показали, и если в 8 процентах кадров рамки смещены, а в 3 процентах перепутаны классы, итоговая точность упрётся в этот потолок. Хуже того, ошибки трудно заметить по метрикам: если отложенная проверочная выборка размечена так же небрежно, цифры выглядят приемлемо, а в реальной работе модель ведёт себя непредсказуемо.
Контроль качества, это не разовая проверка перед сдачей, а процесс, встроенный в разметку с самого начала. Чем раньше найдена системная ошибка, тем меньше кадров придётся переделывать. Если на пятидесятом кадре выяснилось, что разметчик неверно понял правило, исправление стоит минуты. Если то же самое обнаружено на пятитысячном, переразметка обходится в дни.
Какие бывают ошибки
Прежде чем проверять, нужно понимать, что искать. Типичная классификация:
- Пропуски. Объект есть, разметки нет. Самая коварная ошибка: модель получает сигнал, что на этом месте фон.
- Ложные объекты. Разметка есть, объекта нет, или это не тот класс.
- Неверный класс. Объект найден, но назван неправильно, часто между похожими категориями.
- Неточная геометрия. Рамка велика или мала, маска заходит на фон или не доходит до края.
- Нарушения правил. Размечены объекты ниже порога размера, пропущены объекты частичной видимости, не поставлены флаги.
- Технические дефекты. Координаты за пределами изображения, нулевые рамки, дубликаты, неверный формат.
Для каждой из них нужны свои инструменты. Технические дефекты ловятся автоматикой. Геометрия, измерением совпадения. Пропуски и неверные классы, только выборочной ручной проверкой и анализом модели.
Уровень первый: инструкция и пилот
Лучший контроль качества, ясная инструкция. До массовой разметки стоит провести пилот на 50-100 кадрах, в котором несколько разметчиков независимо размечают одни и те же изображения. Сравнение результатов показывает, где правила неоднозначны. Каждое расхождение, это сигнал: либо ошибка исполнителя, либо дыра в инструкции. Если расхождения повторяются, инструкцию нужно дополнить примером. Подробно об этом в статье как написать инструкцию для разметчиков, а о частных правилах для рамок в материале правила разметки ограничивающих рамок.
Уровень второй: измерение согласованности
Согласованность показывает, насколько разметчики разметили одно и то же одинаково. Это лучший косвенный показатель качества, когда эталона нет.
Для геометрии
Берутся рамки или маски двух разметчиков на одном объекте и считается IoU, то есть отношение площади пересечения к площади объединения. Ориентиры из практики:
- средний IoU рамок выше 0,90, очень хорошо; для крупных чётких объектов это норма;
- 0,80-0,90 приемлемо, но для мелких объектов нужно разбираться;
- ниже 0,75 почти наверняка проблема в правилах, а не в людях.
Для масок аналогично применяется коэффициент Дайса или IoU по пикселям. Метрики разобраны в статье о метриках детекции.
Для классов
Для меток категорий используют коэффициент каппа Коэна (для двух разметчиков) или альфу Криппендорфа (для нескольких). Каппа учитывает случайные совпадения: если 95 процентов объектов относится к одному классу, простое «согласие 95 процентов» ничего не говорит. Значения выше 0,8 считаются отличными, 0,6-0,8 хорошими, ниже 0,6 требуют разбора классификации и инструкции.
Уровень третий: золотой набор и скрытые проверки
Золотой набор, это небольшая выборка (100-300 кадров), размеченная экспертом и многократно проверенная. Его используют двумя способами.
Во-первых, для допуска новых разметчиков. Пока человек не показал на золотом наборе нужный уровень совпадения, его работа не идёт в основной датасет.
Во-вторых, как скрытые контрольные задания. Золотые кадры подмешиваются в обычный поток, и разметчик не знает, какие из них проверочные. Если точность на них падает, это сигнал об усталости, невнимательности или недопонимании. Доля контрольных заданий обычно 3-5 процентов потока.
Золотой набор нужен и для оценки самой модели. Его нельзя использовать в обучении, иначе итоговые метрики окажутся завышенными.
Уровень четвёртый: выборочный аудит
Даже при отличных показателях согласованности необходим просмотр глазами. Типичная схема:
- Из каждой партии случайно отбирается 5-10 процентов кадров.
- Проверяющий отмечает ошибки по категориям из списка выше.
- Считается доля ошибочных кадров и ошибочных объектов.
- Если доля ниже порога (например, 2-3 процента объектов с ошибками), партия принимается. Иначе возвращается на доработку целиком или с расширением выборки проверки.
Для малых партий порог можно задавать по правилу приёмочного контроля: чем выше риск, тем больше выборка. Для критичных задач, таких как медицина или безопасность, проверяют 100 процентов кадров с двойным просмотром.
Формулируйте порог приёмки в цифрах заранее и включайте его в договор или регламент. Спор о том, достаточно ли хорошо размечено, без цифр превращается в спор о вкусе.
Уровень пятый: автоматические проверки
Часть дефектов можно найти скриптом без участия человека. Мы рекомендуем иметь набор проверок, который запускается на каждой партии:
- координаты в допустимых диапазонах, площадь рамки больше нуля;
- все классы входят в закрытый список;
- нет дубликатов (две почти совпадающие рамки одного класса);
- распределения размеров и соотношений сторон рамок не содержат аномалий;
- число объектов на кадр не выходит за разумные пределы;
- файлы аннотаций и изображения соответствуют друг другу один к одному.
Эти проверки работают с любыми форматами, о которых мы рассказывали в статье про форматы аннотаций, и экономят часы ручного просмотра. Полезно также визуализировать рамки и маски на случайной выборке и просматривать контактные листы из нескольких десятков кадров сразу: глаз быстро замечает неестественные закономерности.
Уровень шестой: поиск шумных меток моделью
Когда датасет уже размечен, ошибки можно искать с помощью самой модели. Алгоритм прост:
- Обучить модель по кросс-валидации, чтобы каждый кадр предсказывался моделью, не видевшей его при обучении.
- Сравнить предсказания с разметкой.
- Отсортировать кадры по величине расхождения: уверенные предсказания, не совпадающие с разметкой, чаще всего оказываются ошибками разметки.
- Вручную просмотреть верхние 1-5 процентов списка.
Метод находит пропуски, неверные классы и грубые ошибки геометрии лучше любого случайного аудита. Он особенно эффективен как финальный фильтр перед сдачей проекта. Примерно в трети найденных расхождений правой оказывается модель, а не разметка, и это тоже полезно: так выявляются трудные случаи, которые стоит добавить в обучение.
Сводная таблица методов контроля
| Метод | Что находит | Когда применять | Затраты |
|---|---|---|---|
| Пилот с несколькими разметчиками | дыры в инструкции | до начала | низкие |
| IoU и каппа | расхождения между людьми | в ходе работы | низкие |
| Золотой набор | слабых исполнителей, дрейф | постоянно | средние |
| Выборочный аудит | все типы ошибок | каждая партия | средние |
| Автоматические проверки | технические дефекты | каждая партия | почти нулевые |
| Поиск шума моделью | пропуски, неверные классы | перед сдачей | средние |
Контроль качества синтетической разметки
В синтетических датасетах человеческих ошибок нет, но контроль нужен тоже, только другой. Ошибки возникают в сценарии генерации: неверно заданная видимость, пропущенный класс в ID-карте, смещение при ресайзе, несоответствие маски и изображения после постобработки. Мы проверяем разметку по тем же автоматическим скриптам, выводим на просмотр случайные кадры с наложенными аннотациями, а на готовых данных проводим обучение пробной модели и сверяем её с небольшим реальным набором. Подробно о проверке самих изображений в статье о валидации синтетического датасета.
Итог
Хороший контроль качества многоуровневый: понятные правила, измерение согласованности, золотой набор, выборочный аудит, автоматические проверки и финальный поиск шума моделью. Каждый уровень ловит то, что пропускают другие, а вместе они стоят заметно дешевле, чем переразметка и потерянные месяцы на обучение модели, которая не работает.
Если вы хотите передать нам разметку на аудит или обсудить схему контроля для нового проекта, напишите на [email protected]. Подробнее об услугах: разметка данных.
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Разметка данныхВиды разметки изображений: обзор
От выбора вида разметки зависит и стоимость датасета, и то, чему в итоге научится модель. Разбираем основные виды аннотаций, их плюсы и ограничения и даём простую схему выбора.
Разметка данныхПравила разметки ограничивающих рамок
Рамки кажутся простейшей разметкой, но именно несогласованность правил делает датасет шумным: один разметчик рисует вплотную, другой с запасом. Собрали правила, которые мы используем сами и рекомендуем заказчикам.
Разметка данныхСколько стоит ручная разметка и как её сократить
Ручная разметка почти всегда оказывается самой дорогой и самой недооценённой статьёй бюджета проекта по компьютерному зрению. Разбираем, из чего складывается цена, и как её сократить.