Сколько изображений нужно для обучения детектора
Синтетические данныеУниверсального числа нет, но есть рабочие ориентиры и способы оценить потребность до того, как вы потратили бюджет. Разбираем факторы, диапазоны и метод кривой обучения.

Честный ответ: зависит
Вопрос «сколько картинок нужно?» задают в первом же разговоре, и в ответ хочется назвать число. Но любое число без контекста вводит в заблуждение. Одному проекту хватит трёхсот изображений, другому мало и ста тысяч. Зато можно назвать факторы, которые определяют потребность, и дать диапазоны для типовых ситуаций.
Ниже ориентиры, основанные на нашей практике и на общеизвестном опыте обучения детекторов. Это не нормативы, а точка отсчёта для планирования и разговора с подрядчиком.
Факторы, которые определяют объём
Число и сходство классов
Один класс, резко отличающийся от фона, требует существенно меньше данных, чем двадцать классов, из которых многие похожи друг на друга. Различение двух модификаций одной детали, отличающихся мелким отверстием, — задача на порядок более прожорливая, чем отличие детали от пустого стола.
Вариативность условий
Фиксированная камера над конвейером с постоянным светом — одна история. Мобильное приложение, которым снимают в любых помещениях, — другая. Чем шире диапазон условий, тем больше примеров нужно, чтобы покрыть их комбинации.
Размер и видимость объектов
Мелкие объекты на большом кадре обучаются тяжелее: у них мало пикселей и больше шансов потеряться на фоне. Частичные перекрытия, плотные кучи, объекты на краю кадра добавляют сложности и требуют соответствующей представленности в выборке.
Требуемая точность
Для прототипа, который находит объект в 80% случаев, достаточно одного объёма. Для линии контроля, где пропуск стоит дорого и нужен recall выше 99%, нужен совсем другой. Последние проценты метрики обычно «стоят» больше данных, чем первые девяносто.
Качество разметки
Шумная разметка требует больше данных, чтобы модель «пробилась» сквозь ошибки. Чистая и единообразная позволяет обойтись меньшим набором. Чем точнее аннотации, тем эффективнее каждое изображение.
Использование предобученных весов
Почти всегда стоит стартовать с модели, предобученной на крупном общем датасете. Это резко снижает потребность в данных, потому что базовые признаки (границы, текстуры, формы) уже выучены. Тонкая настройка под вашу задачу требует гораздо меньше примеров, чем обучение с нуля.
Ориентировочные диапазоны
Таблица ниже описывает типовые порядки для детекции с предобученной сетью при реальных или смешанных данных. Для синтетики числа обычно можно сдвигать к большим значениям, поскольку дополнительные кадры дёшевы, а сами кадры вариативнее.
| Сценарий | Изображений на класс | Комментарий |
|---|---|---|
| Прототип, один простой класс, фиксированные условия | 100–300 | Хватает для проверки гипотезы |
| Рабочая модель, несколько классов, умеренная вариативность | 500–2 000 | Типичный диапазон для пилота |
| Промышленная модель, много условий и классов | 3 000–10 000 | Нужна системная рандомизация |
| Тонкая классификация похожих объектов | 10 000 и больше | Критично покрытие ракурсов |
| Сложные сцены с плотными кучами и перекрытиями | 10 000–50 000 | Важны экземпляры, а не только кадры |
Обратите внимание, что мы считаем по числу изображений на класс, а не на проект. Но корректнее думать о числе экземпляров (разметенных объектов): в одном кадре их может быть десятки. Десять тысяч кадров с плотной выкладкой дают сотни тысяч экземпляров, а десять тысяч кадров с одним объектом дают ровно десять тысяч.
Почему «ещё больше данных» не всегда помогает
Любая модель выходит на плато. Если вы удвоили выборку, а метрика не выросла, причина обычно не в количестве. Типовые виновники:
- ошибки и несогласованность в разметке;
- дисбаланс классов: редких примеров слишком мало на фоне доминирующих;
- смещение выборки: все кадры из одних условий;
- ограничения самой модели: слишком маленькая сеть или слишком низкое разрешение входа;
- рассогласование между обучением и рабочими данными (тот самый domain gap).
Поэтому прежде чем заказывать вдвое больше, разберите ошибки модели на реальной валидации. Часто выгоднее добавить две тысячи кадров именно тех типов, где модель путается, чем удваивать весь набор.
Метод кривой обучения
Самый практичный способ оценить потребность в данных на вашей задаче — построить кривую обучения. Процедура простая:
- Возьмите имеющийся набор и обучите модель на 10%, 25%, 50% и 100% данных.
- Оцените каждую модель на одной и той же фиксированной валидационной выборке.
- Постройте график: по оси X число кадров, по оси Y метрика.
- Посмотрите на форму кривой.
Если кривая ещё круто растёт при 100%, данных явно не хватает, и добавление даст ощутимый прирост. Если она вышла на плато, дальнейшее наращивание бесполезно, ищите причину в другом. Если рост замедляется, можно прикинуть, сколько данных нужно для целевого значения метрики, экстраполируя тренд.
Этот метод особенно полезен в связке с тестовым датасетом: мы предоставляем небольшой пробный набор по запросу, вы строите кривую на нём и получаете обоснованную оценку объёма для основного заказа, а не прогноз «на глаз».
Особенности синтетических данных
С рендером картина иная в трёх отношениях.
Во-первых, дополнительный кадр почти бесплатен, поэтому можно позволить себе объёмы, которые для реальной съёмки нереалистичны. Для сложных задач это превращает «недостижимые» десятки тысяч в рутину.
Во-вторых, кадры синтетики вариативны по построению. Тысяча рандомизированных рендеров может нести больше полезного разнообразия, чем тысяча реальных, снятых подряд в одном цеху. Но это верно только при качественной рандомизации: тысяча почти одинаковых картинок остаётся тысячей почти одинаковых картинок. Подробности в статье Доменная рандомизация на практике.
В-третьих, нужно следить за соотношением объёма синтетики и реальной доли. Огромный объём рендера не отменяет необходимости в небольшой реальной выборке для настройки и проверки. О пропорциях мы пишем в статье Смешивание синтетики и реальных данных.
Планирование на практике: три шага
Чтобы не гадать, действуйте последовательно.
Шаг первый: определите критерий успеха
Какая метрика, на каких данных и с каким порогом считается достаточной? Без этого вопрос «сколько данных» не имеет ответа. Метрики и их смысл разобраны в материале Метрики детекции: mAP, IoU, precision и recall без путаницы.
Шаг второй: сделайте пилот
Небольшой набор, быстрая модель, оценка на реальной выборке. Цель не идеальная точность, а понимание того, какие классы и условия самые трудные.
Шаг третий: масштабируйте целенаправленно
После пилота вы знаете проблемные места. Добавляйте данные именно там: сложные ракурсы, редкие классы, трудные условия освещения. Такой адресный рост эффективнее равномерного.
Пример рассуждения о бюджете кадров
Допустим, вам нужно детектировать шесть типов изделий на конвейере с фиксированной камерой и небольшими изменениями освещения. Классы различаются заметно. Для старта по ориентирам из таблицы достаточно около полутора тысяч изображений на класс, то есть примерно девяти тысяч кадров. Если в кадре обычно присутствует несколько изделий, фактическое число экземпляров окажется заметно выше.
Теперь усложним: появилось ещё две модификации, внешне почти идентичные, а камера может стоять в нескольких положениях. Потребность вырастет в несколько раз, поскольку модель должна различать мелкие отличия при разных ракурсах. Но здесь и проявляется смысл синтетики: масштабирование с девяти до тридцати или пятидесяти тысяч кадров требует не новых выездов, а дополнительных вычислений.
Не забывайте закладывать запас на итерации. После первой проверки на реальной выборке вы почти наверняка добавите целевые кадры в слабых местах. Разумно планировать бюджет с учётом двух-трёх циклов донабора, а не одной разовой закупки. Так вы избежите ситуации, когда основной объём уже сделан, а выяснилось, что важного ракурса в нём нет.
Чего не стоит делать
- Ориентироваться на чужие числа из статей и кейсов, не сверяя со своей задачей.
- Тратить бюджет на разметку огромного массива до первого пилота.
- Игнорировать вычислительные затраты: больше данных означает дольше обучение и больше итераций.
- Считать, что «много данных» исправит плохую разметку.
Если у вас уже есть оценка потребности в объёмах и вы хотите понять стоимость, обратитесь к странице Цены или напишите на [email protected]. Опишите задачу, число классов и условия съёмки, и мы предложим состав тестового набора и ориентировочный план масштабирования.
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Синтетические данныеСемь мифов о синтетических данных
Одни считают синтетику панацеей, другие игрушкой для презентаций. Правда лежит посередине, и её можно проверить на практике. Разбираем семь мифов по очереди.
Синтетические данныеРедкие объекты: как обучить модель на том, чего почти не бывает
Самое ценное для бизнеса — как раз то, что случается редко: дефект, авария, нештатное положение. Рассказываем, как построить обучающую выборку, когда реальных примеров почти нет.
Синтетические данныеСмешивание синтетики и реальных данных: пропорции и стратегии
Чистая синтетика и чистая реальность — две крайности, между которыми находится большинство рабочих решений. Разбираем стратегии смешивания, ориентиры по пропорциям и способы выбрать свою.