Синтетические и реальные данные: честное сравнение
Синтетические данныеСпор «синтетика против реальности» обычно ведётся лозунгами. Мы сравниваем оба подхода по конкретным критериям и показываем, в каких случаях выигрывает каждый, а в каких разумнее их объединить.

Почему вопрос поставлен неправильно
В обсуждениях часто звучит: «Что лучше, синтетика или реальные данные?» Но это всё равно что спрашивать, что лучше, молоток или отвёртка. Реальные данные — единственный источник истины о том, как выглядит мир в вашей задаче. Синтетические данные — инструмент, который позволяет получить то, чего реальность дать не может или даёт слишком дорого. Нас как поставщика синтетики можно заподозрить в предвзятости, поэтому ниже мы стараемся говорить прямо, включая неудобные для нас места.
Сравнивать стоит по критериям, которые влияют на результат проекта, а не по ощущению «настоящести» картинки. Таких критериев семь: стоимость, скорость, качество разметки, разнообразие, редкие случаи, риск разрыва доменов и юридические ограничения. Пройдём по ним по очереди.
Стоимость и скорость
У реальных данных затраты распределены так: съёмка (оборудование, доступ к объектам, время людей), отбор, разметка, проверка разметки. Причём самая крупная часть — почти всегда разметка. Если размечать маски сегментации, один сложный кадр с несколькими объектами может занимать у специалиста несколько минут. На десятках тысяч кадров получаются месяцы работы команды.
У синтетики структура другая. Основные затраты приходятся на старт: подготовка 3D-моделей, материалов, сцен и настройка параметров рандомизации. Дальше стоимость каждого дополнительного кадра стремится к стоимости вычислительного времени GPU. Поэтому у синтетики есть «порог окупаемости»: на малых объёмах (несколько сотен снимков) выгода сомнительна, на больших (десятки и сотни тысяч) она становится очевидной. Именно поэтому мы говорим, что преимущества технологии лучше всего видны на крупных датасетах.
Практическое правило: если вам нужно меньше пятисот размеченных изображений и объект простой, обычно быстрее и дешевле снять и разметить реальные кадры. Если счёт идёт на тысячи и десятки тысяч, расчёт меняется в пользу рендера.
Качество и согласованность разметки
Здесь у реальных данных главный враг — человеческий фактор. Два разметчика по-разному проведут рамку вокруг частично скрытого предмета, по-разному поймут, включать ли тень или торчащий кабель. Даже при хорошей инструкции появляется шум аннотаций, который модель вынуждена выучивать вместе с полезным сигналом. Мы подробнее разбираем эту проблему в материале про контроль качества разметки.
В синтетике разметка вычисляется из геометрии сцены, поэтому:
- маски совпадают с границей объекта на уровне пикселя;
- рамки строятся по единому правилу для всех кадров;
- перекрытия и усечённые объекты помечаются по точной доле видимой площади;
- ключевые точки и глубина доступны без дополнительной работы.
Но есть оговорка. Разметка точная только настолько, насколько точна сама 3D-модель. Если модель деформирована или её масштаб неверен, ошибка будет систематической, и её труднее заметить, чем случайные промахи человека.
Разнообразие и управляемость
Реальная съёмка даёт естественное разнообразие, которое невозможно придумать: странные ракурсы, непредвиденные фоны, поведение людей. Это бесценно. Но оно неуправляемо: вы не можете попросить реальный цех сегодня работать при низком солнце, а завтра при неоновом освещении. Вы получаете то, что происходило в момент съёмки, и часто это однообразная выборка из одних и тех же условий.
В синтетике, наоборот, вариативность задаётся параметрами. Мы можем сделать равномерное покрытие по освещению, расстоянию, углам, цвету фона. Такая управляемость полезна и для диагностики: когда модель ошибается в определённых условиях, мы можем целенаправленно добавить именно их.
Слабая сторона синтетики: она содержит только то разнообразие, которое мы туда заложили. Если мы не предусмотрели, что в реальных кадрах будет конденсат на стекле, то модель этого не увидит. Реальные данные «знают» то, чего мы не знаем.
Редкие случаи и несуществующие объекты
Это та область, где реальные данные проигрывают почти всегда. Редкий дефект, аварийная ситуация, нештатное положение детали, объект, которого ещё нет в производстве, — собрать их в достаточном числе нельзя в принципе или придётся ждать месяцами.
Для таких задач синтетика часто единственный практичный вариант. Отдельную статью мы посвятили этому сценарию: Редкие объекты: как обучить модель на том, чего почти не бывает.
Domain gap: расплата за удобство
Главный риск синтетики — разрыв между рендером и реальностью. Модель, обученная только на искусственных кадрах, может плохо переносить знания на настоящие. Размер этого разрыва зависит от качества материалов, освещения, имитации оптики и от того, насколько широко проведена рандомизация. Хорошая новость: его можно измерять и сокращать. Плохая: гарантий «из коробки» нет, и честная работа всегда включает проверку на реальной выборке.
У реальных данных такого разрыва нет по определению, но есть свой аналог — смещение выборки. Датасет, снятый в одном цеху, летом, одной камерой, плохо обобщается на другой цех или другую камеру. Так что вопрос не «есть ли у нас разрыв», а «какой именно и как мы его контролируем».
Юридические и этические ограничения
Реальные изображения людей, номеров автомобилей, документов, внутренних помещений предприятий — это персональные данные и коммерческая тайна. Их сбор, хранение и передача подрядчику требуют согласований, а иногда просто запрещены. Синтетические сцены лишены этой проблемы: в них нет реальных людей и реальных закрытых объектов. Для заказчиков из режимных и регулируемых отраслей это нередко решающий довод.
Сводная таблица
| Критерий | Реальные данные | Синтетические данные |
|---|---|---|
| Старт проекта | Быстрый на малых объёмах | Требует подготовки моделей и сцен |
| Стоимость кадра на больших объёмах | Высокая, растёт линейно | Низкая, падает с ростом объёма |
| Точность разметки | Зависит от человека | Пиксельная, при верной модели |
| Управляемость условий | Низкая | Высокая |
| Редкие случаи | Трудно и долго | Любое количество |
| Естественное разнообразие | Максимальное | Только заложенное |
| Риск domain gap | Нет | Есть, управляется |
| Приватность | Серьёзные ограничения | Практически нет проблем |
Когда выбирать что
Реальные данные разумнее взять за основу, когда:
- объём небольшой и задача простая;
- условия съёмки максимально разнообразны и непредсказуемы;
- объект органический, с огромной вариативностью формы;
- у вас уже есть большой архив размеченных кадров.
Синтетику стоит выбрать, когда:
- объект описывается CAD- или фотограмметрической моделью;
- нужны большие объёмы и сложная разметка;
- интересующие вас события редки или опасны;
- объекта ещё нет физически;
- реальные кадры нельзя собирать из-за приватности.
Три типовых сценария выбора
Чтобы сравнение не осталось абстрактным, разберём три обезличенных ситуации.
Производитель бытовой техники
Нужно находить на конвейере десятки модификаций корпусов, CAD-модели есть, реальных снимков брака почти нет. Здесь основой становится синтетика с точными масками, а реальные кадры используются для проверки и финальной настройки. Подход оправдан объёмом и наличием моделей.
Сеть магазинов
Задача: распознавание товаров на полках в десятках разных торговых залов. Освещение, упаковки и расположение постоянно меняются. Реальные фотографии из магазинов незаменимы как источник естественного разнообразия, а синтетика полезна для новых упаковок, которые только выходят на рынок. Хорошо работает гибрид.
Охрана периметра
Требуется распознавать редкие нештатные события на объекте с ограничениями по съёмке. Реальных примеров нет и быть не должно. Синтетика почти единственный путь, а проверку приходится строить на ограниченном числе учебных сценариев.
Из этих примеров видно: выбор определяется не идеологией, а набором условий конкретного проекта. Один и тот же заказчик в разных задачах придёт к разным решениям, и это нормально. Для оценки своей ситуации можно пройти по критериям из таблицы выше и отметить, на чьей стороне оказывается большинство.
Гибрид как рабочий стандарт
На практике лучшие результаты чаще всего даёт сочетание. Синтетика обеспечивает масштаб, покрытие редких случаев и точную разметку, а небольшая доля реальных кадров служит якорем, который подтягивает модель к настоящему распределению. Какую долю брать и на каком этапе подмешивать, мы разобрали в статье Смешивание синтетики и реальных данных.
Если вы не уверены, с чего начать, запросите тестовый датасет: небольшой пробный набор позволяет проверить гипотезу на ваших реальных кадрах, прежде чем планировать большой заказ. Подробнее о формате работы на странице Как мы работаем, а вопросы можно задать на [email protected].
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Синтетические данныеЧто такое синтетические данные и почему о них заговорили все
Синтетические данные — это изображения и разметка, созданные программно, а не снятые камерой. Разбираем, как они устроены, откуда взялся интерес к ним и в каких задачах они действительно работают.
Синтетические данныеDomain gap: как сократить разрыв между рендером и реальностью
Domain gap — главный риск при обучении на рендерах. Он поддаётся диагностике и лечению, если понимать, из каких слагаемых складывается, и работать с каждым по отдельности.
Синтетические данныеКак проверить качество синтетического датасета
Красивые рендеры ничего не гарантируют. Показываем, как проверить синтетический датасет до обучения и после него, какие метрики смотреть и когда останавливать проект.