Syntidata
Главная / Блог / Синтетические данные / Синтетические и реальные данные: честное сравнение

Синтетические и реальные данные: честное сравнение

Синтетические данные

Спор «синтетика против реальности» обычно ведётся лозунгами. Мы сравниваем оба подхода по конкретным критериям и показываем, в каких случаях выигрывает каждый, а в каких разумнее их объединить.

Синтетические и реальные данные: честное сравнение

Почему вопрос поставлен неправильно

В обсуждениях часто звучит: «Что лучше, синтетика или реальные данные?» Но это всё равно что спрашивать, что лучше, молоток или отвёртка. Реальные данные — единственный источник истины о том, как выглядит мир в вашей задаче. Синтетические данные — инструмент, который позволяет получить то, чего реальность дать не может или даёт слишком дорого. Нас как поставщика синтетики можно заподозрить в предвзятости, поэтому ниже мы стараемся говорить прямо, включая неудобные для нас места.

Сравнивать стоит по критериям, которые влияют на результат проекта, а не по ощущению «настоящести» картинки. Таких критериев семь: стоимость, скорость, качество разметки, разнообразие, редкие случаи, риск разрыва доменов и юридические ограничения. Пройдём по ним по очереди.

Стоимость и скорость

У реальных данных затраты распределены так: съёмка (оборудование, доступ к объектам, время людей), отбор, разметка, проверка разметки. Причём самая крупная часть — почти всегда разметка. Если размечать маски сегментации, один сложный кадр с несколькими объектами может занимать у специалиста несколько минут. На десятках тысяч кадров получаются месяцы работы команды.

У синтетики структура другая. Основные затраты приходятся на старт: подготовка 3D-моделей, материалов, сцен и настройка параметров рандомизации. Дальше стоимость каждого дополнительного кадра стремится к стоимости вычислительного времени GPU. Поэтому у синтетики есть «порог окупаемости»: на малых объёмах (несколько сотен снимков) выгода сомнительна, на больших (десятки и сотни тысяч) она становится очевидной. Именно поэтому мы говорим, что преимущества технологии лучше всего видны на крупных датасетах.

Практическое правило: если вам нужно меньше пятисот размеченных изображений и объект простой, обычно быстрее и дешевле снять и разметить реальные кадры. Если счёт идёт на тысячи и десятки тысяч, расчёт меняется в пользу рендера.

Качество и согласованность разметки

Здесь у реальных данных главный враг — человеческий фактор. Два разметчика по-разному проведут рамку вокруг частично скрытого предмета, по-разному поймут, включать ли тень или торчащий кабель. Даже при хорошей инструкции появляется шум аннотаций, который модель вынуждена выучивать вместе с полезным сигналом. Мы подробнее разбираем эту проблему в материале про контроль качества разметки.

В синтетике разметка вычисляется из геометрии сцены, поэтому:

  • маски совпадают с границей объекта на уровне пикселя;
  • рамки строятся по единому правилу для всех кадров;
  • перекрытия и усечённые объекты помечаются по точной доле видимой площади;
  • ключевые точки и глубина доступны без дополнительной работы.

Но есть оговорка. Разметка точная только настолько, насколько точна сама 3D-модель. Если модель деформирована или её масштаб неверен, ошибка будет систематической, и её труднее заметить, чем случайные промахи человека.

Разнообразие и управляемость

Реальная съёмка даёт естественное разнообразие, которое невозможно придумать: странные ракурсы, непредвиденные фоны, поведение людей. Это бесценно. Но оно неуправляемо: вы не можете попросить реальный цех сегодня работать при низком солнце, а завтра при неоновом освещении. Вы получаете то, что происходило в момент съёмки, и часто это однообразная выборка из одних и тех же условий.

В синтетике, наоборот, вариативность задаётся параметрами. Мы можем сделать равномерное покрытие по освещению, расстоянию, углам, цвету фона. Такая управляемость полезна и для диагностики: когда модель ошибается в определённых условиях, мы можем целенаправленно добавить именно их.

Слабая сторона синтетики: она содержит только то разнообразие, которое мы туда заложили. Если мы не предусмотрели, что в реальных кадрах будет конденсат на стекле, то модель этого не увидит. Реальные данные «знают» то, чего мы не знаем.

Редкие случаи и несуществующие объекты

Это та область, где реальные данные проигрывают почти всегда. Редкий дефект, аварийная ситуация, нештатное положение детали, объект, которого ещё нет в производстве, — собрать их в достаточном числе нельзя в принципе или придётся ждать месяцами.

Для таких задач синтетика часто единственный практичный вариант. Отдельную статью мы посвятили этому сценарию: Редкие объекты: как обучить модель на том, чего почти не бывает.

Domain gap: расплата за удобство

Главный риск синтетики — разрыв между рендером и реальностью. Модель, обученная только на искусственных кадрах, может плохо переносить знания на настоящие. Размер этого разрыва зависит от качества материалов, освещения, имитации оптики и от того, насколько широко проведена рандомизация. Хорошая новость: его можно измерять и сокращать. Плохая: гарантий «из коробки» нет, и честная работа всегда включает проверку на реальной выборке.

У реальных данных такого разрыва нет по определению, но есть свой аналог — смещение выборки. Датасет, снятый в одном цеху, летом, одной камерой, плохо обобщается на другой цех или другую камеру. Так что вопрос не «есть ли у нас разрыв», а «какой именно и как мы его контролируем».

Юридические и этические ограничения

Реальные изображения людей, номеров автомобилей, документов, внутренних помещений предприятий — это персональные данные и коммерческая тайна. Их сбор, хранение и передача подрядчику требуют согласований, а иногда просто запрещены. Синтетические сцены лишены этой проблемы: в них нет реальных людей и реальных закрытых объектов. Для заказчиков из режимных и регулируемых отраслей это нередко решающий довод.

Сводная таблица

КритерийРеальные данныеСинтетические данные
Старт проектаБыстрый на малых объёмахТребует подготовки моделей и сцен
Стоимость кадра на больших объёмахВысокая, растёт линейноНизкая, падает с ростом объёма
Точность разметкиЗависит от человекаПиксельная, при верной модели
Управляемость условийНизкаяВысокая
Редкие случаиТрудно и долгоЛюбое количество
Естественное разнообразиеМаксимальноеТолько заложенное
Риск domain gapНетЕсть, управляется
ПриватностьСерьёзные ограниченияПрактически нет проблем

Когда выбирать что

Реальные данные разумнее взять за основу, когда:

  • объём небольшой и задача простая;
  • условия съёмки максимально разнообразны и непредсказуемы;
  • объект органический, с огромной вариативностью формы;
  • у вас уже есть большой архив размеченных кадров.

Синтетику стоит выбрать, когда:

  • объект описывается CAD- или фотограмметрической моделью;
  • нужны большие объёмы и сложная разметка;
  • интересующие вас события редки или опасны;
  • объекта ещё нет физически;
  • реальные кадры нельзя собирать из-за приватности.

Три типовых сценария выбора

Чтобы сравнение не осталось абстрактным, разберём три обезличенных ситуации.

Производитель бытовой техники

Нужно находить на конвейере десятки модификаций корпусов, CAD-модели есть, реальных снимков брака почти нет. Здесь основой становится синтетика с точными масками, а реальные кадры используются для проверки и финальной настройки. Подход оправдан объёмом и наличием моделей.

Сеть магазинов

Задача: распознавание товаров на полках в десятках разных торговых залов. Освещение, упаковки и расположение постоянно меняются. Реальные фотографии из магазинов незаменимы как источник естественного разнообразия, а синтетика полезна для новых упаковок, которые только выходят на рынок. Хорошо работает гибрид.

Охрана периметра

Требуется распознавать редкие нештатные события на объекте с ограничениями по съёмке. Реальных примеров нет и быть не должно. Синтетика почти единственный путь, а проверку приходится строить на ограниченном числе учебных сценариев.

Из этих примеров видно: выбор определяется не идеологией, а набором условий конкретного проекта. Один и тот же заказчик в разных задачах придёт к разным решениям, и это нормально. Для оценки своей ситуации можно пройти по критериям из таблицы выше и отметить, на чьей стороне оказывается большинство.

Гибрид как рабочий стандарт

На практике лучшие результаты чаще всего даёт сочетание. Синтетика обеспечивает масштаб, покрытие редких случаев и точную разметку, а небольшая доля реальных кадров служит якорем, который подтягивает модель к настоящему распределению. Какую долю брать и на каком этапе подмешивать, мы разобрали в статье Смешивание синтетики и реальных данных.

Если вы не уверены, с чего начать, запросите тестовый датасет: небольшой пробный набор позволяет проверить гипотезу на ваших реальных кадрах, прежде чем планировать большой заказ. Подробнее о формате работы на странице Как мы работаем, а вопросы можно задать на [email protected].


Читайте также