Syntidata
Главная / Блог / Синтетические данные / Что такое синтетические данные и почему о них заговорили все

Что такое синтетические данные и почему о них заговорили все

Синтетические данные

Синтетические данные — это изображения и разметка, созданные программно, а не снятые камерой. Разбираем, как они устроены, откуда взялся интерес к ним и в каких задачах они действительно работают.

Что такое синтетические данные и почему о них заговорили все

Определение без тумана

Синтетические данные — это данные, которые не были собраны в физическом мире, а сгенерированы алгоритмом. В компьютерном зрении это чаще всего кадры, полученные 3D-рендерингом: мы строим цифровую сцену, расставляем в ней модели объектов, задаём освещение и виртуальную камеру, а затем «снимаем» тысячи изображений. Вместе с картинкой мы получаем всё, что нужно для обучения: маски, ограничивающие рамки, карты глубины, ключевые точки.

Ключевое отличие от обычного датасета не в том, что картинки «нарисованные». Главное в другом: каждая сцена создаётся нами, поэтому мы знаем о ней всё. Положение каждого объекта в пространстве, его границы с точностью до пикселя, степень перекрытия соседями, расстояние до камеры. Человеку, который размечает фотографии, эти сведения приходится восстанавливать глазами. Рендеру они достаются бесплатно, потому что это исходные параметры сцены.

Синтетика бывает разной, и важно не смешивать понятия:

  • рендер из 3D-сцен — основной предмет нашей работы, подходит для детекции, сегментации, оценки позы и глубины;
  • генеративные модели (диффузионные сети и им подобные) — дают правдоподобные картинки, но без точной геометрической разметки;
  • аугментация существующих снимков — поворот, цвет, шум, вставка объектов на новый фон;
  • табличная и текстовая синтетика — отдельная область, к зрению не относится.

В этой статье речь о первом и, отчасти, третьем пункте. Именно они дают модели то, чего ей чаще всего не хватает: разнообразие и точную разметку в нужном количестве.

Почему о синтетике заговорили именно сейчас

Идея не нова: симуляторы использовали в робототехнике и авиации задолго до эпохи глубокого обучения. Но по-настоящему массовым подход стал, когда сошлись три фактора.

Первый фактор — аппетит нейросетей. Современные детекторы и сегментаторы тем лучше, чем больше разнообразных размеченных примеров они видят. Собрать и разметить сотни тысяч кадров вручную — это месяцы работы и бюджет, который не каждый проект может себе позволить.

Второй — доступность рендеринга. Физически корректный рендер, который раньше требовал студии с вычислительной фермой, сегодня выполняется на обычных GPU. Библиотеки материалов, HDRI-освещение и процедурная генерация сцен стали рабочим инструментом, а не экзотикой.

Третий — осознание цены разметки. Когда команды впервые считают реальную стоимость аннотирования, включая проверки и исправления, синтетика перестаёт выглядеть дорогой альтернативой. Подробнее о цифрах мы писали в статье Экономика синтетических данных: где реальная экономия.

Как выглядит процесс создания датасета

Ниже типичная последовательность, по которой мы строим датасеты под задачу клиента. Конкретные детали зависят от объекта и условий съёмки, но каркас один.

  1. Формулировка задачи: что должна находить модель, в каких условиях, с какой точностью и на каком железе.
  2. Подготовка 3D-моделей: из CAD-файлов клиента, из фотограмметрии реальных предметов или моделирование с нуля.
  3. Материалы и освещение: настройка PBR-материалов, подбор HDRI-карт и источников света под реальные условия эксплуатации.
  4. Сборка сцен: расстановка объектов, фонов, отвлекающих предметов, помех; случайные вариации параметров.
  5. Рендеринг и автоматическая разметка: на выходе картинки и аннотации в нужном формате.
  6. Проверка и тестовая выдача: клиент получает пробную партию, обучает на ней модель и оценивает результат на своих реальных кадрах.
  7. Масштабирование: после согласования мы выпускаем полный объём.

Обратите внимание на шаг шесть. Тестовый датасет мы предоставляем по запросу, потому что гипотезу «синтетика подойдёт нашей задаче» дешевле проверить на небольшой выборке, чем обсуждать теоретически. А вот преимущества подхода раскрываются на больших объёмах: фиксированная стоимость подготовки сцен делится на десятки тысяч кадров, и цена одного размеченного изображения падает.

Что именно получает модель

Хорошая синтетика — не просто «много картинок». Это контролируемое разнообразие. Мы управляем факторами, которые влияют на качество модели, и можем менять их независимо друг от друга.

Разметка без человеческих ошибок

Маски в синтетике совпадают с границами объекта буквально по пикселю, включая тонкие детали: ручки, провода, прозрачные края. Ограничивающие рамки строятся автоматически по проекции модели и не плавают от разметчика к разметчику. О том, как выглядят разные виды аннотаций, можно прочитать на странице Разметка: маски и баундинг-боксы.

Редкие и несуществующие объекты

Если дефект возникает раз на десять тысяч изделий, реальных примеров у вас почти нет. В рендере мы можем создать любое их количество. Более того, можно сделать датасет для изделия, которого физически ещё не существует: прототип только на стадии чертежа, а модель обнаружения для линии должна быть готова к запуску.

Крайние случаи и условия

Плохой свет, блики, частичное перекрытие, необычные ракурсы, пыль на объективе — всё это можно заказать системно, а не ждать, пока оно случайно попадёт в кадр.

Дополнительные каналы

Помимо RGB-изображения доступны карты глубины, нормалей, маски по отдельным экземплярам и ключевые точки. Для реальных съёмок получить такие каналы либо невозможно, либо требуется дорогое оборудование.

Где синтетика работает лучше всего

По нашему опыту, подход сильнее всего проявляется в задачах, где объект хорошо определён геометрически, а реальные данные дороги или недоступны.

СитуацияЧем помогает синтетика
Промышленные детали по CAD-моделиТочные модели, быстрый выпуск вариантов
Редкие дефекты и аварийные ситуацииЛюбое количество примеров
Новые продукты до запуска производстваДатасет раньше, чем появится первый образец
Сложная разметка: маски, глубина, позыАвтоматическая и точная разметка
Закрытые или чувствительные средыНе нужно снимать реальные объекты и людей

Где результат слабее: задачи с сильно вариативными органическими объектами (например, мелкая живая природа в хаотичной среде) требуют заметно больше усилий по моделированию, и часто выигрышнее комбинация с реальными кадрами. Об этом подробно в статье Смешивание синтетики и реальных данных.

Главное возражение: «модель обучится на рендере, а работать будет на реальности»

Это справедливый вопрос, и у него есть название — domain gap, разрыв между доменами. Нейросеть, обученная на слишком «чистых» и однообразных картинках, на реальных кадрах может работать заметно хуже. Мы не отрицаем проблему, мы управляем ею. Основные приёмы:

  • физически корректные материалы и освещение вместо «игровой» графики;
  • доменная рандомизация: широкий разброс фонов, света, текстур и положений;
  • имитация оптики и шума реальной камеры;
  • добавление небольшой доли реальных кадров при финальной настройке;
  • обязательная проверка на реальной валидационной выборке клиента.

Последний пункт принципиален. Единственный честный критерий качества синтетического датасета — метрики модели на реальных данных, которые она никогда не видела при обучении. Если они не устраивают, мы меняем параметры генерации, а не убеждаем клиента, что «картинки выглядят красиво».

Что синтетика не умеет

Чтобы ожидания были трезвыми, назовём границы подхода прямо. Рендер не придумает признаки, о существовании которых мы не знаем: если в реальности на деталях бывает налёт, а в наших сценах его нет, модель его не увидит. Он не заменит проверку на реальных кадрах и не даёт гарантий переноса «из коробки». И он требует исходных материалов: чертежей, 3D-моделей или фотографий предметов, по которым можно построить цифровые копии.

Есть и организационный нюанс. Синтетический датасет не покупается как готовый товар с полки, он проектируется под задачу: набор классов, условия, ракурсы, формат разметки. Поэтому лучшая отправная точка для разговора с подрядчиком не «сколько стоит тысяча картинок», а подробное описание того, где и как модель будет работать. Чем точнее описание, тем меньше итераций потребуется и тем быстрее вы получите результат, который можно проверить на реальных кадрах.

Ещё одна типичная ошибка ожиданий: считать, что синтетика нужна только на старте. На деле она хорошо работает и дальше. Появился новый ракурс камеры, изменилось освещение на площадке, добавилась модификация изделия: набор можно перегенерировать без новой съёмки.

Как понять, подходит ли это вашей задаче

Короткий чек-лист для первичной оценки:

  • объект можно описать 3D-моделью или получить её по фотографиям;
  • реальных размеченных кадров мало, они дороги или их невозможно собрать;
  • нужна точная разметка, которую вручную делать долго: маски, ключевые точки, глубина;
  • вам нужны десятки тысяч изображений и более, а не пара сотен;
  • есть возможность проверить модель на небольшой реальной выборке.

Если большая часть пунктов выполняется, имеет смысл запросить пробную партию. Посмотреть, как выглядят готовые наборы, можно на странице Примеры датасетов, а описание нашего подхода к созданию сцен и рендеру собрано в разделе Технология. Для обсуждения задачи напишите на [email protected]: опишите объект, условия съёмки и требуемую разметку, и мы предложим план проверки гипотезы.


Читайте также