Синтетические данные и приватность
Синтетические данныеФотографии людей, документов и частных помещений создают юридические и репутационные риски. Рассказываем, как синтетические данные снимают большую часть этих проблем и какие вопросы остаются открытыми.

Почему реальные данные становятся обузой
Любой проект по компьютерному зрению начинается с вопроса: где взять изображения. Если задача связана с людьми, документами, медициной, домашним интерьером или рабочими местами, сбор данных быстро превращается в юридическую задачу. Лицо на снимке, номер автомобиля, экран монитора с открытой перепиской, табличка с фамилией на двери — всё это может оказаться персональными данными.
Дальше начинаются согласия, договоры с площадками съёмки, обезличивание, хранение, права доступа и аудит. Обычная ситуация: команда машинного обучения готова обучать модель через неделю, а данные ждут одобрения от службы безопасности ещё два месяца. Часть снимков приходится выбросить, потому что получить согласие уже невозможно.
Есть и менее очевидная проблема: даже обезличенный датасет остаётся хрупким. Размытые лица ухудшают качество детектора людей, а закрашенные номера делают невозможным обучение распознаванию. Обезличивание защищает от утечки, но отнимает у модели полезный сигнал.
Где риски максимальны
- видеонаблюдение в магазинах, на складах и в офисах;
- медицинские снимки и фотографии пациентов;
- сканы документов, паспортов, договоров, чеков;
- интерьеры жилых помещений для умного дома и робототехники;
- салоны автомобилей и системы контроля водителя;
- фото сотрудников на рабочих местах для контроля охраны труда.
Что именно даёт синтетика с точки зрения приватности
Когда датасет строится на основе 3D-моделирования, в нём нет ни одного реального человека. Персонаж — это цифровая модель, собранная из геометрии, текстур кожи и волос, набора одежды и поз. Документ — это шаблон с вымышленными полями. Интерьер — это сцена, которую мы собрали из каталога моделей мебели.
Следовательно, у такого изображения нет субъекта персональных данных. Не нужно собирать согласия, нельзя «деанонимизировать» кадр, а передача датасета подрядчику или в облако не требует отдельного режима защиты. Для заказчика это означает короткий путь от идеи до первого обучения.
Важно оговориться: это справедливо, когда синтетика создана с нуля. Если вместо 3D-сцены используется генеративная модель, обученная на реальных фотографиях, вопрос усложняется, и об этом ниже.
Три уровня синтетики
- Полностью процедурная. Геометрия, материалы и освещение создаются из собственных ассетов. Связи с реальными людьми нет вообще. Это основной подход Syntidata, подробности есть на странице синтетические датасеты.
- Гибридная. Реальный фон или реальные предметы сочетаются с синтетическими вставками. Приватность зависит от того, что именно взято из реальности.
- Генеративная. Изображения создаёт нейросеть, обученная на чужих данных. Здесь возможны воспроизведение фрагментов обучающей выборки и вопросы к происхождению исходного набора.
Сравнение подходов к защите данных
Синтетика не единственный способ уйти от персональных данных. Полезно сравнить варианты по тому, что они дают и что отнимают.
| Подход | Что защищено | Цена для качества модели |
|---|---|---|
| Размытие лиц и номеров | Идентификация по кадру | Теряется сигнал для задач с людьми и номерами |
| Съёмка с согласиями | Юридическая чистота | Дорого, медленно, мало вариативности |
| Закрытый контур хранения | Утечка данных наружу | Данные остаются персональными, нужен аудит |
| Процедурная синтетика | Персональных данных нет | Нужна проверка разрыва с реальностью |
Из таблицы видно, что остальные способы либо снижают полезность данных, либо оставляют обязанности оператора персональных данных. Синтетика переносит сложность в другое место: вместо вопроса «как защитить данные» появляется вопрос «насколько данные похожи на реальные». Он решается инженерно и измеряется, о чём мы пишем в статье про проверку качества синтетического датасета.
Где приватность всё же остаётся вопросом
Было бы нечестно говорить, что синтетика решает всё. Есть четыре зоны, на которые стоит смотреть внимательно.
Исходные ассеты
Если 3D-модель человека получена сканированием реального человека, у неё есть владелец. Лицензия на скан должна разрешать использование в обучении и коммерческое распространение результата. Мы работаем с моделями, права на которые подтверждены, либо создаём собственные. Для заказчика это означает простое правило: просите перечень источников ассетов и условия их использования.
Утечка через обученную модель
Модель, обученная на реальных данных, способна запомнить редкие примеры. Для детекторов это нетипичная проблема, но для генеративных моделей и некоторых классификаторов она реальна. Обучение на процедурной синтетике делает такую атаку бессмысленной: запоминать нечего, кроме вымышленных объектов.
Смешивание с реальными данными
Типичная схема: основная масса данных синтетическая, небольшая доля реальная для финальной подстройки. Приватность тогда определяется реальной частью. Хорошая новость в том, что эта часть обычно мала, и обработать её в закрытом контуре гораздо проще, чем весь датасет. Пропорции и стратегии мы разбирали в статье про смешивание синтетики и реальных данных.
Генеративные модели как источник
Если для создания изображений используется диффузионная модель, нужно знать, на чём она обучалась. В отдельных случаях такие модели воспроизводят узнаваемые лица или логотипы из обучающей выборки. Для проектов с жёсткими требованиями мы предлагаем процедурный рендер, где происхождение каждого элемента сцены прослеживается.
Практический чек-лист для заказчика
Перед стартом проекта с чувствительной предметной областью полезно пройтись по короткому списку вопросов. Он помогает подготовить ответы для юриста и службы безопасности.
- Содержит ли итоговый датасет изображения реальных людей или документов? Ответ должен быть «нет» либо с указанием точной доли.
- Откуда взяты 3D-модели, текстуры и HDRI-карты окружения? Есть ли лицензия на коммерческое использование?
- Применялись ли нейросети при создании изображений, и на каких данных они обучены?
- Какая реальная выборка используется для проверки и подстройки, где она хранится и кто имеет к ней доступ?
- Передаётся ли подрядчику что-то кроме технического задания? Если да, то в каком виде?
- Кто владеет итоговыми данными и разметкой и на каких условиях?
Если на первые три вопроса можно ответить однозначно, значительная часть процедур, связанных с персональными данными, просто не возникает.
Пример: детектор людей без единого реального кадра
Рассмотрим обезличенный пример. Сеть торговых объектов хотела считать посетителей в зоне касс и фиксировать очереди. Видеопоток с камер содержит лица покупателей и сотрудников, использовать его для обучения подрядчиком без отдельного согласования нельзя.
Мы собрали синтетическую сцену: типовая планировка кассовой зоны, набор персонажей разного роста, телосложения и одежды, тележки, корзины, сумки. Свет настраивали под реальные лампы и окна, камеры ставили в тех же точках и под теми же углами, что в магазинах. Разметка ограничивающими рамками и масками создавалась вместе с рендером, подробнее об этом в разделе про разметку.
Модель обучили на синтетике и проверили на небольшом закрытом наборе реальных кадров, который остался внутри контура заказчика. Подрядчик не видел ни одного реального лица. Качество на реальных данных вышло приемлемым после добавления случайных искажений камеры и подстройки яркости, а время на юридические согласования сократилось с месяцев до нескольких дней.
Как не обмануться: типичные ошибки
- Считать «похоже на человека» достаточным. Для приватности это хорошо, но модель всё равно нужно проверять на реальных кадрах.
- Брать готовые модели людей без проверки лицензии. Бесплатный ассет из открытого каталога может запрещать коммерческое использование.
- Забывать про метаданные. В файлах изображений и сцен иногда остаются имена авторов, пути к файлам и служебные теги. Мы очищаем их перед передачей.
- Смешивать реальные кадры в общую папку. Реальная часть должна жить отдельно и с отдельным доступом.
- Игнорировать водяные знаки и логотипы в текстурах. Они тоже могут быть объектом прав.
С чего начать
Начните с аудита: какие данные у вас уже есть, какие из них нельзя использовать из-за ограничений и какие сценарии вы не можете снять в принципе. Часто оказывается, что именно эти сценарии лучше всего закрываются рендером.
Дальше мы предлагаем короткий пилот: договариваемся об описании сцены и классов, получаем тестовый датасет по запросу, проверяем модель на вашей закрытой выборке. Процесс описан на странице как мы работаем. Если у вас чувствительная предметная область и вы хотите обсудить схему данных, напишите на [email protected] и опишите задачу в нескольких предложениях: мы подскажем, какая доля проекта реально может быть синтетической.
Нужен датасет под вашу задачу?
Подготовим тестовую партию изображений с разметкой, чтобы вы могли проверить подход на своей модели. Напишите на [email protected] или оставьте заявку.
Читайте также
Синтетические данныеЭкономика синтетических данных: где реальная экономия
Разговоры об экономии на синтетике часто остаются лозунгом. Раскладываем стоимость датасета по статьям, показываем, где именно возникает выигрыш, и как посчитать точку безубыточности для своей задачи.
Синтетические данныеРедкие объекты: как обучить модель на том, чего почти не бывает
Самое ценное для бизнеса — как раз то, что случается редко: дефект, авария, нештатное положение. Рассказываем, как построить обучающую выборку, когда реальных примеров почти нет.
Синтетические данныеСколько изображений нужно для обучения детектора
Универсального числа нет, но есть рабочие ориентиры и способы оценить потребность до того, как вы потратили бюджет. Разбираем факторы, диапазоны и метод кривой обучения.