Syntidata
Главная / О компании Syntidata

О компании Syntidata

Мы создаём синтетические датасеты для компьютерного зрения: рендерим сцены, размечаем их автоматически и отдаём данные, на которых модели учатся быстрее и дешевле, чем на ручном сборе.

О компании Syntidata

Кто мы

Syntidata (СинтиДата) — небольшая московская компания с понятной специализацией. Мы делаем датасеты для задач компьютерного зрения не из фотографий, а из 3D-сцен: строим виртуальный мир с нужными объектами, снимаем его виртуальными камерами и получаем изображения вместе с точной разметкой. Слоган у нас простой: датасеты для всех. Мы считаем, что качественные обучающие данные не должны быть привилегией крупных корпораций с собственными командами разметчиков.

Основная идея сформулирована в одной фразе: если объект можно описать и смоделировать, то его можно и «сфотографировать» сколько угодно раз, в любых условиях и сразу с идеальной разметкой. Это особенно полезно там, где реальных снимков мало, где их дорого собирать или где нужного объекта в природе пока просто не существует.

Помимо основного направления мы занимаемся автоматизацией бизнес-процессов и разработкой сайтов. Эти направления выросли из практики: любой проект с данными упирается в конвейеры, отчётность и интеграцию, а любой заказчик в итоге хочет, чтобы о его решении можно было рассказать на нормальном сайте.

С чего мы начинали

Мы начинали с обычной для отрасли боли: модель есть, архитектура выбрана, а данных нет. Первые проекты были про то, чтобы помочь командам, у которых на разметку уходило больше времени, чем на само обучение. Разметчики рисовали рамки неделями, в итоге половину приходилось переделывать из-за расхождений в понимании инструкции.

Тогда мы попробовали обратный подход. Вместо того чтобы размечать готовые фотографии, мы начали создавать изображения вокруг уже известной разметки. Если сцена собрана в 3D, то положение каждого объекта, его контур и расстояние до камеры известны точно, потому что мы сами их задали. Разметка перестаёт быть отдельной работой и становится побочным продуктом рендера.

Первые датасеты были небольшими, и честно говоря, не всё получалось с первого раза. Модели, обученные только на рендерах, на реальных кадрах работали хуже ожидаемого. Именно тогда мы вплотную занялись разрывом между синтетикой и реальностью, о котором подробно рассказываем в статье Domain gap: как сократить разрыв между рендером и реальностью. Решение оказалось не в одном магическом приёме, а в системной работе: реалистичные материалы, физически корректный свет, грамотная рандомизация и обязательная проверка на реальных кадрах заказчика.

Так постепенно сложился конвейер, которым мы пользуемся сейчас. Он масштабируется от сотен изображений для тестового образца до сотен тысяч для боевого обучения.

Чем мы занимаемся

Синтетические датасеты

Это ядро компании. Мы создаём датасеты под задачу клиента: детекция, сегментация, оценка позы, определение глубины. Работаем и с существующими объектами, и с теми, которых в реальности нет: прототипами изделий, новой упаковкой, редкими дефектами. Подробности на странице Синтетические датасеты.

Аугментация существующих датасетов

Если у вас уже есть реальные данные, мы не предлагаем их выбросить. Мы дополняем их: добавляем недостающие ракурсы, условия освещения, редкие классы. Часто небольшой реальный набор в сочетании с синтетикой даёт результат лучше, чем любой из них по отдельности.

Разметка

Мы размечаем получившиеся датасеты масками, баундинг-боксами, картами глубины и ключевыми точками. Для синтетических данных это делается автоматически и без ошибок человеческого фактора. Форматы выдаём любые популярные: COCO, YOLO, Pascal VOC и другие.

3D-моделирование и визуализация

Мы строим библиотеки 3D-моделей, настраиваем материалы и сцены. Эти модели можно использовать не только для датасетов, но и для каталогов, презентаций, прототипов.

Автоматизация и сайты

Конвейеры данных, интеграция ML-моделей в рабочие процессы, отчётность, скрипты и боты, а также корпоративные сайты, лендинги и B2B-порталы с поддержкой после запуска.

Команда

Мы не называем имён, но расскажем, из кого состоит команда, потому что именно состав определяет, что мы умеем.

  • 3D-художники. Строят и дорабатывают модели, настраивают материалы, следят за тем, чтобы металл выглядел как металл, а упаковка блестела так, как блестит в магазине. Хороший художник замечает мелочи, которые влияют на то, поверит ли в картинку нейросеть.
  • Инженеры данных. Отвечают за конвейер: хранение моделей и сцен, очереди рендера, версионирование датасетов, экспорт в нужные форматы. Именно они делают так, чтобы сотни тысяч изображений собирались предсказуемо.
  • ML-инженеры. Обучают проверочные модели на наших датасетах, считают метрики, подбирают пропорции смешивания синтетики и реальных данных. Они же говорят «стоп», если датасет выглядит красиво, но не работает.
  • Разработчики. Пишут инструменты автоматизации, интеграции, сервисы приёмки и клиентские сайты.
  • Менеджеры проектов. Переводят задачу бизнеса на язык данных и обратно, держат сроки и коммуникацию.

Такое сочетание нужно потому, что в синтетических данных нельзя разделить «красоту» и «пользу». Красивый рендер, который не улучшает метрику, нам не нужен. А полезный датасет, собранный на скорую руку, плохо масштабируется.

Принципы работы

  1. Сначала задача, потом технология. Мы начинаем с вопроса «что должна уметь модель и где она будет работать», а не с вопроса «какие сцены нарисовать». От этого зависит всё: набор объектов, ракурсы, фоны, уровень шума.
  2. Проверка на реальных кадрах. Синтетика оценивается не по тому, как она выглядит, а по тому, как работает модель на ваших настоящих изображениях. Поэтому мы просим хотя бы небольшую выборку реальных снимков для валидации. Как это устроено, описано в статье Как проверить качество синтетического датасета.
  3. Прозрачность. Мы говорим, где синтетика даст большой выигрыш, а где её лучше сочетать с реальными данными или вообще не применять. Иногда честный ответ — «вам это не нужно».
  4. Воспроизводимость. Каждый датасет описывается параметрами генерации. Если нужно расширить набор или поменять условия, мы воспроизводим конвейер, а не начинаем заново.
  5. Уважение к данным клиента. Ваши модели, фотографии и спецификации не уходят третьим лицам и не используются в других проектах.

Почему синтетика

Причин несколько, и они прагматичные.

Разметка бесплатна и безошибочна. При ручной разметке две трети проблем возникают из-за расхождений между людьми: один обводит рамку по тени, другой нет. В рендере рамка и маска вычисляются из геометрии.

Редкие случаи перестают быть редкими. Дефект, который встречается на одной детали из десяти тысяч, в реальных данных почти не представлен. В синтетике вы можете задать его хоть в каждом сотом изображении. Об этом мы писали в статье Редкие объекты: как обучить модель на том, чего почти не бывает.

Контроль над условиями. Нужны сумерки, дождь, блики на плёнке, ракурс сверху под углом сорок пять градусов? Это просто параметры сцены.

Объектов может ещё не быть. Если вы разрабатываете новое изделие, вам нужна модель, которая научится его распознавать к моменту запуска линии. Реальных фотографий не будет, пока нет изделия, а синтетика будет.

Приватность. В данных нет реальных людей и коммерческих тайн. Это упрощает юридическую сторону проектов.

При этом мы не считаем синтетику панацеей. Её сила раскрывается на больших объёмах: чем больше датасет, тем сильнее разница в стоимости и сроках по сравнению с ручным сбором. На малых объёмах выигрыш скромнее, и мы честно об этом говорим.

Как устроена работа с клиентами

Проект обычно проходит несколько понятных шагов. Вы оставляете заявку, мы проводим бриф и уточняем задачу, затем делаем тестовый датасет, который предоставляется по запросу. Если результат устраивает, мы заключаем договор и запускаем производство, после чего проходит приёмка и, при необходимости, доработки. Каждый этап описан на странице Как мы работаем, там же указаны сроки и список того, что нужно от вас.

За проектом закреплён один ответственный менеджер. Вы всегда знаете, на каком этапе работа, и видите промежуточные выборки, а не получаете результат «чёрным ящиком» в конце.

Мы не стремимся делать всё сразу и для всех. Если задача лежит вне нашей специализации, например требует сложной аппаратной интеграции, мы скажем об этом на этапе брифа.

Офис в Москве

Мы работаем в Москве и принимаем клиентов по предварительной договорённости.

  • Адрес: 117105, г. Москва, Варшавское шоссе, д. 9, стр. 1Б, офис 214
  • Почта: [email protected]

Встречи можно провести и онлайн: для большинства проектов этого достаточно, потому что вся работа идёт с цифровыми данными. Если вам удобнее посмотреть на работу конвейера и обсудить задачу лично, приезжайте, но предварительно напишите нам на почту, чтобы мы подготовили материалы под ваш вопрос.

С чего начать

Самый простой путь — описать задачу в нескольких предложениях: что нужно распознавать, в каких условиях, какого объёма датасет ожидается. Остальное мы уточним сами. Если хочется сначала увидеть результат, закажите тестовый датасет: он предоставляется по запросу, и по нему сразу видно, подходит ли подход вашей задаче. Примеры того, как выглядят наши наборы, собраны на странице Примеры датасетов.

Мы будем рады, если наша работа поможет вашей модели учиться быстрее, а вашей команде тратить время на задачи, где нужны её знания, а не на бесконечное рисование рамок.

Запросить тестовый датасет

Ответим в течение рабочего дня