Генерація синтетичних даних для Computer Vision

Генерація синтетичних даних для Computer Vision Реальна розмітка 10 000 зображень з полігональними масками коштує місяці роботи анотаторів і немалі гроші. При цьому світового нема: у клієнта 400 розмічених фото дефектів на конвеєрі, а модель YOLOv8 з таким обсягом видає [email protected] = 0.51. Синтетичні

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1003

Генерація синтетичних даних для Computer Vision

Реальна розмітка 10 000 зображень з полігональними масками коштує місяці роботи анотаторів і немалі гроші. При цьому світового нема: у клієнта 400 розмічених фото дефектів на конвеєрі, а модель YOLOv8 з таким обсягом видає [email protected] = 0.51. Синтетичні дані — не заміна реальним, а інструмент, який закриває цей розрив без найму армії розмітників. Наш досвід показує, що правильно спроектований пайплайн генерації синтетики підвищує mAP на 30–50% порівняно з навчанням лише на реальних даних. Економія на розмітці досягає 80%.

Синтетичні дані — це штучно згенеровані зображення або відео, що імітують реальні сцени. Вони створюються через 3D-рендеринг, генеративні моделі (GAN, дифузійні моделі) або аугментацію. Докладніше про концепцію можна прочитати в Wikipedia.

Як вибрати метод генерації синтетичних даних?

Метод Доменний розрив Трудомісткість Масштабованість
Copy-paste аугментація Низький (реальні об'єкти) Низька Висока
3D-рендеринг (Blender) Середній (залежить від матеріалів) Висока (моделювання) Середня
NVIDIA Omniverse Replicator Середній Середня Висока
Stable Diffusion / GAN Високий (вимагає fine-tuning) Середня Висока

3D-рендеринг дає більш передбачувану якість розмітки, ніж GAN, але вимагає в 2-3 рази більше часу на підготовку. Copy-paste аугментація в 10 разів дешевша за ручну розмітку при однаковому обсязі.

Коли синтетика реально допомагає, а коли ні

Три сценарії, де синтетика дає вимірний приріст:

  • Дисбаланс класів. На виробничій лінії рідкісний дефект трапляється раз на 5 000 одиниць. Recall за цим класом — 0.23. Генерація 2 000 синтетичних екземплярів через copy-paste аугментацію на реальних фонах піднімає recall до 0.71 без зміни архітектури.

  • Privacy-обмеження. Медичні знімки, документи, обличчя — там реальні дані або не можна використовувати поза захищеним контуром, або їх обсяг клінічно малий. GAN або дифузійна генерація з дотриманням розподілу — робочий вихід.

  • Нове завдання без історичних даних. Склад ще не побудований, робот ще не куплений, а модель потрібна до запуску. Рендеринг 3D-сцен у Blender/NVIDIA Omniverse дає першу навчену модель заздалегідь.

Синтетика не допомагає, якщо domain gap занадто великий — модель, навчена на рендері, лягає на реальних фото без domain adaptation.

Які інструменти для генерації використовуються?

3D-рендеринг

NVIDIA Omniverse Replicator — найбільш зрілий інструмент для CV-синтетики. Дозволяє генерувати зображення з автоматичною розміткою: bounding boxes, маски сегментації, depth maps, normal maps — все з одного пайплайну. Рандомізація матеріалів, освітлення, положення камери вбудована. Згідно з офіційною документацією, генерація сцени з 10 000 об'єктів займає 2 дні.

import omni.replicator.core as rep with rep.new_layer(): # Рандомізація положення об'єкта cube = rep.create.cube(semantics=[("class", "defect")]) with rep.trigger.on_frame(num_frames=5000): with cube: rep.modify.pose( position=rep.distribution.uniform((-50, 0, -50), (50, 0, 50)), rotation=rep.distribution.uniform((0, -180, 0), (0, 180, 0)) ) rep.randomizer.lights() 

Blender + Python scripting — більш гнучкий варіант для кастомних сцен. Достатньо базового знання Blender API та скрипта для batch-рендеру.

GAN і дифузійні моделі

Stable Diffusion з ControlNet — генерація фотореалістичних зображень за масками або скелетами. Для CV-завдань актуально: задаєш маску дефекту, отримуєш варіації текстури та освітлення на цій масці.

StyleGAN3 — добре працює для облич і медичних зображень з контрольованою варіативністю. FID (Fréchet Inception Distance) < 10 досягається на датасетах від 10 000 реальних зразків.

Pix2Pix / CycleGAN — domain transfer: із синтетики в реалістичне зображення. Допомагає закрити domain gap без повторної розмітки.

Copy-paste аугментація

Найдешевший метод для детекції — вирізати реальний об'єкт і вставити на різні фони. Бібліотека albumentations з CopyPasteAugmentation або кастомний скрипт. При коректному змішуванні (Gaussian blur на краях, узгодження освітлення) приріст mAP — 5–15% без жодної нової розмітки.

Чому валідація на реальних даних критична?

Головна помилка — змішувати синтетику в val/test сет. Оцінка моделі повинна проводитися тільки на реальних даних. Інакше метрики виглядають гарно, а в production модель не працює.

Метрики для оцінки якості синтетики:

  • FID — близькість розподілів синтетики та реальних даних (< 30 — прийнятно)
  • KID (Kernel Inception Distance) — більш стійкий на малих вибірках
  • Перенесення через модель: навчи на синтетиці, протестуй на реальних — це єдиний чесний тест
Типові помилки та як їх уникнути
  • Використовувати однакові фони — модель перенавчається на текстуру підлоги. Рішення: randomize фон (HDRI-карти, випадкові зображення).
  • Ігнорувати фізику світла — тіні та відбиття не збігаються з реальністю. Рішення: використовувати path tracing або HDR-оточення.
  • Генерувати лише ідеальні зразки — модель не бачить дефектів захоплення (розмиття, шум). Рішення: додати реалістичний noise та blur.

Який обсяг синтетичних даних потрібен?

На практиці, додавання 5-10 тисяч синтетичних зображень до 500 реальних часто дає приріст mAP на 10-15%. Для рідкісних класів може знадобитися до 20 тисяч. Важливо не змішувати синтетику у валідаційну вибірку.

Кейс: детекція дефектів скла

Наш клієнт — виробник автомобільних стекол. Завдання дефектоскопії: виявлення подряпин, сколів, бульбашок, включень, тріщин та мутності. Вихідний датасет: 380 реальних зображень, розмічених bounding boxes. Класи сильно незбалансовані — клас «включення» представлений лише 23 екземплярами.

Вихідна модель YOLOv8m з попередньо навченими вагами на COCO. Результат після fine-tuning на реальному датасеті: [email protected]:0.95 = 0.38, recall за класом «включення» = 0.19.

Рішення:

  1. 3D-моделювання дефектів у Blender: промисловий дизайнер створив 12 високодеталізованих моделей (сколи, тріщини, бульбашки) з різними матеріалами та текстурами.
  2. Рендеринг 8 000 зображень з рандомізацією: 3 типи освітлення (top, side, backlight), 5 кутів камери, випадкове положення на конвеєрній стрічці. Використано Cycles engine для фотореалістичності.
  3. Copy-paste для рідкісних класів: вирізали реальні включення з 20 вихідних фото, вставили на 3 000 синтетичних фонів із застосуванням Gaussian blur та кольорокорекції.
  4. Domain adaptation через CycleGAN: перевели стиль рендерів у стиль реальних фото лінії (custom dataset з 200 реальних кадрів). Це знизило FID з 45 до 22.
  5. Фінальний датасет: 380 реальних + 11 000 синтетичних. Розбивка 80/10/10 лише на реальних даних у val/test.

Гіперпараметри навчання YOLOv8m:

  • batch size = 16, imgsz = 640, optimizer = AdamW (lr=1e-3)
  • mosaic augmentation, mixup (0.2), copy-paste (0.5)
  • early stopping patience = 10 епох, max епох = 100
  • trained on single NVIDIA A100 (80 GB) — навчання зайняло 4.5 години

Результати на real test set:

Метрика Без синтетики З синтетикою
[email protected]:0.95 0.38 0.67
Recall (включення) 0.19 0.74
Precision (всі класи) 0.82 0.89

Економія: вартість синтетичної генерації (серверний час + дизайнер) виявилася в кілька разів нижчою за ручну розмітку 11 000 зображень, що дозволило знизити бюджет на підготовку датасету.

Що входить у роботу

  • Аудит вихідних даних та постановка завдання
  • Вибір оптимального методу генерації (3D-рендеринг / GAN / copy-paste)
  • Розробка пайплайну генерації з автоматичною розміткою
  • Domain adaptation для зниження domain gap
  • Валідація якості на реальних даних
  • Інтеграція у ваш MLOps-пайплайн
  • Документація та навчання команди

Терміни

Метод Підготовка Генерація 10k зображень
Copy-paste аугментація 1–2 дні години
Blender 3D-рендеринг 1–3 тижні (3D-моделі) 1–3 дні
NVIDIA Omniverse 2–4 тижні 1–5 днів
Stable Diffusion / GAN 1–4 тижні (fine-tuning) години–дні

Вартість розраховується індивідуально залежно від обсягу та складності. Наш досвід — 5+ років у Computer Vision, 20+ проєктів з синтетичних даних. Гарантуємо прозору звітність та підтримку після впровадження.

Отримайте консультацію щодо вашого проєкту — ми допоможемо підібрати оптимальний метод генерації та оцінимо терміни. Зв'яжіться з нами для оцінки вашого завдання. Ми підготуємо комерційну пропозицію протягом одного робочого дня.