На конвеєрі оператор може пропустити дефект через втому. Через годину монотонної роботи точність виявлення падає до 70%. Машинний зір дозволяє знизити брак до 0.5% і нижче — це не просто автоматизація, а реальний результат. Наша команда розробляє системи visual inspection більше 5 років, виконано 15+ впроваджень на лініях металообробки, збірки електроніки та пакування. За 5 років ми заощадили клієнтам понад $2 млн на браку.
Застосовуємо сучасні методи комп'ютерного зору: детекцію аномалій без розмітки, навчену детекцію на YOLOv8 та їх комбінації. Системи працюють цілодобово і при правильному налаштуванні перевершують людину у виявленні дефектів. Вигода: зниження браку, економія на контролерах, підвищення пропускної здатності.
Які дефекти детектуємо і якими методами
| Тип дефекту |
Приклади |
Метод |
| Поверхневі |
Подряпини, тріщини, вм'ятини |
Anomaly Detection / Детекція |
| Розмірні |
Неправильний розмір, форма |
Вимірювання через CV |
| Складальні |
Відсутність компонента, неправильне положення |
Детекція + верифікація |
| Кольорові |
Плями, нерівномірне фарбування |
Classification / Anomaly |
| Текстурні |
Пористість, розшарування |
Anomaly Detection |
Як працює anomaly detection без розмічених дефектів
Розмітка дефектних прикладів дорога — тисячі доларів за невеликий набір зображень. Методи anomaly detection вирішують цю проблему: модель навчається тільки на бездефектних зображеннях і виявляє будь-яке відхилення. Згідно з бенчмарком MVTec AD (github.com/MVTec-AD), PatchCore досягає 99.1% AUROC на рівні зображень. Це в 2 рази краще за порогові методи на кшталт SSIM.
Приклад коду для PatchCore
import torch
from anomalib.models import PatchCore
from anomalib.data import MVTec
from anomalib import TaskType
class ProductionAnomalyDetector:
def __init__(self, model_type: str = 'patchcore'):
self.model = PatchCore(
backbone='wide_resnet50_2',
pre_trained=True,
coreset_sampling_ratio=0.1,
num_neighbors=9
)
def train(self, normal_images_dir: str):
self.model.fit(normal_images_dir)
def predict(self, image_path: str) -> dict:
result = self.model.predict(image_path)
return {
'anomaly_score': float(result.pred_score),
'is_defective': result.pred_label == 1,
'anomaly_map': result.anomaly_map,
'defect_regions': self._extract_regions(result.anomaly_map)
}
PatchCore дає передові показники на бенчмарку MVTec AD: Image-level AUROC 99.1%, Pixel-level AUROC 98.1%, навчання 10 хвилин на 200 нормальних зображеннях. Це дозволяє впровадити детекцію за 4–6 тижнів без дорогої розмітки. PatchCore перевершує EfficientAD на 2% AUROC на цьому бенчмарку.
Коли варто використовувати supervised детекцію
Якщо типи дефектів відомі і є розмічена вибірка, використовуємо YOLOv8. Дропаємо донавчену модель на інференс з латентністю менше 50 мс. Порівняння: supervised підхід на 200 розмічених дефектах дає mAP 0.95, в той час як anomaly detection — 0.91. Тобто YOLOv8 дає точність у 1.04 рази вищу, але потребує розмітки. Рішення: комбінувати обидва підходи.
Приклад коду для YOLOv8
from ultralytics import YOLO
import cv2
import numpy as np
class DefectDetector:
def __init__(self, model_path: str, confidence: float = 0.5):
self.model = YOLO(model_path)
self.confidence = confidence
self.critical_defects = ['crack', 'deep_scratch', 'hole']
self.minor_defects = ['surface_scratch', 'small_dent', 'discoloration']
def inspect(self, image: np.ndarray) -> dict:
results = self.model(image, conf=self.confidence)
defects = []
for box in results[0].boxes:
defect_type = self.model.names[int(box.cls)]
defects.append({
'type': defect_type,
'severity': 'critical' if defect_type in self.critical_defects else 'minor',
'bbox': box.xyxy[0].tolist(),
'confidence': float(box.conf),
'area_px': self._bbox_area(box.xyxy[0])
})
verdict = 'REJECT' if any(d['severity'] == 'critical' for d in defects) else \
'QUARANTINE' if defects else 'PASS'
return {'verdict': verdict, 'defects': defects, 'defect_count': len(defects)}
Чи підходить машинний зір для вашого виробництва? (H2)
Якщо ваша продукція має стабільні геометрію та освітлення, а дефекти повторювані — так. Ми пропонуємо безкоштовний аудит для оцінки.
Які типові помилки виникають при впровадженні visual inspection
- Недостатнє освітлення — нестабільне світло веде до хибних спрацьовувань. Рішення: стробоскоп з синхронізацією або рівномірне освітлення з контролем.
- Погана калібровка камери — спотворення перспективи знижує точність вимірювань. Потрібна регулярна калібровка по мішені.
- Ігнорування варіативності нормальних виробів — anomaly detection може бракувати допустимі відхилення. Збирайте репрезентативну вибірку норми.
- Latency не вкладається в такт конвеєра — якщо час інференсу перевищує цикл, деталь йде у відбраковувач із запізненням. Запасайтесь GPU або використовуйте TensorRT.
Як система інтегрується з конвеєром
Для вбудовування у виробничу лінію критична синхронізація:
- Trigger: датчик (фотобар'єр) фіксує деталь в зоні зйомки → сигнал камері
- Exposure control: стробоскоп синхронізований з камерою (freeze motion)
- Latency: від тригера до рішення менше 100 мс для більшості ліній
- Rejection mechanism: пневматичний штовхач або дивертер спрацьовує за сигналом
Приклад коду для інтеграції з конвеєром
class ConveyorInspectionSystem:
def __init__(self, camera, detector, plc_client):
self.camera = camera
self.detector = detector
self.plc = plc_client
def on_trigger(self, trigger_signal):
image = self.camera.capture()
result = self.detector.inspect(image)
if result['verdict'] in ['REJECT', 'QUARANTINE']:
delay_ms = self.calculate_transport_delay()
self.plc.schedule_rejection(delay_ms, result['verdict'])
self.log_result(result)
Процес роботи: від аудиту до введення в експлуатацію
| Етап |
Що робимо |
Результат |
| 1. Аудит виробництва |
Вивчаємо тип деталей, дефекти, освітлення, швидкість конвеєра |
Технічне завдання з метриками |
| 2. Прототипування |
Збираємо 200–500 зображень, навчаємо модель, тестуємо на вашій лінії |
Демо-система зі звітом про точність |
| 3. Інтеграція |
Встановлюємо камеру, освітлення, синхронізацію; розгортаємо інференс на edge/сервері |
Інтегрована система з API |
| 4. Тестування |
Проганяємо 5000+ деталей, порівнюємо з ручним контролем |
Акт приймання з підтвердженими метриками |
| 5. Гарантійна підтримка |
6 місяців моніторингу, оновлення моделі при зміні продукції |
Стабільна робота 24/7 |
Що входить в роботу
- Навчена модель (ансамбль або єдина)
- Контейнер інференсу (Docker)
- Документація по експлуатації та інтеграції
- Навчання операторів (1–2 дні)
- Гарантія 6 місяців
- Пост-реліз: донавчання моделі при зміні матеріалів (1–2 дні)
Результати на виробництві
На металевих деталях (подряпини, тріщини) досягнуті наступні метрики:
-
Recall дефектів (PatchCore): 96–99%
-
Precision: 91–97%
-
Throughput: до 1200 деталей/год при latency 80 мс
| Масштаб проекту |
Термін |
| Пілот: 1 тип деталі, аномалія |
4–6 тижнів |
| 3–5 типів деталей, відомі дефекти |
8–12 тижнів |
| Багатопозиційна лінія, реалтайм |
12–20 тижнів |
Щоб оцінити застосовність computer vision на вашому виробництві, зв'яжіться з нами — ми проведемо безкоштовний аудит і надамо прототип за 2 тижні. Отримайте консультацію — надішлемо детальний гайд по впровадженню visual inspection.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.