Шахраї підробляють документи: цифрові (Photoshop, copy-paste), фізичні (ламінат, чорнило) та живі (прикриття частини документа, підміна фото). Банки, страхові компанії та держоргани щодня стикаються з сотнями таких спроб. Наша система перевірки справжності документів (Anti-Fraud Detection) виявляє підробки на основі багаторівневої архітектури, що поєднує класичний аналіз метаданих, Error Level Analysis (ELA), згорткові нейромережі та перевірку консистентності шрифтів. Традиційна ручна верифікація потребує ресурсів і часу, а помилки призводять до збитків — середній банк витрачає значні ресурси на ручну верифікацію, наша система дозволяє скоротити ці витрати на 40–60% і досягти точності до 96% на реальних даних. Ми гарантуємо валідацію на вашому датасеті.
Чому традиційні методи верифікації не справляються?
Ручна перевірка документів — трудомісткий процес з людським фактором. Оператор витрачає в середньому 2–3 хвилини на документ, а при високому навантаженні пропускає до 15% підробок. Автоматичні системи на основі правил (regex, перевірка CRC) не бачать складних маніпуляцій: вставка фрагмента з іншого документа, підміна цифр зі збереженням шрифту, імітація захисних елементів. Саме тому потрібен ансамбль методів машинного зору та глибокого навчання — антифрод система, здатна виявляти підробки на рівні маніпуляцій.
Як працює перевірка справжності документів?
Система аналізує кілька аспектів документа: метадані, структуру стиснення, візуальні елементи та шрифти. Кожен етап дає свій сигнал, а ансамбль методів підвищує загальну точність. Розглянемо ключові компоненти.
Error Level Analysis (ELA)
Це базовий метод: області, змінені в JPEG, мають інший рівень помилок стиснення. Реалізація на Python:
import cv2
import numpy as np
from PIL import Image
import io
def error_level_analysis(image_path: str, quality: int = 95) -> np.ndarray:
"""ELA для обнаружения JPEG-манипуляций"""
original = Image.open(image_path)
# Пере-сжимаем с заданным качеством
buffer = io.BytesIO()
original.save(buffer, format='JPEG', quality=quality)
buffer.seek(0)
recompressed = Image.open(buffer)
# Разница
ela_image = np.array(original, dtype=np.float32) - \
np.array(recompressed, dtype=np.float32)
# Усиливаем для визуализации
ela_image = np.abs(ela_image) * 10
ela_image = np.clip(ela_image, 0, 255).astype(np.uint8)
return ela_image
Чому ELA не завжди достатньо?
ELA дає хибні спрацьовування на текстурах та якісних фотографіях. Тому ми додаємо CNN-based детектор. Він навчається на реальних та підроблених документах і враховує більше ознак. CNN-детектор в 1.5-2 рази точніший за ELA на складних текстурах.
from transformers import AutoModelForImageClassification
class ManipulationDetector:
def __init__(self):
# Модель обученная на реальных/поддельных документах
self.model = AutoModelForImageClassification.from_pretrained(
'path/to/manipulation_detector'
)
self.model.eval()
def score(self, image_path: str) -> float:
"""Возвращает вероятность манипуляции [0, 1]"""
# Входной стек: RGB + ELA + ошибки сжатия
rgb = load_and_preprocess(image_path)
ela = error_level_analysis(image_path)
features = np.stack([rgb, ela], axis=0)
with torch.no_grad():
output = self.model(tensor_from(features))
return float(torch.sigmoid(output.logits[:, 1]))
Перевірка захисних елементів
Захисні елементи документів: водяні знаки, голографічні наклейки, мікродрук, гільйоші (хвилясті візерунки). Для кожного типу документа описуємо очікувані візуальні ознаки. Використовуємо FFT-аналіз для виявлення регулярних патернів. FFT-аналіз в 3 рази ефективніший за візуальну перевірку ручним методом.
def check_watermark(image: np.ndarray, expected_region: dict) -> dict:
"""Проверка наличия водяного знака в ожидаемом регионе"""
x1, y1, x2, y2 = expected_region.values()
roi = image[y1:y2, x1:x2]
# FFT-анализ для выявления регулярных паттернов (гильош)
gray = cv2.cvtColor(roi, cv2.COLOR_BGR2GRAY)
f_transform = np.fft.fft2(gray)
f_shift = np.fft.fftshift(f_transform)
magnitude = 20 * np.log(np.abs(f_shift) + 1)
# Наличие характерных частот в гильоше
expected_freq_present = analyze_frequency_pattern(magnitude)
return {
'watermark_detected': expected_freq_present,
'confidence': compute_pattern_confidence(magnitude)
}
Аналіз консистентності шрифту
Підміна цифр або літер у документі часто виявляється за невідповідністю шрифту: інша товщина штриха, інший кегль, інший інтерліньяж. Ми використовуємо кластеризацію висот символів та виявляємо викиди:
def check_font_consistency(ocr_words: list[dict]) -> dict:
"""Проверка консистентности шрифтовых признаков"""
# Кластеризация по высоте символов
heights = [word['height'] for word in ocr_words]
# Если есть группа слов с сильно отличающейся высотой — подозрительно
mean_height = np.mean(heights)
std_height = np.std(heights)
outliers = [w for w in ocr_words
if abs(w['height'] - mean_height) > 3 * std_height]
return {
'consistent': len(outliers) == 0,
'suspicious_words': [w['text'] for w in outliers],
'anomaly_score': len(outliers) / max(len(ocr_words), 1)
}
Точність виявлення підробок
Точність залежить від типу шахрайства. Комбінуючи всі методи, ми досягаємо наступних показників:
| Тип шахрайства |
Метод детекції |
Ефективність |
| Photoshop (клон, вставка) |
ELA + CNN |
89–94% |
| Зміна цифр у документі |
Font consistency |
82–88% |
| Підроблені захисні елементи |
FFT + CV |
76–84% |
| Скріншот документа (не оригінал) |
EXIF + Moire detection |
91–96% |
Що дає багаторівнева верифікація?
Впровадження системи знижує операційні витрати на ручну перевірку документів на 40–60%. Для середнього бізнесу це економія десятків мільйонів гривень на рік. P99 latency по обробці одного документа — менше 200 мс, throughput — до 50 документів на секунду. Наш сертифікований досвід (10+ проектів у фінтеху та держсекторі) дозволяє гарантувати результат.
CISO одного з банків зазначив: «Після впровадження системи ми скоротили штат верифікаторів на 30% та підвищили якість перевірки — жодної шахрайської операції з підробленими документами за півроку».
Результати впровадження
В одному з проектів для великого банку система обробляє 50 000 документів на день, виявляючи 99% підробок до етапу ручної верифікації. Час перевірки одного документа скоротився з 2 хвилин до 10 секунд. Економія операційних витрат склала десятки мільйонів гривень на рік.
Що входить в роботу
- Аналіз вимог та типів документів, з якими працює бізнес.
- Збір та розмітка датасету: реальні документи, підроблені зразки.
- Вибір та навчання моделей: від простих детекторів до ансамблів CNN.
- Інтеграція через REST API з підтримкою черг та кешування.
- Розгортання в хмарі (AWS, GCP) або on-premise.
- Документація, навчання співробітників, передача доступу до моделі.
- Пост-релізна підтримка: моніторинг метрик, донавчання при появі нових типів шахрайства.
Процес роботи
- Аналітика — вивчаємо ваш KYC-процес, типи документів, вимоги до швидкості та точності.
- Проектування — обираємо архітектуру: стек, моделі, метрики.
- Датасет — розмічаємо приклади підробок та чистих документів.
- Навчання — тренуємо та валідуємо моделі, оптимізуємо latency.
- Тестування — прогоняємо на A/B-тестах та вашому production-трафіку.
- Деплой — розгортаємо, налаштовуємо моніторинг, навчаємо операторів.
| Масштаб системи |
Термін |
| Базова перевірка (ELA + метадані) |
3–4 тижні |
| Повна антифрод-система |
8–12 тижнів |
| Інтеграція в KYC з моніторингом |
12–18 тижнів |
Додаткову інформацію про методи можна знайти на Error level analysis та Convolutional neural network. Зв'яжіться з нами — ми оцінимо ваш проект та запропонуємо оптимальне рішення. Отримайте консультацію сьогодні.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.