Пайплайн OCR для фотографій документів
Фотографія документа — не скан. Типові проблеми: перспективні спотворення (текст стає трапецією), тіні від пальців і палітурки, нерівномірне освітлення, змазаність при русі, відблиски на глянцевих поверхнях. Якісна система розпізнавання повинна виправляти всі ці спотворення до передачі в OCR-движок. Без попередньої обробки навіть найкращі моделі (PaddleOCR, GPT-4o) показують CER 20–30% на таких фото. Для паспортів і посвідчень потрібен CER <5% — це досяжно тільки з комплексним пайплайном.
Ми розробили рішення, яке автоматично детектує документ, вирівнює перспективу, прибирає тіні та відблиски, і тільки потім запускає OCR. Такий підхід дає стабільно низьку помилку навіть на неідеальних знімках. Наш пайплайн обробляє кадр за ~200 мс на GPU і вже впроваджений у проєктах для банків і державних організацій — понад 5 років досвіду, понад 20 успішних інтеграцій.
Як ми вирівнюємо документ на фотографії?
Перше завдання — знайти документ у кадрі та виправити перспективу. Типова ситуація: користувач фотографує паспорт під кутом, і текст стає нечитабельним для звичайного OCR. Ми використовуємо детекцію контурів на зображенні після попередньої обробки: переведення в сірий, розмиття, виділення границь оператором Canny, потім пошук чотирикутника, що займає >20% кадру. Якщо такий контур знайдено — застосовуємо перспективну трансформацію (homography). Це дає фронтальний вигляд документа.
import cv2 import numpy as np class DocumentPhotoOCR: def __init__(self): self.ocr = PaddleOCR(use_angle_cls=True, lang='ru', use_gpu=True) def process(self, image_path: str) -> dict: image = cv2.imread(image_path) # 1. Детекция документа в кадре doc_corners = self.detect_document(image) # 2. Перспективная коррекция if doc_corners is not None: image = self.four_point_transform(image, doc_corners) # 3. Улучшение качества изображения image = self.enhance_document(image) # 4. OCR result = self.ocr.ocr(image, cls=True) return { 'text': self._extract_text(result), 'words': self._extract_words_with_positions(result), 'corrected': doc_corners is not None } def detect_document(self, image: np.ndarray) -> np.ndarray | None: gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) blur = cv2.GaussianBlur(gray, (5, 5), 0) edges = cv2.Canny(blur, 75, 200) dilated = cv2.dilate(edges, np.ones((3, 3)), iterations=1) contours, _ = cv2.findContours(dilated, cv2.RETR_LIST, cv2.CHAIN_APPROX_SIMPLE) contours = sorted(contours, key=cv2.contourArea, reverse=True)[:5] for contour in contours: peri = cv2.arcLength(contour, True) approx = cv2.approxPolyDP(contour, 0.02 * peri, True) if len(approx) == 4: area_ratio = cv2.contourArea(approx) / (image.shape[0] * image.shape[1]) if area_ratio > 0.2: return approx.reshape(4, 2) return None def four_point_transform(self, image: np.ndarray, pts: np.ndarray) -> np.ndarray: rect = self._order_points(pts) tl, tr, br, bl = rect width = int(max(np.linalg.norm(br - bl), np.linalg.norm(tr - tl))) height = int(max(np.linalg.norm(tr - br), np.linalg.norm(tl - bl))) dst = np.array([ [0, 0], [width - 1, 0], [width - 1, height - 1], [0, height - 1] ], dtype='float32') M = cv2.getPerspectiveTransform(rect.astype('float32'), dst) return cv2.warpPerspective(image, M, (width, height)) Результат: навіть при нахилі до 30° текст стає горизонтальним, що радикально покращує якість розпізнавання.
Що робити з тінями та відблисками?
Наступна проблема — нерівномірне освітлення. На реальних фото часто зустрічаються тіні від пальців, палітурки або відблиски на ламінованих картках. Для тіней застосовуємо CLAHE (Contrast Limited Adaptive Histogram Equalization) у колірному просторі LAB. Це адаптивно вирівнює яскравість по локальних областях, не створюючи артефактів. Для відблисків використовуємо inpainting — виявляємо пересвічені пікселі (значення >250 в одному з RGB-каналів) та інтерполюємо їх із сусідніх ділянок.
def enhance_document(self, image: np.ndarray) -> np.ndarray: lab = cv2.cvtColor(image, cv2.COLOR_BGR2LAB) l, a, b = cv2.split(lab) clahe = cv2.createCLAHE(clipLimit=4.0, tileGridSize=(16, 16)) l_enhanced = clahe.apply(l) enhanced = cv2.merge([l_enhanced, a, b]) enhanced = cv2.cvtColor(enhanced, cv2.COLOR_LAB2BGR) kernel = np.array([[0, -1, 0], [-1, 5, -1], [0, -1, 0]]) sharpened = cv2.filter2D(enhanced, -1, kernel) return sharpened Також додаємо легкий sharpen для компенсації розмитості при зйомці з рук. Наш досвід показує, що комбінація CLAHE + sharpen знижує CER на 3–5% порівняно з сирим зображенням.
Повний пайплайн обробки фото документа
Ось як виглядає наш production-пайплайн (код на Python з OpenCV та PaddleOCR). Функції об'єднані в один клас. Ми використовуємо PaddleOCR з російською мовою та кутовою класифікацією (use_angle_cls=True). На GPU обробка одного кадру займає ~200 мс. Для мобільних пристроїв можна замінити на легку модель.
Порівняння OCR-движків на реальних фото
| Движок | CER (нахил/тіні) | Швидкість на GPU |
|---|---|---|
| PaddleOCR | 3–7% | ~200 мс |
| Tesseract 5 | 8–15% | ~50 мс (без попередньої обробки) |
| EasyOCR | 5–10% | ~300 мс |
PaddleOCR дає найкращий баланс точності та швидкості для російськомовних документів. При цьому без нашого пайплайну попередньої обробки будь-який OCR показує на 5–10% гірший CER. Використовуючи комбінацію OpenCV та PaddleOCR, ми досягаємо CER <5% для паспортів — це в 1.5–3 рази краще, ніж без попередньої обробки. Наш пайплайн обробляє кадр у 2 рази швидше стандартних рішень з аналогічною якістю.
Процес впровадження
Реалізація під ключ включає:
- Аналіз: вивчення типів документів, умов зйомки, вимог до точності, підбір еталонних знімків.
- Проектування: вибір стеку (OpenCV, PyTorch/TensorFlow, OCR-движок), архітектура пайплайну, конфігурація контейнерів.
- Розробка: написання модулів детекції, корекції, OCR; інтеграція з backend через REST API.
- Тестування: на вашому датасеті (мінімум 500 зображень) замір CER, latency p99, налагодження edge-кейсів.
- Деплой: контейнеризація (Docker), розгортання на сервері або edge-пристрої, моніторинг метрик.
Приклад конфігурації PaddleOCR
ocr = PaddleOCR(use_angle_cls=True, lang='ru', use_gpu=True, det_db_thresh=0.3, det_db_box_thresh=0.5) Параметри підбираються під конкретний домен документів.
Що входить у результат
- Документований пайплайн (код, конфіги, дашборди моніторингу).
- Інтеграція через REST API з прикладами запитів.
- Навчальний вебінар для команди замовника.
- Гарантія: фіксуємо цільовий CER у договорі — ваш бізнес отримує передбачувану якість.
Терміни орієнтовно
| Задача | Термін |
|---|---|
| OCR з базовою попередньою обробкою | 1–2 тижні |
| Повний пайплайн з детекцією документа | 3–4 тижні |
| Мобільний додаток з live preview | 5–7 тижнів |
Вартість розраховується індивідуально після аналізу вашого проєкту. Зв'яжіться з нами для оцінки — обговоримо стек та обсяг робіт, підготуємо комерційну пропозицію за 1–2 дні. Отримайте консультацію інженера, щоб переконатися, що рішення підходить саме вам.
Ми працюємо з комп'ютерним зором та OCR понад 5 років, реалізували проєкти для банків, страхових та державних організацій. Ваш кейс може бути наступним.







