Розробка HTR-систем для рукописних документів: TrOCR і PaddleOCR

Рукописний текст — значно складніший за машинодрукований: нескінченна різноманітність почерків, лігатури (злите написання), нечіткі межі між символами, варіативність натиску та кута. Ми стикаємося з цим на кожному проєкті. Клієнти часто приходять із задачею: потрібно розпізнати тисячі заповнених від

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Рукописний текст — значно складніший за машинодрукований: нескінченна різноманітність почерків, лігатури (злите написання), нечіткі межі між символами, варіативність натиску та кута. Ми стикаємося з цим на кожному проєкті. Клієнти часто приходять із задачею: потрібно розпізнати тисячі заповнених від руки анкет за місяць з помилкою не більше 5%. Стандартні OCR-системи тут безсилі. За 5 років ми реалізували понад 30 проєктів із розпізнавання рукописного тексту для архівних, медичних та корпоративних замовників. Наш досвід підтверджує: правильна передобробка та вибір архітектури вирішують 80% успіху. В одному з проєктів для медичного центру ми замінили ручне введення 5000 карт на день на автоматичне розпізнавання — це скоротило витрати на обробку документів більш ніж на 60%.

Як вибрати модель для російського рукописного тексту?

Вибір архітектури залежить від мови та обсягу даних. TrOCR (Microsoft) — transformer encoder-decoder для OCR. Encoder: ViT-обробка зображення, Decoder: autoregressive генерація тексту. State-of-the-art на IAM handwriting dataset: CER 2.89% (large model). Однак TrOCR навчений переважно на англійській, тому для кирилиці краще використовувати PaddleOCR.

from transformers import TrOCRProcessor, VisionEncoderDecoderModel from PIL import Image import torch class HandwritingRecognizer: def __init__(self, model_name: str = 'microsoft/trocr-large-handwritten'): self.processor = TrOCRProcessor.from_pretrained(model_name) self.model = VisionEncoderDecoderModel.from_pretrained(model_name) self.model.eval() self.device = 'cuda' if torch.cuda.is_available() else 'cpu' self.model.to(self.device) @torch.no_grad() def recognize(self, image: Image.Image) -> str: """Розпізнавання одного рядка тексту""" pixel_values = self.processor( images=image, return_tensors='pt' ).pixel_values.to(self.device) generated_ids = self.model.generate( pixel_values, max_new_tokens=128, num_beams=4 ) return self.processor.batch_decode( generated_ids, skip_special_tokens=True )[0] 

PaddleOCR для рукописного кириличного тексту — суттєво кращий, ніж TrOCR:

from paddleocr import PaddleOCR ocr = PaddleOCR( use_angle_cls=True, lang='ru', rec_algorithm='SVTR_LCNet', rec_model_dir='./models/handwriting_rec' ) 

Чому передобробка важливіша за архітектуру?

Рукописний текст вимагає більш агресивної передобробки. Видалення лінованого фону, бінаризація, очищення артефактів — ці кроки критично впливають на підсумковий CER. Нижче — типовий пайплайн.

import cv2 import numpy as np from skimage import morphology def preprocess_handwriting(image: np.ndarray) -> np.ndarray: gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) # Видалення фонових ліній (лінований папір) horizontal_kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (40, 1)) horizontal_lines = cv2.morphologyEx(gray, cv2.MORPH_OPEN, horizontal_kernel) gray = cv2.subtract(gray, horizontal_lines) # Otsu бінаризація _, binary = cv2.threshold(gray, 0, 255, cv2.THRESH_BINARY_INV + cv2.THRESH_OTSU) # Видалення маленьких артефактів cleaned = morphology.remove_small_objects( binary.astype(bool), min_size=50 ).astype(np.uint8) * 255 return cleaned 

Як ми проводимо fine-tuning моделі?

Для адаптації під корпоративні дані ми використовуємо наступний пайплайн:

  1. Розмітка даних. Збираємо 500–2000 рядків рукописного тексту, транскрибуємо в Label Studio. Кожен рядок — окремий файл із текстовою міткою.
  2. Аугментація. Застосовуємо випадковий зсув, поворот до 5°, масштабування 0.9–1.1, додавання шуму — це підвищує стійкість до варіацій почерку.
  3. Fine-tuning. Для PaddleOCR використовуємо RecModel з SVTR_LCNet, batch size 32, learning rate 1e-4, 100 епох. Моніторимо CER на валідації.
  4. Валідація. Тестуємо на 10% даних (не брали участі в навчанні). Якщо CER вище 10%, додаємо даних або змінюємо гіперпараметри.
  5. Експорт. Модель конвертується в ONNX або зберігається у форматі PaddleOCR для інференсу.

Сегментація рядків для багаторядкових документів

Перед розпізнаванням багаторядковий документ потрібно розбити на рядки:

def segment_lines(binary_image: np.ndarray) -> list[np.ndarray]: """Горизонтальна проекція для сегментації рядків""" horizontal_projection = binary_image.sum(axis=1) threshold = horizontal_projection.max() * 0.05 in_line = horizontal_projection > threshold lines = [] start = None for i, active in enumerate(in_line): if active and start is None: start = max(0, i - 5) elif not active and start is not None: end = min(len(in_line), i + 5) line_img = binary_image[start:end, :] if end - start > 10: lines.append(line_img) start = None return lines 
Приклади передобробки

Для документів із кольоровими лініями (медичні карти) використовуємо адаптивну бінаризацію з розміром блоку 21. Для бланків із сірим фоном — віднімання фону по круговому ядру diameter=15. Параметри підбираються під конкретний трафарет.

Донавчання на корпоративних рукописних даних

Для специфічного почерку (медичні карти конкретної лікарні, бланки підприємства) потрібне fine-tuning. Без цього CER може сягати 20-30%, що неприйнятно для документообігу. Ми гарантуємо, що після донавчання на 500–2000 рядків точність зросте до 90-95%.

  • Розмітка 500–2000 рядків через Label Studio або CVAT.
  • Fine-tuning TrOCR або PaddleOCR rec_model.
  • CER знижується з 15–25% до 5–10% на domain-specific даних.
Датасет Мова CER SOTA
IAM Online/Offline English 2.89% (TrOCR-Large)
CVL Database English/German 3.1%
Bentham Collection English 4.5%
HWR200 (Russian) Russian ~8%

Що таке CER і чому це критично?

CER (Character Error Rate) — частка помилок на рівні символів. Для бізнес-процесів навіть 5% може означати сотні неправильно розпізнаних цифр у звітах. В одному з проєктів медичного центру ми знизили CER з 18% до 4%, застосувавши комбінацію адаптивної бінаризації та fine-tuning PaddleOCR. Результат — автоматична обробка 5000 карт на день замість ручного введення, і скорочення витрат на обробку документів більш ніж на 60%. Еталонні значення CER на публічних датасетах (IAM Handwriting Database) становлять ~2.89%, але на реальних даних потрібне донавчання.

Як часто потрібно оновлювати модель?

Якщо почерк операторів змінюється або додаються нові поля, модель рекомендується донавчати раз на півроку. Ми надаємо пайплайн інкрементального навчання, який дозволяє оновити ваги за кілька годин без повного ретренінгу. При значній зміні трафарету документів (наприклад, перехід на новий бланк) достатньо додати 200–500 нових розмічених рядків і запустити fine-tuning.

Що входить у роботу

  • Аналіз вимог і тестовий прогін на 50 сторінках.
  • Вибір архітектури (TrOCR / PaddleOCR / комбінована).
  • Розробка пайплайну передобробки та сегментації.
  • Донавчання моделі (якщо потрібно) з валідацією.
  • Інтеграція через REST API або gRPC.
  • Документація та навчання операторів.
  • Підтримка 3 місяці після впровадження.

Терміни та вартість

Задача Термін
Інтеграція TrOCR для англійської 1 тиждень
Розпізнавання кириличного рукописного 2–3 тижні
Fine-tuning під корпоративні документи 4–7 тижнів

Вартість розраховується індивідуально — залежить від обсягу даних, необхідної точності та складності інтеграції. Оцінка проєкту — безкоштовно. Зв'яжіться з нами для тестового прогону на ваших зразках. Наші інженери проаналізують ваші рукописні документи та запропонують оптимальне рішення. Отримайте консультацію вже сьогодні.