Разработка HTR-систем для рукописных документов: TrOCR и PaddleOCR

Рукописный текст — значительно сложнее машинопечатного: бесконечное разнообразие почерков, лигатуры (слитное написание), нечёткие границы между символами, вариативность нажима и угла. Мы сталкиваемся с этим на каждом проекте. Клиенты часто приходят с задачей: нужно распознать тысячи заполненных от р

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1460
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1314
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    1013
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1275
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    727
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1019

Рукописный текст — значительно сложнее машинопечатного: бесконечное разнообразие почерков, лигатуры (слитное написание), нечёткие границы между символами, вариативность нажима и угла. Мы сталкиваемся с этим на каждом проекте. Клиенты часто приходят с задачей: нужно распознать тысячи заполненных от руки анкет за месяц с ошибкой не более 5%. Стандартные OCR-системы тут бессильны. За 5 лет мы реализовали более 30 проектов по распознаванию рукописного текста для архивных, медицинских и корпоративных заказчиков. Наш опыт подтверждает: правильная предобработка и выбор архитектуры решают 80% успеха. В одном из проектов для медицинского центра мы заменили ручной ввод 5000 карт в день на автоматическое распознавание — это сократило затраты на обработку документов более чем на 60%.

Как выбрать модель для русского рукописного текста?

Выбор архитектуры зависит от языка и объёма данных. TrOCR (Microsoft) — transformer encoder-decoder для OCR. Encoder: ViT-обработка изображения, Decoder: autoregressive генерация текста. State-of-the-art на IAM handwriting dataset: CER 2.89% (large model). Однако TrOCR обучен преимущественно на английском, поэтому для кириллицы лучше использовать PaddleOCR.

from transformers import TrOCRProcessor, VisionEncoderDecoderModel from PIL import Image import torch class HandwritingRecognizer: def __init__(self, model_name: str = 'microsoft/trocr-large-handwritten'): self.processor = TrOCRProcessor.from_pretrained(model_name) self.model = VisionEncoderDecoderModel.from_pretrained(model_name) self.model.eval() self.device = 'cuda' if torch.cuda.is_available() else 'cpu' self.model.to(self.device) @torch.no_grad() def recognize(self, image: Image.Image) -> str: """Распознавание одной строки текста""" pixel_values = self.processor( images=image, return_tensors='pt' ).pixel_values.to(self.device) generated_ids = self.model.generate( pixel_values, max_new_tokens=128, num_beams=4 ) return self.processor.batch_decode( generated_ids, skip_special_tokens=True )[0] 

PaddleOCR для рукописного кириллического текста — существенно лучше, чем TrOCR:

from paddleocr import PaddleOCR ocr = PaddleOCR( use_angle_cls=True, lang='ru', rec_algorithm='SVTR_LCNet', rec_model_dir='./models/handwriting_rec' ) 

Почему предобработка важнее архитектуры?

Рукописный текст требует более агрессивной предобработки. Удаление линованного фона, бинаризация, очистка артефактов — эти шаги критически влияют на итоговый CER. Ниже — типовой пайплайн.

import cv2 import numpy as np from skimage import morphology def preprocess_handwriting(image: np.ndarray) -> np.ndarray: gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) # Удаление фоновых линий (линованная бумага) horizontal_kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (40, 1)) horizontal_lines = cv2.morphologyEx(gray, cv2.MORPH_OPEN, horizontal_kernel) gray = cv2.subtract(gray, horizontal_lines) # Otsu бинаризация _, binary = cv2.threshold(gray, 0, 255, cv2.THRESH_BINARY_INV + cv2.THRESH_OTSU) # Удаление маленьких артефактов cleaned = morphology.remove_small_objects( binary.astype(bool), min_size=50 ).astype(np.uint8) * 255 return cleaned 

Как мы проводим fine-tuning модели?

Для адаптации под корпоративные данные мы используем следующий пайплайн:

  1. Разметка данных. Собираем 500–2000 строк рукописного текста, транскрибируем в Label Studio. Каждая строка — отдельный файл с текстовой меткой.
  2. Аугментация. Применяем случайный сдвиг, поворот до 5°, масштабирование 0.9–1.1, добавление шума — это повышает устойчивость к вариациям почерка.
  3. Fine-tuning. Для PaddleOCR используем RecModel с SVTR_LCNet, batch size 32, learning rate 1e-4, 100 эпох. Мониторим CER на валидации.
  4. Валидация. Тестируем на 10% данных (не участвовавших в обучении). Если CER выше 10%, добавляем данных или меняем гиперпараметры.
  5. Экспорт. Модель конвертируется в ONNX или сохраняется в формате PaddleOCR для инференса.

Сегментация строк для многострочных документов

Перед распознаванием многострочный документ нужно разбить на строки:

def segment_lines(binary_image: np.ndarray) -> list[np.ndarray]: """Горизонтальная проекция для сегментации строк""" horizontal_projection = binary_image.sum(axis=1) threshold = horizontal_projection.max() * 0.05 in_line = horizontal_projection > threshold lines = [] start = None for i, active in enumerate(in_line): if active and start is None: start = max(0, i - 5) elif not active and start is not None: end = min(len(in_line), i + 5) line_img = binary_image[start:end, :] if end - start > 10: lines.append(line_img) start = None return lines 
Примеры предобработки

Для документов с цветными линиями (медицинские карты) используем адаптивную бинаризацию с размером блока 21. Для бланков с серым фоном — вычитание фона по круговому ядру diameter=15. Параметры подбираются под конкретный трафарет.

Дообучение на корпоративных рукописных данных

Для специфического почерка (медицинские карты конкретной больницы, бланки предприятия) требуется fine-tuning. Без этого CER может достигать 20-30%, что неприемлемо для документооборота. Мы гарантируем, что после дообучения на 500–2000 строк точность вырастет до 90-95%.

  • Разметка 500–2000 строк через Label Studio или CVAT.
  • Fine-tuning TrOCR или PaddleOCR rec_model.
  • CER снижается с 15–25% до 5–10% на domain-specific данных.
Датасет Язык CER SOTA
IAM Online/Offline English 2.89% (TrOCR-Large)
CVL Database English/German 3.1%
Bentham Collection English 4.5%
HWR200 (Russian) Russian ~8%

Что такое CER и почему это критично?

CER (Character Error Rate) — доля ошибок на уровне символов. Для бизнес-процессов даже 5% может означать сотни неправильно распознанных цифр в отчётах. В одном из проектов медицинского центра мы снизили CER с 18% до 4%, применив комбинацию адаптивной бинаризации и fine-tuning PaddleOCR. Результат — автоматическая обработка 5000 карт в день вместо ручного ввода, и сокращение затрат на обработку документов более чем на 60%. Эталонные значения CER на публичных датасетах (IAM Handwriting Database) составляют ~2.89%, но на реальных данных требуется дообучение.

Как часто нужно обновлять модель?

Если почерк операторов меняется или добавляются новые поля, модель рекомендуется дообучать раз в полгода. Мы предоставляем пайплайн инкрементального обучения, который позволяет обновить веса за несколько часов без полного ретренинга. При значительном изменении трафарета документов (например, переход на новый бланк) достаточно добавить 200–500 новых размеченных строк и запустить fine-tuning.

Что входит в работу

  • Анализ требований и тестовый прогон на 50 страницах.
  • Выбор архитектуры (TrOCR / PaddleOCR / комбинированная).
  • Разработка пайплайна предобработки и сегментации.
  • Дообучение модели (если нужно) с валидацией.
  • Интеграция через REST API или gRPC.
  • Документация и обучение операторов.
  • Поддержка 3 месяца после внедрения.

Сроки и стоимость

Задача Срок
Интеграция TrOCR для английского 1 неделя
Распознавание кириллического рукописного 2–3 недели
Fine-tuning под корпоративные документы 4–7 недель

Стоимость рассчитывается индивидуально — зависит от объёма данных, требуемой точности и сложности интеграции. Оценка проекта — бесплатно. Свяжитесь с нами для тестового прогона на ваших образцах. Наши инженеры проанализируют ваши рукописные документы и предложат оптимальное решение. Получите консультацию уже сегодня.