Рукописный текст — значительно сложнее машинопечатного: бесконечное разнообразие почерков, лигатуры (слитное написание), нечёткие границы между символами, вариативность нажима и угла. Мы сталкиваемся с этим на каждом проекте. Клиенты часто приходят с задачей: нужно распознать тысячи заполненных от руки анкет за месяц с ошибкой не более 5%. Стандартные OCR-системы тут бессильны. За 5 лет мы реализовали более 30 проектов по распознаванию рукописного текста для архивных, медицинских и корпоративных заказчиков. Наш опыт подтверждает: правильная предобработка и выбор архитектуры решают 80% успеха. В одном из проектов для медицинского центра мы заменили ручной ввод 5000 карт в день на автоматическое распознавание — это сократило затраты на обработку документов более чем на 60%.
Как выбрать модель для русского рукописного текста?
Выбор архитектуры зависит от языка и объёма данных. TrOCR (Microsoft) — transformer encoder-decoder для OCR. Encoder: ViT-обработка изображения, Decoder: autoregressive генерация текста. State-of-the-art на IAM handwriting dataset: CER 2.89% (large model). Однако TrOCR обучен преимущественно на английском, поэтому для кириллицы лучше использовать PaddleOCR.
from transformers import TrOCRProcessor, VisionEncoderDecoderModel from PIL import Image import torch class HandwritingRecognizer: def __init__(self, model_name: str = 'microsoft/trocr-large-handwritten'): self.processor = TrOCRProcessor.from_pretrained(model_name) self.model = VisionEncoderDecoderModel.from_pretrained(model_name) self.model.eval() self.device = 'cuda' if torch.cuda.is_available() else 'cpu' self.model.to(self.device) @torch.no_grad() def recognize(self, image: Image.Image) -> str: """Распознавание одной строки текста""" pixel_values = self.processor( images=image, return_tensors='pt' ).pixel_values.to(self.device) generated_ids = self.model.generate( pixel_values, max_new_tokens=128, num_beams=4 ) return self.processor.batch_decode( generated_ids, skip_special_tokens=True )[0] PaddleOCR для рукописного кириллического текста — существенно лучше, чем TrOCR:
from paddleocr import PaddleOCR ocr = PaddleOCR( use_angle_cls=True, lang='ru', rec_algorithm='SVTR_LCNet', rec_model_dir='./models/handwriting_rec' ) Почему предобработка важнее архитектуры?
Рукописный текст требует более агрессивной предобработки. Удаление линованного фона, бинаризация, очистка артефактов — эти шаги критически влияют на итоговый CER. Ниже — типовой пайплайн.
import cv2 import numpy as np from skimage import morphology def preprocess_handwriting(image: np.ndarray) -> np.ndarray: gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) # Удаление фоновых линий (линованная бумага) horizontal_kernel = cv2.getStructuringElement(cv2.MORPH_RECT, (40, 1)) horizontal_lines = cv2.morphologyEx(gray, cv2.MORPH_OPEN, horizontal_kernel) gray = cv2.subtract(gray, horizontal_lines) # Otsu бинаризация _, binary = cv2.threshold(gray, 0, 255, cv2.THRESH_BINARY_INV + cv2.THRESH_OTSU) # Удаление маленьких артефактов cleaned = morphology.remove_small_objects( binary.astype(bool), min_size=50 ).astype(np.uint8) * 255 return cleaned Как мы проводим fine-tuning модели?
Для адаптации под корпоративные данные мы используем следующий пайплайн:
- Разметка данных. Собираем 500–2000 строк рукописного текста, транскрибируем в Label Studio. Каждая строка — отдельный файл с текстовой меткой.
- Аугментация. Применяем случайный сдвиг, поворот до 5°, масштабирование 0.9–1.1, добавление шума — это повышает устойчивость к вариациям почерка.
- Fine-tuning. Для PaddleOCR используем RecModel с SVTR_LCNet, batch size 32, learning rate 1e-4, 100 эпох. Мониторим CER на валидации.
- Валидация. Тестируем на 10% данных (не участвовавших в обучении). Если CER выше 10%, добавляем данных или меняем гиперпараметры.
- Экспорт. Модель конвертируется в ONNX или сохраняется в формате PaddleOCR для инференса.
Сегментация строк для многострочных документов
Перед распознаванием многострочный документ нужно разбить на строки:
def segment_lines(binary_image: np.ndarray) -> list[np.ndarray]: """Горизонтальная проекция для сегментации строк""" horizontal_projection = binary_image.sum(axis=1) threshold = horizontal_projection.max() * 0.05 in_line = horizontal_projection > threshold lines = [] start = None for i, active in enumerate(in_line): if active and start is None: start = max(0, i - 5) elif not active and start is not None: end = min(len(in_line), i + 5) line_img = binary_image[start:end, :] if end - start > 10: lines.append(line_img) start = None return lines Примеры предобработки
Для документов с цветными линиями (медицинские карты) используем адаптивную бинаризацию с размером блока 21. Для бланков с серым фоном — вычитание фона по круговому ядру diameter=15. Параметры подбираются под конкретный трафарет.
Дообучение на корпоративных рукописных данных
Для специфического почерка (медицинские карты конкретной больницы, бланки предприятия) требуется fine-tuning. Без этого CER может достигать 20-30%, что неприемлемо для документооборота. Мы гарантируем, что после дообучения на 500–2000 строк точность вырастет до 90-95%.
- Разметка 500–2000 строк через Label Studio или CVAT.
- Fine-tuning TrOCR или PaddleOCR rec_model.
- CER снижается с 15–25% до 5–10% на domain-specific данных.
| Датасет | Язык | CER SOTA |
|---|---|---|
| IAM Online/Offline | English | 2.89% (TrOCR-Large) |
| CVL Database | English/German | 3.1% |
| Bentham Collection | English | 4.5% |
| HWR200 (Russian) | Russian | ~8% |
Что такое CER и почему это критично?
CER (Character Error Rate) — доля ошибок на уровне символов. Для бизнес-процессов даже 5% может означать сотни неправильно распознанных цифр в отчётах. В одном из проектов медицинского центра мы снизили CER с 18% до 4%, применив комбинацию адаптивной бинаризации и fine-tuning PaddleOCR. Результат — автоматическая обработка 5000 карт в день вместо ручного ввода, и сокращение затрат на обработку документов более чем на 60%. Эталонные значения CER на публичных датасетах (IAM Handwriting Database) составляют ~2.89%, но на реальных данных требуется дообучение.
Как часто нужно обновлять модель?
Если почерк операторов меняется или добавляются новые поля, модель рекомендуется дообучать раз в полгода. Мы предоставляем пайплайн инкрементального обучения, который позволяет обновить веса за несколько часов без полного ретренинга. При значительном изменении трафарета документов (например, переход на новый бланк) достаточно добавить 200–500 новых размеченных строк и запустить fine-tuning.
Что входит в работу
- Анализ требований и тестовый прогон на 50 страницах.
- Выбор архитектуры (TrOCR / PaddleOCR / комбинированная).
- Разработка пайплайна предобработки и сегментации.
- Дообучение модели (если нужно) с валидацией.
- Интеграция через REST API или gRPC.
- Документация и обучение операторов.
- Поддержка 3 месяца после внедрения.
Сроки и стоимость
| Задача | Срок |
|---|---|
| Интеграция TrOCR для английского | 1 неделя |
| Распознавание кириллического рукописного | 2–3 недели |
| Fine-tuning под корпоративные документы | 4–7 недель |
Стоимость рассчитывается индивидуально — зависит от объёма данных, требуемой точности и сложности интеграции. Оценка проекта — бесплатно. Свяжитесь с нами для тестового прогона на ваших образцах. Наши инженеры проанализируют ваши рукописные документы и предложат оптимальное решение. Получите консультацию уже сегодня.







