Представьте: отсканированная статья с интегралами, матрицами и суммированиями — обычный OCR выдаёт кракозябры. Двумерная структура формул, показатели степени, дробные черты и специальные символы (∫, ∑, ∂, ∞) не укладываются в линейную модель распознавания текста. Результат нужен в LaTeX или MathML для вёрстки, анализа или публикации. За 5+ лет мы реализовали более 20 проектов в этой области, накопив опыт, который позволяет решать задачи любой сложности.
Мы разрабатываем промышленные системы распознавания формул, которые конвертируют изображения и PDF в математическую разметку с точностью до 93% BLEU на стандартных бенчмарках. Среди наших клиентов — издательства, EdTech-платформы и научные лаборатории, от простых однострочных уравнений до многострочных теорем.
Почему распознавание формул сложнее обычного OCR?
Формула — это не строка символов, а граф с жёсткими позиционными связями. Проблемы: накладывающиеся символы (надстрочные/подстрочные индексы), дроби без явных разделителей, матрицы с пропусками, рукописные символы с вариативностью. Ошибки в распознавании интеграла или границы предела могут полностью изменить смысл. Поэтому мы используем специализированные модели, а не универсальные OCR.
Как мы это делаем: стек и кейс
Для одного EdTech-проекта мы построили пайплайн: сегментация формул → распознавание Pix2Tex → валидация через компиляцию LaTeX → постобработка с помощью LLM для исправления грамматических ошибок (fine-tuned LLaMA 3 на датасете LaTeX). Это снизило количество некомпилируемых формул с 12% до 1.5%. Стек: YOLOv8 для детекции, Pix2Tex как базовый распознаватель, Hugging Face Transformers, pdflatex для валидации.
Pix2Tex: LaTeX OCR из изображений
from pix2tex.cli import LatexOCR from PIL import Image class FormulaRecognizer: def __init__(self): self.model = LatexOCR() def recognize(self, image_path: str) -> dict: img = Image.open(image_path) latex = self.model(img) return { 'latex': latex, 'rendered': self._latex_to_mathml(latex) } def _latex_to_mathml(self, latex: str) -> str: try: import latex2mathml.converter return latex2mathml.converter.convert(latex) except Exception: return '' recognizer = FormulaRecognizer() result = recognizer.recognize('equation.png') print(result['latex']) # \frac{d}{dx}\left(x^2\right) = 2x Альтернатива: Mathpix API
Mathpix — коммерческий сервис с лучшим качеством распознавания на сложных многострочных формулах и текстах смешанного содержания:
Код для Mathpix API
import requests import base64 import json class MathpixOCR: def __init__(self, app_id: str, app_key: str): self.app_id = app_id self.app_key = app_key self.url = 'https://api.mathpix.com/v3/text' def recognize_formula(self, image_path: str) -> dict: with open(image_path, 'rb') as f: image_b64 = base64.b64encode(f.read()).decode() response = requests.post( self.url, headers={ 'app_id': self.app_id, 'app_key': self.app_key, 'Content-Type': 'application/json' }, json={ 'src': f'data:image/jpeg;base64,{image_b64}', 'formats': ['text', 'latex_styled', 'mathml'], 'math_inline_delimiters': ['$', '$'], 'math_display_delimiters': ['$$', '$$'] } ) data = response.json() return { 'latex': data.get('latex_styled', ''), 'text': data.get('text', ''), 'mathml': data.get('mathml', ''), 'confidence': data.get('confidence', 0) } Собственная модель на базе TrOCR
Для специфических нотаций (химические формулы, физические обозначения) мы дообучаем TrOCR на вашем датасете:
from transformers import VisionEncoderDecoderModel, TrOCRProcessor model = VisionEncoderDecoderModel.from_pretrained('microsoft/trocr-base-stage1') processor = TrOCRProcessor.from_pretrained('microsoft/trocr-base-stage1') # Fine-tuning на latex_pairs: [(image, latex_string), ...] Как выбрать между Pix2Tex и Mathpix?
Pix2Tex выигрывает по скорости: он работает в 2–4 раза быстрее Mathpix (0.3–0.7 сек на GPU против 1–2 сек), и полностью локально — не требуется интернет. Mathpix даёт более высокую точность (93+ BLEU против 87.3), особенно на рукописных формулах (85% vs 72%) и на сложных макетах. Если важен privacy и нетребовательна точность — Pix2Tex. Для высоконагруженных издательских систем с жёсткими требованиями к качеству — Mathpix. Мы помогаем выбрать и при необходимости комбинируем оба подхода: Pix2Tex для быстрого превью, Mathpix для финальной вычистки.
| Метрика | Pix2Tex | Mathpix |
|---|---|---|
| BLEU на im2latex-100k | 87.3 | 93+ |
| Точность на рукописных формулах | 72% | 85% |
| Скорость | 0.5 сек | 1–2 сек (API) |
Что такое сегментация формул и зачем она нужна?
Прежде чем распознавать формулы, нужно их найти в документе. Два подхода:
- Детектор формул: YOLOv8 дообученный на датасете документов с размеченными формулами (inline и display). mAP > 0.90 на тестовом наборе.
- PDF через PyMuPDF: извлечение блоков с формулами через анализ PDF-структуры (для digitally created PDF).
Валидация через компиляцию LaTeX
Мы используем автоматическую проверку корректности распознанной формулы через компиляцию pdflatex:
import subprocess import tempfile import os def validate_latex(latex: str) -> bool: template = r""" \documentclass{article} \usepackage{amsmath} \begin{document} $""" + latex + r"""$ \end{document} """ with tempfile.NamedTemporaryFile(suffix='.tex', mode='w', delete=False) as f: f.write(template) tex_path = f.name try: result = subprocess.run( ['pdflatex', '-interaction=nonstopmode', tex_path], capture_output=True, timeout=10 ) return result.returncode == 0 except Exception: return False finally: os.unlink(tex_path) Процесс работы
- Анализ: замеряем объём данных, типы формул, требования к точности, ограничения по latency.
- Выбор подхода: Pix2Tex, Mathpix или кастомная модель (TrOCR + LoRA).
- Интеграция: встраиваем пайплайн в вашу инфраструктуру (Docker, API, брокеры).
- Тестирование: валидация на тестовой выборке, A/B-тестирование.
- Деплой: развёртывание с мониторингом (latency p99, accuracy) и CI/CD.
Что входит в работу
- Документация архитектуры и API.
- Обучающий воркшоп для команды заказчика.
- Поддержка 3 месяца: багфиксы, обновления моделей, консультации.
Ориентировочные сроки
| Задача | Срок |
|---|---|
| Интеграция pix2tex / Mathpix API | 1–2 недели |
| Детекция + распознавание в PDF/Word | 3–5 недель |
| Кастомная модель для нотации | 5–8 недель |
Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки проекта. Мы гарантируем точность не ниже 90% на вашем корпусе после калибровки и предоставляем сертифицированных инженеров с опытом в OCR и MLOps. Получите консультацию: напишите нам, и мы разберём ваш кейс.
Pix2Tex: Lukas Blecher, "Pix2Tex: LaTeX OCR from images", GitHub repository.







