OCR математических формул: Pix2Tex, Mathpix, TrOCR

Представьте: отсканированная статья с интегралами, матрицами и суммированиями — обычный OCR выдаёт кракозябры. Двумерная структура формул, показатели степени, дробные черты и специальные символы (∫, ∑, ∂, ∞) не укладываются в линейную модель распознавания текста. Результат нужен в LaTeX или MathML д

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • Разработка сайта компании B2B ADVANCE
    Разработка сайта компании B2B ADVANCE
    1460
  • Разработка веб-приложения для компании FEEDME
    Разработка веб-приложения для компании FEEDME
    1314
  • Разработка веб-сайта для компании БЕЛФИНГРУПП
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    1013
  • Разработка интернет магазина для компании FURNORO
    Разработка интернет магазина для компании FURNORO
    1275
  • Разработка логотипа компании B2B Advance
    Разработка логотипа компании B2B Advance
    727
  • Разработка веб-приложения для компании Enviok
    Разработка веб-приложения для компании Enviok
    1019

Представьте: отсканированная статья с интегралами, матрицами и суммированиями — обычный OCR выдаёт кракозябры. Двумерная структура формул, показатели степени, дробные черты и специальные символы (∫, ∑, ∂, ∞) не укладываются в линейную модель распознавания текста. Результат нужен в LaTeX или MathML для вёрстки, анализа или публикации. За 5+ лет мы реализовали более 20 проектов в этой области, накопив опыт, который позволяет решать задачи любой сложности.

Мы разрабатываем промышленные системы распознавания формул, которые конвертируют изображения и PDF в математическую разметку с точностью до 93% BLEU на стандартных бенчмарках. Среди наших клиентов — издательства, EdTech-платформы и научные лаборатории, от простых однострочных уравнений до многострочных теорем.

Почему распознавание формул сложнее обычного OCR?

Формула — это не строка символов, а граф с жёсткими позиционными связями. Проблемы: накладывающиеся символы (надстрочные/подстрочные индексы), дроби без явных разделителей, матрицы с пропусками, рукописные символы с вариативностью. Ошибки в распознавании интеграла или границы предела могут полностью изменить смысл. Поэтому мы используем специализированные модели, а не универсальные OCR.

Как мы это делаем: стек и кейс

Для одного EdTech-проекта мы построили пайплайн: сегментация формул → распознавание Pix2Tex → валидация через компиляцию LaTeX → постобработка с помощью LLM для исправления грамматических ошибок (fine-tuned LLaMA 3 на датасете LaTeX). Это снизило количество некомпилируемых формул с 12% до 1.5%. Стек: YOLOv8 для детекции, Pix2Tex как базовый распознаватель, Hugging Face Transformers, pdflatex для валидации.

Pix2Tex: LaTeX OCR из изображений

from pix2tex.cli import LatexOCR from PIL import Image class FormulaRecognizer: def __init__(self): self.model = LatexOCR() def recognize(self, image_path: str) -> dict: img = Image.open(image_path) latex = self.model(img) return { 'latex': latex, 'rendered': self._latex_to_mathml(latex) } def _latex_to_mathml(self, latex: str) -> str: try: import latex2mathml.converter return latex2mathml.converter.convert(latex) except Exception: return '' recognizer = FormulaRecognizer() result = recognizer.recognize('equation.png') print(result['latex']) # \frac{d}{dx}\left(x^2\right) = 2x 

Альтернатива: Mathpix API

Mathpix — коммерческий сервис с лучшим качеством распознавания на сложных многострочных формулах и текстах смешанного содержания:

Код для Mathpix API
import requests import base64 import json class MathpixOCR: def __init__(self, app_id: str, app_key: str): self.app_id = app_id self.app_key = app_key self.url = 'https://api.mathpix.com/v3/text' def recognize_formula(self, image_path: str) -> dict: with open(image_path, 'rb') as f: image_b64 = base64.b64encode(f.read()).decode() response = requests.post( self.url, headers={ 'app_id': self.app_id, 'app_key': self.app_key, 'Content-Type': 'application/json' }, json={ 'src': f'data:image/jpeg;base64,{image_b64}', 'formats': ['text', 'latex_styled', 'mathml'], 'math_inline_delimiters': ['$', '$'], 'math_display_delimiters': ['$$', '$$'] } ) data = response.json() return { 'latex': data.get('latex_styled', ''), 'text': data.get('text', ''), 'mathml': data.get('mathml', ''), 'confidence': data.get('confidence', 0) } 

Собственная модель на базе TrOCR

Для специфических нотаций (химические формулы, физические обозначения) мы дообучаем TrOCR на вашем датасете:

from transformers import VisionEncoderDecoderModel, TrOCRProcessor model = VisionEncoderDecoderModel.from_pretrained('microsoft/trocr-base-stage1') processor = TrOCRProcessor.from_pretrained('microsoft/trocr-base-stage1') # Fine-tuning на latex_pairs: [(image, latex_string), ...] 

Как выбрать между Pix2Tex и Mathpix?

Pix2Tex выигрывает по скорости: он работает в 2–4 раза быстрее Mathpix (0.3–0.7 сек на GPU против 1–2 сек), и полностью локально — не требуется интернет. Mathpix даёт более высокую точность (93+ BLEU против 87.3), особенно на рукописных формулах (85% vs 72%) и на сложных макетах. Если важен privacy и нетребовательна точность — Pix2Tex. Для высоконагруженных издательских систем с жёсткими требованиями к качеству — Mathpix. Мы помогаем выбрать и при необходимости комбинируем оба подхода: Pix2Tex для быстрого превью, Mathpix для финальной вычистки.

Метрика Pix2Tex Mathpix
BLEU на im2latex-100k 87.3 93+
Точность на рукописных формулах 72% 85%
Скорость 0.5 сек 1–2 сек (API)

Что такое сегментация формул и зачем она нужна?

Прежде чем распознавать формулы, нужно их найти в документе. Два подхода:

  • Детектор формул: YOLOv8 дообученный на датасете документов с размеченными формулами (inline и display). mAP > 0.90 на тестовом наборе.
  • PDF через PyMuPDF: извлечение блоков с формулами через анализ PDF-структуры (для digitally created PDF).

Валидация через компиляцию LaTeX

Мы используем автоматическую проверку корректности распознанной формулы через компиляцию pdflatex:

import subprocess import tempfile import os def validate_latex(latex: str) -> bool: template = r""" \documentclass{article} \usepackage{amsmath} \begin{document} $""" + latex + r"""$ \end{document} """ with tempfile.NamedTemporaryFile(suffix='.tex', mode='w', delete=False) as f: f.write(template) tex_path = f.name try: result = subprocess.run( ['pdflatex', '-interaction=nonstopmode', tex_path], capture_output=True, timeout=10 ) return result.returncode == 0 except Exception: return False finally: os.unlink(tex_path) 

Процесс работы

  1. Анализ: замеряем объём данных, типы формул, требования к точности, ограничения по latency.
  2. Выбор подхода: Pix2Tex, Mathpix или кастомная модель (TrOCR + LoRA).
  3. Интеграция: встраиваем пайплайн в вашу инфраструктуру (Docker, API, брокеры).
  4. Тестирование: валидация на тестовой выборке, A/B-тестирование.
  5. Деплой: развёртывание с мониторингом (latency p99, accuracy) и CI/CD.

Что входит в работу

  • Документация архитектуры и API.
  • Обучающий воркшоп для команды заказчика.
  • Поддержка 3 месяца: багфиксы, обновления моделей, консультации.

Ориентировочные сроки

Задача Срок
Интеграция pix2tex / Mathpix API 1–2 недели
Детекция + распознавание в PDF/Word 3–5 недель
Кастомная модель для нотации 5–8 недель

Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки проекта. Мы гарантируем точность не ниже 90% на вашем корпусе после калибровки и предоставляем сертифицированных инженеров с опытом в OCR и MLOps. Получите консультацию: напишите нам, и мы разберём ваш кейс.

Pix2Tex: Lukas Blecher, "Pix2Tex: LaTeX OCR from images", GitHub repository.