OCR математичних формул: Pix2Tex, Mathpix, TrOCR

Уявіть: відсканована стаття з інтегралами, матрицями та підсумовуваннями — звичайний OCR видає кракозябри. Двомірна структура формул, показники степеня, дробові риски та спеціальні символи (∫, ∑, ∂, ∞) не вкладаються в лінійну модель розпізнавання тексту. Результат потрібен у LaTeX або MathML для ве

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Уявіть: відсканована стаття з інтегралами, матрицями та підсумовуваннями — звичайний OCR видає кракозябри. Двомірна структура формул, показники степеня, дробові риски та спеціальні символи (∫, ∑, ∂, ∞) не вкладаються в лінійну модель розпізнавання тексту. Результат потрібен у LaTeX або MathML для верстки, аналізу чи публікації. За 5+ років ми реалізували понад 20 проєктів у цій галузі, накопичивши досвід, який дозволяє вирішувати завдання будь-якої складності.

Ми розробляємо промислові системи розпізнавання формул, які конвертують зображення та PDF у математичну розмітку з точністю до 93% BLEU на стандартних бенчмарках. Серед наших клієнтів — видавництва, EdTech-платформи та наукові лабораторії, від простих однорядкових рівнянь до багаторядкових теорем.

Чому розпізнавання формул складніше за звичайний OCR?

Формула — це не рядок символів, а граф із жорсткими позиційними зв'язками. Проблеми: накладені символи (надрядкові/підрядкові індекси), дроби без явних роздільників, матриці з пропусками, рукописні символи з варіативністю. Помилки в розпізнаванні інтеграла або границі ліміту можуть повністю змінити зміст. Тому ми використовуємо спеціалізовані моделі, а не універсальні OCR.

Як ми це робимо: стек і кейс

Для одного EdTech-проєкту ми побудували пайплайн: сегментація формул → розпізнавання Pix2Tex → валідація через компіляцію LaTeX → постобробка за допомогою LLM для виправлення граматичних помилок (fine-tuned LLaMA 3 на датасеті LaTeX). Це знизило кількість некомпільованих формул з 12% до 1.5%. Стек: YOLOv8 для детекції, Pix2Tex як базовий розпізнавач, Hugging Face Transformers, pdflatex для валідації.

Pix2Tex: LaTeX OCR із зображень

from pix2tex.cli import LatexOCR from PIL import Image class FormulaRecognizer: def __init__(self): self.model = LatexOCR() def recognize(self, image_path: str) -> dict: img = Image.open(image_path) latex = self.model(img) return { 'latex': latex, 'rendered': self._latex_to_mathml(latex) } def _latex_to_mathml(self, latex: str) -> str: try: import latex2mathml.converter return latex2mathml.converter.convert(latex) except Exception: return '' recognizer = FormulaRecognizer() result = recognizer.recognize('equation.png') print(result['latex']) # \frac{d}{dx}\left(x^2\right) = 2x 

Альтернатива: Mathpix API

Mathpix — комерційний сервіс із кращою якістю розпізнавання на складних багаторядкових формулах і текстах змішаного вмісту:

Код для Mathpix API
import requests import base64 import json class MathpixOCR: def __init__(self, app_id: str, app_key: str): self.app_id = app_id self.app_key = app_key self.url = 'https://api.mathpix.com/v3/text' def recognize_formula(self, image_path: str) -> dict: with open(image_path, 'rb') as f: image_b64 = base64.b64encode(f.read()).decode() response = requests.post( self.url, headers={ 'app_id': self.app_id, 'app_key': self.app_key, 'Content-Type': 'application/json' }, json={ 'src': f'data:image/jpeg;base64,{image_b64}', 'formats': ['text', 'latex_styled', 'mathml'], 'math_inline_delimiters': ['$', '$'], 'math_display_delimiters': ['$$', '$$'] } ) data = response.json() return { 'latex': data.get('latex_styled', ''), 'text': data.get('text', ''), 'mathml': data.get('mathml', ''), 'confidence': data.get('confidence', 0) } 

Власна модель на базі TrOCR

Для специфічних нотацій (хімічні формули, фізичні позначення) ми донавчаємо TrOCR на вашому датасеті:

from transformers import VisionEncoderDecoderModel, TrOCRProcessor model = VisionEncoderDecoderModel.from_pretrained('microsoft/trocr-base-stage1') processor = TrOCRProcessor.from_pretrained('microsoft/trocr-base-stage1') # Fine-tuning на latex_pairs: [(image, latex_string), ...] 

Як обрати між Pix2Tex та Mathpix?

Pix2Tex виграє за швидкістю: він працює в 2–4 рази швидше за Mathpix (0.3–0.7 сек на GPU проти 1–2 сек), і повністю локально — не потребує інтернету. Mathpix дає вищу точність (93+ BLEU проти 87.3), особливо на рукописних формулах (85% vs 72%) і на складних макетах. Якщо важливий privacy і нетребувальна точність — Pix2Tex. Для високонавантажених видавничих систем із жорсткими вимогами до якості — Mathpix. Ми допомагаємо обрати та за необхідності комбінуємо обидва підходи: Pix2Tex для швидкого попереднього перегляду, Mathpix для фінального вичищення.

Метрика Pix2Tex Mathpix
BLEU на im2latex-100k 87.3 93+
Точність на рукописних формулах 72% 85%
Швидкість 0.5 сек 1–2 сек (API)

Що таке сегментація формул і навіщо вона потрібна?

Перш ніж розпізнавати формули, потрібно їх знайти в документі. Два підходи:

  • Детектор формул: YOLOv8 донавчений на датасеті документів із розміченими формулами (inline та display). mAP > 0.90 на тестовому наборі.
  • PDF через PyMuPDF: вилучення блоків із формулами через аналіз PDF-структури (для digitally created PDF).

Валідація через компіляцію LaTeX

Ми використовуємо автоматичну перевірку коректності розпізнаної формули через компіляцію pdflatex:

import subprocess import tempfile import os def validate_latex(latex: str) -> bool: template = r""" \documentclass{article} \usepackage{amsmath} \begin{document} $""" + latex + r"""$ \end{document} """ with tempfile.NamedTemporaryFile(suffix='.tex', mode='w', delete=False) as f: f.write(template) tex_path = f.name try: result = subprocess.run( ['pdflatex', '-interaction=nonstopmode', tex_path], capture_output=True, timeout=10 ) return result.returncode == 0 except Exception: return False finally: os.unlink(tex_path) 

Процес роботи

  1. Аналіз: вимірюємо обсяг даних, типи формул, вимоги до точності, обмеження за latency.
  2. Вибір підходу: Pix2Tex, Mathpix або кастомна модель (TrOCR + LoRA).
  3. Інтеграція: вбудовуємо пайплайн у вашу інфраструктуру (Docker, API, брокери).
  4. Тестування: валідація на тестовій вибірці, A/B-тестування.
  5. Деплой: розгортання з моніторингом (latency p99, accuracy) та CI/CD.

Що входить у роботу

  • Документація архітектури та API.
  • Навчальний воркшоп для команди замовника.
  • Підтримка 3 місяці: баґфікси, оновлення моделей, консультації.

Орієнтовні строки

Завдання Строк
Інтеграція pix2tex / Mathpix API 1–2 тижні
Детекція + розпізнавання в PDF/Word 3–5 тижнів
Кастомна модель для нотації 5–8 тижнів

Вартість розраховується індивідуально. Зв'яжіться з нами для оцінки проєкту. Ми гарантуємо точність не нижче 90% на вашому корпусі після калібрування та надаємо сертифікованих інженерів із досвідом в OCR та MLOps. Отримайте консультацію: напишіть нам, і ми розберемо ваш кейс.

Pix2Tex: Lukas Blecher, "Pix2Tex: LaTeX OCR from images", GitHub repository.