Уявіть: відсканована стаття з інтегралами, матрицями та підсумовуваннями — звичайний OCR видає кракозябри. Двомірна структура формул, показники степеня, дробові риски та спеціальні символи (∫, ∑, ∂, ∞) не вкладаються в лінійну модель розпізнавання тексту. Результат потрібен у LaTeX або MathML для верстки, аналізу чи публікації. За 5+ років ми реалізували понад 20 проєктів у цій галузі, накопичивши досвід, який дозволяє вирішувати завдання будь-якої складності.
Ми розробляємо промислові системи розпізнавання формул, які конвертують зображення та PDF у математичну розмітку з точністю до 93% BLEU на стандартних бенчмарках. Серед наших клієнтів — видавництва, EdTech-платформи та наукові лабораторії, від простих однорядкових рівнянь до багаторядкових теорем.
Чому розпізнавання формул складніше за звичайний OCR?
Формула — це не рядок символів, а граф із жорсткими позиційними зв'язками. Проблеми: накладені символи (надрядкові/підрядкові індекси), дроби без явних роздільників, матриці з пропусками, рукописні символи з варіативністю. Помилки в розпізнаванні інтеграла або границі ліміту можуть повністю змінити зміст. Тому ми використовуємо спеціалізовані моделі, а не універсальні OCR.
Як ми це робимо: стек і кейс
Для одного EdTech-проєкту ми побудували пайплайн: сегментація формул → розпізнавання Pix2Tex → валідація через компіляцію LaTeX → постобробка за допомогою LLM для виправлення граматичних помилок (fine-tuned LLaMA 3 на датасеті LaTeX). Це знизило кількість некомпільованих формул з 12% до 1.5%. Стек: YOLOv8 для детекції, Pix2Tex як базовий розпізнавач, Hugging Face Transformers, pdflatex для валідації.
Pix2Tex: LaTeX OCR із зображень
from pix2tex.cli import LatexOCR from PIL import Image class FormulaRecognizer: def __init__(self): self.model = LatexOCR() def recognize(self, image_path: str) -> dict: img = Image.open(image_path) latex = self.model(img) return { 'latex': latex, 'rendered': self._latex_to_mathml(latex) } def _latex_to_mathml(self, latex: str) -> str: try: import latex2mathml.converter return latex2mathml.converter.convert(latex) except Exception: return '' recognizer = FormulaRecognizer() result = recognizer.recognize('equation.png') print(result['latex']) # \frac{d}{dx}\left(x^2\right) = 2x Альтернатива: Mathpix API
Mathpix — комерційний сервіс із кращою якістю розпізнавання на складних багаторядкових формулах і текстах змішаного вмісту:
Код для Mathpix API
import requests import base64 import json class MathpixOCR: def __init__(self, app_id: str, app_key: str): self.app_id = app_id self.app_key = app_key self.url = 'https://api.mathpix.com/v3/text' def recognize_formula(self, image_path: str) -> dict: with open(image_path, 'rb') as f: image_b64 = base64.b64encode(f.read()).decode() response = requests.post( self.url, headers={ 'app_id': self.app_id, 'app_key': self.app_key, 'Content-Type': 'application/json' }, json={ 'src': f'data:image/jpeg;base64,{image_b64}', 'formats': ['text', 'latex_styled', 'mathml'], 'math_inline_delimiters': ['$', '$'], 'math_display_delimiters': ['$$', '$$'] } ) data = response.json() return { 'latex': data.get('latex_styled', ''), 'text': data.get('text', ''), 'mathml': data.get('mathml', ''), 'confidence': data.get('confidence', 0) } Власна модель на базі TrOCR
Для специфічних нотацій (хімічні формули, фізичні позначення) ми донавчаємо TrOCR на вашому датасеті:
from transformers import VisionEncoderDecoderModel, TrOCRProcessor model = VisionEncoderDecoderModel.from_pretrained('microsoft/trocr-base-stage1') processor = TrOCRProcessor.from_pretrained('microsoft/trocr-base-stage1') # Fine-tuning на latex_pairs: [(image, latex_string), ...] Як обрати між Pix2Tex та Mathpix?
Pix2Tex виграє за швидкістю: він працює в 2–4 рази швидше за Mathpix (0.3–0.7 сек на GPU проти 1–2 сек), і повністю локально — не потребує інтернету. Mathpix дає вищу точність (93+ BLEU проти 87.3), особливо на рукописних формулах (85% vs 72%) і на складних макетах. Якщо важливий privacy і нетребувальна точність — Pix2Tex. Для високонавантажених видавничих систем із жорсткими вимогами до якості — Mathpix. Ми допомагаємо обрати та за необхідності комбінуємо обидва підходи: Pix2Tex для швидкого попереднього перегляду, Mathpix для фінального вичищення.
| Метрика | Pix2Tex | Mathpix |
|---|---|---|
| BLEU на im2latex-100k | 87.3 | 93+ |
| Точність на рукописних формулах | 72% | 85% |
| Швидкість | 0.5 сек | 1–2 сек (API) |
Що таке сегментація формул і навіщо вона потрібна?
Перш ніж розпізнавати формули, потрібно їх знайти в документі. Два підходи:
- Детектор формул: YOLOv8 донавчений на датасеті документів із розміченими формулами (inline та display). mAP > 0.90 на тестовому наборі.
- PDF через PyMuPDF: вилучення блоків із формулами через аналіз PDF-структури (для digitally created PDF).
Валідація через компіляцію LaTeX
Ми використовуємо автоматичну перевірку коректності розпізнаної формули через компіляцію pdflatex:
import subprocess import tempfile import os def validate_latex(latex: str) -> bool: template = r""" \documentclass{article} \usepackage{amsmath} \begin{document} $""" + latex + r"""$ \end{document} """ with tempfile.NamedTemporaryFile(suffix='.tex', mode='w', delete=False) as f: f.write(template) tex_path = f.name try: result = subprocess.run( ['pdflatex', '-interaction=nonstopmode', tex_path], capture_output=True, timeout=10 ) return result.returncode == 0 except Exception: return False finally: os.unlink(tex_path) Процес роботи
- Аналіз: вимірюємо обсяг даних, типи формул, вимоги до точності, обмеження за latency.
- Вибір підходу: Pix2Tex, Mathpix або кастомна модель (TrOCR + LoRA).
- Інтеграція: вбудовуємо пайплайн у вашу інфраструктуру (Docker, API, брокери).
- Тестування: валідація на тестовій вибірці, A/B-тестування.
- Деплой: розгортання з моніторингом (latency p99, accuracy) та CI/CD.
Що входить у роботу
- Документація архітектури та API.
- Навчальний воркшоп для команди замовника.
- Підтримка 3 місяці: баґфікси, оновлення моделей, консультації.
Орієнтовні строки
| Завдання | Строк |
|---|---|
| Інтеграція pix2tex / Mathpix API | 1–2 тижні |
| Детекція + розпізнавання в PDF/Word | 3–5 тижнів |
| Кастомна модель для нотації | 5–8 тижнів |
Вартість розраховується індивідуально. Зв'яжіться з нами для оцінки проєкту. Ми гарантуємо точність не нижче 90% на вашому корпусі після калібрування та надаємо сертифікованих інженерів із досвідом в OCR та MLOps. Отримайте консультацію: напишіть нам, і ми розберемо ваш кейс.
Pix2Tex: Lukas Blecher, "Pix2Tex: LaTeX OCR from images", GitHub repository.







