Классические RPA-инструменты — UiPath, Automation Anywhere, Blue Prism — отлично справляются со структурированными данными и детерминированными сценариями. Проблема возникает, когда в процессе появляется неструктурированный текст: письма, PDF-сканы, свободные формы, чаты. Здесь RPA без AI либо требует жёстких шаблонов, либо ломается при малейшем отклонении. Интеграция LLM в RPA-пайплайн закрывает этот разрыв, и мы предлагаем решение под ключ.
Типичный сценарий: входящие счета от 50 разных поставщиков — каждый со своей структурой. Ручная обработка занимает 3–5 минут на документ. После внедрения LLM-модуля время сокращается до 15–30 секунд, точность извлечения ключевых полей — 92–96%. Сравнение с традиционными методами: LLM-подход в 4 раза эффективнее шаблонных парсеров и не требует переобучения при смене формата. Закажите пилотный проект — мы за одну неделю оценим применимость LLM на ваших документах.
Как архитектура RPA-LLM выглядит в production?
Не каждый шаг процесса требует языковой модели. Разумная архитектура разделяет задачи: RPA-движок управляет навигацией, кликами, передачей данных между системами. LLM подключается точечно — там, где нужно понять текст, извлечь сущности или принять решение по нечёткому условию.
Типичные точки интеграции:
- Извлечение данных из входящих писем — определение типа запроса, извлечение реквизитов, маршрутизация
- Обработка PDF-документов — накладные, акты, договоры с вариативной структурой
- Классификация обращений — поддержка, рекламации, запросы на информацию
- Заполнение форм — на основе свободного описания от пользователя или документа
Стандартная схема включает три слоя:
Слой RPA — оркестратор процесса. В зависимости от платформы это может быть UiPath Orchestrator, Robocorp, n8n или самописный планировщик на Python. Отвечает за триггеры, очереди задач, логирование результатов.
Слой AI-обработки — микросервис или лямбда, принимающий неструктурированный контент и возвращающий структурированный JSON. Внутри: предобработка текста (pytesseract/pdfminer для извлечения, langchain/llama-index для оркестрации запросов к LLM). Модель — GPT-4o, Claude 3.5 Sonnet или локальный Mistral/LLaMA через Ollama, в зависимости от требований к конфиденциальности.
Слой валидации — проверка уверенности модели, fallback на человека при низком confidence score. Реализуется через structured output (JSON Schema в промпте или OpenAI function calling) + правила постобработки.
Что входит в работу
- Документация архитектуры и API-спецификаций
- Доступы к LLM-микросервису через REST API
- Обучение команды RPA-разработчиков
- Поддержка в течение месяца после запуска
Почему confidence routing критичен для production?
Модель не всегда уверена. Стратегия confidence routing:
- confidence > 0.9 — автоматическая обработка, логирование
- 0.7–0.9 — обработка + флаг для выборочной проверки
- < 0.7 — отправка в очередь ручной проверки + уведомление
Confidence можно получить несколькими способами: логпробабилити токенов (доступны через API OpenAI), отдельный verification-промпт, или ensemble из двух моделей с голосованием. Наша архитектура confidence routing снижает human escalation на 80% по сравнению с пороговыми правилами.
Какие LLM лучше подходят для RPA?
Выбор модели зависит от требований к латенси, точности и конфиденциальности. Типичная стоимость LLM-вызова — от $0.001 до $0.01 на документ при использовании gpt-4o-mini, что составляет менее 5% от экономии на ручной обработке. Сравнение популярных моделей:
| Модель | Латенси (p50) | Точность извлечения | Цена за 1K токенов |
|---|---|---|---|
| GPT-4o | 1.2 сек | 96% | $0.01 |
| Claude 3.5 | 1.5 сек | 94% | $0.008 |
| Mistral Large | 0.8 сек | 92% | $0.004 |
| LLaMA 3 70B (локально) | 2.0 сек | 91% | местные ресурсы |
Технические детали интеграции
Ключевой момент — промпты должны возвращать строго типизированный JSON, а не свободный текст. Используйте Pydantic-схемы для валидации выхода:
from pydantic import BaseModel from openai import OpenAI class InvoiceData(BaseModel): vendor_name: str invoice_number: str total_amount: float currency: str due_date: str | None client = OpenAI() response = client.beta.chat.completions.parse( model="gpt-4o-mini", messages=[{"role": "user", "content": f"Extract invoice data:\n{text}"}], response_format=InvoiceData, ) Structured outputs от OpenAI или аналогичный режим в Claude (tool_use) гарантируют валидный JSON без постобработки regex.
| Тип документа | Инструмент извлечения | Стратегия LLM |
|---|---|---|
| PDF (текстовый) | pdfminer.six, pypdf | Прямой промптинг с Few-shot |
| PDF (скан) | pytesseract + OpenCV | OCR → LLM extraction |
| Email (.eml, .msg) | email (Python stdlib) | Structured extraction prompt |
| Веб-форма | Selenium/Playwright скрапинг | Классификация + нормализация |
| Word/Excel | python-docx, openpyxl | Таблица → JSON → LLM |
Метрики и мониторинг
После запуска в prod отслеживайте:
- Extraction accuracy — процент полей, извлечённых корректно (эталонная выборка)
- Human escalation rate — цель: снизить с 30–40% (ручная обработка) до 5–10%
- Processing latency — p95 по времени LLM-вызова, цель < 3 с для синхронных процессов
- Token cost per document — для бюджетирования, обычно $0.001–0.01 на документ с gpt-4o-mini
Типичные результаты после внедрения: время обработки одного документа снижается с 3–5 минут (ручная) до 15–30 секунд, accuracy на структурированных полях достигает 92–96%. Наш опыт — более 10 лет в AI/ML, выполнено 50+ проектов по интеграции RPA и LLM. Оценим ваш проект за один день — свяжитесь для консультации. Получите консультацию по архитектуре и выбору модели.
Сроки реализации
- Прототип (1 тип документа, 1 процесс): 2–3 недели
- MVP (3–5 типов документов, интеграция с CRM/ERP): 6–8 недель
- Масштабируемое решение (очередь, мониторинг, fallback): 10–14 недель







