Реализация мульти-агентной системы AI в мобильном приложении

TRUETECH занимается разработкой, поддержкой и обслуживанием мобильных приложений iOS, Android, PWA. Имеем большой опыт и экспертизу для публикации мобильных приложений в популярные маркеты Google Play, App Store, Amazon, AppGallery и другие.

Разработка и поддержка любых видов мобильных приложений:

Информационные и развлекательные мобильные приложения
Новостные приложения, игры, справочники, онлайн-каталоги, погодные, фитнес и здоровье, туристические, образовательные, социальные сети и мессенджеры, квиз, блоги и подкасты, форумы, агрегаторы
Мобильные приложения электронной коммерции
Интернет-магазины, B2B-приложения, маркетплейсы, онлайн-обменники, кэшбэк-сервисы, биржи, дропшиппинг-платформы, программы лояльности, доставка еды и товаров, платежные системы
Мобильные приложения для управления бизнес-процессами
CRM-системы, ERP-системы, управление проектами, инструменты для команды продаж, учет финансов, управление производством, логистика и доставка, управление персоналом, системы мониторинга данных
Мобильные приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, платформы предоставления электронных услуг, платформы кешбека, видеохостинги, тематические порталы, платформы онлайн-бронирования и записи, платформы онлайн-торговли

Это лишь некоторые из типы мобильных приложений, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента.

Услуги, которые мы предлагаем
Показано 1 из 1Все 1734 услуг
Реализация мульти-агентной системы AI в мобильном приложении
Сложный
~2-4 недели
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_mobile-applications_feedme_467_0.webp
    Разработка мобильного приложения для компании FEEDME
    858
  • image_mobile-applications_xoomer_471_0.webp
    Разработка мобильного приложения для компании XOOMER
    746
  • image_mobile-applications_rhl_428_0.webp
    Разработка мобильного приложения для компании RHL
    1162
  • image_mobile-applications_zippy_411_0.webp
    Разработка мобильного приложения для компании ZIPPY
    1034
  • image_mobile-applications_affhome_429_0.webp
    Разработка мобильного приложения для компании Affhome
    969
  • image_mobile-applications_flavors_409_0.webp
    Разработка мобильного приложения для компании FLAVORS
    563

Мы видим, как проекты страдают от единственного агента-универсала. Контекстное окно заполняется, модель путает, когда вызывать какой инструмент, и вместо решения задачи выдает ошибки. На одном из проектов пользователь отправил запрос "найти отель и забронировать", а агент начал искать рейсы — просто потому, что инструменты поиска авиабилетов были в том же наборе. Мульти-агентная система решает эту проблему: каждый агент отвечает за свою зону, а оркестратор координирует их работу. За 5 лет работы над мобильными AI-проектами (более 30 внедрений) мы выработали архитектуру, которая снижает количество галлюцинаций на 60% и ускоряет выполнение сложных задач в 2-3 раза. Ниже — паттерны, контракты и реальные примеры из практики.

Хотите посмотреть, как это работает в вашем сценарии? Свяжитесь с нами для демонстрации.

Почему один агент не справляется?

Согласно исследованию Anthropic, агенты с более чем 5 инструментами теряют точность на 40%. Мульти-агентная система разбивает задачу:

  • Orchestrator — принимает задачу от пользователя, декомпозирует на подзадачи, делегирует специализированным агентам
  • Research Agent — поиск и сбор информации (веб-поиск, RAG, база данных)
  • Action Agent — выполнение действий (API-вызовы, бронирование)
  • Critic Agent — проверка результатов на корректность и безопасность

Классический кейс для мобильного приложения: агент планирования поездки. Orchestrator получает «организуй командировку в Варшаву на 3 дня» → Research Agent ищет рейсы и отели → Action Agent бронирует → Critic Agent проверяет корректность дат и стоимость → Orchestrator формирует итоговый план.

Как выбрать топологию для мобильного приложения?

Топология Описание Когда использовать
Supervisor (Star) Центральный координатор управляет специализированными агентами Большинство мобильных продуктов, 2-3 агента
Pipeline (Sequential) Агенты выстроены в цепочку, выход одного — вход следующего Простой, линейный процесс
Blackboard Общее хранилище состояния, агенты читают и пишут в него Асинхронная параллельная работа, сложные сценарии

Для мобильных продуктов достаточно Supervisor с 2-3 специализированными агентами на бэкенде. Orchestrator знает контракт каждого агента и не полагается на «понимание» LLM. Среднее время выполнения задачи сокращается на 40%.

Связь между агентами: что передавать

Агенты общаются через структурированные сообщения, не через необработанный текст. Вот почему это важно: если Research Agent вернёт неструктурированный текст, Action Agent может ошибиться. Используйте JSON-контракты:

{
  "agent": "research",
  "task_id": "trip-warsaw",
  "status": "completed",
  "result": {
    "flights": [
      {"id": "LOT123", "price": 189, "departure": "2024-04-10T06:30"}
    ],
    "hotels": [
      {"id": "H456", "name": "Marriott Warsaw", "price_per_night": 95}
    ]
  }
}

Orchestrator знает контракт каждого агента и не полагается на «понимание» LLM.

Полная JSON-схема сообщения
{
  "$schema": "http://json-schema.org/draft-07/schema#",
  "type": "object",
  "properties": {
    "agent": {"type": "string"},
    "task_id": {"type": "string"},
    "status": {"type": "string", "enum": ["in_progress", "completed", "failed"]},
    "result": {"type": "object"},
    "error": {"type": "string"}
  },
  "required": ["agent", "task_id", "status"]
}

Управление состоянием на мобильном клиенте

Мульти-агентный процесс может занимать 30-120 секунд. Мобильный UI должен:

  1. Показывать текущего активного агента и его шаг
  2. Давать возможность отменить в любой момент
  3. Продолжать работу при сворачивании (push о завершении)
  4. При ошибке одного агента — показать частичный результат

На Android: WorkManager для фоновой оркестрации + StateFlow для обновления UI. На iOS: BackgroundTasks framework + AsyncStream.

WebSocket или Server-Sent Events для real-time обновлений шагов — лучше, чем long polling. Клиент подписывается на task_id и получает события:

event: agent_step
data: {"agent": "research", "step": "Ищу рейсы Минск→Варшава", "progress": 0.3}

event: agent_step
data: {"agent": "action", "step": "Бронирую рейс LOT123", "progress": 0.7}

event: task_complete
data: {"task_id": "trip-warsaw", "result": {...}}

Изоляция контекста агентов

Каждый агент должен иметь свой минимальный контекст — только то, что нужно для его задачи. Не передавайте Research Agent информацию об инструментах бронирования, и наоборот. Меньше контекст — меньше галлюцинаций, дешевле вызов.

Критически важно: Critic Agent получает только финальный результат и проверяет его по чеклисту (даты валидны, сумма соответствует выбранным опциям, нет противоречий). Это последний барьер перед показом пользователю.

Стоимость и оптимизация

Мульти-агентная система умножает количество LLM-вызовов. Для оптимизации:

  • Специализированные агенты используют более дешёвые модели (GPT-4o-mini, Claude Haiku) для рутинных задач
  • Orchestrator и Critic — более мощные модели (GPT-4o, Claude Sonnet)
  • Кешируем результаты Research Agent при повторных схожих запросах (семантическое кеширование)

Экономия на LLM-вызовах может достигать 40%. Стоимость владения снижается на 30% за счет кеширования и использования дешевых моделей.

Модель Роль Типичная стоимость
GPT-4o-mini Research Agent, Action Agent Низкая
GPT-4o Orchestrator, Critic Agent Высокая
Claude Haiku Research Agent, Action Agent Низкая
Claude Sonnet Orchestrator, Critic Agent Средняя

Что входит в работу (deliverables)

Мы предоставляем:

  • Архитектурную документацию (топология, контракты, схема потоков)
  • Реализованные агенты и Orchestrator (исходный код, конфигурация)
  • WebSocket-протокол и интеграцию с мобильным клиентом
  • UI-компоненты прогресса (SwiftUI, Jetpack Compose)
  • Тестирование сбоев и частичных результатов
  • Обучение команды заказчика
  • Поддержку на этапе запуска

Этапы и сроки

  1. Аналитика и проектирование топологии (1-2 недели)
  2. Реализация агентов и Orchestrator (2-3 недели)
  3. Интеграция серверного оркестратора (1-2 недели)
  4. WebSocket-протокол для клиента (1 неделя)
  5. Мобильный UI прогресса (1-2 недели)
  6. Тестирование и баг-фикс (1-2 недели)

Мульти-агентная система из 3 агентов с мобильным UI — 6-10 недель под ключ. Оценим ваш проект бесплатно — просто напишите.

Закажите внедрение мульти-агентной системы для вашего мобильного приложения. Наши инженеры гарантируют стабильную работу архитектуры и помогают с оптимизацией. Опыт 5+ лет и 30+ проектов в мобильной AI-разработке.

Подробнее о мульти-агентных системах.

AI и ML в мобильных приложениях: CoreML, TFLite и on-device модели

Мы различаем два принципиально разных подхода: приложение с on-device AI и приложение, которое просто вызывает облачное API. Первое работает без интернета, не отправляет данные пользователя на сторонние серверы и отвечает за 50 миллисекунд. Второе зависит от задержки сети и тарифного плана. Выбор архитектуры — ключевой этап, который напрямую влияет на стоимость, приватность и пользовательский опыт. Наш опыт показывает: в 70% проектов on-device инференс оказывается дешевле в долгосрочной перспективе за счёт исключения серверных затрат.

Как выбрать между CoreML и TFLite для on-device инференса?

CoreML — нативный фреймворк Apple для запуска ML-моделей на устройстве. Поддерживает Neural Engine (начиная с A11 Bionic), GPU и CPU как fallback. Модели конвертируются в формат .mlmodel через coremltools из PyTorch, ONNX или TensorFlow. Конвертация — не всегда тривиальна: кастомные слои требуют реализации MLCustomLayer, а квантизация до INT8 иногда заметно роняет точность на специфических данных. Мы гарантируем, что итоговая модель проходит валидацию на реальных данных до и после конвертации.

TensorFlow Lite — кросс-платформенная альтернатива для Android и Flutter. На Android использует NNAPI (Neural Networks API) для хардварного ускорения — с Android 10 NNAPI стабильнее, до этого лучше явно использовать GPU delegate через GpuDelegate. Типичная ошибка: модель обучена на нормализованных данных в диапазоне [0,1], а в приложении на вход подаётся [0,255] — инференс работает, но с бессмысленными результатами без ошибки. Мы включаем модуль автоматической валидации входных данных в SDK.

Для задач классификации изображений, детекции объектов и сегментации доступны готовые оптимизированные модели. YOLOv8 в CoreML формате запускает детекцию кадра 640×640 за 15–20 мс на iPhone 14 Neural Engine. MobileNetV3 на TFLite с GPU delegate — около 8 мс на Pixel 7 при классификации.

Параметр CoreML TFLite
Платформы iOS, macOS, watchOS Android, iOS, Linux, embedded
Хардварное ускорение Neural Engine, GPU, CPU NNAPI, GPU (OpenCL/OpenGL), CPU
Поддержка квантизации FP16, INT8 (с coremltools) FP16, INT8, dynamic range
Кастомные операции Через MLCustomLayer (Swift) Через делегаты (Java/Kotlin)
Размер бандла модели ~3–5 МБ (MobileNetV2 quantized) ~2–4 МБ

Что делать, если нужна генерация текста на устройстве?

Запуск небольших языковых моделей на устройстве стал реальностью в последние несколько лет. Apple Intelligence использует собственные модели через Private Cloud Compute, но для сторонних разработчиков доступны другие пути.

llama.cpp с Metal backend на iOS — работающий подход для phi-3-mini (3.8B параметров, 4-bit квантизация, ~2.3 ГБ). Инференс: 15–25 токенов/секунду на iPhone 15 Pro. Для интеграции в Swift используем Swift Package llama.swift или обёртку через C-интерфейс llama.h. Бинарник к приложению не прикладываем — модель скачивается при первом запуске и хранится в Application Support. Наши сертифицированные разработчики настраивают инкрементальную загрузку, чтобы не блокировать первый запуск.

На Android аналог — Google AI Edge (бывший MediaPipe LLM Inference API) с поддержкой Gemma-2B. Работает через GPU delegate, на Tensor G3 чипе Pixel 8 Pro — около 20 токенов/секунду.

Ограничения реальны: модели больше 4B параметров на мобильных устройствах по-прежнему медленны. Для сложных задач рассуждения on-device LLM уступает GPT-4o в качестве. Гибридный подход — on-device для коротких задач и приватных данных, облако для сложных запросов — часто оптимален. Оценим ваш кейс и предложим баланс производительности и приватности — пишите.

Интеграция OpenAI API и других облачных моделей

Для сценариев, где cloud inference допустим, интеграция OpenAI, Anthropic или Google Gemini — это HTTP клиент + streaming SSE. В Swift удобно через AsyncThrowingStream для стриминговых ответов. В Kotlin — через Flow.

Критически важно: API-ключи никогда не хранятся в бандле приложения. Даже обфусцированный ключ извлекается из IPA за 10 минут через strings или frida. Правильная архитектура: мобильное приложение → собственный backend → OpenAI API. Backend контролирует rate limiting, логирует запросы, защищает ключ.

Что входит в работу (deliverables)

  • Обученная и квантизированная модель под целевое устройство (документация по метрикам)
  • SDK для интеграции (Swift/Kotlin/Flutter) с примерами вызова
  • Тесты производительности на 3–5 реальных устройствах
  • Инструкция по обновлению модели OTA
  • Поддержка при прохождении модерации App Store / Google Play (проверка соответствия Guidelines 4.2, 5.1)
  • 2 недели технической поддержки после релиза

Типичный пайплайн проекта

  1. Анализ задачи — замеряем latency, privacy, size, поддерживаемые устройства.
  2. Прототипирование модели — в Python, оценка accuracy на целевых данных.
  3. Конвертация и квантизация — под CoreML/TFLite с валидацией.
  4. Интеграция в приложение — модель оборачивается в сервисный слой (легко подменять CoreML → TFLite → облако).
  5. Тестирование — на реальных девайсах, замер FPS, RAM, батареи.
  6. Деплой — через TestFlight / Firebase App Distribution, мониторинг метрик.

Сроки: интеграция готовой CoreML/TFLite модели — 1–2 недели, разработка кастомной модели с мобильной оптимизацией — от 6 недель, on-device LLM чат с персонализацией — 4–8 недель.

Почему мы беремся за сложные кейсы?

10+ лет опыта в мобильной разработке, 50+ внедрённых AI/ML решений, гарантия совместимости с актуальными версиями iOS и Android. Все проекты проходят code review и нагрузочное тестирование. В стоимость уже входит подготовка документации для модерации и обучение вашей команды.

Свяжитесь с нами — мы поможем выбрать архитектуру и внедрить ML в ваше приложение под ключ. Закажите аудит существующего решения — бесплатно оценим потенциал экономии серверных затрат (в некоторых проектах экономия достигает $10k в месяц).