Развёртывание LLM на Azure: OpenAI или Machine Learning Endpoints

Вы разработали RAG-приложение на основе LLaMA-3-8B — теперь нужно выдать его сотням пользователей. Локальная RTX 4090 справляется с отладкой, но production требует масштабируемого endpoint с latency p99 <500 мс и автоскейлингом. Azure Machine Learning Managed Online Endpoints дают такую возможность

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Вы разработали RAG-приложение на основе LLaMA-3-8B — теперь нужно выдать его сотням пользователей. Локальная RTX 4090 справляется с отладкой, но production требует масштабируемого endpoint с latency p99 <500 мс и автоскейлингом. Azure Machine Learning Managed Online Endpoints дают такую возможность — но правильная настройка включает VNet интеграцию, мониторинг и асинхронный деплой. Мы развернули LLM для 20+ компаний, включая крупный финтех с жёсткими требованиями к приватности данных. Типичный проект: выбор между Azure OpenAI и Azure ML, настройка vLLM с PagedAttention, конфигурация RBAC и Private Endpoints. Экономия на инфраструктуре при нерегулярной нагрузке достигает 50% по сравнению с PAYG-схемой.

Azure ML endpoint documentation

Проблемы которые решаем

Холодный старт и автоскейлинг. Без настройки scale_settings эндпоинт не масштабируется под внезапные пики. Мы задаём TargetUtilization, polling interval и cooldown так, чтобы переход от 1 до 8 инстансов занимал <2 минут без потери запросов.

Управление памятью GPU. Ошибки OOM — частая проблема при деплое LLaMA-3-70B. Используем vLLM с PagedAttention и gpu_memory_utilization=0.90, а также Tensor Parallelism на нескольких GPU.

Мониторинг и алертинг. Без сбора метрик (RequestsPerMinute, Latency P50/P99, GPU Utilization) вы узнаёте о проблеме только от пользователей. Мы настраиваем Azure Monitor + Application Insights с порогами оповещений.

Как снизить latency p99?

Для latency p99 <200 мс используем vLLM с оптимизациями: max_num_batched_tokens=8192, --tensor-parallel-size 4 на A100. Это даёт throughput 1500 токенов/сек для LLaMA-3-8B. В Azure OpenAI с PTU latency p99 держится на уровне 150 мс при фиксированном TPM.

Почему автоскейлинг важен?

Без автоскейлинга вы переплачиваете за idle ресурсы или теряете пользователей при пике. Настраиваем scale_settings: min_instances=1, max_instances=10 с target_utilization_percentage=70. Цена таких настроек — нулевая, экономия при нерегулярной нагрузке — до 50%.

Что входит в работу

  • Аудит требований: нагрузка, latency SLA, комплаенс.
  • Проектирование архитектуры: выбор сервиса, региона, типа GPU (A100, V100), сетевой изоляции.
  • Реализация: написание scoring script (vLLM или custom), настройка конфигураций деплоя, скриптов CI/CD.
  • Нагрузочное тестирование: измерение latency, throughput, выявление узких мест.
  • Документация: описание архитектуры, инструкции по эксплуатации.
  • Обучение команды: воркшоп по мониторингу и масштабированию.
  • Поддержка: месяц после деплоя.

Как выбрать: Azure OpenAI vs Azure ML Endpoints?

Критерий Azure OpenAI Service Azure ML Managed Endpoints
Доступные модели GPT-4, GPT-4o, GPT-3.5-turbo, Embeddings Любые open-source модели (LLaMA, Mistral, Qwen)
Управление Полностью managed — только API ключ Самописный scoring script, конфигурация среды
Производительность PTU для фиксированного TPM без throttling vLLM + автоскейлинг; latency p99 <300 мс
Безопасность Azure RBAC, Private Endpoints VNet Integration, Managed Identity, Key Vault
Стоимость PAYG или PTU — дороже при больших объёмах Оплата только GPU VM + хранение — дешевле при batch

Для продакшена с GPT-4 выбираем Azure OpenAI (SLA, PTU). Для кастомизации и open-source — Azure ML с vLLM.

Примерные конфигурации GPU для популярных моделей

Модель GPU Параметры vLLM Ожидаемый latency p99
LLaMA-3-8B 1x A100 (80GB) tensor-parallel-size=1, gpu-memory-utilization=0.90 <200 мс
LLaMA-3-70B 4x A100 (80GB) tensor-parallel-size=4, gpu-memory-utilization=0.85 <500 мс
Mistral-7B 1x A100 (80GB) tensor-parallel-size=1, gpu-memory-utilization=0.90 <150 мс

Процесс работы

  1. Анализ требований — нагрузка, latency SLA, бюджет, требования к приватности.
  2. Проектирование инфраструктуры — выбор региона, типа GPU (A100, V100), сетевой изоляции.
  3. Реализация — написание scoring script (vLLM или custom), настройка конфигураций деплоя.
  4. Нагрузочное тестирование — измерение latency, throughput, выявление узких мест.
  5. Деплой и мониторинг — развёртывание эндпоинта, настройка дашбордов и алертов.

Сроки: от 2 до 4 недель в зависимости от сложности. Стоимость рассчитывается индивидуально.

Пример конфигурации vLLM для LLaMA-3-8B

model: meta-llama/Meta-Llama-3-8B-Instruct tensor-parallel-size: 4 gpu-memory-utilization: 0.90 max-num-batched-tokens: 8192 

Результаты и гарантии

  • latency p99 <300 мс при batch size 1 для LLaMA-3-8B на A100.
  • Автоскейлинг от 1 до 8 инстансов с кастомными правилами.
  • Экономия до 35% по сравнению с Azure OpenAI PTU для high-load сценариев.
  • Гарантия 99.9% доступности эндпоинта при правильной конфигурации.

Мы гарантируем передачу всех конфигураций, документации и обучение вашей команды. Поддержка — месяц после деплоя.

Как заказать развёртывание?

Получите консультацию: наши инженеры проанализируют вашу задачу и предложат архитектуру за один день. Свяжитесь с нами — развернём LLM на Azure с нуля до production за 2–4 недели. Мы имеем сертификацию Azure Solutions Architect и 5+ лет опыта в MLOps.