Розгортання LLM на Azure: OpenAI чи ML Endpoints

Ви розробили RAG-застосунок на основі LLaMA-3-8B — тепер потрібно видати його сотням користувачів. Локальна RTX 4090 справляється з налагодженням, але production вимагає масштабованого endpoint з latency p99 <500 мс і автоскейлінгом. Azure Machine Learning Managed Online Endpoints дають таку можливі

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Ви розробили RAG-застосунок на основі LLaMA-3-8B — тепер потрібно видати його сотням користувачів. Локальна RTX 4090 справляється з налагодженням, але production вимагає масштабованого endpoint з latency p99 <500 мс і автоскейлінгом. Azure Machine Learning Managed Online Endpoints дають таку можливість — але правильне налаштування включає VNet інтеграцію, моніторинг та асинхронний деплой. Ми розгорнули LLM для 20+ компаній, включаючи великий фінтех із жорсткими вимогами до приватності даних. Типовий проєкт: вибір між Azure OpenAI і Azure ML, налаштування vLLM з PagedAttention, конфігурація RBAC і Private Endpoints. Економія на інфраструктурі при нерегулярному навантаженні сягає 50% порівняно з PAYG-схемою.

Azure ML endpoint documentation

Проблеми, які ми вирішуємо

Холодний старт і автоскейлінг. Без налаштування scale_settings ендпоінт не масштабується під раптові піки. Ми задаємо TargetUtilization, polling interval і cooldown так, щоб перехід від 1 до 8 інстансів займав <2 хвилин без втрати запитів.

Керування пам'яттю GPU. Помилки OOM — часта проблема при деплої LLaMA-3-70B. Використовуємо vLLM з PagedAttention і gpu_memory_utilization=0.90, а також Tensor Parallelism на кількох GPU.

Моніторинг і алертинг. Без збору метрик (RequestsPerMinute, Latency P50/P99, GPU Utilization) ви дізнаєтеся про проблему тільки від користувачів. Ми налаштовуємо Azure Monitor + Application Insights з порогами сповіщень.

Як знизити latency p99?

Для latency p99 <200 мс використовуємо vLLM з оптимізаціями: max_num_batched_tokens=8192, --tensor-parallel-size 4 на A100. Це дає throughput 1500 токенів/сек для LLaMA-3-8B. В Azure OpenAI з PTU latency p99 тримається на рівні 150 мс при фіксованому TPM.

Чому автоскейлінг важливий?

Без автоскейлінгу ви переплачуєте за idle ресурси або втрачаєте користувачів при піці. Налаштовуємо scale_settings: min_instances=1, max_instances=10 з target_utilization_percentage=70. Ціна таких налаштувань — нульова, економія при нерегулярному навантаженні — до 50%.

Що входить до роботи

  • Аудит вимог: навантаження, latency SLA, комплаєнс.
  • Проєктування архітектури: вибір сервісу, регіону, типу GPU (A100, V100), мережевої ізоляції.
  • Реалізація: написання scoring script (vLLM або custom), налаштування конфігурацій деплою, скриптів CI/CD.
  • Навантажувальне тестування: вимірювання latency, throughput, виявлення вузьких місць.
  • Документація: опис архітектури, інструкції з експлуатації.
  • Навчання команди: воркшоп з моніторингу та масштабування.
  • Підтримка: місяць після деплою.

Як обрати: Azure OpenAI vs Azure ML Endpoints?

Критерій Azure OpenAI Service Azure ML Managed Endpoints
Доступні моделі GPT-4, GPT-4o, GPT-3.5-turbo, Embeddings Будь-які open-source моделі (LLaMA, Mistral, Qwen)
Управління Повністю managed — тільки API ключ Власний scoring script, конфігурація середовища
Продуктивність PTU для фіксованого TPM без throttling vLLM + автоскейлінг; latency p99 <300 мс
Безпека Azure RBAC, Private Endpoints VNet Integration, Managed Identity, Key Vault
Вартість PAYG або PTU — дорожче при великих обсягах Оплата тільки GPU VM + зберігання — дешевше при batch

Для продакшену з GPT-4 обираємо Azure OpenAI (SLA, PTU). Для кастомізації та open-source — Azure ML з vLLM.

Приблизні конфігурації GPU для популярних моделей

Модель GPU Параметри vLLM Очікуваний latency p99
LLaMA-3-8B 1x A100 (80GB) tensor-parallel-size=1, gpu-memory-utilization=0.90 <200 мс
LLaMA-3-70B 4x A100 (80GB) tensor-parallel-size=4, gpu-memory-utilization=0.85 <500 мс
Mistral-7B 1x A100 (80GB) tensor-parallel-size=1, gpu-memory-utilization=0.90 <150 мс

Процес роботи

  1. Аналіз вимог — навантаження, latency SLA, бюджет, вимоги до приватності.
  2. Проєктування інфраструктури — вибір регіону, типу GPU (A100, V100), мережевої ізоляції.
  3. Реалізація — написання scoring script (vLLM або custom), налаштування конфігурацій деплою.
  4. Навантажувальне тестування — вимірювання latency, throughput, виявлення вузьких місць.
  5. Деплой і моніторинг — розгортання ендпоінта, налаштування дашбордів та алертів.

Терміни: від 2 до 4 тижнів залежно від складності. Вартість розраховується індивідуально.

Приклад конфігурації vLLM для LLaMA-3-8B

model: meta-llama/Meta-Llama-3-8B-Instruct tensor-parallel-size: 4 gpu-memory-utilization: 0.90 max-num-batched-tokens: 8192 

Результати та гарантії

  • latency p99 <300 мс при batch size 1 для LLaMA-3-8B на A100.
  • Автоскейлінг від 1 до 8 інстансів з кастомними правилами.
  • Економія до 35% порівняно з Azure OpenAI PTU для high-load сценаріїв.
  • Гарантія 99.9% доступності ендпоінта при правильній конфігурації.

Ми гарантуємо передачу всіх конфігурацій, документації та навчання вашої команди. Підтримка — місяць після деплою.

Як замовити розгортання?

Отримайте консультацію: наші інженери проаналізують ваше завдання та запропонують архітектуру за один день. Зв'яжіться з нами — розгорнемо LLM на Azure з нуля до production за 2–4 тижні. Ми маємо сертифікацію Azure Solutions Architect і 5+ років досвіду в MLOps.