Ви розробили RAG-застосунок на основі LLaMA-3-8B — тепер потрібно видати його сотням користувачів. Локальна RTX 4090 справляється з налагодженням, але production вимагає масштабованого endpoint з latency p99 <500 мс і автоскейлінгом. Azure Machine Learning Managed Online Endpoints дають таку можливість — але правильне налаштування включає VNet інтеграцію, моніторинг та асинхронний деплой. Ми розгорнули LLM для 20+ компаній, включаючи великий фінтех із жорсткими вимогами до приватності даних. Типовий проєкт: вибір між Azure OpenAI і Azure ML, налаштування vLLM з PagedAttention, конфігурація RBAC і Private Endpoints. Економія на інфраструктурі при нерегулярному навантаженні сягає 50% порівняно з PAYG-схемою.
Azure ML endpoint documentation
Проблеми, які ми вирішуємо
Холодний старт і автоскейлінг. Без налаштування scale_settings ендпоінт не масштабується під раптові піки. Ми задаємо TargetUtilization, polling interval і cooldown так, щоб перехід від 1 до 8 інстансів займав <2 хвилин без втрати запитів.
Керування пам'яттю GPU. Помилки OOM — часта проблема при деплої LLaMA-3-70B. Використовуємо vLLM з PagedAttention і gpu_memory_utilization=0.90, а також Tensor Parallelism на кількох GPU.
Моніторинг і алертинг. Без збору метрик (RequestsPerMinute, Latency P50/P99, GPU Utilization) ви дізнаєтеся про проблему тільки від користувачів. Ми налаштовуємо Azure Monitor + Application Insights з порогами сповіщень.
Як знизити latency p99?
Для latency p99 <200 мс використовуємо vLLM з оптимізаціями: max_num_batched_tokens=8192, --tensor-parallel-size 4 на A100. Це дає throughput 1500 токенів/сек для LLaMA-3-8B. В Azure OpenAI з PTU latency p99 тримається на рівні 150 мс при фіксованому TPM.
Чому автоскейлінг важливий?
Без автоскейлінгу ви переплачуєте за idle ресурси або втрачаєте користувачів при піці. Налаштовуємо scale_settings: min_instances=1, max_instances=10 з target_utilization_percentage=70. Ціна таких налаштувань — нульова, економія при нерегулярному навантаженні — до 50%.
Що входить до роботи
- Аудит вимог: навантаження, latency SLA, комплаєнс.
- Проєктування архітектури: вибір сервісу, регіону, типу GPU (A100, V100), мережевої ізоляції.
- Реалізація: написання scoring script (vLLM або custom), налаштування конфігурацій деплою, скриптів CI/CD.
- Навантажувальне тестування: вимірювання latency, throughput, виявлення вузьких місць.
- Документація: опис архітектури, інструкції з експлуатації.
- Навчання команди: воркшоп з моніторингу та масштабування.
- Підтримка: місяць після деплою.
Як обрати: Azure OpenAI vs Azure ML Endpoints?
| Критерій | Azure OpenAI Service | Azure ML Managed Endpoints |
|---|---|---|
| Доступні моделі | GPT-4, GPT-4o, GPT-3.5-turbo, Embeddings | Будь-які open-source моделі (LLaMA, Mistral, Qwen) |
| Управління | Повністю managed — тільки API ключ | Власний scoring script, конфігурація середовища |
| Продуктивність | PTU для фіксованого TPM без throttling | vLLM + автоскейлінг; latency p99 <300 мс |
| Безпека | Azure RBAC, Private Endpoints | VNet Integration, Managed Identity, Key Vault |
| Вартість | PAYG або PTU — дорожче при великих обсягах | Оплата тільки GPU VM + зберігання — дешевше при batch |
Для продакшену з GPT-4 обираємо Azure OpenAI (SLA, PTU). Для кастомізації та open-source — Azure ML з vLLM.
Приблизні конфігурації GPU для популярних моделей
| Модель | GPU | Параметри vLLM | Очікуваний latency p99 |
|---|---|---|---|
| LLaMA-3-8B | 1x A100 (80GB) | tensor-parallel-size=1, gpu-memory-utilization=0.90 | <200 мс |
| LLaMA-3-70B | 4x A100 (80GB) | tensor-parallel-size=4, gpu-memory-utilization=0.85 | <500 мс |
| Mistral-7B | 1x A100 (80GB) | tensor-parallel-size=1, gpu-memory-utilization=0.90 | <150 мс |
Процес роботи
- Аналіз вимог — навантаження, latency SLA, бюджет, вимоги до приватності.
- Проєктування інфраструктури — вибір регіону, типу GPU (A100, V100), мережевої ізоляції.
- Реалізація — написання scoring script (vLLM або custom), налаштування конфігурацій деплою.
- Навантажувальне тестування — вимірювання latency, throughput, виявлення вузьких місць.
- Деплой і моніторинг — розгортання ендпоінта, налаштування дашбордів та алертів.
Терміни: від 2 до 4 тижнів залежно від складності. Вартість розраховується індивідуально.
Приклад конфігурації vLLM для LLaMA-3-8B
model: meta-llama/Meta-Llama-3-8B-Instruct tensor-parallel-size: 4 gpu-memory-utilization: 0.90 max-num-batched-tokens: 8192 Результати та гарантії
- latency p99 <300 мс при batch size 1 для LLaMA-3-8B на A100.
- Автоскейлінг від 1 до 8 інстансів з кастомними правилами.
- Економія до 35% порівняно з Azure OpenAI PTU для high-load сценаріїв.
- Гарантія 99.9% доступності ендпоінта при правильній конфігурації.
Ми гарантуємо передачу всіх конфігурацій, документації та навчання вашої команди. Підтримка — місяць після деплою.
Як замовити розгортання?
Отримайте консультацію: наші інженери проаналізують ваше завдання та запропонують архітектуру за один день. Зв'яжіться з нами — розгорнемо LLM на Azure з нуля до production за 2–4 тижні. Ми маємо сертифікацію Azure Solutions Architect і 5+ років досвіду в MLOps.







