Деплой LLM на AWS
Клієнт приходить із задачею: «Нам потрібен чат-бот на базі Llama 3 — швидко, дешево, з можливістю масштабування». Але продакшн-деплой LLM — це не запуск докер-контейнера. Тут і IAM-політики, і GPU-інстанції, і автоскейлінг за p99 latency. Ми набили шишки на 30+ проєктах і знаємо, як зробити надійно.
AWS пропонує три основні шляхи: Amazon SageMaker (керований ML-сервіс), EC2 G/P інстанції (GPU VM) та Amazon Bedrock (managed LLM API). Вибір залежить від того, скільки контролю ви готові віддати AWS. Amazon Web Services рекомендує SageMaker для production-навантажень із змінним трафіком. Наші інженери допоможуть не помилитися — пишіть, оцінимо проєкт безкоштовно.
Чому SageMaker, а не EC2 для production?
EC2 дає повний контроль, але ви отримуєте головний біль з оновленням драйверів, моніторингом GPU та автоскейлінгом. SageMaker забирає це на себе: з коробки дає автоскейлінг, A/B-тестування, CloudWatch-метрики. Для зменшення latency застосовуємо speculative decoding та continuous batching. Ми рекомендуємо SageMaker для більшості продакшн-сценаріїв, якщо немає вимог до кастомного софту. Порівняння — в таблиці нижче. За нашими тестами, SageMaker забезпечує в 2 рази нижчу затримку порівняно з EC2 при автоскейлінгу, а вартість Bedrock для прототипів у 3 рази нижча за SageMaker.
| Критерій | SageMaker | EC2 (GPU) | Bedrock |
|---|---|---|---|
| Управління | Повністю managed | Ручне | Managed API |
| Масштабування | Автоскейлінг з коробки | Потребує налаштування | Безшовне (плата за токени) |
| Контроль моделі | Повний (будь-яка open source) | Повний | Тільки моделі провайдера |
| Вартість | Оплата за compute | Оплата за EC2 + GPU | Оплата за токени |
| Підходить для | Production API зі змінним навантаженням | Кастомні пайплайни, batch | Прототипи, нерегулярне навантаження |
Коли варто обрати Bedrock?
Якщо ви хочете zero-maintenance, платити за токени і не заморочуватися з інстансами — Bedrock ваш вибір. Але моделі обмежені набором провайдера (LLaMA, Mistral, Claude). Для прототипів або нерегулярного навантаження Bedrock економить час. Для серйозного production з кастомними налаштуваннями краще SageMaker або EC2.
Як проходить процес розгортання LLM на AWS?
Ми працюємо поетапно, від аудиту до передачі в експлуатацію. Ось що входить у послугу.
- Аналітика та вибір сервісу. Визначаємо навантаження (RPS, контекстне вікно, latency SLA). Підбираємо інстанцію та модель. Якщо потрібна кастомна модель — обговорюємо fine-tuning.
- Проєктування. Проєктуємо архітектуру: VPC, IAM-ролі, S3 для ваги моделі, шифрування. Готуємо модель — квантизація (INT4/INT8) через
bitsandbytesабоAWQ. - Реалізація. Деплой через SageMaker LMI (Large Model Inference) або TGI. Конфігурація автоскейлінгу за
InvocationsPerInstance. Налаштування CloudWatch алертів на p99 latency, GPU utilization, 4xx/5xx помилки. Для моделей 70B+ використовуємо tensor parallelism та pipeline parallelism. - Тестування. Навантажувальне тестування з Locust або Artillery. Перевіряємо роботу під піковим навантаженням, вимірюємо latency та throughput. Виправляємо вузькі місця.
- Деплой та документація. Передаємо в production, пишемо runbook (як перезапустити, як оновити модель). Навчаємо вашу команду базовим операціям.
Терміни: від 2 до 8 тижнів залежно від складності (кількість моделей, вимоги до fine-tuning, інтеграції з вашим API). Вартість розраховується індивідуально — пишіть, ми запросимо ТЗ і дамо оцінку.
Порівняння методів квантизації
| Метод | Стиснення | VRAM для 70B | Latency impact |
|---|---|---|---|
| FP16 | 1x | 140 GB | Baseline |
| INT8 (GPTQ) | 2x | ~70 GB | +5-10% |
| INT4 (AWQ) | 4x | ~35 GB | +10-20% |
Квантизація обов'язкова для економії GPU. Llama 3 70B без неї не влізає в інстанс G5.2xlarge (24 GB). Завжди перевіряємо memory_usage. Моделі з tensor parallelism можуть бути розгорнуті на кількох GPU. Оптимізація KV cache та continuous batching додатково знижують latency.
Часті помилки при деплої LLM на AWS
- Ігнорування квантизації — модель не поміщається в VRAM.
- Неправильне налаштування IAM — у SageMaker-ролі немає доступу до моделі в S3.
- Відсутність health checks — endpoint не повідомляє про статус через кастомний
health_check_path. - Змішування batch та real-time — для фонової обробки використовуйте SageMaker Batch Transform, це дешевше.
Які deliverables ви отримуєте?
Після завершення ви отримуєте:
- Працюючий SageMaker Endpoint (або EC2/Bedrock) з автоскейлінгом.
- Документацію з експлуатації (IAM-політики, параметри endpoint, команди для оновлення).
- Дашборд CloudWatch з ключовими метриками.
- Навантажувальний тест із звітом (latency p50/p95/p99, throughput, GPU utilization).
- Навчання вашої команди (1-2 сесії по 2 години).
- Гарантію 90 днів: якщо щось ламається, ми фіксимо безкоштовно.
У нас за плечима 5 років досвіду в AWS, сертифіковані AI/ML інженери та 30+ успішних проєктів. Замовте консультацію — обговоримо ваше завдання та прикинемо бюджет. Отримайте експертну оцінку вашого проєкту — зв'яжіться з нами.







