Развертывание LLM на Yandex Cloud: от модели до продакшена
Типичная ситуация: компания разработала RAG-бота на базе отечественных LLM, но западные облака недоступны. Мы уже разворачивали Mistral 7B и LLaMA 3 на Yandex Cloud с использованием vLLM и знаем, как обойти подводные камни — от настройки CUDA до балансировки нагрузки. Наш опыт: более 5 лет работы с ML-инфраструктурой, десятки успешных проектов по внедрению AI. Получите консультацию по вашему проекту — оценим за 2 дня.
Почему Yandex Cloud для LLM?
Yandex Cloud — основной отечественный провайдер с GPU-инстанциями, Yandex ML Platform и собственными LLM (YandexGPT). Для российских компаний с требованиями к data residency и импортозамещению это оптимальный выбор. Мы получаем доступ к GPU по запросу, managed Jupyter (DataSphere) и интеграцию с Object Storage. Поддержка CUDA и Tensor Cores обеспечивает максимальную производительность. По данным официальной документации Yandex Cloud, GPU-инстанции g3 на A100 обеспечивают прирост производительности до 80% по сравнению с V100 для LLM (https://cloud.yandex.ru/docs/compute/concepts/gpus).
Как настроить GPU-инстанцию?
GPU-кластеры: g2 (Tesla V100 32GB) и g3 (A100 80GB). Для большинства open-source моделей 7B параметров хватает одной V100. Создание VM через YC CLI:
yc compute instance create \ --name llm-server \ --zone ru-central1-a \ --platform gpu-standard-v3 \ --gpus 1 \ --memory 48GB \ --cores 14 \ --core-fraction 100 \ --image-family ubuntu-2204-lts-gpu \ --image-folder-id standard-images \ --disk-type network-ssd \ --disk-size 300GB \ --network-interface subnet-name=default,nat-ip-version=ipv4 \ --ssh-key ~/.ssh/id_rsa.pub Сравнение GPU-инстанций
| Параметр | g2 (V100) | g3 (A100) |
|---|---|---|
| Память GPU | 32 GB HBM2 | 80 GB HBM2e |
| Подходит для моделей | до 13B (INT4) | до 70B (INT8) |
| Макс. токенов/сек (Mistral 7B) | 120–150 | 200–280 |
| Аренда | ~150–300 ₽/час | ~400–800 ₽/час |
Как выбрать GPU для вашей модели?
Выбор между V100 и A100 зависит от размера модели и желаемой latency. Для моделей 7B в INT4 V100 даёт приемлемую скорость — до 150 токенов/сек. Если планируете обслуживать несколько запросов параллельно или работать с 13B+ моделями, берите A100. Также учитывайте budget: A100 стоит в 2-3 раза дороже. Для экспериментов подойдёт V100, для продакшена с высокой нагрузкой — A100.
Конфигурация vLLM на YC VM
vLLM — самый производительный inference engine для LLM (в 2–3 раза быстрее Hugging Face Transformers на той же GPU). Установка и запуск:
sudo apt-get update && sudo apt-get install -y python3-pip pip install vllm # Загрузка модели из Yandex Object Storage aws s3 sync s3://my-bucket/models/mistral-7b/ /data/models/mistral-7b/ \ --endpoint-url https://storage.yandexcloud.net \ --profile yandex # Запуск сервера python -m vllm.entrypoints.openai.api_server \ --model /data/models/mistral-7b/ \ --tensor-parallel-size 1 \ --max-model-len 8192 \ --max-num-seqs 128 \ --port 8000 \ --host 0.0.0.0 Детали конфигурации vLLM
Для оптимизации используйте флаги --quantize awq для INT4 и --kv-cache-dtype auto. При нескольких GPU включите --tensor-parallel-size. Мониторинг метрик через эндпоинт /metrics.
Сравнение: vLLM vs Hugging Face на Yandex Cloud
| Параметр | vLLM | Hugging Face Transformers |
|---|---|---|
| Токенов/сек (Mistral 7B, V100) | 120–150 | 40–60 |
| Использование GPU | >90% | 60–70% |
| Поддержка continuous batching | Да | Нет |
| P50 latency | <100ms | ~300ms |
Yandex Object Storage для моделей
Храним веса моделей в S3-совместимом Object Storage: дёшево (≈ 2–3 ₽/ГБ/мес) и надёжно. Пример загрузки:
import boto3 s3 = boto3.client( "s3", endpoint_url="https://storage.yandexcloud.net", aws_access_key_id=os.getenv("YC_ACCESS_KEY"), aws_secret_access_key=os.getenv("YC_SECRET_KEY"), region_name="ru-central1" ) for file in model_files: s3.upload_file( Filename=f"/local/models/{file}", Bucket="llm-models-bucket", Key=f"mistral-7b/{file}", ExtraArgs={"StorageClass": "COLD"} ) Yandex DataSphere для прототипирования
DataSphere — managed Jupyter с GPU по запросу. Идеально для экспериментов и fine-tuning, но не для продакшн-деплоя. Мы используем его для быстрой проверки гипотез и настройки параметров quantization (INT4/INT8) перед развёртыванием.
Как масштабировать под нагрузку?
Для балансировки используем Application Load Balancer:
yc alb target-group create llm-targets \ --target subnet-name=default,ip-address=10.0.0.10 \ --target subnet-name=default,ip-address=10.0.0.11 yc alb backend-group create llm-backends \ --http-backend name=vllm-backend,port=8000,target-group-id=xxx,healthcheck-path=/health yc alb http-router create llm-router \ --virtual-host name=llm,authority=llm.company.ru \ --route name=api,path-prefix=/v1,backend-group-id=xxx Как настроить мониторинг LLM?
Встроенная интеграция: VM метрики (CPU, память, GPU utilization через DCGM exporter) автоматически в Yandex Monitoring. Custom метрики через Unified Agent:
# /etc/yandex-unified-agent/config.yml routes: - input: plugin: prometheus_puller config: url: http://localhost:8000/metrics pull_period: 15s output: plugin: yc_metrics config: folder_id: xxx iam_token_file: /etc/yandex-unified-agent/iam_token Процесс работы: 7 шагов
- Анализ требований — определяем нагрузку, latency, бюджет.
- Выбор модели и quantization — подбираем оптимальную под задачу.
- Создание GPU-инстанции — настраиваем VM через YC CLI.
- Установка vLLM — ставим и оптимизируем inference engine.
- Загрузка модели в Object Storage — переносим веса в S3-хранилище.
- Запуск и настройка API — открываем эндпоинт, интегрируем с приложением.
- Балансировка и мониторинг — добавляем ALB, настраиваем алерты.
Что входит в работу?
- Аудит вашей задачи и выбор конфигурации (модель, GPU, бюджет)
- Развёртывание vLLM / TGI на Yandex Cloud с мониторингом
- Настройка API-шлюза и автоскейлинга
- Документация по эксплуатации и обучение команды
- Техническая поддержка на этапе запуска
Гарантируем: latency p99 <200ms для моделей до 13B, uptime 99.9%. Опыт — более 5 лет в AI/ML, сертифицированные специалисты Yandex Cloud.
Свяжитесь с нами для консультации — оценим проект за 2 дня. Закажите развёртывание LLM на Yandex Cloud прямо сейчас!







