Развёртывание LLM на Yandex Cloud с GPU и vLLM

Развертывание LLM на Yandex Cloud: от модели до продакшена

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1284
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    980
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1240
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    696
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    982

Развертывание LLM на Yandex Cloud: от модели до продакшена

Типичная ситуация: компания разработала RAG-бота на базе отечественных LLM, но западные облака недоступны. Мы уже разворачивали Mistral 7B и LLaMA 3 на Yandex Cloud с использованием vLLM и знаем, как обойти подводные камни — от настройки CUDA до балансировки нагрузки. Наш опыт: более 5 лет работы с ML-инфраструктурой, десятки успешных проектов по внедрению AI. Получите консультацию по вашему проекту — оценим за 2 дня.

Почему Yandex Cloud для LLM?

Yandex Cloud — основной отечественный провайдер с GPU-инстанциями, Yandex ML Platform и собственными LLM (YandexGPT). Для российских компаний с требованиями к data residency и импортозамещению это оптимальный выбор. Мы получаем доступ к GPU по запросу, managed Jupyter (DataSphere) и интеграцию с Object Storage. Поддержка CUDA и Tensor Cores обеспечивает максимальную производительность. По данным официальной документации Yandex Cloud, GPU-инстанции g3 на A100 обеспечивают прирост производительности до 80% по сравнению с V100 для LLM (https://cloud.yandex.ru/docs/compute/concepts/gpus).

Как настроить GPU-инстанцию?

GPU-кластеры: g2 (Tesla V100 32GB) и g3 (A100 80GB). Для большинства open-source моделей 7B параметров хватает одной V100. Создание VM через YC CLI:

yc compute instance create \ --name llm-server \ --zone ru-central1-a \ --platform gpu-standard-v3 \ --gpus 1 \ --memory 48GB \ --cores 14 \ --core-fraction 100 \ --image-family ubuntu-2204-lts-gpu \ --image-folder-id standard-images \ --disk-type network-ssd \ --disk-size 300GB \ --network-interface subnet-name=default,nat-ip-version=ipv4 \ --ssh-key ~/.ssh/id_rsa.pub 

Сравнение GPU-инстанций

Параметр g2 (V100) g3 (A100)
Память GPU 32 GB HBM2 80 GB HBM2e
Подходит для моделей до 13B (INT4) до 70B (INT8)
Макс. токенов/сек (Mistral 7B) 120–150 200–280
Аренда ~150–300 ₽/час ~400–800 ₽/час

Как выбрать GPU для вашей модели?

Выбор между V100 и A100 зависит от размера модели и желаемой latency. Для моделей 7B в INT4 V100 даёт приемлемую скорость — до 150 токенов/сек. Если планируете обслуживать несколько запросов параллельно или работать с 13B+ моделями, берите A100. Также учитывайте budget: A100 стоит в 2-3 раза дороже. Для экспериментов подойдёт V100, для продакшена с высокой нагрузкой — A100.

Конфигурация vLLM на YC VM

vLLM — самый производительный inference engine для LLM (в 2–3 раза быстрее Hugging Face Transformers на той же GPU). Установка и запуск:

sudo apt-get update && sudo apt-get install -y python3-pip pip install vllm # Загрузка модели из Yandex Object Storage aws s3 sync s3://my-bucket/models/mistral-7b/ /data/models/mistral-7b/ \ --endpoint-url https://storage.yandexcloud.net \ --profile yandex # Запуск сервера python -m vllm.entrypoints.openai.api_server \ --model /data/models/mistral-7b/ \ --tensor-parallel-size 1 \ --max-model-len 8192 \ --max-num-seqs 128 \ --port 8000 \ --host 0.0.0.0 
Детали конфигурации vLLM

Для оптимизации используйте флаги --quantize awq для INT4 и --kv-cache-dtype auto. При нескольких GPU включите --tensor-parallel-size. Мониторинг метрик через эндпоинт /metrics.

Сравнение: vLLM vs Hugging Face на Yandex Cloud

Параметр vLLM Hugging Face Transformers
Токенов/сек (Mistral 7B, V100) 120–150 40–60
Использование GPU >90% 60–70%
Поддержка continuous batching Да Нет
P50 latency <100ms ~300ms

Yandex Object Storage для моделей

Храним веса моделей в S3-совместимом Object Storage: дёшево (≈ 2–3 ₽/ГБ/мес) и надёжно. Пример загрузки:

import boto3 s3 = boto3.client( "s3", endpoint_url="https://storage.yandexcloud.net", aws_access_key_id=os.getenv("YC_ACCESS_KEY"), aws_secret_access_key=os.getenv("YC_SECRET_KEY"), region_name="ru-central1" ) for file in model_files: s3.upload_file( Filename=f"/local/models/{file}", Bucket="llm-models-bucket", Key=f"mistral-7b/{file}", ExtraArgs={"StorageClass": "COLD"} ) 

Yandex DataSphere для прототипирования

DataSphere — managed Jupyter с GPU по запросу. Идеально для экспериментов и fine-tuning, но не для продакшн-деплоя. Мы используем его для быстрой проверки гипотез и настройки параметров quantization (INT4/INT8) перед развёртыванием.

Как масштабировать под нагрузку?

Для балансировки используем Application Load Balancer:

yc alb target-group create llm-targets \ --target subnet-name=default,ip-address=10.0.0.10 \ --target subnet-name=default,ip-address=10.0.0.11 yc alb backend-group create llm-backends \ --http-backend name=vllm-backend,port=8000,target-group-id=xxx,healthcheck-path=/health yc alb http-router create llm-router \ --virtual-host name=llm,authority=llm.company.ru \ --route name=api,path-prefix=/v1,backend-group-id=xxx 

Как настроить мониторинг LLM?

Встроенная интеграция: VM метрики (CPU, память, GPU utilization через DCGM exporter) автоматически в Yandex Monitoring. Custom метрики через Unified Agent:

# /etc/yandex-unified-agent/config.yml routes: - input: plugin: prometheus_puller config: url: http://localhost:8000/metrics pull_period: 15s output: plugin: yc_metrics config: folder_id: xxx iam_token_file: /etc/yandex-unified-agent/iam_token 

Процесс работы: 7 шагов

  1. Анализ требований — определяем нагрузку, latency, бюджет.
  2. Выбор модели и quantization — подбираем оптимальную под задачу.
  3. Создание GPU-инстанции — настраиваем VM через YC CLI.
  4. Установка vLLM — ставим и оптимизируем inference engine.
  5. Загрузка модели в Object Storage — переносим веса в S3-хранилище.
  6. Запуск и настройка API — открываем эндпоинт, интегрируем с приложением.
  7. Балансировка и мониторинг — добавляем ALB, настраиваем алерты.

Что входит в работу?

  • Аудит вашей задачи и выбор конфигурации (модель, GPU, бюджет)
  • Развёртывание vLLM / TGI на Yandex Cloud с мониторингом
  • Настройка API-шлюза и автоскейлинга
  • Документация по эксплуатации и обучение команды
  • Техническая поддержка на этапе запуска

Гарантируем: latency p99 <200ms для моделей до 13B, uptime 99.9%. Опыт — более 5 лет в AI/ML, сертифицированные специалисты Yandex Cloud.

Свяжитесь с нами для консультации — оценим проект за 2 дня. Закажите развёртывание LLM на Yandex Cloud прямо сейчас!