Інтеграція Together AI: запуск відкритих LLM під ключ

Розгорнути власну GPU-інфраструктуру для інференсу сучасних LLM — завдання не з дешевих. A100/H100 кластери потребують бюджету від мільйонів гривень і команди MLOps-інженерів. Together AI знімає цей бар'єр: ми беремо на себе інтеграцію ваших сервісів з платформою. Підключаємо OpenAI-сумісний API, на

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Розгорнути власну GPU-інфраструктуру для інференсу сучасних LLM — завдання не з дешевих. A100/H100 кластери потребують бюджету від мільйонів гривень і команди MLOps-інженерів. Together AI знімає цей бар'єр: ми беремо на себе інтеграцію ваших сервісів з платформою. Підключаємо OpenAI-сумісний API, налаштовуємо роутинг між моделями, оптимізуємо latency p99 — і ви отримуєте готовий endpoint під свої завдання. За 5+ років роботи ми реалізували більше 30 проектів з інтеграції LLM у продакшен — оцінимо ваш проект протягом дня.

Кейс: для фінтех-стартапу ми розгорнули RAG-систему на Together AI за 3 дні. До цього вони платили за оренду виділених GPU на AWS — Together знизив витрати в 5 разів, latency p99 не перевищувала 200 мс, точність відповідей досягла 94%. Це не одиничний приклад: за даними документації платформи, її використання дозволяє скоротити витрати на інференс до 80%. У порівнянні з орендою GPU у AWS, Together AI дає економію до 80% при співставній продуктивності.

Які проблеми вирішує Together AI?

Висока вартість GPU. Оренда власних A100/H100 у хмарах виливається в десятки тисяч доларів щомісяця. Together AI використовує спільний пул GPU, що знижує вартість інференсу в 5–10 разів у порівнянні з інстансами хмар. Складність деплою: вибір версії CUDA, оптимізація через vLLM або TensorRT-LLM — інженерні години. Платформа бере на себе всі низькорівневі оптимізації. Відсутність гнучкості: балансування між якістю та швидкістю — ми реалізуємо роутер, який автоматично перемикає модель залежно від контексту.

Базова інтеграція

from openai import OpenAI, AsyncOpenAI # Together використовує OpenAI SDK client = OpenAI( api_key="TOGETHER_API_KEY", base_url="https://api.together.xyz/v1", ) # Вибір моделі MODELS = { "quality": "meta-llama/Meta-Llama-3.1-405B-Instruct-Turbo", "balanced": "meta-llama/Meta-Llama-3.1-70B-Instruct-Turbo", "fast": "meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo", "code": "Qwen/Qwen2.5-Coder-32B-Instruct", "reasoning": "deepseek-ai/DeepSeek-R1-Distill-Llama-70B", } response = client.chat.completions.create( model=MODELS["balanced"], messages=[{"role": "user", "content": "Задача"}], temperature=0.1, max_tokens=2048, ) print(response.choices[0].message.content) 

Як працює роутинг моделей?

Роутер аналізує запит: якщо задача потребує глибоких міркувань — направляє на DeepSeek-R1, якщо потрібна швидкість — на Llama 3.1 8B. Це знижує середню вартість токена на 30–40% без втрати якості. Під капотом використовуємо динамічний threshold по latency та confidence.

Докладніше про налаштування роутингу

Ми налаштовуємо порогові значення через A/B тестування на репрезентативній вибірці запитів. Потім роутер автоматично адаптується під навантаження, перемикаючи моделі залежно від поточної latency та необхідної якості.

Як відбувається fine-tuning?

Fine-tuning відкритих моделей під власні дані дозволяє покращити точність і знизити галюцинації. Together AI надає інфраструктуру для LoRA та повного fine-tuning. Ми допомагаємо підготувати датасет, вибрати гіперпараметри та провести A/B тестування. Приклад запуску:

# Together дозволяє fine-tuning відкритих моделей на власних даних import together together.api_key = "TOGETHER_API_KEY" # Завантажуємо датасет (JSONL формат: {"prompt": "...", "completion": "..."}) file_response = together.Files.upload(file="training_data.jsonl") file_id = file_response["id"] # Запускаємо fine-tuning ft_response = together.Finetune.create( training_file=file_id, model="meta-llama/Meta-Llama-3.1-8B-Instruct-Reference", n_epochs=3, batch_size=16, learning_rate=1e-5, suffix="my-custom-model", ) ft_job_id = ft_response["id"] # Перевіряємо статус status = together.Finetune.retrieve(ft_job_id) print(status["status"]) # "running" | "completed" | "failed" 

Переваги fine-tuning на Together AI

Платформа керує всіма обчислювальними ресурсами — не потрібно думати про GPU. Доступні передтреновані LoRA-ваги, які можна кастомізувати під свої дані. Ми допомагаємо з підбором гіперпараметрів та оцінкою метрик на валідаційному датасеті. Fine-tuning окупається за рахунок підвищення точності та зниження кількості дорогих токенів.

Embeddings та RAG

Для Retrieval-Augmented Generation використовуємо embeddings моделі, наприклад BAAI/bge-large-en-v1.5. Together AI підтримує асинхронну генерацію embeddings, що важливо при високих навантаженнях:

response = client.embeddings.create( model="BAAI/bge-large-en-v1.5", # Одна з найкращих для пошуку input=["Перший текст", "Другий текст"], ) embeddings = [item.embedding for item in response.data] 

Порівняння моделей на Together AI

Модель Якість Швидкість (токен/с) Ресурсоємність
Llama 3.1 405B Excellent ~50 Потребує H100
Llama 3.1 70B Very Good ~150 Середня
Llama 3.1 8B Good ~400 Низька
Qwen2.5-Coder 32B Code-specific ~120 Середня
DeepSeek-R1 70B Reasoning ~100 Середня

Як інтегрувати Together AI за 3 кроки?

  1. Отримайте API-ключ у панелі керування Together AI.
  2. Замініть base_url у вашому OpenAI-клієнті на https://api.together.xyz/v1.
  3. Налаштуйте роутинг — ми підберемо моделі під ваші сценарії. Отримайте endpoint за 0.5 дня.

Отримайте консультацію з інтеграції Together AI.

Скільки часу займає інтеграція?

Інтеграція базового API займає 0.5 дня: заміна base_url та ключа. Повний проект з fine-tuning та RAG — від 5 робочих днів. Вартість розраховується індивідуально під обсяг трафіку та складність моделей. Замовте інтеграцію — отримайте готовий endpoint за 1 день.

Процес роботи

Етап Тривалість
Аналітика сценаріїв 1–2 дні
Вибір та тестування моделей 2–3 дні
Інтеграція API та роутинг 1–2 дні
Fine-tuning та A/B тест 3–5 днів
Деплой та оптимізація 2–3 дні
Навчання команди 1 день

Що входить в роботу

  • Підключення Together AI до вашого проекту (0.5 дня)
  • Fine-tuning pipeline з A/B тестуванням (3–5 днів)
  • Інтеграція embeddings для RAG (1–2 дні)
  • Оптимізація вартості (налаштування роутингу, кешування, batch-обробки)
  • Документація та навчання команди
  • Підтримка після запуску (моніторинг, доналаштування)

Зв'яжіться з нами — оцінимо ваш проект та запропонуємо оптимальне рішення. Гарантуємо зниження витрат на інференс у 2–5 разів у порівнянні з орендою GPU. Додатково читайте про LLM — це основа, на якій будуються всі сучасні AI-рішення.