Розгорнути власну GPU-інфраструктуру для інференсу сучасних LLM — завдання не з дешевих. A100/H100 кластери потребують бюджету від мільйонів гривень і команди MLOps-інженерів. Together AI знімає цей бар'єр: ми беремо на себе інтеграцію ваших сервісів з платформою. Підключаємо OpenAI-сумісний API, налаштовуємо роутинг між моделями, оптимізуємо latency p99 — і ви отримуєте готовий endpoint під свої завдання. За 5+ років роботи ми реалізували більше 30 проектів з інтеграції LLM у продакшен — оцінимо ваш проект протягом дня.
Кейс: для фінтех-стартапу ми розгорнули RAG-систему на Together AI за 3 дні. До цього вони платили за оренду виділених GPU на AWS — Together знизив витрати в 5 разів, latency p99 не перевищувала 200 мс, точність відповідей досягла 94%. Це не одиничний приклад: за даними документації платформи, її використання дозволяє скоротити витрати на інференс до 80%. У порівнянні з орендою GPU у AWS, Together AI дає економію до 80% при співставній продуктивності.
Які проблеми вирішує Together AI?
Висока вартість GPU. Оренда власних A100/H100 у хмарах виливається в десятки тисяч доларів щомісяця. Together AI використовує спільний пул GPU, що знижує вартість інференсу в 5–10 разів у порівнянні з інстансами хмар. Складність деплою: вибір версії CUDA, оптимізація через vLLM або TensorRT-LLM — інженерні години. Платформа бере на себе всі низькорівневі оптимізації. Відсутність гнучкості: балансування між якістю та швидкістю — ми реалізуємо роутер, який автоматично перемикає модель залежно від контексту.
Базова інтеграція
from openai import OpenAI, AsyncOpenAI # Together використовує OpenAI SDK client = OpenAI( api_key="TOGETHER_API_KEY", base_url="https://api.together.xyz/v1", ) # Вибір моделі MODELS = { "quality": "meta-llama/Meta-Llama-3.1-405B-Instruct-Turbo", "balanced": "meta-llama/Meta-Llama-3.1-70B-Instruct-Turbo", "fast": "meta-llama/Meta-Llama-3.1-8B-Instruct-Turbo", "code": "Qwen/Qwen2.5-Coder-32B-Instruct", "reasoning": "deepseek-ai/DeepSeek-R1-Distill-Llama-70B", } response = client.chat.completions.create( model=MODELS["balanced"], messages=[{"role": "user", "content": "Задача"}], temperature=0.1, max_tokens=2048, ) print(response.choices[0].message.content) Як працює роутинг моделей?
Роутер аналізує запит: якщо задача потребує глибоких міркувань — направляє на DeepSeek-R1, якщо потрібна швидкість — на Llama 3.1 8B. Це знижує середню вартість токена на 30–40% без втрати якості. Під капотом використовуємо динамічний threshold по latency та confidence.
Докладніше про налаштування роутингу
Ми налаштовуємо порогові значення через A/B тестування на репрезентативній вибірці запитів. Потім роутер автоматично адаптується під навантаження, перемикаючи моделі залежно від поточної latency та необхідної якості.
Як відбувається fine-tuning?
Fine-tuning відкритих моделей під власні дані дозволяє покращити точність і знизити галюцинації. Together AI надає інфраструктуру для LoRA та повного fine-tuning. Ми допомагаємо підготувати датасет, вибрати гіперпараметри та провести A/B тестування. Приклад запуску:
# Together дозволяє fine-tuning відкритих моделей на власних даних import together together.api_key = "TOGETHER_API_KEY" # Завантажуємо датасет (JSONL формат: {"prompt": "...", "completion": "..."}) file_response = together.Files.upload(file="training_data.jsonl") file_id = file_response["id"] # Запускаємо fine-tuning ft_response = together.Finetune.create( training_file=file_id, model="meta-llama/Meta-Llama-3.1-8B-Instruct-Reference", n_epochs=3, batch_size=16, learning_rate=1e-5, suffix="my-custom-model", ) ft_job_id = ft_response["id"] # Перевіряємо статус status = together.Finetune.retrieve(ft_job_id) print(status["status"]) # "running" | "completed" | "failed" Переваги fine-tuning на Together AI
Платформа керує всіма обчислювальними ресурсами — не потрібно думати про GPU. Доступні передтреновані LoRA-ваги, які можна кастомізувати під свої дані. Ми допомагаємо з підбором гіперпараметрів та оцінкою метрик на валідаційному датасеті. Fine-tuning окупається за рахунок підвищення точності та зниження кількості дорогих токенів.
Embeddings та RAG
Для Retrieval-Augmented Generation використовуємо embeddings моделі, наприклад BAAI/bge-large-en-v1.5. Together AI підтримує асинхронну генерацію embeddings, що важливо при високих навантаженнях:
response = client.embeddings.create( model="BAAI/bge-large-en-v1.5", # Одна з найкращих для пошуку input=["Перший текст", "Другий текст"], ) embeddings = [item.embedding for item in response.data] Порівняння моделей на Together AI
| Модель | Якість | Швидкість (токен/с) | Ресурсоємність |
|---|---|---|---|
| Llama 3.1 405B | Excellent | ~50 | Потребує H100 |
| Llama 3.1 70B | Very Good | ~150 | Середня |
| Llama 3.1 8B | Good | ~400 | Низька |
| Qwen2.5-Coder 32B | Code-specific | ~120 | Середня |
| DeepSeek-R1 70B | Reasoning | ~100 | Середня |
Як інтегрувати Together AI за 3 кроки?
- Отримайте API-ключ у панелі керування Together AI.
- Замініть base_url у вашому OpenAI-клієнті на
https://api.together.xyz/v1. - Налаштуйте роутинг — ми підберемо моделі під ваші сценарії. Отримайте endpoint за 0.5 дня.
Отримайте консультацію з інтеграції Together AI.
Скільки часу займає інтеграція?
Інтеграція базового API займає 0.5 дня: заміна base_url та ключа. Повний проект з fine-tuning та RAG — від 5 робочих днів. Вартість розраховується індивідуально під обсяг трафіку та складність моделей. Замовте інтеграцію — отримайте готовий endpoint за 1 день.
Процес роботи
| Етап | Тривалість |
|---|---|
| Аналітика сценаріїв | 1–2 дні |
| Вибір та тестування моделей | 2–3 дні |
| Інтеграція API та роутинг | 1–2 дні |
| Fine-tuning та A/B тест | 3–5 днів |
| Деплой та оптимізація | 2–3 дні |
| Навчання команди | 1 день |
Що входить в роботу
- Підключення Together AI до вашого проекту (0.5 дня)
- Fine-tuning pipeline з A/B тестуванням (3–5 днів)
- Інтеграція embeddings для RAG (1–2 дні)
- Оптимізація вартості (налаштування роутингу, кешування, batch-обробки)
- Документація та навчання команди
- Підтримка після запуску (моніторинг, доналаштування)
Зв'яжіться з нами — оцінимо ваш проект та запропонуємо оптимальне рішення. Гарантуємо зниження витрат на інференс у 2–5 разів у порівнянні з орендою GPU. Додатково читайте про LLM — це основа, на якій будуються всі сучасні AI-рішення.







