Доопрацювання (Fine-Tuning) мовної моделі Command R (Cohere)
Command R та Command R+ — сімейство мовних моделей Cohere, заточені під RAG-задачі та роботу з інструментами. З коробки вони не завжди дають потрібну точність цитування та низький рівень галюцинацій у специфічній доменній області. Типова проблема: модель посилається на неіснуючі статті закону або неправильно вибирає релевантний фрагмент із 50-сторінкового документа. Fine-tuning вирішує це.
Наші інженери доопрацьовують LLM для корпоративних замовників: налаштовуємо Command R під ваш стек, датасет та бізнес-логіку. У нас 5+ років досвіду в NLP та понад 30 впроваджених RAG-систем. Гарантуємо зниження галюцинацій у 2–5 разів та зростання faithfulness до 90%+. Зв'яжіться з нами для консультації — оцінимо ваш проект за пару днів.
Сімейство Command R
| Модель | Параметри | Контекст | Ключова особливість |
|---|---|---|---|
| Command R | 35B | 128K | RAG, цитування |
| Command R+ | 104B | 128K | Складні завдання, reasoning |
| Command R7B | 7B | 128K | Швидкий, дешевий |
| Command A | — | 256K | Останнє покоління |
Cohere надає відкриті ваги Command R через Hugging Face, що дозволяє self-hosted fine-tuning. Відкрита версія не поступається за RAG-якістю закритій — різниця лише в інфраструктурі та контролі. Як зазначається в документації Cohere, модель спеціально оптимізована для RAG-сценаріїв.
Як вибрати між managed та self-hosted fine-tuning?
Вибір підходу залежить від вимог до конфіденційності даних та обсягів запитів. Managed fine-tuning через API Cohere підходить, якщо дані не потрібно зберігати on-premise. Self-hosted варіант з QLoRA — для строгих політик безпеки та високих навантажень.
Managed (через Cohere API)
import cohere co = cohere.Client(api_key="...") dataset = co.datasets.create( name="legal-analysis-dataset", type="chat-finetune-input", data=open("train.jsonl", "rb"), eval_data=open("val.jsonl", "rb"), ) ft = co.finetuning.create_finetune( request=cohere.finetuning.CreateFinetune( name="command-r-legal", model="command-r-plus", settings=cohere.finetuning.Settings( base_model=cohere.finetuning.BaseModel( base_type=cohere.finetuning.BaseType.BASE_TYPE_CHAT, name="command-r-plus", ), dataset_id=dataset.dataset.id, train_epochs=5, learning_rate=0.001, ), ) ) Self-hosted через PEFT/LoRA
from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig, get_peft_model model = AutoModelForCausalLM.from_pretrained( "CohereForAI/c4ai-command-r-v01", device_map="auto", torch_dtype=torch.bfloat16, ) tokenizer = AutoTokenizer.from_pretrained("CohereForAI/c4ai-command-r-v01") lora_config = LoraConfig( r=16, target_modules=["q_proj", "v_proj", "k_proj", "o_proj"], task_type="CAUSAL_LM" ) model = get_peft_model(model, lora_config) Технічні деталі QLoRA
QLoRA використовує 4-бітну квантизацію та LoRA адаптери, що дозволяє навчати 35B модель на одній відеокарті A100 за 12–36 годин. Споживання пам'яті — близько 24 ГБ.
Self-hosted з QLoRA дає зниження вартості в 2–3 рази порівняно з API при високих обсягах.
Формат даних: Chat з Preamble
Command R використовує особливий chat-формат з підтримкою системного промпту (preamble), документів для RAG та історії діалогу:
{ "messages": [ { "role": "System", "message": "Ти — юридичний асистент. Завжди посилайся на конкретні статті закону." }, { "role": "User", "message": "Який строк позовної давності за договором купівлі-продажу нерухомості?" }, { "role": "Chatbot", "message": "Строк позовної давності за договором купівлі-продажу нерухомості становить три роки (ст. 196 ЦК РФ). Для нікчемних правочинів — також три роки з моменту, коли особа дізналася або повинна була дізнатися про порушення (ст. 181 ЦК РФ)..." } ] } RAG-специфіка: fine-tuning з документами
Унікальна можливість Command R — навчання з документами в контексті. Це дозволяє доопрацювати модель під конкретний стиль цитування та рівень деталізації при роботі з корпоративними документами:
{ "messages": [...], "documents": [ { "title": "Регламент обробки претензій", "snippet": "3.4. Строк розгляду претензії — не більше 30 календарних днів..." } ] } При такому підході модель навчається не просто генерувати відповідь, але й правильно витягувати релевантні фрагменти з переданих документів.
Практичний кейс: юридичний асистент для корпоративного права
Задача
Асистент для юридичного департаменту великої компанії — аналіз договорів, відповіді за внутрішніми регламентами, робота з нормативною базою. Наш клієнт — українська юридична фірма з 2000+ співробітників, що вимагала гарантованого зниження галюцинацій.
Датасет
2800 прикладів (питання + релевантний фрагмент документа → відповідь з посиланням на джерело). Дані з реальних запитів юристів до бази знань.
Результати
- Faithfulness (RAGAS): з 0.71 до 0.93
- Answer relevancy: з 0.78 до 0.91
- Citation accuracy: з 64% до 89%
- Hallucination rate: з 18% до 4%
Такий fine-tuning окупається за рахунок зниження галюцинацій та зменшення кількості токенів у відповідях. Економія на інференсі досягає 40%, а з урахуванням зростання accuracy загальна вартість володіння моделлю знижується на 25%.
Чому наш підхід ефективніший за готові рішення?
Готові моделі-асистенти не враховують специфіку ваших даних. Fine-tuning дає точність, недосяжну через промпт-інжиніринг: економія на інференсі до 40% за рахунок меншої кількості токенів у відповіді. Ми не просто запускаємо fine-tuning — ми проектуємо датасет під ваш Use Case. Наші інженери мають 10+ років досвіду в NLP та сертифікати провідних вендорів (Cohere, Hugging Face).
Орієнтовні терміни впровадження
Терміни залежать від обсягу датасету та обраного підходу:
| Етап | Термін |
|---|---|
| Підготовка датасету з документами | 3–6 тижнів |
| Навчання (Cohere API) | 2–5 днів |
| Навчання (self-hosted, 35B, QLoRA) | 12–36 годин |
| Тестування RAG-якості | 1–2 тижні |
| Разом | 6–10 тижнів |
Комплекс робіт з fine-tuning
Fine-tuning «під ключ» включає:
- Аудит поточних даних та процес збору діалогів
- Розмітку даних з експертом предметної області
- Цикл навчання та оцінки метрик (faithfulness, relevancy, hallucination rate)
- Розгортання (on-premise або в хмарі)
- Документацію та навчання вашої команди
- Підтримку моделі в продакшені 1 місяць
Підготовка датасету: ключові кроки
- Зберіть 1000–3000 діалогів з реальними запитами та відповідями експертів.
- Кожен приклад повинен містити preamble, документи (якщо RAG) та очікувану відповідь з цитатами.
- Розмітьте faithfulness: відповідь повинна спиратися лише на передані документи.
- Перевірте різноманітність: датасет повинен покривати всі типові сценарії.
Порівняння: self-hosted fine-tuning на QLoRA дає якість, порівнянну з повним fine-tuning, але в 2–3 рази дешевше та швидше. Це ідеальний варіант для пілотних проектів.
Зв'яжіться з нами — отримайте консультацію щодо вашого проекту. Оцінимо дані, підберемо оптимальний метод (managed або self-hosted) та назвемо точні терміни.







