Доопрацювання Command R для корпоративних RAG-завдань

Доопрацювання (Fine-Tuning) мовної моделі Command R (Cohere)

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1001

Доопрацювання (Fine-Tuning) мовної моделі Command R (Cohere)

Command R та Command R+ — сімейство мовних моделей Cohere, заточені під RAG-задачі та роботу з інструментами. З коробки вони не завжди дають потрібну точність цитування та низький рівень галюцинацій у специфічній доменній області. Типова проблема: модель посилається на неіснуючі статті закону або неправильно вибирає релевантний фрагмент із 50-сторінкового документа. Fine-tuning вирішує це.

Наші інженери доопрацьовують LLM для корпоративних замовників: налаштовуємо Command R під ваш стек, датасет та бізнес-логіку. У нас 5+ років досвіду в NLP та понад 30 впроваджених RAG-систем. Гарантуємо зниження галюцинацій у 2–5 разів та зростання faithfulness до 90%+. Зв'яжіться з нами для консультації — оцінимо ваш проект за пару днів.

Сімейство Command R

Модель Параметри Контекст Ключова особливість
Command R 35B 128K RAG, цитування
Command R+ 104B 128K Складні завдання, reasoning
Command R7B 7B 128K Швидкий, дешевий
Command A 256K Останнє покоління

Cohere надає відкриті ваги Command R через Hugging Face, що дозволяє self-hosted fine-tuning. Відкрита версія не поступається за RAG-якістю закритій — різниця лише в інфраструктурі та контролі. Як зазначається в документації Cohere, модель спеціально оптимізована для RAG-сценаріїв.

Як вибрати між managed та self-hosted fine-tuning?

Вибір підходу залежить від вимог до конфіденційності даних та обсягів запитів. Managed fine-tuning через API Cohere підходить, якщо дані не потрібно зберігати on-premise. Self-hosted варіант з QLoRA — для строгих політик безпеки та високих навантажень.

Managed (через Cohere API)

import cohere co = cohere.Client(api_key="...") dataset = co.datasets.create( name="legal-analysis-dataset", type="chat-finetune-input", data=open("train.jsonl", "rb"), eval_data=open("val.jsonl", "rb"), ) ft = co.finetuning.create_finetune( request=cohere.finetuning.CreateFinetune( name="command-r-legal", model="command-r-plus", settings=cohere.finetuning.Settings( base_model=cohere.finetuning.BaseModel( base_type=cohere.finetuning.BaseType.BASE_TYPE_CHAT, name="command-r-plus", ), dataset_id=dataset.dataset.id, train_epochs=5, learning_rate=0.001, ), ) ) 

Self-hosted через PEFT/LoRA

from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig, get_peft_model model = AutoModelForCausalLM.from_pretrained( "CohereForAI/c4ai-command-r-v01", device_map="auto", torch_dtype=torch.bfloat16, ) tokenizer = AutoTokenizer.from_pretrained("CohereForAI/c4ai-command-r-v01") lora_config = LoraConfig( r=16, target_modules=["q_proj", "v_proj", "k_proj", "o_proj"], task_type="CAUSAL_LM" ) model = get_peft_model(model, lora_config) 
Технічні деталі QLoRA

QLoRA використовує 4-бітну квантизацію та LoRA адаптери, що дозволяє навчати 35B модель на одній відеокарті A100 за 12–36 годин. Споживання пам'яті — близько 24 ГБ.

Self-hosted з QLoRA дає зниження вартості в 2–3 рази порівняно з API при високих обсягах.

Формат даних: Chat з Preamble

Command R використовує особливий chat-формат з підтримкою системного промпту (preamble), документів для RAG та історії діалогу:

{ "messages": [ { "role": "System", "message": "Ти — юридичний асистент. Завжди посилайся на конкретні статті закону." }, { "role": "User", "message": "Який строк позовної давності за договором купівлі-продажу нерухомості?" }, { "role": "Chatbot", "message": "Строк позовної давності за договором купівлі-продажу нерухомості становить три роки (ст. 196 ЦК РФ). Для нікчемних правочинів — також три роки з моменту, коли особа дізналася або повинна була дізнатися про порушення (ст. 181 ЦК РФ)..." } ] } 

RAG-специфіка: fine-tuning з документами

Унікальна можливість Command R — навчання з документами в контексті. Це дозволяє доопрацювати модель під конкретний стиль цитування та рівень деталізації при роботі з корпоративними документами:

{ "messages": [...], "documents": [ { "title": "Регламент обробки претензій", "snippet": "3.4. Строк розгляду претензії — не більше 30 календарних днів..." } ] } 

При такому підході модель навчається не просто генерувати відповідь, але й правильно витягувати релевантні фрагменти з переданих документів.

Практичний кейс: юридичний асистент для корпоративного права

Задача

Асистент для юридичного департаменту великої компанії — аналіз договорів, відповіді за внутрішніми регламентами, робота з нормативною базою. Наш клієнт — українська юридична фірма з 2000+ співробітників, що вимагала гарантованого зниження галюцинацій.

Датасет

2800 прикладів (питання + релевантний фрагмент документа → відповідь з посиланням на джерело). Дані з реальних запитів юристів до бази знань.

Результати

  • Faithfulness (RAGAS): з 0.71 до 0.93
  • Answer relevancy: з 0.78 до 0.91
  • Citation accuracy: з 64% до 89%
  • Hallucination rate: з 18% до 4%

Такий fine-tuning окупається за рахунок зниження галюцинацій та зменшення кількості токенів у відповідях. Економія на інференсі досягає 40%, а з урахуванням зростання accuracy загальна вартість володіння моделлю знижується на 25%.

Чому наш підхід ефективніший за готові рішення?

Готові моделі-асистенти не враховують специфіку ваших даних. Fine-tuning дає точність, недосяжну через промпт-інжиніринг: економія на інференсі до 40% за рахунок меншої кількості токенів у відповіді. Ми не просто запускаємо fine-tuning — ми проектуємо датасет під ваш Use Case. Наші інженери мають 10+ років досвіду в NLP та сертифікати провідних вендорів (Cohere, Hugging Face).

Орієнтовні терміни впровадження

Терміни залежать від обсягу датасету та обраного підходу:

Етап Термін
Підготовка датасету з документами 3–6 тижнів
Навчання (Cohere API) 2–5 днів
Навчання (self-hosted, 35B, QLoRA) 12–36 годин
Тестування RAG-якості 1–2 тижні
Разом 6–10 тижнів

Комплекс робіт з fine-tuning

Fine-tuning «під ключ» включає:

  • Аудит поточних даних та процес збору діалогів
  • Розмітку даних з експертом предметної області
  • Цикл навчання та оцінки метрик (faithfulness, relevancy, hallucination rate)
  • Розгортання (on-premise або в хмарі)
  • Документацію та навчання вашої команди
  • Підтримку моделі в продакшені 1 місяць

Підготовка датасету: ключові кроки

  1. Зберіть 1000–3000 діалогів з реальними запитами та відповідями експертів.
  2. Кожен приклад повинен містити preamble, документи (якщо RAG) та очікувану відповідь з цитатами.
  3. Розмітьте faithfulness: відповідь повинна спиратися лише на передані документи.
  4. Перевірте різноманітність: датасет повинен покривати всі типові сценарії.

Порівняння: self-hosted fine-tuning на QLoRA дає якість, порівнянну з повним fine-tuning, але в 2–3 рази дешевше та швидше. Це ідеальний варіант для пілотних проектів.

Зв'яжіться з нами — отримайте консультацію щодо вашого проекту. Оцінимо дані, підберемо оптимальний метод (managed або self-hosted) та назвемо точні терміни.

Cohere fine-tuning API Command R on Hugging Face