Дообучение (Fine-Tuning) языковой модели Command R (Cohere)
Command R и Command R+ — семейство языковых моделей Cohere, заточенные под RAG-задачи и работу с инструментами. Из коробки они не всегда дают нужную точность цитирования и низкий уровень галлюцинаций в специфической доменной области. Типичная проблема: модель ссылается на несуществующие статьи закона или неправильно выбирает релевантный фрагмент из 50-страничного документа. Fine-tuning решает это.
Наши инженеры дообучают LLM для корпоративных заказчиков: настраиваем Command R под ваш стек, датасет и бизнес-логику. У нас 5+ лет опыта в NLP и более 30 внедрённых RAG-систем. Гарантируем снижение галлюцинаций в 2–5 раз и рост faithfulness до 90%+. Свяжитесь с нами для консультации — оценим ваш проект за пару дней.
Семейство Command R
| Модель | Параметры | Контекст | Ключевая особенность |
|---|---|---|---|
| Command R | 35B | 128K | RAG, цитирование |
| Command R+ | 104B | 128K | Сложные задачи, reasoning |
| Command R7B | 7B | 128K | Быстрый, дешёвый |
| Command A | — | 256K | Последнее поколение |
Cohere предоставляет открытые веса Command R через Hugging Face, что позволяет self-hosted fine-tuning. Открытая версия не уступает по RAG-качеству закрытой — разница лишь в инфраструктуре и контроле. Как отмечается в документации Cohere, модель специально оптимизирована для RAG-сценариев.
Как выбрать между managed и self-hosted fine-tuning?
Выбор подхода зависит от требований к конфиденциальности данных и объёмов запросов. Managed fine-tuning через API Cohere подходит, если данные не нужно хранить on-premise. Self-hosted вариант с QLoRA — для строгих политик безопасности и высоких нагрузок.
Managed (через Cohere API)
import cohere co = cohere.Client(api_key="...") dataset = co.datasets.create( name="legal-analysis-dataset", type="chat-finetune-input", data=open("train.jsonl", "rb"), eval_data=open("val.jsonl", "rb"), ) ft = co.finetuning.create_finetune( request=cohere.finetuning.CreateFinetune( name="command-r-legal", model="command-r-plus", settings=cohere.finetuning.Settings( base_model=cohere.finetuning.BaseModel( base_type=cohere.finetuning.BaseType.BASE_TYPE_CHAT, name="command-r-plus", ), dataset_id=dataset.dataset.id, train_epochs=5, learning_rate=0.001, ), ) ) Self-hosted через PEFT/LoRA
from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig, get_peft_model model = AutoModelForCausalLM.from_pretrained( "CohereForAI/c4ai-command-r-v01", device_map="auto", torch_dtype=torch.bfloat16, ) tokenizer = AutoTokenizer.from_pretrained("CohereForAI/c4ai-command-r-v01") lora_config = LoraConfig( r=16, target_modules=["q_proj", "v_proj", "k_proj", "o_proj"], task_type="CAUSAL_LM" ) model = get_peft_model(model, lora_config) Технические детали QLoRA
QLoRA использует 4-битную квантизацию и LoRA адаптеры, что позволяет обучать 35B модель на одной видеокарте A100 за 12–36 часов. Потребление памяти — около 24 ГБ.
Self-hosted с QLoRA даёт снижение стоимости в 2–3 раза по сравнению с API при высоких объёмах.
Формат данных: Chat с Preamble
Command R использует особый chat-формат с поддержкой системного промпта (preamble), документов для RAG и истории диалога:
{ "messages": [ { "role": "System", "message": "Ты — юридический ассистент. Всегда ссылайся на конкретные статьи закона." }, { "role": "User", "message": "Каков срок исковой давности по договору купли-продажи недвижимости?" }, { "role": "Chatbot", "message": "Срок исковой давности по договору купли-продажи недвижимости составляет три года (ст. 196 ГК РФ). Для ничтожных сделок — также три года с момента, когда лицо узнало или должно было узнать о нарушении (ст. 181 ГК РФ)..." } ] } RAG-специфика: fine-tuning с документами
Уникальная возможность Command R — обучение с документами в контексте. Это позволяет дообучить модель под конкретный стиль цитирования и уровень детализации при работе с корпоративными документами:
{ "messages": [...], "documents": [ { "title": "Регламент обработки претензий", "snippet": "3.4. Срок рассмотрения претензии — не более 30 календарных дней..." } ] } При таком подходе модель обучается не просто генерировать ответ, но и правильно извлекать релевантные фрагменты из переданных документов.
Практический кейс: юридический ассистент для корпоративного права
Задача
Ассистент для юридического департамента крупной компании — анализ договоров, ответы по внутренним регламентам, работа с нормативной базой. Наш клиент — российская юридическая фирма с 2000+ сотрудников, требовавшая гарантированного снижения галлюцинаций.
Датасет
2800 примеров (вопрос + релевантный фрагмент документа → ответ со ссылкой на источник). Данные из реальных запросов юристов к базе знаний.
Результаты
- Faithfulness (RAGAS): с 0.71 до 0.93
- Answer relevancy: с 0.78 до 0.91
- Citation accuracy: с 64% до 89%
- Hallucination rate: с 18% до 4%
Такой fine-tuning окупается за счёт снижения галлюцинаций и уменьшения количества токенов в ответах. Экономия на инференсе достигает 40%, а с учётом роста accuracy общая стоимость владения моделью снижается на 25%.
Почему наш подход эффективнее готовых решений?
Готовые модели-ассистенты не учитывают специфику ваших данных. Fine-tuning даёт точность, недостижимую через промпт-инжиниринг: экономия на инференсе до 40% за счёт меньшего числа токенов в ответе. Мы не просто запускаем fine-tuning — мы проектируем датасет под ваш Use Case. Наши инженеры имеют 10+ лет опыта в NLP и сертификаты ведущих вендоров (Cohere, Hugging Face).
Ориентировочные сроки внедрения
Сроки зависят от объёма датасета и выбранного подхода:
| Этап | Срок |
|---|---|
| Подготовка датасета с документами | 3–6 недель |
| Обучение (Cohere API) | 2–5 дней |
| Обучение (self-hosted, 35B, QLoRA) | 12–36 часов |
| Тестирование RAG-качества | 1–2 недели |
| Итого | 6–10 недель |
Комплекс работ по fine-tuning
Fine-tuning «под ключ» включает:
- Аудит текущих данных и процесс сбора диалогов
- Разметку данных с экспертом предметной области
- Цикл обучения и оценки метрик (faithfulness, relevancy, hallucination rate)
- Развёртывание (on-premise или в облаке)
- Документацию и обучение вашей команды
- Поддержку модели в продакшене 1 месяц
Подготовка датасета: ключевые шаги
- Соберите 1000–3000 диалогов с реальными запросами и ответами экспертов.
- Каждый пример должен содержать preamble, документы (если RAG) и ожидаемый ответ с цитатами.
- Разметьте faithfulness: ответ должен опираться только на переданные документы.
- Проверьте разнообразие: датасет должен покрывать все типовые сценарии.
Сравнение: self-hosted fine-tuning на QLoRA даёт качество, сравнимое с полным fine-tuning, но в 2–3 раза дешевле и быстрее. Это идеальный вариант для пилотных проектов.
Свяжитесь с нами — получите консультацию по вашему проекту. Оценим данные, подберём оптимальный метод (managed или self-hosted) и назовём точные сроки.







