Ви впроваджуєте DeepSeek для аналізу фінансової документації, але стандартна модель не вловлює специфіку ваших договорів чи бухгалтерських проводок? Наш досвід показує: дообучення (fine-tuning) DeepSeek під ваші дані підвищує точність у 1,5–2 рази. Ми вже дообучали цю модель для фінансового аудиту, юридичного аналізу та генерації коду — кожного разу отримували приріст точності та значну економію обчислювальних ресурсів.
За даними незалежного тестування, DeepSeek-R1 досягає 89% точності на задачі математичного міркування. Це в 1,5 рази краще за GPT-4o на аналогічних тестах.
Як дообучити DeepSeek для бізнес-завдань?
Сімейство DeepSeek: навігація по моделях
| Модель | Параметри | Архітектура | Застосування |
|---|---|---|---|
| DeepSeek-V3 | 671B (MoE, ~37B активних) | MoE | Флагман, general purpose |
| DeepSeek-R1 | 671B (MoE) | MoE + Chain-of-Thought | Reasoning, математика |
| DeepSeek-R1-Distill-Llama-70B | 70B | Dense | Reasoning, доступніше |
| DeepSeek-R1-Distill-Llama-8B | 8B | Dense | Легкий reasoning |
| DeepSeek-R1-Distill-Qwen-32B | 32B | Dense | Баланс якості/ресурсів |
| DeepSeek-Coder-V2 | 236B (MoE) | MoE | Генерація коду |
Для практичного fine-tuning ми частіше використовуємо дистильовані версії (8B, 32B, 70B). Вони навчаються на звичайному GPU-кластері і дають хороші результати для спеціалізованих задач.
Архітектурна особливість: Multi-head Latent Attention (MLA)
DeepSeek-V3 використовує MLA — механізм уваги з компресією KV-кешу. Порівняно з GQA (Grouped Query Attention у Llama), MLA знижує об'єм KV-кешу в 5–13× при аналогічній якості. Це критично при інференсі з довгим контекстом — DeepSeek підтримує 128K токенів при розумних вимогах до пам'яті.
При fine-tuning MLA-шари обробляються стандартним чином через peft. Але при виборі target_modules враховуйте специфіку: у DeepSeek-V3 проекції уваги називаються q_proj, kv_a_proj_with_mqa, kv_b_proj, o_proj.
Які результати дає дообучення DeepSeek?
У порівнянні з GPT-4o або Claude, DeepSeek пропонує відкриті ваги та ліцензію MIT. Ви не прив'язані до провайдера. Вартість інференсу на власних GPU у 2–4 рази нижча, ніж через API OpenAI. При дообученні ви повністю контролюєте дані та модель. Це критично для конфіденційної інформації. Наші клієнти досягають значної економії обчислювальних ресурсів, впровадивши дообучену модель замість комерційної альтернативи.
Етапи дообучення DeepSeek під бізнес-задачу
- Аналіз бізнес-задачі та збір репрезентативного датасету (3–8 тижнів).
- Розмітка даних з think-блоками для збереження reasoning.
- Вибір архітектури fine-tuning: LoRA або QLoRA з квантизацією INT4.
- Навчання на GPU-кластері (12–24 години для 32B моделі).
- Оцінка якості силами експертів та ітерація при необхідності (2 тижні).
- Деплой на вашу інфраструктуру через vLLM або Triton Inference Server.
LoRA fine-tuning DeepSeek-R1-Distill-Qwen-32B
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig from peft import LoraConfig, get_peft_model, TaskType import torch model_name = "deepseek-ai/DeepSeek-R1-Distill-Qwen-32B" bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype=torch.bfloat16, bnb_4bit_use_double_quant=True, ) model = AutoModelForCausalLM.from_pretrained( model_name, quantization_config=bnb_config, device_map="auto", trust_remote_code=True, torch_dtype=torch.bfloat16, ) lora_config = LoraConfig( r=16, lora_alpha=32, target_modules=["q_proj", "v_proj", "k_proj", "o_proj", "gate_proj", "up_proj", "down_proj"], lora_dropout=0.05, bias="none", task_type=TaskType.CAUSAL_LM, ) model = get_peft_model(model, lora_config) model.print_trainable_parameters() # trainable params: 160,432,128 || all params: 32,783,822,848 || trainable%: 0.49 Робота з ланцюжком міркувань (Chain-of-Thought) при fine-tuning R1
DeepSeek-R1 генерує міркування у спеціальних тегах <think>...</think> перед фінальною відповіддю. При fine-tuning на спеціалізованих даних важливо:
- зберігати think-блоки у навчальних прикладах — це підтримує reasoning-здатність моделі;
- не пригнічувати токен
<think>у промптах під час навчання; - при необхідності прибрати reasoning з інференсу — використовувати
<think>\n\n</think>як prefix або налаштувати stopping criteria.
Приклад навчального прикладу для R1:
{ "messages": [ {"role": "user", "content": "Чи є суперечність між п.3.2 та п.7.1 договору?"}, {"role": "assistant", "content": "<think>\nПункт 3.2 встановлює термін оплати — 30 днів з моменту поставки. Пункт 7.1 говорить про право постачальника призупинити поставки при простроченні оплати більш ніж 15 днів. Суперечності немає — п.7.1 створює право постачальника, яке настає раніше закінчення загального терміну оплати.\n</think>\n\nПрямої суперечності між пунктами немає..."} ] } З нашої практики: фінансовий аудит на DeepSeek-R1
Задача: дообучити DeepSeek-R1-Distill-Qwen-32B для виявлення порушень у фінансовій документації. Датасет: 2100 прикладів з think-блоками. Навчання: QLoRA (r=32), 3 епохи, 4×A100 40GB, 18 годин.
| Метрика | До дообучення | Після дообучення |
|---|---|---|
| Precision | 0.61 | 0.89 |
| Recall | 0.54 | 0.84 |
| F1 | 0.57 | 0.87 |
| Оцінка reasoning (1–5) | 2.8 | 4.3 |
Цей кейс — з практики нашої команди. Ми впровадили рішення в компанію, яка обробляє 500+ фінансових документів на день. Це скоротило час ручної перевірки на 70%.
Що входить в роботу
Ми надаємо повний цикл: аналіз бізнес-задачі, збір та розмітку датасету, вибір архітектури (LoRA/QLoRA), навчання, тестування, деплой на вашу інфраструктуру. У результаті ви отримуєте:
- навчену модель разом з вагами та конфігами
- датасет і скрипти навчання
- документацію з розгортання та моніторингу
- навчання вашої команди роботі з моделлю
- підтримку протягом 3 місяців після запуску
Гарантія якості: ми сертифіковані фахівці з 5-річним досвідом у fine-tuning LLM. Наш досвід охоплює 30+ завершених проєктів з дообучення моделей під бізнес.
Терміни проєкту
- Підготовка датасету з think-блоками: 3–8 тижнів.
- Навчання (32B, 4×A100): 12–24 години.
- Оцінка reasoning-якості: 2 тижні.
- Деплой та моніторинг: 1–2 тижні.
- Разом: 7–14 тижнів.
Зв'яжіться з нами — ми оцінимо ваш сценарій і запропонуємо оптимальну стратегію дообучення під ключ. Замовте консультацію: розкажіть про задачу, і ми підберемо модель, архітектуру та план робіт.







