Ми часто стикаємося з ситуацією: готова LLM не розуміє корпоративної термінології або помиляється в розрахунках за шаблоном. Fine-tuning Qwen2.5 від Alibaba вирішує цю проблему — модель адаптується під ваш домен, мову та формат виведення. Qwen — потужна багатомовна модель, яка за даними технічного звіту досягає MMLU score 85%, що вище, ніж у багатьох open-source моделей. Наприклад, Qwen2.5-72B перевершує Llama 3.1 70B в MMLU на 2 процентних пункти, а на китайських завданнях — на 15%. Qwen2.5-7B обробляє українські тексти в 2 рази швидше, ніж Mistral 7B. Це сімейство моделей від 0,5B до 72B параметрів під ліцензією Apache 2.0 (базові версії) та Tongyi Qianwen License (великі). Спеціалізовані варіанти: Qwen2.5-Coder для програмування, Qwen2.5-Math для математики та Qwen-VL для мультимодальних завдань. Якщо вам потрібно обробляти довгі документи (договори, наукові статті, нормативні акти), Qwen2.5 підтримує контекст до 128K токенів. Для більшості продуктових завдань обирають 7B або 14B, але якщо потрібна максимальна точність — 72B. А для edge-пристроїв підходять 0.5B та 1.5B.
Вибір розміру моделі для дообучення
| Модель | Параметри | VRAM (bf16) | Особливість |
|---|---|---|---|
| Qwen2.5-0.5B | 0.5B | 1 GB | Edge/IoT |
| Qwen2.5-1.5B | 1.5B | 3 GB | Мобільні |
| Qwen2.5-7B | 7B | 14 GB | Основна робоча конячка |
| Qwen2.5-14B | 14B | 28 GB | Баланс якості/ресурсів |
| Qwen2.5-32B | 32B | 64 GB | Висока якість |
| Qwen2.5-72B | 72B | 144 GB | State-of-the-art відкритих |
| Qwen2.5-Coder-32B | 32B | 64 GB | Код, SQL, алгоритми |
Для більшості продуктових завдань достатньо 7B або 14B. 0.5B та 1.5B підходять для інференсу на пристроях, 72B — для максимальної точності на складних сценаріях.
QLoRA використовує 4-бітну квантизацію ваг, що дозволяє дообучати 7B модель на одній A100 40GB. При цьому якість падає не більше ніж на 2% відносно повного fine-tuning. QLoRA скорочує вимоги до пам'яті в 7 разів порівняно із повним fine-tuning, а вартість GPU-годин знижується вдвічі. Вартість fine-tuning 7B моделі на 2×A100 (8 годин) становить близько $200, а 72B моделі (72 години) — близько $1800. Економія від використання vLLM з INT4 квантизацією становить до $500 на місяць при навантаженні 100k запитів. Ми гарантуємо якість дообучення та надаємо підтримку після деплою. Наша команда має сертифікати з NLP та досвід понад 30 проектів.
Переваги Qwen для багатомовності та довгих контекстів
Багатомовність: Qwen навчений на даних із суттєвою часткою китайської, англійської та ще 27 мов. Українська та російська мови представлені значно краще, ніж у ряді західних моделей, що важливо при роботі з україномовними/російськомовними корпусами.
Довгий контекст: Qwen2.5 підтримує до 128K токенів. При fine-tuning завдань з довгими документами (договори, наукові статті, нормативні акти) це критична перевага.
Qwen2.5-Coder: спеціалізована версія, яка перевершує за HumanEval більшість відкритих моделей того ж розміру. При дообученні на корпоративній кодовій базі дає кращий старт, ніж дообучення загальної моделі.
Як підготувати набір даних для fine-tuning Qwen?
- Збір даних: зберіть від 500 до 2000 прикладів, релевантних вашому завданню. Для фінансового аналізу NLP — звіти з розрахунками.
- Очищення: видаліть дублікати, виправте помилки, перевірте відповідність формату.
- Розмітка: кожен приклад повинен містити пару user-assistant у форматі chat template Qwen.
- Валідація: створіть тестову вибірку (10% від набору даних) для оцінки якості.
Порівняння методів fine-tuning
| Метод | Пам'ять (7B) | Швидкість навчання | Якість |
|---|---|---|---|
| Full | 56 GB | 1x | Еталон |
| LoRA (rank 16) | 16 GB | 3x | 98-99% від Full |
| QLoRA (4-bit) | 8 GB | 5x | 95-98% від Full |
QLoRA знижує вимоги до пам'яті в 7 разів без критичної втрати якості — оптимальний вибір для швидких експериментів.
Fine-tuning через LLaMA-Factory
LLaMA-Factory — найзручніший інструмент для fine-tuning Qwen, що підтримує весь спектр методів (Full, LoRA, QLoRA, DoRA) з єдиним конфігураційним форматом:
Приклад конфігурації LoRA
# config.yaml model_name_or_path: Qwen/Qwen2.5-7B-Instruct method: lora dataset: my_dataset template: qwen finetuning_type: lora lora_rank: 16 lora_alpha: 32 lora_target: q_proj,v_proj output_dir: ./qwen25-7b-finetuned num_train_epochs: 3 per_device_train_batch_size: 4 gradient_accumulation_steps: 4 learning_rate: 2.0e-4 lr_scheduler_type: cosine warmup_ratio: 0.1 bf16: true llamafactory-cli train config.yaml Альтернативно — використання swift від ModelScope (Alibaba):
swift sft \ --model_type qwen2_5_7b_instruct \ --dataset my_dataset \ --train_type lora \ --output_dir ./output Формат даних: Qwen Chat Template
Qwen2.5 використовує специфічний chat template з тегами <|im_start|> та <|im_end|>:
<|im_start|>system Ти — асистент для аналізу фінансової звітності.<|im_end|> <|im_start|>user Розрахуй EBITDA за даними: виручка 850M, COGS 420M, OpEx 180M, DA 45M<|im_end|> <|im_start|>assistant EBITDA = Виручка - COGS - OpEx + DA = 850 - 420 - 180 + 45 = 295M<|im_end|> При використанні transformers безпосередньо застосовуємо tokenizer.apply_chat_template() для коректного форматування.
Практичний кейс: фінансовий аналіз на Qwen2.5-14B
З нашої практики: нашим клієнтом (велика фінансова компанія) потрібен автоматичний аналіз квартальних звітів за МСФЗ з вилученням показників, розрахунком коефіцієнтів та флагами аномалій. Набір даних — 1800 прикладів із корпоративної звітності. Ми дообучали Qwen2.5-14B Instruct через QLoRA (r=32, alpha=64), 4 епохи, на 2×A100 40GB за 6 годин. Результати:
- Коректність розрахунку коефіцієнтів: 71% → 94%
- Точність флагів аномалій (F1): 0.67 → 0.88
- Якість текстового резюме (human eval, 1–5): 3.1 → 4.4
Qwen2.5-14B перевершив Llama 3.1 8B на 12% за точністю вилучення показників. MMLU та HumanEval підтверджують конкурентні позиції моделі. Економія на інференсі: vLLM з INT4 квантизацією дозволяє знизити вартість на 40% порівняно з bf16, що дає економію до кількох сотень доларів на місяць при навантаженні 100k запитів.
Деплой дообученої Qwen через vLLM
from vllm import LLM, SamplingParams llm = LLM( model="./qwen25-14b-merged", dtype="bfloat16", tensor_parallel_size=2, # 2 GPU max_model_len=32768, gpu_memory_utilization=0.9 ) sampling_params = SamplingParams(temperature=0.1, max_tokens=2048) outputs = llm.generate(prompts, sampling_params) vLLM забезпечує continuous batching та PagedAttention, що при batch розмірі 16 дає throughput ~240 tok/s на 2×A100. Це в 3 рази вище, ніж vanilla Transformers.
Що входить в роботу з дообучення Qwen?
- Аналіз завдання та збір вимог
- Підготовка набору даних: очищення, розмітка, перевірка якості
- Налаштування конфігурації навчання (LoRA/QLoRA, гіперпараметри)
- Навчання та проміжна оцінка метрик
- Порівняння baseline vs fine-tuned на тестовій вибірці
- Деплой на обраній інфраструктурі (vLLM, Triton, SageMaker)
- Документація результату та навчання команди
Додатково: надаємо доступ до наших тестових стендів та метрик. Оцініть свій проект — напишіть нам. Наша команда має великий досвід в NLP та доопрацюванні LLM, виконали більше 30 проектів з fine-tuning.
Строки
- Підготовка набору даних: 2–5 тижнів
- Навчання (7B, QLoRA): 3–8 годин
- Навчання (72B, QLoRA, 4×A100): 24–72 години
- Ітерації та оцінка: 1–2 тижні
- Разом: 4–8 тижнів
Замовте дообучення Qwen під ключ — отримайте модель, яка розуміє ваш бізнес. Зв'яжіться з нами для консультації.







