Перейти к содержимому
Нейросети

Дообучение LLM: когда нужно и сколько стоит в 2026

· 21 июля 2026 · 10 мин чтения
Дообучение LLM: когда нужно и сколько стоит в 2026

Дообучение языковой модели, или fine-tuning, адаптирует уже обученную LLM к конкретной задаче, стилю или предметной области за счёт дополнительного обучения на узком датасете. Обучение с нуля требует сотен миллионов токенов и десятков GPU-серверов. Дообучение стартует от 500 пар «вопрос-ответ» и одной арендованной GPU. От RAG оно отличается принципиально: RAG добавляет внешние знания в runtime, а дообучение меняет поведение и формат вывода на уровне весов модели. Бюджет, сроки, выбор российских моделей рассмотрены ниже. Выбор между подходами разобран в Fine-tuning vs RAG.

Что такое дообучение LLM и чем отличается от обучения с нуля

Предобученная языковая модель уже умеет читать, писать и рассуждать. GPT-4o, Llama-3.1, GigaChat Ultra прошли обучение на триллионах токенов: это заняло месяцы и стоило десятки миллионов долларов. Дообучение использует эту базу как фундамент и настраивает поведение модели под вашу задачу. Грубая аналогия: не учить сотрудника читать и писать с нуля, а провести отраслевой тренинг для уже грамотного специалиста.

Обучение с нуля требует 8–16 серверов A100, 2–6 месяцев работы ML-команды и бюджета от $1 млн. Для 99% бизнес-задач оно избыточно. Дообучение решает три конкретных проблемы, с которыми не справляется RAG.

Формат вывода. Если модель должна всегда возвращать валидный JSON строго заданной схемы, отвечать в юридическом стиле вашей компании или генерировать SQL без пояснений, дообучение вшивает это поведение в веса. Промпт-инжиниринг даёт нестабильный результат на масштабе.

Потолок промпт-инжиниринга. Некоторые задачи требуют глубокого понимания доменной терминологии или специфических шаблонов, которые не передаются через системный промпт. Когда 50 итераций промпта не дают стабильного качества, это сигнал для дообучения.

Снижение inference-cost. Дообученная компактная модель (7B–13B параметров) на задаче классификации заявок или извлечения сущностей может заменить GPT-4o при цене в 20–50 раз ниже за запрос.

Три метода: LoRA, QLoRA и полное дообучение

Выбор метода зависит от бюджета, размера модели и требуемого качества.

Full fine-tuning (полное дообучение). Обновляются все параметры модели. Для модели 70B нужно 16 GPU A100 80 GB, один прогон обходится в $500–5 000. Качество максимальное, но стоимость и инфраструктура делают это вариантом для enterprise-проектов с командой MLOps. Подходит, когда нужно кардинально изменить поведение большой модели.

LoRA (Low-Rank Adaptation). Замораживает базовые веса и обучает только небольшие матрицы-адаптеры, составляющие 0,1–1% параметров. Для модели 7B достаточно одной GPU A100 24 GB, прогон стоит $50–200. Качество сравнимо с full fine-tuning на большинстве задач. Это стандарт для production-дообучения в 2026 году.

QLoRA (Quantized LoRA). Сжимает веса базовой модели до 4-битного формата и применяет LoRA поверх сжатой модели. Для 7B достаточно GPU с 12 GB VRAM, например потребительской RTX 3090 или арендованной A10G. Прогон обходится в $15–50 через Vast.ai или RunPod. Стек 2026: Unsloth + PEFT + bitsandbytes. Потеря качества по сравнению с LoRA минимальна на задачах классификации и извлечения. Начинать стоит с QLoRA.

Запустить модель после дообучения можно через Llama 3 локально на собственном VPS с GPU. Это снижает inference-cost до фиксированных $200–400/мес независимо от объёма запросов.

Стоимость одного прогона по методам $15–50 QLoRA 12 GB GPU $50–200 LoRA A100 24 GB $500–5 000 Full FT 16× A100

Когда дообучение нужно бизнесу: 4 критерия

Большинство задач решаются через RAG или грамотный промпт. Дообучение оправдано, когда одновременно выполняются четыре условия.

1. Есть структурированный датасет. Минимум 300–500 пар «вход-выход», желательно 2 000–5 000. Если данных нет, сначала нужно разметить, и это самая трудоёмкая часть проекта. Меньше 300 примеров дают ненадёжный результат: модель переобучается на артефакты разметки, а не на паттерн.

2. Задача повторяется массово. Тысячи запросов в день с одинаковой структурой: классификация тикетов, конвертация текста в SQL, извлечение реквизитов из документов, ответы в стиле саппорта. При меньшем объёме ROI от дообучения не окупает затраты на подготовку и поддержку.

3. Промпт-инжиниринг достиг потолка. Команда сделала 30+ итераций промпта, качество на eval-сете не растёт выше 70–75%, ошибки носят системный характер. Это сигнал: модели не хватает доменных примеров в весах.

4. RAG не решает задачу. Если проблема не в знаниях, а в поведении, RAG не поможет. Хранить в векторной базе данных 10 000 примеров правильного JSON-формата и каждый раз подавать их в контекст технически возможно, но это дорогой и нестабильный способ. Дообучение решает это раз и навсегда.

Примеры задач, где дообучение оправдано: генерация SQL из произвольного текста, классификация заявок в CRM по 20+ категориям, адаптация тональности саппорта под бренд, извлечение структурированного JSON из неструктурированных документов.

Этапы проекта по дообучению LLM

Шаг 1. Сбор и разметка датасета (1–2 недели). Самый трудоёмкий этап. Нужно собрать реальные примеры входных данных и создать эталонные выходы. Способы: ручная разметка силами предметных экспертов, перегонка через сильную модель (GPT-4o, Claude Opus) с последующей валидацией, извлечение из исторических логов системы. Правило: проверять вручную не менее 10% датасета перед запуском обучения. Грязный датасет губит проект чаще, чем неверная архитектура обучения.

Шаг 2. Выбор базовой модели (2–3 дня). Для русскоязычных задач в 2026 году три основных кандидата: GigaChat Ultra (открытые веса с мая 2026), Qwen 3.6 (лучший RU-язык среди open-source, лицензия Apache 2.0), Llama-3.1 8B (широкое сообщество, HuggingFace-интеграции). Выбор зависит от языка данных, требований к развёртке и лицензии.

Шаг 3. Прогон QLoRA (1–3 дня). 3–5 эпох на датасете с мониторингом training loss и eval loss. Если eval loss перестаёт снижаться или начинает расти, останавливаем досрочно. Инструменты: Unsloth для ускорения на 2–5x по сравнению с базовым PEFT, Weights and Biases для логирования кривых обучения.

Шаг 4. Оценка качества (2–5 дней). Сравниваем дообученную модель с базовой на hold-out тест-сете. Метрики зависят от задачи: F1 для классификации, ExactMatch для структурированного вывода, ROUGE для суммаризации. Для субъективных задач используют LLM-as-judge: GPT-4o оценивает пары ответов вслепую. Если прирост качества меньше 10% над базовой, возвращаемся к шагу 1 с расширенным датасетом.

Шаг 5. Деплой и мониторинг (1–3 дня). Сервинг через vLLM или Ollama на VPS с GPU. A10G 24 GB от Vast.ai или RunPod обходится в 4 500–8 000 ₽/мес при постоянной нагрузке. Настраиваем мониторинг деградации качества: раз в неделю прогоняем eval-сет и сравниваем с бейзлайном.

Итого на проект: 3–6 недель при готовых данных, до 3 месяцев если датасет собирается с нуля.

Сколько стоит дообучение LLM в России: цифры 2026 года

Статья затрат Своими силами Через агентство
Сбор и разметка датасета (1 000 примеров) 40–120 ч работы аналитика 60 000–150 000 ₽
QLoRA-прогон 7B (GPU-аренда) $15–50 (Vast.ai / RunPod) включено
LoRA-прогон 7B в облаке $50–200 включено
Full fine-tuning 70B (enterprise) $500–5 000 за прогон по запросу
Оценка качества + итерации нет 30 000–80 000 ₽
Деплой + мониторинг нет 20 000–50 000 ₽
Проект под ключ (QLoRA 7B) GPU + время ML-инженера 150 000–500 000 ₽

OpenAI fine-tuning gpt-4o-mini: $0,004 за 1 000 токенов обучения. Датасет 500 000 токенов обойдётся в $2 000 за один прогон. Inference дообученной модели стоит дороже базовой: $0,012 на вход вместо $0,0015. Удобно для команд без GPU-инфраструктуры, но vendor lock и рост inference-стоимости делают это дорогим при масштабировании.

ROI-расчёт на реальных числах. 10 000 запросов в день через GPT-4o ($0,015 за запрос) = $4 500/мес. Дообученная 7B-модель на VPS с A10G = $200–400/мес при неограниченном числе запросов. Экономия составляет $4 100–4 300/мес. При стоимости проекта 200 000–300 000 ₽ окупаемость наступает на втором месяце эксплуатации.

Дообучение российских моделей: GigaChat и YandexGPT

GigaChat Ultra. В мае 2026 года Сбер открыл веса модели. Дообучение доступно через HuggingFace + PEFT по стандартному LoRA/QLoRA-пайплайну. Модель обучена на русскоязычном корпусе, хорошо держит падежи и деловой стиль. Актуальна для проектов, где данные не могут обрабатываться зарубежными провайдерами или где требования проекта предполагают работу в российской инфраструктуре.

YandexGPT 5 Lite. Fine-tuning через YandexCloud ML Platform без необходимости поднимать собственную GPU-инфраструктуру. Стоимость прогона: 2 000–8 000 ₽ в зависимости от объёма данных. Инференс через YandexCloud API даёт фиксированную стоимость и SLA от Яндекса. Подходит командам, которые уже работают в Яндекс Облаке и хотят минимизировать DevOps-нагрузку.

Qwen 3.6. Open-source модель под лицензией Apache 2.0 от Alibaba. Показывает лучшее качество на русском языке среди открытых моделей по состоянию на середину 2026 года. Нет vendor lock, можно развернуть на любом VPS или on-premise сервере. QLoRA-дообучение стандартным Unsloth-пайплайном: $15–50 за прогон. Оптимальный выбор для международных проектов или когда нужна гибкость в деплое.

Для проектов с требованиями по локализации данных подойдут GigaChat Ultra или YandexGPT 5 Lite через YandexCloud. Для госсектора и КИИ следует уточнять требования конкретного регулятора с юридической командой: архитектурные гарантии зависят от конфигурации развёртки.

Риски и частые ошибки при дообучении

Catastrophic forgetting. Полное дообучение может «затереть» общие способности модели при агрессивном обучении на узком датасете: модель начинает хорошо делать одно, но перестаёт справляться с остальным. LoRA и QLoRA решают эту проблему структурно: базовые веса не трогаются, адаптер обучается отдельно.

Переобучение. Если eval loss начинает расти, пока training loss снижается, модель заучила датасет, а не паттерн. Решение: ранняя остановка (early stopping), более высокий dropout, уменьшение числа эпох. Типичный безопасный диапазон: 2–5 эпох для датасетов от 1 000 примеров.

Грязный датасет. 10–15% ошибок в разметке разрушают результат даже при хорошей архитектуре обучения. Перед запуском верифицируйте вручную случайную выборку из 10% примеров. Если нашли более 5% ошибок, переразметка обязательна.

Дообучение вместо RAG. Если ваши данные меняются ежедневно (цены, остатки, новые документы), дообучение потребует переобучения при каждом обновлении. Это дорого и медленно. Меняющиеся данные относятся к зоне RAG с векторным поиском, а не fine-tuning.

Недостаток данных. Меньше 300 примеров дают статистически ненадёжный результат: качество нестабильно между прогонами, модель чувствительна к порядку примеров. Стабильный результат начинается от 500 пар. Надёжный продакшн требует от 2 000 пар. Подробнее о выборе между подходами: внедрение ИИ с нуля или надстройка над существующей инфраструктурой.

EQ.team: практика, а не теория

Нужно дообучение под вашу задачу?

Помогаем выбрать подход (RAG / fine-tuning / prompt), собрать датасет и запустить проект. Работаем с GigaChat, YandexGPT, Llama и Qwen.

Сколько примеров нужно для дообучения LLM?

Минимум 300 пар «вход-выход». Стабильный результат начинается от 500, надёжный продакшн требует 2 000–5 000 пар. Качество разметки важнее количества: 500 чистых примеров дают лучший результат, чем 5 000 с 15% ошибок. Перед запуском обучения всегда проверяйте 10% датасета вручную.

Можно ли дообучить LLM без собственного GPU?

Да. Через облачную аренду GPU на Vast.ai или RunPod QLoRA-прогон 7B-модели обходится в $15–50 без покупки оборудования. Второй путь: fine-tuning через API провайдеров. OpenAI (gpt-4o-mini) или YandexCloud ML Platform берут 2 000–8 000 ₽ за прогон. Первый вариант гибче и дешевле при итеративной работе, второй проще для команд без DevOps.

Чем дообучение отличается от RAG?

RAG добавляет внешние знания в каждый запрос в runtime: модель получает релевантные фрагменты из базы данных и отвечает на их основе. Дообучение меняет поведение, стиль и формат ответов на уровне весов самой модели, без дополнительного контекста при инференсе. Если данные меняются чаще раза в квартал, нужен RAG. Если задача требует фиксированного формата вывода или устойчивого стиля, это зона fine-tuning. Подробное сравнение: Fine-tuning vs RAG.

Сколько времени занимает проект по дообучению?

Если датасет уже готов, а задача решается QLoRA на 7B-модели: 3–4 недели с учётом итераций оценки и деплоя. Если данные нужно собирать и размечать с нуля: 2–3 месяца. Enterprise-проект с full fine-tuning большой модели и несколькими итерациями занимает 3–6 месяцев. Самый длинный этап почти всегда подготовка датасета, а не само обучение.

Какую базовую модель выбрать для дообучения в России?

Для проектов с требованиями по локализации данных и работой в российской инфраструктуре: GigaChat Ultra (открытые веса) или YandexGPT 5 Lite через YandexCloud. Для максимального качества на русском языке в open-source без vendor lock: Qwen 3.6 (Apache 2.0). Для международных проектов или задач с большим англоязычным компонентом: Llama-3.1 8B или Mistral 7B. В 2026 году большинство RU-проектов выбирают Qwen 3.6 или GigaChat Ultra.

Обсудим задачу

Опишите задачу в 2–3 предложениях и оставьте контакт. Ответим в течение 2 часов в рабочее время.

Telegram
@streeboga
Почта
sale@eq.team
Часы работы
10:00–19:00 (МСК)
Пришлём оценку письмом в течение рабочего дня. Достаточно заполнить одно поле из двух.
Данные не передаём третьим лицам. Как их обрабатываем — в политике обработки персональных данных.
С чего начать

EQ поддержит на любом этапе

Старт проекта

Готовы к разработке — нужен надёжный фундамент и понятный план.

Обсудить проект

Масштабирование

Продукт растёт — нужна разработка новых фич в продакшене.

Написать нам

Поддержка

Всё работает — нужно развивать, поддерживать и мониторить.

Написать нам