Когда базовая LLM начинает давать неточные ответы на вопросы о вашем бизнесе, команда встаёт перед выбором: дообучить модель на своих данных (fine-tuning) или построить систему с доступом к базе знаний (RAG). Fine-tuning vs RAG: один из ключевых архитектурных вопросов ИИ-проектов 2026 года. От правильного ответа зависит бюджет, время запуска и точность системы.
Что такое fine-tuning: суть и когда применяют
Fine-tuning: дообучение предобученной языковой модели на специфическом датасете. Модель получает тысячи пар «вопрос–ответ» или «промпт–вывод» и адаптирует свои веса. После обучения она отвечает в нужном стиле, формате или предметной области без дополнительных подсказок в промпте.
Что нужно для запуска:
- Чистый датасет: минимум 100–500 пар для LoRA-дообучения, от 5 000 для full fine-tuning
- Вычислительные ресурсы: GPU A100 40 GB или облачный сервис (AWS SageMaker, Google Vertex AI)
- Время: 4–12 часов на LoRA-обучение модели 7–13B параметров, от $50 стоимость GPU-аренды
- Цикл поддержки: при изменении данных нужно новое обучение
Пример: юридическое агентство дообучает модель на 10 000 своих договоров. Через 6 часов на A100 (~$15) модель пишет в юридическом стиле компании, правильно структурирует разделы и знает стандартные оговорки. Дополнительных инструкций в промпте не нужно.
Что такое RAG: извлечение плюс генерация
RAG (Retrieval-Augmented Generation) не меняет модель. При каждом запросе система делает четыре шага:
- Переводит вопрос пользователя в вектор через embedding-модель
- Ищет похожие фрагменты в векторной базе данных (Qdrant, pgvector, Weaviate)
- Вставляет найденные фрагменты в контекст промпта
- Базовая модель отвечает, опираясь на предоставленные данные
Пример: интернет-магазин с 50 000 SKU подключает каталог к Llama 3.1. Покупатель спрашивает «есть водонепроницаемые кроссовки до 8 000 рублей?» RAG находит 5 подходящих товаров и подставляет карточки в промпт. Модель формирует ответ из реальных данных, не придумывает.
Как работает векторный поиск в RAG: Эмбеддинги и семантический поиск для бизнеса и Векторные базы данных: Qdrant, Weaviate и Pinecone.
Fine-tuning vs RAG: сравнительная таблица
| Параметр | Fine-tuning | RAG |
|---|---|---|
| Откуда знания | Зашиты в веса модели | Извлекаются при запросе |
| Обновление данных | Нужно переобучение ($50–5 000) | Обновление базы за минуты |
| Стоимость запуска | $50–5 000 | $0–500 |
| Инфраструктура/мес | $200–2 000 (GPU-хостинг) | $25–300 (VPS + VectorDB) |
| Риск галлюцинаций | Выше (нет источника) | Ниже (есть источник) |
| Стиль и тональность | Отлично адаптируется | Зависит от промпта |
| Актуальность данных | Устаревают со временем | Всегда свежие |
| Задержка ответа | Быстро (нет поиска) | +50–200 мс на поиск |
| Прозрачность | Нет ссылок на источники | Можно показать источник |
Когда выбирать fine-tuning: 4 критерия
Fine-tuning оправдан в четырёх ситуациях.
1. Нужен специфический стиль или формат вывода. Если модель должна генерировать юридические документы в строгом шаблоне, писать код в конкретном фреймворке с соблюдением code style или отвечать строго в тональности бренда. RAG с этим справляется хуже: стиль задаётся промптом на каждый запрос, fine-tuning вшивает его в веса модели раз и навсегда.
2. Данные статичны и меняются редко. Производственные регламенты, обновляемые раз в год. FAQ с постоянными ответами. Технические характеристики оборудования без частых апдейтов. Здесь стоимость переобучения ($50–200 за LoRA) невысока: переобучение редкое.
3. Объём данных слишком велик для контекста. RAG подставляет в промпт 5–20 фрагментов. Если для ответа нужно «понимать» паттерны из 100 000 документов сразу, а не искать конкретный, fine-tuning обрабатывает их все на этапе обучения.
4. Задержка критична. Голосовые ассистенты реального времени, где 100–200 мс на поиск недопустимы. Fine-tuned модель отвечает без этапа retrieval.
Когда выбирать RAG: 4 критерия
RAG подходит большинству бизнес-задач в 2026 году.
1. Данные часто меняются. Прайсы, остатки на складе, новости, обновлённые регламенты: при RAG достаточно обновить базу. Fine-tuning потребует нового цикла обучения за $50–5 000 каждый раз.
2. Нужна прозрачность источников. RAG показывает, откуда взяты данные (ссылка на документ, ID карточки товара, номер страницы). Это важно в медицине, юриспруденции, финансах. Fine-tuning не может объяснить, почему модель ответила именно так.
3. Данные конфиденциальны и нельзя передавать третьим сторонам. Self-hosted RAG (Qdrant + Llama 3 на своём VPS) держит данные внутри контура. Дообучение через OpenAI API требует загрузки датасета на серверы Anthropic или OpenAI. Для 152-ФЗ и конфиденциальных данных это риск.
4. Ограниченный бюджет и сжатые сроки. RAG запускается за 1–3 дня: VPS от 900 руб./мес, Qdrant бесплатно (self-hosted), Ollama бесплатно, индексация 10 000 документов около 300 руб. Fine-tuning требует минимум недели на подготовку датасета и GPU-вычисления.
Стоимость fine-tuning vs RAG в 2026
Fine-tuning через API:
- OpenAI (gpt-4o-mini): $8 за млн токенов обучения. Датасет 10 000 пар по 500 токенов = $40 за один прогон. Хостинг fine-tuned модели через inference: от $3/час.
- YandexGPT Pro Fine-tuning: от 20 000 руб. за проект (тариф по запросу, 2026).
- Open-source LoRA на A100: $1,50–3/час GPU = $15–50 за обучение 7B-модели. Хостинг: $300–800/мес при постоянной нагрузке.
RAG-инфраструктура:
- Self-hosted (VPS 4 CPU + Qdrant + Ollama Llama 3.1 8B): 900–3 000 руб./мес.
- Managed (Qdrant Cloud + YandexGPT Embeddings + YandexGPT Pro API): $25–150/мес при умеренной нагрузке до 10 000 запросов/день.
- Индексация: 0,06 руб. за 1 000 токенов (YandexGPT Embeddings); 10 000 страниц = ~300 руб. разово.
RAG обходится в 5–20 раз дешевле на старте и масштабируется без дополнительных GPU.
Типичные ошибки при выборе подхода
Большинство проектов теряют бюджет на трёх ошибках.
Ошибка 1: fine-tuning для актуальных данных. Команда тратит три недели на подготовку датасета и $400 на обучение, чтобы модель знала каталог товаров. Через месяц половина товаров обновилась, и цикл начинается заново. RAG решил бы эту задачу за два дня и 900 руб./мес.
Ошибка 2: RAG для строгого формата вывода. Юридический отдел подключил RAG к базе договоров и ожидает, что модель будет автоматически писать документы в корпоративном шаблоне. RAG даёт правильное содержание, но структура каждый раз разная. Здесь нужен fine-tuning на примерах корпоративных документов или строгий system-промпт.
Ошибка 3: гибрид с первого дня. Стартап сразу закладывает и fine-tuning, и RAG, и vector database. Итог: три месяца разработки и 0 пользователей, которые реально тестируют систему. Правильный порядок: MVP на RAG (2–3 дня) → проверка гипотезы с реальными пользователями → fine-tuning только если RAG недостаточен по качеству.
Ошибка 4: отсутствие метрик качества. Ни fine-tuning, ни RAG не дают 100% точности «из коробки». Без оценки через RAGAS (Faithfulness, Answer Relevance, Context Recall) непонятно, улучшил ли ваш апдейт датасета систему или ухудшил. Минимальный тест-сет: 50 вопросов с правильными ответами, прогон раз в неделю.
Большинство RAG-контуров в проде собирают на LangChain. Когда фреймворк оправдан, а когда лишний, разобрано здесь: LangChain для бизнеса.
Пошаговый план запуска RAG для бизнеса
Для большинства задач RAG — первый шаг. Вот схема запуска за 3–5 дней без ML-специалиста:
- День 1. Подготовка данных. Собрать документы: договоры, регламенты, FAQ, карточки товаров. Разбить на чанки по 500–800 токенов с 50-токенным перекрытием. Инструменты: LangChain TextSplitter, LlamaIndex NodeParser.
- День 2. Индексация. Выбрать embedding-модель: YandexGPT Embeddings (0,06 руб./1 000 токенов, GDPR-compliant для РФ) или OpenAI text-embedding-3-small ($0,02/млн токенов). Загрузить векторы в Qdrant self-hosted или Qdrant Cloud.
- День 3. Подключение LLM. Настроить retrieval-цепочку: запрос → embedding → топ-5 чанков из Qdrant → промпт с чанками → ответ YandexGPT Pro или GPT-4o mini. Проверить на 10–20 тестовых вопросах.
- День 4. Интеграция. Подключить к Telegram-боту, CRM или веб-чату через REST API. FastAPI или Node.js — 50 строк кода для простого эндпоинта.
- День 5. Мониторинг. Подключить логирование запросов и оценку качества. Настроить RAGAS или хотя бы ручной отбор «плохих» ответов для итерации датасета.
Если после двух недель работы системы модель стабильно ошибается в стиле или формате — тогда рассматривайте fine-tuning как следующий шаг.
Гибридный подход: RAG плюс fine-tuning вместе
Крупные проекты часто сочетают оба метода: fine-tuning адаптирует модель к стилю и предметной области, RAG добавляет актуальные данные при каждом запросе.
Пример: банк дообучает модель на регламентах клиентского обслуживания (раз в квартал), а актуальные курсы валют и остатки счётов подключает через RAG (данные обновляются каждую минуту). Ни fine-tuning в одиночку (устаревшие курсы), ни RAG в одиночку (неправильный тон ответов менеджера) не дадут нужного результата.
Гибрид оправдан, когда:
- Есть специфический домен с устойчивыми паттернами вывода (юридические документы, технические описания)
- Плюс данные, которые меняются чаще раза в квартал
- Бюджет на ИИ-инфраструктуру от 150 000 руб./мес
Если начинаете с нуля, стартуйте с RAG. Добавляйте fine-tuning только когда RAG упирается в ограничения стиля или контекста.
Внедрить RAG или fine-tuning под конкретную задачу бизнеса помогут в разработке ИИ-агентов и внедрении ИИ в бизнес на eq.team.
Можно ли запустить RAG без fine-tuning?
Да, и в большинстве проектов именно так и делают. RAG на базовой модели GPT-4o mini или YandexGPT Pro решает 80% задач, связанных с корпоративными знаниями: ответы по документации, поиск по каталогу, поддержка клиентов. Fine-tuning добавляют позже, когда базовый стиль модели не устраивает.
Сколько стоит запустить RAG с нуля?
Минимальный стек: VPS 4 CPU / 8 GB RAM (900 руб./мес) + Qdrant self-hosted (бесплатно) + Ollama с Llama 3.1 8B (бесплатно) + индексация 10 000 документов (~300 руб. разово). Итого: старт от 1 200 руб. в месяц. Managed-вариант через Qdrant Cloud + YandexGPT API: от $25/мес.
Как долго длится fine-tuning?
LoRA на 7B-модели с датасетом 5 000 пар: 4–6 часов на одной GPU A100. Full fine-tuning 13B-модели: 12–24 часа. Через OpenAI API (gpt-4o-mini): 2–4 часа с уведомлением на почту. Самое долгое: подготовка качественного датасета, 2–4 недели при ручной разметке.
Что лучше для корпоративного чат-бота на документах?
RAG. Подключаете базу знаний, обновляете документы без переобучения, получаете ссылки на источники в ответах. Fine-tuning добавляйте только если нужна специфическая терминология или строгий формат вывода, которого не достичь промптингом.
Работает ли fine-tuning с open-source моделями локально?
Да. Llama 3.1 8B через Hugging Face + PEFT-библиотека + LoRA на GPU с 16+ GB VRAM. Данные не покидают контур, полное соответствие 152-ФЗ. Стоимость: аренда сервера с A100 от $2/час, один прогон обучения $10–16. Минимальные требования: CUDA 11.8+, Python 3.10+.
