статья · технологии · 2026

Что такое fine-tuning: когда дообучение LLM реально нужно

· 8 минут чтения

Fine-tuning (донастройка под ваш стиль) — это дообучение уже готовой языковой модели на ваших данных, чтобы она говорила в вашем стиле и знала вашу терминологию. Нужен он не всегда: смена фактуры знаний почти всегда решается дешевле через RAG — систему, при которой ИИ перед ответом ищет нужные фрагменты в ваших документах и опирается на них, — а дообучение берут на себя, когда требуется изменить само поведение или голос модели.

Что такое fine-tuning простыми словами

Взяли большую языковую модель, обученную на миллиардах текстов, и получили сырой инструмент. Она отлично знает язык, но не имеет ни малейшего понятия о вашем бизнесе.

Дообучение (в англоязычной литературе — fine-tuning) закрывает этот разрыв. Вы берёте готовую модель и прогоняете через неё дополнительный этап обучения на своём наборе обучающих примеров (датасете). После этого модель меняет поведение: начинает отвечать в принятом у вас тоне, держит формат, использует вашу терминологию и избегает формулировок, которые вам не подходят.

Суть: fine-tuning не создаёт модель с нуля. Он корректирует параметры (числовые настройки) уже готовой сети так, чтобы она подстроилась под ваш стиль, домен и правила. Не знания «вшиваются» в параметры, а скорее манера и поведение.

Как проходит дообучение

Процесс в грубом виде состоит из трёх шагов: готовите примеры, настраиваете модель на них, проверяете результат на отложенных данных.

  1. Подготовка пар «вопрос — эталонный ответ». Собираете несколько сотен или тысяч примеров, где на запрос дан именно такой ответ, какой вы хотите видеть. Это может быть история переписок вашей поддержки, разобранная вручную, или синтетика, которую вы же и правите.
  2. Обучение. Модель прогоняется по набору примеров несколькими эпохами (проходами по всем данным). Параметры корректируются так, чтобы предсказывать ваши эталонные ответы как можно точнее.
  3. Оценка. На части примеров, которых модель ещё не видела, проверяете, что она реально усвоила: не переобучилась ли, не потеряла ли общие знания, держит ли тон.

Чаще всего сегодня используют подход LoRA (донастройка лишь части модели) — вместо всех параметров настраивают лишь небольшую добавочную матрицу. Выигрыш ощутимый: объём хранения и стоимость обучения падают на порядки, а качество для типовых задач почти не страдает.

Различают два уровня. Полное дообучение (full fine-tuning) — перенастраиваются все параметры, дорого, требует серьёзных видеокарт (GPU). Дообучение на инструкциях (instruction tuning) — по парам «запрос — правильный ответ», самый ходовой вариант. Есть ещё RLHF, где модель обучают по отзывам людей, но это удел очень крупных команд.

Чем отличается от RAG

Эти два подхода часто путают, потому что оба отвечают на вопрос «как научить модель вашим данным». Но работают они на разных уровнях и решают разные задачи.

RAG не трогает модель. Перед ответом он ищет релевантные фрагменты в вашей базе знаний и подставляет их в запрос как контекст. Знание живёт в базе, а не в параметрах.

Fine-tuning меняет саму модель. Знание и поведение — условно говоря, статика, зашитая в настройки модели.

СвойствоRAGFine-tuning
Что меняетсяконтекст запросанастройки модели
Обновить знаниязагрузить документыпереобучать заново
Свежесть данныхактуально в моментезастывает на дате обучения
Стоимость запусканизкаязаметная
Стиль и тонне влияетвлияет напрямую

Из таблицы видно главное: если вам нужно, чтобы агент отвечал по свежим документам — это RAG. Если нужно, чтобы он звучал как ваш оператор и строго держал формат — это fine-tuning.

Когда дообучение действительно нужно

Есть ряд сценариев, где fine-tuning оказывается не капризом, а оправданным решением.

  • Узкий домен и особая терминология. Медицина, юриспруденция, редкие технические стандарты — модель на дообученных данных реже выдумывает и лучше понимает контекст отрасли.
  • Строгий стиль и формат. Нужно, чтобы JSON выходил без мусора, ответ укладывался в сущность, тон совпадал с брендом. Дообучение задаёт это надёжнее, чем длинная инструкция (промпт).
  • Закрытый контур. Когда данные сентитивные и вы не хотите гонять их через внешние инструкции каждый запрос, а хотите, чтобы модель уже всё усвоила, — дообучение подходит.
  • Снижение объёма текста (токенов) и задержек. Поведение уже в модели, инструкцию можно сократить, ответ приходит быстрее и дешевле в проде.

Общая закономерность такая: модель должна измениться, а не узнать новое. Если поправки касаются поведения, голоса и формата — вот его зона.

Когда fine-tuning не нужен

Для большинства бизнес-агентов первичен RAG, и к нему стоит присмотреться до того, как браться за дообучение.

Меняются документы, регламенты, прайсы? Значит, знания устареют через неделю. Каждое обновление означало бы новый цикл обучения — а это дорого и медленно. Иллюстративный пример: представьте, что у вас условный онлайн-магазин с прайсом на пять тысяч позиций и новыми поступлениями каждую неделю. RAG подхватит новый прайс за час — переобучение под каждый прайс невозможно в принципе.

Если же задача — просто «отвечать по нашим документам», а не менять тон, fine-tuning почти не даст эффекта. Модель и так умеет следовать контексту из инструкции.

Простое правило: новое знание — к RAG, новое поведение — к fine-tuning. Начинайте с RAG: он дешевле, свежее и быстрее внедряется, а дообучение добавляется точечно там, где его без замены.

Данные и ресурсы для запуска

Главное, что нужно для дообучения, — не деньги и не железо, а данные. Без качественного набора обучающих примеров (датасета) всё остальное бесполезно.

  • Датасет от нескольких сотен до тысяч пар. Чем меньше модель и чем уже задача, тем меньше примеров. Десятки тысяч уже избыточны для типовых задач.
  • Разметка и чистка. Примеры согласованы по стилю и формату — плохие модель выучит так же охотно, как хорошие.
  • Вычислительные ресурсы. Для LoRA на модели в несколько миллиардов настроек хватает одной приличной видеокарты (GPU). Полное переобучение требует кластера, это уже промышленный масштаб.
  • Оценочный набор. Отдельный кусок данных, который модель не видела в обучении, чтобы честно проверить результат.

По рынку типичные бюджеты таких проектов заметно выше, чем у RAG-внедрения, но точную цену под ваш случай посчитают под задачу. Сама подготовка данных обычно занимает больше времени, чем обучение.

Типичные риски

  • Переобучение. Модель зазубривает обучающие примеры и теряет обобщение. Лечится больше данных и меньшим числом эпох.
  • Катастрофическое забывание. Подстраиваясь под ваш домен, модель забывает часть общих знаний — это проверяется на контрольных вопросах из других тем.
  • Галлюцинации от плохих данных. Если в датасете есть неверные ответы, модель их выучит и станет выдавать уверенно. Данные — это фундамент.
  • Скрытая цена поддержки. Выходит новая версия базовой модели — возникает вопрос, переобучаться ли снова. Это расходы и время, которые стоит закладывать заранее.

Большинство из них закрывается оценочным набором, аккуратной разметкой и маленькими шагами по эпохам.

Для большинства бизнес-агентов старт — это RAG, а fine-tuning подключается точечно, когда становится видно, чего агенту не хватает.

Спроектируем агента под ключ: хватает RAG — так и сделаем, нужен fine-tuning — добавим

Разберём ваши данные, решим — хватает ли RAG, и добавим дообучение только там, где оно действительно даёт эффект.

Рассчитать стоимостьПопробовать демо

Бриф — 30 минут. Прототип — 7 дней.