Подготовка базы знаний для RAG: с чего начать
Подготовка базы знаний для RAG — это превращение документов компании в аккуратный источник фактов, по которому ИИ находит ответ раньше, чем его сформулирует: нужные файлы собираются, текст нарезается на фрагменты, устаревшее убирается, к каждому куску привязываются метки. Половина качества ответов решается именно здесь, а не настройкой модели.
Какие документы нужны для базы знаний
RAG (система, при которой ИИ перед ответом находит нужные фрагменты в ваших документах и опирается на них; проще говоря, ИИ отвечает по вашей базе знаний, а не по памяти) работает только на том, что вы в него загрузили. Поэтому первый шаг — решить, что вообще класть внутрь.
Правило простое: берите то, о чём люди реально спрашивают. Прайсы и условия — товары, цены, доставка, возврат. Инструкции и регламенты — как устроен процесс. Ответы на частые вопросы — что уже сто раз объяснялось в переписке. Каталог продукции или услуг — если ассистент должен знать ассортимент.
- Прайсы и условия. Цены, скидки, сроки, правила доставки и возврата.
- Инструкции и регламенты. Как проходит процесс, что можно, что нельзя.
- Частые вопросы. Готовые ответы из сообщений и тикетов — главный источник реалистичных формулировок.
- Каталог. Товары, услуги, состав, характеристики.
Не тащите всё подряд. Лишний документ не помогает, он шумит. Начните с узкого набора, который закрывает основные вопросы, и добавляйте по мере необходимости. Возьмём условный интернет-магазин: хватает четырёх файлов — прайса, правил доставки и возврата, карточек товаров и готовых ответов на частые вопросы. Этого достаточно для большинства обращений.
Как нарезать текст на фрагменты
В базе знаний текст живёт не сплошным полотном, а кусками. По ним идёт поиск: на запрос система вытаскивает несколько фрагментов и отдаёт модели. От того, как нарезаны фрагменты (куски документа, «чанки»), напрямую зависит качество ответа.
Крупный кусок размывает смысл, и ответ уходит в сторону. Мелкий теряет контекст, и модели не хватает деталей. Единого золотого размера не существует, он зависит от типа документов, но правило простое: резать по смыслу, а не по числу символов.
- По структуре. Документ делится по заголовкам, разделам и абзацам, а не «через N символов».
- С запасом контекста. Конец куска захватывает хвост предыдущего, чтобы не терять мысль.
- Границы не рвут. Один раздел — одна единица, а не разрезанная надвое страница.
Скажем, регламент на десять страниц режется по разделам «Оформление заказа», «Возврат», «Гарантия». У каждого раздела есть начало, середина и конец мысли, и он ищется точнее, чем сплошной блок или, наоборот, абзацы по три строки.
Чистота: убрать мусор и противоречия
ИИ не отличает важное от мусора в загруженном файле. Если внутри копипасты, повторов, старой шапки или пустых разделов, поиск спотыкается. Чистка — это не косметика, а точность.
Сначала соберите дубликаты. Один прайс в трёх папках, «финальная версия» и «финальная версия 2» — оставляем один источник истины. Потом уберите служебное: меню, подписи, повторяющиеся колонтитулы, заметки. Наконец, разрулите противоречия. Старый регламент говорит одно, новый другое, оба в базе — и ответ может опереться на любой. Приводим к одному актуальному варианту.
Эту работу часто недооценивают, а именно она сильнее всего двигает качество. Чистая база отвечает точнее, даже если нарезка не идеальна.
Актуальность: база устаревает
База знаний живёт своей жизнью. Цены меняются, регламенты переписываются, товары снимаются с продажи. Загруженный однажды документ остаётся в базе, и ИИ честно повторит его, даже если информация устарела.
Поэтому актуальность это не разовая работа, а часть системы. У каждого документа есть дата и владелец — человек, который отвечает за его верность. Изменение прайса означает замену файла, а не добавление нового рядом со старым. Иначе через полгода в базе окажется две версии правды, и модель не разберётся, какая важнее.
Устаревшая выдача опаснее отсутствия ответа: ассистент говорит уверенно и при этом неверно. Свежая база — половина доверия к системе.
Метки и метаданные: зачем они нужны
Чтобы ассистент не только нашёл ответ, но и сказал, откуда он, каждому фрагменту нужны метки и метаданные. Это служебная информация о куске: название документа, раздел, дата, тип, отдел.
- Источник. Название документа и ссылка, чтобы ИИ мог указать его, а человек проверить.
- Тип. Прайс, регламент, ответ на вопрос. Тип позволяет фильтровать поиск.
- Дата и версия. Чтобы отсекать устаревшее и показывать, на чём основан ответ.
- Область. Отдел или категория, ограничивающая выдачу.
Польза видна на практике. На вопрос клиента ассистент отвечает и добавляет «по прайсу от 1 октября». Пользователь понимает, чему верить, и открывает источник. Без меток ответ превращается в непроверяемое утверждение.
Чек-лист перед запуском
Перед запуском пройдитесь по списку. Если по каждому пункту получается галочка, база готова.
- Собрали вопросы. Записали реальные обращения клиентов и выбрали, на какие отвечает ассистент.
- Отобрали документы. В базе только то, что закрывает эти вопросы, без лишнего.
- Нарезали по смыслу. Фрагменты идут по разделам, с контекстом, без разорванных мыслей.
- Почистили. Убраны дубликаты, служебное и противоречия, остался один источник истины.
- Разметили. Каждому куску присвоены источник, тип и дата.
- Назначили владельца. Понятно, кто и как обновляет документы.
- Протестировали. Прогнали реальные вопросы и проверили, что ответы точны и со ссылками.
На подготовку узкого набора обычно хватает нескольких дней, на проверку вопросами — пары часов. Это мало по сравнению с месяцами переделок кривой базы.
Частые ошибки при подготовке
Большинство проблем с RAG — не в модели, а в базе. Перечислим то, что встречается чаще всего.
- Загружать всё подряд. «Вся база компании» звучит полезно, но мусор шумит и роняет точность.
- Резать по символам. Ровные куски на пятьсот знаков рвут мысль посреди предложения.
- Не обновлять. Загрузили один раз и забыли — база устаревает, ответы врут.
- Без меток. Нет источников, ответ нельзя проверить, доверие падает.
- Тестировать на «красивых» вопросах. Идеальные формулировки не показывают, как ассистент ответит на реальные корявые запросы. Гоняйте именно их.
Если база аккуратная, свежая и размеченная, дальше остаётся настройка поисковика, а не переделка данных. Это уверенный фундамент для ассистента, который отвечает по вашим документам.
Наведём порядок в базе знаний под ключ
Соберём и подготовим ваши документы для RAG-системы: отбор, чистка, разметка и настройка выдачи.
Рассчитать стоимостьПопробовать демоБриф — 30 минут. Прототип — 7 дней.