Перейти к содержимому
llmagentLLM-Агент Документация

База знаний

Какие источники знаний понимает агент, как документы индексируются и как писать их так, чтобы ответы были точными.

База знаний — это документы, по которым агент отвечает на вопросы клиентов: условия доставки и возврата, регламенты, инструкции, описания услуг, FAQ. Всё, что вы сюда загрузите, агент сможет найти и использовать в ответе — со ссылкой на источник, если вы это включите.

Раздел «База знаний» находится в кабинете app.llmagent.ru. База привязана к агенту: у каждого агента — свой набор документов.

При загрузке документ разбивается на фрагменты примерно по 500 знаков — по границам абзацев и предложений, с небольшим перекрытием между соседними фрагментами, чтобы мысль не обрывалась на стыке. Для каждого фрагмента строится векторное представление смысла, поэтому поиск находит текст по значению, а не по точному совпадению слов: вопрос «сколько ждать курьера» найдёт абзац про «сроки доставки».

Когда клиент пишет агенту, отдельная быстрая модель анализирует диалог, формулирует один поисковый запрос (подставляя контекст вместо местоимений — «а сколько это стоит?» превращается в запрос о конкретной услуге) и оценивает, нужен ли поиск по базе знаний. Если нужен — из базы отбираются лучшие фрагменты, они группируются максимум по 5 документам, и все найденные фрагменты этих документов в порядке чтения передаются основной модели вместе с историей диалога. Подробно весь путь сообщения описан в статье «Как агент готовит ответ».

В чатах сотрудников (внутренняя аудитория) агент дополнительно обязан заглянуть в базу знаний на первом шаге ответа, если база не пуста, — чтобы не отвечать «из головы» на процедурные вопросы.

В «Настройки» есть параметр «Показывать источники ответов»: «Никому» (по умолчанию), «Сотрудникам» или «Всем». Когда источники включены, под ответом агента появляется ссылка «Источник» — она открывает страницу просмотра документа, где подсвечены фрагменты, использованные в ответе. Работает это в чате кабинета и в Битрикс24 (ссылка приходит отдельным сообщением после ответа); в Telegram и MAX ссылка «Источник» не отправляется.

Добавить материалы можно пятью способами — кнопка «Добавить» в разделе «База знаний».

Форматы: PDF, DOCX, XLSX, TXT, MD. Можно загрузить несколько файлов сразу. Из файла извлекается текст: у DOCX сохраняются заголовки и таблицы (построчно), у XLSX каждая строка листа превращается в строку текста, листы идут друг за другом с названиями.

Название (до 120 знаков) и сам текст — самый быстрый способ завести короткий регламент или скрипт. Редактировать в кабинете можно любой документ (карандаш на карточке): открывается извлечённый текст, а после сохранения документ хранится как «Текст».

Агент скачает страницу по ссылке и сохранит её текст (включая ссылки со страницы; изображения отбрасываются). На загрузку страницы даётся 15 секунд — тяжёлые или закрытые от роботов страницы могут не загрузиться. Копия статична: если страница на сайте изменится, документ нужно удалить и добавить заново.

Если ссылка похожа на товарный фид (XML/YML), кабинет предложит завести её в раздел «Каталог товаров» — для прайсов и выгрузок он подходит лучше, см. «Каталог товаров».

Вставьте ссылку на документ Google. Поддерживаются Таблицы, Документы и Презентации. Если документ приватный, добавьте в читатели сервисный адрес, который показан в окне добавления, — либо откройте доступ по ссылке.

Каждый лист таблицы и каждый слайд презентации становятся отдельным документом базы; вместе они образуют группу с общим названием — группу можно удалить одним действием. Копия статична: изменения в Google-документе сами в базу не попадают, обновление — удалить группу и добавить документ заново.

Кнопка «Битрикс24» видна, если вы работаете в кабинете через портал Битрикс24. Поддержаны обе версии базы знаний портала:

  • База знаний 1.0 — выберите базы, и каждая их страница станет документом. В начало документа записывается ссылка на страницу, название базы и название страницы, поэтому агент может дать клиенту ссылку на первоисточник на портале. Синхронизация идёт в фоне; повторная синхронизация полностью заменяет прежнюю копию базы.
  • База знаний 2.0 — подключается входящим вебхуком с вашего портала. Вебхук должен иметь только право «note»: вебхук с лишними правами будет отклонён, адрес хранится в замаскированном виде. После подключения выберите базы для синхронизации; документы приходят в исходной разметке.
  • Перенос 1.0 → 2.0 — кабинет умеет перенести базу 1.0 в Базу знаний 2.0: на портале создаётся коллекция «v1.0_{название}» с документом на каждую страницу. Перенесённая база дальше индексируется только как 2.0 — дублей в базе агента не будет.

Память базы знаний общая на подписку и делится между всеми вашими агентами. Объём зависит от тарифа: «Тест» — 20 МБ, «Базовый» — 200 МБ, «Расширенный» — 2 ГБ (см. «Тарифы и оплата»). Индикатор заполненности показан в шапке раздела «База знаний».

Есть и лимит на один документ — он одинаков для всех тарифов и с запасом вмещает даже очень большие руководства: примерно 4 млн знаков, порядка двух тысяч страниц текста. Упереться в него можно практически только выгрузкой каталога или прайс-листом — такие данные загружайте в «Каталог товаров»: он хранится отдельно и память базы знаний не расходует.

Оба лимита проверяются до индексации: документ, который не помещается, отклоняется сразу с сообщением о причине и места не занимает. Если база заполнена — удалите часть документов или перейдите на тариф с большей памятью.

Как писать документы, чтобы агент отвечал лучше

Заголовок раздела «Как писать документы, чтобы агент отвечал лучше»

Советы следуют из механики поиска: агент видит не документ целиком, а найденные фрагменты по ~500 знаков.

  • Один вопрос — один связный абзац. Формулировка вопроса и ответ должны попадать в один фрагмент. Если условие («для юрлиц») стоит в начале страницы, а цифры — тремя экранами ниже, фрагмент с цифрами найдётся без условия.
  • Пишите словами клиентов. Поиск ищет по смыслу и прощает синонимы, но заголовок «Логистика отгрузок ТМЦ» проиграет заголовку «Доставка: сроки и стоимость». Полезно продублировать частые формулировки вопросов — формат FAQ («Вопрос — Ответ») индексируется идеально.
  • Несколько тематических документов лучше одного «обо всём». В ответ попадает до 5 документов, ранжированных по лучшему фрагменту; компактный точный документ легко выигрывает у гигантского.
  • В таблицах делайте строки самодостаточными. Таблицы превращаются в текст построчно, и фрагмент из середины листа не увидит шапку. Строка «Казань — 3 дня — 500 ₽» бесполезна, если слово «доставка» есть только в названии листа; лучше «Доставка в Казань: 3 дня, 500 ₽».
  • Не держите противоречивых версий. Старый и новый регламенты найдутся оба — обновляя документ, удаляйте прежний.
  1. Проверьте, что текст вообще есть в базе. Строка поиска в разделе «База знаний» ищет по содержимому документов и показывает сниппеты. Нет в поиске — нет и у агента.
  2. Посмотрите на документ глазами агента. Кнопка превью на карточке документа показывает текст по фрагментам — так, как его видит поиск. PDF-скан даст пустое превью, кривая таблица — «кашу».
  3. Переформулируйте. Добавьте короткий текст-FAQ с формулировкой вопроса клиента и ответом — это самый быстрый способ закрыть конкретный пробел.
  4. Очистите кеш диалогов после большого обновления базы. Агент учитывает историю переписки и может ссылаться на свои старые ответы. Действие «Очистить кеш диалогов» (меню «⋯» в разделе) сбрасывает историю у всех собеседников — агент начнёт отвечать только по актуальной базе. Действие необратимо: собеседники теряют контекст переписки.
  5. Помните про порог поиска. Поиск запускается, когда модель-аналитик считает вопрос содержательным; на приветствия и болтовню база знаний не дёргается — это нормально.