База знаний
Какие источники знаний понимает агент, как документы индексируются и как писать их так, чтобы ответы были точными.
База знаний — это документы, по которым агент отвечает на вопросы клиентов: условия доставки и возврата, регламенты, инструкции, описания услуг, FAQ. Всё, что вы сюда загрузите, агент сможет найти и использовать в ответе — со ссылкой на источник, если вы это включите.
Раздел «База знаний» находится в кабинете app.llmagent.ru. База привязана к агенту: у каждого агента — свой набор документов.
Как это работает
Заголовок раздела «Как это работает»При загрузке документ разбивается на фрагменты примерно по 500 знаков — по границам абзацев и предложений, с небольшим перекрытием между соседними фрагментами, чтобы мысль не обрывалась на стыке. Для каждого фрагмента строится векторное представление смысла, поэтому поиск находит текст по значению, а не по точному совпадению слов: вопрос «сколько ждать курьера» найдёт абзац про «сроки доставки».
Когда клиент пишет агенту, отдельная быстрая модель анализирует диалог, формулирует один поисковый запрос (подставляя контекст вместо местоимений — «а сколько это стоит?» превращается в запрос о конкретной услуге) и оценивает, нужен ли поиск по базе знаний. Если нужен — из базы отбираются лучшие фрагменты, они группируются максимум по 5 документам, и все найденные фрагменты этих документов в порядке чтения передаются основной модели вместе с историей диалога. Подробно весь путь сообщения описан в статье «Как агент готовит ответ».
В чатах сотрудников (внутренняя аудитория) агент дополнительно обязан заглянуть в базу знаний на первом шаге ответа, если база не пуста, — чтобы не отвечать «из головы» на процедурные вопросы.
Источник под ответом
Заголовок раздела «Источник под ответом»В «Настройки» есть параметр «Показывать источники ответов»: «Никому» (по умолчанию), «Сотрудникам» или «Всем». Когда источники включены, под ответом агента появляется ссылка «Источник» — она открывает страницу просмотра документа, где подсвечены фрагменты, использованные в ответе. Работает это в чате кабинета и в Битрикс24 (ссылка приходит отдельным сообщением после ответа); в Telegram и MAX ссылка «Источник» не отправляется.
Источники знаний
Заголовок раздела «Источники знаний»Добавить материалы можно пятью способами — кнопка «Добавить» в разделе «База знаний».
Форматы: PDF, DOCX, XLSX, TXT, MD. Можно загрузить несколько файлов сразу. Из файла извлекается текст: у DOCX сохраняются заголовки и таблицы (построчно), у XLSX каждая строка листа превращается в строку текста, листы идут друг за другом с названиями.
Название (до 120 знаков) и сам текст — самый быстрый способ завести короткий регламент или скрипт. Редактировать в кабинете можно любой документ (карандаш на карточке): открывается извлечённый текст, а после сохранения документ хранится как «Текст».
Агент скачает страницу по ссылке и сохранит её текст (включая ссылки со страницы; изображения отбрасываются). На загрузку страницы даётся 15 секунд — тяжёлые или закрытые от роботов страницы могут не загрузиться. Копия статична: если страница на сайте изменится, документ нужно удалить и добавить заново.
Если ссылка похожа на товарный фид (XML/YML), кабинет предложит завести её в раздел «Каталог товаров» — для прайсов и выгрузок он подходит лучше, см. «Каталог товаров».
Google Документы, Таблицы и Презентации
Заголовок раздела «Google Документы, Таблицы и Презентации»Вставьте ссылку на документ Google. Поддерживаются Таблицы, Документы и Презентации. Если документ приватный, добавьте в читатели сервисный адрес, который показан в окне добавления, — либо откройте доступ по ссылке.
Каждый лист таблицы и каждый слайд презентации становятся отдельным документом базы; вместе они образуют группу с общим названием — группу можно удалить одним действием. Копия статична: изменения в Google-документе сами в базу не попадают, обновление — удалить группу и добавить документ заново.
Битрикс24
Заголовок раздела «Битрикс24»Кнопка «Битрикс24» видна, если вы работаете в кабинете через портал Битрикс24. Поддержаны обе версии базы знаний портала:
- База знаний 1.0 — выберите базы, и каждая их страница станет документом. В начало документа записывается ссылка на страницу, название базы и название страницы, поэтому агент может дать клиенту ссылку на первоисточник на портале. Синхронизация идёт в фоне; повторная синхронизация полностью заменяет прежнюю копию базы.
- База знаний 2.0 — подключается входящим вебхуком с вашего портала. Вебхук должен иметь только право «note»: вебхук с лишними правами будет отклонён, адрес хранится в замаскированном виде. После подключения выберите базы для синхронизации; документы приходят в исходной разметке.
- Перенос 1.0 → 2.0 — кабинет умеет перенести базу 1.0 в Базу знаний 2.0: на портале создаётся коллекция «v1.0_{название}» с документом на каждую страницу. Перенесённая база дальше индексируется только как 2.0 — дублей в базе агента не будет.
Память базы знаний общая на подписку и делится между всеми вашими агентами. Объём зависит от тарифа: «Тест» — 20 МБ, «Базовый» — 200 МБ, «Расширенный» — 2 ГБ (см. «Тарифы и оплата»). Индикатор заполненности показан в шапке раздела «База знаний».
Есть и лимит на один документ — он одинаков для всех тарифов и с запасом вмещает даже очень большие руководства: примерно 4 млн знаков, порядка двух тысяч страниц текста. Упереться в него можно практически только выгрузкой каталога или прайс-листом — такие данные загружайте в «Каталог товаров»: он хранится отдельно и память базы знаний не расходует.
Оба лимита проверяются до индексации: документ, который не помещается, отклоняется сразу с сообщением о причине и места не занимает. Если база заполнена — удалите часть документов или перейдите на тариф с большей памятью.
Как писать документы, чтобы агент отвечал лучше
Заголовок раздела «Как писать документы, чтобы агент отвечал лучше»Советы следуют из механики поиска: агент видит не документ целиком, а найденные фрагменты по ~500 знаков.
- Один вопрос — один связный абзац. Формулировка вопроса и ответ должны попадать в один фрагмент. Если условие («для юрлиц») стоит в начале страницы, а цифры — тремя экранами ниже, фрагмент с цифрами найдётся без условия.
- Пишите словами клиентов. Поиск ищет по смыслу и прощает синонимы, но заголовок «Логистика отгрузок ТМЦ» проиграет заголовку «Доставка: сроки и стоимость». Полезно продублировать частые формулировки вопросов — формат FAQ («Вопрос — Ответ») индексируется идеально.
- Несколько тематических документов лучше одного «обо всём». В ответ попадает до 5 документов, ранжированных по лучшему фрагменту; компактный точный документ легко выигрывает у гигантского.
- В таблицах делайте строки самодостаточными. Таблицы превращаются в текст построчно, и фрагмент из середины листа не увидит шапку. Строка «Казань — 3 дня — 500 ₽» бесполезна, если слово «доставка» есть только в названии листа; лучше «Доставка в Казань: 3 дня, 500 ₽».
- Не держите противоречивых версий. Старый и новый регламенты найдутся оба — обновляя документ, удаляйте прежний.
Если агент не находит ответ
Заголовок раздела «Если агент не находит ответ»- Проверьте, что текст вообще есть в базе. Строка поиска в разделе «База знаний» ищет по содержимому документов и показывает сниппеты. Нет в поиске — нет и у агента.
- Посмотрите на документ глазами агента. Кнопка превью на карточке документа показывает текст по фрагментам — так, как его видит поиск. PDF-скан даст пустое превью, кривая таблица — «кашу».
- Переформулируйте. Добавьте короткий текст-FAQ с формулировкой вопроса клиента и ответом — это самый быстрый способ закрыть конкретный пробел.
- Очистите кеш диалогов после большого обновления базы. Агент учитывает историю переписки и может ссылаться на свои старые ответы. Действие «Очистить кеш диалогов» (меню «⋯» в разделе) сбрасывает историю у всех собеседников — агент начнёт отвечать только по актуальной базе. Действие необратимо: собеседники теряют контекст переписки.
- Помните про порог поиска. Поиск запускается, когда модель-аналитик считает вопрос содержательным; на приветствия и болтовню база знаний не дёргается — это нормально.