RAG (поиск с дополнением генерации)

Подход, при котором перед ответом языковая модель ищет подходящие документы в базе знаний и использует их как контекст.

КРАТКО
RAG — это связка «поиск + LLM». Перед тем как ответить, система ищет в вашей базе документов куски, относящиеся к вопросу, подаёт их модели вместе с запросом, и только тогда модель отвечает. Так удаётся подружить общий «здравый смысл» большой модели с конкретными фактами компании: продуктовая документация, регламенты, история переписки, договоры. Это самый частый способ построить ИИ-ассистента поверх собственных знаний.
СИНОНИМЫ:RAGпоиск с дополнением генерациигенерация с опорой на поискretrieval-augmented generation

Без RAG большая языковая модель ограничена своими знаниями на момент обучения и склонна выдумывать факты. С RAG она перестаёт пытаться запомнить мир и работает как «языковой процессор» для документов, которые ей подкладывают.

Как устроен RAG

  1. Документы заранее разбиваются на куски (chunks) и переводятся в эмбеддинги — векторные представления.
  2. Векторы хранятся в векторной базе данных с индексом для быстрого поиска по близости.
  3. На запрос пользователя строится его эмбеддинг.
  4. Из базы достаются несколько самых близких кусков.
  5. Эти куски вместе с вопросом отправляются в модель в виде контекста.
  6. Модель отвечает, опираясь на переданные документы.

Где сложнее всего

  • Качество разбивки документов на куски.
  • Качество эмбеддингов и поискового индекса.
  • Правильное оформление контекста в промпте: ссылки на источники, защита от противоречий.
  • Разбор случаев, когда поиск не нашёл нужный документ и модель выдумала ответ.
КОГДА ПРИМЕНЯТЬ
  • Нужен помощник по вашим документам: продуктовая документация, регламенты, поддержка
  • Информация меняется, и её нельзя «зашить» в модель
  • Важна возможность сослаться на источник ответа
КОГДА НЕ СТОИТ
  • Задача чисто стилистическая или творческая и не требует фактических знаний
  • База знаний помещается в обычное контекстное окно и можно подать её целиком
  • Документы очень разнородные и плохо структурированы — сначала стоит навести порядок в источниках
ПРИМЕР

В банке внедряют RAG поверх внутренних регламентов и обучающих материалов. Сотрудник в чате спрашивает: «какой лимит на снятие наличных по карте премиум-уровня?». Система находит в базе пару нужных пунктов регламента, подаёт их модели, и она отвечает: «Согласно регламенту X (раздел 4.2), лимит составляет ... рублей в сутки; для лимита в месяц см. раздел 4.3». При этом в ответе видны конкретные ссылки на разделы — сотрудник может перепроверить.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Не пытайтесь сделать «идеальный RAG» с первой попытки. Начните с простой версии: разбивка по абзацам, базовая модель эмбеддингов, открытая векторная база. Соберите 30–100 реальных запросов с эталонными ответами, измерьте долю случаев, когда нужный документ попадает в верх результатов поиска. И уже на этих метриках улучшайте каждый компонент отдельно.

Попробовать бесплатно

Вопросы про «RAG (поиск с дополнением генерации)»

Факты в базе можно менять прямо сейчас, без переобучения модели. К тому же RAG позволяет показать пользователю источник ответа, что важно в задачах поддержки, юридических, медицинских. Тонкая настройка лучше подходит для стиля и поведения, а не для фактических знаний.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.