Контекстное окно

Максимальное количество токенов, которые языковая модель может видеть одновременно — её рабочая «оперативная память».

КРАТКО
Контекстное окно — это сколько токенов модель видит одновременно: системный промпт, история диалога, приложенные документы и сам запрос. Всё, что не помещается в окно, модель просто не видит. У современных моделей оно варьируется от нескольких тысяч до миллиона токенов и больше: чем окно больше, тем более сложные задачи решаются за один запрос, но тем дороже и медленнее ответ.
СИНОНИМЫ:контекстное окноокно контекстаразмер контекстаContext Window

Контекстное окно — фундаментальное ограничение работы с языковыми моделями. У модели нет долгосрочной памяти: всё, что она знает о текущем разговоре, должно лежать внутри окна.

Из чего состоит контекст

  • Системный промпт — общие инструкции и роль модели.
  • История диалога — все предыдущие сообщения, если речь о чате.
  • Дополнительные документы — выдержки из базы знаний, переданные через RAG.
  • Сам запрос пользователя.
  • В режиме генерации — постепенно добавляемый ответ модели.

Что происходит, когда контекст переполнен

  • API возвращает ошибку, и приходится сокращать ввод.
  • В чатах самые старые сообщения выпадают из памяти, и модель начинает их забывать.
  • Скорость и стоимость растут нелинейно: обработка длинного контекста заметно дороже, чем короткого.
КОГДА ПРИМЕНЯТЬ
  • Когда выбираете модель под задачу: длинный документ или длинная история диалога — это про большое окно
  • Когда проектируете чат-бота или агента: важно понимать, как и что вы будете забывать
  • Когда оцениваете стоимость продукта на больших объёмах текста
КОГДА НЕ СТОИТ
  • Простые короткие запросы — для них окно почти никогда не становится узким местом
ПРИМЕР

Юридическая команда хочет, чтобы модель проверила длинный договор и нашла противоречия с регламентом компании. Если регламент и договор вместе занимают 200 тысяч токенов, нужно либо использовать модель с большим окном, либо построить схему с RAG: разбить документы на куски, отдавать модели только подходящие фрагменты, а сводный анализ собирать в несколько шагов.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Не пытайтесь втиснуть в контекст всё подряд. Чем длиннее окно, тем дороже запрос, медленнее ответ и выше шанс, что модель потеряет что-то важное в середине. Часто лучше отбирать только подходящие куски через поиск (RAG), чем грузить весь архив.

Попробовать бесплатно

Вопросы про «Контекстное окно»

Нет, если ваше приложение явно не подаёт прошлые сообщения снова. У самой модели нет долгосрочной памяти — она помнит ровно то, что лежит в текущем контекстном окне. Сервисы вроде ChatGPT создают видимость памяти за счёт того, что хранят историю и подкладывают её к каждому запросу.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.