Контекстное окно — фундаментальное ограничение работы с языковыми моделями. У модели нет долгосрочной памяти: всё, что она знает о текущем разговоре, должно лежать внутри окна.
Из чего состоит контекст
- Системный промпт — общие инструкции и роль модели.
- История диалога — все предыдущие сообщения, если речь о чате.
- Дополнительные документы — выдержки из базы знаний, переданные через RAG.
- Сам запрос пользователя.
- В режиме генерации — постепенно добавляемый ответ модели.
Что происходит, когда контекст переполнен
- API возвращает ошибку, и приходится сокращать ввод.
- В чатах самые старые сообщения выпадают из памяти, и модель начинает их забывать.
- Скорость и стоимость растут нелинейно: обработка длинного контекста заметно дороже, чем короткого.
- Когда выбираете модель под задачу: длинный документ или длинная история диалога — это про большое окно
- Когда проектируете чат-бота или агента: важно понимать, как и что вы будете забывать
- Когда оцениваете стоимость продукта на больших объёмах текста
- Простые короткие запросы — для них окно почти никогда не становится узким местом
Юридическая команда хочет, чтобы модель проверила длинный договор и нашла противоречия с регламентом компании. Если регламент и договор вместе занимают 200 тысяч токенов, нужно либо использовать модель с большим окном, либо построить схему с RAG: разбить документы на куски, отдавать модели только подходящие фрагменты, а сводный анализ собирать в несколько шагов.
Не пытайтесь втиснуть в контекст всё подряд. Чем длиннее окно, тем дороже запрос, медленнее ответ и выше шанс, что модель потеряет что-то важное в середине. Часто лучше отбирать только подходящие куски через поиск (RAG), чем грузить весь архив.