Температура — один из главных параметров генерации в языковых моделях. Технически она масштабирует «решительность» модели в выборе следующего токена.
Как выбирать температуру
- 0,0–0,3 — точные задачи: классификация, извлечение данных, ответы в формате JSON, генерация кода.
- 0,3–0,7 — содержательные ответы на вопросы, поддержка клиентов, аналитика.
- 0,7–1,2 — творческие задачи: тексты для маркетинга, идеи, генерация вариантов.
- выше 1,2 — для экспериментов и нестандартных задач; обычные приложения здесь редко работают.
Что важно
- Низкая температура не делает ответ «верным», только более стабильным. Если модель часто ошибается на этом запросе, при температуре 0 она будет ошибаться одинаково.
- Температура связана с другими параметрами генерации — top-p и top-k; обычно меняют что-то одно.
- Когда настраиваете сервис на языковой модели для боевой среды
- Когда замечаете нестабильность ответов в одинаковых сценариях
- Когда задача требует разнообразных вариантов (например, генерация заголовков)
- Не нужно для каждого запроса вручную крутить температуру в коде — обычно её задают на уровне продукта или роли модели
В одном и том же приложении могут жить два режима: для классификации заявок поддержки — температура 0,1, чтобы одно и то же обращение всегда попадало в одну категорию; для «помоги придумать варианты ответа клиенту» — температура 0,7, чтобы каждый раз получать несколько разных формулировок.
При отладке ответов сначала зафиксируйте температуру на 0 или 0,1: вы сразу увидите, насколько проблема воспроизводима. Когда поведение стабилизировалось, аккуратно поднимайте температуру и смотрите, при каком значении начинает сыпаться качество. Это и будет ваш рабочий диапазон.