RLHF в современном виде популяризовали OpenAI и Anthropic. Подход состоит из нескольких шагов.
Шаги RLHF
- Предобученная модель учится следовать инструкциям на хорошем размеченном наборе.
- Люди сравнивают пары ответов модели на один и тот же запрос и выбирают лучший.
- На этих сравнениях обучается модель вознаграждения, которая предсказывает, насколько такой ответ понравится людям.
- Основная модель обновляется через обучение с подкреплением, максимизируя предсказанное вознаграждение.
Что даёт RLHF
- Модель лучше следует инструкциям и формату.
- Реже выдаёт грубые, опасные или явно бессмысленные ответы.
- Учитывает стилистические предпочтения людей: краткость, вежливость, объяснения.
Ограничения
- Модель вознаграждения может переучиться под предпочтения конкретной группы разметчиков, и это превращается в скрытое смещение.
- Модель учится казаться правильной, а не быть таковой: можно получить уверенный, но фактически неверный ответ.
- Строите собственного ассистента, в котором важны стиль и безопасность
- Готовы выделить ресурсы на разметку и поддерживать её во времени
- Работа с промптами и обычная тонкая настройка уже исчерпали себя
- Маленький проект на 1–2 человек — это слишком тяжёлая артиллерия
- Нет инфраструктуры для разметки и контроля качества разметчиков
Команда улучшает специализированный медицинский чат-бот. После тонкой настройки на медицинских инструкциях ответы стали точнее, но иногда модель уходит в излишнюю самоуверенность или, наоборот, отказывается отвечать на безобидные вопросы. Разметчики-медики сравнивают пары ответов и отмечают, какой звучит более полезно и безопасно. После раунда RLHF модель чаще задаёт уточняющие вопросы, аккуратнее обращается с фактами и реже навязывает диагноз.
Качество RLHF почти полностью определяется качеством разметки. Если разметчики устают, торопятся или плохо понимают предметную область, модель быстро запомнит их ошибки и предпочтения. Поэтому больше всего внимания уходит не на алгоритмы, а на инструкции, обучение и контроль работы разметчиков.