Искусственный интеллектLLMОбучение моделейБезопасность ИИ

Обучение с подкреплением на обратной связи человека (RLHF)

Метод, в котором модель улучшают, используя оценки людей: они сравнивают разные ответы и направляют обучение в сторону предпочтительных.

КРАТКО
Обучение с подкреплением на обратной связи человека (RLHF) — это способ научить большую языковую модель отвечать так, как ожидают люди. Модель показывает несколько вариантов ответа, разметчики выбирают лучший, и на этих оценках обучается отдельная модель вознаграждения. Затем основную модель дообучают через обучение с подкреплением так, чтобы её ответы получали более высокую оценку. Благодаря этому ассистенты стали внятнее и безопаснее.
СИНОНИМЫ:Обучение с подкреплением на обратной связи человекаобучение на оценках людейRLHFreinforcement learning from human feedback

RLHF в современном виде популяризовали OpenAI и Anthropic. Подход состоит из нескольких шагов.

Шаги RLHF

  1. Предобученная модель учится следовать инструкциям на хорошем размеченном наборе.
  2. Люди сравнивают пары ответов модели на один и тот же запрос и выбирают лучший.
  3. На этих сравнениях обучается модель вознаграждения, которая предсказывает, насколько такой ответ понравится людям.
  4. Основная модель обновляется через обучение с подкреплением, максимизируя предсказанное вознаграждение.

Что даёт RLHF

  • Модель лучше следует инструкциям и формату.
  • Реже выдаёт грубые, опасные или явно бессмысленные ответы.
  • Учитывает стилистические предпочтения людей: краткость, вежливость, объяснения.

Ограничения

  • Модель вознаграждения может переучиться под предпочтения конкретной группы разметчиков, и это превращается в скрытое смещение.
  • Модель учится казаться правильной, а не быть таковой: можно получить уверенный, но фактически неверный ответ.
КОГДА ПРИМЕНЯТЬ
  • Строите собственного ассистента, в котором важны стиль и безопасность
  • Готовы выделить ресурсы на разметку и поддерживать её во времени
  • Работа с промптами и обычная тонкая настройка уже исчерпали себя
КОГДА НЕ СТОИТ
  • Маленький проект на 1–2 человек — это слишком тяжёлая артиллерия
  • Нет инфраструктуры для разметки и контроля качества разметчиков
ПРИМЕР

Команда улучшает специализированный медицинский чат-бот. После тонкой настройки на медицинских инструкциях ответы стали точнее, но иногда модель уходит в излишнюю самоуверенность или, наоборот, отказывается отвечать на безобидные вопросы. Разметчики-медики сравнивают пары ответов и отмечают, какой звучит более полезно и безопасно. После раунда RLHF модель чаще задаёт уточняющие вопросы, аккуратнее обращается с фактами и реже навязывает диагноз.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Качество RLHF почти полностью определяется качеством разметки. Если разметчики устают, торопятся или плохо понимают предметную область, модель быстро запомнит их ошибки и предпочтения. Поэтому больше всего внимания уходит не на алгоритмы, а на инструкции, обучение и контроль работы разметчиков.

Попробовать бесплатно

Вопросы про «Обучение с подкреплением на обратной связи человека (RLHF)»

Обычная тонкая настройка показывает модели готовые пары «вход — правильный ответ» и учит их воспроизводить. RLHF идёт дальше: модель учится на предпочтениях людей, которые выбирают лучший из нескольких её собственных ответов. Это позволяет настраивать то, что трудно записать одним эталонным ответом, — стиль, осторожность в спорных темах, вежливость и готовность признать, что данных не хватает.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.