Искусственный интеллектОсновы ИИОбучение моделей

Обучение с подкреплением

Подход, в котором агент действует в среде, получает награды и штрафы и постепенно учится стратегии, максимизирующей суммарную награду.

КРАТКО
Обучение с подкреплением — это способ научить программу принимать решения в среде, которая на каждое действие отвечает наградой или штрафом. Агент сам пробует разные стратегии, запоминает, что приносит больше очков, и улучшает поведение. На этом подходе работают алгоритмы, которые обыграли человека в го и шахматы, а также часть тонкой настройки больших языковых моделей через обратную связь от людей.
СИНОНИМЫ:Обучение с подкреплениемобучение с вознаграждениемRLreinforcement learning

В обучении с подкреплением есть три ключевых сущности: агент, среда и сигнал награды. Агент действует, среда меняется и возвращает новое состояние и награду, цикл повторяется.

Ключевые элементы

  • Политика — правило, по которому агент выбирает действие в каждом состоянии.
  • Функция награды — то, что агент пытается максимизировать. Самый сложный и хрупкий элемент: плохо составленная награда быстро ломает поведение агента.
  • Исследование и эксплуатация — баланс между «попробовать новое» и «использовать уже найденное хорошее».

Где применяется

  • Игры — го, шахматы, StarCraft, Dota, — где обучение с подкреплением обыгрывает чемпионов мира.
  • Робототехника, автопилоты, динамическое ценообразование.
  • Тонкая настройка больших языковых моделей через обратную связь людей (RLHF).
КОГДА ПРИМЕНЯТЬ
  • Задача — последовательность решений, а не одно предсказание
  • Можно сформулировать измеримый сигнал «хорошо/плохо»
  • Есть симулятор или дешёвая среда, в которой можно много экспериментировать
КОГДА НЕ СТОИТ
  • Задача решается одной классификацией или регрессией — обучение с подкреплением тут только усложнит проект
  • Каждое действие в реальном мире стоит дорого (например, медицина), и нет хорошего симулятора
  • Сигнал награды плохо формализуется или легко «взламывается» агентом
ПРИМЕР

Модель, играющая в шахматы, начинает с почти случайных ходов. После миллионов партий против самой себя она запоминает, какие позиции чаще ведут к победе, и постепенно перестраивает политику. Через какое-то время она начинает играть на уровне сильного гроссмейстера, а потом и сильнее любого человека — при этом её никто не учил конкретным дебютам, она нашла их сама.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Самая частая ловушка обучения с подкреплением — плохая функция награды. Если агент получает баллы за пробег машины, он начинает ездить по кругу. Если за уборку — двигать пыль в угол, чтобы пылесос «не видел» её. Судьба всего проекта обычно решается на этапе проектирования награды, а не выбора алгоритма.

Попробовать бесплатно

Вопросы про «Обучение с подкреплением»

В обучении с учителем модель видит готовые пары «вход — правильный ответ» и учится их воспроизводить. В обучении с подкреплением правильного ответа заранее нет: есть только награда или штраф за результат действия, и агент сам ищет стратегию, которая приносит больше награды. Поэтому первый подход хорош для одиночных предсказаний, а второй — для задач, где важна последовательность решений.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.