В обучении с подкреплением есть три ключевых сущности: агент, среда и сигнал награды. Агент действует, среда меняется и возвращает новое состояние и награду, цикл повторяется.
Ключевые элементы
- Политика — правило, по которому агент выбирает действие в каждом состоянии.
- Функция награды — то, что агент пытается максимизировать. Самый сложный и хрупкий элемент: плохо составленная награда быстро ломает поведение агента.
- Исследование и эксплуатация — баланс между «попробовать новое» и «использовать уже найденное хорошее».
Где применяется
- Игры — го, шахматы, StarCraft, Dota, — где обучение с подкреплением обыгрывает чемпионов мира.
- Робототехника, автопилоты, динамическое ценообразование.
- Тонкая настройка больших языковых моделей через обратную связь людей (RLHF).
- Задача — последовательность решений, а не одно предсказание
- Можно сформулировать измеримый сигнал «хорошо/плохо»
- Есть симулятор или дешёвая среда, в которой можно много экспериментировать
- Задача решается одной классификацией или регрессией — обучение с подкреплением тут только усложнит проект
- Каждое действие в реальном мире стоит дорого (например, медицина), и нет хорошего симулятора
- Сигнал награды плохо формализуется или легко «взламывается» агентом
Модель, играющая в шахматы, начинает с почти случайных ходов. После миллионов партий против самой себя она запоминает, какие позиции чаще ведут к победе, и постепенно перестраивает политику. Через какое-то время она начинает играть на уровне сильного гроссмейстера, а потом и сильнее любого человека — при этом её никто не учил конкретным дебютам, она нашла их сама.
Самая частая ловушка обучения с подкреплением — плохая функция награды. Если агент получает баллы за пробег машины, он начинает ездить по кругу. Если за уборку — двигать пыль в угол, чтобы пылесос «не видел» её. Судьба всего проекта обычно решается на этапе проектирования награды, а не выбора алгоритма.