Q-learning учится на отдельных переходах, не зная таблицу вероятностей среды. Actor–critic решает другую задачу разделением труда: actor меняет поведение, critic оценивает, оказалось ли действие лучше ожидания.
Один переход вместо полной модели
В марковском процессе решений итерация ценности использовала сумму по всем с известными . Робот в настоящем коридоре такой таблицы не имеет. Он видит один опыт:
Q-learning строит оценку оптимальной ценности действия. Беллмановская цель для наблюдаемого перехода
Ошибка временной разности
обновляет ячейку:
Если переход оказался лучше текущего ожидания, и ценность растёт. Если хуже — падает. Мы подставляем одну случайную реализацию вместо математического ожидания, поэтому обновления шумны, но в среднем направлены к уравнению Беллмана.
Цель впервые достигнута справа. В первом эпизоде положительная TD-ошибка возникает у последнего перехода; в следующих эпизодах сигнал распространяется к более ранним состояниям. Толщина стрелок соответствует , цвет — знаку последнего обновления.
Off-policy: действуем одним правилом, учим другое
Поведение может быть -жадным, но цель содержит . Поэтому Q-learning оценивает жадную target-policy, хотя данные собраны исследующей behavior-policy. Это называется off-policy.
SARSA использует реально выбранное следующее действие:
В опасной сетке разница видима. Q-learning оценивает идеальное жадное продолжение и может выбрать путь рядом с обрывом. SARSA учитывает, что -исследование иногда сделает случайный шаг, поэтому предпочитает запас безопасности.
Исследование нельзя выключить слишком рано
Жадная policy
использует текущие знания, но не исправляет неизвестные ячейки. -greedy случайно исследует действия. Для теоретической сходимости табличного Q-learning нужны убывающие шаги и бесконечные посещения всех пар :
В конечном опыте это превращается в инженерный компромисс. Быстрое уменьшение фиксирует ранние ошибки; постоянное не даёт policy успокоиться. Можно отдельно оценивать поведение без исследования.
Лаборатория Q и critic
В табличном режиме следите, как положительная награда распространяется назад. Поменяйте : слишком малая делает обучение медленным, слишком большая заставляет таблицу повторять последний шумный опыт.
В режиме actor–critic зафиксируйте одну траекторию и сравните знак advantage с изменением вероятности действия. Затем увеличьте шум critic. Actor начинает усиливать случайные действия, потому что принимает ошибку оценки за свидетельство.
От таблицы к функции
Для изображения или непрерывного состояния таблица невозможна. Заменим её нейросетью и минимизируем
Target-сеть с параметрами обновляется медленнее основной, а replay buffer перемешивает прошлые переходы. Без этих приёмов цель менялась бы одновременно с предсказанием, а соседние наблюдения были бы сильно коррелированы.
Однако комбинация аппроксимации функции, bootstrap-цели и off-policy данных может расходиться. Её называют deadly triad. Нейросеть не превращает уравнение в автоматически устойчивый алгоритм.
Переход из среды попадает в буфер. Текущая сеть вычисляет , замороженная target-сеть — bootstrap-часть цели. Пунктирная стрелка показывает периодическое копирование параметров; отсутствие прямого градиента через target подчёркнуто знаком остановки.
Actor–critic: оценка помогает действию
Пусть actor задаёт дифференцируемую стратегию , а critic оценивает . TD-ошибка
служит приближением advantage: насколько действие оказалось лучше обычного результата из . Обновление actor имеет направление
При положительной вероятность выбранного действия растёт; при отрицательной — падает. Critic обучается уменьшать квадрат TD-ошибки. Baseline не меняет ожидаемый policy gradient, но уменьшает дисперсию.
Для дискретных действий actor часто выдаёт softmax. Энтропийный бонус
не даёт распределению слишком рано схлопнуться. Позже идеи ограничения обновления появятся в PPO.
A2C по шагам
Один цикл advantage actor–critic:
- сэмплировать действие ;
- получить ;
- вычислить ;
- обновить critic по ;
- обновить actor по ;
- добавить энтропийный бонус и повторить.
На практике используют несколько параллельных сред и -шаговые возвраты:
Малое даёт больше bias от critic и меньше дисперсию; большое приближается к Monte Carlo и сильнее шумит. Это знакомый компромисс смещения и дисперсии.
Offline-ловушка
Предположим, есть журнал старой policy, а взаимодействовать со средой нельзя. Q-learning берёт максимум по действиям, даже если некоторые почти отсутствуют в данных. Аппроксиматор способен назначить им случайно высокие значения; bootstrap затем усиливает ошибку. Это extrapolation error.
Безопасные offline RL-методы штрафуют действия вне поддержки данных или требуют консервативных оценок. Но сначала стоит спросить, нужен ли RL: если каждое решение независимо, достаточно контекстного бандита; если есть хорошие метки результата для фиксированного действия, возможно, хватит supervised learning.
Реальный кейс: батарея здания
В CityLearn агент управляет накопителем. Состояние включает заряд, час, текущую нагрузку и погодный прогноз. Награда может штрафовать стоимость электричества и пиковую мощность. Для actor–critic действие удобно сделать непрерывным: доля максимальной мощности заряда от до .
Проверка должна включать несколько погодных лет и baseline из урока о MDP. Отчёт содержит не только reward, но и:
- стоимость и пик нагрузки;
- число нарушений физических ограничений;
- деградацию при ошибке прогноза;
- разброс по seed;
- кривые обучения и качество окончательной policy без exploration noise.
Вверху показаны тариф и заряд, в центре — истинный по симулятору advantage и оценка critic, внизу — вероятность разряда. В выделенном интервале critic меняет знак преимущества, actor усиливает неверное действие, что позже создаёт дорогой пик.
Мини-исследование: увидеть переоценку максимума
Даже если все оценки несмещённы, максимум шумных чисел обычно завышен:
Проверьте это на одном состоянии с десятью действиями, истинная ценность каждого равна нулю, а оценка содержит независимый шум . Для сгенерируйте сто тысяч наборов и найдите средний максимум. Чем больше действий, тем сильнее эффект.
В Q-learning этот завышенный максимум входит в bootstrap target и может переноситься назад. Double Q-learning разделяет выбор и оценку:
Одна сеть выбирает действие, другая оценивает его, поэтому один и тот же положительный шум реже используется дважды.
Сравните обычный и double вариант в маленьком MDP с шумными наградами. Помимо среднего возврата покажите калибровку против Monte Carlo returns. Этот опыт связывает RL с ensemble и неопределённостью: высокая оценка действия может быть следствием операции максимума, а не реального преимущества.
Добавьте distributional срез. В двух действиях одинаковое среднее, но первое почти всегда даёт ноль и редко , второе стабильно даёт . Обычный различает только ожидание. Если задача штрафует риск, состояние должно включать ограничение или objective должен учитывать quantile/CVaR.
Постройте empirical return distributions и покажите, почему фраза «ценность равна единице» скрывает форму исходов. В управлении батареей редкое нарушение может быть важнее малой средней экономии.
Проведите ablation replay buffer. Обучите DQN на последовательных переходах и на случайных mini-batches из того же журнала. Сравните корреляцию соседних targets, oscillation loss и final return. Затем уменьшите buffer настолько, чтобы он почти не разрушал зависимость, и увеличьте до режима, где старые данные задерживают адаптацию.
Buffer одновременно стабилизирует обучение и меняет распределение опыта. При non-stationary среде слишком длинная память становится liability. Поэтому размер связывают с временным масштабом изменения, а не выбирают как магическое число.
От перехода к устойчивой политике
Q-learning переносит уравнение Беллмана в поток наблюдаемых переходов. Actor–critic отделяет выбор действия от оценки продолжения. Оба метода учатся из собственных данных, поэтому исследование, поддержка действий и честная оценка важнее красивой финальной кривой. Стабильность нейросетевого RL достигается архитектурой эксперимента, а не одной формулой.