Марковский процесс принятия решений описывает не «умного агента», а повторяющийся выбор под неопределённостью. Уравнение Беллмана делает главный трюк динамического программирования: длинное будущее раскладывает на ближайший шаг и задачу того же типа.
Курьер у развилки
Курьер едет к станции. На перекрёстке он может выбрать короткую улицу, которая иногда перекрыта, или длинный надёжный маршрут. Решение влияет не только на ближайшую минуту: от новой позиции зависят следующие варианты. Простая классификация «какую кнопку нажать» не видит этого продолжения.
Марковский процесс принятия решений, MDP, задаётся пятёркой
— состояния, — действия, — вероятности переходов, — награда, — коэффициент дисконтирования. Марковское условие утверждает:
Текущее состояние должно содержать всё прошлое, существенное для прогноза следующего шага. Если в «состоянии» записана только улица, но не время суток, хотя пробки зависят от часа, условие нарушено. Тогда надо расширить состояние, а не надеяться на красивую формулу.
Квадраты обозначают состояния, цветные стрелки — действия, подписи на ветвях — и немедленные награды. Одинаковые состояния на втором уровне объединены: MDP хранит состояние, а не всю историю пути.
Стратегия и случайность
Стратегия, или policy, задаёт распределение действий:
Детерминированная стратегия выбирает одно действие, стохастическая смешивает их. После фиксации управляемый процесс превращается в обычную цепь Маркова с переходами
Цель — максимизировать ожидаемый дисконтированный возврат
При агент видит только ближайшую награду. При близком к единице далёкие последствия значимы. Эффективный горизонт имеет порядок : при около 10 шагов, при — около 100.
Уравнение Беллмана как рекурсия
Разделим возврат:
Отсюда для фиксированной стратегии
Оптимальная ценность выбирает лучшее действие:
Правая часть содержит ту же функцию в следующем состоянии. Это и есть принцип оптимальности: хвост оптимального плана сам должен быть оптимален для достигнутого состояния.
Итерация ценности
Начнём с произвольного , часто нулевого, и повторим
После сходимости извлечём жадную стратегию:
Одна итерация табличного алгоритма требует порядка операций для плотных переходов и меньше для разреженных. Ошибка после шагов убывает геометрически, но при медленно.
Панели соответствуют итерациям . Зелёная клетка даёт награду, красные клетки опасны, стены непроходимы. Волна ненулевой ценности расходится на один шаг за итерацию; итоговые стрелки показывают policy, а не одну траекторию.
Лаборатория городских маршрутов
Сначала сделайте движение почти детерминированным. Изменяйте и наблюдайте, когда агент выбирает короткую дорогу рядом с опасной клеткой, а когда — длинный безопасный обход. Затем увеличьте вероятность бокового сноса: оптимальный маршрут может отойти от препятствия на дополнительную клетку.
Сравните цвет ценности и стрелки стратегии. Соседние состояния могут иметь близкие , но разные лучшие действия. И наоборот, одна стрелка не сообщает, насколько выбор уверен: нужен разрыв между лучшим и вторым .
Награда не обязана совпадать с целью
Разработчик выбирает , но надеется получить полезное поведение. Если курьеру начислять за скорость на каждом участке, агент может ездить кругами по быстрой магистрали. Если роботу-пылесосу платить за собранную пыль, он может рассыпать её снова. Такое exploitation заданной метрики называют reward hacking.
Полезно различать:
- терминальную цель и промежуточные shaping-награды;
- цену риска и средний результат;
- реальные ограничения и штрафы, которыми их приблизили;
- то, что измеряется симулятором, и то, что важно вне него.
Potential-based shaping вида
при стандартных условиях сохраняет оптимальные стратегии, но ускоряет обучение. Произвольный бонус такой гарантии не имеет.
Модель известна не всегда
Итерация ценности предполагает известные и . В реальном управлении переходы приходится оценивать из данных или узнавать опытом. Model-based подход строит модель, model-free сразу оценивает ценность или стратегию. Q-learning заменит точное ожидание по наблюдаемым переходом.
Если данные собраны старой стратегией, некоторые действия почти не встречаются. Нельзя надёжно оценить их последствия без дополнительных предположений. Это роднит управление с каузальным выводом: корреляция «так делали хорошие операторы» ещё не говорит, что действие само улучшает результат.
Реальный кейс: управление энергией здания
CityLearn предоставляет симуляторы зданий с нагрузкой, солнечной генерацией, аккумуляторами и погодой. Состояние может включать час, температуру, прогноз нагрузки и заряд батареи. Действие — зарядить, разрядить или не трогать накопитель. Награда штрафует пиковое потребление, стоимость и выбросы.
Перед обучением нужен простой baseline: не использовать батарею; заряжать ночью по фиксированному расписанию; жадно покрывать текущую нагрузку. Сложный агент должен выигрывать у них на одинаковых погодных периодах.
Оценивать только среднюю награду мало. Нужны пиковая мощность, стоимость, число нарушений ограничений батареи и устойчивость к другому году погоды. Временной split обязателен: будущее лето не должно попадать в обучающий период.
На общей временной оси показаны потребление дома, тариф и state of charge. Серая стратегия реагирует только на текущую цену, синяя сохраняет заряд перед вечерним пиком. Заштрихованная область отмечает ограничение мощности; фигура объясняет, почему локально дешёвое действие может ухудшить возврат.
Мини-исследование: неопределённость переходов
Итерация ценности использует точные вероятности, но оценка по малому журналу шумна. Возьмите сетку лаборатории и для каждого действия сгенерируйте лишь 20 переходов. Получите empirical , вычислите policy, затем повторите сбор 200 раз. Для каждой клетки отметьте, как часто выбиралось каждое действие.
Карта стабильности policy информативнее одной стрелки. В состоянии, где два различаются на , небольшая ошибка переходов переворачивает выбор почти без потери возврата. В другом состоянии неправильное действие может быть редким, но дорогим. Поэтому рядом с частотой переключения покажите regret относительно policy на истинном .
Добавьте pessimistic оценку: из ожидаемого результата действия вычитайте бонус неопределённости, зависящий от числа наблюдений. Агент станет обходить малоизученные рёбра. Это разумно в safety-задаче и слишком осторожно в исследовательской игре. Сравните оба режима при двух ценах аварии.
Наконец, проверьте simulator mismatch: уменьшите фактическую эффективность батареи на 10%, не переобучая policy. Такой stress test связывает MDP с domain shift. Если стратегия выигрывает только при точной модели, вывод должен звучать как результат симуляции, а не готовое управление зданием.
Разделите uncertainty на aleatoric и epistemic. Случайный боковой снос останется даже при бесконечном журнале; неизвестная его вероятность сужается с данными. В первой ситуации policy управляет риском, во второй может собирать информацию. Нарисуйте для одного состояния posterior вероятности перехода и induced distribution разности .
Если интервал разности пересекает ноль, заявлять единственное лучшее действие рано. Можно выбрать консервативное, запросить ещё данные или показать обе policy. Такой вывод полезнее стрелки без масштаба уверенности.
На карте подпишите и абсолютный разрыв ценностей: частое переключение между почти равными действиями не является практической катастрофой.
Что именно оптимизировало уравнение
MDP начинается не с нейросети, а с выбора состояния, действия, переходов, награды и горизонта. Беллмановская рекурсия превращает длинный план в локальное уравнение, а сжатие гарантирует сходимость при . Но математически оптимальная policy оптимальна лишь для записанной модели. Проверка состояния и награды остаётся частью задачи.