Видео добавляет время, 3D — точку обзора, world model — действие и последствия. Хороший отдельный кадр больше не достаточен: объект должен сохранять идентичность, камера — геометрию, а будущее — реагировать на вмешательство.
Мяч обязан продолжить траекторию
Пусть кадры . Генератор может создать каждый кадр реалистично и всё же заставить мяч телепортироваться, тень перескочить или человека сменить одежду. Нужна временная согласованность.
Простейшая модель прогнозирует
Pixel loss
на неопределённом будущем усредняет варианты и размывает движение. Поэтому используют latent dynamics, perceptual loss, diffusion и adversarial компоненты.
Оптический поток связывает пиксели:
Нарушение warping consistency обнаруживает скачки, но не работает идеально на окклюзиях и новых областях.
Верхняя последовательность следует параболе, нижняя имеет скачок, хотя каждый кадр резок. Справа показаны координата центра , residual к ballistic fit и warping error с учётом маски окклюзии.
Модель времени
Video transformer превращает пространство-время в tokens: patches каждого кадра плюс temporal position. Full attention по токенам дорого, поэтому разделяют spatial и temporal attention или работают в сжатом latent.
Recurrent state model:
Без действий это video predictor. С действиями — кандидат на world model. Noise хранит неопределённость будущего.
Долгий rollout страдает compounding error: модель обучалась на real states, а затем получает собственные слегка ошибочные predictions. Scheduled sampling и latent regularization помогают, но не заменяют multi-step evaluation.
Камера задаёт проектирование
В pinhole model 3D-точка переходит в пиксель
содержит intrinsics, — положение камеры. Один пиксель задаёт луч, а не глубину. Несколько views связываются epipolar geometry.
Если модель генерирует новый ракурс, линии и окклюзии должны соответствовать одной 3D-сцене. Просто похожие текстуры недостаточны.
Точка проецируется в . Луч первой камеры и baseline задают epipolar plane; на второй плоскости соответствие лежит на линии. Рядом показана ошибочная генерация, где matching point нарушает constraint.
NeRF: цвет и плотность вдоль луча
Neural Radiance Field задаёт
где — 3D-точка, — направление взгляда, — density, — цвет. Pixel получается volume rendering:
Модель обучается по нескольким фотографиям с известными poses. Новый view рендерится интегрированием по новым лучам. Ошибки camera calibration превращаются в размытое поле.
3D Gaussian Splatting использует явные Gaussian-примитивы и быстрее рендерит, но тоже требует согласованных views.
Лаборатория мира
Задайте начальную скорость мяча и сравните генерацию, обученную только по кадрам, с моделью, получающей physics penalty. Измените действие — толчок — и проверьте, реагирует ли будущая траектория.
Перемещайте виртуальную камеру. Если размер объекта меняется не по глубине или дальний объект закрывает ближний, 2D-реализм нарушает 3D-логику.
World model и действие
Для управления latent model учит
где encoder переводит observation в . Агент планирует во внутреннем rollout, выбирая последовательность действий по predicted rewards.
Главная опасность — model exploitation: planner ищет траектории, где модель ошибочно обещает высокий reward. Ensemble uncertainty, короткий planning horizon и проверка в реальной среде ограничивают риск.
Связь с MDP прямая: world model приближает и . В отличие от пассивного видео, данные зависят от behavior policy. Неисследованные действия остаются неизвестными.
Причинность требует вмешательства
Наблюдение «руль повернулся, машина пошла вправо» может быть корреляцией с дорогой: водитель поворачивает руль именно на изгибе. Чтобы оценить действие, нужны разнообразные interventions или simulator.
Counterfactual test: из одного состояния подать разные и проверить правдоподобное расхождение. Если output не меняется, модель игнорирует action. Если меняет фон целиком, action entangled с данными.
Верхняя строка — общий наблюдаемый префикс. Три ветви получают разные steering actions; нанесены траектории, uncertainty cones и predicted collision risk. Серым показан недоступный в train участок, где uncertainty растёт.
Waymo Open Dataset
Waymo Open Dataset содержит последовательности камер и lidar, 3D boxes и motion data. Объём велик; школьный проект берёт опубликованный subset. Split по segments, а не frames, предотвращает утечку соседних кадров.
Возможная задача — прогноз траекторий объектов на несколько секунд. Метрики:
- displacement error по горизонту;
- miss rate;
- calibration множества траекторий;
- collision/road-boundary violations;
- результат по редким манёврам;
- latency.
Average displacement не наказывает одинаково пропущенный поворот и небольшой сдвиг на прямой. Сценарные метрики продолжают материал урока.
Мини-исследование: раскладываем ошибку траектории
Прогноз позиции может ошибаться по трём причинам: неверна скорость, направление или выбранная мода будущего. Для каждой predicted trajectory разложите displacement относительно истинной tangent:
Продольная ошибка означает опережение/отставание, поперечная — уход с пути. На повороте basis меняется по времени. Постройте обе компоненты по горизонту, а не один ADE.
Для multimodal predictor оцените coverage: попала ли истина хотя бы в одну из траекторий, и calibration вероятностей мод. Десять почти одинаковых вариантов не дают настоящей diversity. Добавьте pairwise endpoint distance и occupancy.
Мини-исследование: обнаружить exploitation world model
Обучите model на действиях в ограниченном диапазоне, например steering . Planner разрешите выбирать . Он, вероятно, уйдёт к краям, где predicted reward необоснованно высок.
Нанесите выбранные actions на histogram behavior data. Добавьте uncertainty ensemble и штраф
Сравните predicted и true simulator return. Пессимизм уменьшит exploitation, но может отвергать полезные новые действия. Это offline RL support problem в model-based форме.
Мини-исследование: 3D consistency через замкнутый маршрут
Рендерите сцену по камерам, образующим круг, и сравните первый и последний view. Geometry должна вернуться, хотя stochastic texture может немного отличаться. Отслеживайте landmarks и depth ordering.
Для двух промежуточных views постройте feature correspondences и epipolar residual. Простая perceptual similarity не обнаружит, что объект оказался за неправильной поверхностью. Геометрический тест продолжает computer vision и проекции.
Наконец, измените camera intrinsics вне train. Если сцена распадается, limitation относится к calibration range. Публикуйте его вместе с красивым novel-view video.
Мини-исследование: окклюзия как проверка памяти объекта
Пусть машина на десять кадров скрывается за автобусом и появляется снова. Tracking/world model должна сохранить identity и предсказать область выхода. Сравните embedding до и после окклюзии, position uncertainty и число identity switches.
Удлиняйте окклюзию и меняйте возможные выходы. Uncertainty должна расти; уверенная точка при трёх развилках некалибрована. Сравните deterministic и multimodal forecasts.
Эта задача связывает видео с рекуррентной памятью: hidden state переносит объект без пиксельного evidence. Но если модель узнаёт конкретный фон, geographical split выявит shortcut.
Мини-исследование: conservation residual
В synthetic-сцене без внешних сил вычисляйте momentum до и после взаимодействия. Для столкновения двух тел
Сравните generated rollout и real simulator. Малый pixel loss не гарантирует малый : скорости чувствительны к положению между кадрами.
Не навязывайте conservation в сценах с неизвестными внешними силами. Помечайте только контролируемые эпизоды. Physics residual является контрольным вопросом к модели, а не универсальным score реализма.
Добавьте energy residual отдельно: momentum может сохраняться при неупругом столкновении, kinetic energy — нет. Если модель штрафует оба одинаково, она запрещает физически допустимую потерю энергии.
Для bouncing ball коэффициент restitution задаёт отношение нормальных скоростей после и до удара. Оцените его по generated видео и сравните с simulator. Так «физичность» распадается на измеримые законы с условиями применимости.
Мир проверяется временем и действием
Видео требует согласованности во времени, 3D — согласованности между views, world model — правильной реакции на действия. One-step realism не проверяет rollout. Геометрические и физические рисунки полезны как тесты: они дают инварианты, которые можно измерить, а не только посмотреть.