Случайное блуждание непредсказуемо в деталях и удивительно строго в масштабе. После тысячи шагов мы не знаем, где окажется частица, но знаем, почему типичное расстояние будет порядка , а не .
Монета прокладывает маршрут
Пусть независимы и принимают значения и с равными вероятностями. После бросков положение частицы
Среднее каждого шага равно нулю, поэтому . Это не означает, что частица обычно находится в нуле. Разброс определяется дисперсией:
Линейно растёт дисперсия, а стандартное отклонение — как корень. Через шагов типичный масштаб положения равен примерно . Пройти расстояние можно только если почти все шаги направлены одинаково; вероятность такого события ничтожна.
Это первая встреча с диффузионным масштабированием. В центральной предельной теореме сумма после деления на приближается к нормальному распределению. Здесь та же нормировка получает геометрический смысл.
Такое же вероятностное движение уже работало в PageRank, только там шаги шли по конечному графу и их стационарные частоты задавали рейтинг. Теперь пространство бесконечно, поэтому вместо ранга нас интересуют масштаб смещения и время достижения границы.
На трёх панелях изображены траектории при возрастающем . Голубые границы равны , светлые — . Оси обеих координат меняют масштаб, но после нормировки облака выглядят сравнимо.
Точные вероятности и чётность
Чтобы после шагов оказаться в точке , нужно сделать шагов вправо. Поэтому и должны иметь одинаковую чётность, а
Например, вернуться в ноль через нечётное число шагов невозможно. При вероятность возврата равна
Она не мала экспоненциально: центральный биномиальный коэффициент почти компенсирует . По формуле Стирлинга
Вероятность быть в нуле в конкретный поздний момент убывает, но сумма этих вероятностей расходится. Отсюда вырастает глубокий факт: одномерное симметричное блуждание почти наверное когда-нибудь вернётся в начало.
Дрейф меняет всё
Пусть шаг вправо происходит с вероятностью , влево — с . Тогда
и
Теперь центр движется линейно, а шум вокруг него растёт как . Даже крошечный перекос через миллион шагов даёт средний сдвиг , намного больше стандартного отклонения около . Слабый постоянный сигнал обнаруживается накоплением.
Эта идея вернётся в обучении с подкреплением: небольшое преимущество действия со временем доминирует, но его ещё нужно отличить от случайного разброса.
Граница, которая прекращает опыт
Часто нас интересует не положение в фиксированный момент, а первое достижение границы. Пусть игрок начинает с капитала и после каждого раунда выигрывает или проигрывает единицу. Игра заканчивается при или . Вероятность достичь раньше нуля в честной игре удовлетворяет
Вторая конечная разность равна нулю, значит линейна:
Так появляется «разорение игрока». При и шанс дойти до ста раньше нуля всего , хотя игра честная. Симметрия шагов не делает симметричными расстояния до границ.
Среднее время до остановки равно . Оно максимально в середине и растёт квадратично с размером интервала. Вероятность успеха и длительность эксперимента отвечают на разные вопросы.
По горизонтали начальный капитал при . Синяя прямая показывает , красная парабола — по правой оси. Отмечены точки : одинаковый шаговый закон даёт им разные риск и длительность.
От ломаной к броуновскому движению
Увеличим число шагов и одновременно уменьшим их длину. Процесс
на отрезке приближается к винеровскому процессу . Его приращение на интервале длины нормально распределено с дисперсией , а непересекающиеся приращения независимы.
Траектория непрерывна, но почти наверное нигде не имеет обычной производной. Если пытаться вычислять скорость по всё меньшим интервалам, отношение имеет масштаб и разлетается. Это не дефект графика, а математическое свойство.
Броуновское движение служит моделью тепловой диффузии, шума датчиков и случайных возмущений. Оно также лежит под стохастическими дифференциальными уравнениями, родственными непрерывному взгляду на диффузионные генеративные модели.
Лаборатория множества траекторий
Сначала поставьте и сравните облака конечных положений для , и . Если закон корня верен, стандартные отклонения должны относиться как , хотя число шагов относится как . Затем включите небольшой дрейф и найдите момент, после которого средний сдвиг становится больше двух стандартных отклонений.
Отдельно следите за максимумом и временем первого пересечения уровня. Их распределения нельзя восстановить только из : порядок шагов имеет значение.
Данные: дрейфующие океанские буи
Программа NOAA Global Drifter Program публикует координаты дрейфующих буёв с временными метками. Траектория определяется течением, ветром, волнами и ошибками позиционирования, поэтому простое независимое блуждание — лишь baseline.
Чтобы сравнить модель с данными, переведите широту и долготу в локальные координаты, выберите постоянный временной шаг и рассмотрите приращения
Проверьте средний дрейф, зависимость от лага и корреляцию соседних приращений. Для идеальной двумерной диффузии средний квадрат смещения линейно растёт со временем:
Реальные кривые могут сначала расти квадратично из-за инерции, затем линейно, а на больших лагах искажаться границами бассейна. Подгонять одну прямую по всему диапазону неразумно.
Слева показана траектория в локальных километрах, цвет кодирует время. Справа по логарифмическим осям отложено среднее ; пунктир имеет наклон 1 и соответствует диффузии. Серой полосой отмечен диапазон лагов, использованный для оценки .
Мини-исследование: отличить диффузию от направленного движения
Пусть дана двумерная траектория длины 20 000 шагов. Одного рисунка маршрута недостаточно: медленный дрейф на фоне шума и коррелированное движение могут выглядеть одинаково. Разбейте последовательность на непересекающиеся блоки длины и вычислите block displacements
Для сравните средний вектор, covariance ellipse и распределение норм. У независимого блуждания средний после удаления дрейфа остаётся около нуля, а размер эллипса растёт как . При инерции соседние шаги согласованы, поэтому на малых рост быстрее.
Затем перемешайте приращения по времени. Их одномерное распределение сохранится, но автокорреляция исчезнет. Если mean squared displacement после перемешивания заметно изменился, порядок содержал информацию. Это контрольный опыт в духе перестановочных тестов: разрушаем конкретную структуру, сохраняя остальные свойства.
Для доверительного интервала не считайте перекрывающиеся блоки независимыми. Можно использовать block bootstrap, пересэмплируя длинные куски траектории. Обязательно укажите длину блока и покажите, как вывод меняется при её удвоении. Такой анализ превращает фразу «маршрут похож на случайный» в набор опровержимых признаков: нулевой drift, корневой масштаб и слабая память приращений.
Ещё один контроль строится без симуляции. Для каждого разделите конечные положения на и наложите empirical CDF. Если кривые разных сходятся, нормировка выбрана разумно. Затем разделите на : распределения сожмутся к нулю. Эта пара графиков буквально показывает, почему характерный масштаб не линейный.
Проверяйте хвосты отдельно. Среднее и дисперсия могут совпасть у процессов с редкими большими скачками, но вероятность выйти за будет иной. Для океанского буя такой хвост может означать шторм, сбой GPS или смену течения; каждую гипотезу проверяют по метаданным.
Возврат, размерность и вывод
В одной и двух размерностях симметричное блуждание возвращается в начало с вероятностью . В трёх измерениях вероятность возврата уже меньше единицы. Дополнительное направление даёт больше путей «убежать». Это пример фазового изменения, вызванного не параметром, а размерностью пространства.
Главные идеи урока складываются в короткую систему. Сумма независимых шумов имеет разброс ; постоянный дрейф накапливается как ; границы превращают траекторию в задачу первого достижения; непрерывный предел даёт броуновское движение. Эти результаты нужны не для красивой монеты, а чтобы отделять сигнал от флуктуаций в реальных временных данных.