Этим уроком открывается модуль вероятности и статистики. В детерминированной задаче ответ скрыт от нас, но уже определён условиями. Вероятность устроена иначе: она описывает результат повторяемой процедуры, который действительно может оказаться разным. Эта тонкая граница между незнанием и случайностью задаёт весь язык статистики — и начинается он не с чисел, а с чёткого описания опыта.

Сначала процедура, потом проценты

Фраза «вероятность дождя равна 40%» выглядит как готовое число, хотя за ней всегда стоит модель опыта. Что именно повторяется — один и тот же день, прогноз для похожих атмосферных условий или работа конкретной метеомодели? Как фиксируется результат — выпала хотя бы одна капля в городе, в аэропорту или на выбранной станции? Без таких уточнений процент нельзя ни проверить, ни разумно использовать.

Математика начинает с множества элементарных исходов Ω\Omega. Для двух различимых кубиков

Ω={(i,j):i,j{1,,6}}.\Omega=\{(i,j):i,j\in\{1,\ldots,6\}\}.

Событие — это подмножество исходов, например A={(i,j):i+j10}A=\{(i,j):i+j\geq 10\}. Вероятностная мера PP приписывает событиям числа так, что P(Ω)=1P(\Omega)=1, P(A)0P(A)\geq0, а вероятности несовместных событий складываются. Из этих трёх правил, а не из житейского ощущения удачи, выводятся все остальные формулы.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Решётка 6 на 6, клетки окрашены по сумме двух кубиков от 2 до 12; шесть клеток с суммой не меньше 10 обведены красным — это событие вероятности 6 из 36
Рис. 41.1. Пространство исходов двух кубиков

По осям — грани первого и второго кубика, цвет клетки кодирует сумму. Красным обведено событие i+j10i+j\geq10: шесть клеток из тридцати шести, то есть P(A)=1/6P(A)=1/6.

Рисунок вскрывает частую ловушку. Хотя каждая пара (i,j)(i,j) равновероятна (1/361/36), суммы распределены неравномерно: у семёрки шесть прообразов, у двойки один. Поэтому вероятность AA — это доля подходящих элементарных исходов, а не доля чисел {10,11,12}\{10,11,12\} среди возможных сумм.

Русская линия открывается сразу с вершины. Именно А. Н. Колмогоров в 1933 году дал вероятности строгое аксиоматическое основание, превратив её из набора приёмов в полноценную математику. Всё, что мы делаем ниже, опирается на три его аксиомы: неотрицательность, нормировку и сложение вероятностей несовместных событий.

Случайная величина — это функция

Случайная величина XX — это не «число, которое случайно меняется», а функция

X:ΩR,X:\Omega\to\mathbb R,

которая сжимает подробный исход до измеряемого признака. Для кубиков можно взять X(i,j)=i+jX(i,j)=i+j, или Y(i,j)=max(i,j)Y(i,j)=\max(i,j), или индикатор Z(i,j)=1{i=j}Z(i,j)=\mathbf 1\{i=j\}. Одна процедура порождает много величин, и выбор функции решает, что мы замечаем, а что отбрасываем.

Для непрерывной величины отдельная точка обычно имеет нулевую вероятность; тогда используют плотность f(x)f(x) и считают площадь P(aXb)=abf(x)dxP(a\leq X\leq b)=\int_a^b f(x)\,dx. Различие дискретного и непрерывного случая всплывёт снова у нормального распределения.

Случайная величина на реальных данных

Кубики удобны для понятий, но настоящая статистика живёт на данных. Возьмём открытый набор о прокате велосипедов: для каждого часа записано число поездок. Процедура — «выбрать случайный час из наблюдений», а случайная величина XX — число поездок в этот час. У неё есть настоящее распределение.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Гистограмма числа поездок за час из данных велопроката: высокий пик у малых значений и длинный правый хвост; красная линия среднего 189 стоит правее зелёной линии медианы 142
Рис. 41.2. Случайная величина на реальных данных

Распределение числа поездок за случайный час на реальных данных. Среднее (189189) заметно правее медианы (142142): длинный правый хвост из редких загруженных часов тянет среднее вверх, и «среднее» перестаёт быть «типичным».

Этот разрыв между средним и медианой — не курьёз, а важное предупреждение: у скошенного распределения одно число редко описывает объект честно, и рядом со средним нужны медиана, квантили и сама гистограмма.

Центр и разброс

Математическое ожидание

EX=xxP(X=x)\mathbb E X=\sum_x x\,P(X=x)

в дискретном случае — центр масс вероятностей. Это не обязательно возможный результат: среднее число детей в семье может равняться 1,431{,}43. Ожидание отвечает на вопрос о долгой серии — к нему стремится выборочное среднее при независимых повторениях.

Одного центра мало: величины с одинаковым ожиданием могут вести себя совсем по-разному. Разброс измеряет дисперсия

Var(X)=E(XEX)2=EX2(EX)2,\operatorname{Var}(X)=\mathbb E(X-\mathbb E X)^2=\mathbb E X^2-(\mathbb E X)^2,

а стандартное отклонение σX=Var(X)\sigma_X=\sqrt{\operatorname{Var}(X)} возвращает исходные единицы.

::::

Потрогай вероятность

Исходы, случайная величина и закон больших чисел

Загружается живая иллюстрация…

Бросайте кубики и смотрите, как распределение выбранной величины набирается из бросков и приближается к теоретическому (красные точки). Внизу видно закон больших чисел: доля события сходится к его вероятности. Переключите величину на «максимум» — форма распределения изменится, потому что изменится число прообразов у каждого значения.

Условие меняет распределение

У той же величины «поездки за час» распределение зависит от условий. Разобьём часы по погоде — и получим разные распределения с разными средними.

От модели к частотам

Распределение задаёт теоретические вероятности; таблица наблюдений даёт эмпирические частоты p^n(x)=1ni1{Xi=x}\widehat p_n(x)=\frac1n\sum_i\mathbf1\{X_i=x\}. При независимых одинаково распределённых наблюдениях частоты стабилизируются — это закон больших чисел.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три траектории выборочного среднего числа поездок против числа наблюдений в логарифмической шкале; все сходятся к истинному среднему 189, коридор плюс-минус сигма на корень из n сужается
Рис. 41.3. Закон больших чисел на реальных данных

Три независимые серии выборочного среднего поездок сходятся к истинному среднему (189189). Коридор ±σ/n\pm\sigma/\sqrt n сужается: чтобы уменьшить случайную ошибку вдесятеро, нужно примерно в сто раз больше наблюдений.

Удвоение объёма не делит ошибку пополам: для многих средних она убывает как 1/n1/\sqrt n. Точный масштаб корня выведет центральная предельная теорема.

Данные как случайные объекты

Вернёмся к практике. Рассмотрим выборку сделок с жильём: площадь, район, год, цена. Цена случайно выбранной сделки YY — случайная величина относительно процедуры «выбрать одну запись внутри заданных временных и географических границ». Меняется процедура — меняется распределение: выбор только новостроек или исключение сделок без площади создают другую популяцию.

Средняя цена отвечает на вопрос о случайной сделке, но при длинном правом хвосте плохо описывает «типичный дом» — тогда нужны медиана и квантили. А пропуски требуют отдельного вопроса: случайно ли исчезла площадь, или дорогие объекты чаще скрывают характеристики? До расчёта полезно письменно задать Ω\Omega, правило выборки, величину XX и оцениваемое событие. Этот паспорт связывает статистику с эмпирическим риском: среднее по таблице осмысленно лишь как приближение среднего по будущей популяции.

Что должно остаться после урока

Вероятностная модель начинается с повторяемой процедуры и пространства исходов, строго подпёртых аксиомами Колмогорова. Случайная величина отображает исходы в числа, распределение описывает её возможные значения, а ожидание и дисперсия сжимают распределение до двух характеристик, теряя часть формы. Наблюдаемая частота не совпадает с вероятностью, но приближает её по закону больших чисел — тем медленнее, чем точнее мы хотим. И перед любой формулой нужно уметь назвать опыт, объект случайности и границу популяции. Дальше мы наполним этот язык конкретными распределениями и предельными теоремами.

Задачи