Этим уроком открывается модуль вероятности и статистики. В детерминированной задаче ответ скрыт от нас, но уже определён условиями. Вероятность устроена иначе: она описывает результат повторяемой процедуры, который действительно может оказаться разным. Эта тонкая граница между незнанием и случайностью задаёт весь язык статистики — и начинается он не с чисел, а с чёткого описания опыта.
Сначала процедура, потом проценты
Фраза «вероятность дождя равна 40%» выглядит как готовое число, хотя за ней всегда стоит модель опыта. Что именно повторяется — один и тот же день, прогноз для похожих атмосферных условий или работа конкретной метеомодели? Как фиксируется результат — выпала хотя бы одна капля в городе, в аэропорту или на выбранной станции? Без таких уточнений процент нельзя ни проверить, ни разумно использовать.
Математика начинает с множества элементарных исходов . Для двух различимых кубиков
Событие — это подмножество исходов, например . Вероятностная мера приписывает событиям числа так, что , , а вероятности несовместных событий складываются. Из этих трёх правил, а не из житейского ощущения удачи, выводятся все остальные формулы.

По осям — грани первого и второго кубика, цвет клетки кодирует сумму. Красным обведено событие : шесть клеток из тридцати шести, то есть .
Рисунок вскрывает частую ловушку. Хотя каждая пара равновероятна (), суммы распределены неравномерно: у семёрки шесть прообразов, у двойки один. Поэтому вероятность — это доля подходящих элементарных исходов, а не доля чисел среди возможных сумм.
Русская линия открывается сразу с вершины. Именно А. Н. Колмогоров в 1933 году дал вероятности строгое аксиоматическое основание, превратив её из набора приёмов в полноценную математику. Всё, что мы делаем ниже, опирается на три его аксиомы: неотрицательность, нормировку и сложение вероятностей несовместных событий.
Случайная величина — это функция
Случайная величина — это не «число, которое случайно меняется», а функция
которая сжимает подробный исход до измеряемого признака. Для кубиков можно взять , или , или индикатор . Одна процедура порождает много величин, и выбор функции решает, что мы замечаем, а что отбрасываем.
Для непрерывной величины отдельная точка обычно имеет нулевую вероятность; тогда используют плотность и считают площадь . Различие дискретного и непрерывного случая всплывёт снова у нормального распределения.
Случайная величина на реальных данных
Кубики удобны для понятий, но настоящая статистика живёт на данных. Возьмём открытый набор о прокате велосипедов: для каждого часа записано число поездок. Процедура — «выбрать случайный час из наблюдений», а случайная величина — число поездок в этот час. У неё есть настоящее распределение.

Распределение числа поездок за случайный час на реальных данных. Среднее () заметно правее медианы (): длинный правый хвост из редких загруженных часов тянет среднее вверх, и «среднее» перестаёт быть «типичным».
Этот разрыв между средним и медианой — не курьёз, а важное предупреждение: у скошенного распределения одно число редко описывает объект честно, и рядом со средним нужны медиана, квантили и сама гистограмма.
Центр и разброс
Математическое ожидание
в дискретном случае — центр масс вероятностей. Это не обязательно возможный результат: среднее число детей в семье может равняться . Ожидание отвечает на вопрос о долгой серии — к нему стремится выборочное среднее при независимых повторениях.
Одного центра мало: величины с одинаковым ожиданием могут вести себя совсем по-разному. Разброс измеряет дисперсия
а стандартное отклонение возвращает исходные единицы.
::::
Потрогай вероятность
Бросайте кубики и смотрите, как распределение выбранной величины набирается из бросков и приближается к теоретическому (красные точки). Внизу видно закон больших чисел: доля события сходится к его вероятности. Переключите величину на «максимум» — форма распределения изменится, потому что изменится число прообразов у каждого значения.
Условие меняет распределение
У той же величины «поездки за час» распределение зависит от условий. Разобьём часы по погоде — и получим разные распределения с разными средними.

Отсюда растёт понятие условного ожидания и закон полной дисперсии, разбивающий разброс на «внутри условий» и «между условиями». Мы вернёмся к этому в задачах.
Неизвестное не всегда случайно
Пусть в закрытом конверте лежит целое число. Для нас оно неизвестно, но после запечатывания не меняется — физической повторяемой случайности в самом числе нет. Напротив, тепловой шум датчика при каждом измерении рождает новый результат: даже идеально известный алгоритм не предскажет конкретную флуктуацию.
В статистике эти два слоя часто соседствуют. Параметр модели считают фиксированным, а выборку — случайной; тогда оценка случайна, потому что зависит от выборки. В байесовском подходе неизвестность параметра, наоборот, кодируют распределением — этот другой смысл вероятности разберём в уроке об априорном и апостериорном.
Генератор псевдослучайных чисел детерминирован: зная seed и код, всю последовательность можно повторить. Для вычислительного эксперимента этого достаточно, если она проходит нужные статистические проверки. Различай источник непредсказуемости и математическую модель результата.
От модели к частотам
Распределение задаёт теоретические вероятности; таблица наблюдений даёт эмпирические частоты . При независимых одинаково распределённых наблюдениях частоты стабилизируются — это закон больших чисел.

Три независимые серии выборочного среднего поездок сходятся к истинному среднему (). Коридор сужается: чтобы уменьшить случайную ошибку вдесятеро, нужно примерно в сто раз больше наблюдений.

При достаточно большом числе испытаний доля благоприятных исходов подходит к их вероятности сколь угодно близко с любой наперёд заданной уверенностью — в этом состоит золотая теорема.
Удвоение объёма не делит ошибку пополам: для многих средних она убывает как . Точный масштаб корня выведет центральная предельная теорема.
Случайная ошибка выборочного среднего убывает примерно как . Во сколько раз нужно увеличить выборку, чтобы уменьшить эту ошибку в пять раз?
Показать ответ
Ошибка пропорциональна , поэтому уменьшить её в раз — значит увеличить в раз, то есть в раз. Точность растёт медленно: каждый следующий знак достаётся всё дороже. Это фундаментальное ограничение любых оценок по конечной выборке.
Данные как случайные объекты
Вернёмся к практике. Рассмотрим выборку сделок с жильём: площадь, район, год, цена. Цена случайно выбранной сделки — случайная величина относительно процедуры «выбрать одну запись внутри заданных временных и географических границ». Меняется процедура — меняется распределение: выбор только новостроек или исключение сделок без площади создают другую популяцию.
Теория вероятностей есть в сущности не что иное, как здравый смысл, сведённый к исчислению; она позволяет точно оценить то, что верные умы чувствуют как бы инстинктом.
Средняя цена отвечает на вопрос о случайной сделке, но при длинном правом хвосте плохо описывает «типичный дом» — тогда нужны медиана и квантили. А пропуски требуют отдельного вопроса: случайно ли исчезла площадь, или дорогие объекты чаще скрывают характеристики? До расчёта полезно письменно задать , правило выборки, величину и оцениваемое событие. Этот паспорт связывает статистику с эмпирическим риском: среднее по таблице осмысленно лишь как приближение среднего по будущей популяции.
Один дом может несколько раз выставляться на продажу, а одна запись — соединять данные из разных источников. Независимость строк не возникает от сохранения в CSV: её обосновывает механизм сбора, и этот вопрос нельзя откладывать.
Что должно остаться после урока
Вероятностная модель начинается с повторяемой процедуры и пространства исходов, строго подпёртых аксиомами Колмогорова. Случайная величина отображает исходы в числа, распределение описывает её возможные значения, а ожидание и дисперсия сжимают распределение до двух характеристик, теряя часть формы. Наблюдаемая частота не совпадает с вероятностью, но приближает её по закону больших чисел — тем медленнее, чем точнее мы хотим. И перед любой формулой нужно уметь назвать опыт, объект случайности и границу популяции. Дальше мы наполним этот язык конкретными распределениями и предельными теоремами.
Задачи
Два различимых честных кубика бросают один раз. Постройте пространство элементарных исходов и найдите распределение случайной величины . Вычислите и . Все дроби сократите и поясните, почему шесть значений не равновероятны.
Автобус приходит через случайное целое число минут , все десять значений равновероятны. Пассажир оценивает неудобство функцией . Найдите распределение , , и . Объясните, почему минимизация среднего ожидания и минимизация среднего квадратичного неудобства могут приводить к разным решениям расписания.
В городе дней сухие: расход самокатов в такой день имеет среднее поездок и стандартное отклонение . В дождливый день среднее , стандартное отклонение . Погода выбирается случайно для одного дня. Найдите общее математическое ожидание числа поездок, а затем по формуле вычислите общую дисперсию и объясните смысл обоих слагаемых.
Исследователь записал суммы бросков двух кубиков и заявил: «среднее равно , значит кубики нечестные». Сформулируйте нулевую модель, вычислите точные и для честных кубиков, оцените стандартное отклонение среднего по броскам и определите, на сколько таких отклонений отстоит от теоретического среднего. Сделайте осторожный вывод без готового статистического теста.
На реальных данных велопроката (число поездок за час) даны среднее и медиана . Объясните, почему для скошенного вправо распределения . Какая из двух характеристик лучше отвечает на вопрос «сколько поездок в типичный час», а какая — «сколько поездок ожидать суммарно за много часов»? Приведите по одному управленческому решению, где уместна каждая.
Для условного распределения поездок по погоде известно: ясно — среднее при доле дней , облачно — при доле , дождь — при доле . Считая эти доли вероятностями погоды, найдите по формуле полного ожидания . Объясните, почему полученное число может не совпасть с простым средним всех часов, и какое предположение о выборе часов делает их равными.
Пусть независимы, одинаково распределены, , . Для выборочного среднего докажите и , используя линейность ожидания и свойства дисперсии независимых слагаемых. Выведите отсюда, что стандартная ошибка равна , и объясните, откуда берётся правило «в сто раз больше данных ради десятикратной точности».
Таблица из сделок содержит price, area, district, rooms,
building_year, deal_month. В строках площадь отсутствует; медианная цена этих
сделок млн против млн у остальных. Оцените две величины:
(средняя удельная цена случайной сделки)
и (цена метра случайно выбранной
проданной площади). Опишите пространство исходов и единицу случайного выбора для каждой,
объясните смещение при удалении строк и предложите две стратегии восстановления
(стратификация по интервалам площади и множественное заполнение), назвав для каждой
проверяемое предположение и диагностическую таблицу по району, комнатам, году и месяцу.