Колокол нормального распределения возникает не потому, что природа любит симметрию. Он появляется, когда результат складывается из многих малых вкладов, ни один из которых не захватывает всю сумму. Центральная предельная теорема говорит о стандартизованной сумме, а не объявляет нормальным любой столбец таблицы — и в этом уроке мы увидим её работу прямо на реальных данных.
Почему среднее десяти измерений спокойнее одного
Возьмём датчик, который выдаёт истинное значение плюс шум. Отдельное измерение может быть скошенным, но среднее десяти показаний выглядит симметричнее, среднее ста — ещё ближе к колоколу, и одновременно его разброс падает. Пусть независимы, одинаково распределены, со средним и дисперсией . Для выборочного среднего
линейность ожидания и сложение дисперсий независимых слагаемых дают
Стандартное отклонение среднего равно . Поэтому сто измерений уменьшают случайный разброс примерно в десять раз, а не в сто — это «правило корня» из урока о случайных величинах.
Чтобы увидеть устойчивую форму, среднее нужно правильно стандартизовать: вычесть центр и умножить отклонение на . Без этого распределение просто сожмётся в точку.
Нормальная модель
Нормальное распределение имеет плотность
Параметр задаёт центр, — масштаб. После стандартизации получается стандартная нормаль с известным правилом: около массы лежит в , около — в , около — в .

Стандартная нормаль и доли массы в пределах , , стандартных отклонений. Плотность — не вероятность точки: вероятность задаёт площадь под кривой, .
Квантили превратятся в границы доверительных интервалов, и понимать их лучше как площади, а не как таинственные константы из таблицы.
Центральная предельная теорема
Теорема не утверждает, что сами становятся нормальными, и не даёт точного равенства при конечном . Скорость приближения зависит от формы исходного распределения: сильная асимметрия и тяжёлые хвосты требуют больше наблюдений. Экспонента квадрата возникает не случайно — при сложении независимых вкладов их характеристические функции перемножаются, а в разложении после центрирования первым существенным остаётся квадратичный член, связанный с дисперсией.
Русская линия здесь на самом виду. Именно А. М. Ляпунов в 1901 году дал центральной предельной теореме строгое доказательство при общих условиях (не требуя, чтобы слагаемые были одинаково распределены), введя знаменитое условие Ляпунова. До него теорему знали как эмпирический факт; после — как теорему с ясными предпосылками, продолжив линию Чебышёва и Маркова.
Потрогай теорему
Выберите исходное распределение — скошенное, равномерное или двугорбое — и усредняйте по наблюдениям. Гистограмма средних набирается из тысяч опытов и стягивается к красной нормальной кривой, тем точнее, чем больше . Затем переключитесь на хвосты Коши: у него нет конечной дисперсии, и колокол не появляется никогда — наглядное напоминание, что у ЦПТ есть условия.
Биномиальный счёт становится колоколом
Пусть — число успехов в независимых испытаниях с вероятностью . Тогда , , и при больших и распределение близко к нормальному. Для целочисленного события нужна поправка на непрерывность:
Половинка появляется потому, что столбец занимает интервал от до ; она заметно улучшает приближение при умеренном .
Когда колокол подводит
ЦПТ — не заклинание, и у неё три типичных провала. Первый — зависимость: сто последовательных секунд ряда с суточным ритмом несут гораздо меньше независимой информации, чем сто случайных дней. Второй — доминирующий вклад: если одно слагаемое велико, «малость каждого» нарушается. Третий — тяжёлые хвосты: у распределения Коши нет конечных ожидания и дисперсии, и среднее независимых величин Коши имеет ту же ширину, сколько бы их ни было.

Во всех трёх рядах формально по наблюдений. Независимые данные дают узкое среднее; сильная автокорреляция сохраняет широкий разброс; среднее величин Коши не стабилизируется. Одинаковое не означает одинаковый объём информации.
Фраза «при всё нормально» — не теорема, а грубое эмпирическое правило, которое молчит и о зависимости, и о хвостах.
Каждое наблюдение в таблице продублировали, и число строк выросло с до . Уменьшится ли реальная стандартная ошибка среднего? Какое условие нарушает наивный расчёт ?
Показать ответ
Нет: дубликаты не несут новой информации, а формула предполагает независимых наблюдений. На деле независимых по-прежнему , и настоящая ошибка равна . Наивный расчёт нарушает условие независимости и занижает неопределённость в раз. То же происходит и с сильно зависимыми, хотя и не буквально одинаковыми, строками.
Проверяй, не предполагай
Раз колокол — это вывод, а не стиль графика, его нужно проверять. Простейший инструмент — квантиль-квантильный график: он сравнивает квантили данных с нормальными, и отклонение от прямой сразу выдаёт скос или тяжёлые хвосты.

Красивые гистограммы показывают поведение выбранной модели. Они не доказывают независимость реального датчика и не гарантируют конечную дисперсию. Вычислительный опыт отвечает «что следует из предположений?», а данные — «похожи ли предположения на наш процесс?».
Энергосистема: сумма малых вкладов
Суммарная нагрузка района складывается из тысяч приборов, и для короткого интервала отдельные включения похожи на малые случайные вклады — центральная часть распределения нагрузки часто близка к нормальной, что позволяет оценивать вероятность перегрузки подстанции. Но в жару кондиционеры включаются согласованно, а крупное предприятие даёт доминирующий вклад: независимость и «малость каждого» теряются именно в опасном хвосте. Практический вывод — не запрет колокола, а проверка: сравнить квантили модели с эмпирическими, исследовать остатки, учесть сезонность и посмотреть на периоды экстремальной погоды. Эти проверки родственны диагностике предпосылок в линейной регрессии и карте неопределённости из урока о прогнозных интервалах.
Что именно разрешает теорема
ЦПТ связывает сумму или среднее многих подходящих вкладов с нормальным распределением после центрирования и масштабирования. Она объясняет , приближённые квантили и устойчивость формы к деталям исходного распределения. Но каждое применение обязано назвать слагаемые, защитить независимость или слабую зависимость, проверить отсутствие доминирующих вкладов и отделить центр от хвостов. Колокол — вывод из устройства процесса, а не стиль графика по умолчанию.
Задачи
Время ответа сервера имеет среднее мс и стандартное отклонение мс. Считая запросы независимыми с конечной дисперсией, найдите среднее и стандартное отклонение среднего времени для запросов. По ЦПТ оцените вероятность, что среднее превысит мс. Объясните, почему нормальность времени одного запроса для расчёта не требуется.
Монету с вероятностью орла бросают раз. Нормальным приближением оцените вероятность получить от до орлов включительно, применив поправку на непрерывность. Запишите стандартизованные границы и назовите два произведения, проверяющие разумность приближения.
Датчик выдаёт независимую ошибку со значениями и вероятностями . Найдите ожидание и дисперсию ошибки. Для среднего измерений вычислите центр и стандартное отклонение, затем по ЦПТ оцените . Объясните, почему нормальное приближение среднего разумно, хотя одна ошибка датчика нормальной не является.
Ряд содержит минутных измерений нагрузки. Корреляция соседних значений близка к , и значение остаётся похожим на предыдущее около минут. Объясните, почему стандартная ошибка слишком мала. Предложите два способа оценить неопределённость суточного среднего — разбиение на блоки и блочный bootstrap, — описав для каждого единицу повторной выборки и диагностический график.
Портфель содержит малых независимых рисков со средним убытком тыс. и стандартным отклонением тыс. каждый, плюс один общий климатический риск: с вероятностью он добавляет млн, иначе ноль (независимо от малых рисков). Найдите среднее и дисперсию суммарного убытка. Объясните, почему нормальное приближение центра резко недооценит вероятность больших потерь, и предложите модель, сохраняющую отдельный общий сценарий.
На реальных данных (число поездок велопроката за час, среднее , стандартное отклонение ) распределение одного часа сильно скошено. Опишите, как проверить ЦПТ эмпирически: многократно берите случайные подвыборки размера , считайте их средние и стройте гистограмму. Для предскажите форму и ширину распределения средних, проверив, что стандартное отклонение средних близко к . Объясните, почему Q-Q-график одного часа кривой, а среднего — почти прямой.
Докажите, что для независимых одинаково распределённых с дисперсией верно , используя свойство и аддитивность дисперсии независимых слагаемых. Затем покажите, что для суммы разброс растёт как , и объясните разницу масштабов для суммы и для среднего.
Сравните скорость сходимости ЦПТ для двух исходных распределений: симметричного равномерного на и сильно скошенного экспоненциального. Для каждого вычислите коэффициент асимметрии (третий стандартизованный момент) и по неравенству Берри—Эссеена оцените, при каком отклонение от нормали станет мало. Объясните, почему скошенному распределению нужно больше наблюдений, и как это связано с медленным приближением в хвостах.