Одна оценка скрывает, насколько она могла измениться при новой выборке. Доверительный интервал описывает процедуру: если повторять сбор данных, заранее заданная доля построенных интервалов накроет фиксированный неизвестный параметр. А насколько узким этот интервал вообще может быть, задаёт информация Фишера — та самая кривизна правдоподобия из прошлого урока.
Сто опросов одного города
Пусть истинная доля жителей, поддерживающих проект парка, равна и фиксирована на момент исследования. Из города сто раз независимо выбирают по человек, и каждый опрос даёт свою оценку и свой интервал
Большинство интервалов накрывает , некоторые проходят целиком мимо. До сбора данных границы случайны; после публикации конкретного интервала они, как и параметр, уже зафиксированы.

Каждая строка — новый опрос при одном и том же . Синие интервалы пересекают истинную долю, красные — нет. Процедура допускает около пяти промахов на сто серий (здесь их шесть), но не обязана давать ровно пять в каждом эксперименте.
Что означает 95 процентов
Корректная фраза: «Использован метод, который при повторении условий накрывает истинный параметр примерно в случаев». Фраза «вероятность, что параметр лежит в уже полученном интервале, равна » не соответствует классической модели: фиксированный параметр либо лежит там, либо нет. Прямой вероятностный смысл интервала параметра появится в байесовском подходе. И уровень не гарантирует, что предпосылки верны, выборка случайна и измерения не смещены.
От нормального приближения к интервалу
По центральной предельной теореме стандартизованная оценка приближённо нормальна: . Поскольку , решение двойного неравенства относительно даёт
Тонкость в том, что настоящую стандартную ошибку мы не знаем и подставляем её оценку. Законность такой замены обеспечивает теорема Слуцкого: если оценка состоятельна, предельное нормальное распределение сохраняется.
Русская линия здесь незаметна, но фундаментальна. Теорема Е. Е. Слуцкого — то, что позволяет в формуле интервала подставить выборочную стандартную ошибку вместо истинной и всё же получить верное предельное покрытие. Без неё переход от «известной » к «оценённой » был бы незаконным.
Информация Фишера задаёт точность
Откуда берётся стандартная ошибка? Из кривизны правдоподобия. Чем острее вершина лог-правдоподобия, тем точнее оценка. Меру остроты называют информацией Фишера:
Для независимых наблюдений информация складывается в , а стандартная ошибка оценки максимального правдоподобия примерно равна .

Кривизна вершины лог-правдоподобия равна : чем круче парабола, тем уже интервал . Так «ширина максимума» из урока о правдоподобии превращается в стандартную ошибку и в границы интервала.
Для доли Бернулли , поэтому — знакомая формула оказывается прямым следствием информации Фишера. Обратите внимание, что информация зависит от самого параметра: у долей около каждое наблюдение приносит меньше информации, чем у долей около нуля или единицы, поэтому интервал в середине шкалы при том же шире всего. А граница Крамера–Рао утверждает, что никакая несмещённая оценка не может иметь стандартную ошибку меньше : интервал уже этого предела честно не построить, сколько ни хитри с формулой.
Потрогай покрытие
Проведите серию при , затем при с тем же : у края простой интервал Вальда накрывает истину заметно реже обещанного. Увеличьте число опросов — частота покрытия стабилизируется около уровня, но не совпадает с ним точно. Наконец поднимите уровень до : интервалы станут длиннее — за более высокое покрытие платят шириной.
Интервал для доли: простая формула с дефектом
Подстановка в стандартную ошибку даёт интервал Вальда . Он знаком, но у границ ломается: при ошибка обращается в ноль, и интервал вырождается в точку, хотя десять неудач не доказывают невозможность успеха. А при малом числе успехов формула честно выдаёт границы ниже нуля или выше единицы — недопустимые для вероятности.

Здесь интервал Вальда показан честно, без обрезки: у краёв он уходит за и вырождается в точку. Интервал Уилсона (из score-теста) остаётся допустимым и лучше сохраняет покрытие. Обрезать выход за до границ нельзя — это скрывает дефект, не исправляя покрытие.
Ширина — это точность, уровень — осторожность
Ширина интервала среднего примерно равна : рост сужает, рост уровня расширяет. Чтобы уменьшить ширину вдвое, обычно нужно вчетверо больше данных, и нет метода, одновременно повышающего покрытие и сужающего интервал без новых данных или предположений.
::::
Bootstrap: повторные выборки из одной выборки
Когда распределение оценки сложно вывести формулой, применяют bootstrap: из исходных строк многократно выбирают строк с возвращением, каждый раз считают оценку и изучают её эмпирическое распределение; его квантили дают интервал.

Вместо того чтобы выводить распределение оценки аналитически, можно поручить эту работу компьютеру: многократно пересобирая имеющиеся данные, мы приближаем то, что дал бы повторный эксперимент.
Метод работает, если исходная выборка представляет популяцию, а единица пересборки выбрана верно. Для временного ряда нельзя тасовать отдельные минуты — нужны блоки; для учеников пересобирают школы или классы, если наблюдения внутри них зависимы.
В bootstrap-копии некоторые строки повторяются, некоторые пропадают. Почему размер копии берут равным исходному , а не меньше?
Показать ответ
Bootstrap имитирует повторный сбор выборки того же размера из той же популяции, ведь именно определяет неопределённость оценки. Взяв копию меньшего размера, мы имитировали бы другой, меньший эксперимент и завысили бы разброс оценок. Повторы и пропуски внутри копии — это и есть случайность выбора из с возвращением, воспроизводящая изменчивость исходной процедуры.
Интервалы прогноза и параметра
Интервал для среднего ответа и интервал для нового отдельного наблюдения — разные объекты. Даже если среднее энергопотребление известно почти точно, завтрашний час остаётся шумным: для нового к неопределённости оценки среднего добавляется собственная вариативность результата.

В байесовской регрессии это различие видно как два слагаемых предсказательной дисперсии. В отчёте всегда подписывают, что заключено в интервал: параметр популяции, условное среднее или единичный будущий объект.
Как не превратить интервал в украшение
Нужно назвать параметр и популяцию, описать процедуру выборки и уровень, проверить предпосылки и прочитать ширину в единицах решения. Интервал для поддержки парка говорит не только «оценка », но и что данные совместимы и с небольшим, и с уверенным большинством. Если эти сценарии ведут к разным действиям, надо собирать больше данных или улучшать дизайн. И помните ловушку эффективного объёма: тысяча ответов из десяти школьных чатов не равна тысяче независимых горожан — общая среда делает ответы внутри чата похожими, единицей повторения служит чат, а число строк ещё не сообщает объём информации.
Задачи
В случайной выборке покупателей выбрали новый дизайн. Вычислите оценку доли и интервал Вальда. Затем вычислите интервал Уилсона по формуле , , и сравните центры и ширины.
Среднее время выполнения задачи у школьников равно мин, выборочное стандартное отклонение мин. Постройте приближённый интервал для среднего с коэффициентом . Объясните разницу между интервалом среднего и интервалом времени следующего случайного школьника; какое из них шире и почему.
Из десяти испытаний ни одно не завершилось отказом. Покажите, что интервал Вальда для вероятности отказа вырождается. По правилу трёх оцените верхнюю границу и объясните её смысл. Сколько испытаний без отказа нужно примерно, чтобы верхняя граница стала меньше ?
Редакция каждую неделю опрашивает новую выборку и прекращает сбор, как только интервал доли перестаёт содержать . Объясните, почему обычное покрытие, рассчитанное для заранее фиксированного , нарушается. Предложите два честных дизайна — заранее назначенный объём и последовательную процедуру с поправкой — с правилом остановки до просмотра результатов.
Даны ежедневных значений выручки с сильным недельным циклом. Нужен bootstrap-интервал среднего дневного значения. Сравните повторную выборку отдельных дней, семидневных блоков и целых недель. Аргументируйте выбор единицы bootstrap, опишите алгоритм не менее чем из пяти шагов и назовите диагностический график, проверяющий сохранение зависимости.
Для доли Бернулли информация Фишера на одно наблюдение равна . Выведите её из через . Покажите, что стандартная ошибка MLE равна , и объясните, почему интервал уже границы Крамера–Рао честно построить нельзя.
Смоделируйте покрытие интервала Вальда: при истинном и объёме многократно генерируйте , стройте интервал и считайте долю накрывших. Для и оцените фактическое покрытие и покажите, что у края ( близко к нулю) оно систематически ниже . Сравните с покрытием интервала Уилсона.
Опрос набрал ответов, но из школьных чатов по человек, и ответы внутри чата коррелируют (внутриклассовая корреляция ). Оцените эффективный объём выборки при размере группы и покажите, во сколько раз истинная стандартная ошибка больше наивной . Предложите кластерный bootstrap, пересобирающий целые чаты.