Одна оценка скрывает, насколько она могла измениться при новой выборке. Доверительный интервал описывает процедуру: если повторять сбор данных, заранее заданная доля построенных интервалов накроет фиксированный неизвестный параметр. А насколько узким этот интервал вообще может быть, задаёт информация Фишера — та самая кривизна правдоподобия из прошлого урока.

Сто опросов одного города

Пусть истинная доля жителей, поддерживающих проект парка, равна p=0,6p=0{,}6 и фиксирована на момент исследования. Из города сто раз независимо выбирают по 400400 человек, и каждый опрос даёт свою оценку p^\widehat p и свой интервал

p^±1,96p^(1p^)n.\widehat p\pm1{,}96\sqrt{\frac{\widehat p(1-\widehat p)}{n}}.

Большинство интервалов накрывает 0,60{,}6, некоторые проходят целиком мимо. До сбора данных границы случайны; после публикации конкретного интервала они, как и параметр, уже зафиксированы.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Сто горизонтальных доверительных интервалов доли из повторных опросов при истинной доле 0,6; девяносто четыре синих интервала пересекают вертикальную линию истины, шесть красных её не накрывают
Рис. 46.1. Покрытие в серии повторных выборок

Каждая строка — новый опрос n=400n=400 при одном и том же p=0,6p=0{,}6. Синие интервалы пересекают истинную долю, красные — нет. Процедура 95%95\% допускает около пяти промахов на сто серий (здесь их шесть), но не обязана давать ровно пять в каждом эксперименте.

Что означает 95 процентов

Корректная фраза: «Использован метод, который при повторении условий накрывает истинный параметр примерно в 95%95\% случаев». Фраза «вероятность, что параметр лежит в уже полученном интервале, равна 95%95\%» не соответствует классической модели: фиксированный параметр либо лежит там, либо нет. Прямой вероятностный смысл интервала параметра появится в байесовском подходе. И уровень 95%95\% не гарантирует, что предпосылки верны, выборка случайна и измерения не смещены.

От нормального приближения к интервалу

По центральной предельной теореме стандартизованная оценка приближённо нормальна: (θ^θ)/se(θ^)N(0,1)(\widehat\theta-\theta)/\operatorname{se}(\widehat\theta)\approx N(0,1). Поскольку P(1,96Z1,96)0,95P(-1{,}96\le Z\le1{,}96)\approx0{,}95, решение двойного неравенства относительно θ\theta даёт

θ^1,96se(θ^)θθ^+1,96se(θ^).\widehat\theta-1{,}96\,\operatorname{se}(\widehat\theta)\le\theta\le \widehat\theta+1{,}96\,\operatorname{se}(\widehat\theta).

Тонкость в том, что настоящую стандартную ошибку мы не знаем и подставляем её оценку. Законность такой замены обеспечивает теорема Слуцкого: если оценка se\operatorname{se} состоятельна, предельное нормальное распределение сохраняется.

Русская линия здесь незаметна, но фундаментальна. Теорема Е. Е. Слуцкого — то, что позволяет в формуле интервала подставить выборочную стандартную ошибку вместо истинной и всё же получить верное предельное покрытие. Без неё переход от «известной σ\sigma» к «оценённой σ^\widehat\sigma» был бы незаконным.

Информация Фишера задаёт точность

Откуда берётся стандартная ошибка? Из кривизны правдоподобия. Чем острее вершина лог-правдоподобия, тем точнее оценка. Меру остроты называют информацией Фишера:

I(θ)=E(θ).I(\theta)=-\mathbb E\,\ell''(\theta).

Для nn независимых наблюдений информация складывается в nI(θ)nI(\theta), а стандартная ошибка оценки максимального правдоподобия примерно равна 1/nI(θ)1/\sqrt{nI(\theta)}.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Кривая лог-правдоподобия с наложенной параболой кривизны n умножить на информацию Фишера; заштрихованная полоса показывает интервал шириной плюс-минус 1,96 делить на корень из n I
Рис. 46.2. Информация Фишера — кривизна вершины

Кривизна вершины лог-правдоподобия равна nI(θ)nI(\theta): чем круче парабола, тем уже интервал θ^±1,96/nI\widehat\theta\pm1{,}96/\sqrt{nI}. Так «ширина максимума» из урока о правдоподобии превращается в стандартную ошибку и в границы интервала.

Для доли Бернулли I(p)=1/[p(1p)]I(p)=1/[p(1-p)], поэтому se=p(1p)/n\operatorname{se}=\sqrt{p(1-p)/n} — знакомая формула оказывается прямым следствием информации Фишера. Обратите внимание, что информация зависит от самого параметра: у долей около 1/21/2 каждое наблюдение приносит меньше информации, чем у долей около нуля или единицы, поэтому интервал в середине шкалы при том же nn шире всего. А граница Крамера–Рао утверждает, что никакая несмещённая оценка не может иметь стандартную ошибку меньше 1/nI1/\sqrt{nI}: интервал уже этого предела честно не построить, сколько ни хитри с формулой.

Потрогай покрытие

Сто опросов и доля накрывших интервалов

Загружается живая иллюстрация…

Проведите серию при p=0,5p=0{,}5, затем при p=0,05p=0{,}05 с тем же nn: у края простой интервал Вальда накрывает истину заметно реже обещанного. Увеличьте число опросов — частота покрытия стабилизируется около уровня, но не совпадает с ним точно. Наконец поднимите уровень до 99%99\%: интервалы станут длиннее — за более высокое покрытие платят шириной.

Интервал для доли: простая формула с дефектом

Подстановка p^\widehat p в стандартную ошибку даёт интервал Вальда p^±zp^(1p^)/n\widehat p\pm z\sqrt{\widehat p(1-\widehat p)/n}. Он знаком, но у границ ломается: при p^=0\widehat p=0 ошибка обращается в ноль, и интервал вырождается в точку, хотя десять неудач не доказывают невозможность успеха. А при малом числе успехов формула честно выдаёт границы ниже нуля или выше единицы — недопустимые для вероятности.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Для числа успехов от 0 до 10 при n=10 красные интервалы Вальда показаны без обрезки: они уходят ниже нуля и выше единицы, а на краях вырождаются. Синие интервалы Уилсона всегда лежат внутри отрезка от нуля до единицы
Рис. 46.3. Вальд против Уилсона у границы

Здесь интервал Вальда показан честно, без обрезки: у краёв он уходит за [0,1][0,1] и вырождается в точку. Интервал Уилсона (из score-теста) остаётся допустимым и лучше сохраняет покрытие. Обрезать выход за [0,1][0,1] до границ нельзя — это скрывает дефект, не исправляя покрытие.

Ширина — это точность, уровень — осторожность

Ширина интервала среднего примерно равна 2zσ/n2z\,\sigma/\sqrt{n}: рост nn сужает, рост уровня расширяет. Чтобы уменьшить ширину вдвое, обычно нужно вчетверо больше данных, и нет метода, одновременно повышающего покрытие и сужающего интервал без новых данных или предположений.

::::

Bootstrap: повторные выборки из одной выборки

Когда распределение оценки сложно вывести формулой, применяют bootstrap: из исходных nn строк многократно выбирают nn строк с возвращением, каждый раз считают оценку и изучают её эмпирическое распределение; его квантили дают интервал.

Метод работает, если исходная выборка представляет популяцию, а единица пересборки выбрана верно. Для временного ряда нельзя тасовать отдельные минуты — нужны блоки; для учеников пересобирают школы или классы, если наблюдения внутри них зависимы.

Интервалы прогноза и параметра

Интервал для среднего ответа и интервал для нового отдельного наблюдения — разные объекты. Даже если среднее энергопотребление известно почти точно, завтрашний час остаётся шумным: для нового YY к неопределённости оценки среднего добавляется собственная вариативность результата.