Байесовский вывод хранит не одну лучшую оценку, а целое распределение неизвестного параметра. Данные умножают прежнее распределение на правдоподобие; после нормировки получается новая карта неопределённости. Это прямое продолжение формулы Байеса и правдоподобия, только теперь неизвестен не исход, а сам параметр модели.

Две монеты и честное предварительное знание

На столе две внешне одинаковые монеты. Про первую известно, что её вероятность орла близка к 1/21/2; вторую изготовили на экспериментальном станке, и её свойства неизвестны. Обе дали три орла в четырёх бросках. Максимум правдоподобия в обоих случаях даёт p^=3/4\widehat p=3/4 — но байесовский подход различит ситуации, потому что явно записывает знание до данных.

Параметр θ\theta считают величиной с априорной плотностью p(θ)p(\theta). Для наблюдений DD:

p(θD)=p(Dθ)p(θ)p(Du)p(u)dup(Dθ)p(θ).p(\theta\mid D)=\frac{p(D\mid\theta)\,p(\theta)}{\int p(D\mid u)\,p(u)\,du}\propto p(D\mid\theta)\,p(\theta).

Числитель объединяет prior и likelihood, знаменатель делает площадь posterior равной единице. Это важно: все три кривые — настоящие плотности, а не перерисованные к общей высоте.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три кривые на одной оси вероятности орла: синий prior Beta(2,2) с вершиной у 0,5, золотое пунктирное правдоподобие 3 из 4 с вершиной у 0,75 и красный posterior Beta(5,3) между ними; все нормированы как плотности площади один
Рис. 47.1. Обновление как произведение плотностей

Синий prior сосредоточен около 0,50{,}5, золотое правдоподобие тянет к 0,750{,}75, красный posterior — их нормированное произведение со средним 0,6250{,}625. Все три показаны как плотности площади один: posterior не перенормирован к пику, а честно взвешивает prior и данные.

Три распределения, три роли

Prior p(θ)p(\theta) описывает неопределённость до выборки. Likelihood p(Dθ)p(D\mid\theta) — функция параметра при фиксированных данных. Posterior p(θD)p(\theta\mid D) — распределение после обновления. Одинаковые по форме кривые играют разные логические роли, и путать их нельзя: likelihood не есть «вероятность параметра», байесовская вероятность параметра возникает только после задания prior и нормировки.

Обновление в шансах

Для двух гипотез формула прозрачна: posterior odds равны prior odds, умноженным на Bayes factor:

P(H1D)P(H0D)=P(H1)P(H0)P(DH1)P(DH0).\frac{P(H_1\mid D)}{P(H_0\mid D)}=\frac{P(H_1)}{P(H_0)}\cdot\frac{P(D\mid H_1)}{P(D\mid H_0)}.

Каждый новый независимый пакет данных добавляет к логарифму шансов логарифм отношения правдоподобий — та же механика, что защищала от ошибки прокурора, теперь как общая схема обучения. Если данные не различают гипотезы, Bayes factor близок к единице и шансы почти не меняются; если наблюдение гораздо вероятнее при одной из гипотез, оно резко сдвигает шансы в её пользу. Удобство логарифмической записи в том, что накопление улик превращается в сложение: слабые независимые свидетельства складываются и вместе могут пересилить даже уверенный prior, а сильное одиночное наблюдение видно как большой скачок.

::::

Сила prior решает, кто победит

Насколько данные сдвинут веру, зависит от силы prior. Слабый prior уступает данным, сильный почти не двигается.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Две панели. Слева слабый prior Beta(2,2) и его posterior заметно сдвинут к 0,62. Справа сильный prior Beta(50,50) и его posterior едва отошёл от 0,5 до 0,51
Рис. 47.2. Слабый и сильный prior при одних данных

Одни и те же данные 3/43/4: слабый Beta(2,2)\operatorname{Beta}(2,2) сдвигается к 0,620{,}62, а сильный Beta(50,50)\operatorname{Beta}(50,50) едва отходит от 0,50{,}5 к 0,510{,}51. Сильный prior ведёт себя как крупный объём прежних свидетельств.

Потрогай обновление

Prior, правдоподобие и posterior на одной оси

Загружается живая иллюстрация…

Задайте слабый симметричный prior и добавляйте наблюдения: следите не только за движением среднего, но и за сужением распределения. Затем поставьте prior, противоречащий данным, и посмотрите, сколько однотипных наблюдений нужно, чтобы posterior пересёк середину — это число делает силу исходного предположения наглядной.

Байес на реальных данных

Метод работает не только на монетах. Оценим долю спама на настоящем корпусе SMS. Начнём с равномерного prior Beta(1,1)\operatorname{Beta}(1,1) и будем добавлять сообщения порциями.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Апостериорные плотности доли спама после равномерного prior и данных n=50, 500 и 5574: с ростом объёма кривая становится всё уже и концентрируется около 0,134, синим отмечен 95-процентный credible-интервал [0,125; 0,143]
Рис. 47.3. Последовательное обновление на реальных SMS

Равномерный prior превращается во всё более узкий posterior по мере поступления реальных SMS: после всех 55745574 сообщений он сосредоточен около доли спама 0,1340{,}134 с 95%95\% credible-интервалом [0,125;0,143][0{,}125;\,0{,}143]. Данные быстро подавили безразличный prior.

Интервал с прямым вероятностным смыслом

По posterior находят числа a,ba,b, для которых P(aθbD)=0,95P(a\le\theta\le b\mid D)=0{,}95. Это 95%95\% credible interval: при принятой модели и prior параметр лежит в нём с апостериорной вероятностью 0,950{,}95. Он логически отличается от доверительного интервала, чьё 95%95\%-е свойство относится к серии случайных границ. При большой выборке и слабом prior границы численно похожи, но интерпретации разные: байесовское утверждение условно на модели и prior, частотное — на процедуре повторения.

Предсказание нового наблюдения

Чтобы предсказать новый ответ Y~\widetilde Y, параметр нельзя заменить одной оценкой — нужно усреднить прогнозы по всей апостериорной неопределённости:

p(y~D)=p(y~θ)p(θD)dθ.p(\widetilde y\mid D)=\int p(\widetilde y\mid\theta)\,p(\theta\mid D)\,d\theta.

Это апостериорное предсказательное распределение: оно включает и случайность нового результата, и неопределённость параметра.

::::

Модель тоже является гипотезой

Формула Байеса условна на выбранном likelihood. Если монета меняет вероятность орла со временем, один постоянный θ\theta — неверное описание, и узкий posterior означает лишь уверенность внутри тесной модели. Проверяют это апостериорной предсказательной проверкой (posterior predictive check): строят искусственные данные DrepD^{\text{rep}} из обученной модели и сравнивают их статистики с наблюдаемыми — длину серий, изменение доли по времени, число переходов. Совпадение общей доли не гарантирует совпадения структуры.

Русская линия ведёт к Р. Л. Стратоновичу — физику и математику, создателю теории нелинейной фильтрации и байесовского оценивания в реальном времени. Его взгляд «оценка — это условное среднее, а измерение сужает апостериор» — ровно то, что делает наш последовательный расчёт на SMS, только там параметр менялся бы во времени.

Итоговая схема байесовского вывода

Байесовский вывод начинается с порождающей модели: как параметр порождает наблюдения. Prior кодирует знание и ограничения до данных; likelihood сообщает, какие значения лучше объясняют увиденное; posterior соединяет оба источника; credible interval описывает неопределённость параметра, а предсказательное распределение переносит её на будущие события. Каждый слой обсуждается и проверяется отдельно — и честный анализ повторяют с несколькими разумными prior: если вывод устойчив, prior перестал играть главную роль, а если меняется, это сообщают как зависимость от неразрешённого предположения. Для сложных моделей интеграл в знаменателе не берётся вручную, и его считают численно — сеткой, методами Монте-Карло по цепям Маркова или вариационным приближением, — но вычислительная трудность не меняет сути: отделить прежнее знание, механизм данных и итоговое заключение.

Задачи