Байесовский вывод хранит не одну лучшую оценку, а целое распределение неизвестного параметра. Данные умножают прежнее распределение на правдоподобие; после нормировки получается новая карта неопределённости. Это прямое продолжение формулы Байеса и правдоподобия, только теперь неизвестен не исход, а сам параметр модели.
Две монеты и честное предварительное знание
На столе две внешне одинаковые монеты. Про первую известно, что её вероятность орла близка к ; вторую изготовили на экспериментальном станке, и её свойства неизвестны. Обе дали три орла в четырёх бросках. Максимум правдоподобия в обоих случаях даёт — но байесовский подход различит ситуации, потому что явно записывает знание до данных.
Параметр считают величиной с априорной плотностью . Для наблюдений :
Числитель объединяет prior и likelihood, знаменатель делает площадь posterior равной единице. Это важно: все три кривые — настоящие плотности, а не перерисованные к общей высоте.

Синий prior сосредоточен около , золотое правдоподобие тянет к , красный posterior — их нормированное произведение со средним . Все три показаны как плотности площади один: posterior не перенормирован к пику, а честно взвешивает prior и данные.
Три распределения, три роли
Prior описывает неопределённость до выборки. Likelihood — функция параметра при фиксированных данных. Posterior — распределение после обновления. Одинаковые по форме кривые играют разные логические роли, и путать их нельзя: likelihood не есть «вероятность параметра», байесовская вероятность параметра возникает только после задания prior и нормировки.
Обновление в шансах
Для двух гипотез формула прозрачна: posterior odds равны prior odds, умноженным на Bayes factor:
Каждый новый независимый пакет данных добавляет к логарифму шансов логарифм отношения правдоподобий — та же механика, что защищала от ошибки прокурора, теперь как общая схема обучения. Если данные не различают гипотезы, Bayes factor близок к единице и шансы почти не меняются; если наблюдение гораздо вероятнее при одной из гипотез, оно резко сдвигает шансы в её пользу. Удобство логарифмической записи в том, что накопление улик превращается в сложение: слабые независимые свидетельства складываются и вместе могут пересилить даже уверенный prior, а сильное одиночное наблюдение видно как большой скачок.
::::
Сила prior решает, кто победит
Насколько данные сдвинут веру, зависит от силы prior. Слабый prior уступает данным, сильный почти не двигается.

Одни и те же данные : слабый сдвигается к , а сильный едва отходит от к . Сильный prior ведёт себя как крупный объём прежних свидетельств.
равнозначен сотне прошлых наблюдений. Если за ним нет воспроизводимых измерений или инженерного ограничения, красивая узкая кривая лишь маскирует уверенное мнение — и его стоит назвать вслух, а не прятать в prior.
Потрогай обновление
Задайте слабый симметричный prior и добавляйте наблюдения: следите не только за движением среднего, но и за сужением распределения. Затем поставьте prior, противоречащий данным, и посмотрите, сколько однотипных наблюдений нужно, чтобы posterior пересёк середину — это число делает силу исходного предположения наглядной.
Байес на реальных данных
Метод работает не только на монетах. Оценим долю спама на настоящем корпусе SMS. Начнём с равномерного prior и будем добавлять сообщения порциями.
![Апостериорные плотности доли спама после равномерного prior и данных n=50, 500 и 5574: с ростом объёма кривая становится всё уже и концентрируется около 0,134, синим отмечен 95-процентный credible-интервал [0,125; 0,143]](/figures/lessons/47/sequential_real.png)
Равномерный prior превращается во всё более узкий posterior по мере поступления реальных SMS: после всех сообщений он сосредоточен около доли спама с credible-интервалом . Данные быстро подавили безразличный prior.
Мы обновили prior сначала первой половиной сообщений, потом второй. Совпадёт ли результат с обновлением сразу всей выборкой?
Показать ответ
Да, при условной независимости наблюдений. Posterior пропорционален , а умножение коммутативно и ассоциативно, поэтому порядок и разбиение честных данных не меняют итог. Сегодняшний posterior становится завтрашним prior. Свойство ломается, если наблюдения зависимы — тогда , и перемножать нельзя.
Интервал с прямым вероятностным смыслом
По posterior находят числа , для которых . Это credible interval: при принятой модели и prior параметр лежит в нём с апостериорной вероятностью . Он логически отличается от доверительного интервала, чьё -е свойство относится к серии случайных границ. При большой выборке и слабом prior границы численно похожи, но интерпретации разные: байесовское утверждение условно на модели и prior, частотное — на процедуре повторения.

Вероятность не существует сама по себе как свойство мира; она есть выражение нашего ожидания, согласованного с наблюдениями по правилам вероятностного исчисления.
Предсказание нового наблюдения
Чтобы предсказать новый ответ , параметр нельзя заменить одной оценкой — нужно усреднить прогнозы по всей апостериорной неопределённости:
Это апостериорное предсказательное распределение: оно включает и случайность нового результата, и неопределённость параметра.

Почему обычно не равно ? Приведите пример с и двумя равновероятными значениями параметра.
Показать ответ
Из-за нелинейности . Пусть равновероятно равен или : тогда , и . Но . Значения не совпадают. Поэтому в нелинейной модели подставлять среднее параметра в прогноз нельзя — надо усреднять сами прогнозы, как и делает предсказательное распределение.
::::
Модель тоже является гипотезой
Формула Байеса условна на выбранном likelihood. Если монета меняет вероятность орла со временем, один постоянный — неверное описание, и узкий posterior означает лишь уверенность внутри тесной модели. Проверяют это апостериорной предсказательной проверкой (posterior predictive check): строят искусственные данные из обученной модели и сравнивают их статистики с наблюдаемыми — длину серий, изменение доли по времени, число переходов. Совпадение общей доли не гарантирует совпадения структуры.
Оптимальная оценка есть условное среднее при известных наблюдениях; каждое новое измерение уточняет апостериорное распределение, и ценность информации измеряется тем, насколько оно сужается.
Русская линия ведёт к Р. Л. Стратоновичу — физику и математику, создателю теории нелинейной фильтрации и байесовского оценивания в реальном времени. Его взгляд «оценка — это условное среднее, а измерение сужает апостериор» — ровно то, что делает наш последовательный расчёт на SMS, только там параметр менялся бы во времени.
Итоговая схема байесовского вывода
Байесовский вывод начинается с порождающей модели: как параметр порождает наблюдения. Prior кодирует знание и ограничения до данных; likelihood сообщает, какие значения лучше объясняют увиденное; posterior соединяет оба источника; credible interval описывает неопределённость параметра, а предсказательное распределение переносит её на будущие события. Каждый слой обсуждается и проверяется отдельно — и честный анализ повторяют с несколькими разумными prior: если вывод устойчив, prior перестал играть главную роль, а если меняется, это сообщают как зависимость от неразрешённого предположения. Для сложных моделей интеграл в знаменателе не берётся вручную, и его считают численно — сеткой, методами Монте-Карло по цепям Маркова или вариационным приближением, — но вычислительная трудность не меняет сути: отделить прежнее знание, механизм данных и итоговое заключение.
Задачи
Для монеты выбран prior . В десяти бросках выпало семь орлов. Запишите posterior, найдите его среднее и вероятность следующего орла. Сравните posterior mean с MLE и объясните направление различия.
Две модели имеют prior odds в пользу . Наблюдение даёт и . Найдите Bayes factor, posterior odds и апостериорную вероятность . Затем поступило условно независимое наблюдение с Bayes factor ; обновите шансы второй раз.
Инженер считает вероятность отказа близкой к и берёт prior . В испытаниях отказов нет. Найдите posterior и вероятность отказа следующего компонента. Повторите для равномерного prior и объясните, какие прежние данные оправдывают первый prior.
Последовательность бросков содержит орлов, но первые дали орлов, а последние — . Модель постоянного с prior хорошо воспроизводит общую долю. Предложите posterior predictive check, использующий порядок, и статистику, обнаруживающую смену режима. Опишите альтернативную модель с двумя параметрами и неизвестной точкой переключения.
Три школы сообщили доли сдачи: , , . Объясните, почему отдельные MLE одинаковы, но различаются по неопределённости. Спроектируйте иерархическую Beta-Binomial модель: параметры школьного уровня, общий prior, предсказательную величину для новой школы. Без вычислений объясните ожидаемое направление стягивания трёх оценок.
На реальном корпусе SMS ( спам из ) с prior запишите posterior доли спама, его среднее и приближённый credible-интервал. Сравните с MLE и с доверительным интервалом Вальда из урока 46: совпадают ли границы численно и в чём различие интерпретаций?
Покажите, что при сопряжённом Beta-priorе апостериорное среднее — это взвешенное среднее априорного среднего и доли данных . Найдите веса и объясните, почему с ростом вес данных стремится к единице, а prior перестаёт влиять.
Докажите, что последовательное обновление не зависит от разбиения данных: для условно независимых покажите , и что обновление сначала , затем даёт тот же posterior, что и разовое обновление . Объясните, при каком нарушении независимости это свойство ломается.