Сопряжённый prior выбран так, что после умножения на likelihood posterior остаётся в том же семействе. Это не волшебство и не закон природы: алгебра сводит байесовское обновление к сложению нескольких счётчиков. А заодно из этой алгебры вырастает правило Лапласа — способ не выдавать ноль за уверенность, когда редкое событие пока не случилось.

Ноль аварий не означает нулевой риск

Новая система совершила 2000020\,000 поездок без единой аварии. Наивная оценка вероятности аварии равна 0/20000=00/20000=0 — но принять её буквально значит объявить следующую поездку абсолютно безопасной, а это сильнее данных: конечная серия без аварий совместима с малой, но положительной вероятностью.

Пусть исход поездки — Бернулли с параметром θ\theta (успехом назовём аварию). При hh авариях и tt безопасных поездках L(θ)θh(1θ)tL(\theta)\propto\theta^h(1-\theta)^t. Возьмём сопряжённый prior Beta(α,β)θα1(1θ)β1\operatorname{Beta}(\alpha,\beta)\propto\theta^{\alpha-1}(1-\theta)^{\beta-1}. После умножения показатели складываются, и posterior снова оказывается Beta:

p(θD)θα+h1(1θ)β+t1,θDBeta(α+h,β+t).p(\theta\mid D)\propto\theta^{\alpha+h-1}(1-\theta)^{\beta+t-1},\qquad \theta\mid D\sim\operatorname{Beta}(\alpha+h,\,\beta+t).

Предсказание следующего события

Вероятность аварии следующей поездки — это среднее θ\theta по posterior:

P(Xn+1=1D)=01θp(θD)dθ=α+hα+β+h+t.P(X_{n+1}=1\mid D)=\int_0^1\theta\,p(\theta\mid D)\,d\theta=\frac{\alpha+h}{\alpha+\beta+h+t}.

Для равномерного prior Beta(1,1)\operatorname{Beta}(1,1) получается правило преемственности Лапласа h+1n+2\dfrac{h+1}{n+2}. При нуле аварий из 2000020\,000 оно даёт 1/200021/20002, а не ноль: речь не о выдуманной аварии, а об усреднении неизвестного параметра с явным prior.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Апостериорная плотность Beta(1, 20001) вероятности аварии круто убывает от нуля; вертикальный пунктир и формула показывают, что вероятность следующей аварии равна единице делить на 20002, а не нулю
Рис. 48.1. Правило Лапласа при нуле событий

Posterior вероятности аварии при 00 авариях из 2000020\,000: он сосредоточен у нуля, но не в нуле. Предсказание следующей аварии равно 0+120000+21/20002\dfrac{0+1}{20000+2}\approx1/20002 — маленькое, но положительное. Наивный ноль был бы уверенностью, которой данные не дают.

Псевдосчётчики: полезная, но неполная метафора

Среднее Beta(α,β)\operatorname{Beta}(\alpha,\beta) равно α/(α+β)\alpha/(\alpha+\beta), а сумму α+β\alpha+\beta называют силой prior. Апостериорное среднее удобно записать как взвешенное среднее prior-среднего и выборочной доли:

E(θD)=α+βα+β+nαα+β+nα+β+nhn.\mathbb E(\theta\mid D)=\frac{\alpha+\beta}{\alpha+\beta+n}\cdot\frac{\alpha}{\alpha+\beta} +\frac{n}{\alpha+\beta+n}\cdot\frac hn.

Метафора «псевдоуспехи и псевдонеудачи» помогает видеть стягивание к общему уровню. Но она неполна: Beta(1/2,1/2)\operatorname{Beta}(1/2,1/2) имеет U-образную плотность и важные свойства инвариантности, хотя «половина успеха» плохо звучит как эксперимент.

Двигайте среднее и силу prior: малые группы стягиваются к общему уровню сильно, крупные — едва заметно. Обратите внимание на группу с нулём событий: её сглаженная оценка не ноль, а маленькое положительное число. Усильте prior, противоречащий данным, и найдите объём, после которого выборка начинает преобладать над предположением.

Неопределённый параметр даёт лишний разброс

Если сначала выбрать θ\theta из Beta, а затем число успехов из Binomial(n,θ)\operatorname{Binomial}(n,\theta), то после усреднения параметра возникает Beta-Binomial распределение. Его дисперсия больше биномиальной, потому что группы отличаются скрытыми значениями θ\theta.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Два распределения числа успехов из 50 с одним средним 10: синее биномиальное узкое, красное Beta-Binomial заметно шире и с более тяжёлыми хвостами
Рис. 48.2. Биномиальный и Beta-Binomial разброс

Обе кривые имеют среднее 1010 из 5050. Синий Binomial предполагает один фиксированный p=0,2p=0{,}2; красный Beta-Binomial допускает различие параметра между группами и чаще порождает и очень малые, и очень большие счёты. Если между группами разброса больше, чем разрешает одно pp, — это не «выбросы», а скрытая неоднородность.

Сглаживание в искусственном интеллекте

Та же алгебра спасает наивный байесовский классификатор. Слово, ни разу не встретившееся в одном классе, даёт нулевую оценку вероятности — и одним умножением обнуляет весь продукт признаков. Сглаживание Лапласа прибавляет единицу к каждому счётчику и превращает ноль в маленькое положительное число. Посмотрим на настоящий корпус SMS.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Горизонтальные столбцы оценки P(слово при условии не спам) для реальных слов с разным числом появлений в обычных письмах: сырая оценка равна нулю у слова claim, а сглажённая даёт маленькие положительные значения
Рис. 48.3. Сглаживание на реальных SMS

Реальные слова из спама с разным числом появлений в обычных письмах (от 00 у «claim» до 2424 у «pm»). Сырая оценка c/nc/n у слова с нулём равна нулю; сглаженная (c+1)/(n+2)(c+1)/(n+2) поднимает её к маленькому положительному значению. Так одно невиданное слово перестаёт обнулять весь прогноз наивного байесовского классификатора.

Другие сопряжённые пары

Сопряжённость не ограничена монетой. Для числа редких событий KPoisson(λ)K\sim\operatorname{Poisson} (\lambda) сопряжён Gamma-prior: после суммы событий SS и времени наблюдения TT он становится Gamma(a+S,b+T)\operatorname{Gamma}(a+S,\,b+T). Счётчики снова складываются: события обновляют форму, время — интенсивность.

::::

Редкие события и цена сильного prior

Препарат применили 200200 раз и увидели один тяжёлый побочный эффект. Равномерный prior даёт posterior Beta(2,200)\operatorname{Beta}(2,200). Исторические данные по близким препаратам могут подсказать другой prior — но насколько близки препараты, одинаково ли определялось событие, совпадает ли возраст пациентов? Эти вопросы определяют допустимую силу переноса. Сильный ошибочный prior особенно опасен при редких событиях: текущих данных мало, чтобы его преодолеть, поэтому сообщают анализ чувствительности к нескольким разумным prior.

Последовательное обновление без хранения истории

Posterior после первой партии становится prior для второй: для Beta-Binomial параметры просто накапливают успехи и неудачи. При условной независимости итог не зависит от разбиения на партии, и потому мониторинг можно вести, храня лишь достаточные статистики h,th,t, а не всю историю.

Русская линия ведёт к А. Н. Ширяеву — математику, чьи работы по статистике случайных процессов и последовательному анализу и учебник «Вероятность» воспитали поколения. Его взгляд «апостериор несёт всю информацию, а обновляют несколько достаточных чисел» — ровно то, что делает наш счётчик h,th,t: сжимает историю без потери, пока модель верна.

Эта же лёгкость последовательного пересчёта делает сопряжённые модели удобными в A/B-тестах: апостериорные доли двух вариантов позволяют в любой момент оценить вероятность превосходства одного над другим и ожидаемую цену ошибочного запуска. Но соблазн остановить эксперимент сразу после красивого результата — это уже вопрос дизайна и контроля отбора, к которому мы вернёмся в уроке об экспериментах; байесовская формула допускает подглядывание, а вот честное решение обязано учитывать потери и качество модели.

Что именно дают обновлённые счётчики

Сопряжённый prior сохраняет алгебраическую форму posterior, и обновление сводится к сложению счётчиков, а предсказание — к их отношению. Правило Лапласа не даёт выдать ноль за уверенность, сглаживание спасает наивный Байес от нулевых вероятностей, а стягивание стабилизирует оценки малых групп. Но сила prior должна иметь предметное обоснование, а закрытая формула не освобождает от проверки неоднородности, зависимости и полноты регистрации данных.

Задачи