Сопряжённый prior выбран так, что после умножения на likelihood posterior остаётся в том же семействе. Это не волшебство и не закон природы: алгебра сводит байесовское обновление к сложению нескольких счётчиков. А заодно из этой алгебры вырастает правило Лапласа — способ не выдавать ноль за уверенность, когда редкое событие пока не случилось.
Ноль аварий не означает нулевой риск
Новая система совершила поездок без единой аварии. Наивная оценка вероятности аварии равна — но принять её буквально значит объявить следующую поездку абсолютно безопасной, а это сильнее данных: конечная серия без аварий совместима с малой, но положительной вероятностью.
Пусть исход поездки — Бернулли с параметром (успехом назовём аварию). При авариях и безопасных поездках . Возьмём сопряжённый prior . После умножения показатели складываются, и posterior снова оказывается Beta:
Предсказание следующего события
Вероятность аварии следующей поездки — это среднее по posterior:
Для равномерного prior получается правило преемственности Лапласа . При нуле аварий из оно даёт , а не ноль: речь не о выдуманной аварии, а об усреднении неизвестного параметра с явным prior.

Posterior вероятности аварии при авариях из : он сосредоточен у нуля, но не в нуле. Предсказание следующей аварии равно — маленькое, но положительное. Наивный ноль был бы уверенностью, которой данные не дают.
Псевдосчётчики: полезная, но неполная метафора
Среднее равно , а сумму называют силой prior. Апостериорное среднее удобно записать как взвешенное среднее prior-среднего и выборочной доли:
Метафора «псевдоуспехи и псевдонеудачи» помогает видеть стягивание к общему уровню. Но она неполна: имеет U-образную плотность и важные свойства инвариантности, хотя «половина успеха» плохо звучит как эксперимент.
Двигайте среднее и силу prior: малые группы стягиваются к общему уровню сильно, крупные — едва заметно. Обратите внимание на группу с нулём событий: её сглаженная оценка не ноль, а маленькое положительное число. Усильте prior, противоречащий данным, и найдите объём, после которого выборка начинает преобладать над предположением.
Неопределённый параметр даёт лишний разброс
Если сначала выбрать из Beta, а затем число успехов из , то после усреднения параметра возникает Beta-Binomial распределение. Его дисперсия больше биномиальной, потому что группы отличаются скрытыми значениями .

Обе кривые имеют среднее из . Синий Binomial предполагает один фиксированный ; красный Beta-Binomial допускает различие параметра между группами и чаще порождает и очень малые, и очень большие счёты. Если между группами разброса больше, чем разрешает одно , — это не «выбросы», а скрытая неоднородность.
Сглаживание в искусственном интеллекте
Та же алгебра спасает наивный байесовский классификатор. Слово, ни разу не встретившееся в одном классе, даёт нулевую оценку вероятности — и одним умножением обнуляет весь продукт признаков. Сглаживание Лапласа прибавляет единицу к каждому счётчику и превращает ноль в маленькое положительное число. Посмотрим на настоящий корпус SMS.

Реальные слова из спама с разным числом появлений в обычных письмах (от у «claim» до у «pm»). Сырая оценка у слова с нулём равна нулю; сглаженная поднимает её к маленькому положительному значению. Так одно невиданное слово перестаёт обнулять весь прогноз наивного байесовского классификатора.
Другие сопряжённые пары
Сопряжённость не ограничена монетой. Для числа редких событий сопряжён Gamma-prior: после суммы событий и времени наблюдения он становится . Счётчики снова складываются: события обновляют форму, время — интенсивность.
::::
Редкие события и цена сильного prior
Препарат применили раз и увидели один тяжёлый побочный эффект. Равномерный prior даёт posterior . Исторические данные по близким препаратам могут подсказать другой prior — но насколько близки препараты, одинаково ли определялось событие, совпадает ли возраст пациентов? Эти вопросы определяют допустимую силу переноса. Сильный ошибочный prior особенно опасен при редких событиях: текущих данных мало, чтобы его преодолеть, поэтому сообщают анализ чувствительности к нескольким разумным prior.
Отсутствие зарегистрированных аварий не равно отсутствию аварий, если часть поездок не попала в журнал или определение события менялось. Сопряжённость облегчает вычисление, но не проверяет процесс наблюдения — это по-прежнему на тебе.
Последовательное обновление без хранения истории
Posterior после первой партии становится prior для второй: для Beta-Binomial параметры просто накапливают успехи и неудачи. При условной независимости итог не зависит от разбиения на партии, и потому мониторинг можно вести, храня лишь достаточные статистики , а не всю историю.
Апостериорное распределение вбирает всю информацию выборки, и для сопряжённых моделей его несут несколько чисел; их обновление по мере поступления данных и есть обучение в чистом виде.
Русская линия ведёт к А. Н. Ширяеву — математику, чьи работы по статистике случайных процессов и последовательному анализу и учебник «Вероятность» воспитали поколения. Его взгляд «апостериор несёт всю информацию, а обновляют несколько достаточных чисел» — ровно то, что делает наш счётчик : сжимает историю без потери, пока модель верна.
Эта же лёгкость последовательного пересчёта делает сопряжённые модели удобными в A/B-тестах: апостериорные доли двух вариантов позволяют в любой момент оценить вероятность превосходства одного над другим и ожидаемую цену ошибочного запуска. Но соблазн остановить эксперимент сразу после красивого результата — это уже вопрос дизайна и контроля отбора, к которому мы вернёмся в уроке об экспериментах; байесовская формула допускает подглядывание, а вот честное решение обязано учитывать потери и качество модели.
Что именно дают обновлённые счётчики
Сопряжённый prior сохраняет алгебраическую форму posterior, и обновление сводится к сложению счётчиков, а предсказание — к их отношению. Правило Лапласа не даёт выдать ноль за уверенность, сглаживание спасает наивный Байес от нулевых вероятностей, а стягивание стабилизирует оценки малых групп. Но сила prior должна иметь предметное обоснование, а закрытая формула не освобождает от проверки неоднородности, зависимости и полноты регистрации данных.
Задачи
Для вероятности успеха задан prior . В испытаниях успехов. Найдите posterior, его среднее и предсказательную вероятность успеха в следующем испытании. Запишите posterior mean как взвешенное среднее prior-среднего и выборочной доли.
В испытаниях отказов не было. Сравните posterior при и . Для каждого найдите вероятность отказа следующего устройства и вероятность двух отказов подряд (условно независимых при фиксированном ), интегрируя . Объясните, почему квадрат posterior mean даёт другой ответ.
Две партии дали отказа из и из . Начните с и обновите сначала первой, затем второй партией; повторите в обратном порядке и одним объединённым обновлением. Покажите равенство и назовите условие, без которого объединение содержательно неверно.
Число заявок за час — Пуассон с интенсивностью , prior с . За часов зарегистрировано заявки. Выведите posterior , найдите его среднее и предсказательное среднее числа заявок в следующие два часа. Поясните единицы параметра .
Пять школ сообщили доли победителей: , , , , . С общим prior найдите posterior mean каждой. Постройте таблицу «сырая доля — сглаженная — сила сдвига» и объясните, почему одинаковый prior сильнее влияет на малые школы, и какое нарушение модели возникнет, если школы систематически различаются по отбору учеников.
На реальном корпусе SMS слово «claim» встречается в обычных письмах при обычных. Сравните сырую оценку и сглажённую . Объясните, почему в наивном байесовском классификаторе сырой ноль обнуляет весь продукт признаков, а сглаживание этого избегает. Как выбор добавляемой константы влияет на редкие слова?
Докажите, что апостериорное среднее — это выпуклая комбинация prior-среднего и выборочной доли . Найдите веса, покажите, что они неотрицательны и в сумме дают единицу, и что при вес данных стремится к единице. Свяжите это со «стягиванием» малых групп.
Пусть параметр каждой из групп берётся из общего , а данные группы — из . Покажите, что маргинальное распределение числа успехов группы — Beta-Binomial, и что его дисперсия превышает биномиальную. Объясните, как из наблюдаемой сверхдисперсии оценить силу общего prior и почему это форма иерархической модели.