Обычная регрессия выдаёт одну линию. Байесовская оставляет множество линий, взвешенных по согласованности с данными и prior. Там, где измерений мало, это множество расходится и честно расширяет прогнозный интервал.

Три измерения не определяют одну прямую

Пусть лаборатория измерила зависимость сигнала yy от концентрации xx всего в трёх точках. Least squares выберет единственную прямую. Но немного измените шум — наклон заметно сдвинется. Точечный ответ скрывает, что многие близкие линии почти одинаково согласуются с данными.

Запишем модель

y=Xw+ε,εN(0,σ2I)y=Xw+\varepsilon,\qquad \varepsilon\sim N(0,\sigma^2I)

и нормальный prior

wN(m0,S0).w\sim N(m_0,S_0).

Prior может выражать умеренные наклоны, известный знак или связь коэффициентов. Для простого изотропного случая m0=0m_0=0, S0=τ2IS_0=\tau^2I большие веса заранее менее вероятны.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три точки и множество полупрозрачных прямых, густых около среднего прогноза и расходящихся вдали
Рис. 52.1. Не одна линия, а posterior линий

Через область трёх наблюдений проходит пучок линий, выбранных из posterior. Тёмная линия — posterior mean, полоса — 95%-й интервал условного среднего. Внутри диапазона данных линии похожи; слева и справа их наклоны накапливают различие.

Умножение двух нормальных форм

Likelihood по ww пропорционален

exp[12σ2(yXw)(yXw)],\exp\left[-\frac1{2\sigma^2}(y-Xw)^\top(y-Xw)\right],

prior —

exp[12(wm0)S01(wm0)].\exp\left[-\frac12(w-m_0)^\top S_0^{-1}(w-m_0)\right].

После раскрытия квадратов показатели складываются в новую квадратичную форму. Posterior остаётся нормальным:

Sn1=S01+1σ2XX,S_n^{-1}=S_0^{-1}+\frac1{\sigma^2}X^\top X, mn=Sn(S01m0+1σ2Xy),m_n=S_n\left(S_0^{-1}m_0+\frac1{\sigma^2}X^\top y\right), wDN(mn,Sn).w\mid D\sim N(m_n,S_n).

Матрицы точности, обратные ковариациям, складываются: prior приносит S01S_0^{-1}, данные — XX/σ2X^\top X/\sigma^2. Это многомерная версия сопряжённого обновления из урока 48.

Эллипс неопределённости весов

Для двух коэффициентов posterior можно нарисовать эллипсами равной плотности. Если признаки почти одинаковы, данные хорошо определяют их сумму, но плохо — разность: likelihood вытянут вдоль диагонали. Prior сжимает гребень, posterior объединяет обе геометрии.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три панели контуров двух коэффициентов: круглый prior, вытянутый likelihood и более компактный posterior
Рис. 52.2. Prior, likelihood и posterior в пространстве весов

Оси — w1,w2w_1,w_2. Круглый prior ограничивает общую норму, likelihood вытянут вдоль плохо различимого направления коррелированных признаков. Умножение плотностей даёт более короткий posterior-эллипс, но его наклон сохраняет остаточную связь коэффициентов.

Предсказательное распределение

Для нового объекта xx_* условное среднее при фиксированных весах равно xwx_*^\top w. Усреднение по posterior даёт

E[yx,D]=xmn.\mathbb E[y_*\mid x_*,D]=x_*^\top m_n.

Дисперсия нового наблюдения

Var(yx,D)=σ2шум объекта+xSnxнеопределённость весов.\operatorname{Var}(y_*\mid x_*,D)= \underbrace{\sigma^2}_{\text{шум объекта}}+ \underbrace{x_*^\top S_nx_*}_{\text{неопределённость весов}}.

Первое слагаемое не исчезает даже при бесконечном числе данных, если процесс сам шумный. Второе уменьшается там, где признаки хорошо измерены, и растёт в направлениях, которые выборка не закрепила. Это точная версия различия между интервалом среднего и интервалом нового объекта из урока 46.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Регрессионная линия с узкой полосой неопределенности среднего и более широкой полосой нового наблюдения
Рис. 52.3. Два слоя предсказательной неопределённости

Тёмная полоса показывает квантили xwx^\top w по posterior и расширяется вдали от обучающих xx. Светлая включает дополнительный шум σ2\sigma^2 и потому шире даже около точек. Под графиком два цветных слагаемых складываются в полную дисперсию.

Лаборатория интервала

Точки, posterior прямых и расширение вдали

Загружается живая иллюстрация…

Перемещайте одну точку по оси xx и смотрите, где полоса сужается. Затем увеличьте шум: внешняя полоса расширится всюду, а posterior весов тоже станет менее определённым. Наконец усилите prior. Линии соберутся около нулевого наклона; проверьте, не подавляет ли это явный сигнал.

Активный выбор измерения

Если новый эксперимент дорог, можно выбрать xx, который сильнее уменьшит posterior uncertainty. В линейно-нормальной модели одно наблюдение в направлении, где xSnxx^\top S_nx велико, приносит много информации о весах. Так возникает активное обучение: модель не только отвечает, но и предлагает следующий вопрос миру.

Однако точка с максимальной математической неопределённостью может быть физически недоступна или опасна. При калибровке химического датчика нельзя безопасно измерить произвольную концентрацию. Дизайн эксперимента оптимизирует информацию с ограничениями стоимости, этики и диапазона прибора.

Клинический сигнал

Пусть по уровню биомаркера прогнозируется изменение показателя здоровья. Данных мало, признаки коррелированы, а крайние концентрации редки. Нормальный prior удерживает коэффициенты, posterior показывает совместную неопределённость, predictive interval — диапазон для нового пациента.

Но нормальный шум и линейный отклик должны проверяться. Если разброс растёт с тяжестью состояния, нужна σ(x)\sigma(x). Если есть порог, пригодятся базисы из урока 50. Если важны решения о лечении, одного среднего прогноза мало: порог должен учитывать цену ошибок из урока 57.

Неизвестная дисперсия

До сих пор σ2\sigma^2 считалась известной. На практике её тоже оценивают. Сопряжённый Normal-Inverse-Gamma prior даёт аналитический posterior, а предсказательное распределение становится распределением Стьюдента с более тяжёлыми хвостами. Это отражает дополнительное сомнение в масштабе шума.

При малой выборке подстановка одной σ^\widehat\sigma делает интервалы слишком уверенными. При большой разница уменьшается. Общий принцип: если неизвестная величина влияет на прогноз, её неопределённость нужно либо интегрировать, либо обоснованно показать, что ею можно пренебречь.

Связь с Gaussian process

Линейная модель с prior на веса индуцирует ковариацию значений функции:

Cov(f(x),f(x))=xS0x.\operatorname{Cov}(f(x),f(x'))=x^\top S_0x'.

Если заменить xx богатой картой ϕ(x)\phi(x), получим kernel k(x,x)=ϕ(x)S0ϕ(x)k(x,x')=\phi(x)^\top S_0\phi(x'). Gaussian process задаёт prior напрямую на функции через kernel, иногда даже без явного перечисления бесконечного числа базисов.

Близость точек определяется не только расстоянием, а выбранным kernel: периодический связывает одинаковые часы разных суток, гладкий радиальный — близкие координаты, линейный — похожие направления. Это снова показывает, что неопределённость зависит от представления.

Что сообщать в результате

Нужны posterior mean коэффициентов, их совместная неопределённость, predictive intervals и проверки на воспроизведение структуры данных. Полезно показать несколько линий из posterior: они передают зависимость параметров лучше таблицы стандартных отклонений.

Prior описывается предметно и проверяется анализом чувствительности. Граница обучающих признаков отмечается на графике. Если решение принимается вне неё, широкая полоса является сигналом нового измерения, а не приглашением выбрать середину.

Posterior в одномерной регрессии

Пусть модель имеет один вес: y=xw+εy=xw+\varepsilon, где εN(0,4)\varepsilon\sim N(0,4), а prior wN(0,1)w\sim N(0,1). Получено одно измерение x=2x=2, y=6y=6. Posterior precision равна сумме prior precision и информации наблюдения:

SN1=1+x24=2.S_N^{-1}=1+\frac{x^2}{4}=2.

Значит, SN=0,5S_N=0{,}5, а среднее

mN=SNxy4=0,5124=1,5.m_N=S_N\frac{xy}{4} =0{,}5\cdot\frac{12}{4}=1{,}5.

Least squares по одной точке дала бы w=3w=3. Prior стянул оценку к нулю, поскольку одно шумное измерение ещё не перекрывает прежнюю неопределённость. Если повторить то же наблюдение много раз, вклад XX/σ2X^\top X/\sigma^2 вырастет, и влияние prior ослабнет.

Для нового входа x=3x_*=3 средний прогноз равен 4,54{,}5. Дисперсия самой линии составляет x2SN=4,5x_*^2S_N=4{,}5, а дисперсия нового измерения добавляет ещё 44. Поэтому predictive standard deviation равна 8,52,92\sqrt{8{,}5}\approx2{,}92. Если сообщить только среднее 4,54{,}5, исчезнут и неопределённость веса, и случайность будущего результата — две разные причины ширины.

Задачи