Обычная регрессия выдаёт одну линию. Байесовская оставляет множество линий, взвешенных по согласованности с данными и prior. Там, где измерений мало, это множество расходится и честно расширяет прогнозный интервал.
Три измерения не определяют одну прямую
Пусть лаборатория измерила зависимость сигнала от концентрации всего в трёх точках. Least squares выберет единственную прямую. Но немного измените шум — наклон заметно сдвинется. Точечный ответ скрывает, что многие близкие линии почти одинаково согласуются с данными.
Запишем модель
и нормальный prior
Prior может выражать умеренные наклоны, известный знак или связь коэффициентов. Для простого изотропного случая , большие веса заранее менее вероятны.
Через область трёх наблюдений проходит пучок линий, выбранных из posterior. Тёмная линия — posterior mean, полоса — 95%-й интервал условного среднего. Внутри диапазона данных линии похожи; слева и справа их наклоны накапливают различие.
Умножение двух нормальных форм
Likelihood по пропорционален
prior —
После раскрытия квадратов показатели складываются в новую квадратичную форму. Posterior остаётся нормальным:
Матрицы точности, обратные ковариациям, складываются: prior приносит , данные — . Это многомерная версия сопряжённого обновления из урока 48.
Эллипс неопределённости весов
Для двух коэффициентов posterior можно нарисовать эллипсами равной плотности. Если признаки почти одинаковы, данные хорошо определяют их сумму, но плохо — разность: likelihood вытянут вдоль диагонали. Prior сжимает гребень, posterior объединяет обе геометрии.
Оси — . Круглый prior ограничивает общую норму, likelihood вытянут вдоль плохо различимого направления коррелированных признаков. Умножение плотностей даёт более короткий posterior-эллипс, но его наклон сохраняет остаточную связь коэффициентов.
Предсказательное распределение
Для нового объекта условное среднее при фиксированных весах равно . Усреднение по posterior даёт
Дисперсия нового наблюдения
Первое слагаемое не исчезает даже при бесконечном числе данных, если процесс сам шумный. Второе уменьшается там, где признаки хорошо измерены, и растёт в направлениях, которые выборка не закрепила. Это точная версия различия между интервалом среднего и интервалом нового объекта из урока 46.
Тёмная полоса показывает квантили по posterior и расширяется вдали от обучающих . Светлая включает дополнительный шум и потому шире даже около точек. Под графиком два цветных слагаемых складываются в полную дисперсию.
Лаборатория интервала
Перемещайте одну точку по оси и смотрите, где полоса сужается. Затем увеличьте шум: внешняя полоса расширится всюду, а posterior весов тоже станет менее определённым. Наконец усилите prior. Линии соберутся около нулевого наклона; проверьте, не подавляет ли это явный сигнал.
Активный выбор измерения
Если новый эксперимент дорог, можно выбрать , который сильнее уменьшит posterior uncertainty. В линейно-нормальной модели одно наблюдение в направлении, где велико, приносит много информации о весах. Так возникает активное обучение: модель не только отвечает, но и предлагает следующий вопрос миру.
Однако точка с максимальной математической неопределённостью может быть физически недоступна или опасна. При калибровке химического датчика нельзя безопасно измерить произвольную концентрацию. Дизайн эксперимента оптимизирует информацию с ограничениями стоимости, этики и диапазона прибора.
Клинический сигнал
Пусть по уровню биомаркера прогнозируется изменение показателя здоровья. Данных мало, признаки коррелированы, а крайние концентрации редки. Нормальный prior удерживает коэффициенты, posterior показывает совместную неопределённость, predictive interval — диапазон для нового пациента.
Но нормальный шум и линейный отклик должны проверяться. Если разброс растёт с тяжестью состояния, нужна . Если есть порог, пригодятся базисы из урока 50. Если важны решения о лечении, одного среднего прогноза мало: порог должен учитывать цену ошибок из урока 57.
Неизвестная дисперсия
До сих пор считалась известной. На практике её тоже оценивают. Сопряжённый Normal-Inverse-Gamma prior даёт аналитический posterior, а предсказательное распределение становится распределением Стьюдента с более тяжёлыми хвостами. Это отражает дополнительное сомнение в масштабе шума.
При малой выборке подстановка одной делает интервалы слишком уверенными. При большой разница уменьшается. Общий принцип: если неизвестная величина влияет на прогноз, её неопределённость нужно либо интегрировать, либо обоснованно показать, что ею можно пренебречь.
Связь с Gaussian process
Линейная модель с prior на веса индуцирует ковариацию значений функции:
Если заменить богатой картой , получим kernel . Gaussian process задаёт prior напрямую на функции через kernel, иногда даже без явного перечисления бесконечного числа базисов.
Близость точек определяется не только расстоянием, а выбранным kernel: периодический связывает одинаковые часы разных суток, гладкий радиальный — близкие координаты, линейный — похожие направления. Это снова показывает, что неопределённость зависит от представления.
Что сообщать в результате
Нужны posterior mean коэффициентов, их совместная неопределённость, predictive intervals и проверки на воспроизведение структуры данных. Полезно показать несколько линий из posterior: они передают зависимость параметров лучше таблицы стандартных отклонений.
Prior описывается предметно и проверяется анализом чувствительности. Граница обучающих признаков отмечается на графике. Если решение принимается вне неё, широкая полоса является сигналом нового измерения, а не приглашением выбрать середину.
Posterior в одномерной регрессии
Пусть модель имеет один вес: , где , а prior . Получено одно измерение , . Posterior precision равна сумме prior precision и информации наблюдения:
Значит, , а среднее
Least squares по одной точке дала бы . Prior стянул оценку к нулю, поскольку одно шумное измерение ещё не перекрывает прежнюю неопределённость. Если повторить то же наблюдение много раз, вклад вырастет, и влияние prior ослабнет.
Для нового входа средний прогноз равен . Дисперсия самой линии составляет , а дисперсия нового измерения добавляет ещё . Поэтому predictive standard deviation равна . Если сообщить только среднее , исчезнут и неопределённость веса, и случайность будущего результата — две разные причины ширины.