Почему максимум правдоподобия приводит к сумме квадратов?
Сумма квадратов — не ритуал построения прямой. Она возникает, если наблюдаемый ответ равен
линейному прогнозу плюс независимый нормальный шум одинакового масштаба. Это прямое следствие
максимума правдоподобия: измените историю о шуме — изменится и разумная
оптимизация. А заодно окажется, что метод наименьших квадратов — это ортогональная проекция, и
что одно число R2 никогда не заменит взгляда на остатки.
Линия среди облака точек
Возьмём величину, которая заметно зависит от условия, — число поездок велопроката в час против
температуры. Связь видна на глаз: теплее — больше поездок, но при одной и той же температуре
разброс огромен (день недели, час, погода). Запишем модель yi=w0+w1xi+εi, где
линия w0+w1x описывает условный центр ответа, а остаток ei=yi−yi — вертикальное
расхождение конкретного наблюдения с прогнозом.
Рис. 49.1. Линия наименьших квадратов на реальных данных
Реальные данные велопроката: каждая точка — час наблюдения. Красная линия наименьших квадратов
объясняет R2≈0,16 разброса поездок — температура важна, но далеко не единственный
фактор. Видно и «веер»: при высокой температуре разброс больше, о чём мы вспомним при
диагностике.
Вероятностная модель наблюдения
Предположим εi∼N(0,σ2) независимо. Тогда условная плотность ответа
гауссова, и логарифм правдоподобия равен
ℓ(w,σ)=−nlogσ−2nlog(2π)−2σ21i=1∑n(yi−w⊤xi)2,
где в вектор признаков включена единица для свободного члена. При фиксированной σ первые
два слагаемых не зависят от w, поэтому максимум правдоподобия совпадает с минимумом суммы
квадратов:
wMLE=argwmini=1∑n(yi−w⊤xi)2.
Нулевое среднее ошибки утверждает, что линия попадает в условное среднее; общая σ —
одинаковый масштаб разброса при любом x; независимость разрешает перемножить плотности строк.
Квадратичная ошибка кодирует именно эти предположения о хвостах и масштабе.
Если столбцы линейно независимы, формально w=(X⊤X)−1X⊤y; но матрицу обычно
не обращают, а используют QR или SVD — устойчивее и связано с
ценой матричных вычислений.
Русская линия здесь — теорема Гаусса—Маркова. А. А. Марков придал ей строгую форму: при
некоррелированных ошибках одной дисперсии оценка наименьших квадратов — наилучшая линейная
несмещённая (BLUE), даже без предположения о нормальности. Нормальность нужна для правдоподобия и
интервалов, а оптимальность в классе линейных оценок — уже из одних вторых моментов.
Потрогай линию и остатки
Точки, линия наименьших квадратов и остатки
График шире экрана — листайте по горизонтали →
Загружается живая иллюстрация…
Перетаскивайте точки и следите, как линия минимизирует сумму квадратов вертикальных остатков.
Особенно поучительна крайняя правая точка: у неё большой рычаг (leverage), и даже небольшой её
сдвиг по вертикали заметно поворачивает всю прямую. Кнопка показывает сами квадраты остатков —
то, что метод и минимизирует.
Что измеряет коэффициент детерминации
Насколько линия лучше простого среднего, показывает коэффициент детерминации
R2=1−∑i(yi−yˉ)2∑i(yi−yi)2.
В числителе — сумма квадратов остатков модели, в знаменателе — той же величины для наивного
прогноза «всегда среднее». R2 — это доля разброса ответа, объяснённая линией: от нуля (модель не
лучше среднего) до единицы (идеальная подгонка). Но большое R2 не значит «модель верна»: оно
растёт от добавления любых признаков, ничего не говорит о причинности и легко обманывает при
экстраполяции. А малое R2, как на наших велоданных, не делает связь ложной — просто у ответа
много других источников разброса, кроме одного признака.
Коэффициент не равен причинному эффекту
Если квартиры в центре одновременно меньше и дороже, модель только с площадью смешивает влияние
площади и района: коэффициент w1 описывает ассоциацию в наблюдаемой популяции, а не изменение
цены при магическом расширении той же квартиры. Добавление района сравнивает площади внутри
районов, но причинный вывод всё равно требует отсутствия пропущенных смешивающих факторов.
Регрессия честно решает предсказательную задачу, но не создаёт рандомизированный эксперимент, и
подмена ассоциации причиной — самая частая и дорогая ошибка при чтении её коэффициентов.
Диагностика остатками
Одно число R2 или RMSE не скажет, верна ли модель. График «прогноз — остаток» должен выглядеть
как бесструктурное облако вокруг нуля; любая структура — сигнал поломки.
Панель A совместима с моделью. В B осталась кривизна — пропущена нелинейность. В C разброс растёт
с прогнозом — гетероскедастичность. В D цвет времени выявляет зависимость. Одна итоговая RMSE не
различает эти четыре поломки.
Диагностика не просто критикует, а указывает следующую модель: при гетероскедастичности моделируют
σ(x) или берут взвешенные квадраты; при тяжёлых хвостах — робастную потерю;
при нелинейности — базисные функции.
Рычаг: одна точка правит всем
Точка с необычным значением x имеет высокий leverage — способность поворачивать всю линию. В
модели без свободного члена w=∑xiyi/∑xi2: далёкая по x точка вносит в
знаменатель огромный вклад и почти диктует наклон.