Сумма квадратов — не ритуал построения прямой. Она возникает, если наблюдаемый ответ равен линейному прогнозу плюс независимый нормальный шум одинакового масштаба. Это прямое следствие максимума правдоподобия: измените историю о шуме — изменится и разумная оптимизация. А заодно окажется, что метод наименьших квадратов — это ортогональная проекция, и что одно число R2R^2 никогда не заменит взгляда на остатки.

Линия среди облака точек

Возьмём величину, которая заметно зависит от условия, — число поездок велопроката в час против температуры. Связь видна на глаз: теплее — больше поездок, но при одной и той же температуре разброс огромен (день недели, час, погода). Запишем модель yi=w0+w1xi+εiy_i=w_0+w_1x_i+\varepsilon_i, где линия w0+w1xw_0+w_1x описывает условный центр ответа, а остаток ei=yiy^ie_i=y_i-\widehat y_i — вертикальное расхождение конкретного наблюдения с прогнозом.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Диаграмма рассеяния числа поездок за час против температуры со множеством точек и красной линией наименьших квадратов ŷ=9x; разброс точек растёт с температурой; R квадрат равен 0,16
Рис. 49.1. Линия наименьших квадратов на реальных данных

Реальные данные велопроката: каждая точка — час наблюдения. Красная линия наименьших квадратов объясняет R20,16R^2\approx0{,}16 разброса поездок — температура важна, но далеко не единственный фактор. Видно и «веер»: при высокой температуре разброс больше, о чём мы вспомним при диагностике.

Вероятностная модель наблюдения

Предположим εiN(0,σ2)\varepsilon_i\sim N(0,\sigma^2) независимо. Тогда условная плотность ответа гауссова, и логарифм правдоподобия равен

(w,σ)=nlogσn2log(2π)12σ2i=1n(yiwxi)2,\ell(w,\sigma)=-n\log\sigma-\frac n2\log(2\pi)-\frac1{2\sigma^2}\sum_{i=1}^n(y_i-w^\top x_i)^2,

где в вектор признаков включена единица для свободного члена. При фиксированной σ\sigma первые два слагаемых не зависят от ww, поэтому максимум правдоподобия совпадает с минимумом суммы квадратов:

w^MLE=argminwi=1n(yiwxi)2.\widehat w_{\text{MLE}}=\arg\min_w\sum_{i=1}^n(y_i-w^\top x_i)^2.

Нулевое среднее ошибки утверждает, что линия попадает в условное среднее; общая σ\sigma — одинаковый масштаб разброса при любом xx; независимость разрешает перемножить плотности строк. Квадратичная ошибка кодирует именно эти предположения о хвостах и масштабе.

Если столбцы линейно независимы, формально w^=(XX)1Xy\widehat w=(X^\top X)^{-1}X^\top y; но матрицу обычно не обращают, а используют QR или SVD — устойчивее и связано с ценой матричных вычислений.

Русская линия здесь — теорема Гаусса—Маркова. А. А. Марков придал ей строгую форму: при некоррелированных ошибках одной дисперсии оценка наименьших квадратов — наилучшая линейная несмещённая (BLUE), даже без предположения о нормальности. Нормальность нужна для правдоподобия и интервалов, а оптимальность в классе линейных оценок — уже из одних вторых моментов.

Потрогай линию и остатки

Точки, линия наименьших квадратов и остатки

Загружается живая иллюстрация…

Перетаскивайте точки и следите, как линия минимизирует сумму квадратов вертикальных остатков. Особенно поучительна крайняя правая точка: у неё большой рычаг (leverage), и даже небольшой её сдвиг по вертикали заметно поворачивает всю прямую. Кнопка показывает сами квадраты остатков — то, что метод и минимизирует.

Что измеряет коэффициент детерминации

Насколько линия лучше простого среднего, показывает коэффициент детерминации

R2=1i(yiy^i)2i(yiyˉ)2.R^2=1-\frac{\sum_i(y_i-\widehat y_i)^2}{\sum_i(y_i-\bar y)^2}.

В числителе — сумма квадратов остатков модели, в знаменателе — той же величины для наивного прогноза «всегда среднее». R2R^2 — это доля разброса ответа, объяснённая линией: от нуля (модель не лучше среднего) до единицы (идеальная подгонка). Но большое R2R^2 не значит «модель верна»: оно растёт от добавления любых признаков, ничего не говорит о причинности и легко обманывает при экстраполяции. А малое R2R^2, как на наших велоданных, не делает связь ложной — просто у ответа много других источников разброса, кроме одного признака.

Коэффициент не равен причинному эффекту

Если квартиры в центре одновременно меньше и дороже, модель только с площадью смешивает влияние площади и района: коэффициент w1w_1 описывает ассоциацию в наблюдаемой популяции, а не изменение цены при магическом расширении той же квартиры. Добавление района сравнивает площади внутри районов, но причинный вывод всё равно требует отсутствия пропущенных смешивающих факторов. Регрессия честно решает предсказательную задачу, но не создаёт рандомизированный эксперимент, и подмена ассоциации причиной — самая частая и дорогая ошибка при чтении её коэффициентов.

Диагностика остатками

Одно число R2R^2 или RMSE не скажет, верна ли модель. График «прогноз — остаток» должен выглядеть как бесструктурное облако вокруг нуля; любая структура — сигнал поломки.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Четыре панели остатков против прогноза: A случайное облако (модель в порядке), B дуга (пропущена нелинейность), C веер (растёт дисперсия), D волна во времени (зависимость)
Рис. 49.3. Четыре диагностики остатков

Панель A совместима с моделью. В B осталась кривизна — пропущена нелинейность. В C разброс растёт с прогнозом — гетероскедастичность. В D цвет времени выявляет зависимость. Одна итоговая RMSE не различает эти четыре поломки.

Диагностика не просто критикует, а указывает следующую модель: при гетероскедастичности моделируют σ(x)\sigma(x) или берут взвешенные квадраты; при тяжёлых хвостах — робастную потерю; при нелинейности — базисные функции.

Рычаг: одна точка правит всем

Точка с необычным значением xx имеет высокий leverage — способность поворачивать всю линию. В модели без свободного члена w^=xiyi/xi2\widehat w=\sum x_iy_i/\sum x_i^2: далёкая по xx точка вносит в знаменатель огромный вклад и почти диктует наклон.