Пять отметок высоты лежат на столе рядом с секундомером. По ним можно восстановить ускорение падения с точностью до сотых. Можно также провести через точки полином с восемью коэффициентами и получить почти нулевую ошибку. Первая формула говорит о силе тяжести, вторая хорошо запоминает опыт. Какая из них лучше? Ответ зависит от вопроса, который мы собираемся задать миру.

Опыт, который помещается в пяти строках

Сразу обозначим происхождение чисел: ниже синтетическая учебная серия, а не протокол реального падения. Она нужна, чтобы весь расчёт МНК можно было проверить карандашом. Время задано сеткой ti=(0;0,5;1;1,5;2)t_i=(0;0{,}5;1;1{,}5;2) с, а высота сгенерирована по правилу

hi=round0,01m(204,905ti2+0,04ti3+εi),h_i=\operatorname{round}_{0{,}01\,\mathrm m} \left( 20-4{,}905t_i^2+0{,}04t_i^3+\varepsilon_i \right),

где зафиксированная реализация ошибки при seed 2026 равна

(ε1,,ε5)=(0; 0; 0,015; 0,02125; 0) m.(\varepsilon_1,\ldots,\varepsilon_5) =(0;\ 0;\ -0{,}015;\ 0{,}02125;\ 0)\ \mathrm m.

Округление до ближайшего сантиметра выполнено после сложения всех членов. Вектор ошибки приведён явно, поэтому таблица воспроизводится без догадок о версии генератора случайных чисел.

номер кадра ii12345
время tit_i, с0,000,501,001,502,00
высота hih_i, м20,0018,7815,129,120,70

В таблице нет слов «тяжесть», «ускорение» и «сопротивление воздуха». Это след опыта, а не объяснение. Из пяти пар чисел можно построить много правил:

h^1(t)=204,9t2,\widehat h_1(t)=20-4{,}9t^2, h^2(t)=a0+a1t+a2t2++a7t7,\widehat h_2(t)=a_0+a_1t+a_2t^2+\dots+a_7t^7, h^3(t)=hmechanics(t)+rθ(t).\widehat h_3(t)=h_{\mathrm{mechanics}}(t)+r_\theta(t).

Первая запись вносит сильную гипотезу о движении. Во второй почти вся форма выбирается по наблюдениям. Третья соединяет понятный механизм с обучаемой поправкой. На измеренном отрезке три кривые могут идти рядом, но отвечают они на разные вопросы.

Если нужно лишь восстановить пропущенный кадр между t=1t=1 и t=1,5t=1{,}5 секунды, гибкое правило вполне удобно. Если нужно оценить ускорение свободного падения, коэффициенты полинома почти бесполезны. Если шар заменят парашютом и спросят, что произойдёт после удвоения площади купола, одной близости к прежним точкам недостаточно: модель должна знать, как площадь входит в силу сопротивления.

В первом уроке мы различали фиксированное правило и правило, параметры которого найдены по примерам. Теперь разберём источник самой формы правила. Часть формы может прийти из механики, геометрии или закона сохранения; часть можно подобрать по таблице. Наличие оптимизации само по себе не проводит границу между физикой и машинным обучением.

Между миром и формулой стоят приборы

Высоту шара никто не кладёт в CSV рукой природы. Камера превращает свет в пиксели; алгоритм находит центр шара; калибровочная шкала переводит пиксели в метры; часы камеры приписывают момент; программа округляет число и сохраняет строку. Каждая стрелка в этой цепочке содержит допущение.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Пять измерений высоты падающего тела и схема перехода от секундомера и шкалы к строке опыта и физической гипотезе
Рис. 2.1. Измерение и гипотеза появляются на разных шагах

Слева показана синтетическая серия из таблицы выше: 204,905t2+0,04t3+ε20-4{,}905t^2+0{,}04t^3+\varepsilon, seed 2026, округление до 0,01 м. Справа разделены два источника знания: приборы создают пары (ti,hi)(t_i,h_i), а исследователь предлагает связь между ними. Даже идеальная подгонка не исправит неверную шкалу времени.

Пусть часы камеры отстают на 2%. Тогда записанное время равно tcam=0,98ttruet_{\mathrm{cam}}=0{,}98t_{\mathrm{true}}. Если подставить его в формулу h=20gt2/2h=20-gt^2/2, оценка ускорения вырастет примерно в 1/0,9821,0411/0{,}98^2\approx1{,}041 раза. Ошибка прибора превратится в правдоподобный физический параметр. По одной таблице трудно понять, что именно испорчено: закон, число gg или часы.

Другой пример: начало координат высоты сдвинуто на bb метров. Если h0h_0 известно независимо, постоянный сдвиг заметен во всех остатках. Если h0h_0 тоже подбирают, два числа начинают компенсировать друг друга. Чем больше свободных параметров, тем легче модели спрятать дефект измерения.

В следующем уроке мы подробно исследуем, как мир становится таблицей. Здесь достаточно зафиксировать правило: модель начинается раньше формулы. Её границы проходят через прибор, протокол опыта, единицы и способ отбора строк.

Короткая формула хранит длинный рассказ

Пренебрежём сопротивлением воздуха и направим ось высоты вверх. Ускорение постоянно и направлено вниз. За промежуток Δt\Delta t скорость меняется на gΔt-g\Delta t. Поэтому через время tt

v(t)=v0gt.v(t)=v_0-gt.

График скорости от времени представляет прямую. Перемещение равно площади под этим графиком: прямоугольнику v0tv_0t минус треугольнику с основанием tt и высотой gtgt. Отсюда

h(t)h0=v0tgt22,h(t)-h_0=v_0t-\frac{gt^2}{2},

или

h(t)=h0+v0tgt22.h(t)=h_0+v_0t-\frac{gt^2}{2}.

За тремя слагаемыми спрятан рассказ. h0h_0 задаёт выбор начала опыта. Член v0tv_0t сохраняет начальную скорость. Квадратичный член возникает из постоянного ускорения. Мы заранее считаем тело точкой, поле тяжести однородным, а сопротивление воздуха малым. Формула ценна не тем, что коротка, а тем, что каждая часть допускает отдельную проверку.

Размерности выполняют первую проверку:

[h0]=m,[v0t]=mss=m,[gt22]=ms2s2=m.[h_0]=\mathrm m,\qquad [v_0t]=\frac{\mathrm m}{\mathrm s}\,\mathrm s=\mathrm m,\qquad \left[\frac{gt^2}{2}\right] =\frac{\mathrm m}{\mathrm s^2}\,\mathrm s^2=\mathrm m.

Складывать метры с секундами нельзя. Если число 500 миллисекунд принять за 500 секунд, квадратичный член вырастет в миллион раз. Проверка размерности не докажет истинность закона, но быстро отбросит множество бессмысленных записей.

Механистическая модель не обязана быть точной или сложной. Формула свободного падения заведомо неполна. Она полезна, пока отброшенные эффекты малы на интересующем масштабе. Идеализация становится опасной не из-за неполноты, а из-за забытой границы применимости.

Один параметр из пяти измерений

В нашем опыте h0=20h_0=20 м и v0=0v_0=0. Неизвестным оставим gg. Перепишем формулу так, чтобы неизвестное входило линейно. Введём

zi=ti22,di=h0hi.z_i=\frac{t_i^2}{2},\qquad d_i=h_0-h_i.

Тогда модель говорит digzid_i\approx gz_i. Для пяти строк получаем:

iitit_izi=ti2/2z_i=t_i^2/2di=20hid_i=20-h_i
10,000,0000,00
20,500,1251,22
31,000,5004,88
41,501,12510,88
52,002,00019,30

Ни одно значение gg не обязано пройти через все строки: измерения округлены, воздух не исчез, камера шумит. Выберем число, при котором мала сумма квадратов расхождений:

Q(g)=i=15(digzi)2.Q(g)=\sum_{i=1}^{5}(d_i-gz_i)^2.

Раскроем скобки и соберём степени gg:

Q(g)=idi22gizidi+g2izi2.Q(g)= \sum_i d_i^2 -2g\sum_i z_id_i +g^2\sum_i z_i^2.

Это парабола по переменной gg. Её можно привести к полному квадрату:

Q(g)=(izi2)(gizidiizi2)2+idi2(izidi)2izi2.Q(g)= \left(\sum_i z_i^2\right) \left( g-\frac{\sum_i z_id_i}{\sum_i z_i^2} \right)^2 +\sum_i d_i^2 -\frac{\left(\sum_i z_id_i\right)^2}{\sum_i z_i^2}.

Последние два слагаемых от gg не зависят. Коэффициент перед квадратом положителен, если хотя бы одно ti0t_i\ne0. Минимум достигается при

g^=izidiizi2.\widehat g= \frac{\sum_i z_id_i}{\sum_i z_i^2}.

Подставим числа:

izidi=53,4325,izi2=5,53125,\sum_i z_id_i=53{,}4325,\qquad \sum_i z_i^2=5{,}53125, g^=53,43255,531259,6601 ms2.\widehat g= \frac{53{,}4325}{5{,}53125} \approx9{,}6601\ \mathrm{m\,s^{-2}}.

Мы получили формулу оценки без программного оптимизатора. Данные выбрали число g^\widehat g, но квадратичная зависимость от времени, знак и размерность были заданы до вычисления. Это калибровка физической модели через данные.

Почему именно квадрат

Абсолютные отклонения, квадраты и максимальная ошибка отвечают разным инженерным предпочтениям. Квадрат удобен здесь по трём причинам. Он не даёт положительным и отрицательным остаткам взаимно уничтожиться, сильнее штрафует большие отклонения и приводит к явной формуле для g^\widehat g.

У квадрата есть цена. Один грубый сбой камеры может перевесить десятки точных кадров. Если последняя высота по ошибке записана как 7,0 м вместо 0,70 м, её остаток станет огромным, а оценка gg заметно сдвинется. Поэтому выбор потерь связан с представлением об ошибках измерения.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Слева измерения и две траектории с графиком остатков, справа парабола суммы квадратов по ускорению
Рис. 2.2. МНК одновременно показывает траекторию, остатки и функцию потерь

Расчёт использует ту же синтетическую серию: пять времён от 0 до 2 с, кубическая добавка 0,04t30{,}04t^3, вектор ошибок и seed 2026 указаны перед таблицей. Золотая точка на дне параболы справа отмечает тот же параметр, который задаёт красную кривую слева. Нижняя панель показывает, где и в какую сторону ошибается формула.

Для найденного g^\widehat g прогнозы и остатки ri=hih^ir_i=h_i-\widehat h_i равны:

tit_i, сhih_i, мh^i\widehat h_i, мrir_i, м
0,0020,00020,0000,0000
0,5018,78018,792−0,0125
1,0015,12015,170−0,0499
1,509,1209,132−0,0124
2,000,7000,680+0,0202

Сумма квадратов равна примерно 0,00321 m20{,}00321\ \mathrm{m^2}, а среднеквадратичная ошибка по пяти строкам

RMSE=15iri20,0253 m.\operatorname{RMSE} =\sqrt{\frac{1}{5}\sum_i r_i^2} \approx0{,}0253\ \mathrm m.

Число 2,5 сантиметра выглядит убедительно, но не говорит, что механизм верен. Оно описывает близость пяти измерений в одном опыте. Ускорение получилось ниже табличного значения около поверхности Земли; причиной может быть воздух, округление, неточная шкала или выбранный фрагмент движения.

Насколько точно найдено ускорение

Оценка 9,66019{,}6601 записана четырьмя знаками после запятой, но число знаков не равно числу достоверных знаков. Чтобы говорить о точности параметра, нужна модель самого измерительного шума.

Предположим, что камера добавляет к каждой высоте случайную ошибку εi\varepsilon_i:

hi=h0gzi+εi,Eεi=0,Var(εi)=σ2.h_i=h_0-gz_i+\varepsilon_i, \qquad \mathbb E\varepsilon_i=0, \qquad \operatorname{Var}(\varepsilon_i)=\sigma^2.

Ошибки считаются независимыми и одинаково разбросанными. Тогда di=h0hi=gziεid_i=h_0-h_i=gz_i-\varepsilon_i, а оценку можно переписать:

g^=izi(gziεi)izi2=giziεiizi2.\widehat g =\frac{\sum_i z_i(gz_i-\varepsilon_i)}{\sum_i z_i^2} =g-\frac{\sum_i z_i\varepsilon_i}{\sum_i z_i^2}.

При повторении опыта случайные ошибки в среднем взаимно компенсируются, поэтому Eg^=g\mathbb E\widehat g=g. Разброс оценки равен

Var(g^)=σ2izi2,\operatorname{Var}(\widehat g) =\frac{\sigma^2}{\sum_i z_i^2},

а её стандартное отклонение

SE(g^)=σizi2.\operatorname{SE}(\widehat g) =\frac{\sigma}{\sqrt{\sum_i z_i^2}}.

Формула объясняет устройство хорошего опыта. Чем точнее камера, то есть чем меньше σ\sigma, тем устойчивее оценка. Чем больше значения zi=ti2/2z_i=t_i^2/2, тем больше знаменатель. Поздний кадр обычно сообщает об ускорении больше, чем очень ранний: влияние gg успевает накопиться.

Но нельзя бесконечно отодвигать камеру во времени. Тело достигнет пола; сопротивление воздуха накопит заметный эффект; поле или форма движения могут измениться. Поздняя точка информативна только внутри области, где наша механическая форма ещё защищена. Экспериментальный дизайн балансирует чувствительность к параметру и правдоподобие модели.

На практике σ\sigma неизвестно. Его оценивают по остаткам, но на пяти строках такая оценка очень груба. Кроме того, остатки связаны подбором параметра: нормальное уравнение уже заставило одно направление исчезнуть. Для модели с одним найденным параметром используют оценку

σ^2=iri2n1.\widehat\sigma^2 =\frac{\sum_i r_i^2}{n-1}.

В знаменателе стоит n1n-1, а не nn: один независимый фрагмент информации ушёл на выбор g^\widehat g. Для наших чисел σ^0,0283\widehat\sigma\approx0{,}0283 м и формальная стандартная ошибка ускорения равна примерно

SE^(g^)=0,02835,531250,0120 ms2.\widehat{\operatorname{SE}}(\widehat g) =\frac{0{,}0283}{\sqrt{5{,}53125}} \approx0{,}0120\ \mathrm{m\,s^{-2}}.

Разность между 9,66019{,}6601 и 9,819{,}81 намного больше этой величины. Следовательно, модель «независимый шум одинакового масштаба и никакой иной ошибки» плохо объясняет расхождение. Вероятнее систематический эффект: сопротивление, масштаб времени, высота отсчёта или округление не того вида. Формула неопределённости полезна здесь именно потому, что обнажает несогласованность предпосылок, а не потому, что украшает ответ интервалом.

Если точность высоты различается между кадрами, обычный МНК обращается с ними слишком демократично. Пусть стандартное отклонение ii-го измерения равно σi\sigma_i. Более точной строке дают вес wi=1/σi2w_i=1/\sigma_i^2 и минимизируют

Qw(g)=iwi(digzi)2.Q_w(g)=\sum_i w_i(d_i-gz_i)^2.

Повторение вывода с полным квадратом даёт

g^w=iwizidiiwizi2.\widehat g_w =\frac{\sum_i w_i z_i d_i}{\sum_i w_i z_i^2}.

Это не право назначить удобные веса после просмотра результата. Значения σi\sigma_i должны происходить из паспорта прибора, повторных кадров или заранее заданной модели шума.

Калибровка не может сама себя проверить

Пять строк уже повлияли на g^\widehat g. Если на них же сообщить RMSE, мы измерим, насколько хорошо выбранный параметр описывает материал, по которому его выбрали. Это полезная диагностическая величина, но не независимая проверка.

Самый простой честный протокол состоит из повторения опыта. По первой серии оценивают gg, а во второй заранее фиксируют тот же параметр и вычисляют остатки. Ещё сильнее изменить условие, которое модель обещает переносить: другую высоту старта, иной размер шара или другую частоту кадров. Изменение должно быть таким, чтобы основное допущение сохранялось, а случайное совпадение первой таблицы не сохранялось автоматически.

Для гибкой остаточной модели ролей становится больше:

  1. обучающие строки выбирают коэффициенты θ\theta;
  2. настроечные строки помогают выбрать степень, штраф или набор признаков;
  3. тестовые строки один раз оценивают уже полностью выбранную процедуру;
  4. контрольный физический опыт проверяет механизм или вмешательство.

Если после просмотра теста поменять степень полинома, тест превратится в ещё одну настройку. Для новой честной оценки понадобится новый набор строк. В интерактивной лаборатории степень выбирают по validation, а скрытая траектория закрыта до отдельной кнопки фиксации. Открытая траектория служит oracle-разбором одного решения. Она не считается тестом, если читатель затем возвращается к настройке.

Полезно явно разделить случайную ошибку и дефект механизма:

hi=hphys(ti;g)+δ(ti)+εi.h_i =h_{\mathrm{phys}}(t_i;g) +\delta(t_i) +\varepsilon_i.

Здесь εi\varepsilon_i меняется непредсказуемо между повторами, а δ(t)\delta(t) описывает устойчивое расхождение формы, например сопротивление воздуха. При подгонке только gg часть δ(t)\delta(t) проецируется на t2t^2. Оценка ускорения начинает компенсировать отсутствующую физику:

g^g=iziδ(ti)izi2iziεiizi2.\widehat g-g =-\frac{\sum_i z_i\delta(t_i)}{\sum_i z_i^2} -\frac{\sum_i z_i\varepsilon_i}{\sum_i z_i^2}.

Вторая доля в среднем исчезает при повторах. Первая сохраняется. Поэтому узкий формальный интервал вокруг смещённой оценки может быть очень уверенным и очень неверным относительно физического gg.

Остаток как письмо от опыта

Остаток не следует воспринимать как мусор, который модель обязана уничтожить. Его форма подсказывает, чего не хватает в гипотезе.

Если остатки беспорядочно колеблются около нуля без заметного изменения разброса, простая модель согласуется с наблюдаемым масштабом. Если все остатки положительны, вероятно постоянное смещение. Если сначала они отрицательны, а затем положительны, кривая имеет неверную форму. Если разброс растёт со временем, ошибка может накапливаться или измерение поздних кадров менее точно. Периодический рисунок намекает на пропущенный цикл.

Для МНК-оценки выполняется нормальное уравнение

iziri=0.\sum_i z_i r_i=0.

Оно означает, что остаток ортогонален выбранному направлению zz в пространстве пяти наблюдений. Но отсюда не следует случайность остатка. Кривая может иметь сложный систематический рисунок, который случайно даёт нулевую взвешенную сумму.

В уроке о линейной регрессии нормальные уравнения появятся в матричной форме. Здесь важна геометрическая мысль: подбор параметра удаляет из остатка только те направления, которые модель умеет выражать.

Три семейства одной траектории

Сравним три способа описать падение.

Механистическая модель

h^phys(t)=h0+v0tg^t22\widehat h_{\mathrm{phys}}(t) =h_0+v_0t-\frac{\widehat g t^2}{2}

имеет жёсткую форму и несколько параметров с единицами. Она может ошибаться, когда сопротивление воздуха заметно, зато её продолжение за пределы опыта диктуется ясным предположением.

Свободная модель по данным

h^data(t)=β0+β1t++βktk\widehat h_{\mathrm{data}}(t) =\beta_0+\beta_1t+\dots+\beta_kt^k

выбирает больше формы по наблюдениям. При большом kk она легко проходит около каждой точки, но продолжение полинома определяется краевыми коэффициентами, которые плохо закреплены коротким опытом.

Гибридная модель

h^hybrid(t)=h^phys(t)+rθ(t,x)\widehat h_{\mathrm{hybrid}}(t) =\widehat h_{\mathrm{phys}}(t)+r_\theta(t,x)

оставляет механику каркасом и учит повторяющийся остаток. Вектор xx может включать скорость ветра, давление, ориентацию тела и показания других датчиков. Гибрид полезен, если физическая часть улавливает главное, а пропущенный эффект повторяется в данных.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Физическая, гибридная и полиномиальная модели проходят рядом с обучающими точками и расходятся при экстраполяции; ниже показана ошибка
Рис. 2.3. Модели различаются прежде всего за границей опыта

Вертикальная линия отделяет измеренный диапазон от нового режима. Внутри диапазона полином высокой степени почти невозможно упрекнуть. Справа его ошибка быстро растёт: короткий опыт слабо определяет продолжение гибкой функции. Параметры рисунка: скрытая кривая 204,905t2+0,36t320-4{,}905t^2+0{,}36t^3, восемь равноотстоящих точек на [0;1,5][0;1{,}5] с, шум N(0;0,0552m2)\mathcal N(0;0{,}055^2\,\mathrm m^2), NumPy PCG64, seed 2026. Треугольник у верхней границы нижней панели отмечает ошибку полинома выше 12 м, а не горизонтальное продолжение ошибки.

Гибрид не получает доверие автоматически. Поправка может выучить ошибку датчика, специфичную для одного прибора. Она может компенсировать неверный знак в физическом коде и скрыть его на обучении. Наконец, слишком гибкий остаток превращает физическую часть в декоративную надпись.

Чтобы физика действительно ограничивала решение, контролируют масштаб rθr_\theta, проверяют его на новых режимах и сравнивают с моделью без физического каркаса. Иногда полезно запретить поправке менять известный закон сохранения или заставить её обращаться в ноль в точно известном пределе.

Совпадение на отрезке не определяет продолжение

Рассмотрим две функции:

f(t)=t2,fε(t)=t2+εt(t1).f(t)=t^2,\qquad f_\varepsilon(t)=t^2+\varepsilon t(t-1).

В точках t=0t=0 и t=1t=1 они совпадают. На всём отрезке [0,1][0,1]

fε(t)f(t)=εt(t1)ε4,|f_\varepsilon(t)-f(t)| =|\varepsilon t(t-1)| \le\frac{|\varepsilon|}{4},

поскольку максимум t(1t)t(1-t) равен 1/41/4. При t=10t=10 разность уже равна 90ε90\varepsilon. Даже маленькое ε=0,01\varepsilon=0{,}01 даёт расхождение 0,9.

Отсюда не следует, что экстраполяция запрещена. Она возможна, когда мы способны защитить допущение о продолжении. Механика защищает параболу постоянством ускорения в выбранном масштабе. Периодическая модель защищает повторением цикла. Гладкость защищает отсутствие резких скачков. Каждое основание можно обсуждать и проверять.

Как ошибка параметра проходит через формулу

Оценка параметра и ошибка будущего прогноза связаны чувствительностью модели. Если вместо gg подставлено g+Δgg+\Delta g, разность двух прогнозов высоты равна

Δh(t)=Δgt22.\Delta h(t) =-\frac{\Delta g\,t^2}{2}.

При Δg=0,01\Delta g=0{,}01 м/с² ошибка составляет 0,005 м через секунду, 0,02 м через две секунды и 0,125 м через пять секунд. Один и тот же промах в параметре опаснее на большем горизонте. Поэтому фраза «ускорение найдено с ошибкой 0,01» неполна без времени и требуемой точности прогноза.

Для общей функции y=f(θ)y=f(\theta) малое изменение параметра можно оценить наклоном:

ΔyfθΔθ.\Delta y\approx \frac{\partial f}{\partial\theta}\Delta\theta.

В формуле падения h/g=t2/2\partial h/\partial g=-t^2/2. Коэффициент чувствительности сам меняется со временем. В сложной модели таких направлений много: часть параметров почти не влияет на наблюдение, часть усиливается. Длинная плоская долина функции потерь как раз показывает направление слабой чувствительности.

Удобна и относительная запись. Для терминальной скорости

v=(2mgρCdA)1/2v_\infty= \left(\frac{2mg}{\rho C_dA}\right)^{1/2}

малые относительные изменения приближённо связаны равенством

Δvv12(ΔmmΔρρΔCdCdΔAA).\frac{\Delta v_\infty}{v_\infty} \approx\frac12 \left( \frac{\Delta m}{m} -\frac{\Delta\rho}{\rho} -\frac{\Delta C_d}{C_d} -\frac{\Delta A}{A} \right).

Знак сразу сообщает направление эффекта. Рост массы увеличивает скорость; рост плотности воздуха, сопротивления или площади уменьшает её. Множитель 1/21/2 означает, что 2% относительной ошибки площади дают примерно 1% ошибки скорости, если остальные величины фиксированы.

Но обратное рассуждение слабее. Ошибка скорости 1% не говорит, какой из четырёх параметров ошибочен. Несколько изменений могут компенсироваться. Чувствительность показывает, как известная неопределённость распространяется вперёд; идентифицируемость спрашивает, можно ли по результату восстановить источник назад. Эти вопросы близки, но не совпадают.

Предсказание и вмешательство

Архив полётов может показать: грузы с большими парашютами спускались быстрее. Это не нарушение механики. Возможно, большие купола выдавали более тяжёлым грузам, а масса росла сильнее площади. Предсказательная модель честно запомнит корреляцию «больше купол, выше скорость» внутри архива.

Инженер задаёт другой вопрос: что произойдёт с тем же грузом, если заменить его купол? Это вмешательство. Нельзя просто поменять столбец площади в формуле, которая обучалась на совместно меняющихся массе и площади, если формула не отделила их действие.

Для ответа на вмешательство полезна механическая запись силы сопротивления:

Fdrag=12ρCdAv2.F_{\mathrm{drag}} =\frac12\rho C_dAv^2.

Она говорит, какие величины надо удержать постоянными и что изменить в опыте. Механизм может быть приблизительным, но он проектирует проверку: взять один груз, несколько куполов, одинаковые условия и измерить скорости.

В уроке об A/B-тестах появится главный инструмент проверки вмешательств — контролируемый эксперимент. Пока достаточно различать две фразы: «что обычно бывает при AA?» и «что случится, если изменить только AA?».

Два параметра, которые опыт видит как один

При установившемся спуске скорость почти не меняется, поэтому сила тяжести уравновешивается сопротивлением:

mg=12ρCdAv2.mg=\frac12\rho C_dA v_\infty^2.

Отсюда

v=2mgρCdA.v_\infty= \sqrt{\frac{2mg}{\rho C_dA}}.

Пусть m=80m=80 кг, ρ=1,2\rho=1{,}2 кг/м³ и измеренная скорость равна 5 м/с. Тогда

CdA=2mgρv2=2809,811,225=52,32 m2.C_dA= \frac{2mg}{\rho v_\infty^2} =\frac{2\cdot80\cdot9{,}81}{1{,}2\cdot25} =52{,}32\ \mathrm{m^2}.

Опыт определил произведение CdAC_dA, но не его множители. Пары (Cd,A)=(0,8;65,4)(C_d,A)=(0{,}8;65{,}4) и (1,6;32,7)(1{,}6;32{,}7) дают ту же скорость.

Неидентифицируемость легко доказать преобразованием. Для любого λ>0\lambda>0 заменим

Cd=λCd,A=Aλ.C_d'=\lambda C_d,\qquad A'=\frac{A}{\lambda}.

Произведение сохраняется:

CdA=(λCd)Aλ=CdA,C_d'A'=(\lambda C_d)\frac{A}{\lambda}=C_dA,

а значит сохраняется и vv_\infty. Наблюдение одной установившейся скорости не может отличить исходную пару от преобразованной.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
На плоскости коэффициента сопротивления и площади показана длинная долина одинаковой скорости и три пары с одинаковым прогнозом
Рис. 2.4. Долина одинаковых прогнозов

Слева тёмная пунктирная кривая задаёт почти одинаковую потерю. Справа три далёкие пары параметров дают один результат. Число в строке метрики не сообщает, где вдоль долины находится истинная пара. Расчётная схема использует m=80m=80 кг, ρ=1,2\rho=1{,}2 кг/м³, v=5v_\infty=5 м/с и масштаб ошибки скорости σv=0,08\sigma_v=0{,}08 м/с.

Регуляризация выбирает, но не измеряет

Пусть физически правдоподобными считаются CdC_d около 1,21{,}2 и площадь около 40 м². Возьмём масштаб ошибки скорости σv=0,08m/s\sigma_v=0{,}08\,\mathrm{m/s} и запишем безразмерный критерий:

J(Cd,A)=(v(Cd,A)5m/s0,08m/s)2+λ[(Cd1,20,3)2+(A40m210m2)2],λ>0.J(C_d,A)= \left( \frac{v_\infty(C_d,A)-5\,\mathrm{m/s}} {0{,}08\,\mathrm{m/s}} \right)^2 +\lambda \left[ \left(\frac{C_d-1{,}2}{0{,}3}\right)^2 +\left( \frac{A-40\,\mathrm{m^2}} {10\,\mathrm{m^2}} \right)^2 \right], \qquad \lambda>0.

Каждая дробь безразмерна, поэтому λ\lambda здесь тоже безразмерно. Если не нормировать первый квадрат на σv2\sigma_v^2, коэффициент перед штрафом должен иметь единицы (m/s)2(\mathrm{m/s})^2. Новая функция обычно имеет отдельный минимум. Но этот минимум появился не из дополнительного полёта. Мы внесли предпочтение: значения вблизи (1,2;40)(1{,}2;40) считаются более правдоподобными. Регуляризация полезна, когда предпочтение обосновано конструкцией или прошлыми опытами. Нельзя выдавать её результат за информацию, извлечённую из одной скорости.

Число повторов и количество информации не совпадают. Повтор одного режима уменьшает случайный разброс поперёк долины, но почти не сокращает долину вдоль неё. Новый тип опыта может оказаться ценнее тысячи старых строк.

Та же идея в комнате, а не в полёте

Механистические и гибридные модели нужны не только в механике движения. Рассмотрим температуру класса. Пусть T(t)T(t) измеряется в градусах Цельсия, Tout(t)T_{\mathrm{out}}(t) задаёт температуру снаружи, Q(t)Q(t) означает мощность обогрева, CC описывает эффективную теплоёмкость помещения, а kk задаёт утечку тепла через стены и окна.

Баланс мощности можно записать:

CdTdt=Qk(TTout)D(t).C\frac{dT}{dt} =Q-k(T-T_{\mathrm{out}})-D(t).

Член D(t)D(t) собирает дополнительные потери, например открытую дверь. Если время измеряется в часах, удобно взять CC в кВт·ч/°C, QQ в кВт и kk в кВт/°C. Тогда обе части уравнения имеют размерность кВт.

Для вычисления по четвертям часа применим шаг Эйлера:

Tj+1=Tj+ΔtC[Qjk(TjTout,j)Dj].T_{j+1} =T_j+\frac{\Delta t}{C} \left[ Q_j-k(T_j-T_{\mathrm{out},j})-D_j \right].

Пусть Tj=20T_j=20^\circC, Tout,j=4T_{\mathrm{out},j}=4^\circC, Qj=5,5Q_j=5{,}5 кВт, k=0,65k=0{,}65 кВт/°C, C=7,5C=7{,}5 кВт·ч/°C и Δt=0,25\Delta t=0{,}25 ч. Без двери

Tj+1=20+0,257,5[5,50,65(204)]19,837C.T_{j+1} =20+\frac{0{,}25}{7{,}5} \left[5{,}5-0{,}65(20-4)\right] \approx19{,}837^\circ\mathrm C.

Если открытая дверь добавляет Dj=4D_j=4 кВт потерь, следующий прогноз равен примерно 19,70319{,}703^\circC. Разность между двумя сценариями за один шаг мала, но повторение эффекта в течение нескольких часов создаёт видимый рисунок остатков.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Слева схема теплового баланса класса, справа временной ряд температуры для физической и гибридной моделей при открытой двери
Рис. 2.5. Тепловой баланс и обучаемая поправка к нему

Физическая часть объясняет обычную утечку. Повторяющееся открывание двери создаёт структурированный остаток. Гибрид полезен, если признак двери доступен и эффект повторяется в новых днях. Ряд синтетический: шаг 0,25 ч, C=7,5C=7{,}5 кВт·ч/°C, k=0,65k=0{,}65 кВт/°C, обогрев 5,5 кВт с 6:00 до 21:00 и 2,2 кВт в прочие часы, дверь добавляет 4 кВт потерь с 14:00 до 16:30. Красная поправка использует 3,7 кВт на том же интервале.

Обучаемая поправка может оценивать DjD_j по датчику двери, расписанию и числу людей:

D^j=rθ(дверьj, людиj, времяj).\widehat D_j=r_\theta \left( \text{дверь}_j,\ \text{люди}_j,\ \text{время}_j \right).

Такой остаток имеет предметный смысл как недостающий поток энергии. Если rθr_\theta начинает компенсировать ошибку единиц у QQ, он перестаёт быть моделью двери. Проверка должна включать отдельный опыт: включить обогреватель известной мощности при закрытой двери и сравнить скорость изменения температуры.

Модель проверяют несколькими видами доказательств

Одна итоговая ошибка слишком сильно сжимает историю. Для инженерного чтения полезно держать рядом три слоя.

Первый слой записан до данных: закон, размерности, симметрии, ограничения и границы режима. Второй слой приходит из опыта: параметры, остатки, разброс, корреляции ошибок и чувствительность к отдельным строкам. Третий слой появляется на новом режиме: качество переноса, реакция на вмешательство и последствия промаха.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три колонки разделяют знания до данных, оценки из опыта и проверки на новом режиме
Рис. 2.6. Карта источников доказательств

Ни одна колонка не заменяет остальные. Закон без измерения может иметь неверные параметры. Подгонка без структуры не защищает продолжение. Новый тест без описания режима не показывает, куда переносить вывод. Знаки «плюс» между колонками означают совместную проверку; строки не образуют три причинные цепочки.

Утверждение «модель точна на 97%» стоит заменить паспортом:

  1. какую величину и какими единицами прогнозировали;
  2. какой диапазон участвовал в подборе;
  3. какие части формы внесены до наблюдений;
  4. какие параметры оценены и насколько устойчиво;
  5. как выглядят остатки;
  6. на каком новом режиме выполнена проверка;
  7. какое действие последует за прогнозом.

Этот паспорт связывает урок с дальнейшим курсом. Выборка и измерение появятся в уроке 03, разделение данных по времени в уроке 32, оптимизация в уроке 21, регуляризация в уроке 51, а проверка вмешательств экспериментом — в уроке 55.

Вычислительный опыт: чему разрешено учиться

В лаборатории скрытая траектория имеет вид

h(t)=204,905t2+βt3.h_*(t)=20-4{,}905t^2+\beta t^3.

Синяя механическая кривая фиксирована. Красная модель подбирает методом наименьших квадратов полиномиальный остаток

rθ(t)=θ1t+θ2t2++θktkr_\theta(t)=\theta_1t+\theta_2t^2+\dots+\theta_kt^k

только по заполненным чёрным точкам. Времена не переезжают при движении ползунка: мастер-сетка идёт от 0 до 3 с с шагом 0,1 с, а граница лишь открывает дополнительные строки. Каждая пятая доступная точка отмечена золотым кольцом и отложена для validation. Её значение не входит в нормальные уравнения.

RMSE train считается по шумным чёрным точкам, а не по гладкой скрытой кривой. Степень выбирают по RMSE validation. Показатель cond(XTX+109I)\operatorname{cond}(X^\mathsf TX+10^{-9}I) точно называет матрицу, которую решает код: малая добавка 109I10^{-9}I нужна лишь для численной устойчивости и не скрыта от читателя. Шум высоты задан стандартным отклонением σh\sigma_h в сантиметрах.

Физический каркас, validation и новый режим

Загружается живая иллюстрация…

Проведите четыре коротких опыта.

Сначала выберите степень 0. Красная поправка исчезнет, останется чистая механика. Запишите train RMSE и validation RMSE. Это базовая линия: более сложный остаток пока разрешено сравнивать с ней только по validation.

Затем поставьте степени 1, 2, 3, 5 и 7 при неизменном seed. Не открывайте новый режим. Степени 5 и 7 могут уменьшить train RMSE, но validation часто замечает их чувствительность к шуму.

После этого увеличьте конец доступного диапазона с 0,7 до 2,2 с. Старые точки останутся на местах, к ним добавятся точки фиксированной сетки. Сравните изменение validation RMSE и числа обусловленности.

Наконец, нажимайте «Новый шум», не меняя остальные настройки. Выберите степень по нескольким validation-сериям и запишите выбор. Лишь после этой записи нажмите «Зафиксировать степень и открыть». Пунктирная траектория и RMSE new/oracle используют известный симулятору ответ вне границы. Если открывать oracle для нескольких степеней, опыт становится наглядной демонстрацией переобучения, но перестаёт быть честной итоговой проверкой.

Наука начинается там, где меняют опыт

Вычислительная лаборатория удобна тем, что скрытая траектория известна коду. В настоящем исследовании такой привилегии нет. Приходится проектировать опыт, который разводит конкурирующие объяснения.

Если механика без воздуха и гибрид одинаково точны первые полторы секунды, увеличивают длительность или меняют форму тела. Если CdC_d и AA слились в произведение, площадь измеряют отдельно или используют купола известной геометрии. Если тепловая модель путает дверь и слабый обогреватель, проводят день с закрытой дверью и известным режимом мощности.

Алгоритм помогает считать, подбирать и сравнивать. Исследователь выбирает, какой вопрос задаёт опыт, какие величины удерживаются постоянными и какое наблюдение различит гипотезы. Чем гибче модель, тем важнее этот выбор: гибкая формула умеет приспособиться и к закономерности, и к дефекту протокола.

Что теперь можно сказать точно

Математическая и обучаемая модели не образуют две непроницаемые коробки. Механистическая формула тоже может иметь параметры, найденные по данным. Обучаемая модель тоже содержит человеческую структуру: признаки, архитектуру, потери и ограничения. Полезнее спрашивать, какая часть знания появилась на каждом шаге.

Для нашего падения картина ясна:

  • закон постоянного ускорения дал квадратичную форму;
  • пять измерений дали оценку g^9,6601\widehat g\approx9{,}6601 м/с²;
  • остатки проверили локальное согласие;
  • новый диапазон проверяет продолжение;
  • изменение формы тела проверяет механизм;
  • отдельное измерение площади снимает часть неидентифицируемости;
  • регуляризация вносит обоснованное предпочтение, но не заменяет опыт.

Заметьте, что слово «модель» в этом списке относится сразу к нескольким объектам. Есть формула как гипотеза, процедура оценки параметров, программа численного расчёта и полный экспериментальный протокол. Ошибка может жить в любом слое. Неверный коэффициент не требует переписывать закон; неверная единица не лечится новым оптимизатором; новый режим может потребовать иной формулы, даже если код безупречен. Поэтому хороший отчёт хранит версии формулы, калибровки, данных и программы раздельно. Тогда после расхождения можно повторить путь от прибора к выводу, а не только нажать кнопку обучения ещё раз.

Именно эта раздельность позволяет соединять физику и машинное обучение без магии. Физический каркас отвечает за те продолжения, которые мы готовы защищать; обучаемая часть отвечает за повторяющийся остаток; эксперимент проверяет обе ответственности отдельно. Если остаток вырос, мы можем спросить: изменился ли мир, сломался ли датчик или закончилась область применимости.

Главный вывод урока можно записать не формулой, а порядком работы:

вопросмеханизмизмерениеподгонкаостатокновый опыт.\text{вопрос} \longrightarrow \text{механизм} \longrightarrow \text{измерение} \longrightarrow \text{подгонка} \longrightarrow \text{остаток} \longrightarrow \text{новый опыт}.

Если цепочка обрывается после подгонки, модель умеет повторять таблицу, но мы ещё не знаем, что именно она поняла. Если новый опыт поставлен так, что конкурирующие модели расходятся, даже простая формула становится сильным научным инструментом.

Задачи