Модель сообщает, насколько правдоподобны увиденные данные при каждом значении неизвестного параметра. Метод максимального правдоподобия поворачивает эту зависимость: данные фиксируются, параметр двигается, а вершина кривой становится оценкой. Из одного этого принципа выведутся и знакомая доля успехов, и метод наименьших квадратов, и кросс-энтропия обучения.

Монета, которую бросили двадцать раз

В двадцати бросках выпало четырнадцать орлов. Какая вероятность орла pp лучше согласуется с наблюдением? При независимых бросках вероятность последовательности с hh орлами и tt решками равна P(Dp)=ph(1p)tP(D\mid p)=p^h(1-p)^t. После опыта h=14h=14 и t=6t=6 фиксированы, и то же выражение читают как функцию параметра:

L(p;D)=p14(1p)6.L(p;D)=p^{14}(1-p)^6.

Её называют функцией правдоподобия. Это не распределение параметра: площадь под ней не обязана равняться единице. Запись L(p)L(p) лишь сравнивает значения pp по тому, насколько хорошо каждое объясняет одну и ту же выборку.

Правдоподобие на реальных данных

Монета — модель, но метод работает на настоящих данных так же. Возьмём реальный корпус SMS: из 55745574 сообщений спамом оказались 747747. Считая каждое сообщение испытанием Бернулли, построим правдоподобие доли спама pp — и для разного объёма выборки.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три кривые правдоподобия доли спама для выборок 50, 500 и 5574 сообщений; все с вершиной около 0,134, но с ростом объёма пик становится всё уже
Рис. 45.1. Правдоподобие на реальных SMS

Правдоподобие доли спама для выборок n=50n=50, 500500 и всех 55745574 сообщений. Вершина у всех общая — оценка p^=747/55740,134\widehat p=747/5574\approx0{,}134, — но с ростом объёма кривая резко сужается: данные всё точнее различают соседние значения параметра.

Максимум находится без угадывания

Произведения малых вероятностей быстро становятся машинным нулём, поэтому работают с логарифмом:

(p)=logL(p)=hlogp+tlog(1p).\ell(p)=\log L(p)=h\log p+t\log(1-p).

Логарифм строго возрастает и сохраняет точку максимума. Производная (p)=h/pt/(1p)\ell'(p)=h/p-t/(1-p) равна нулю при h(1p)=tph(1-p)=tp, откуда

p^MLE=hh+t.\widehat p_{\text{MLE}}=\frac{h}{h+t}.

Вторая производная (p)=h/p2t/(1p)2<0\ell''(p)=-h/p^2-t/(1-p)^2<0 подтверждает, что это максимум. Знакомая доля успехов оказалась не произвольной формулой, а следствием модели Бернулли и принципа правдоподобия.

Логарифм превращает произведение в сумму

Логарифм не меняет победителя, но меняет масштаб задачи: произведения становятся суммами, машинное округление — мягче. И он делает видимой разницу между кандидатами.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Слева правдоподобие монеты 14 из 20 на линейной шкале, где далёкие от максимума значения сливаются с нулём. Справа лог-правдоподобие с наложенной параболой второго порядка, совпадающей у вершины
Рис. 45.2. Линейное и лог-правдоподобие

Слева далёкие от максимума значения почти сливаются с нулём. Справа (p)(p^)\ell(p)-\ell(\widehat p) различима на всём интервале; красная парабола второго порядка показывает локальную кривизну — именно она несёт сведения о точности оценки.

Кривизна около вершины растёт примерно как nn, поэтому характерная ширина оценки убывает как 1/n1/\sqrt{n}. Удобная величина — удвоенная разность логарифмов 2[(p^)(p)]2[\ell(\widehat p)-\ell(p)]: она сравнивает кандидата с лучшим объяснением и при регулярных условиях даёт интервалы правдоподобия, чей частотный смысл покрытия аккуратно разберёт следующий урок.

::::

Потрогай правдоподобие

Данные, логарифм и ширина максимума

Загружается живая иллюстрация…

Сохраните долю успехов и увеличивайте число наблюдений: вершина останется на месте, а интервал близких значений сузится. Сравните 7/107/10 и 700/1000700/1000 — одинаковая точечная оценка несёт совершенно разную неопределённость. Наконец поставьте все успехи и ни одной неудачи: максимум уйдёт на границу p=1p=1, где обычное «оценка плюс-минус ошибка» перестаёт работать.

От правдоподобия к функции потерь

Для многих независимых объектов L(θ)=ipθ(yixi)L(\theta)=\prod_i p_\theta(y_i\mid x_i), а логарифм даёт сумму (θ)=ilogpθ(yixi)\ell(\theta)=\sum_i\log p_\theta(y_i\mid x_i). Максимизация \ell — это то же самое, что минимизация средней отрицательной лог-правдоподобности. И тут открывается связь с машинным обучением: конкретная модель шума задаёт конкретную функцию потерь.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Две панели. Слева при нормальном шуме отрицательное лог-правдоподобие равно сумме квадратов, минимум в среднем. Справа при бинарном ответе оно равно кросс-энтропии, минимум в доле успехов
Рис. 45.3. Максимум правдоподобия — минимум знакомой потери

При нормальном шуме отрицательное лог-правдоподобие — это сумма квадратов, и MLE центра равна среднему. При бинарном ответе оно превращается в кросс-энтропию, и MLE равна доле успехов. Функция потерь не выдумана, а выведена из вероятностного предположения.

::::

Граница и неразличимость

У правдоподобия есть особые случаи. Первый — граница: для данных 10/1010/10 функция L(p)=p10L(p)=p^{10} монотонно растёт до p=1p=1, максимум лежит на краю допустимого диапазона, и симметричный интервал «оценка ±\pm ошибка» вышел бы за пределы [0,1][0,1].

Русская линия ведёт к Ю. В. Линнику — математику, чьи работы по теории оценивания и обработке наблюдений продолжили русскую школу вероятности (Чебышёв, Марков, Ляпунов, Колмогоров). Идея, что точность оценки ограничена количеством информации в данных, — прямо про ширину вершины правдоподобия.

Что MLE обещает и чего не обещает

При корректной идентифицируемой модели и достаточном объёме MLE часто сходится к истинному параметру, становится приближённо нормальной и эффективно использует информацию. Но эти свойства асимптотические: они не превращают малую выборку в большую и не проверяют модель.

Если данные собраны со смещением, MLE точно оценит параметр смещённой популяции. Если семейство распределений выбрано неверно, оптимизатор найдёт лучший параметр внутри неверной модели. Поэтому после максимизации исследуют остатки, устойчивость и смысл параметров: численная вершина — начало статистического заключения, а не его финал.

Одна оценка, две кривые разной остроты

Сравним серии 14/2014/20 и 70/10070/100: в обеих p^=0,7\widehat p=0{,}7, и таблица точечных оценок объявила бы эксперименты одинаковыми. Но возьмём конкурента p=0,6p=0{,}6: отношение L(0,6)/L(0,7)L(0{,}6)/L(0{,}7) для первой серии около 0,650{,}65 (значение ещё правдоподобно), а для второй — около 0,120{,}12 (заметно хуже). Одинаковая доля успехов создала гораздо более острую вершину, потому что каждый из ста бросков добавил слагаемое к лог-правдоподобию. Ширина вершины несёт сведения о точности, которых нет в одной MLE.

А если последние двадцать бросков делал другой автомат, складывать серии нельзя без проверки общего pp: узкая вершина будет уверенно оценивать несуществующее «среднее состояние». Сравнение модели с одним параметром и модели с двумя превращает вычисление максимума в проверяемый вопрос об однородности эксперимента — и это уже мост к следующим урокам об интервалах и проверке гипотез.

Задачи