Модель сообщает, насколько правдоподобны увиденные данные при каждом значении неизвестного параметра. Метод максимального правдоподобия поворачивает эту зависимость: данные фиксируются, параметр двигается, а вершина кривой становится оценкой. Из одного этого принципа выведутся и знакомая доля успехов, и метод наименьших квадратов, и кросс-энтропия обучения.
Монета, которую бросили двадцать раз
В двадцати бросках выпало четырнадцать орлов. Какая вероятность орла лучше согласуется с наблюдением? При независимых бросках вероятность последовательности с орлами и решками равна . После опыта и фиксированы, и то же выражение читают как функцию параметра:
Её называют функцией правдоподобия. Это не распределение параметра: площадь под ней не обязана равняться единице. Запись лишь сравнивает значения по тому, насколько хорошо каждое объясняет одну и ту же выборку.
Правдоподобие на реальных данных
Монета — модель, но метод работает на настоящих данных так же. Возьмём реальный корпус SMS: из сообщений спамом оказались . Считая каждое сообщение испытанием Бернулли, построим правдоподобие доли спама — и для разного объёма выборки.

Правдоподобие доли спама для выборок , и всех сообщений. Вершина у всех общая — оценка , — но с ростом объёма кривая резко сужается: данные всё точнее различают соседние значения параметра.
Максимум находится без угадывания
Произведения малых вероятностей быстро становятся машинным нулём, поэтому работают с логарифмом:
Логарифм строго возрастает и сохраняет точку максимума. Производная равна нулю при , откуда
Вторая производная подтверждает, что это максимум. Знакомая доля успехов оказалась не произвольной формулой, а следствием модели Бернулли и принципа правдоподобия.
Логарифм превращает произведение в сумму
Логарифм не меняет победителя, но меняет масштаб задачи: произведения становятся суммами, машинное округление — мягче. И он делает видимой разницу между кандидатами.

Слева далёкие от максимума значения почти сливаются с нулём. Справа различима на всём интервале; красная парабола второго порядка показывает локальную кривизну — именно она несёт сведения о точности оценки.
Кривизна около вершины растёт примерно как , поэтому характерная ширина оценки убывает как . Удобная величина — удвоенная разность логарифмов : она сравнивает кандидата с лучшим объяснением и при регулярных условиях даёт интервалы правдоподобия, чей частотный смысл покрытия аккуратно разберёт следующий урок.
::::
Потрогай правдоподобие
Сохраните долю успехов и увеличивайте число наблюдений: вершина останется на месте, а интервал близких значений сузится. Сравните и — одинаковая точечная оценка несёт совершенно разную неопределённость. Наконец поставьте все успехи и ни одной неудачи: максимум уйдёт на границу , где обычное «оценка плюс-минус ошибка» перестаёт работать.
Каждую строку лога кликов случайно продублировали дважды. Точечная MLE доли не изменилась, но кривая правдоподобия стала вдвое уже. Почему это ложная уверенность, а не новая информация?
Показать ответ
Дубликаты не независимы: они несут ровно ту же информацию, что оригиналы. Формула предполагает независимых наблюдений, поэтому кривизна лог-правдоподобия удваивается и вершина сужается в раз. Но настоящей информации по-прежнему на наблюдений, и истинная стандартная ошибка не изменилась. Узкая вершина здесь — артефакт нарушенной независимости, а не точность.
От правдоподобия к функции потерь
Для многих независимых объектов , а логарифм даёт сумму . Максимизация — это то же самое, что минимизация средней отрицательной лог-правдоподобности. И тут открывается связь с машинным обучением: конкретная модель шума задаёт конкретную функцию потерь.

При нормальном шуме отрицательное лог-правдоподобие — это сумма квадратов, и MLE центра равна среднему. При бинарном ответе оно превращается в кросс-энтропию, и MLE равна доле успехов. Функция потерь не выдумана, а выведена из вероятностного предположения.

Так сумма квадратов линейной регрессии и кросс-энтропия классификации — частные случаи одного принципа, что подробнее в уроке о функциях потерь. Но произведение законно только после описания зависимости: если один пользователь сделал сто кликов, сто строк не равны ста независимым людям, и формула оптимизатора этого не исправит.
Наблюдения — это истинное значение плюс независимый нормальный шум. Какую оценку даёт максимум правдоподобия и почему это выборочное среднее?
Показать ответ
Лог-правдоподобие нормали содержит плюс не зависящие от слагаемые. Максимум по — это минимум суммы квадратов ; приравняв производную к нулю, получаем — выборочное среднее. Так метод наименьших квадратов оказывается максимумом правдоподобия при нормальном шуме.
::::
Граница и неразличимость
У правдоподобия есть особые случаи. Первый — граница: для данных функция монотонно растёт до , максимум лежит на краю допустимого диапазона, и симметричный интервал «оценка ошибка» вышел бы за пределы .

Когда параметры неразличимы
Второй особый случай — неидентифицируемость. В модели наблюдения зависят только от произведения , поэтому все пары на гиперболе имеют одно правдоподобие: максимум лежит не в точке, а вдоль гребня, и отдельно восстановить и нельзя, сколько данных того же типа ни добавить. Помогает либо новый тип измерения, зависящий от и по-разному, либо prior из байесовского вывода, который явно выбирает точку гребня.
Наилучшая оценка та, что при заданной модели извлекает из наблюдений максимум содержащейся в них информации; мера этой информации и определяет достижимую точность.
Русская линия ведёт к Ю. В. Линнику — математику, чьи работы по теории оценивания и обработке наблюдений продолжили русскую школу вероятности (Чебышёв, Марков, Ляпунов, Колмогоров). Идея, что точность оценки ограничена количеством информации в данных, — прямо про ширину вершины правдоподобия.
Что MLE обещает и чего не обещает
При корректной идентифицируемой модели и достаточном объёме MLE часто сходится к истинному параметру, становится приближённо нормальной и эффективно использует информацию. Но эти свойства асимптотические: они не превращают малую выборку в большую и не проверяют модель.
Никакая несмещённая оценка не может иметь дисперсию меньше обратной величины информации Фишера; этот предел показывает, чего в принципе нельзя достичь никаким методом обработки.
Если данные собраны со смещением, MLE точно оценит параметр смещённой популяции. Если семейство распределений выбрано неверно, оптимизатор найдёт лучший параметр внутри неверной модели. Поэтому после максимизации исследуют остатки, устойчивость и смысл параметров: численная вершина — начало статистического заключения, а не его финал.
Одна оценка, две кривые разной остроты
Сравним серии и : в обеих , и таблица точечных оценок объявила бы эксперименты одинаковыми. Но возьмём конкурента : отношение для первой серии около (значение ещё правдоподобно), а для второй — около (заметно хуже). Одинаковая доля успехов создала гораздо более острую вершину, потому что каждый из ста бросков добавил слагаемое к лог-правдоподобию. Ширина вершины несёт сведения о точности, которых нет в одной MLE.
А если последние двадцать бросков делал другой автомат, складывать серии нельзя без проверки общего : узкая вершина будет уверенно оценивать несуществующее «среднее состояние». Сравнение модели с одним параметром и модели с двумя превращает вычисление максимума в проверяемый вопрос об однородности эксперимента — и это уже мост к следующим урокам об интервалах и проверке гипотез.
Задачи
Монету бросили раз и получили орлов. Запишите likelihood и log-likelihood параметра , найдите MLE через производную и проверьте знак второй производной. Вычислите без перемножения двух крошечных произведений — через разность логарифмов.
Счётчик регистрирует число событий за минуту по закону Пуассона . За восемь минут получены . Выведите log-likelihood , найдите MLE и объясните, почему множители можно отбросить при оптимизации, но нельзя при вычислении вероятности данных.
В двух вариантах страницы: кликов из и из . Найдите отдельные MLE . Затем под гипотезой общего найдите объединённую MLE. Запишите log-likelihood обеих моделей и вычислите удвоенную разность их максимумов. Сделайте только сравнительный, не тестовый вывод.
В модели оба параметра неизвестны. Для независимой выборки выведите MLE и . Покажите, что оценка дисперсии делит сумму квадратов на , а несмещённая — на , и объясните, почему максимум правдоподобия не обязан давать несмещённую оценку в конечной выборке.
Приложение считает каждое открытие рекламного экрана независимым испытанием: показов и кликов, но показов принадлежат самым активным пользователям. Опишите, какое произведение вероятностей использует наивная модель, почему оно завышает информацию, и предложите иерархическую или кластерную модель. Укажите, как разделить train и validation по пользователям, чтобы не повторить ошибку.
На реальном корпусе SMS ( спам-сообщений из ) запишите log-likelihood доли спама , найдите MLE и его стандартную ошибку . Оцените, во сколько раз сузится интервал правдоподобия, если собрать вчетверо больше сообщений при той же доле спама, и объясните ответ через .
Покажите, что для независимых наблюдений с нормальным шумом , , максимизация лог-правдоподобия по эквивалентна минимизации суммы квадратов . Затем покажите, что для бинарных ответов максимизация лог-правдоподобия Бернулли эквивалентна минимизации кросс-энтропии. Объясните, как выбор модели шума определяет функцию потерь в обучении.
В модели наблюдения зависят только от произведения . Покажите, что правдоподобие постоянно вдоль каждой гиперболы , значит отдельные MLE и не определены (неидентифицируемость). Предложите два способа сделать параметры идентифицируемыми — дополнительное измерение, зависящее от и по-разному, и prior — и для каждого назовите вносимое предположение.