Дискриминативная модель сразу проводит границу. Порождающий классификатор рассказывает, как каждый класс создаёт признаки, а затем сравнивает эти рассказы по правилу Байеса. Форма облаков становится частью решения.
Два вида ириса как два облака
Пусть содержит длину и ширину лепестка, а — вид ириса. Вместо прямого моделирования зададим для каждого класса плотность и prior . После измерения цветка
Класс выбирают по максимальному числителю. Знаменатель одинаков для всех , поэтому границу определяет сравнение
Prior сдвигает решение даже при одинаковой форме облаков: редкому классу нужно более убедительное совпадение признаков.
Оси — длина и ширина лепестка. Эллипсы показывают уровни , кресты — средние классов. Чёрная граница проходит там, где prior-взвешенные плотности равны; она не обязана лежать ровно посередине центров.
LDA: общая форма разброса
Linear Discriminant Analysis предполагает
с разными средними , но общей ковариацией . Логарифм нормальной плотности содержит квадрат
При сравнении классов общий член сокращается. Остаётся линейная дискриминантная функция
Поэтому граница LDA линейна. Ковариация определяет метрику: отличие вдоль шумного направления считается слабее, чем такое же евклидово отличие вдоль стабильного.
QDA: каждому классу своя геометрия
Quadratic Discriminant Analysis допускает
Квадратичные члены больше не сокращаются, и граница становится кривой. Модель способна описать компактный класс внутри рассеянного или облака с разными ориентациями. Цена — отдельная матрица ковариации для каждого класса, то есть гораздо больше параметров.
Слева общая заставляет эллипсы иметь одинаковую форму, и граница прямая. Справа различны, поэтому равенство дискриминантов содержит квадраты координат и огибает компактное облако.
Лаборатория эллипсов
Сначала сделайте ковариации классов одинаковыми: LDA и QDA должны дать близкие границы, но QDA будет оценивать лишние параметры. Затем растяните один класс по диагонали. Наконец уменьшите его prior и проследите, как область решения сжимается без движения самих точек.
Цена prior и цена ошибки
Prior описывает частоту класса в целевой популяции. Если модель обучалась на искусственно сбалансированной выборке, обучающая доля не является естественным prior. Для применения нужно вернуть реальную распространённость.
При разных потерях даже posterior максимум не оптимален. Решение выбирают по минимальному условному риску
Получается ясное разделение труда: generative model оценивает вероятности, prior адаптирует популяцию, а матрица цен задаёт действие. Это разделение повторяет геометрию и пороги и будет формализовано в уроке о риске.
Naive Bayes: смелая независимость
Для текста с тысячами признаков полную ковариацию оценить невозможно. Naive Bayes предполагает условную независимость:
Для счётчиков слов используют мультиномиальную модель и сглаживание из урока 48. Независимость слов явно неверна: «машинное» и «обучение» встречаются вместе. Но классификатор часто хорошо ранжирует, потому что грубое произведение накапливает сигнал.
Вероятности могут быть плохо калиброваны: зависимые свидетельства учитываются несколько раз. Поэтому качество класса и качество численного posterior нужно проверять отдельно.
Порождающая модель умеет работать с пропусками
Если один признак отсутствует, generative model может маргинализовать его:
Для многомерной нормали наблюдаемая подгруппа координат снова нормальна с соответствующими частями среднего и ковариации. Это естественнее, чем подставлять среднее без учёта класса.
Однако механизм пропуска важен. Если лаборатория чаще не измеряет дорогой анализ у здоровых пациентов, сам факт пропуска несёт информацию. Тогда нужно моделировать индикатор измерения или включать его как признак.
Слева классы разделены в плоскости . У нового объекта известен только , поэтому справа сравниваются проекции плотностей на эту ось. Неизвестная координата интегрируется, а не заменяется одной точкой.
Связь с логистической регрессией
Для двух нормальных классов с общей ковариацией log-odds posterior линейны:
Значит, LDA и логистическая регрессия имеют одинаковую форму границы, но оценивают параметры по-разному. LDA моделирует и может быть эффективнее, если нормальная история верна. Логистическая регрессия моделирует только и не обязана описывать распределение признаков.
При большом объёме и неверной нормальности дискриминативная модель часто устойчивее. При малом объёме и хорошем generative предположении LDA использует структуру сильнее. Выбор делается по диагностике и честной validation, а не по ярлыку «старый» или «современный». За пределами поддержанных облаков обеим нужна отдельная карта неопределённости.
Реальный пример: отклик на сообщение
Для анонимизированной кампании признаки включают время отправки, историю активности и тип сообщения, класс — отклик в течение суток. Generative model может описать распределения активности у откликнувшихся и нет, а prior — реальную редкую долю отклика.
Нельзя включать признаки, появившиеся после отправки, и считать повторные сообщения одному человеку независимыми. Ковариация может различаться по классам, но QDA при сотнях признаков неустойчива; помогает shrinkage covariance между общей и отдельной матрицей.
Итог
Порождающий классификатор моделирует признаки внутри класса и prior классов, затем применяет Байеса. LDA получает линейную границу из общей ковариации, QDA — квадратичную из отдельных. Naive Bayes заменяет сложную совместную плотность произведением. Сильная сторона подхода — содержательная модель облаков, пропусков и сдвига prior; слабая — цена неверных распределительных предположений.
Как редкий prior двигает границу LDA
Рассмотрим один признак. Для обычного класса , для редкого — . Отношение плотностей имеет линейный логарифм:
При равных prior граница posterior проходит через . Теперь пусть редкий класс встречается лишь в случаев. К log-likelihood ratio добавляется , поэтому граница сдвигается к
Наблюдение ближе к среднему редкого класса, но при таком prior всё ещё не достигает posterior : похожий сигнал часто возникает среди гораздо более многочисленных обычных объектов.
Если обучающую таблицу искусственно сбалансировали, а в production сохранились , граница даст множество ложных тревог. Исправить её можно возвращением реального prior в формулу, не переоценивая гауссовы плотности. Этот маленький расчёт отделяет форму классов от частоты их появления.