Выбор модели платит за просмотр кандидатов. Воображаемый oracle знает истинные риски и выбирает лучшего бесплатно; реальная процедура видит шумные оценки. Oracle inequality сравнивает их и явно добавляет цену поиска.
Лучший из ста на контрольной
Сто моделей имеют одинаковый истинный риск 10%. Каждую проверили на небольшой validation. Оценки колеблются: 8%, 11%, 9% и так далее. Минимум, вероятно, окажется заметно ниже 10%, хотя ни одна модель не лучше.
Пусть
Для одного фиксированного оценка может быть несмещённой. Минимум по шумным оценкам смещён вниз. Это тот же эффект, который появился при эмпирическом риске, теперь сделаем его явным.
Истинный риск всех кандидатов равен 0,1. По оси — число просмотренных моделей, по оси — выбранный minimum validation. Медиана минимума падает, хотя качество семейства не меняется.
Воображаемый oracle
Oracle знает распределение и выбирает
Мы хотим, чтобы риск реальной выбранной модели был близок:
Такую оценку называют oracle inequality. Константа показывает, насколько сравнение ослаблено, penalty — цену конечных данных и выбора. Хорошая процедура почти не хуже лучшего кандидата, даже не зная, кто он.
От концентрации к цене log M
Для loss в неравенство Хёффдинга даёт для фиксированного :
По union bound вероятность, что хотя бы одна из оценок отклонится сильнее, не превосходит
Приравнивая к , получаем одновременную границу
Если все оценки одновременно близки, риск выбранной модели не более чем примерно на хуже лучшего. Цена растёт как : миллион кандидатов дороже одного, но не в миллион раз.
По оси — от 1 до миллиона, по оси — . Кривые для растут медленно по и заметно падают с объёмом.
Структурная сложность
Кандидаты не всегда конечны. Полиномы всех коэффициентов, деревья разных разбиений и нейросети образуют непрерывные классы. Вместо используют меры способности подогнать произвольные метки: VC dimension, Rademacher complexity, covering numbers.
Главная идея сохраняется: эмпирический риск плюс штраф за богатство класса. Structural risk minimization выбирает
по вложенным классам . Больший класс лучше подгоняет train, но платит больше.
Лаборатория выбора
Увеличивайте число одинаковых кандидатов: observed best улучшается, true best остаётся на месте. Затем увеличьте validation — разрыв сокращается. Наконец добавьте небольшое реальное различие рисков и найдите объём, при котором процедура стабильно отличает сигнал от удачного шума.
Cross-validation тоже участвует в выборе
-fold CV уменьшает зависимость оценки от одного split, но если по нему выбирают гиперпараметры, итоговый minimum остаётся адаптивным. Nested cross-validation добавляет внешний цикл:
- внешний fold откладывается для оценки;
- внутри оставшихся данных внутренний CV выбирает гиперпараметры;
- модель переобучается и проверяется на внешнем fold;
- внешние результаты усредняются.
Внешний цикл оценивает всю процедуру выбора, а не один заранее известный гиперпараметр.
Большой прямоугольник делится на внешние folds. Для каждого внешнего test оставшаяся часть содержит собственный внутренний цикл. Гиперпараметр не видит внешний fold; поэтому итог оценивает поиск, включая его ошибки.
Ранжирование экспериментов как семейство
Кандидат — не только модель. Это версия очистки, набор признаков, seed, checkpoint, prompt, порог и даже способ посчитать метрику. Если исследователь после каждого эксперимента смотрит validation и проектирует следующий, число эффективных попыток больше размера финальной таблицы.
Журнал экспериментов делает поиск видимым. Заранее фиксированный лимит, отдельный confirmation set и воспроизведение результата на новом периоде уменьшают оптимизм. Публиковать следует не только победителя, но диапазон разумных кандидатов.
Текстовые модели
При классификации текстов перебирают n-grams, размер словаря, regularization, эмбеддинги и пороги. Случайный split по сообщениям одного автора позволяет запомнить стиль; group split по автору может резко изменить рейтинг моделей. Такое разбиение определяет само будущее, а не только очередной гиперпараметр.
Большая модель может победить на среднем validation, но проиграть по редкой группе. Если после просмотра выбрать метрику, где она выглядит лучше, семейство выбора расширилось. Нужен заранее заданный primary risk и guardrails из урока 55. Сама метрика является функцией потерь, поэтому её смена после результата равносильна добавлению новых кандидатов в поиск.
Агрегация вместо выбора одного
Model averaging и stacking иногда уменьшают цену жёсткого выбора. Если кандидаты ошибаются по-разному, средний прогноз имеет меньшую variance. Экспоненциальное взвешивание использует
Но веса тоже обучаются по данным. Stacking нуждается в out-of-fold предсказаниях, иначе meta-model увидит переобученные ответы train.
Когда test перестаёт быть test
Leaderboard позволяет отправлять много решений и видеть score. Команда постепенно подгоняется к скрытому набору, даже без прямого доступа к строкам. Public/private split, лимит отправок и финальная переоценка на свежих данных защищают соревнование.
В production аналогичную роль играет постоянный мониторинг одной метрики с ручными изменениями системы. Отложенный shadow-период или рандомизированный эксперимент даёт новое подтверждение.
Практическое неравенство
Теоретический penalty часто слишком консервативен для точного выбора, но структура рассуждения полезна:
Отчёт должен позволить оценить все три части: объём и зависимость validation, число и родство кандидатов, способ выбора и независимую проверку. Oracle inequality учит не поклоняться лучшему числу в таблице.
Цена каталога кандидатов
Для ограниченной потери Hoeffding bound и union bound дают ориентир: одновременно для заранее перечисленных моделей с вероятностью не меньше
При и добавка для одной модели около . Для она вырастает примерно до , а для — до . Рост логарифмический, но не нулевой: большой каталог легче производит случайного победителя.
Граница груба и не учитывает сходство кандидатов. Сто learning rates одной архитектуры связаны сильнее ста разных pipeline, поэтому эффективная цена может быть меньше. Nested cross-validation оценивает её процедурно: внутренние fold выбирают кандидата, внешний fold видит только результат выбора.
Если после внешних fold исследователь меняет каталог, оценка снова начинает участвовать в поиске. Тогда нужен новый внешний цикл или честное описание адаптивности. Oracle inequality дисциплинирует журнал экспериментов: кто входил в каталог и какое наблюдение повлияло на его расширение.