Одна цифра прогноза скрывает три разных сомнения: случайность самого результата, нехватку данных и отличие нового объекта от обучающей популяции. Карта неопределённости должна превращать эти причины в действия.
Прогноз 7,2 без единиц сомнения
Модель оценила риск осложнения как 7,2%. Врач спрашивает: насколько надёжно это число, похож ли пациент на обучающую выборку, что делать при сомнении? Интерфейс, показывающий только процент, заставляет пользователя додумать ответы.
Разделим неопределённость на три рабочих слоя:
- Aleatoric: разные исходы возможны даже при полностью известных условиях.
- Epistemic: параметры и функция плохо известны из-за ограниченных данных.
- Distributional: новый объект или среда отличаются от train.
Точные границы терминов различаются между областями, но разделение полезно, потому что причины требуют разных действий. Новые похожие данные уменьшают epistemic uncertainty, но не устраняют случайность исхода. Сдвиг популяции требует проверки применимости, а не только большего числа старых объектов.
Слева классы перекрываются при плотных данных — aleatoric uncertainty. В центре несколько функций согласуются с редкими точками — epistemic. Справа новый объект лежит вне области train — distributional uncertainty. Одинаковая иконка «не уверен» скрыла бы разные диагнозы.
Два слагаемых предсказательной дисперсии
В байесовской регрессии для нового объекта
описывает шум нового результата, — неопределённость весов. Эта формула является примером общего разложения
Первое слагаемое усредняет aleatoric variance, второе измеряет расхождение моделей по параметрам. Ensemble приближённо показывает второе через разброс прогнозов разных моделей, но только если ансамбль действительно отражает правдоподобные функции, а не десять копий одного решения.
Калибровка: частоты должны соглашаться с числами
Для классификатора разделим объекты на группы по прогнозу. Среди объектов с оценкой около 0,2 положительный класс должен встречаться примерно в 20% случаев. Reliability diagram сравнивает средний прогноз и наблюдаемую долю.
Калибровка зависит от популяции. После изменения базовой частоты болезни модель может сохранить ranking, но потерять соответствие вероятностей. Temperature scaling или isotonic regression обучают на отдельной calibration части, не на test.
По оси — средняя предсказанная вероятность, по оси — наблюдаемая доля. Диагональ означает калибровку. Размер кружка и нижняя гистограмма показывают поддержку: большое отклонение в почти пустом bin менее надёжно, но пустая область сама требует предупреждения.
Область поддержки
Новый объект может иметь обычное значение каждого признака по отдельности, но необычное сочетание. Температура 30°C и снег по отдельности встречались, а вместе — нет. Одномерные диапазоны не обнаружат сдвиг.
Методы расстояния в пространстве признаков, density ratio и отдельный классификатор «train или production» оценивают отличие распределений. Если такой классификатор легко разделяет источники, условия изменились. Представление должно быть связано с задачей: расстояние по сырому пикселю может считать небольшой сдвиг изображения огромным, а семантически другой объект — близким.
Отказ как полноценное действие
Система может не выдавать автоматическое решение, если риск ошибки высок. Selective classifier выбирает прогноз только на части объектов. Coverage — доля автоматизированных случаев, selective risk — ошибка на принятой части.
Изменяя порог отказа, строят risk-coverage curve. Хорошая система сначала отбрасывает самые опасные объекты, поэтому при уменьшении coverage риск быстро падает. Если отказ случаен, кривая почти горизонтальна.
По оси — доля объектов, обработанных автоматически, по оси — ошибка на них. Синяя кривая использует информативную неопределённость, серая — случайный отказ. Рабочая точка выбирается по ресурсу экспертов и цене ошибки, а не по красоте изгиба.
Лаборатория отказа
Двигайте порог передачи человеку и следите одновременно за риском и coverage. Затем сдвиньте новую популяцию: порог, выбранный на validation, может перестать выполнять обещание. Попробуйте отдельно использовать ширину интервала и расстояние до train. Их объединение ловит разные опасности.
Клинический маршрут
Для модели риска осложнения карта может показывать:
- точечную вероятность и диапазон;
- плотность похожих пациентов в train;
- факторы, сильнее всего изменившие прогноз;
- статус калибровки в клинике, где используют модель;
- рекомендуемое действие и причину отказа.
Интерфейс не должен выдавать ширину как юридическую страховку. Если врач не может проверить исходные признаки или понять, почему случай передан человеку, карта не помогает решению.
Клиники различаются оборудованием и популяцией. Перед переносом нужна внешняя validation, а затем мониторинг калибровки и доли отказов. Скачок отказов может раньше средней accuracy показать изменение среды.
Как сравнивать две системы
Средняя accuracy недостаточна. Сравнивают:
- discrimination: ROC-AUC или PR-AUC;
- calibration: Brier score и reliability diagram;
- coverage при заданном selective risk;
- качество отдельных значимых групп;
- обнаружение заранее определённых сдвигов;
- время и качество человеческой обработки отказов.
Один агрегат не заменяет профиль. Если новая система уменьшила среднюю ошибку, но стала самоувереннее на редкой группе, решение зависит от цены и этики. Функция потерь из урока 57 связывает профиль с действием. Для классификатора полезно отдельно проверить, как отказ меняет геометрию ошибок и пороги, введённые в уроке 53.
Проектный протокол
Полезная карта строится от решения назад:
- перечислить действия и их стоимость;
- определить типы сомнения, меняющие действие;
- выбрать оцениватели и validation-сценарии;
- спроектировать визуальный слой без ложной точности;
- задать мониторинг и маршрут обратной связи.
Для каждого индикатора нужен тест поломки. Если ensemble disagreement объявлен epistemic uncertainty, создайте область без train-точек и проверьте рост разброса. Если distance объявлен OOD-score, добавьте содержательные сдвиги. Если интервал обещает 90% покрытия, проверьте покрытие по времени и группам, как в уроке 46.
Защита проекта
На защите показывают не только лучший пример, но и карту отказов: где система сомневается правильно, где уверенно ошибается, какие случаи передаются человеку и какой ресурс нужен. Полезен один сквозной объект, проходящий от сырых признаков до решения и последующего исхода.
Критерий зрелости прост: зритель может ответить, что система знает, откуда она это знает, где заканчиваются данные и что произойдёт при сомнении. Такая карта превращает неопределённость из декоративной полосы в рабочую часть ИИ.
Карта для одного клинического решения
Модель выдала пациенту риск . В клинике вмешательство рекомендуют выше , поэтому одна цифра говорит «действовать». Добавим три слоя. Среди похожих пациентов обучающей выборки было лишь человек; bootstrap даёт диапазон прогноза от до . В этой области reliability diagram показывает, что прогнозы около в среднем соответствовали исходов. Наконец, расстояние пациента до ближайшей плотной области признаков попало в верхний процентиль.
Три сигнала ведут к разным исправлениям. Широкий bootstrap-диапазон просит больше похожих наблюдений. Смещение reliability curve требует локальной калибровки. Необычность признаков запрещает переносить даже исправленную частоту без проверки. Интерфейс может показать скорректированную оценку, диапазон и решение «передать специалисту», а не автоматически выбирать вмешательство.
Через месяц исход пациента нельзя просто добавить в общую таблицу: решение само изменило вероятность осложнения. Для мониторинга нужно хранить принятое действие и, по возможности, сравнивать политики. Иначе карта будет учиться на последствиях собственных рекомендаций как на естественном ходе болезни.