«Вероятность случайного совпадения — один на миллион, значит подсудимый почти наверняка виновен». За этой фразой прячется одна из самых дорогих ошибок в применении вероятности. Редкость улики при невиновности и вероятность невиновности после улики — разные числа, и путать их значит осудить невиновного. Этот урок — прямое продолжение формулы Байеса, только теперь на кону судьба человека.
Два вопроса, похожие только записью
Пусть — виновность подозреваемого, — совпадение следа. Эксперт лаборатории оценивает : частоту случайного совпадения у непричастного человека. А суду нужно совсем другое — : вероятность невиновности после совпадения. Условие и заключение поменялись местами, и равенство этих чисел не следует ни из редкости совпадения, ни из логики.

Эксперт и суд задают разные вопросы. В городе-миллионнике при частоте совпадения совпадут примерно человек, и лишь один из них виновен: вероятность вины случайно совпавшего — около , а вовсе не .
Город из миллиона жителей
Разберём число явно. В городе миллион человек, случайное совпадение — . Среди почти миллиона невиновных ожидается около десяти случайных совпадений. Если виновный тоже в городе и анализ его находит, он добавит одиннадцатое. Среди одиннадцати совпавших нельзя автоматически указать нужного: простая модель с равными prior даёт вероятность вины найденного около , а не .
Это ещё не оценка для суда — реальные подозреваемые выбираются не равновероятно, улики зависимы, а обнаружение следа у виновного меньше единицы. Пример показывает лишь, как огромная база превращает очень редкое совпадение в ожидаемое событие.
Отношение правдоподобий
Честнее сообщать не одну частоту, а отношение правдоподобий:
Важно, что числитель — не единица: чувствительность анализа обычно меньше . Пусть , а случайное совпадение ; тогда . Улика в раз правдоподобнее при виновности, но начальный уровень шансов она не задаёт:
При prior один к миллиону апостериорные шансы станут около (вероятность вины меньше ); при prior один к ста — около . Одна и та же лабораторная характеристика даёт разный posterior, потому что доказательственная ситуация разная.
::::
Потрогай ошибку прокурора
Двигайте вероятность случайного совпадения, размер базы, априорные шансы вины и чувствительность анализа. Смотрите, как «один на миллион» превращается в почти достоверное событие при большой базе, и как апостериор скачет вместе с prior. Одна редкая частота сама по себе не отвечает на вопрос суда.
Поиск по базе: «один на миллион» становится обычным
Есть принципиальная разница между двумя сценариями. В первом человека подозревали по независимым обстоятельствам, потом сравнили профиль со следом. Во втором след прогнали по миллионам записей и выбрали лучшее совпадение — и тогда процедура почти гарантирует, что чей-то профиль совпадёт. Если вероятность совпадения в одном сравнении , то вероятность хотя бы одного среди независимых сравнений

При совпадение «один на миллион» для одного человека превращается в событие с вероятностью , стоит прогнать базу из миллиона записей. Синяя линия — ожидаемое число совпадений : при малом оно близко к вероятности, при большом расходится.
Вероятность случайного совпадения . Профиль прогнали по базе из миллиона записей. Какова вероятность, что хотя бы один невиновный совпадёт?
Показать ответ
. «Один шанс на миллион» для одного человека превратился в событие вероятности при поиске по миллиону записей. Приближение здесь уже грубо; точное значение даёт . Поэтому поиск по базе и проверка одного заранее выбранного подозреваемого — совершенно разные ситуации.

Ищешь среди многих — найдёшь ложное
Та же математика работает далеко за пределами суда, и её легко увидеть на данных. Возьмём реальную цель — число поездок велопроката за час — и проверим её связь с сотнями случайных, никак не связанных с ней признаков. Ни один из них не имеет отношения к цели, и всё же чем больше признаков мы перебираем, тем сильнее лучшая случайная корреляция.

Наибольшая корреляция случайного признака с реальной целью растёт вместе с числом проверок, хотя настоящей связи нет ни у одного признака. Выбор самого впечатляющего результата делает его куда обычнее, чем кажется.
Что общего между прокурором, который по редкому ДНК-совпадению объявляет вину, и исследователем, который перебрал двести признаков и объявил найденную корреляцию открытием?
Показать ответ
Оба игнорируют число проверенных возможностей. Прокурор не учёл, что след искали по большой базе, где случайное совпадение почти неизбежно. Исследователь не учёл, что среди двухсот случайных признаков сильная корреляция возникает по чистому везению. В обоих случаях вероятность «удивительного» надо считать с поправкой на число попыток увидеть удивительное, иначе редкое выдаётся за значимое.
Это тот же оптимизм, что при выборе лучшей модели на validation — его разберёт урок об oracle inequality — и при преждевременной остановке A/B-теста из урока об экспериментах. Даже оценка риска по выборке становится оптимистичной, если сначала просмотреть тысячи вариантов и сообщить лучший. Общий вопрос один: сколько возможностей увидеть «интересное» получила процедура?
Ошибка защиты — зеркальная, но не симметричная
Защита тоже может ошибиться: «В городе ожидаются десять совпадений, значит вероятность вины подсудимого всего один из десяти». Это игнорирует остальные улики и механизм, по которому именно этот человек попал в подозреваемые. Вероятностная ошибка не становится верной от смены стороны.
Чтобы применить исчисление вероятностей, необходимо принять некую гипотезу о равновозможности случаев; выбор этой гипотезы предшествует расчёту и не может быть выведен из него самого.
Зависимые улики нельзя перемножать
Каждая улика обновляет общие шансы, и в форме шансов обновление удобно тем, что множители независимых улик просто перемножаются. Но перемножать отношения правдоподобий можно только при условной независимости: . Стоит появиться скрытой общей причине — и это равенство рушится, а наивное перемножение начинает считать одну и ту же информацию дважды.

Два свидетеля, обсудившие событие между собой, не дают два независимых показания. Два анализа одного загрязнённого образца делят источник ошибки. Наивное перемножение множителей завышает уверенность.
Откуда берётся исходная вероятность
Prior вины не должен возникать из личной симпатии или из самой улики. Его строят из информации, логически предшествующей улике: доступа к месту, времени, независимых записей, механизма отбора. Но превратить весь контекст в одно число трудно, поэтому эксперт обычно ограничивается , ясно называет сравниваемые гипотезы и не выносит окончательный posterior. И формулировка гипотез важна: «след принадлежит подсудимому» и «след принадлежит его неизвестному брату» дают разные отношения правдоподобий.
Вероятность имеет смысл лишь по отношению к определённой схеме испытаний; без указания этой схемы числовое значение вероятности остаётся пустым символом.
Русская линия ведёт к С. Н. Бернштейну — одному из создателей аксиоматики вероятности, который настаивал: у вероятности нет смысла без ясно заданной схемы испытаний и популяции. Ошибка прокурора и есть нарушение этого правила — частоту из одной популяции переносят в совсем другую ситуацию, не назвав схему.
Как читать вероятностное доказательство
Полезен короткий протокол. Записать словами гипотезы и наблюдение. Отделить от . Назвать популяцию, в которой оценивалась частота. Учесть число сравнений и способ выбора кандидата. Проверить зависимость разных улик. Только после этого число можно обсуждать содержательно: вероятность не заменяет судебное решение, но ограничивает, какие выводы совместимы с данными, и делает спор проверяемым.
Задачи
В университете студентов. Алгоритм сравнивает почерк неизвестной записки со всеми образцами; для непричастного студента вероятность попасть в список кандидатов равна , а автора алгоритм включает с вероятностью . Считая включения непричастных независимыми, найдите ожидаемое число ложных кандидатов и приближённую положительную прогностическую ценность как отношение ожидаемого числа включений автора к ожидаемому размеру списка. Объясните, почему это не то же самое, что математическое ожидание доли автора в конкретном списке.
До анализа камер шансы вины оценены как . Экспертиза дала улику с и . Вычислите отношение правдоподобий, апостериорные шансы и апостериорную вероятность. Повторите для prior и объясните различие.
Антивирус имеет вероятность ложной тревоги на независимый файл. За сутки он проверяет чистых файлов. Найдите вероятность хотя бы одной ложной тревоги и ожидаемое их число. Сравните точное с приближением . Объясните, почему ожидаемые две тревоги не означают ни ровно двух каждый день, ни стопроцентной вероятности хотя бы одной.
Две лаборатории исследуют один образец. При отсутствии вещества общий источник загрязнения с вероятностью делает оба анализа положительными; кроме того, техническая ложная тревога каждой лаборатории возникает независимо с вероятностью . При наличии вещества общего загрязнения нет, а чувствительность каждого анализа . Через вычислите , , , . Найдите истинное и наивное и объясните расхождение.
Возьмите реальную цель (например, число поездок велопроката за час) и сгенерируйте случайных признаков, не связанных с целью. Для каждого найдите наибольшую по модулю выборочную корреляцию случайного признака с целью и сравните её с теоретической оценкой ожидаемого максимума под нулевой гипотезой . Объясните, почему «найденная сильная корреляция» после перебора многих признаков не доказывает связь, и как это связано с ошибкой прокурора.
Поиск по базе даёт единственное совпадение среди млн записей; вероятность случайного совпадения для неродственного человека , чувствительность процедуры . Найдите , ожидаемое число случайных совпадений в базе и вероятность хотя бы одного. Объясните, почему из «единственного совпадения» не следует высокая вероятность вины без prior, и приведите два фактора (родство, механизм отбора), меняющих оценку.
Докажите, что при и число независимых редких совпадений в базе из записей приближается распределением Пуассона с параметром : выведите как предел биномиального . Для найдите , и и объясните, почему «ожидается десять» совместимо с широким разбросом фактического числа кандидатов.
Составьте экспертное заключение на – слов для ситуации: профиль совпал с одной записью в базе из пяти миллионов, оценка случайного совпадения для неродственного человека , чувствительность , способ включения подсудимого в базу неизвестен. Вычислите отношение правдоподобий, но не выдавайте posterior без prior. Перечислите минимум четыре ограничения: множественный поиск, применимость частоты к популяции, родство, лабораторная ошибка или механизм отбора.