Опрос оценивает долю сторонников маршрута, модель предсказывает завтрашнюю
загрузку, диспетчерская система решает, выпускать ли дополнительный автобус.
Три слова: статистика, машинное обучение и ИИ, отвечают за три разных звена
этой цепочки, и у каждого звена собственная математика и собственный способ
ошибаться.
Три команды и один маршрут
Город обсуждает новый автобусный маршрут. Прежде чем рисовать расписание,
мэрия хочет узнать, сколько жителей поедет. Опросить всех нельзя: в городе
миллион взрослых, а бюджет опроса рассчитан на тысячу разговоров. Первая
команда берёт случайную выборку и по тысяче ответов оценивает долю поддержки
во всём городе. Вместе с оценкой она обязана сообщить, насколько эта оценка
может промахнуться. Это работа статистического вывода.
Маршрут открыли. Теперь перевозчику каждое утро нужно число: сколько
пассажиров придёт завтра. Вторая команда строит модель, которая по календарю,
погоде и истории поездок выдаёт прогноз. Её не спрашивают о «доле поддержки
в генеральной совокупности»; её спрашивают, на сколько пассажиров прогноз
обычно ошибается на новых, ещё не виденных днях. Это работа машинного
обучения.
Наконец, прогноз сам по себе никого никуда не везёт. Третья команда встраивает
его в решение: при каком прогнозе выпускать резервный автобус, кто отвечает за
ошибку, как система объяснит своё решение оператору и что она запишет в
журнал. Прогноз стал частью контура наблюдений и действий. Такие контуры мы
начали разбирать в первом уроке, и именно к ним обычно относят
слова «система ИИ».
Одна цепочка связывает все три работы:
наблюдения⟶оценка⟶прогноз⟶действие.
Границы между дисциплинами размыты: статистик строит прогнозы, инженер
машинного обучения оценивает неопределённость, а проектировщик системы
пользуется и тем и другим. Спорить о названиях бесполезно. Полезно другое:
на каждом звене цепочки задаётся свой вопрос, даётся своя гарантия и
подстерегает своя характерная ошибка. Этот урок проходит цепочку слева
направо на одном сквозном материале: сначала настоящий провал опроса
1936 года, затем настоящие данные о нью-йоркских автобусах, затем решение
о выпуске рейса, которое замыкает контур.
У каждого звена свой вопрос и свой способ провалиться: смещённая рамка
выборки, утечка будущего в обучение, неверно назначенная цена ошибки.
Стрелка от действия назад к наблюдениям превращает конвейер в контур:
завтрашние данные придут уже из мира, изменённого сегодняшним решением.
Что выборка сообщает о городе
Запишем ответ жителя i числом: Xi=1, если он поддерживает маршрут, и
Xi=0 иначе. Пусть во всём городе доля сторонников равна p; это число
существует, но нам недоступно. По выборке из n ответов считают выборочную
долю
p^=n1i=1∑nXi.
Если каждый житель попадает в выборку с одинаковым шансом и ответы собираются
независимо, то p^ в среднем попадает точно в p:
Ep^=p. Отдельная выборка при этом почти никогда не даёт ровно
p. Мера типичного промаха, стандартная ошибка, выводится из дисперсии
суммы независимых слагаемых:
se(p^)=np(1−p)≈np^(1−p^).
Подставим числа нашего опроса. Из n=1000 случайно выбранных жителей маршрут
поддержали 580. Тогда p^=0,58 и
se(p^)≈10000,58⋅0,42≈0,0156.
Типичный промах: полтора процентных пункта. Удвоенная стандартная ошибка
даёт привычный доверительный интервал: 0,58±0,03. О том, что именно
означает эта запись, поговорим чуть ниже; сначала посмотрим, как ошибка
зависит от размера выборки, потому что эта зависимость управляет бюджетом
любого опроса.
Ошибка уменьшается как корень из n
В формуле стандартной ошибки размер выборки стоит под корнем. Отсюда правило,
которое стоит проверить руками: чтобы уменьшить случайную ошибку вдвое,
выборку нужно увеличить вчетверо. Погоня за точностью быстро дорожает:
переход от ±3 до ±1 процентного пункта требует не втрое, а
в девять раз больше интервью.
sense4n=p(1−p)/np(1−p)/(4n)=21.
Верно и обратное прочтение: после нескольких тысяч ответов дальнейший рост
выборки почти не помогает. При n=1000 случайная ошибка доли около полутора
пунктов, при n=10000 — около половины пункта. Если бы точность опроса
определялась только этой формулой, историю опросов можно было бы закрыть
одной страницей. Реальная история интереснее, и в 1936 году она поставила
эксперимент такого масштаба, какой ни один учебник не смог бы себе позволить.
Крушение «Литерари дайджест»
Осенью 1936 года журнал The Literary Digest проводил опрос о выборах
президента США: Франклин Рузвельт против Альфреда Лэндона. Журнал разослал
около десяти миллионов бюллетеней и получил 2,38 миллиона ответов. Ни один
опрос в истории не собирал столько. По формуле из предыдущего раздела
случайная ошибка такой выборки смехотворна:
se(p^)≈23800000,5⋅0,5≈0,0003,
три сотых процентного пункта. Журнал объявил: Лэндон победит с 57%
голосов. Через несколько недель Рузвельт получил 60,8% и выиграл 46 штатов
из 48. Опрос промахнулся почти на двадцать процентных пунктов, в шестьдесят
тысяч раз больше своей формальной ошибки. Журнал закрылся через полтора
года.
Джордж Гэллап в том же году предсказал победу Рузвельта по выборке примерно
в пятьдесят тысяч человек: в полсотни раз меньше. Дело не в размере. Адреса
для рассылки Digest брал из телефонных справочников и списков владельцев
автомобилей. В 1936 году, на дне Великой депрессии, телефон и автомобиль
были признаками достатка, а достаток коррелировал с голосованием за
республиканца Лэндона. Вторая беда: ответили только 24% получателей, и
недовольные действующим президентом отвечали охотнее. Обе ошибки не
случайные, а систематические: они не убывают с ростом n ни на волос.
Рис. 5.2. Два миллиона ответов против пятидесяти тысяч
Площадь круга пропорциональна числу ответов, положение на оси — прогнозу.
Гигантская выборка Digest легла далеко от результата, маленькая выборка
Гэллапа — рядом. Случайная ошибка обеих выборок меньше толщины линии: весь
промах Digest систематический.
Смещение и разброс в одной формуле
Разделим промах оценки на две части аккуратно. Пусть оценка θ^
целится в истинное значение θ. Средний квадрат промаха раскладывается
точно:
Рост выборки давит только второе слагаемое: разброс убывает как 1/n.
Первое слагаемое, квадрат смещения, от n не зависит вовсе. У Digest
смещение составляло около двадцати пунктов, и никакие миллионы ответов не
могли его тронуть. Отсюда практическое правило чтения любого отчёта об
опросе: приведённое «±» описывает лишь разброс; о смещении рамки и
отклика формула молчит, и спрашивать о них нужно словами, а не формулами.
С происхождением данных и вопросом «кто не попал в таблицу» мы подробно
работали в уроке о данных.
Схема выборки как часть ответа
Как собрать выборку, которой можно верить? Простейший честный способ:
пронумеровать всю совокупность и выбирать номера случайно, как лотерейные
шары. Часто доступен способ сильнее. Пусть город делится на L известных
групп, страт: по возрасту, району или способу добираться до работы. Доля
страты h в населении равна Wh, и внутри каждой страты мы проводим свой
случайный опрос объёма nh. Стратифицированная оценка собирается как
взвешенная сумма:
Выигрыш двойной. Во-первых, оценка защищена от случайного перекоса состава:
доля молодёжи в ответах равна её доле в городе по построению, а не по
везению. Во-вторых, если внутри страт мнения однороднее, чем между ними,
разброс стратифицированной оценки меньше, чем у простой случайной выборки
того же объёма. Платит за это организатор: нужно заранее знать веса Wh и
уметь опрашивать каждую страту отдельно.
Посчитаем на числах. Пусть город состоит из двух страт: 30% жителей ездят
на работу транспортом (W1=0,3), 70% — нет (W2=0,7). Опрос дал
p^1=0,82 по n1=300 ответам и p^2=0,47 по n2=700.
Тогда
Простая выборка того же объёма дала бы около 0,0156: стратификация
срезала десятую часть ошибки бесплатно, просто за счёт знания структуры
города. В машинном обучении та же идея вернётся под именем
стратифицированного разбиения на обучение и контроль в
уроке о честной проверке.
Интервал принадлежит процедуре, а не числу
Вернёмся к записи 0,58±0,03 и произнесём её точный смысл, потому
что неточное прочтение этой записи — самая массовая статистическая ошибка.
Интервал строится по правилу
p^±znp^(1−p^),z≈1,96дляуровня95%.
Уровень 95% относится к процедуре, а не к конкретному интервалу. Если много
раз повторять весь опрос заново и каждый раз строить интервал по этому
правилу, то около 95% построенных интервалов накроют истинную долю p.
Про один уже построенный интервал вероятностного утверждения не остаётся:
он либо накрыл p, либо нет, и мы не узнаем, что случилось. Рисунок 5.3
делает эту конструкцию видимой: сто повторов одного и того же честного
опроса, сто интервалов, и примерно пять из них промахиваются мимо истины
не по чьей-то вине, а по устройству случайности.
Рис. 5.3. Сто повторов опроса: покрытие принадлежит процедуре
Верхняя серия: честная случайная выборка, интервалы прыгают вокруг истинной
доли p=0,55, промахиваются примерно пять из ста. Нижняя серия: та же
формула при смещённой рамке выборки. Интервалы стали не шире, а дружно
легли мимо: формула честно измеряет разброс и ничего не знает о смещении.
Формула с z=1,96 приближённая: она опирается на нормальную аппроксимацию
биномиального распределения и портится на краях, при p^ около нуля
или единицы. Интервал Уилсона аккуратнее:
1+nz2p^+2nz2±znp^(1−p^)+4n2z2
При p^=0,58 и n=1000 оба интервала совпадают до третьего знака.
Разница проявляется на редких событиях: оценить долю дней с нулевыми
продажами по 20 наблюдениям, из которых событие случилось один раз, простая
формула не может, а интервал Уилсона даёт разумный ответ.
Лаборатория опроса: где ломается рамка
Прежде чем перейти от оценки к прогнозу, проверьте руками всё, что
утверждалось выше. В лаборатории живёт город из ста тысяч жителей с
неизвестной вам долей поддержки. Доступны три схемы: простая случайная
выборка, выборка по «телефонной книге», накрывающей только часть города, и
стратифицированная выборка по способу добираться до работы.
Опрос города: рамка, размер и сто повторов
График шире экрана — листайте по горизонтали →
Загружается живая иллюстрация…
Рабочий протокол. Сначала при честной случайной схеме увеличивайте n и
следите, как сжимается облако оценок в ста повторах: закон 1/n
виден глазами. Затем переключитесь на телефонную книгу и повторите: облако
сжимается вокруг чужого центра, и кнопка «ещё ответы» перестаёт быть
кнопкой «точнее». В конце сравните стратифицированную схему с простой при
равных n: выигрыш скромный, но бесплатный. Число под графиком, покрытие
интервалов, отвечает на вопрос предыдущего раздела честнее любых слов.
Задача прогноза ставится иначе
Опрос спрашивал о фиксированном числе p, скрытом свойстве совокупности.
Перевозчику нужно другое: правило f, которое по признакам дня x —
дате, дню недели, погоде, каникулам — выдаёт прогноз загрузки
y^=f(x). Правило оценивают не по тому, насколько красиво оно
объясняет прошлое, а по ожидаемой ошибке на будущих днях:
R(f)=E[ℓ(f(X),Y)],
где ℓ — функция потерь, цена одного промаха. Для загрузки естественна
абсолютная ошибка ℓ(y^,y)=∣y^−y∣: она измеряется в пассажирах
и читается без перевода. Ожидание R(f) берётся по распределению будущих
дней, которого мы не знаем, поэтому его оценивают средним по отложенным
данным:
R=m1t=1∑mf(xt)−yt,
и вся статистика первой половины урока немедленно возвращается: R
— выборочное среднее, у него есть стандартная ошибка, и сравнение двух
моделей по R — снова задача статистического вывода. Различие
не в математике, а в постановке: статистика чаще спрашивает «каков параметр
источника», обучение — «как ошибётся правило на следующем объекте». Первую
постановку называют выводом, вторую — предсказанием, и одна и та же формула
может служить обеим.
1776 дней нью-йоркских автобусов
Дальше работаем с настоящей таблицей. Транспортное управление Нью-Йорка
(MTA) ежедневно публикует оценку числа поездок на городских автобусах;
открытый набор данных лежит на портале data.ny.gov (набор vxuj-8kew) и
на момент подготовки урока содержал 1776 дней, с 1 марта 2020 года по
8 января 2025-го. За 2024 год средняя загрузка составила 1 117 138 поездок
в день. Среднее по неделе устроено так:
День
Пн
Вт
Ср
Чт
Пт
Сб
Вс
Тыс. поездок
1213
1302
1310
1288
1239
815
647
Вторник, среда и четверг почти неотличимы, пятница чуть легче, а воскресенье
вдвое тише среды. Городской транспорт дышит неделей, и это дыхание —
главный ресурс прогнозиста: не зная о городе ничего больше, уже можно
предсказывать неплохо.
Рис. 5.4. Недельное дыхание города: осень 2024 года
Слева десять недель осени 2024 года: будни держатся выше миллиона поездок,
выходные проваливаются. Справа средний профиль недели за весь год. Провал
в конце ноября — не сбой датчика, а День благодарения; календарь ещё
сыграет свою роль.
Наивная модель сильнее, чем кажется
Недельный ритм подсказывает прогноз без единого обученного параметра:
завтра будет столько же поездок, сколько в тот же день неделю назад,
y^t=yt−7.
Прогон этого правила по всем дням 2024 года даёт среднюю абсолютную ошибку
Rnaive=3661t∑yt−7−yt≈92968
поездок в день, около 8% средней загрузки. Для сравнения возьмём совсем
грубое правило: всегда предсказывать среднегодовое значение. Его ошибка —
250 682 поездки, в два и семь десятых раза хуже. Одна строчка про «неделю
назад» съела почти две трети ошибки константы.
Отсюда главный обычай честного прогнозирования: любая модель обязана
сравниваться с сильной наивной базовой линией, и отчитываться не только
абсолютной ошибкой, но и отношением к ней. Это отношение называют MASE:
MASE=RnaiveRmodel,MASE<1— модельполезна.
Сложная модель с ошибкой 90 000 выглядит внушительно в отчёте, пока рядом
не встанет бесплатное правило с 93 000: выигрыш три процента, и его ещё
нужно отличить от случайности. В соревнованиях прогнозов и в честных
статьях базовая линия стоит в первой таблице, а не в сноске.
Праздник ломает прогноз дважды
Средняя ошибка скрывает интересное. Разложим ошибки наивного правила по
дням года и посмотрим на самые крупные. Вот верх списка за 2024 год, в
тысячах поездок:
Дата
Промах
Что случилось
25 декабря
1014
Рождество: город встал
5 декабря
939
неделя после Дня благодарения
28 ноября
890
День благодарения
9 сентября
828
неделя после Дня труда
8 января
771
неделя после Нового года
3 июня
701
неделя после Дня поминовения
27 мая
698
День поминовения
Закономерность видна без статистики: каждый праздник бьёт по прогнозу
дважды. В сам праздник правило переносит на тихий день загрузку обычной
недели и завышает; через неделю оно переносит праздничную тишину на
обычный день и занижает. Ошибка — не случайный шум, а подпись пропущенного
признака: календаря. Стоит добавить в модель индикатор праздника,
и обе половины пары исчезают из верха таблицы ошибок. Останется один
выброс без календарной пары: 13 февраля 2024 года, вторник с промахом в
622 тысячи, когда на Нью-Йорк обрушился первый за два года крупный
снегопад. Погоду календарь не знает; это подпись следующего недостающего
признака. Чтение остатков модели как дневника её
невежества — приём, который мы впервые применили к падению шара в
уроке о модели и эксперименте и который не стареет ни на
каком уровне сложности.
Рис. 5.5. Ошибки наивного правила помнят календарь
Каждая точка — ошибка правила «как неделю назад» в один день 2024 года.
Пары выбросов вокруг праздников симметричны: перелёт в сам праздник,
недолёт через неделю. Красные точки без подписи — те же пары вокруг дня
Мартина Лютера Кинга, Президентского дня, 4 июля и Дня Колумба.
Единственный крупный выброс без календарной пары — снежный шторм
13 февраля: пропущенный признак «погода».
Проверка по времени без подглядывания
Чтобы честно измерить ошибку правила на «новых днях», нужно аккуратно
определить слово «новые». У временного ряда есть стрела времени, и она
запрещает привычное случайное перемешивание: обучившись на пятнице и
проверившись на предыдущем вторнике, модель подглядывает в будущее.
Правильная схема повторяет жизнь. Фиксируем момент T, обучаем правило
только на днях t≤T, прогнозируем день T+1, затем сдвигаем границу и
повторяем:
R=m1k=1∑mf≤Tk(xTk+1)−yTk+1,
где f≤T обозначает правило, обученное без единого взгляда за
границу T. Схему называют скользящим началом. Она дороже перемешивания:
модель приходится переобучать много раз, но только она отвечает на вопрос,
который задаёт диспетчер. Общую теорию честного разделения данных мы
построим в уроке о train, validation и test, а урок о
переобучении покажет, что случается с моделями, которым
позволили подглядывать.
Март 2020 года: мир сдвигается целиком
Праздники и штормы сдвигают ряд на день-другой. В нашей таблице записан и
сдвиг другого масштаба. В первую неделю марта 2020 года будни держались
около 2,2 миллиона поездок. 18 марта наивное правило промахнулось на
миллион с лишним: город закрывался. К концу апреля дневные значения в
таблице упали ниже двадцати тысяч, а 26 апреля 2020 года колонка сообщает
5498 поездок на весь Нью-Йорк. После лета ряд возвращается, но не к
прежнему уровню: будни 2022–2024 годов стоят на плато около 1,3 миллиона,
на 40% ниже доковидного уровня. Мир, который прогнозировала бы модель
образца февраля 2020 года, перестал существовать за две недели.
Поучительно, кто пережил этот обвал. Правило «как неделю назад» ошибалось
чудовищно ровно семь дней подряд: начиная с восьмого дня оно опиралось уже
на новую реальность, и к середине апреля его ошибка составляла считанные
тысячи. Наивная модель самовосстановилась, потому что не хранит ничего,
кроме последней недели. Модель «среднее за прошлый год» осталась сломанной
на месяцы: её память стала её приговором. Общая формула этого компромисса,
экспоненциальное сглаживание, взвешивает прошлое с затуханием:
y^t=λyt−7+(1−λ)y^t−7,0<λ≤1,
где λ управляет длиной памяти: при λ=1 получается наше
наивное правило, при малых λ — долгая память и медленная реакция
на сдвиги. Выбор λ — тот же размен смещения и разброса из первой
половины урока, только во времени: короткая память шумит, длинная память
отстаёт от мира.
Рис. 5.6. Пять лет одного ряда: обвал, бесплатное лето и новое плато
Сглаженный семидневным средним ряд поездок. Затенённое окно: с 23 марта по
31 августа 2020 года проезд был бесплатным, и привязанная к оплате оценка
почти перестала видеть пассажиров. После восстановления оплаты ряд выходит
не на старый уровень, а на новое плато: часть поездок навсегда ушла в
удалённую работу.
Сравнение моделей возвращает статистику
Календарная модель дала ошибку 74 400, наивная — 92 968. Разница 18 568
поездок: много это или случайность удачного года? Вопрос статистический, и
инструменты первой половины урока применяются дословно. Для каждого дня
t посчитаем парную разность ошибок:
dt=y^tnaive−yt−y^tcal−yt,
получим m=366 чисел со средним dˉ=18568. Стандартная ошибка
среднего оценивается по выборочному разбросу разностей:
se(dˉ)=msd,sd2=m−11t∑(dt−dˉ)2,
и интервал dˉ±2se(dˉ) отвечает на вопрос о
случайности. Существенно, что разности парные: обе модели проверялись на
одних и тех же днях, поэтому общая для обеих трудность дня, шторм или
праздник, вычитается и не раздувает разброс. Одна тонкость остаётся:
соседние dt зависимы, тяжёлая неделя портит обе модели несколько дней
подряд, поэтому формула для se(dˉ) слегка оптимистична
и честный отчёт оговаривает это словами.
Круг замкнулся. Машинное обучение построило правило; статистика измерила,
насколько правилу можно верить. Две дисциплины не соседствуют, а вложены
одна в другую.
Цена ошибки назначает порог действия
Диспетчеру прогноз нужен не сам по себе: в семь утра он решает, выпускать
ли резервный автобус. Ошибки решения несимметричны. Лишний автобус стоит
топлива и смены водителя, скажем cлишн=20 условных единиц.
Невыпущенный автобус при переполнении стоит сорванных поездок, жалоб и
опозданий: cпроп=80. Пусть модель оценивает вероятность
переполнения как q. Сравним ожидаемые затраты двух действий:
Выпускать выгодно, когда cлишн<qcпроп, то есть при
q>q⋆=cпропcлишн=8020=0,25.
Порог решения определился ценами, а не круглым числом 0,5. Прогноз
«переполнение с вероятностью 30%» звучит успокаивающе, но при таких ценах
он уже команда выпускать. Общий принцип записывается через функцию затрат
C(a,y), зависящую от действия и исхода:
a⋆(x)=argaminE[C(a,Y)∣X=x],
и читается так: модель отвечает за условное распределение будущего, а
выбор действия — за минимизацию ожидаемых затрат при этом распределении.
Прогноз и решение разделены. Одна и та же модель обслуживает осторожного и
рискованного диспетчера; меняются цены, а не веса. Тот же принцип разделит
ошибки первого и второго рода в уроке о классификации, и он
же объяснит поведение спам-фильтра, скорингов и медицинских тестов.
Лаборатория диспетчера: порог, цены и месяц работы
Вторая лаборатория проигрывает месяц работы маршрута на недельном ритме,
списанном с данных MTA. Модель каждое утро выдаёт вероятность переполнения;
качество модели и цены ошибок в ваших руках, порог — тоже.
Резервный автобус: вероятность, порог и счёт за месяц
График шире экрана — листайте по горизонтали →
Загружается живая иллюстрация…
Три опыта в порядке возрастания поучительности. Первый: при ценах 20/80
двигайте порог и найдите минимум месячных затрат; сравните с расчётным
q⋆=0,25 и с «интуитивным» порогом 0,5. Второй: ухудшите
модель шумом и посмотрите, как минимум затрат сдвигается и мелеет: с плохим
прогнозом даже правильный порог спасает лишь отчасти. Третий: включите
обратную связь, при которой выпущенный автобус приманивает пассажиров на
маршрут, и понаблюдайте, как вчерашние решения искажают сегодняшнюю
статистику переполнений. Этот эффект — тема следующего раздела.
Действие меняет следующую строку данных
Пока команда только предсказывала, мир не замечал её работы. Как только
прогноз стал действием, стрелка замкнулась в кольцо:
xt⟶y^t⟶at⟶xt+1.
Выпущенный автобус сокращает ожидание, короткое ожидание приводит новых
пассажиров, и следующая таблица собрана уже в изменённом мире. Прогноз,
влияющий на собственные будущие данные, называют перформативным, и вокруг
этого свойства строится целый список ловушек. Оценить новую политику
диспетчеризации по архиву, собранному при старой политике, напрямую нельзя:
в архиве нет дней, где резерв выпускали по новому правилу. Модель,
обученная на данных времён её собственной работы, учится в том числе у
самой себя. Даже метрика «доля переполнений» перестаёт быть внешней:
хорошая работа диспетчера убирает переполнения из данных, и наивный вывод
«проблема исчезла, резерв не нужен» разрушает то, что его породило.
Строгий инструментарий для таких колец: эксперимент, при котором действие
иногда выбирается случайно, и внеполитическое оценивание, мы отложим до
урока об A/B-тестах и
уроков об обучении с подкреплением. Бытовое правило доступно уже сейчас. У всякой развёрнутой модели есть два
вопроса: насколько она точна и что её действия делают с её же будущими
данными. Второй вопрос задают реже, а стоит он обычно дороже.
Рис. 5.7. Прогноз, ставший действием, меняет собственные данные
Сплошные стрелки — рабочий цикл диспетчерской системы. Пунктирная стрелка —
незваный участник: действие меняет распределение будущих наблюдений, и
модель начинает учиться у последствий собственных решений. Архив, собранный
при одной политике, молчит о том, что случилось бы при другой.
Слово «ИИ» и три вида гарантий
Теперь можно точно сказать, где в этой истории искусственный интеллект.
Не в конкретной формуле: формулы принадлежат статистике и оптимизации.
Слово «ИИ» уместно, когда оценки и прогнозы встроены в систему, которая
воспринимает среду, действует в ней, объясняет свои действия и несёт
заданную человеком ответственность. Нейросеть может быть крошечной деталью
такой системы; глубокая модель без действия остаётся исследовательским
инструментом.
Полезно различать уровни полномочий системы. Она может только показывать
прогноз; может рекомендовать действие с объяснением; может действовать в
безопасном коридоре с правом оператора на отмену; может действовать
автономно. С ростом полномочий растут требования к обвязке: журналу
решений, резервному правилу на случай отказа модели, кнопке остановки и
регулярной проверке качества на свежих данных. Все эти требования лежат вне математики: они инженерные и организационные,
и подробный разговор о них пойдёт в
уроке о безопасности ИИ.
Сведём гарантии трёх дисциплин в одну таблицу:
Звено
Главный вопрос
Форма ответа
Характерный провал
Статистика
что верно об источнике данных
оценка с интервалом
смещённая рамка выборки
Машинное обучение
как ошибётся правило на новых данных
ошибка на честной проверке
утечка будущего, слабая базовая линия
Система ИИ
что произойдёт при развёртывании
протокол действий и журнал
кольцо обратной связи, неверные цены ошибок
Таблица — рабочий чек-лист. Встречая любую систему, от прогноза погоды до
рекомендаций музыки, задайте все три вопроса по очереди. Пропущенное звено
обнаружится быстро, и почти всегда это будет третье.
Цепочка собрана: от выборки до действия
Статистический вывод отвечает за связь выборки с источником: оценка обязана
приходить с мерой разброса, а разброс — лишь половина правды, потому что
смещение рамки не лечится размером выборки; это доказал опрос на два
миллиона ответов. Машинное обучение отвечает за перенос правила на новые
данные: честная проверка уважает стрелу времени, сильная наивная базовая
линия обязательна, а таблица худших ошибок читается как список недостающих
признаков; это показали 1776 дней нью-йоркских автобусов. Решение
превращает вероятность в действие через цены ошибок, и порог q⋆
выводится из цен одной строкой. Действие замыкает кольцо и начинает менять
данные, из которых система учится; с этого места точность перестаёт быть
свойством модели и становится свойством пары «модель и мир».
В следующем уроке мы разложим само обучение на пять режимов
по виду доступной обратной связи: от полной разметки до редкой запаздывающей
награды. А в уроке о классификации первое звено сегодняшней
цепочки будет разобрано до винтов: граница между классами, два рода ошибок
и порог, который сегодня появился из цен, станут главными героями.