Различие между группами убеждает, когда оно велико относительно случайного разброса процедуры. Главная сила эксперимента возникает до вычислений: рандомизация делает группы сравнимыми без знания всех скрытых факторов, а записанный заранее протокол лишает случайность права выбирать, что мы объявим открытием.

Кнопка стала синей, кликов стало больше

Сайт случайно показал половине посетителей зелёную кнопку A, половине синюю B. В A кликнули 7,8%, в B — 8,3%. Разница 0,5 процентного пункта может быть эффектом цвета, случайным колебанием или следствием ошибки дизайна. Пока мы не скажем, какого разброса ждать при отсутствии эффекта, у этих 0,5 пункта нет смысла: число без масштаба сравнения не является свидетельством.

Эта глава — про две разные вещи, которые легко перепутать. Первая: как устроен эксперимент, чтобы сравнение вообще что-то значило. Вторая: как измерять разницу в единицах собственного шума процедуры. Первая важнее. Никакой критерий не спасёт сравнение, где группы собраны по-разному, и никакая формула не восстановит тех, кого не спросили.

Что именно мы хотим измерить

Представим, что у каждого объекта ii есть два возможных исхода: Yi(1)Y_i(1) — что случилось бы при варианте B, и Yi(0)Y_i(0) — что случилось бы при A. Эффект для одного объекта

τi=Yi(1)Yi(0)\tau_i=Y_i(1)-Y_i(0)

не наблюдаем никогда: человек либо увидел синюю кнопку, либо зелёную. Это называют фундаментальной проблемой причинного вывода. Спасает то, что нам обычно нужно среднее:

τ=E[Y(1)Y(0)]=E[Y(1)]E[Y(0)].\tau=\mathbb E[Y(1)-Y(0)]=\mathbb E[Y(1)]-\mathbb E[Y(0)].

Наблюдаемый исход связан с назначением Ti{0,1}T_i\in\{0,1\} простым правилом

Yi=TiYi(1)+(1Ti)Yi(0).Y_i=T_iY_i(1)+(1-T_i)Y_i(0).

Если назначение независимо от потенциальных исходов, T(Y(1),Y(0))T\perp (Y(1),Y(0)), то

E[YT=1]=E[Y(1)],E[YT=0]=E[Y(0)],\mathbb E[Y\mid T=1]=\mathbb E[Y(1)],\qquad \mathbb E[Y\mid T=0]=\mathbb E[Y(0)],

и разность выборочных средних оказывается несмещённой оценкой τ\tau:

E[YˉBYˉA]=τ.\mathbb E\left[\bar Y_B-\bar Y_A\right]=\tau .

Вся конструкция держится на независимости назначения. Её нельзя проверить после эксперимента — её нужно создать до него.

Рандомизация — машина сравнимости

Рандомизация не делает группы одинаковыми. Она делает их одинаково случайными: любые различия — по возрасту, устройству, привычкам, настроению — попадают в группы без систематической связи с вариантом. Скрытые факторы, которых мы не измеряли и даже не подозреваем, распределяются тем же механизмом, что и известные.

До запуска нужно определить единицу рандомизации. Если вариант назначается при каждом показе, один человек увидит оба цвета, его повторные действия зависимы, а формула стандартной ошибки, считающая наблюдения независимыми, занизит шум. Рандомизация по пользователю сохраняет вариант за человеком. Кластеры вроде класса или школы требуют назначения целого кластера, если участники влияют друг на друга.

Полезная привычка — проверка баланса до анализа основной метрики: сравнить группы по доэкспериментальным признакам, которые эффект заведомо не мог изменить. Небольшие расхождения нормальны и сами подчиняются тем же законам случайности. Тревожен систематический перекос: он обычно означает ошибку в механизме назначения, а не редкое совпадение.

A/A-тест: разница есть всегда

Возьмём реальные данные городского велопроката: 1737917\,379 почасовых записей, среднее число поездок 189,46189{,}46, медиана 142142, стандартное отклонение 181,39181{,}39 — распределение сильно скошено, как мы видели в уроке 41. Никакого воздействия здесь нет и быть не может: это просто прошлое. Разобьём записи случайно пополам и сравним средние, как если бы это были группы A и B.

Одно такое разбиение (генератор с фиксированным зерном) дало yˉA=187,57\bar y_A=187{,}57 и yˉB=191,36\bar y_B=191{,}36: разница 3,793{,}79 поездки в час. Стандартная ошибка разности

se=sA2nA+sB2nB\operatorname{se}=\sqrt{\frac{s_A^2}{n_A}+\frac{s_B^2}{n_B}}

превращает её в z=1,38z=1{,}38, чему соответствует p=0,168p=0{,}168. Разница есть, эффекта нет.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Гистограмма z-статистик по 4000 случайных разбиений реального велопроката на две половины совпадает со стандартной нормальной кривой; красные хвосты за порогом 1,96 содержат 5,5 процента разбиений, золотая линия отмечает одно разбиение с z=1,38
Рис. 55.1. A/A-тест на реальных данных: эффекта нет, разница есть всегда

Четыре тысячи случайных разбиений одних и тех же реальных записей. Эффекта нет по построению, но разность средних каждый раз другая. Её распределение почти в точности стандартное нормальное (выборочное стандартное отклонение zz равно 1,0081{,}008) — это центральная предельная теорема в работе. За порогом z>1,96|z|>1{,}96 оказались 5,5%5{,}5\% разбиений: ровно та доля ложных тревог, которую мы сами себе разрешили.

Это и есть нулевое распределение — эталон, с которым сравнивают наблюдаемую разницу. Заметьте, что мы получили его без единого предположения о форме данных: достаточно перемешивать реальные записи. Такой приём называется перестановочным тестом, и его pp-значение считается прямо как доля перестановок, давших статистику не хуже наблюдённой:

pperm=#{b: TbTobs}B.p_{\text{perm}}=\frac{\#\{b:\ |T_b|\geq|T_{\text{obs}}|\}}{B}.

Разность и её шум

Для бинарной метрики (кликнул / не кликнул) оценка эффекта — разность долей

τ^=p^Bp^A,\widehat\tau=\widehat p_B-\widehat p_A,

а её дисперсия складывается из дисперсий независимых групп:

Var(τ^)=pA(1pA)nA+pB(1pB)nB.\operatorname{Var}(\widehat\tau)= \frac{p_A(1-p_A)}{n_A}+\frac{p_B(1-p_B)}{n_B}.

Подставив оценки вместо неизвестных долей, получаем стандартную ошибку

se(τ^)=p^A(1p^A)nA+p^B(1p^B)nB\operatorname{se}(\widehat\tau)= \sqrt{ \frac{\widehat p_A(1-\widehat p_A)}{n_A}+ \frac{\widehat p_B(1-\widehat p_B)}{n_B} }

и статистику z=τ^/sez=\widehat\tau/\operatorname{se} — эффект, измеренный в единицах собственного шума процедуры. Приближённый доверительный интервал из урока 46:

τ^±1,96se(τ^).\widehat\tau\pm1{,}96\operatorname{se}(\widehat\tau).

Статистическая заметность не равна практической. При миллионах показов микроскопический эффект окажется «значимым», хотя пользы от него нет; при тысяче наблюдений огромный эффект утонет в шуме. Отношение zz отвечает на вопрос «отличимо ли от нуля», а не «стоит ли того».

Нулевая модель и p-значение

Нулевая гипотеза H0H_0 задаёт мир без эффекта — вместе со всей процедурой: способом назначения, объёмом, правилом остановки. pp-значение — вероятность при H0H_0 получить статистику не менее экстремальную, чем наблюдаемая:

p=PH0{TTobs}.p=P_{H_0}\{|T|\geq|T_{\text{obs}}|\}.

Это не вероятность истинности H0H_0 и не вероятность того, что результат случаен. Условие стоит справа от вертикальной черты: мы считаем вероятность данных при гипотезе, а не гипотезы при данных. Перепутать их — та же ошибка прокурора, что в уроке 43; чтобы развернуть условие, нужны априорные шансы, а их pp-значение не содержит.

Уровень α\alpha заранее задаёт частоту ложных отклонений в серии экспериментов, где H0H_0 верна:

PH0{отклонить H0}α.P_{H_0}\{\text{отклонить }H_0\}\leq\alpha .

Это утверждение о процедуре, повторяемой много раз, а не о конкретном результате. Если выбирать порог после просмотра результата, гарантия исчезает — частота считается по тому правилу, которое вы применяете на самом деле.

Ошибки двух родов и мощность

Решение по эксперименту может ошибиться двумя способами:

α=P{отклонить H0H0 верна},β=P{не отклонитьH1 верна}.\alpha=P\{\text{отклонить }H_0\mid H_0\ \text{верна}\},\qquad \beta=P\{\text{не отклонить}\mid H_1\ \text{верна}\}.

Мощность — вероятность обнаружить заданный истинный эффект:

Power(τ)=1β=Pτ{отклонить H0}.\operatorname{Power}(\tau)=1-\beta=P_\tau\{\text{отклонить }H_0\}.

Она растёт с объёмом, размером эффекта и допустимым α\alpha, уменьшается с шумом. Для двусторонней проверки при нормальном приближении

Power(τ)Φ ⁣(τsez1α/2).\operatorname{Power}(\tau)\approx \Phi\!\left(\frac{|\tau|}{\operatorname{se}}-z_{1-\alpha/2}\right).
Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Три кривые мощности в зависимости от объёма группы в логарифмической шкале: для эффектов 0,5, 1 и 2 процентных пункта; отметки восьмидесятипроцентной мощности стоят при n около 47 525, 12 205 и 3 210
Рис. 55.2. Чем меньше эффект, тем дороже его увидеть

База 8%, уровень 0,050{,}05. Чтобы с вероятностью 80%80\% поймать прирост в 22 пункта, хватит 32103\,210 человек на группу; для 11 пункта нужно 1220512\,205; для 0,50{,}5 пункта — 4752547\,525. Уменьшение эффекта вдвое умножает цену почти вчетверо, потому что nn входит в стандартную ошибку под корнем.

Планирование начинается с минимального практически значимого эффекта, а не с надежды «соберём сколько получится». Формула объёма для сравнения двух долей:

n(z1α/2+z1β)2[pA(1pA)+pB(1pB)]τ2.n\approx\frac{(z_{1-\alpha/2}+z_{1-\beta})^2 \left[p_A(1-p_A)+p_B(1-p_B)\right]}{\tau^2}.

При базе 8%, эффекте 0,50{,}5 пункта, α=0,05\alpha=0{,}05 и мощности 80%80\% она даёт n47525n\approx47\,525 на группу. Если взять 1000010\,000, мощность окажется 0,2500{,}250: даже при реально существующем эффекте эксперимент промолчит в трёх случаях из четырёх. При 100000100\,000 мощность равна 0,9820{,}982.

Сколько нужно людей: MDE

Обратный вопрос практичнее: какой эффект вообще различим при доступном объёме? Минимальный различимый эффект (MDE) получается разрешением той же формулы относительно τ\tau:

MDE=(z1α/2+z1β)2p(1p)n.\text{MDE}=(z_{1-\alpha/2}+z_{1-\beta}) \sqrt{\frac{2p(1-p)}{n}} .

Разговор о MDE лечит от самой частой болезни школьных и корпоративных экспериментов — надежды измерить полупроцентный эффект на выборке в двести человек. Такой опыт даёт не «отсутствие эффекта», а отсутствие информации.

Подглядывание: как честный тест теряет уровень

Формула z=τ^/sez=\widehat\tau/\operatorname{se} ничего не знает о том, сколько раз вы на неё смотрели. Гарантия α=0,05\alpha=0{,}05 относится к правилу «посмотреть один раз в конце». Правило «смотреть каждый день и остановиться, как только p<0,05p<0{,}05» — другая процедура, и уровень у неё другой.

Проверим это на тех же реальных данных. Разобьём записи велопроката пополам (эффекта нет), будем добавлять по 434434 наблюдения в каждую группу и считать zz после каждого пакета — всего 2020 проверок. В 20002000 повторов доля тех, где z|z| хоть раз пересёк 1,961{,}96, оказалась 24,85%24{,}85\%, тогда как при единственной проверке в конце — 4,3%4{,}3\%. Уровень вырос почти в шесть раз, а ни одна формула не изменилась.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Шестьдесят траекторий накопленной z-статистики при нулевом эффекте на реальных данных; красные траектории хотя бы раз пересекают горизонтальные пороги плюс-минус 1,96
Рис. 55.3. Подглядывание раздувает ложные открытия

Каждая линия — эксперимент без эффекта, пересчитываемый после каждого пакета данных. Серые остались внутри коридора, красные хотя бы раз пересекли порог и дали бы «значимый» результат при остановке в этот момент. Траектория блуждает, и чем дольше на неё смотреть, тем вероятнее, что она случайно коснётся границы.

Лечение известно и не требует героизма. Первый способ — фиксированный горизонт: объём и дата подведения итогов записаны заранее, промежуточные значения считаются служебной информацией и не имеют права остановить опыт. Второй — последовательные методы, где границы специально расширены на ранних шагах, так что суммарная вероятность ложного пересечения остаётся равной α\alpha. Идея последовательного анализа принадлежит Абрахаму Вальду (1945), а её строгая теория оптимальной остановки развита в том числе советской школой; практический вывод для нас один: правило остановки — часть гипотезы, а не деталь реализации.

Лаборатория A/B

Эффект, шум, размер выборки и преждевременная остановка

Загружается живая иллюстрация…

Виджет прогоняет 400400 повторов одного и того же эксперимента при истинном эффекте, который вы задаёте сами. Поставьте эффект в ноль: доля отклонений держится около 5%5\% — это уровень. Включите правило «остановиться при p<0,05p<0{,}05» — доля взлетает в несколько раз, хотя ни база, ни объём не изменились. Верните фиксированный горизонт и задайте эффект 0,50{,}5 пункта: при малом nn мощность мала, а средняя оценка среди победивших повторов заметно больше истины. Увеличивайте nn — облако сужается, доля побед растёт, а золотая линия сползает к зелёной. Это и есть проклятие победителя, исчезающее только с ростом мощности.

Двадцать метрик — двадцать билетов

Если проверить mm независимых метрик на уровне α\alpha, вероятность хотя бы одной ложной тревоги

P{хотя бы одна}=1(1α)m.P\{\text{хотя бы одна}\}=1-(1-\alpha)^m .

При m=5m=5 это 22,6%22{,}6\%, при m=12m=12 — уже 46,0%46{,}0\%, при m=20m=2064,15%64{,}15\%. Отчёт, в котором сообщён единственный «улучшившийся» показатель из двадцати, показывает читателю одну попытку, тогда как случайность использовала двадцать.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Красная кривая вероятности хотя бы одной ложной тревоги растёт с ростом числа метрик; синяя кривая с поправкой Бонферрони остаётся у пяти процентов; отмечена точка двадцати метрик со значением 64,2 процента
Рис. 55.4. Каждая лишняя метрика — ещё один билет в лотерее ложных открытий

Без поправки вероятность хотя бы одной ложной тревоги растёт как 10,95m1-0{,}95^m и на двадцати метриках достигает 64,15%64{,}15\%. Поправка Бонферрони (порог α/m\alpha/m, для m=20m=20 это 0,00250{,}0025) удерживает её у заявленных 5%5\%, но ценой чувствительности: настоящие эффекты приходится доказывать строже.

Бонферрони контролирует вероятность хотя бы одной ошибки (FWER) и потому консервативен при больших mm. Процедуры контроля доли ложных открытий (FDR) ставят более мягкую цель:

FDR=E[Vmax(R,1)]q,\text{FDR}=\mathbb E\left[\frac{V}{\max(R,1)}\right]\leq q,

где RR — число объявленных открытий, VV — число ложных среди них. Процедура Бенджамини–Хохберга упорядочивает p(1)p(m)p_{(1)}\leq\ldots\leq p_{(m)} и отклоняет все гипотезы до наибольшего kk, для которого

p(k)kmq.p_{(k)}\leq\frac{k}{m}\,q .

Лучший дизайн, впрочем, начинается раньше любых поправок: заранее выбраны одна основная метрика, несколько защитных (guardrail) и правило коррекции для остальных. Разведочный анализ не запрещён — он просто рождает гипотезы, а не выводы.

Охота за сегментами и проклятие победителя

Тот же счётчик попыток тикает при переборе подгрупп. Возьмём одно A/A-разбиение реальных данных велопроката и посчитаем zz отдельно в каждом из 2424 часов суток. В 10001000 таких нулевых экспериментов общий эффект был «значим» в 5,9%5{,}9\% случаев — как и обещано. Но хотя бы один «значимый» час нашёлся в 71,3%71{,}3\% случаев, а медиана максимального z|z| по сегментам равна 2,192{,}19.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Столбиковая диаграмма z-статистик по 24 часам суток для одного нулевого разбиения; общий эффект z равен 1,00, а сегмент нулевого часа выпадает за порог со значением минус 2,26
Рис. 55.5. Одно A/A-разбиение, 24 сегмента: «победитель» находится почти всегда

Общий эффект скромен (z=1,00z=1{,}00), но сегмент «полночь» показывает z=2,26z=-2{,}26 и выглядит открытием: «наш вариант проваливается ночью». Никакого эффекта в данных нет — это одно и то же прошлое, разрезанное надвое случайным жребием.

Максимум по шумным оценкам систематически смещён вверх: если из mm оценок выбрать наибольшую, её ожидание больше наибольшего истинного эффекта,

E[maxjτ^j]>maxjτj.\mathbb E\left[\max_j\widehat\tau_j\right]>\max_j\tau_j .

Это тот же механизм, что портит выбор победителя среди моделей в уроке 63 и делает опасным выбор порога по той же выборке, на которой он измерялся. Найденная подгруппа — не готовое открытие, а новая гипотеза, требующая отдельного подтверждающего эксперимента с заранее записанным вопросом.

Опрос начинается со списка отсутствующих

Для опроса нужно назвать целевую популяцию и рамку выборки. Опрос в школьном чате исключает тех, кто редко читает чат; добровольный ответ сильнее привлекает людей с ярким мнением. Формально, если RiR_i — индикатор ответа, то опрос оценивает не E[Y]\mathbb E[Y], а

E[YR=1]=E[Y]+Cov(Y,R)P(R=1).\mathbb E[Y\mid R=1]=\mathbb E[Y]+ \frac{\operatorname{Cov}(Y,R)}{P(R=1)} .

Второе слагаемое — смещение отбора. Оно не уменьшается с ростом числа ответивших: увеличение nn сужает интервал, но вокруг сдвинутого числа.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Красная кривая оценки среднего по добровольцам держится около 311 при любом объёме, зелёная линия истинного среднего 189, доверительная полоса сужается с ростом числа ответивших и перестаёт накрывать истину
Рис. 55.6. Рост выборки сужает интервал вокруг неправильного числа

Модельный добровольный опрос на реальных записях велопроката: вероятность «ответить» растёт с загруженностью часа. Истинное среднее 189,5189{,}5, но оценка сходится к 310,7310{,}7 — смещение 121,3121{,}3 поездки, 64%64\% от истины. Ширина 95%-го разброса падает со 115,7115{,}7 при n=50n=50 до 9,39{,}3 при n=7943n=7943: уверенность растёт, правильность — нет.

Случайная выборка из полного списка уменьшает систематическое смещение. Стратификация заранее обеспечивает достаточное представительство небольших групп, после чего оценки взвешиваются обратно к долям популяции:

Y^str=hNhNyˉh,\widehat Y_{\text{str}}=\sum_h \frac{N_h}{N}\,\bar y_h, Var(Y^str)=h(NhN)2sh2nh.\operatorname{Var}(\widehat Y_{\text{str}})= \sum_h\left(\frac{N_h}{N}\right)^2\frac{s_h^2}{n_h} .

Постстратификация и веса wi=1/π^iw_i=1/\widehat\pi_i, где π^i\widehat\pi_i — оценённая вероятность попасть в выборку, могут исправить известные различия. Но они бессильны против невидимых причин неответа: вес умеет чинить только тот перекос, который вы сумели измерить.

Кластеры, интерференция и эффект новизны

Если вариант назначается целым классам, а измеряются ученики, наблюдения внутри класса похожи друг на друга. Внутриклассовая корреляция ρ\rho раздувает дисперсию среднего в

DE=1+(m1)ρ\text{DE}=1+(m-1)\rho

раз, где mm — размер кластера. При m=25m=25 и ρ=0,2\rho=0{,}2 получаем DE=5,8\text{DE}=5{,}8: двадцать классов по двадцать пять учеников, то есть 500500 человек, работают как 500/5,886500/5{,}8\approx86 независимых наблюдений. Считать здесь стандартную ошибку по числу учеников — значит завысить точность примерно в 5,82,4\sqrt{5{,}8}\approx2{,}4 раза.

В социальной сети вариант одного пользователя влияет на друзей, нарушая условие отсутствия взаимодействия (SUTVA): потенциальный исход перестаёт зависеть только от собственного назначения. Рандомизация по сообществам уменьшает перетекание, но число независимых единиц становится числом кластеров, а не людей.

Есть и эффект насыщения: акция может работать на 5% аудитории, но потерять силу при полном запуске из-за ограниченного запаса товара или внимания операторов. A/B-тест оценивает эффект в экспериментальном масштабе; для переноса к 100% нужен причинный рассказ о взаимодействиях и ресурсных ограничениях, иногда отдельный эксперимент с несколькими уровнями охвата.

Эффект новизны возникает, когда новая функция сначала привлекает внимание, а затем привычка исчезает. Короткий тест измеряет временную смесь. Нужен достаточный горизонт, график эффекта по дням и проверка сезонности. Разделение train/test по времени из урока 58 имеет здесь экспериментальный аналог: будущая неделя не должна быть заменена повтором вчерашней.

Налимов: эксперимент как объект проектирования

В русской традиции планирование эксперимента выросло не из социологии, а из химии и металлургии, где каждый опыт стоит дорого и потому обязан быть спроектирован. Владимир Васильевич Налимов (1910–1997) — химик и математик, прошедший арест и годы лагерей, — вернувшись к науке, стал главным проводником этой идеи в СССР. В книге «Статистические методы планирования экстремальных экспериментов» (совместно с Н. А. Черновой, 1965) и в «Теории эксперимента» (1971) он изложил то, что мы сегодня называем дизайном исследования: план опытов выбирается заранее, исходя из того, какую именно неопределённость мы хотим сократить, а не после того, как данные собраны.

Взгляд Налимова был шире инженерного. Он рассматривал эксперимент как средство диалога с природой, у которого есть цена — число опытов, — и требовал, чтобы каждый опыт был выбран так, чтобы максимально уменьшить незнание. Отсюда факторные планы, где вместо перебора одного фактора за раз варьируют сразу все по специальной схеме, и последовательная стратегия восхождения к оптимуму, в которой следующий набор опытов зависит от результата предыдущих — но по записанному заранее правилу, а не по вкусу экспериментатора.

Для нас важен его главный организационный вывод: качество вывода закладывается в плане, а не в обработке. Ровно это Фишер сказал про вскрытие, а Налимов превратил в инженерную дисциплину с таблицами планов и критериями оптимальности.

От вероятности к решению

Результат эксперимента — это не слово «значимо», а набор: оценка эффекта, интервал, практический порог, состояние guardrail-метрик и границы применимости. Если интервал пересекает и ноль, и важный положительный эффект, честный вывод — «данные не различают важные сценарии», а не «эффекта нет».

Решение о запуске естественно формулировать через ожидаемую выгоду:

E[U]=U(τ)π(τданные)dτ,\mathbb E[U]=\int U(\tau)\,\pi(\tau\mid \text{данные})\,d\tau,

где UU — полезность (прибыль, качество, риск), а π\pi — апостериорное распределение эффекта из урока 47. Статистика сообщает неопределённость причинного эффекта, а цену действий задаёт содержательная задача — та самая функция потерь, что переводит вероятности в поступки. Полезно помнить и симметричную цену: отказ от полезного изменения тоже стоит денег, просто эти потери никогда не попадают в отчёт.

Полпроцента под увеличительным стеклом

Вернёмся к кнопке. В варианте A кликнули 780780 из 1000010\,000 посетителей, в B — 830830 из 1000010\,000. Наблюдаемая разница τ^=0,005\widehat\tau=0{,}005. Стандартная ошибка

0,0780,92210000+0,0830,91710000=0,00385,\sqrt{\frac{0{,}078\cdot0{,}922}{10\,000} +\frac{0{,}083\cdot0{,}917}{10\,000}} =0{,}00385,

отношение z=1,30z=1{,}30, двустороннее p=0,194p=0{,}194, интервал [0,25;1,25][-0{,}25;\,1{,}25] процентного пункта. Такие колебания не редкость даже при нулевом эффекте — мы видели их распределение на рисунке 55.1.

Сохраним те же доли, но наберём по 100000100\,000 посетителей. Тогда

se=0,00122,z=0,0050,00122=4,11.\operatorname{se}=0{,}00122,\qquad z=\frac{0{,}005}{0{,}00122}=4{,}11 .

Оценка эффекта не изменилась ни на йоту — изменилась только точность. Отсюда дисциплинирующая мысль: «значимо» и «велико» — разные слова, и первое зависит от бюджета эксперимента не меньше, чем от природы. Тот же разговор мы вели про доверительные интервалы и про оценку параметра: данные ограничивают, но не назначают решение.

Теперь переведём эффект в решение. При десяти миллионах показов в месяц полпроцента означает около 5000050\,000 дополнительных кликов. Стоит ли это запуска, зависит от того, что происходит после клика: если синяя кнопка приводит людей, которые чаще уходят с формы оплаты, выигранные клики окажутся убытком. Поэтому до запуска фиксируют основную метрику, защитные метрики, минимально полезный эффект и правило остановки — четыре строки, которые превращают наблюдение в эксперимент.

И последнее. Проверка только кликов после просмотра десятков разрезов превращает случайный максимум в красивую историю; мы измерили её цену — 71,3%71{,}3\% нулевых экспериментов дают хотя бы один «значимый» сегмент. Независимое подтверждение должно повторить заранее записанный вопрос, а не самый удачный из двадцати.

Задачи