Различие между группами убеждает, когда оно велико относительно случайного разброса процедуры. Главная сила эксперимента возникает до вычислений: рандомизация делает группы сравнимыми без знания всех скрытых факторов.

Кнопка стала синей, кликов стало больше

Сайт случайно показал половине посетителей зелёную кнопку A, половине синюю B. В A кликнули 7,8%, в B — 8,3%. Разница 0,5 процентного пункта может быть эффектом цвета, случайным колебанием или следствием ошибки дизайна.

До запуска нужно определить единицу рандомизации. Если вариант назначается при каждом показе, один человек увидит оба цвета и его повторные действия зависимы. Рандомизация по пользователю сохраняет вариант за человеком. Кластеры вроде класса или школы требуют назначения целого кластера, если участники влияют друг на друга.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Поток пользователей случайно разделяется на A и B, до разделения показаны смешивающие признаки, после — похожие распределения
Рис. 55.1. Рандомизация создаёт сравнимые группы

До развилки пользователи различаются устройством, активностью и временем. Случайный механизм, не глядя на признаки, распределяет их между A и B. Малые дисбалансы остаются случайными; систематической связи варианта со скрытым фактором в среднем нет.

Опрос начинается со списка отсутствующих

Для опроса нужно назвать целевую популяцию и рамку выборки. Опрос в школьном чате исключает тех, кто редко читает чат; добровольный ответ сильнее привлекает людей с ярким мнением. Большой объём сужает случайную ошибку вокруг смещённой доли, но не возвращает отсутствующих.

Случайная выборка из полного списка уменьшает систематическое смещение. Стратификация заранее обеспечивает достаточное представительство небольших групп, после чего оценки взвешиваются обратно к долям популяции. Постстратификация может исправить известные различия, но не невидимые причины неответа.

Разность долей и её шум

При независимых группах оценка эффекта

τ^=p^Bp^A.\widehat\tau=\widehat p_B-\widehat p_A.

Приближённая стандартная ошибка:

se(τ^)=p^A(1p^A)nA+p^B(1p^B)nB.\operatorname{se}(\widehat\tau)= \sqrt{ \frac{\widehat p_A(1-\widehat p_A)}{n_A}+ \frac{\widehat p_B(1-\widehat p_B)}{n_B} }.

Отношение τ^/se\widehat\tau/\operatorname{se} измеряет эффект в единицах выборочного шума. Доверительный интервал добавляет к оценке диапазон совместимых значений. Статистическая заметность не равна практической: при миллионах показов микроскопический эффект может быть точным, но бесполезным.

Проверка гипотезы без судебного приговора

Нулевая гипотеза H0H_0 задаёт мир без эффекта. pp-value — вероятность при H0H_0 получить статистику не менее экстремальную, чем наблюдаемая:

p=PH0{TTobs}.p=P_{H_0}\{T\geq T_{\text{obs}}\}.

Это не вероятность истинности H0H_0 и не вероятность случайности результата. Малое значение говорит, что данные плохо согласуются с конкретной нулевой моделью и процедурой.

Уровень α\alpha заранее задаёт частоту ложных отклонений в серии экспериментов, где H0H_0 верна. Если выбирать порог после просмотра результата, частотная гарантия меняется.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Распределение разности долей при нулевой гипотезе, наблюдаемая статистика и заштрихованные хвосты
Рис. 55.2. p-value как хвост нулевого распределения

Колокол показывает возможные τ^\widehat\tau при отсутствии эффекта. Вертикальная линия — наблюдаемая разность. Для двустороннего теста заштрихованы оба хвоста с TTobs|T|\geq|T_{\text{obs}}|; их площадь равна pp-value.

Мощность и размер эффекта

Мощность — вероятность обнаружить заданный истинный эффект:

Power(τ)=Pτ{отклонить H0}.\operatorname{Power}(\tau)=P_\tau\{\text{отклонить }H_0\}.

Она растёт с объёмом, размером эффекта и допустимым α\alpha, уменьшается с шумом. Планирование начинается с минимального практически значимого эффекта, а не с надежды «соберём сколько получится».

Если базовая кликабельность 8%, команда считает полезным прирост минимум на 0,5 пункта. Эти числа, желаемая мощность 80% и уровень 5% определяют требуемый объём. После опыта нельзя подменять исходный минимальный эффект наблюдаемой разностью: это сделает план круговым.

Лаборатория A/B

Эффект, шум, размер выборки и преждевременная остановка

Загружается живая иллюстрация…

Зафиксируйте малый истинный эффект и запускайте повторные эксперименты. При малом nn оценки скачут и часто меняют знак. Увеличьте nn — распределение сузится. Затем включите просмотр результата после каждого шага и остановку при p<0,05p<0{,}05: ложные открытия станут чаще, хотя формула теста не менялась.

Рисунок шире экрана — проведите по немуОткрыть целиком ↗
Сто траекторий накопленного z-score при отсутствии эффекта, несколько пересекают горизонтальные пороги при повторном просмотре
Рис. 55.3. Подглядывание раздувает ложные открытия

Каждая линия — эксперимент с нулевым эффектом, проверяемый после каждого пакета данных. Горизонтальные границы соответствуют наивному порогу. Чем дольше наблюдать, тем больше траекторий случайно пересекают его хотя бы раз. Фиксированный тест не сохраняет уровень при произвольной остановке.

Множественные метрики

Если проверить 20 независимых метрик на уровне 5%, вероятность хотя бы одной ложной тревоги равна

10,95200,64.1-0{,}95^{20}\approx0{,}64.

Bonferroni использует порог α/m\alpha/m для каждой проверки и контролирует вероятность хотя бы одной ошибки, но может быть консервативен. FDR-процедуры контролируют ожидаемую долю ложных открытий среди объявленных.

Лучший дизайн заранее выбирает одну primary metric, несколько guardrail метрик и правило коррекции. В exploratory-анализе можно искать сигналы, но они требуют нового подтверждающего эксперимента.

Похожая цена возникает при переборе сегментов. Если общий эффект мал, но аналитик просмотрел возраст, регион, устройство и десятки их пересечений, какая-нибудь подгруппа почти наверняка покажет яркий результат. Её следует считать новой гипотезой, а не готовым открытием. Формально это родственник выбора победителя среди моделей в уроке 63: максимум по шумным оценкам смещён в выгодную сторону.

Интерференция и новизна

В социальной сети вариант одного пользователя влияет на друзей, нарушая условие отсутствия взаимодействия. Рандомизация по сообществам уменьшает перетекание, но число независимых единиц становится числом кластеров, а не людей.

Есть и эффект насыщения: акция может работать на 5% аудитории, но потерять силу при полном запуске из-за ограниченного запаса товара или внимания операторов. A/B-тест оценивает эффект в экспериментальном масштабе. Для переноса к 100% нужен причинный рассказ о взаимодействиях и ресурсных ограничениях, иногда отдельный эксперимент с несколькими уровнями охвата.

Эффект новизны возникает, когда новая функция сначала привлекает внимание, а затем привычка исчезает. Короткий тест измеряет временную смесь. Нужен достаточный горизонт, график эффекта по дням и проверка сезонности. Разделение train/test по времени из урока 58 имеет здесь экспериментальный аналог: будущая неделя не должна быть заменена повтором вчерашней.

От вероятности к решению

Результат эксперимента включает оценку эффекта, интервал, практический порог, guardrails и ограничения применимости. Если интервал пересекает как ноль, так и значимый положительный эффект, вывод — не «эффекта нет», а «данные не различают важные сценарии».

Решение о запуске может использовать ожидаемую выгоду и риск. Это связывает эксперимент с функцией потерь: статистика сообщает неопределённость причинного эффекта, бизнес задаёт цену действий.

Полпроцента под увеличительным стеклом

Пусть в варианте A кликнули 780780 из 1000010\,000 посетителей, а в B — 830830 из 1000010\,000. Наблюдаемая разница равна 0,0050{,}005. При независимой рандомизации её стандартная ошибка оценивается как

0,078(10,078)10000+0,083(10,083)100000,00385.\sqrt{\frac{0{,}078(1-0{,}078)}{10\,000} +\frac{0{,}083(1-0{,}083)}{10\,000}} \approx0{,}00385.

Отношение разницы к ошибке около 1,301{,}30: такие колебания не редкость даже при нулевом эффекте. Если сохранить те же доли, но набрать по 100000100\,000 посетителей, ошибка уменьшится примерно до 0,001220{,}00122, а отношение вырастет до 4,14{,}1. Значимость изменилась из-за точности, хотя оценённый эффект остался тем же.

Теперь переведём эффект в решение. При десяти миллионах показов в месяц полпроцента означает около 5000050\,000 дополнительных кликов, но новая кнопка может ухудшить оплату после клика. Поэтому до запуска фиксируют основную метрику, защитные метрики и минимально полезный эффект. Проверка только кликов после просмотра десятков разрезов превращает случайный максимум в красивую историю; независимое подтверждение должно повторить заранее записанный вопрос.

Задачи