Различие между группами убеждает, когда оно велико относительно случайного разброса процедуры. Главная сила эксперимента возникает до вычислений: рандомизация делает группы сравнимыми без знания всех скрытых факторов.
Кнопка стала синей, кликов стало больше
Сайт случайно показал половине посетителей зелёную кнопку A, половине синюю B. В A кликнули 7,8%, в B — 8,3%. Разница 0,5 процентного пункта может быть эффектом цвета, случайным колебанием или следствием ошибки дизайна.
До запуска нужно определить единицу рандомизации. Если вариант назначается при каждом показе, один человек увидит оба цвета и его повторные действия зависимы. Рандомизация по пользователю сохраняет вариант за человеком. Кластеры вроде класса или школы требуют назначения целого кластера, если участники влияют друг на друга.
До развилки пользователи различаются устройством, активностью и временем. Случайный механизм, не глядя на признаки, распределяет их между A и B. Малые дисбалансы остаются случайными; систематической связи варианта со скрытым фактором в среднем нет.
Опрос начинается со списка отсутствующих
Для опроса нужно назвать целевую популяцию и рамку выборки. Опрос в школьном чате исключает тех, кто редко читает чат; добровольный ответ сильнее привлекает людей с ярким мнением. Большой объём сужает случайную ошибку вокруг смещённой доли, но не возвращает отсутствующих.
Случайная выборка из полного списка уменьшает систематическое смещение. Стратификация заранее обеспечивает достаточное представительство небольших групп, после чего оценки взвешиваются обратно к долям популяции. Постстратификация может исправить известные различия, но не невидимые причины неответа.
Разность долей и её шум
При независимых группах оценка эффекта
Приближённая стандартная ошибка:
Отношение измеряет эффект в единицах выборочного шума. Доверительный интервал добавляет к оценке диапазон совместимых значений. Статистическая заметность не равна практической: при миллионах показов микроскопический эффект может быть точным, но бесполезным.
Проверка гипотезы без судебного приговора
Нулевая гипотеза задаёт мир без эффекта. -value — вероятность при получить статистику не менее экстремальную, чем наблюдаемая:
Это не вероятность истинности и не вероятность случайности результата. Малое значение говорит, что данные плохо согласуются с конкретной нулевой моделью и процедурой.
Уровень заранее задаёт частоту ложных отклонений в серии экспериментов, где верна. Если выбирать порог после просмотра результата, частотная гарантия меняется.
Колокол показывает возможные при отсутствии эффекта. Вертикальная линия — наблюдаемая разность. Для двустороннего теста заштрихованы оба хвоста с ; их площадь равна -value.
Мощность и размер эффекта
Мощность — вероятность обнаружить заданный истинный эффект:
Она растёт с объёмом, размером эффекта и допустимым , уменьшается с шумом. Планирование начинается с минимального практически значимого эффекта, а не с надежды «соберём сколько получится».
Если базовая кликабельность 8%, команда считает полезным прирост минимум на 0,5 пункта. Эти числа, желаемая мощность 80% и уровень 5% определяют требуемый объём. После опыта нельзя подменять исходный минимальный эффект наблюдаемой разностью: это сделает план круговым.
Лаборатория A/B
Зафиксируйте малый истинный эффект и запускайте повторные эксперименты. При малом оценки скачут и часто меняют знак. Увеличьте — распределение сузится. Затем включите просмотр результата после каждого шага и остановку при : ложные открытия станут чаще, хотя формула теста не менялась.
Каждая линия — эксперимент с нулевым эффектом, проверяемый после каждого пакета данных. Горизонтальные границы соответствуют наивному порогу. Чем дольше наблюдать, тем больше траекторий случайно пересекают его хотя бы раз. Фиксированный тест не сохраняет уровень при произвольной остановке.
Множественные метрики
Если проверить 20 независимых метрик на уровне 5%, вероятность хотя бы одной ложной тревоги равна
Bonferroni использует порог для каждой проверки и контролирует вероятность хотя бы одной ошибки, но может быть консервативен. FDR-процедуры контролируют ожидаемую долю ложных открытий среди объявленных.
Лучший дизайн заранее выбирает одну primary metric, несколько guardrail метрик и правило коррекции. В exploratory-анализе можно искать сигналы, но они требуют нового подтверждающего эксперимента.
Похожая цена возникает при переборе сегментов. Если общий эффект мал, но аналитик просмотрел возраст, регион, устройство и десятки их пересечений, какая-нибудь подгруппа почти наверняка покажет яркий результат. Её следует считать новой гипотезой, а не готовым открытием. Формально это родственник выбора победителя среди моделей в уроке 63: максимум по шумным оценкам смещён в выгодную сторону.
Интерференция и новизна
В социальной сети вариант одного пользователя влияет на друзей, нарушая условие отсутствия взаимодействия. Рандомизация по сообществам уменьшает перетекание, но число независимых единиц становится числом кластеров, а не людей.
Есть и эффект насыщения: акция может работать на 5% аудитории, но потерять силу при полном запуске из-за ограниченного запаса товара или внимания операторов. A/B-тест оценивает эффект в экспериментальном масштабе. Для переноса к 100% нужен причинный рассказ о взаимодействиях и ресурсных ограничениях, иногда отдельный эксперимент с несколькими уровнями охвата.
Эффект новизны возникает, когда новая функция сначала привлекает внимание, а затем привычка исчезает. Короткий тест измеряет временную смесь. Нужен достаточный горизонт, график эффекта по дням и проверка сезонности. Разделение train/test по времени из урока 58 имеет здесь экспериментальный аналог: будущая неделя не должна быть заменена повтором вчерашней.
От вероятности к решению
Результат эксперимента включает оценку эффекта, интервал, практический порог, guardrails и ограничения применимости. Если интервал пересекает как ноль, так и значимый положительный эффект, вывод — не «эффекта нет», а «данные не различают важные сценарии».
Решение о запуске может использовать ожидаемую выгоду и риск. Это связывает эксперимент с функцией потерь: статистика сообщает неопределённость причинного эффекта, бизнес задаёт цену действий.
Полпроцента под увеличительным стеклом
Пусть в варианте A кликнули из посетителей, а в B — из . Наблюдаемая разница равна . При независимой рандомизации её стандартная ошибка оценивается как
Отношение разницы к ошибке около : такие колебания не редкость даже при нулевом эффекте. Если сохранить те же доли, но набрать по посетителей, ошибка уменьшится примерно до , а отношение вырастет до . Значимость изменилась из-за точности, хотя оценённый эффект остался тем же.
Теперь переведём эффект в решение. При десяти миллионах показов в месяц полпроцента означает около дополнительных кликов, но новая кнопка может ухудшить оплату после клика. Поэтому до запуска фиксируют основную метрику, защитные метрики и минимально полезный эффект. Проверка только кликов после просмотра десятков разрезов превращает случайный максимум в красивую историю; независимое подтверждение должно повторить заранее записанный вопрос.