A/B-тестирование

A/B-тест сравнивает две версии опыта, случайно распределяя пользователей между ними и измеряя заранее выбранную метрику. Именно рандомизация делает сравнение причинным: раз распределение не зависит от того, кто пользователь, любое систематическое расхождение в результате относится к изменению, а не к тому, что группы изначально были разными. В этом вся ценность, и этого не дают сравнения «до и после», ведь сезонность, маркетинговая активность и продуктовые изменения сами по себе двигают цифры. Честный запуск требует нескольких решений, принятых заранее. Выберите одну основную метрику и минимальный эффект, который имеет смысл обнаружить, и по ним посчитайте необходимую длительность: тест, срок которого определяют после появления данных, — это поиск удобного момента остановки. Ведите его целыми деловыми циклами, обычно полными неделями, потому что будни и выходные ведут себя по-разному. Заранее определите, какие вторичные метрики служат ограничителями, чтобы рост конверсии, сопровождаемый ростом возвратов, не был записан в победы. И проверьте, что распределение действительно сработало: неравные размеры групп — обычный признак ошибки в инструментировании, обесценивающей результат. Главное практическое ограничение — трафик. Большинство изменений даёт малые эффекты, а малым эффектам нужны большие выборки, поэтому продукты с низким трафиком часто просто не могут различить интересующую их разницу. В таком случае выстраивать изменения последовательно, проверять более крупные гипотезы или опираться на качественные данные честнее, чем запускать заведомо слабый тест и читать его исход.

Похожие термины

Ещё термины: Аналитика