new-lvl.pro · Статьи · A/B-тесты
Статья A/B // 7 мин чтения

Как читать
результаты A/B-теста

На собеседовании и в работе аналитика проверяют не подсчёт p-value — это делает Python за секунду. Проверяют умение прочитать готовый результат теста и не сделать по нему неверный вывод. Разбираем четыре типичные ошибки и тренажёр, где это можно натренировать на реальных кейсах.

Собеседование проверяет не арифметику

Дай любой библиотеке две выборки — она посчитает p-value за миллисекунду. Поэтому на собеседовании продуктового аналитика почти никогда не спрашивают «как вручную посчитать z-статистику». Спрашивают другое: вот результат готового теста — что ты скажешь продакту?

На реальной работе то же самое. Расчёт делает код, а решение принимают по твоему выводу: раскатывать фичу, продлевать тест или откатывать всё назад. Ошибка в формуле почти всегда заметна сразу. Ошибка в выводе — например, «раскатываем, эффект значим» — по невалидному сплиту — заметна только через месяц, когда метрика не подтвердится.

// Суть навыка
Умение читать результат теста — отдельный навык, не сводящийся к статистике. Он тренируется на чужих готовых экспериментах: важно увидеть подвох в цифрах, которые считал не ты.

Четыре типичные ошибки при чтении теста

Все четыре встречаются не в учебниках, а в реальных дашбордах. Ниже — как каждая выглядит на практике.

Ошибка 1 · Подглядывание Peeking
Тест идёт три дня, в дашборде мелькнуло p-value 0.04 — команда останавливает тест и катит фичу. Проблема в том, что p-value «мерцает»: если смотреть на него каждый день, вероятность поймать случайно значимый результат растёт с каждой проверкой. Правильный порядок обратный: размер выборки фиксируется до запуска, тест останавливается по достижении именно этого размера — не раньше, как бы ни хотелось.
Ошибка 2 · Дисперсия важнее среднего Шум
Средний чек вырос на 60 ₽ — выглядит как победа. Но у метрик вроде чека или времени в приложении разброс между пользователями огромный: один крупный заказ двигает среднее сильнее, чем сотня обычных. Без теста на значимость (и без взгляда на p-value, а не только на дельту) «рост» может быть эффектом пары выбросов, а не изменения продукта.
Ошибка 3 · Сломанный сплит SRM
Дизайн теста — 50/50, но по факту в группах 21 000 и 24 000 пользователей. Если проверить это отклонение хи-квадратом (SRM-чек), разница окажется статистически невозможной случайно. Значит, где-то в редиректах, ботах или логике рандомизации баг — и группы уже не сравнимы. Метрикам такого теста верить нельзя, какими бы «хорошими» они ни выглядели.
Ошибка 4 · Агрегат вместо разбивки Парадокс Симпсона
В целом по тесту конверсия выросла — отчёт готов, всё раскатывают. Но если разбить пользователей по сегментам (например, по платформе или по новым/старым), внутри каждого сегмента конверсия могла упасть: рост в агрегате получился из-за того, что изменился состав трафика между группами, а не сама метрика. Без разбивки по группам такой эффект не видно — только имитация роста.
// Общее в этих четырёх
Три из этих четырёх ошибок не видны в самом p-value — они про контекст вокруг числа: когда его посмотрели, сравнимы ли группы и не спрятался ли эффект внутри сегментов. Вторая ловушка обратная: там на p-value как раз и не посмотрели, а решили по дельте.

Как устроен A/B-тренажёр

A/B-тренажёр (ab.new-lvl.pro) — не курс и не сборник теории, а 30 задач по нарастающей сложности: от простых расчётов конверсии и доверительных интервалов до самих ловушек выше — подглядывания, сломанного сплита, парадокса Симпсона. 15 задач открыты без подписки, ещё несколько premium-задач (в их числе — разбор парадокса Симпсона) доступны бесплатно как демо.

// Двухэтапный флоу
Сначала расчёт, потом вывод
В каждой задаче есть готовый датасет и код на Python (pandas/scipy) прямо в браузере. Шаг 1 — написать расчёт и нажать «Проверить расчёт»: тренажёр сверяет числа с эталоном. Шаг 2 — выбрать точный вывод для продакта из нескольких вариантов формулировки. Полный разбор с объяснением открывается только после верного выбора — так проверяется и техника, и то, какой вывод ты из неё делаешь.

Это и есть отличие от «посчитать p-value в блокноте»: код запускается на реальных данных, а засчитывается задача не за правильное число, а за правильный вывод из этого числа — ровно то, что спрашивают на собеседовании и ждут от тебя на работе.

Если блок A/B в диагностике вышел слабым

На сайте есть бесплатная диагностика знаний — 39 вопросов по семи блокам (SQL, Python/Pandas, статистика, A/B-тесты, метрики, продуктовое мышление, BI), из них 7 — про A/B-тесты. Диагностика показывает профиль сильных и слабых блоков без регистрации.

Если блок A/B оказался слабым местом — тренажёр прямой следующий шаг: не пересдавать тест по учебнику, а прогнать десяток готовых экспериментов и увидеть свои ошибки на конкретных цифрах, а не в абстракции.

Частые вопросы про A/B-тренажёр

Что проверяет A/B-тренажёр new-lvl.pro?
Не расчёт p-value как таковой, а умение прочитать результат готового теста и сделать из него правильный вывод для продакта: увидеть подглядывание, проверить сплит, не спутать значимость с важностью и не попасться в парадокс Симпсона.
Сколько задач в A/B-тренажёре и сколько из них бесплатно?
Всего 30 задач по нарастающей сложности. 15 открыты без подписки, ещё несколько premium-задач — например, разбор парадокса Симпсона — доступны бесплатно как демо.
Как устроен разбор задачи в тренажёре?
Сначала кнопка «Проверить расчёт» — тренажёр сверяет числа из pandas/scipy с эталоном. После верного расчёта нужно выбрать точный вывод для продакта из нескольких вариантов; полный разбор открывается после верного выбора.

Связанные материалы

Главное про чтение результатов A/B-теста

Собеседование и работа проверяют не формулу, а вывод из готового результата: раскатывать, продлевать или откатывать. Четыре ловушки, которые чаще всего портят этот вывод, — подглядывание, метрика с большой дисперсией, сломанный сплит и парадокс Симпсона за агрегатом.

A/B-тренажёр тренирует именно это на 30 готовых экспериментах: сначала расчёт в Python, потом — выбор точного вывода для продакта. 15 задач открыты без подписки.

АТ
Андрей Тарасенко
// Продуктовый аналитик · Авито · Ментор

Разбор чужих A/B-тестов — рабочая рутина: почти каждую неделю кто-то приносит результат теста и просит помочь понять, можно ли ему верить. Ошибки почти всегда одни и те же четыре — собрал их в тренажёр, чтобы тренировать не память, а зрение на цифры.

Написать в Telegram
// ЗАКРЕПИ НА ПРАКТИКЕ

Прогони 15 бесплатных задач прямо сейчас

30 готовых экспериментов, разбор p-value, SRM и парадокса Симпсона. Проверка расчёта и вывода — как перед реальным продактом.

▶ Открыть A/B-тренажёр ★ Пройти диагностику
Все материалы: База знаний · Telegram