Зачем
Собеседование проверяет не арифметику
Дай любой библиотеке две выборки — она посчитает p-value за миллисекунду. Поэтому на собеседовании продуктового аналитика почти никогда не спрашивают «как вручную посчитать z-статистику». Спрашивают другое: вот результат готового теста — что ты скажешь продакту?
На реальной работе то же самое. Расчёт делает код, а решение принимают по твоему выводу: раскатывать фичу, продлевать тест или откатывать всё назад. Ошибка в формуле почти всегда заметна сразу. Ошибка в выводе — например, «раскатываем, эффект значим» — по невалидному сплиту — заметна только через месяц, когда метрика не подтвердится.
// Суть навыка
Умение читать результат теста — отдельный навык, не сводящийся к статистике. Он тренируется на чужих готовых экспериментах: важно увидеть подвох в цифрах, которые считал не ты.
Ловушки
Четыре типичные ошибки при чтении теста
Все четыре встречаются не в учебниках, а в реальных дашбордах. Ниже — как каждая выглядит на практике.
Тест идёт три дня, в дашборде мелькнуло p-value 0.04 — команда останавливает тест и катит фичу. Проблема в том, что p-value «мерцает»: если смотреть на него каждый день, вероятность поймать случайно значимый результат растёт с каждой проверкой. Правильный порядок обратный: размер выборки фиксируется до запуска, тест останавливается по достижении именно этого размера — не раньше, как бы ни хотелось.
Средний чек вырос на 60 ₽ — выглядит как победа. Но у метрик вроде чека или времени в приложении разброс между пользователями огромный: один крупный заказ двигает среднее сильнее, чем сотня обычных. Без теста на значимость (и без взгляда на p-value, а не только на дельту) «рост» может быть эффектом пары выбросов, а не изменения продукта.
Дизайн теста — 50/50, но по факту в группах 21 000 и 24 000 пользователей. Если проверить это отклонение хи-квадратом (SRM-чек), разница окажется статистически невозможной случайно. Значит, где-то в редиректах, ботах или логике рандомизации баг — и группы уже не сравнимы. Метрикам такого теста верить нельзя, какими бы «хорошими» они ни выглядели.
В целом по тесту конверсия выросла — отчёт готов, всё раскатывают. Но если разбить пользователей по сегментам (например, по платформе или по новым/старым), внутри каждого сегмента конверсия могла упасть: рост в агрегате получился из-за того, что изменился состав трафика между группами, а не сама метрика. Без разбивки по группам такой эффект не видно — только имитация роста.
// Общее в этих четырёх
Три из этих четырёх ошибок не видны в самом p-value — они про контекст вокруг числа: когда его посмотрели, сравнимы ли группы и не спрятался ли эффект внутри сегментов. Вторая ловушка обратная: там на p-value как раз и не посмотрели, а решили по дельте.
Инструмент
Как устроен A/B-тренажёр
A/B-тренажёр (ab.new-lvl.pro) — не курс и не сборник теории, а 30 задач по нарастающей сложности: от простых расчётов конверсии и доверительных интервалов до самих ловушек выше — подглядывания, сломанного сплита, парадокса Симпсона. 15 задач открыты без подписки, ещё несколько premium-задач (в их числе — разбор парадокса Симпсона) доступны бесплатно как демо.
// Двухэтапный флоу
Сначала расчёт, потом вывод
В каждой задаче есть готовый датасет и код на Python (pandas/scipy) прямо в браузере. Шаг 1 — написать расчёт и нажать «Проверить расчёт»: тренажёр сверяет числа с эталоном. Шаг 2 — выбрать точный вывод для продакта из нескольких вариантов формулировки. Полный разбор с объяснением открывается только после верного выбора — так проверяется и техника, и то, какой вывод ты из неё делаешь.
Это и есть отличие от «посчитать p-value в блокноте»: код запускается на реальных данных, а засчитывается задача не за правильное число, а за правильный вывод из этого числа — ровно то, что спрашивают на собеседовании и ждут от тебя на работе.
Откуда сюда попадают
Если блок A/B в диагностике вышел слабым
На сайте есть бесплатная диагностика знаний — 39 вопросов по семи блокам (SQL, Python/Pandas, статистика, A/B-тесты, метрики, продуктовое мышление, BI), из них 7 — про A/B-тесты. Диагностика показывает профиль сильных и слабых блоков без регистрации.
Если блок A/B оказался слабым местом — тренажёр прямой следующий шаг: не пересдавать тест по учебнику, а прогнать десяток готовых экспериментов и увидеть свои ошибки на конкретных цифрах, а не в абстракции.
FAQ
Частые вопросы про A/B-тренажёр
Что проверяет A/B-тренажёр new-lvl.pro?
Не расчёт p-value как таковой, а умение прочитать результат готового теста и сделать из него правильный вывод для продакта: увидеть подглядывание, проверить сплит, не спутать значимость с важностью и не попасться в парадокс Симпсона.
Сколько задач в A/B-тренажёре и сколько из них бесплатно?
Всего 30 задач по нарастающей сложности. 15 открыты без подписки, ещё несколько premium-задач — например, разбор парадокса Симпсона — доступны бесплатно как демо.
Как устроен разбор задачи в тренажёре?
Сначала кнопка «Проверить расчёт» — тренажёр сверяет числа из pandas/scipy с эталоном. После верного расчёта нужно выбрать точный вывод для продакта из нескольких вариантов; полный разбор открывается после верного выбора.
Что дальше
Связанные материалы
Главное про чтение результатов A/B-теста
Собеседование и работа проверяют не формулу, а вывод из готового результата: раскатывать, продлевать или откатывать. Четыре ловушки, которые чаще всего портят этот вывод, — подглядывание, метрика с большой дисперсией, сломанный сплит и парадокс Симпсона за агрегатом.
A/B-тренажёр тренирует именно это на 30 готовых экспериментах: сначала расчёт в Python, потом — выбор точного вывода для продакта. 15 задач открыты без подписки.
АТ
Андрей Тарасенко
// Продуктовый аналитик · Авито · Ментор
Разбор чужих A/B-тестов — рабочая рутина: почти каждую неделю кто-то приносит результат теста и просит помочь понять, можно ли ему верить. Ошибки почти всегда одни и те же четыре — собрал их в тренажёр, чтобы тренировать не память, а зрение на цифры.
Написать в Telegram