002. Увеличение чувствительности в A/B с помощью Cuped — Валерий Бабушкин

THE SUMMARYAI-generated

Снижение дисперсии в A/B тестировании: Стратификация и QPD

Введение

Докладчик, Валерий Бабушкин, директор по моделированию и анализу данных в X5 Retail Group, делится опытом снижения дисперсии в A/B тестировании. Он затрагивает два основных подхода: частотный и байесовский, фокусируясь на частотном подходе и его методах оптимизации.

1. Основы A/B тестирования и расчет необходимого объема выборки

  • Цель A/B тестирования: Сравнение двух или более вариантов (например, веб-страниц, функций) для определения наиболее эффективного.
  • Формула расчета объема выборки (частотный подход):
    • $N = \frac{(\alpha^2 \cdot \text{дисперсия})}{M^2}$
    • Где:
      • $N$: количество наблюдений в каждой группе.
      • $\alpha$: доверительный интервал (степень надежности). Чем меньше $\alpha$, тем больше наблюдений требуется.
      • Дисперсия: мера разброса данных. Может быть представлена как $p(1-p)$ для дискретных распределений (дисперсия биномиального распределения) или $\sigma^2$ для непрерывных распределений. Чем больше дисперсия, тем больше наблюдений требуется.
      • $M$: минимальная обнаружимая разница (Minimum Detectable Effect - MDE). Чем меньше $M$, тем больше наблюдений требуется (квадратичная зависимость).
  • Ограничения: Количество данных ограничено пользователями, временем сбора, или необходимостью быстрого получения результата.

2. Снижение дисперсии: Стратификация

  • Идея: Разделение выборки на группы (страты) по признаку, который коррелирует с целевой метрикой. Это позволяет уменьшить общую дисперсию.
  • Примеры стратификации:
    • По операционной системе (Windows, macOS, Linux).
    • По странам.
    • По типу браузера.
  • Процесс:
    1. Определение страт: Выбор признака, по которому будет производиться разделение.
    2. Расчет весов страт: Вес каждой страты пропорционален доле ее наблюдений в общей выборке. $P(\text{страта}) = \frac{\text{количество наблюдений в страте}}{\text{общее количество наблюдений}}$.
    3. Расчет стратифицированной метрики: Среднее значение метрики по всем стратам, взвешенное по их весам: $\text{Среднее}{\text{стратифицированное}} = \sum (\text{метрика}{\text{страта}} \cdot \text{вес}_{\text{страта}})$.
  • Математическое обоснование:
    • Среднее значение стратифицированной метрики не отличается от среднего значения при случайной выборке.
    • Дисперсия стратифицированной метрики меньше дисперсии случайной выборки. Формула дисперсии случайной выборки ($ \sigma^2_{\text{SRS}} $) может быть представлена как сумма дисперсии внутри страт и дисперсии между стратами. Стратификация устраняет или уменьшает компонент дисперсии между стратами.
  • Экспериментальные результаты: В X5 Retail Group стратификация позволила снизить дисперсию на 1%. Докладчик предполагает, что прирост может быть больше при меньшем объеме данных или при наличии нарушений в случайности выборки.

3. Снижение дисперсии: QPD (Quality-Adjusted Difference)

  • Идея: Использование дополнительной переменной (ковариата) $X$, которая коррелирует с целевой метрикой $Y$, для снижения дисперсии. Метод основан на вычитании предсказанного значения $Y$ на основе $X$.
  • Формула новой метрики (QPD): $Q = Y - \theta X$
    • Где:
      • $Y$: целевая метрика.
      • $X$: ковариата (независимая переменная, не подверженная влиянию эксперимента).
      • $\theta$: коэффициент, который минимизирует дисперсию новой метрики $Q$.
  • Оптимальное значение $\theta$: $\theta = \frac{\text{ковариация}(Y, X)}{\text{дисперсия}(X)}$
  • Итоговая дисперсия QPD: $\text{Дисперсия}(Q) = \text{Дисперсия}(Y) \cdot (1 - \text{корреляция}^2(Y, X))$
  • Почему это работает: Метод удаляет ту часть дисперсии $Y$, которая объясняется ковариатой $X$, оставляя только ту часть, которая обусловлена другими факторами.
  • Выбор ковариаты $X$:
    • Логичным выбором является та же метрика $Y$, но измеренная в период, предшествующий эксперименту.
    • Период для $X$: Практический опыт показывает, что оптимальным является период около двух недель.
  • Связь с линейной регрессией: Подбор оптимального $\theta$ эквивалентен нахождению линии регрессии $Y$ по $X$. Новая метрика $Q$ представляет собой остатки от этой регрессии.
  • Преимущества:
    • Снижает дисперсию, что приводит к уменьшению необходимого объема выборки и ускорению теста.
    • Среднее значение новой метрики $Q$ не меняется по сравнению со средним значением $Y$.
    • Простота реализации: найти коррелирующую переменную, рассчитать $\theta$, вычислить $Q$.
  • Экспериментальные результаты:
    • В онлайн-среде дисперсия метрики QPD снизилась на 45%.
    • В X5 Retail Group дисперсия снизилась в 4 раза.
    • Максимальное снижение дисперсии, наблюдавшееся докладчиком в реальной жизни, составило 19 раз.
  • Применимость: Метод QPD наиболее эффективен для непрерывных метрик.

4. Ограничения и особые случаи

  • Дискретные метрики: Для дискретных метрик (например, конверсии 0/1) метод QPD не подходит напрямую. В таких случаях рекомендуется использовать стратификацию или линеаризацию.
  • Линеаризация: Метод, позволяющий ускорить A/B тестирование дискретных метрик в 30-40 раз. Он переводит метрику в другое признаковое пространство, сохраняя пропорциональность и повышая чувствительность теста.
  • Отсутствие предыдущих данных: Если для пользователя нет предыдущих данных (например, новый пользователь), его предыдущее значение метрики принимается за ноль. Альтернативно, таких пользователей можно исключить из теста.
  • Проблема очистки cookies и идентификации пользователей: В X5 Retail Group основной единицей анализа является магазин. При работе с клиентами используется карта лояльности, но проблема склеивания разных карт одного человека остается.

5. Ключевые аргументы и выводы

  • Снижение дисперсии является ключевым фактором для повышения эффективности A/B тестирования, позволяя сократить объем выборки и ускорить получение результатов.
  • Стратификация и QPD – мощные методы для снижения дисперсии, каждый со своими областями применения.
  • QPD особенно эффективен для непрерывных метрик, используя коррелирующие ковариаты для "очистки" данных от нерелевантной изменчивости.
  • Выбор правильной ковариаты и периода ее измерения критичен для успеха QPD.
  • Для дискретных метрик стратификация и линеаризация являются предпочтительными методами.

Ключевые концепции

  • A/B тестирование: Метод сравнения двух или более вариантов.
  • Дисперсия: Мера разброса данных.
  • Объем выборки: Количество наблюдений, необходимое для статистической значимости.
  • Минимальная обнаружимая разница (MDE): Наименьшая разница, которую тест способен обнаружить.
  • Стратификация: Разделение выборки на группы по признаку для снижения дисперсии.
  • Ковариата: Переменная, коррелирующая с целевой метрикой.
  • QPD (Quality-Adjusted Difference): Метод снижения дисперсии с использованием ковариаты.
  • Линеаризация: Метод для ускорения A/B тестирования дискретных метрик.
  • Частотный подход: Статистический подход к анализу данных.
  • Байесовский подход: Альтернативный статистический подход.

AI summaries can miss context or contain errors. Check important details against the original video.

Go a little deeper.

Have a question about this video? Load its transcript to open the video chat.