003. A/B тесты и как мы их готовим — Станислав Гафаров

THE SUMMARYAI-generated

Анализ и проведение экспериментов в условиях ограниченных данных и специфики пользовательского поведения

Данный доклад посвящен опыту проведения экспериментов в компании Umatech, которая занимается анализом пользовательского поведения, моделированием оттока, рекомендациями и анализом видео для цифровых продуктов "Газпром-медиа холдинга". Основной акцент делается на проблемах и подходах к проведению A/B тестов в условиях ограниченной истории экспериментов, небольших групп пользователей и специфики метрик.

Основные темы и ключевые моменты

1. Специфика проведения экспериментов в Umatech:

  • Отсутствие истории экспериментов: Эксперименты часто проводятся "с нуля", что затрудняет сравнение с предыдущими результатами и стратификацию.
  • Небольшие группы пользователей: Ограниченный размер групп может вносить смещение в оценки.
  • Отклик пользователей: Медленный отклик пользователей на коммуникацию (например, раз в неделю) требует длительного ожидания результатов.
  • Привязка к контенту: Эксперименты могут быть приурочены к выходу нового контента, что делает невозможным повторное проведение без этого контента.
  • Воспроизводимость результатов: Сезонность и смещение метрик могут затруднять воспроизведение результатов экспериментов.

2. Проблема объединения групп (Парадокс Симпсона):

  • Суть проблемы: При объединении данных из разных групп пользователей тренд, наблюдаемый в каждой группе по отдельности, может исчезнуть или даже измениться на противоположный при рассмотрении общей совокупности.
  • Пример: Случай в Университете Беркли в 1973 году, когда при анализе поступления на разные факультеты оказалось, что мужчины имели более высокий процент поступления в целом, но при рассмотрении каждого факультета отдельно женщины имели более высокий процент поступления.
  • Последствия: Неправильные выводы о нововведениях, когда часть пользователей принимает их хорошо, а часть – плохо, но это скрывается при агрегации данных.
  • Решение: Аккуратное формирование групп пользователей и тщательный подсчет метрик.

3. Метрики и их чувствительность:

  • "Pure user" метрики: Метрики, которые отслеживают изменение поведения пользователя (например, начал смотреть контент, хотя раньше не смотрел).
  • Чувствительность метрик: Важно, чтобы метрики были чувствительны к изменениям, но при этом не были слишком волатильными.
  • Подходы к повышению чувствительности:
    • Бутстреппирование (Bootstrap): Жадный метод, требующий многократной выборки пользователей. Не всегда применим в онлайн-тестах.
    • Дельта-метод (Delta method): Появился в Microsoft в 2018 году.
    • Линеаризация: Помогает ускорить тест.
  • Проблема: Метрики могут быть дискретно распределены и нестационарны, что затрудняет доверие к ним.

4. Нестационарность метрик и A/A тесты:

  • Проблема: Метрики могут меняться со временем, что делает их ненадежными для оценки экспериментов.
  • Решение: Проведение A/A тестов (тестов на истории до A/B экспериментов) для проверки стабильности метрик.
  • Нюансы A/A тестов: Важно правильно развивать группы и определять целевые и контрольные группы.

5. Стандартный алгоритм проведения экспериментов:

  • Определение гипотез и метрик: Выбор проверяемой гипотезы и метрик для оценки.
  • Подбор групп пользователей: Использование методов проверки на нормальность для формирования групп.
  • Проведение эксперимента: Сбор данных в течение определенного периода (например, неделя-две).
  • Оценка результатов: Проведение проверок на нормальность, t-тестов или U-тестов Манна-Уитни для сравнения гипотез.
  • Визуализация результатов: Использование диаграмм (например, вариационных лотов) для наглядного представления изменений метрик.
  • Документирование: Создание подробных отчетов (внутренних и внешних) для сохранения истории экспериментов и возможности проведения пост-анализа и стратификации.

6. Пример проведения эксперимента:

  • Целевая группа (темно-синяя): Получает воздействие (например, коммуникацию от модели машинного обучения).
  • Контрольная группа (светло-синяя): Не получает воздействия.
  • Деление групп: Может быть 50/50, 70/30, 80/20.
  • Оценка эффекта модели: Сравнение группы, не получавшей коммуникацию (например, группа "EF"), с данными из трейна/валидации модели.
  • Оценка эффекта коммуникации: Сравнение группы "ABC" (получавшей коммуникацию) с группой "DEF" (не получавшей коммуникацию).
  • A/B тест: Проводится для сравнения групп "ABC" и "DEF" для оценки влияния коммуникации.
  • Взвешивание групп: При необходимости проводится перевзвешивание групп для нивелирования смещений.

7. Создание собственного сервиса для экспериментов:

  • Мотивация: Необходимость упрощения проведения онлайн A/B тестов и вывода новых фич в продакшен.
  • Вдохновение: Опыт других компаний (например, Avito с их подходом к расчету метрик).
  • Преимущества: Ускорение A/B тестов, упрощение вывода фич.

Важные примеры и реальные приложения

  • Парадокс Симпсона в Университете Беркли (1973): Классический пример проблемы объединения групп.
  • Анализ пользовательского поведения в Umatech: Моделирование оттока, рекомендации контента, анализ видео.
  • Коммуникация с пользователями: Отправка рекомендаций нового контента, как у Netflix.
  • Оффлайн и онлайн тесты рекомендательных моделей.

Ключевые аргументы и перспективы

  • "Паранойя" в проведении экспериментов: Спикер подчеркивает необходимость крайней осторожности при проведении экспериментов из-за потенциальных проблем с данными и метриками.
  • Важность A/A тестов: Для проверки стабильности метрик и доверия к результатам.
  • Гибкость в выборе тестов: Использование t-тестов и U-тестов Манна-Уитни в зависимости от распределения данных.
  • Необходимость документирования: Сохранение истории экспериментов для анализа и обучения.
  • Адаптация к специфике: Разработка собственных подходов и инструментов для решения уникальных задач.

Ключевые понятия

  • A/B тест: Метод сравнения двух версий (A и B) для определения, какая из них лучше.
  • A/A тест: Тест, где обе группы получают одинаковое воздействие, для проверки стабильности метрик.
  • Парадокс Симпсона: Статистический феномен, при котором тренд в агрегированных данных отличается от тренда в подгруппах.
  • Метрика: Показатель, используемый для измерения производительности или поведения.
  • Стратификация: Разделение пользователей на подгруппы для более детального анализа.
  • Чистые пользователи (Pure users): Пользователи, чье поведение отслеживается с момента их первого взаимодействия.
  • Нестационарность: Свойство временного ряда, когда его статистические свойства меняются со временем.
  • Волатильность: Степень изменчивости метрики.
  • Линеаризация: Метод, используемый для ускорения статистических тестов.
  • Бутстреппирование: Метод ресэмплирования для оценки статистических свойств.
  • Дельта-метод: Метод для аппроксимации распределения функции от случайной величины.
  • U-тест Манна-Уитни: Непараметрический тест для сравнения двух независимых выборок.
  • T-тест: Параметрический тест для сравнения средних двух групп.
  • Вариационный лот: Графическое представление распределения данных.
  • Сезонность: Периодические колебания в данных.
  • Смещение (Bias): Систематическая ошибка в данных или анализе.

Синтез/Заключение

Umatech сталкивается с типичными для многих компаний проблемами при проведении экспериментов: ограниченность данных, необходимость точного измерения эффекта и высокая чувствительность к ошибкам. Спикер подчеркивает важность глубокого понимания статистических феноменов, таких как Парадокс Симпсона, и тщательного подхода к выбору и анализу метрик. Проведение A/A тестов, документирование каждого шага и разработка собственных инструментов являются ключевыми стратегиями для минимизации рисков и получения достоверных результатов в условиях специфики пользовательского поведения и ограниченных ресурсов.

Key Concepts

  • A/B Testing
  • A/A Testing
  • Simpson's Paradox
  • Metrics
  • Stratification
  • Pure User Metrics
  • Non-stationarity
  • Volatility
  • Linearization
  • Bootstrapping
  • Delta Method
  • Mann-Whitney U Test
  • T-test
  • Variation Plot
  • Seasonality
  • Bias

AI summaries can miss context or contain errors. Check important details against the original video.

Go a little deeper.

Have a question about this video? Load its transcript to open the video chat.