Анализ и проведение экспериментов в условиях ограниченных данных и специфики пользовательского поведения
Данный доклад посвящен опыту проведения экспериментов в компании Umatech, которая занимается анализом пользовательского поведения, моделированием оттока, рекомендациями и анализом видео для цифровых продуктов "Газпром-медиа холдинга". Основной акцент делается на проблемах и подходах к проведению A/B тестов в условиях ограниченной истории экспериментов, небольших групп пользователей и специфики метрик.
Основные темы и ключевые моменты
1. Специфика проведения экспериментов в Umatech:
- Отсутствие истории экспериментов: Эксперименты часто проводятся "с нуля", что затрудняет сравнение с предыдущими результатами и стратификацию.
- Небольшие группы пользователей: Ограниченный размер групп может вносить смещение в оценки.
- Отклик пользователей: Медленный отклик пользователей на коммуникацию (например, раз в неделю) требует длительного ожидания результатов.
- Привязка к контенту: Эксперименты могут быть приурочены к выходу нового контента, что делает невозможным повторное проведение без этого контента.
- Воспроизводимость результатов: Сезонность и смещение метрик могут затруднять воспроизведение результатов экспериментов.
2. Проблема объединения групп (Парадокс Симпсона):
- Суть проблемы: При объединении данных из разных групп пользователей тренд, наблюдаемый в каждой группе по отдельности, может исчезнуть или даже измениться на противоположный при рассмотрении общей совокупности.
- Пример: Случай в Университете Беркли в 1973 году, когда при анализе поступления на разные факультеты оказалось, что мужчины имели более высокий процент поступления в целом, но при рассмотрении каждого факультета отдельно женщины имели более высокий процент поступления.
- Последствия: Неправильные выводы о нововведениях, когда часть пользователей принимает их хорошо, а часть – плохо, но это скрывается при агрегации данных.
- Решение: Аккуратное формирование групп пользователей и тщательный подсчет метрик.
3. Метрики и их чувствительность:
- "Pure user" метрики: Метрики, которые отслеживают изменение поведения пользователя (например, начал смотреть контент, хотя раньше не смотрел).
- Чувствительность метрик: Важно, чтобы метрики были чувствительны к изменениям, но при этом не были слишком волатильными.
- Подходы к повышению чувствительности:
- Бутстреппирование (Bootstrap): Жадный метод, требующий многократной выборки пользователей. Не всегда применим в онлайн-тестах.
- Дельта-метод (Delta method): Появился в Microsoft в 2018 году.
- Линеаризация: Помогает ускорить тест.
- Проблема: Метрики могут быть дискретно распределены и нестационарны, что затрудняет доверие к ним.
4. Нестационарность метрик и A/A тесты:
- Проблема: Метрики могут меняться со временем, что делает их ненадежными для оценки экспериментов.
- Решение: Проведение A/A тестов (тестов на истории до A/B экспериментов) для проверки стабильности метрик.
- Нюансы A/A тестов: Важно правильно развивать группы и определять целевые и контрольные группы.
5. Стандартный алгоритм проведения экспериментов:
- Определение гипотез и метрик: Выбор проверяемой гипотезы и метрик для оценки.
- Подбор групп пользователей: Использование методов проверки на нормальность для формирования групп.
- Проведение эксперимента: Сбор данных в течение определенного периода (например, неделя-две).
- Оценка результатов: Проведение проверок на нормальность, t-тестов или U-тестов Манна-Уитни для сравнения гипотез.
- Визуализация результатов: Использование диаграмм (например, вариационных лотов) для наглядного представления изменений метрик.
- Документирование: Создание подробных отчетов (внутренних и внешних) для сохранения истории экспериментов и возможности проведения пост-анализа и стратификации.
6. Пример проведения эксперимента:
- Целевая группа (темно-синяя): Получает воздействие (например, коммуникацию от модели машинного обучения).
- Контрольная группа (светло-синяя): Не получает воздействия.
- Деление групп: Может быть 50/50, 70/30, 80/20.
- Оценка эффекта модели: Сравнение группы, не получавшей коммуникацию (например, группа "EF"), с данными из трейна/валидации модели.
- Оценка эффекта коммуникации: Сравнение группы "ABC" (получавшей коммуникацию) с группой "DEF" (не получавшей коммуникацию).
- A/B тест: Проводится для сравнения групп "ABC" и "DEF" для оценки влияния коммуникации.
- Взвешивание групп: При необходимости проводится перевзвешивание групп для нивелирования смещений.
7. Создание собственного сервиса для экспериментов:
- Мотивация: Необходимость упрощения проведения онлайн A/B тестов и вывода новых фич в продакшен.
- Вдохновение: Опыт других компаний (например, Avito с их подходом к расчету метрик).
- Преимущества: Ускорение A/B тестов, упрощение вывода фич.
Важные примеры и реальные приложения
- Парадокс Симпсона в Университете Беркли (1973): Классический пример проблемы объединения групп.
- Анализ пользовательского поведения в Umatech: Моделирование оттока, рекомендации контента, анализ видео.
- Коммуникация с пользователями: Отправка рекомендаций нового контента, как у Netflix.
- Оффлайн и онлайн тесты рекомендательных моделей.
Ключевые аргументы и перспективы
- "Паранойя" в проведении экспериментов: Спикер подчеркивает необходимость крайней осторожности при проведении экспериментов из-за потенциальных проблем с данными и метриками.
- Важность A/A тестов: Для проверки стабильности метрик и доверия к результатам.
- Гибкость в выборе тестов: Использование t-тестов и U-тестов Манна-Уитни в зависимости от распределения данных.
- Необходимость документирования: Сохранение истории экспериментов для анализа и обучения.
- Адаптация к специфике: Разработка собственных подходов и инструментов для решения уникальных задач.
Ключевые понятия
- A/B тест: Метод сравнения двух версий (A и B) для определения, какая из них лучше.
- A/A тест: Тест, где обе группы получают одинаковое воздействие, для проверки стабильности метрик.
- Парадокс Симпсона: Статистический феномен, при котором тренд в агрегированных данных отличается от тренда в подгруппах.
- Метрика: Показатель, используемый для измерения производительности или поведения.
- Стратификация: Разделение пользователей на подгруппы для более детального анализа.
- Чистые пользователи (Pure users): Пользователи, чье поведение отслеживается с момента их первого взаимодействия.
- Нестационарность: Свойство временного ряда, когда его статистические свойства меняются со временем.
- Волатильность: Степень изменчивости метрики.
- Линеаризация: Метод, используемый для ускорения статистических тестов.
- Бутстреппирование: Метод ресэмплирования для оценки статистических свойств.
- Дельта-метод: Метод для аппроксимации распределения функции от случайной величины.
- U-тест Манна-Уитни: Непараметрический тест для сравнения двух независимых выборок.
- T-тест: Параметрический тест для сравнения средних двух групп.
- Вариационный лот: Графическое представление распределения данных.
- Сезонность: Периодические колебания в данных.
- Смещение (Bias): Систематическая ошибка в данных или анализе.
Синтез/Заключение
Umatech сталкивается с типичными для многих компаний проблемами при проведении экспериментов: ограниченность данных, необходимость точного измерения эффекта и высокая чувствительность к ошибкам. Спикер подчеркивает важность глубокого понимания статистических феноменов, таких как Парадокс Симпсона, и тщательного подхода к выбору и анализу метрик. Проведение A/A тестов, документирование каждого шага и разработка собственных инструментов являются ключевыми стратегиями для минимизации рисков и получения достоверных результатов в условиях специфики пользовательского поведения и ограниченных ресурсов.
Key Concepts
- A/B Testing
- A/A Testing
- Simpson's Paradox
- Metrics
- Stratification
- Pure User Metrics
- Non-stationarity
- Volatility
- Linearization
- Bootstrapping
- Delta Method
- Mann-Whitney U Test
- T-test
- Variation Plot
- Seasonality
- Bias
AI summaries can miss context or contain errors. Check important details against the original video.





