Как читать. Мегаисследование (megastudy) — дизайн, где много вариантов вмешательства тестируются одновременно на одной популяции с одним и тем же протоколом рандомизации и одним и тем же измеримым исходом, что снимает проблему сравнения результатов разных отдельных экспериментов (разные выборки, разные протоколы) — здесь сравнение внутреннее, «яблоки с яблоками».
| Источник | Дизайн | N | Величина | Поправка на смещение |
|---|---|---|---|---|
| Milkman et al. 2021 | Мегаисследование: 19 текстовых напоминаний о вакцинации, случайное распределение внутри одной популяции пациентов сети клиник | N не приведён отдельно по вариантам в добытом фрагменте; 19 протоколов, статистика по всей выборке | Средний прирост по 19 вариантам: 2,1 п.п. (+5%), p=0,024; лучший «сырой» вариант: 4,6 п.п. (+11%), p<0,01 | После коррекции на вероятное завышение оценки лучшего из 19 вариантов (проблема множественных сравнений) — консервативная оценка истинного эффекта лучшего варианта: 2,8 п.п. (+6,7%) |
[факт] Основной результат по всем 19 вариантам: «The 19 treatments boosted vaccination levels by an average of 2.1 percentage points or 5% (P = 0.024), and we cannot reject the null hypothesis that all 19 effects have the same true value (Chi-sq = 21.277, df = 18, P = 0.266)» (Milkman et al., 2021, Results) — то есть статистически нельзя утверждать, что 19 вариантов реально различаются между собой по истинной величине эффекта, хотя точечные оценки визуально расходятся.
[факт] Лучший по точечной оценке вариант: «The top-performing intervention in our study showed a 4.6 percentage point boost in vaccination (an 11% increase; P < 0.01) at the cost of sending two text messages» (Milkman et al., 2021, Results).
[оговорка авторов, поправка на смещение] Прямое предупреждение о завышении оценки лучшего варианта среди многих протестированных («winner's curse»/inflation problem): «Correcting for likely inflation in the largest out of 19 estimates, we calculate a more conservative estimate of the true effect to be a 2.8 percentage point boost in vaccination or a 6.7% increase from baseline» (Milkman et al., 2021, Results) — методическая поправка именно на то, что при выборе «лучшего из многих» его сырая оценка почти всегда завышена относительно истинной величины.
(б) Процедура. Единственный измеренный вывод: если организация тестирует несколько вариантов одного и того же вмешательства одновременно (A/B/…/S-тест, не последовательные отдельные эксперименты), при выборе «победителя» нужно скорректировать его сырую оценку вниз (winner's curse) — Milkman et al. (2021) прямо показывают методику (4,6 п.п. сырых → 2,8 п.п. консервативных) и её оправданность статистическим тестом, не отвергающим гипотезу об одинаковой истинной величине всех 19 вариантов. (в) Среда. Дизайн мегаисследования сам по себе — среда с быстрой и однозначной обратной связью (Kahneman & Klein, 2009 — критерий валидности среды, см. МХ-12 Натуралистическое принятие решений RPD): все варианты тестируются одновременно на одной популяции с одним и тем же измеримым исходом (запись на приём/вакцинация), что делает сравнение вариантов надёжным способом отличить реально значимую разницу формулировок от случайного шума. (г) Организация. Кто решает vs кто предлагает: организация, тестирующая несколько формулировок одного «подталкивания», получает более надёжную информацию о разбросе эффектов, чем организация, пробующая варианты по очереди в разное время на разных группах — прямое методическое следствие дизайна мегаисследования, а не отдельно измеренная управленческая практика.
2026-09-12
отвечено 0 из 3
1. Можно ли, по статистическому тесту Milkman et al. (2021), утверждать, что 19 протестированных вариантов текстовых напоминаний реально различались по истинной величине эффекта?
2. Почему авторы скорректировали сырую оценку лучшего варианта (4,6 п.п.) до более консервативной (2,8 п.п.)?
3. Чем дизайн мегаисследования отличается от последовательного тестирования вариантов вмешательства по одному в разное время?