← ДашбордКаталог узлов

ДТ-03. Разброс эффектов между одинаковыми nudge (мегастади)

Данные / замер · статус: dev · проверен: 2026-09-12 · база «Когнитивные искажения»
Просто: представьте, что 19 разных копирайтеров одновременно пишут напоминание «запишитесь на приём к врачу» для одной и той же аптеки — какие-то тексты сработают чуть лучше среднего, какой-то один — заметно лучше, но реальный разрыв между «средним» и «лучшим» текстом не в разы больше, чем кажется по заголовкам новостей про магию одной удачной фразы: после честной статистической поправки лучший результат скромнее, чем выглядел на бумаге.
Тезис: когда 19 разных команд учёных одновременно тестируют 19 разных текстовых напоминаний об одной и той же цели (вакцинация) на одной и той же популяции в одном и том же «мегаисследовании», средний эффект скромный (2,1 процентного пункта), а разброс между конкретными формулировками велик — лучший вариант дал 4,6 п.п. (после поправки на инфляцию оценки — 2,8 п.п.), то есть выбор конкретной формулировки «подталкивания» может удваивать или обнулять эффект при одной и той же общей идее вмешательства.

Содержание

Как читать. Мегаисследование (megastudy) — дизайн, где много вариантов вмешательства тестируются одновременно на одной популяции с одним и тем же протоколом рандомизации и одним и тем же измеримым исходом, что снимает проблему сравнения результатов разных отдельных экспериментов (разные выборки, разные протоколы) — здесь сравнение внутреннее, «яблоки с яблоками».

Источник Дизайн N Величина Поправка на смещение
Milkman et al. 2021 Мегаисследование: 19 текстовых напоминаний о вакцинации, случайное распределение внутри одной популяции пациентов сети клиник N не приведён отдельно по вариантам в добытом фрагменте; 19 протоколов, статистика по всей выборке Средний прирост по 19 вариантам: 2,1 п.п. (+5%), p=0,024; лучший «сырой» вариант: 4,6 п.п. (+11%), p<0,01 После коррекции на вероятное завышение оценки лучшего из 19 вариантов (проблема множественных сравнений) — консервативная оценка истинного эффекта лучшего варианта: 2,8 п.п. (+6,7%)

[факт] Основной результат по всем 19 вариантам: «The 19 treatments boosted vaccination levels by an average of 2.1 percentage points or 5% (P = 0.024), and we cannot reject the null hypothesis that all 19 effects have the same true value (Chi-sq = 21.277, df = 18, P = 0.266)» (Milkman et al., 2021, Results) — то есть статистически нельзя утверждать, что 19 вариантов реально различаются между собой по истинной величине эффекта, хотя точечные оценки визуально расходятся.

[факт] Лучший по точечной оценке вариант: «The top-performing intervention in our study showed a 4.6 percentage point boost in vaccination (an 11% increase; P < 0.01) at the cost of sending two text messages» (Milkman et al., 2021, Results).

[оговорка авторов, поправка на смещение] Прямое предупреждение о завышении оценки лучшего варианта среди многих протестированных («winner's curse»/inflation problem): «Correcting for likely inflation in the largest out of 19 estimates, we calculate a more conservative estimate of the true effect to be a 2.8 percentage point boost in vaccination or a 6.7% increase from baseline» (Milkman et al., 2021, Results) — методическая поправка именно на то, что при выборе «лучшего из многих» его сырая оценка почти всегда завышена относительно истинной величины.

Бриф для ЛПР

(б) Процедура. Единственный измеренный вывод: если организация тестирует несколько вариантов одного и того же вмешательства одновременно (A/B/…/S-тест, не последовательные отдельные эксперименты), при выборе «победителя» нужно скорректировать его сырую оценку вниз (winner's curse) — Milkman et al. (2021) прямо показывают методику (4,6 п.п. сырых → 2,8 п.п. консервативных) и её оправданность статистическим тестом, не отвергающим гипотезу об одинаковой истинной величине всех 19 вариантов. (в) Среда. Дизайн мегаисследования сам по себе — среда с быстрой и однозначной обратной связью (Kahneman & Klein, 2009 — критерий валидности среды, см. МХ-12 Натуралистическое принятие решений RPD): все варианты тестируются одновременно на одной популяции с одним и тем же измеримым исходом (запись на приём/вакцинация), что делает сравнение вариантов надёжным способом отличить реально значимую разницу формулировок от случайного шума. (г) Организация. Кто решает vs кто предлагает: организация, тестирующая несколько формулировок одного «подталкивания», получает более надёжную информацию о разбросе эффектов, чем организация, пробующая варианты по очереди в разное время на разных группах — прямое методическое следствие дизайна мегаисследования, а не отдельно измеренная управленческая практика.

Связан с

Источники

Открытые хвосты

Проверен на дату

2026-09-12

Вопросы

отвечено 0 из 3

1. Можно ли, по статистическому тесту Milkman et al. (2021), утверждать, что 19 протестированных вариантов текстовых напоминаний реально различались по истинной величине эффекта?

Ответ: (б). Раздел «Содержание», Milkman et al. 2021, Results.

2. Почему авторы скорректировали сырую оценку лучшего варианта (4,6 п.п.) до более консервативной (2,8 п.п.)?

Ответ: (б). Раздел «Содержание», Milkman et al. 2021, Results.

3. Чем дизайн мегаисследования отличается от последовательного тестирования вариантов вмешательства по одному в разное время?

Ответ: (б). Раздел «Содержание», «Как читать».
Дашборд Каталог узлов Наверх ↑