Формулировка спора и общий массив данных. [факт] Оба мета-анализа основаны на одном и том же корпусе исследований nudge (архитектуры выбора), собранном в изначальном мета-анализе, и представляют разные статистические подходы к поправке на публикационное смещение — это не спор о разных данных, а спор о методе анализа одних и тех же данных.
[спорно — сторона 1] Тезис: nudge-интервенции в среднем дают умеренный положительный эффект на поведение.
Опора: k=455 эффектов, N=2,15 млн участников, d=0,45 [95% ДИ 0,39; 0,52], гетерогенность I²=99,67% (крайне высокая — эффект сильно варьирует между интервенциями), тест Эггера на асимметрию воронки значим (указывает на публикационное смещение). При умеренной коррекции на смещение оценка падает до d=0,31, при жёсткой коррекции — до d=0,03 (по выжимке Р-5/Д16). Значимая гетерогенность I²=99,67% — сама по себе оговорка авторов: усреднённое d=0,45 плохо описывает разброс между конкретными типами nudge.
[спорно — сторона 2] Тезис: на тех же 455 эффектах, при более консервативном байесовском методе коррекции публикационного смещения (RoBMA), общий эффект статистически неотличим от нуля.
Опора: d=0,04 [95% ДИ 0,00; 0,14] — дословный вывод «no evidence remains that nudges are effective» (по выжимке Р-5/Д16). По категориям интервенций: information-nudges — с 0,25 до 0,00 (Bayes Factor в пользу нулевой гипотезы BF01=33,8 — сильное свидетельство отсутствия эффекта); structure-nudges — с 0,58 до 0,12 (авторы называют «undecided», не «ноль»); assistance-nudges — с 0,22 до 0,01. Важная оговорка авторов, зафиксированная в выжимке: разброс по категориям означает, что «some nudges might be effective» — Maier не отрицает эффект nudge как класса полностью, отрицает его как усреднённую по всем интервенциям константу.
Что признаёт каждая сторона у другой (из самого факта одинакового массива данных): обе стороны согласны в сыром, не скорректированном на смещение результате (d≈0,45) и в высокой гетерогенности между типами nudge; расхождение — только в силе и методе коррекции публикационного смещения, не в исходных данных.
[факт] DellaVigna, S. & Linos, E. (2022) — не третья сторона в терминологическом споре о коррекции, а независимая полевая проверка на другом массиве: 126 RCT из практики двух государственных nudge-подразделений США (BIT North America — офис Behavioral Insights Team, работает с местными [local] органами власти, и OES — Office of Evaluation Sciences, работает с федеральным правительством США), 243 отдельных nudge-сравнения, 23 млн участников (по выжимке Р-5/Д16). Результат: в поле — 1,4 процентных пункта (8,1% относительного эффекта); в академических публикациях по тем же типам интервенций — 8,7 п.п. (33,5%) — «about one sixth», то есть академическая литература завышает эффект примерно в шесть раз. Решающая оговорка: «весь разрыв — публикационное смещение + низкая мощность» академических исследований (по выжимке); при этом «практики nudge-units калиброваны почти идеально» в своих собственных прогнозах эффекта, тогда как прочие прогнозисты (эксперты вне юнитов) систематически переоценивают.
Что реально устояло — по трём источникам вместе, не по моему суждению. [факт] Три независимых метода коррекции публикационного смещения (умеренная и жёсткая байесовская поправка на одном массиве плюс независимая полевая проверка на другом массиве) сходятся в одном: величина эффекта nudge в академической литературе завышена относительно того, что показывает более строгий анализ или независимое поле. [факт] Расхождение начинается там, где нужно решить, остаётся ли после поправки эффект, статистически отличимый от нуля («умеренный, но маленький» — Mertens и DellaVigna & Linos, против «неотличим от нуля в среднем по категориям» — Maier); все три источника согласны, что усреднённая оценка по всем типам nudge — плохой ориентир из-за экстремальной гетерогенности (I²≈99,7% у Mertens; разброс по категориям у Maier; «about one sixth» — не общий, а специфичный к паре «академия/поле» результат у DellaVigna & Linos).
(б) Процедура. Измеренная и воспроизводимая величина: полевой эффект типичного nudge — около 1,4 п.п. (8,1% относительного изменения поведения), не 8,7 п.п., которые обещает средняя академическая публикация (DellaVigna & Linos 2022, по выжимке Р-5/Д16). Практический вывод: при планировании ожидаемого эффекта архитектуры выбора закладывать эффект в шесть раз меньше того, что обещает цитируемая академическая статья, если источник оценки — не собственный пилот в тех же условиях.
(в) Среда. Диагностика: если решение опирается на цитату из академической литературы про эффект конкретного nudge — по DellaVigna & Linos это систематически завышенная оценка; если решение опирается на собственный пилотный RCT в той же организации и популяции — по тем же данным именно такой источник («практики nudge-units калиброваны почти идеально») даёт реалистичный прогноз. Среда с высокой гетерогенностью типов интервенций (I²≈99,7%) означает: усреднённая цифра «nudge работает с d=X» бесполезна без указания конкретного типа интервенции (information/structure/assistance по категориям Maier).
(г) Организация. [факт] Из данных DellaVigna & Linos прямо следует организационный вывод: собственное nudge-подразделение с историей пилотов в своей среде калибрует ожидания точнее, чем внешние эксперты или академическая литература («practitioners... calibrated almost perfectly»). Это не «кейсы, не RCT» — это количественное сравнение прогнозов практиков и прогнозов сторонних экспертов на одних и тех же 126 RCT.
2026-09-12
отвечено 0 из 3
1. Почему Mertens (2022) и Maier (2022) получают разные ответы на один и тот же вопрос «работает ли nudge», используя один и тот же массив из 455 эффектов?
2. Что показывает независимая проверка DellaVigna & Linos (2022) на полевых данных государственных nudge-подразделений?
3. В чём сходятся все три источника спора, несмотря на разные выводы о статистической значимости?