← ДашбордКаталог узлов

СП-06. Работает ли nudge

Спор · статус: dev · проверен: 2026-09-12 · база «Когнитивные искажения»
Просто: представьте, что две лаборатории взяли одни и те же анализы крови у одной и той же группы пациентов, но по-разному учли, что «здоровые» результаты чаще попадают в отчёты, а «так себе» — чаще выбрасываются в мусорную корзину. Одна лаборатория, поправив на это по-мягкому, говорит «пациент в целом здоров, есть небольшое отклонение». Другая, поправив по-жёсткому, говорит «отклонения не видно вообще». А независимая проверка на новых пациентах — не тех же самых — говорит: отклонение действительно есть, просто раньше о нём писали в шесть раз громче, чем оно есть на самом деле.
Тезис: два мета-анализа на одном и том же массиве данных (455 эффектов, 2,15 млн участников) дают противоположные ответы в зависимости от того, как корректировать публикационное смещение — Mertens (2022) находит умеренный эффект (d=0,45), Maier (2022) на тех же данных при жёсткой поправке на смещение публикаций находит «no evidence remains that nudges are effective» (d≈0,04); независимый арбитр на других данных (DellaVigna & Linos 2022, 126 полевых RCT) подтверждает: эффект реален, но литература завышает его примерно в шесть раз против того, что реально измеряется в практике государственных nudge-подразделений.

Содержание

Формулировка спора и общий массив данных. [факт] Оба мета-анализа основаны на одном и том же корпусе исследований nudge (архитектуры выбора), собранном в изначальном мета-анализе, и представляют разные статистические подходы к поправке на публикационное смещение — это не спор о разных данных, а спор о методе анализа одних и тех же данных.

Сторона «эффект реален, умеренный» (Mertens et al. 2022)

[спорно — сторона 1] Тезис: nudge-интервенции в среднем дают умеренный положительный эффект на поведение.

Опора: k=455 эффектов, N=2,15 млн участников, d=0,45 [95% ДИ 0,39; 0,52], гетерогенность I²=99,67% (крайне высокая — эффект сильно варьирует между интервенциями), тест Эггера на асимметрию воронки значим (указывает на публикационное смещение). При умеренной коррекции на смещение оценка падает до d=0,31, при жёсткой коррекции — до d=0,03 (по выжимке Р-5/Д16). Значимая гетерогенность I²=99,67% — сама по себе оговорка авторов: усреднённое d=0,45 плохо описывает разброс между конкретными типами nudge.

Сторона «эффекта не остаётся» (Maier et al. 2022)

[спорно — сторона 2] Тезис: на тех же 455 эффектах, при более консервативном байесовском методе коррекции публикационного смещения (RoBMA), общий эффект статистически неотличим от нуля.

Опора: d=0,04 [95% ДИ 0,00; 0,14] — дословный вывод «no evidence remains that nudges are effective» (по выжимке Р-5/Д16). По категориям интервенций: information-nudges — с 0,25 до 0,00 (Bayes Factor в пользу нулевой гипотезы BF01=33,8 — сильное свидетельство отсутствия эффекта); structure-nudges — с 0,58 до 0,12 (авторы называют «undecided», не «ноль»); assistance-nudges — с 0,22 до 0,01. Важная оговорка авторов, зафиксированная в выжимке: разброс по категориям означает, что «some nudges might be effective» — Maier не отрицает эффект nudge как класса полностью, отрицает его как усреднённую по всем интервенциям константу.

Что признаёт каждая сторона у другой (из самого факта одинакового массива данных): обе стороны согласны в сыром, не скорректированном на смещение результате (d≈0,45) и в высокой гетерогенности между типами nudge; расхождение — только в силе и методе коррекции публикационного смещения, не в исходных данных.

Независимый арбитр на других данных (DellaVigna & Linos 2022)

[факт] DellaVigna, S. & Linos, E. (2022) — не третья сторона в терминологическом споре о коррекции, а независимая полевая проверка на другом массиве: 126 RCT из практики двух государственных nudge-подразделений США (BIT North America — офис Behavioral Insights Team, работает с местными [local] органами власти, и OES — Office of Evaluation Sciences, работает с федеральным правительством США), 243 отдельных nudge-сравнения, 23 млн участников (по выжимке Р-5/Д16). Результат: в поле — 1,4 процентных пункта (8,1% относительного эффекта); в академических публикациях по тем же типам интервенций — 8,7 п.п. (33,5%) — «about one sixth», то есть академическая литература завышает эффект примерно в шесть раз. Решающая оговорка: «весь разрыв — публикационное смещение + низкая мощность» академических исследований (по выжимке); при этом «практики nudge-units калиброваны почти идеально» в своих собственных прогнозах эффекта, тогда как прочие прогнозисты (эксперты вне юнитов) систематически переоценивают.

Что реально устояло — по трём источникам вместе, не по моему суждению. [факт] Три независимых метода коррекции публикационного смещения (умеренная и жёсткая байесовская поправка на одном массиве плюс независимая полевая проверка на другом массиве) сходятся в одном: величина эффекта nudge в академической литературе завышена относительно того, что показывает более строгий анализ или независимое поле. [факт] Расхождение начинается там, где нужно решить, остаётся ли после поправки эффект, статистически отличимый от нуля («умеренный, но маленький» — Mertens и DellaVigna & Linos, против «неотличим от нуля в среднем по категориям» — Maier); все три источника согласны, что усреднённая оценка по всем типам nudge — плохой ориентир из-за экстремальной гетерогенности (I²≈99,7% у Mertens; разброс по категориям у Maier; «about one sixth» — не общий, а специфичный к паре «академия/поле» результат у DellaVigna & Linos).

Бриф для ЛПР

(б) Процедура. Измеренная и воспроизводимая величина: полевой эффект типичного nudge — около 1,4 п.п. (8,1% относительного изменения поведения), не 8,7 п.п., которые обещает средняя академическая публикация (DellaVigna & Linos 2022, по выжимке Р-5/Д16). Практический вывод: при планировании ожидаемого эффекта архитектуры выбора закладывать эффект в шесть раз меньше того, что обещает цитируемая академическая статья, если источник оценки — не собственный пилот в тех же условиях.

(в) Среда. Диагностика: если решение опирается на цитату из академической литературы про эффект конкретного nudge — по DellaVigna & Linos это систематически завышенная оценка; если решение опирается на собственный пилотный RCT в той же организации и популяции — по тем же данным именно такой источник («практики nudge-units калиброваны почти идеально») даёт реалистичный прогноз. Среда с высокой гетерогенностью типов интервенций (I²≈99,7%) означает: усреднённая цифра «nudge работает с d=X» бесполезна без указания конкретного типа интервенции (information/structure/assistance по категориям Maier).

(г) Организация. [факт] Из данных DellaVigna & Linos прямо следует организационный вывод: собственное nudge-подразделение с историей пилотов в своей среде калибрует ожидания точнее, чем внешние эксперты или академическая литература («practitioners... calibrated almost perfectly»). Это не «кейсы, не RCT» — это количественное сравнение прогнозов практиков и прогнозов сторонних экспертов на одних и тех же 126 RCT.

Связан с

Источники

Открытые хвосты

Проверен на дату

2026-09-12

Вопросы

отвечено 0 из 3

1. Почему Mertens (2022) и Maier (2022) получают разные ответы на один и тот же вопрос «работает ли nudge», используя один и тот же массив из 455 эффектов?

Ответ: (б). Раздел «Формулировка спора» и обе карточки сторон.

2. Что показывает независимая проверка DellaVigna & Linos (2022) на полевых данных государственных nudge-подразделений?

Ответ: (б). Раздел «Независимый арбитр», цифры 1,4 vs 8,7 п.п., «about one sixth».

3. В чём сходятся все три источника спора, несмотря на разные выводы о статистической значимости?

Ответ: (б). Раздел «Что реально устояло».
Дашборд Каталог узлов Наверх ↑