Как читать. Величина «доля выпадений за пределы X%-интервала» — прямой измеритель калибровки: при идеальной калибровке доля выпадений точно равна (100% − X%); чем сильнее фактическая доля превышает ожидаемую, тем сильнее избыточная уверенность (overprecision). Для приёмов-противоядий приведена абсолютная величина прироста точности (в процентных пунктах попаданий или в Cohen's d).
| Источник | Дизайн | N | Величина | Как читать |
|---|---|---|---|---|
| Tversky & Kahneman 1974 | Испытуемые оценивают X01/X99-процентили для количественных величин (напр. расстояние Нью-Дели—Пекин); проверка калибровки по агрегату задач | «several investigators», один эксперимент — 24 величины | Истинные значения выпадают за пределы 98%-интервала [X01; X99] примерно в 30% случаев вместо ожидаемых 2% | Базовая демонстрация overprecision без всякого обучения; эффект не устраняется у экспертов и при наличии правильных стимулов к точности (TK74, с. 1129) |
| Moore & Healy 2008 | Обзор литературы по overconfidence, реконциляция трёх типов (overestimation, overplacement, overprecision) | обзор ~365 работ по PsycINFO, ≈31% из них — про overprecision | 90%-доверительные интервалы содержат правильный ответ менее чем в 50% случаев | Overprecision — самый устойчивый из трёх видов «избыточной уверенности», меньше всего поддаётся развороту в «недоуверенность» на лёгких задачах (в отличие от overestimation/overplacement) |
| Larrick 2004 (цит. Soll & Klayman 2004) | Обзор дебайасинга; сравнение стандартной и раздельной процедуры запроса интервалов | — (обзор чужих результатов) | Стандартная процедура: 80%-интервалы содержат истину в 30–40% случаев; раздельная процедура (10-й и 90-й процентили запрашиваются в разных, отдельных стадиях) — попадание выросло почти до 60% | Простое изменение процедуры опроса (не тренинг, не мотивация) даёт измеримый прирост калибровки |
| Herzog & Hertwig 2009 | Лабораторный эксперимент: диалектический бутстрэппинг (второе, «противоположное» мнение того же человека) против простого повторения оценки | N=50 участников | Простое повторение (reliability condition): прирост точности 0,3 п.п. (d=0,12); диалектический бутстрэппинг: прирост 4,1 п.п. (d=0,53); усреднение с реальным вторым человеком: 7,1 п.п. (d=0,86) | Диалектический бутстрэппинг работает не у всех: у 72% участников (36 из 50) точность выросла, у 24% (12 из 50) — снизилась; собственное «второе мнение» вполовину слабее реального второго человека |
[факт] Базовая демонстрация (Tversky & Kahneman, 1974, с. 1128–1129): «the true values should fall in the confidence interval between X01 and X99 on 98 percent of the problems… In most studies, the actual values of the assessed quantities are either smaller than X01 or greater than X99 for about 30 percent of the problems… This bias is common to naive and to sophisticated subjects, and it is not eliminated by introducing proper scoring rules, which provide incentives for external calibration» (TK74, с. 1129).
[факт] Определение и относительная устойчивость overprecision (Moore & Healy, 2008, с. 502–503): «Results show that these confidence intervals are too narrow, suggesting that people are too sure they know the correct answer; 90% confidence intervals contain the correct answer less than 50% of the time (Alpert & Raiffa, 1982; Klayman, Soll, Gonzalez-Vallejo, & Barlas, 1999; Soll & Klayman, 2004)». Авторы отдельно отмечают (в оговорке о трёх типах overconfidence), что overprecision «appears to be more persistent than either of the other 2 types of overconfidence» (Moore & Healy, 2008, абстракт).
[факт, ПР с измеренным эффектом] Простая процедурная поправка (Larrick, 2004, с. 323, цитируя Soll & Klayman, 2004): «Ranges for which people are 80 percent confident capture the truth 30 percent to 40 percent of the time. Soll and Klayman (2004) showed that having judges generate 10th and 90th percentile estimates in separate stages – which forces them to consider distinct reasons for low and high values – increased hit rates to nearly 60 percent by both widening and centering ranges».
[факт, ПР с измеренным эффектом] Диалектический бутстрэппинг (Herzog & Hertwig, 2009, с. 234): реальный прирост точности от простого повторного вопроса ничтожен (0,3 п.п., d=0,12), тогда как явная генерация «противоположной» второй оценки того же человека («dialectical estimate») даёт прирост «by an order of magnitude: 4.1 percentage points… an effect of medium size (d = 0.53)» (с. 234). При этом усреднение с независимой оценкой реального второго человека даёт больший эффект — «average dyadic gain of 7.1 percentage points… an effect of large size (d = 0.86)» (с. 235) — «Nevertheless, one's own second, dialectical opinion is worth half the opinion of another judge» (с. 235).
[оговорка авторов] Диалектический бутстрэппинг помогает не всем: «Nearly three fourths of participants (36 of 50, or 72%) benefited from dialectical bootstrapping… For about one fourth of participants (12 of 50, 24%), accuracy actually decreased» (Herzog & Hertwig, 2009, с. 234) — то есть приём с измеренным положительным средним эффектом, но не универсальным индивидуальным результатом.
(б) Процедура. Два измеренных приёма с конкретной величиной эффекта: (1) запрашивать нижнюю и верхнюю границу интервала раздельными стадиями вместо одновременного вопроса — рост попаданий с 30–40% до ~60% (Larrick, 2004, с. 323, Soll & Klayman, 2004), см. ПР-02 Интервальные оценки и калибровка; (2) диалектический бутстрэппинг — сформулировать явно «противоположную» вторую оценку того же вопроса, представив, что первая оценка неверна, — прирост 4,1 п.п. точности, d=0,53, но не работает примерно у четверти пробующих (Herzog & Hertwig, 2009, с. 234), см. ПР-03 Диалектический бутстрэппинг. Оба приёма — измеренный, но частичный эффект, не устраняющий overprecision полностью. (в) Среда. Overprecision — самый устойчивый из трёх видов overconfidence (Moore & Healy, 2008, абстракт) и не устраняется одними стимулами к точности (TK74, с. 1129: «not eliminated by introducing proper scoring rules») — то есть в средах, где мотивация уже высокая (ставки велики), одной мотивации недостаточно; нужна именно процедурная поправка формата запроса оценки. (г) Организация. Кто решает vs кто предлагает: если решение об интервальной оценке (бюджет, срок, риск) принимает один человек единолично, у организации нет встроенного способа поймать overprecision — практики, дающие измеренный прирост, требуют либо явной процедуры (раздельный запрос границ), либо структурированного запроса второго мнения (диалектического или от реального другого человека) — кейсы использования этих приёмов в управленческом, не лабораторном контексте в источниках не приведены отдельно.
2026-09-12
отвечено 0 из 3
1. Какая доля истинных значений выпадает за пределы заявленного испытуемыми 98%-доверительного интервала, по демонстрации Tversky & Kahneman (1974)?
2. Какой прирост точности даёт раздельный запрос 10-го и 90-го процентилей вместо одновременного, по цитате Larrick (2004) из Soll & Klayman (2004)?
3. У какой доли участников диалектический бутстрэппинг (Herzog & Hertwig, 2009) реально улучшил точность оценки, а у какой — ухудшил?