[факт] Overprecision — одна из трёх операционализаций «overconfidence», которые литература валила в одно слово; Moore & Healy формально развели их: «(a) overestimation of one's actual performance, (b) overplacement of one's performance relative to others, and (c) excessive precision in one's beliefs» (MH08, с. 502, абстракт). Опрашиваемых обычно просят дать численный ответ («How long is the Nile River?») и 90%-й доверительный интервал вокруг него; классический результат — интервал ловит правильный ответ менее чем в 50% случаев (MH08, с. 502–503, со ссылкой на Alpert & Raiffa 1982, Klayman et al. 1999, Soll & Klayman 2004 — сами эти работы этим заходом не добывались, цитата — по пересказу MH08).
[факт] Прямая первичная демонстрация задолго до MH08 — калибровка у Tversky & Kahneman: «Several investigators have obtained probability distributions for many quantities from a large number of judges. These distributions indicated large and systematic departures from proper calibration. In most studies, the actual values of the assessed quantities are either smaller than X01 or greater than X99 for about 30 percent of the problems» (TK74, с. 1128–1129) — то есть заявленный 98%-интервал в реальности ловит истину примерно в 70% случаев. Оговорка авторов о причине и об устойчивости: «This bias is common to naive and to sophisticated subjects, and it is not eliminated by introducing proper scoring rules, which provide incentives for external calibration» (TK74, с. 1129) — денежный стимул за точность не лечит.
[факт] Экспериментальная проверка Moore & Healy (N=82, студенты Carnegie Mellon, лаборатория, 18 раундов триви-викторин с денежной ставкой по квадратичному правилу подсчёта очков) дала похожий, но не идентичный паттерн: заявленная уверенность в 90%-интервале составила в среднем 90,5%, а фактическое попадание — 73,1% (MH08, с. 509–510: «The actual score fell within this range 73.1% of the time. This 90.5% confidence is significantly greater than the 73.1% accuracy; a binomial test confirmed that the odds of observing accuracy rates of 73.1% or lower for 90.5% confidence intervals are about 6 per million»). Величина промаха зависела от того, что именно человек оценивал: на стадии «до квиза» (prior, когда о своих будущих результатах ничего не известно) попадание было хуже всего — 55,1%, к финалу (после сдачи, posterior) выросло до 84,4% (там же, с. 509–510) — то есть overprecision смягчается по мере роста фактической информированности, но не исчезает.
[факт] Overprecision — не то же самое искажение, что overestimation и overplacement, и ведёт себя иначе: в том же эксперименте overestimation и overplacement по-разному реагировали на трудность задания (hard-easy паттерн, см. ИС-43, ИС-44), а overprecision оказалась «более устойчивой»: «Overprecision appears to be more persistent than either of the other 2 types of overconfidence, but its presence reduces the magnitude of both overestimation and overplacement» (MH08, с. 502, абстракт). Итоговый методологический вывод авторов: «The three different types of overconfidence are conceptually and empirically distinct» (MH08, с. 514, «Conclusions» — по нумерации выжимки Д10; при собственной сверке проектом строка стоит на последней содержательной странице перед списком литературы, с. 513–514 по разметке файла) — смешивать три явления в одном измерении методологически ошибочно.
[гипотеза] Байесовская теория авторов (регрессивность оценок себя и ещё более сильная регрессивность оценок других) объясняет overestimation и overplacement, но прямо признаёт свой предел применительно к overprecision: «As to the question of when we should expect overprecision, our theory has little to say» (MH08, с. 505) — механизм избыточной точности в этой теории не выведен, а взят как эмпирическое наблюдение.
[спорно] Величина эффекта нестабильна: литературный диапазон hit rate для 90%-интервалов — 30–50% (по пересказу MH08 со ссылкой на Teigen & Jorgensen 2005, отдельно не добывался), тогда как в собственном эксперименте MH08 попадание оказалось выше (73,1%) — авторы связывают это с методом измерения и с ростом информированности участников по ходу эксперимента (с. 509–510). Формат подачи и предметная область — модерирующие переменные, не отменяющие эффект.
Каноническая демонстрация: Moore & Healy (2008) — лабораторный эксперимент, N=82, студенты Carnegie Mellon University, репитед-мерный дизайн (18 раундов триви-викторин с денежным вознаграждением по квадратичному правилу подсчёта очков); первичка — txt_Moore_Healy_2008_Overconfidence.txt.
Статус доказательности: 🟡 первичка — две независимые первичные демонстрации на разных выборках и в разные десятилетия (TK74 1974, MH08 2008) дают качественно совпадающий паттерн (заявленная точность выше фактической), но отдельного мета-анализа или прямой репликации именно overprecision (в отличие от anchoring/framing/sunk cost — Many Labs, Д10) этим заходом не найдено — охват: открыты txt_Moore_Healy_2008_Overconfidence.txt, txt_Tversky_Kahneman_1974_JudgmentUnderUncertainty.txt, Р-3/Д10 (Moore & Healy — приёмка «🟡 расщепить»).
Величина эффекта: как измерена — доля случаев, когда истинное значение попало в заявленный доверительный интервал (hit rate), против номинальной уверенности; величина — TK74: заявлено 98%, факт ~70% (miss ≈30%, с. 1128–1129); MH08: заявлено 90,5%, факт 73,1% (с. 509–510, биномиальный тест p ≈ 6·10⁻⁶); на ком — TK74: «naive and sophisticated subjects» (эксперты не защищены); MH08: N=82 студента CMU. Источник — оба выше.
Ось карты — стадия: сбор информации (главная — формирование оценки неопределённости по числовому вопросу); второстепенная — оценка результата (постфактум-переоценка своей точности).
Координата «уровень»: индивид.
Координата «механизм/таксономия»: вероятностное суждение / калибровка; частично — эвристика анкоринга (TK74 прямо связывает узость интервала с недостаточной корректировкой от точечной оценки: «To select X90... it is natural to begin by thinking about one's best estimate... and adjust this value upward. If this adjustment... is insufficient, then X90 will not be sufficiently extreme», с. 1129).
Цена для управленца: типовая ситуация — точечный прогноз без честной вилки (сроки проекта, объём продаж, бюджет) выдаётся и воспринимается как более надёжный, чем он есть; что теряется — решения, рассчитанные на узкий коридор исходов, не готовы к реализации хвостов распределения; кейс — [не найдено в первичке; см. КС-04 Ловушка сверхуверенности Sibony, статус 🟡 по отрывку].
Противоядия: ПР-02 Интервальные оценки и калибровка — 🟢 (🟡 доступ), расширение и смещение центра интервала поднимает попадание с 30–40% до ~60% (Larrick 2004, с. 323); ПР-03 Диалектический бутстрэппинг — 🟢 лаборатория, второе (пусть и своё же, отсроченное) мнение сужает регрессивную ошибку; awareness как самостоятельное противоядие не работает (МФ-01).
Термин: en overprecision · ru нет устоявшегося перевода — «сверхточность» / «избыточная точность оценки» встречается в русских пересказах непоследовательно.
(б) Процедура. Замер, который снижает overprecision в среднем на 20–30 п.п. попадания, — не «уверенность», а процедура: явно спросить 10-й, 50-й и 90-й процентили («сначала нижняя граница, потом верхняя»), не один вопрос-диапазон (Larrick 2004, с. 323, цит. по Soll & Klayman 2004: 30–40% → ~60%; см. ПР-02 Интервальные оценки и калибровка). Граница: замер — лабораторный, перенос на управленческую практику (бюджеты, сроки проектов) отдельно не проверен этим заходом. (в) Среда. Искажение сильнее там, где нет быстрой и однозначной обратной связи о том, попал ли прогноз в интервал (см. критерий Kahneman & Klein 2009 для «валидной среды» — ИС-42, ПР-14); в MH08 попадание росло по мере того, как участники получали информацию о собственном результате внутри одного эксперимента (55,1% → 84,4%, с. 509–510) — то есть локальная, немедленная обратная связь смягчает эффект, разовая оценка вдалеке от исхода — нет. (г) Организация. Кто решает vs кто предлагает: чек-лист ревью решения прямо требует спрашивать не «насколько вы уверены», а «где взяты числа» и не является ли прогноз надёжнее, чем он есть (KLS11, вопрос 10 — «Is the base case overly optimistic?», см. ИС-17 Искажение оптимизма); институционально — обязательная форма подачи прогноза в трёх точках (низко/средне/высоко), а не одним числом — кейсовая практика, не RCT.
первичка проекта2026-09-12
отвечено 0 из 2
1. Что из перечисленного узел называет самой устойчивой из трёх форм overconfidence?
2. Как соотносятся заявленная уверенность и фактическое попадание в эксперименте Moore & Healy (2008)?