← ДашбордКаталог узлов

ПН-07. VVUQ: верификация, валидация и количественная оценка неопределённости

Понятие/различение · статус: dev · проверен: 2026-08-25 · база «DT management — управление по концепции цифровых двойников»
Тезис: VVUQ — зрелая инженерная дисциплина ответа на вопрос «насколько модели можно верить

для этого решения»; она разработана для статичных моделей и на непрерывно обновляемый двойник не переносится — методов непрерывной VVUQ, по заключению Национальных академий США, не существует.

Содержание

Что это за аппарат [факт] (о существовании и составе)

Семейство стандартов ASME «Verification, Validation and Uncertainty Quantification»: V&V 10 (вычислительная механика твёрдого тела, ред. 2019), V&V 20 (CFD и теплопередача — количественная оценка точности из сравнения расчёта с экспериментом), V&V 40 (медизделия — рамка credibility, соразмерной риску), VVUQ 1-2022 (терминология), VVUQ 10.2-2021 (роль UQ). Класс: [независимый отчёт].

Не найдено в сырье: дословных определений «verification», «validation» и «uncertainty quantification» по первоисточнику ASME (стандарты платные, в заходах не добывались). В узле используются операциональные описания из вторичных и смежных источников, а не нормативные формулировки. Реконструировать определения по памяти запрещено дисциплиной проекта.

NASA-STD-7009 «Standard for Models and Simulations» (ред. A/B) — шкала оценки доверия (Credibility Assessment Scale) с восемью факторами: верификация, валидация, происхождение входных данных (input pedigree), неопределённость результатов, устойчивость результатов, история использования, управление M&S, люди. Класс: [независимый отчёт].

Два готовых управленческих примитива [факт] для содержания, [гипотеза] для переноса

(1) Доверие соразмерно риску решения (ASME V&V 40). Не «модель верна», а «модель достаточно верна для этого решения». Механизм: объявляется контекст применения → риск модели = влияние модели на решение × последствия ошибки решения → объём VVUQ пропорционален риску → Credibility Assessment Report. [гипотеза] Для решения «сдвинуть ППР на неделю» и решения «продлить ресурс на 10 лет» нужны разные уровни доверия к одной и той же модели; поле двойников этот принцип почти не использует — прямая управленческая ниша.

(2) Доверие — свойство организации (NASA-STD-7009). Два из восьми факторов шкалы — «история использования» и «люди». То есть зрелая инженерная культура считает доверие к модели свойством организации, а не только математики. [гипотеза] Покупка платформы не создаёт ни истории, ни людей.

Почему аппарат не переносится на двойник [факт] — подтверждено двумя независимыми источниками верхнего уровня

(А) NASEM 2024 (Национальные академии США), [независимый отчёт] — дословно (перевод захода Р-3):

(Б) Sel K., Hawkins-Daarud A., Chaudhuri A., Osman D., Bahai A., Paydarfar D., Willcox K., Chung C., Jafari R. «Survey and perspective on verification, validation, and uncertainty quantification of digital twins for precision medicine». npj Digital Medicine 8:40, 2025. DOI 10.1038/s41746-025-01447-y. [рецензируемое] — дословно:

Сводка разрыва [гипотеза]: классическая V&V валидирует версию модели; двойник по определению меняется. Отсюда три нерешённые задачи: (1) чем считать «валидированным» непрерывно обновляемый объект; (2) как часто и по какому критерию ре-валидировать; (3) кто отвечает за версию, принявшую решение. Управленчески это вопрос о регламенте, а не о софте, и он не закрыт ни одним стандартом.

Три дрейфа, которые в разговоре сливают в один [гипотеза] (различение составителя Р-3)

Тип дрейфа Что уезжает Как обнаруживают
Дрейф объекта объект стареет, ремонтируется, модернизируется сравнение предсказания с измерением; ре-калибровка параметров
Дрейф данных / концепта меняется распределение входов, режимы эксплуатации статистические детекторы дрейфа, мониторинг качества предсказаний
Семантический дрейф меняются смыслы: справочники, состав оборудования, структура модели, онтология почти не автоматизирован — активная исследовательская тема

Семантический дрейф как отдельный класс: «Understanding Semantic Drift in Model Driven Digital Twins», ACM/IEEE MODELS 2024, [рецензируемое] — определение: «рассогласование между цифровым представлением и физической реальностью во времени»; управление им требует поддержки всех уровней (данные, модель, метамодель, онтология). Развитие: «Semantic drift evaluation…», Future Generation Computer Systems, 2025 — метрики только предлагаются, то есть инструмента измерения ещё нет.

[гипотеза] Самый опасный — семантический: он не сигнализирует о себе ошибкой предсказания сразу.

Валидация сверх точности прогноза [факт] (о существовании инструмента)

Vallée A. (2026). «Validating medical digital twins for clinical decision support: beyond predictive accuracy». JAMIA Open 9(4):ooag160. Восемь измерений валидации сверх точности: представление неопределённости; устойчивость при обновлении; робастность при смене режима; валидность в режиме действия; контрфактическая согласованность; ошибка, взвешенная клиническими последствиями; последствия уровня решения; фальсифицируемость. Инструмент — не чек-лист, а «instrument validation statement»: явное объявление эпистемической области («этот двойник валидирован для такой-то популяции, по таким-то режимам»).

[гипотеза] Это ближайший найденный аналог «паспорта двойника» и прямая перекличка с уроком У-2 захода Д-2: паспорт обязан фиксировать режимы, в которых двойник валиден, а не только точность.

Управленческая формула узла [гипотеза]

«Валидированный двойник» — не свойство, а срок годности. Правильный вопрос не «валидирован ли», а «когда валидирован, по каким режимам, и каков регламент ре-валидации».

Место VVUQ в цепочке зрелости (Р-3): «данные → модели → синхронизация → валидация» — зрелость падает слева направо; самое незрелое звено последнее, и именно оно превращает модель в основание для решения. Это структурное объяснение того, почему эффекты двойников не подтверждаются независимо.

Данные

Связан с

Источники

Открытые хвосты

Проверен на дату: 2026-08-25