康复测量属性:信度、效度、测量误差与响应性
区分康复与运动评估中 reliability、validity、measurement error、responsiveness 等测量属性,避免把可重复、准确与能检测变化混为一谈。
[!info] related notes
- 所属 MOC:
- 相关概念:
- 易混淆概念:
- 相关资源:
康复测量属性:信度、效度、测量误差与响应性
范围
一个测试“能给出数字”不代表这个数字适合用于判断个体状态或变化。
评估工具至少要区分几个不同问题:
它测的是我要测的东西吗? → validity
重复测量足够稳定吗? → reliability
数字本身有多大随机/系统误差? → measurement error
真实发生变化时它能检测出来吗? → responsiveness
这些问题不能互相替代。
Validity:测到的是目标构念吗
Validity 关注测量结果是否能够合理代表目标 construct。
例如你真正想知道的是:
physical function
就不能因为某个单项力量测试容易测,就默认它等于整体 physical function。
COSMIN 特别强调,选择 outcome measurement instrument 前要先明确到底想测什么 construct。对于 PROM,content validity 是非常基础的一层:题目是否相关、完整并且可理解。
Reliability:没变化时能否得到相近结果
Reliability 关注在被测对象没有真实变化时,重复测量是否足够稳定。
常见维度包括:
- test-retest;
- intra-rater;
- inter-rater;
- 某些量表中的 internal consistency。
需要注意:
high reliability
≠ no measurement error
≠ high validity
一个方法完全可能“每次都很稳定地测错”。
Measurement Error:变化可能只是噪声吗
Measurement error 是不能归因于 construct 真实变化的系统误差和随机误差。
实际追踪时最重要的问题之一是:
本次 5° / 5 N / 5 分的变化
到底是真实变化
还是测量波动?
因此 longitudinal monitoring 不应该只保存当前值,还应该尽量知道该工具和协议对应的误差范围。
常见统计概念包括:
- SEM:Standard Error of Measurement;
- MDC / SDC:Minimal / Smallest Detectable Change;
- Limits of Agreement。
它们和“最小有意义变化”不是同一个概念。
Responsiveness:真实变化时能不能看出来
Responsiveness 关注一个 instrument 对随时间发生的目标构念变化是否敏感。
所以一个适合 baseline classification 的测试,不一定适合 outcome tracking。
例如:
测试可以区分 A 与 B 两类人
不等于:
测试可以可靠检测同一个人 4 周后的微小变化
Relative Reliability 与 Absolute Reliability
相对可靠性关注个体在群体中的排序或区分是否稳定,常见指标如 ICC。
绝对可靠性更关注数字误差本身,例如 SEM、MDC/SDC。
对于 BodySense 的个体 longitudinal tracking,后者尤其重要,因为系统最终需要判断:
这个用户真的变化了吗?
而不仅是:
这个工具在群体研究中 ICC 很高吗?
Measurement Property 是协议相关的
不能把可靠性写成某个工具永恒不变的属性。
结果往往会受到:
- body region;
- tested movement;
- population;
- examiner;
- positioning;
- stabilization;
- instrument;
- repeated-trial aggregation;
- measurement interval
影响。
因此知识库更合理的表达是:
instrument + protocol + population + outcome
→ measurement property evidence
而不是:
“goniometer 很可靠”
对 BodySense 的数据契约含义
未来 assessment evidence 可以保留:
assessment_id: ...
construct: hip_internal_rotation_rom
instrument: universal_goniometer
protocol_version: ...
value: 32
direction: degree
rater_type: self | clinician | computer_vision
measurement_context: ...
而测量属性证据属于外部知识:
reliability:
population: ...
protocol: ...
estimate: ...
measurement_error: ...
responsiveness: ...
source_id: ...
不要把群体层面的 reliability 自动变成当前用户 observation 的 certainty。