统计指导报告诊断测试 的研究结果:行业与FDA工作人员指南
Statistical Guidance on Reporting Results from Studies Evaluating Diagnostic Tests - Guidance for Industry and FDA Staff
发布日期:2007-03-12
状态:Final(最终) 类型:Guidance Document 类别:临床 / 真实世界证据 主题:Biostatistics 案卷号:FDA-2020-D-0957
官方来源
https://www.fda.gov/regulatory-information/search-fda-guidance-documents/statistical-guidance-reporting-results-studies-evaluating-diagnostic-tests-guidance-industry-and-fda PDF:https://www.fda.gov/media/71147/download
INFO
本内容由英文原文机器辅助翻译,并经结构校对。如有歧义,以英文官方文本为准。
官方文件全文
本指南代表FDA目前对该主题的观点。它不为任何人确立任何权利,对FDA或公众亦不具约束力。若替代方法满足适用要求,可采用该替代方法。FDA指南中“应当”表示建议。
2. 范围
本指南适用于评价诊断试验性能的研究之结果报告,包括体外诊断及其他诊断器械研究。重点在于如何正确报告与参考标准或非参考标准比较的结果,以及应避免的统计不当做法。它补充但不取代特定产品的临床/分析性能指南。
3. 简介
诊断试验评价的核心是估计试验区分目标疾病/状态有无的能力。当存在可接受的参考标准时,通常报告敏感性与特异性(及置信区间)。当仅能与另一非参考标准试验比较时,应报告一致性度量,且不应将一致性称为敏感性/特异性。不确定(equivocal)结果、差异解决(discrepant resolution)以及不完整验证是常见偏倚来源,必须透明处理。
4. 基准与研究人群
4.1 与基准的比较
- 若可获得参考标准: 用其估计敏感性与特异性,并报告完整交叉表与置信区间。
- 若参考标准可获得但不切实可行: 尽可能对受试者子集使用参考标准,并说明验证偏倚及校正方法(若有)。
- 若参考标准不可获得或不可接受: 考虑构建复合参考标准、专家组或其他经论证的方法;明确假设。
- 若无法获得且无法构建参考标准: 与非参考标准比较时报告阳性/阴性一致性百分比等,避免误用敏感性/特异性术语。
4.2 选择研究人群
描述人群来源、入选/排除、采样方式(前瞻连续、回顾、病例—对照、富集)以及患病率或阳性率。病例—对照或富集设计可能影响预测值与表观准确性,应讨论可概括性。说明盲法:指数试验解读是否对参考标准及其他信息保持回避,反之亦然。
5. 报告建议
报告中应包括:
- 研究目标与指数试验预期用途的对齐;
- 参考标准或比较试验的定义、时机与质量;
- 受试者处置(纳入、排除、缺失、不确定);
- 主要表型结果:二分类情形下的 2×2 表;连续/有序情形下的ROC/AUC;
- 点估计与置信区间及方法说明;
- 不确定结果的预设规则与敏感性分析;
- 预设亚群与多重性策略;
- 局限性与潜在偏倚。
对与非参考标准的比较,报告总体一致性、阳性一致性、阴性一致性,并强调一致性≠正确性,且随患病率变化。
6. 统计上不适当的做法
FDA认为下列做法不适当:
- 用“敏感性”“特异性”描述新试验与非参考标准的比较——在无参考标准时应使用一致性术语。
- 在计算诊断准确性度量时剔除不确定的新试验结果——应报告其频率,并在敏感性分析中显示不同归类的影响。
- 使用经差异解决更改或更新后的结局来计算准确性——对不一致病例追加第三方检测并据此“修正”表格,常导致偏倚与不可解释的列定义。
- 将新试验与包含该新试验本身的检测算法结局进行比较——这种比较没有独立基准,结果易被夸大。
7. 附录
7.1 计算敏感性与特异性的估计
标准 2×2 表:
| 参考标准阳性 | 参考标准阴性 | |
|---|---|---|
| 新试验阳性 | TP | FP |
| 新试验阴性 | FN | TN |
敏感性 = TP/(TP+FN);特异性 = TN/(TN+FP)。应报告置信区间。示例计算应展示分子分母与排除人数。
7.2 计算一致性估计
当比较新试验与非参考标准时,使用一致性表(非参考标准阳性/阴性 × 新试验阳性/阴性)。阳性百分一致性与阴性百分一致性随患病率变化;不能把一致性解释为正确率。三向表(新试验 × 非参考标准 × 参考标准)在可获得参考标准子集时可帮助解释,但仍须谨慎。
7.3 差异解决示例及其问题
差异解决通常对不一致样本追加“解决者”检测,并用解决者结果改写原表。问题包括:修订表的列定义不清;由此计算的敏感性/特异性不正确;表观总体一致性被夸大。指南通过数值示例说明:即使解决者本身不完善,修订做法仍可严重扭曲结果。因此不应将差异解决后的修订表作为主要准确性分析。
8. 实务要点摘要
- 有参考标准:报告敏感性/特异性 + CI + 完整数据处置。
- 无参考标准:报告一致性,勿冒称敏感性/特异性。
- 保留并分析不确定结果。
- 避免差异解决驱动的结局更新作为主要分析。
- 明确患病率对预测值与一致性的影响。
- 在方案中预设截断值与主要分析;数据驱动截断需验证。
脚注
脚注定义“不确定”等术语并引用统计方法文献。实施时应结合现行IVD指南与上市前提交要求。

