临床性能评估:应用于放射影像与放射器械数据的计算机辅助检测器械在上市前通知(510(k))提交中的考量:行业与FDA工作人员指南
Clinical Performance Assessment: Considerations for Computer-Assisted Detection Devices Applied to Radiology Images and Radiology Device Data in Premarket Notification (510(k)) Submissions: Guidance for Industry and FDA Staff
发布日期:2022-09-28
状态:Final(最终) 类型:Guidance Document 类别:数字健康与网络安全 主题:Premarket、510(k)、Digital Health、Radiology、Labeling 案卷号:FDA-2009-D-0503
官方来源
https://www.fda.gov/regulatory-information/search-fda-guidance-documents/clinical-性能-assessment-considerations-computer-assisted-detection-devices-applied-radiology PDF:https://www.fda.gov/media/77642/download
INFO
本内容由英文原文机器辅助翻译,并经结构校对。如有歧义,以英文官方文本为准。
官方文件全文
临床性能评估:用于放射图像和放射器械数据计算机辅助检测器械在上市前通知中的考虑(510(k))
本指南代表了FDA目前对这一专题的想法。它没有规定任何人的任何权利,对FDA或公众没有约束力。您可采取另一种方式,即满足适用的法规和条例的要求。为了讨论另一种办法,请与标题页所列FDA工作人员或负责本指南的办公室联系。
I. 简介
本指南文件向行业、系统和服务提供者、顾问、FDA以及适用于放射图象和放射器械数据(本文件通常称为“放射数据”)的计算机辅助检测(CADE)器械临床性能评估。CADE器械是计算机化系统,包含模式识别和数据分析能力(即结合数值、测量等)。目的是识别、标记、突出或以任何其他方式引起对图像部分的注意,放射器械数据或放射器械数据的某些方面,在被预定用户(即:或)解释病人放射图象或病人放射器械数据时,可能出现异常(即:医生或其他保健专业人员),本文件中称为“临床医生”。我们考虑了在1年期间提出的关于CADE器械的文献记录和性能测试的建议。 使用缩略语CADE进行计算机辅助检测,在整个社会中可能不是公认的缩略语。本文件用于确定本文件所讨论的具体类型的器械。 2008年3月4日至5日、11月2日和11月17日至18日放射器械小组公开会议2009年3月,我们又审议了公众就2009年10月21日联邦登记册公布的指南草案(74 FR 54053)4 提出的意见。FDA发布了一项最后命令,更改用于乳癌乳房X线造影、超声波乳房损伤、放射肺结核、乳房X线照相分析仪的医学图像分析器的类别。5 本指南提供的建议可能有助于遵守21 CFR 892.2070(b)(1)中编纂的并在斜体字体中注明的特别控制措施,以明确指南。 也正在修订本指南,略加更新,以反映最后规则“医疗器械;符合《21世纪铜法》医疗软件规定的医疗器械分类条例”(86 FF 20278.6)。FDA的指南文件没有规定法律上可执行的责任。 相反,FDA目前对一个专题的想法,只应视为建议,除非引述具体的规章或法规要求。在FDA的指导意见中使用这个词意味着建议或建议某种东西,但并不要求。
II. 范围
该文件为用于放射图像和放射器械数据的CADE器械临床性能评估研究以及用于乳癌乳房X线造影检查的CADE器械临床性能评估研究提供指导,例如,辐射数据包括:在病人检查期间产生的超声波、放射、磁共振成像(MRI)、计算断层成像(CT)、正电子发射断层成像(PET)等图像,如上文所述,CADE器械是电脑化系统,旨在识别、标记、突出显示、识别、或以任何其他方式 注意图像的部分,或放射器械数据的各个方面,临床医生在解释病人放射图象或病人放射器械数据时,可能会发现异常。本指南适用于 CADE 器械, 包括当 CADE 器械 本指南文件适用于根据21 CFR 892.2050“医疗图像管理和处理系统”分类的CADE器械和根据21 CFR 892.2070“医疗图像分析器”分类的器械,包括以下产品编码:NWE(光计算断层摄影系统,计算机辅助检测);OEB(液计算断层摄影系统,计算机辅助检测);OMJ(热X射线计算机辅助检测);· MYN(医学图像分析仪)。 FDA打算制定新的产品编码,以便在必要时确定和追踪新型的CADE产品。a CADE器械可是一种独特的检测办法,仅针对一种类型的潜在异常,或多种平行检测办法的组合或捆绑,每项专门设计用于检测病人辐射数据中显示的一种潜在异常。属于本指南范围的CADE器械的例子包括:· CADE算法,目的是在数字乳房X光照片上查明和迅速进行微量计算组群和群集;CADE器械,旨在识别和及时检测CT结肠学研究的结肠质聚苯;CADE器械,旨在识别和及时填补Thoracic CT检查的缺陷;旨在识别和加速磁共振研究中脑损伤的CADE。 为了本指南的目的,我们可能会考虑修改CADE算法,例如,如果对图像处理组件、功能等作了修改,则可以考虑修改CADE算法。分类算法、培训方法、培训数据集或算法参数。关于CADE 510(k)提交材料的资料,见FDA题为 " 用于放射图像和放射器械数据的计算机辅助探测器械 -- -- 预先通知[510(k)]提交材料 " 的指导8。包括何时可以建议进行临床性能评估,以便提交CADE 510(k)报告。 本指南不适用于(1) 用于在手术期间使用的CADE器械的临床性能评估研究,(2) 放射性计算机辅助诊断器械(CADx)(分类为21 CFR 892.2060),(3) 计算机辅助检测/诊断(CADE/x)器械(分类低于21 CFR 892.2090),(4) 计算机辅助购置/优化(CADa/o)器械(在21 CFR 892.2100下分类),(五) 产品编码”,载于第_ 对于其中任何类型的器械,我们建议你与FDA联系,就与监管途径、监管要求有关的问题征求反馈意见。关于非临床和临床数据的建议。
III. 背景
21 CFR 892.2070以下列为医学图像分析仪的器械,须遵守21 CFR 892.2070(b)下的特殊监管,包括要求详细说明事先指定的性能测试方法和数据集,用于评估该器械是否将改进设计核查和验证中预期的读者性能。 9 医学图像分析仪还必须列入性能测试的结果,以表明该器械在按照使用说明使用时会提高读者在预定用途群中的性能。性能评估必须基于适当的诊断准确性措施,测试数据集必须包含重要组群(例如:由临床相关混杂因素、效应修饰因素、伴随疾病、10 下列建议可能有助于证明遵守这些特别管制措施。 建议:以下各节就临床研究的设计、方法、研究人口以及评估CADE系统的报告提出建议。本指南就如何设计和开展临床性能评估研究(即:这些研究可能是你向FDA提交的510(k)份材料的一部分。本文件中的建议旨在指导您开发和测试您的 CADE 器械;11 如果你希望FDA就分类和监管要求提出建议,其中可能包括11个A 510(k)提交文件是本指南所述CADE器械最常见的提交类型。“用于放射图像和放射器械数据的计算机辅助检测器械- 上市前通知 [510(k)]提交书”提供了510(k)提交书中器械说明和独立性能评估的补充资料。 适用于您的器械,您可根据《联邦食品、药品、12 我们建议,在开始对你的CADE器械进行独立的性能评估和临床性能评估研究之前,请FDA审查你们的协议。请FDA审查你们的议定书,可向FDA提交申请前材料。
IV. 临床研究设计
CADE器械的临床性能评估旨在证明你的器械对于预期用途的临床安全性和有效性,预定用户使用时,按照拟议的标签和说明。 如上文在范围(CADE器械)中描述的,设计,目的是查明在临床医生对病人放射图象或数据进行判读时可能显示异常的数据。 CADE产出与临床医生之间有着复杂的关系,因此临床性能可能取决于各种因素,在任何研究设计中都应考虑这些因素,其中包括:解释过程中(例如同时或第二读)CADE应用的时间;· CADE标记的物理特征,即大小和形状、边界类型(例如固体、破折、圆、同位素)以及CADE标记接近异常;用户了解CADE设计用来标记的异常类型;CADE标记的数量。 您的临床性能评估应使用控制良好的研究设计,排除或限制可能影响该器械安全性或有效性结论的各种偏见(见附录)。我们特别建议,在实验室(即,在实验室)进行临床性能评估时,我们特别建议这样做。由于实验室的临床环境难以重复,因此很难在临床非处方复制。用于评估您的 CADE 器械的一些研究设计包括:- 实地测试或可能的读者研究(例如随机控制试验),在实际临床条件下评价一种器械。实地测试在一些情况下可能不切实际,例如,在疾病流行率很低的情况下,可能需要大量病人就诊。 12 《FD&C法》(21 U.S.C.)第513(g)节。360c(g))提供了一种手段,以了解FDA对您器械可能适用的分类和监管要求的看法。 医疗器械提交:Q-Submission Programme” 可在FDA官网获取。
- 一项回顾性读者研究,包括一个经过追溯性收集的病例,并丰富了疾病/异常病例,这是实地测试的一个可能替代。
- 压力测试是对某些CADE器械进行临床性能评估的另一个选择。压力测试是一份读者回顾性研究,其内容为病人病例,其中的成像结果(或其他图像数据)比常规临床实践通常看到的情况更具挑战性,但仍属于该器械预定用途(见A/CN.9/WG.III/WG.III/WP.5号文件)。 第五节. 研究人口)。请注意,由于试验和临床实践在疾病流行率(以及压力测试的病例难度)方面的差异,使用样品浓缩可能会改变试验中的读者性能,而与临床实践相比,这可能会改变其表现。 对CADE器械的临床性能评估通常采用多读者多案例研究设计(MRMC)来进行,在设计时有一组临床阅读者(即:在多读条件或方式下(例如:MRMC的设计可以“完全交错”,所有读者都可以独立阅读所有案例。这一设计为一定数量的案例提供了最大的统计力量,然而,非完全跨过的研究设计可能是可以接受的,例如,在预期的研究中,由多个临床医生对同一病人数据的解释可能不可行。 您是否决定了 全面研究的设计,我们建议使用一个MRMC评价模式,利用上述研究设计之一,评估CADE器械的临床性能。完整的临床研究设计程序应包含在你的提交中。统计分析的预先具体化是取得一致和令人信服的科学证据的关键因素。研究设计说明; 如何收集成象数据的说明(例如成象器械和成象程序模型和模型); 研究设计说明; 成象数据如何收集的说明; 成象数据说明(例如成象器械和成象程序书的制作和模型); 成象技术说明; 成像技术说明; 成象技术说明; 成像技术说明;• 协议副本,包括以下内容:将测试和研究终点的假设、检查验证测试所需的任何假设的计划;o 如果不符合所需的假设,将采用何种替代程序/试验,o 研究成功标准,指出应满足哪些假设,才能使临床研究被视为成功;o 选定读者人数的统计和临床理由;o 图像判读方法和与临床实践的关系、o随机化方法和读者任务,包括所使用的评级表(见第四节D.评级表);· 统计分析计划(即终点、统计方法),其中说明:确定真相的过程(见第六节,参考标准),参考所用评分技术的细节(见第四.E节)。支持拟议设计的一项试点研究的任何结果。 对CADE器械临床性能的有效估计取决于健全的研究设计。研究人口(疾病和正常病例)适当代表预定用途人口或从中抽取;· 研究设计避免混淆CADE效应(例如读取会话效果);· 真实定义适合于评估性能,参考标准中的不确定性在研究分析中正确反映(如果适用);数据集中包含适当的数据组; - 选择读者,使其能代表该器械预期用户群中的临床用户。选择成像硬件,使其符合目前的临床做法。
A. 评价模式和研究
您应该选择研究终点以证明您的 CADE 器械有效( 即相当一部分目标人群, 包括:将器械用于其预定用途和用途条件,并附有适当的使用指示和警告,以防不安全使用,14 选择初级和二级终点将取决于器械预定用途,在开始评估前应加以确定。基于接收器操作特征(ROC)曲线或ROC变式(例如:自由反应接收器操作特征(FRROC)曲线或特定位置的接收器操作特征(LRROC)曲线,除了在临床行动点的敏感性(Se)和特殊性(Sp)之外,还有可能作为终点。以ROC为基础的终点可以对一系列操作点的器械进行评估。ROC曲线是Se对1-Sp的图,是器械或临床医生诊断性能的概要。 FROC 曲线是 Se 的图案, 相对于每个图像集的假正数标记数 。FROC衡量标准总结了分析中每个病人的疾病地点和多重疾病地点的诊断性能。15 报告Se和Sp对,可按临床临界点或截断点对器械进行评估,读者将按此采取行动。其定义是,对于患病/状况/异常的病人群体,测试呈阳性的概率,而Sp则被定义为,对正常病人群体(即:)进行负性的检测的概率。没有疾病/状况/异常症的病人)16。 Se和Sp的估计值应当基于临床读者的明确临床诊断(如召回或不召回),用于生成 ROC 曲线的评级数据不能间接间接地从这些数据中得出。 ROC、Se和Sp的数据收集可以在单一读者研究中同时进行。16 Altman,D.G.,《医学研究实用统计》,Chapman & Hall,伦敦,1991年。
例如,阅读设想方案可以是,首先读者对Se和Sp评价作出临床上合理的二进制反应,然后立即作出与ROC评价所用二进制反应一致的评级反应。 您可以使用各种简要性能衡量标准来评估读者使用您的 CADE 器械的有效性(而根据特定器械和临床指示,这类衡量标准可能有所不同)。这些例子包括:- 曲线下面积、部分面积或其他ROC曲线度量;
- 曲线下面积、部分面积或其他FROC曲线度量;· LROC曲线的面积、部分区域或其他度量; 我们建议使用ROC简要性能衡量标准作为你主要分析的一部分,尽管我们承认,替代性能衡量标准也可能是适当的。如上文所述,我们建议,在使用ROC简要性能衡量标准时,将Se和Sp作为分析的第二端点。报告Se和Sp(或Se和召回率)可提供补充资料,以了解一个器械对临床实践的预期影响。我们还建议,在考虑采用另一种性能衡量标准时,与FDA联系。 研究终点时,根据ROC/FROC/LOC曲线下的区域或ROC/FROC/LOC曲线下的部分区域,我们建议尽可能提供实际曲线图以及参数和非参数分析方法的性能概要信息。请检查在分析中使用的所有方法是否适当适合数据。 选择基于病变、基于病人、作为初级或二级终点的绩效衡量标准取决于该器械的预定用途和预期对临床实践的影响。任何额外的单位分析,如非打算提出具体的性能要求,就没有必要进行具有统计意义的统计意义分析。 我们建议你说明你的统计评价方法,并提供结果,包括:· 相关混淆器或效果修饰器分层性能(例如,损伤类型、损伤大小、损伤位置、扫描程序、成像硬件、17 召回率是指被召回或召回接受额外医疗评估的病人(包括疾病和非疾病病人)的百分比。 我们建议你确定并验证你的分析软件。 19你应参考所使用的分析方法,澄清软件的安装情况,某些经过验证的MRMC分析方法,其实例可在文献中找到或在线获得,20、21 真正的正、假、正、、正、、正、、正、正、正、、、、假的CADE标记应与该器械的预定用途和参考标准定性一致(见第六节,参考标准)。
B. 控制武器
我们建议您评估您的 CADE 器械相对于控制模式的临床性能。 使用常规临床解释( 即: ) 的研究控制器( ) 。没有CADE器械的读者口译)通常应是CADE性能评估中最相关的参照。对于作为第二读者的CADE器械,另一种可能的控制措施是两名临床医生双读。这些控制措施或与上游CADE器械的直接比较一般应适合于确定实质性等同。 我们建议,在进行临床研究之前,与FDA联系,讨论你对控制武器的选择。 研究控制手臂应使用与器械手臂相同的阅读方法,并与临床实践保持一致。如果不是同一案件本身,案件数量相同,那么所有研究机构都应有相同的案件数量,以尽量减少潜在的偏差。我们建议你提供一份描述和流程图,说明你如何随机安排病人和读者进入不同领域。 20 关于MRMC文献参考资料,例如,见:Metz, C.E.,基本ROC分析,《医学成像手册》,第一卷,《物理和心理物理学》,SPIE出版社,2000年。第15章,751-769。 Wagner,R.F.,Metz,C.E.和Campbell,G.,《医疗成像系统和计算机辅助器具的评估:辅导性审查》,Acad. Radiol.,2007年。14(6):723-48。 以及Obuchowski、N.A.、Beiden、S.V.、Berbaum、K.S.、Hillis、S.L.、Ishwaran、H.、Song、H.H.和Wagner、R.F.、多读者、多案例ROC分析:对五种方法的经验比较:Radiol,2004年,11(9);980-995.0** 21 关于在线获取软件,用以分析基于验证技术的MRMC数据,例如,见:LABMRMC软件和一般ROC软件,芝加哥大学:=0 (用于准连续数据或绝对数据);爱荷华大学MRMC软件:*0+%(用于绝对数据);或 OBUMRM 软件:%1+%
C. 阅读情景和随机化
临床评价中的阅读情景应与该器械的预期用途相一致。以下是阅读假想的例子,这些假想可能是CADE临床评价的一部分。
- 第二读取器仅使用器械(顺序设计): O 读者在没有 CADE 器械的情况下按常规阅读(即仅读取器);o 由读者在进行常规解释后立即展示CADE输出的第二读(这一读物可在与所谓的“顺序”读取办法中的传统读物相同的阅读环节内进行)。
- 同时读取器械(交叉设计): O 由读者在没有 CADE 器械的情况下(即仅读取器) 进行常规读取;o 在口译过程中,读者可以同时读取或同时读取CADE产出的读者在任何时间都可以在口译过程中读取(该读取将在与传统读取分开的单独读取中进行)。 您应该随机区分读者、案例和阅读情景,以减少绩效衡量中的偏差。我们建议你描述你的随机方法,并提供相关的流程图。随机处理的一种办法是利用拉丁方块原则,作为读者研究区块设计的一部分。 23 在多次阅读时,同一案例被多次阅读的情况下,我们建议你将每次阅读课的时间至少分开四周,以避免记忆偏差,但较长的时间间隔可能是可取的。对于阅读届会之间的较短或更长的时间间隔,我们建议你提供数据,说明你所提议的时间间隔。
D. 评分比例
您应使用常规医疗解释和报告方法,进行损伤地点、程度和病人管理。评估模式和研究终点可支持采用更精确的评级(例如,a 7点或100点比例),读者对病人的损伤和/或疾病状况进行评分。我们建议向读者提供使用评分表的培训(见第四节F. 研究学员培训)。 22 Obuchowski N.A., Meziane M., Dachman A.H., Lieber M.L., Mazzone P.J., 纽约。测量计算机辅助检测(CAD)对观察者性能的影响的研究控制是什么? 7. 23 Bailey,R.A.,《比较实验的设计》,剑桥大学出版社,2008年。
E. 区标
我们把确定读者解释与实地真相(如疾病状况)之间的对应关系的程序称为评分程序。评分过程和评分定义是CADE器械临床评估的重要组成部分,你应该描述一下。我们建议你描述这一过程(即理由、定义、定义、确定读者的解释是否符合真相进程期间确定的真相地位的标准(见第六节)。真相进程信息参考标准)。 在此指南中,我们用临床性能评估来描述评分。24 临床研究的评分过程应与CADE所标明的异常和打算使用的器械相一致。您应在评估前描述和修补评分过程。在你对评分过程的说明中,我们建议你说明评分是否基于: 电子或非电子手段;· 参考标准边界、区域或读者标记的体积与边界、区域或参考标准体积发生实际重叠;· 读者标记的中间体与参考标准的边界或空间位置之间的关系;· 参考标准与读者标记的边界或空间位置的中间体关系;审查读者的口译;或 对于仰赖阅读者解释的评分, 我们建议您提供参与的读者数量, 以及他们的资历,他们的经验和专长水平,在参加评分过程之前向他们转达的具体指示,以及作为评分过程一部分使用的任何具体标准。当多个读者参与评分时,您应描述您综合解释以作出总体评分评定的过程,或您如何将其解释纳入绩效考评,包括您如何解决任何不一致之处。
F. 临床读者培训
我们建议您在CADE器械使用研究方面,以及如何参与临床研究的细节方面,为临床读者提供具体指导和培训。 培训应包括说明器械和如何使用器械的说明。 关于专门阅读指令或规则(例如,在审查CADE标记时更改初始非CADE解释的规则),我们建议您根据阅读任务、临床工作流程和医疗实践来说明临床相关性。 我们还建议你向读者提供关于使用评级表的培训(见第四节D节)。特别是如果临床实践没有普遍采用这种评级尺度,这种培训有助于避免不正确或不解释的结果。我们建议,读者培训应包括根据研究设计方法,对正常和异常情况进行有代表性的评分,并利用不属于测试数据库范围的案件。
V. 研究人口
您可依据明确定义的包容和排斥标准,预先或追溯地收集患者数据(即病例)。我们建议你为案件收集提供协议书请注意,为临床试验收集的病例应独立于器械开发过程中使用的案例。获取数据的一个可接受的方法是,从每个参与收集的收集地点收集在列入和排除标准之外连续的案件。 允许以疾病/异常情况进行浓缩,以建立高效和负担较少的具有代表性的成套案件数据。浓缩可能会影响阅片者的表现,因此,浓缩的程度应当与研究设计中引入的偏差加以权衡。您也可以让研究对象群体更丰富一些病人病例,这些病例含有对临床医生具有挑战性的图像结果(或其他图像数据),但仍属于该器械预定用途人群。这种浓缩常常被称为压力测试,并将在研究设计中引入偏见。因此,并非所有发展压力人口的方法都适合用于你的临床评估。a 研究中富含含有小息肉的病例的人口,在评估一般CADE器械时,可能适当,该器械旨在协助探测各种息肉大小。然而,我们不建议对基于CADE器械的性能的案件进行浓缩。 您应当从器械预定用途群中抽取研究对象,以便案件集包含适当的疾病/异常和正常病例。在使用压力测试时,对预定用途人群进行选择性抽样调查是适当的。研究的抽样规模应该足够大,使研究有足够的权力,能够以具有统计意义的方式发现你拟议的性能声称。在适当情况下,研究应包括重要组群(例如临床相关混淆者界定的子集、影响改变者、改变者因此,可以对这些个别子集进行临床性能估计和信任间隔。不必为统计意义向每个组群授权,除非你们正在提出具体的子集性能要求。当您提出多重性能声称时,需要事先对测试多个子集进行统计调整。 在描述你的研究人群时,我们建议你酌情提供具体信息,包括:病人人口数据(例如年龄、族裔、种族、性别); 与CADE应用有关的病人病史;病人疾病状况和放射性试验的症状; 放射试验的条件(例如技术、技术等); 病人疾病状况和放射性试验的迹象; 放射试验的条件(例如技术、技术等)。包括检查是否与/没有对比、对比型和每个病人的剂量、病人身体质量指数、辐射照射、MRI图像的T加权,描述如何收集成像数据(例如成像器械的制作和模型以及成像程序); 收集地点; 收集;处理站点(如病人数据数字化); 案件数量:o 疾病病例数、正常病例数、用以确定疾病状况、地点和范围的方法(见第六节)。 参考标准; · 由有关混杂因素或效应修饰因素分层的病例分布,如损伤类型(例如超塑性对腺息肉),体积、损伤位置、疾病阶段、器官特征(如乳房组成)、伴随疾病、成像硬件(如制造和模型),成像或扫描程序、收集场地和处理场地(如果适用);比较病人数据的临床、成像和病理特征与目标人口。
A. 数据可集中易用性
仅根据外国临床数据并以其他方式符合批准标准为依据的上市前批准申请,可以获得批准,如果除其他要求外,外国数据适用于美国人口和美国。25你应说明为什么非美国的数据反映了对美国的期望。人口在疾病发生、特征、医疗实践和临床能力方面的情况。根据良好的临床研究设计,您应当从统计和临床两方面证明多个网站的数据可集中。我们建议510(k)份提交在外国数据和数据可解读性方面遵循类似的质量数据做法。如果您打算以外国临床数据作为上市前提交资料的依据,请与FDA联系。
B. 测试数据重新使用
FDA认识到难以获得用于CADE评估的数据。FDA还认识到,如果同一个测试组多次使用,读者和CADE算法可能隐含或明确调整到测试数据上。如果在两次测试之间没有进行算法培训(例如,如果申办者正在调查一种新的即时类型的影响),如果你们希望FDA考虑重新使用任何测试数据,您应控制您的工作人员获取测试子群和个别病例的性能结果。因此,你也许有必要设立“防火墙”,以确保管理评估小组以外的人员(例如:除了适当的简要性能结果之外,其他任何东西都完全与放射图象和辐射数据知识隔绝。您应在产品整个生命周期内保持测试数据的完整性。这类似于临床试验数据监测委员会的数据完整性,以及使用“防火墙”使负责提议临时议定书更改的人员无法了解临时比较结果。关于临床试验数据监测委员会数据完整性的更多信息,参见FDA题为“建立和运行临床试验申办者临床试验数据监测委员会”的指导意见第4.4.1.4节。 尽量减少调试数据和维持数据完整性的风险,我们建议,在考虑重新使用任何测试数据时,应开发审计线索,并实施下列控制措施:· 随机从一个随着时间增长的较大数据库中选择数据;使用过时图像获取协议或器械获得的数据不再符合现行做法,· 对用于评估的案件数量设定一个小的固定限制;· 维持“防火墙”,以便严格控制数据存取,确保监管评估小组以外的任何人,特别是任何与算法开发有关的人,都可以查阅数据(即只有简要性能结果在评估小组之外报告);· 维持数据存取记录,以追踪每次存取数据的情况,包括记录谁存取数据、测试条件和简要性能结果;在每个新的临床读者研究中使用新的读者。 审计线索的目的包括:(1) 规定你在培训和测试组中适当界定了案例,使培训组和测试组之间没有发生数据泄漏;(2) 确保事先(即在对测试集应用之前)确定新的CADE算法;和(3) 提供资料,说明您在多大程度上使用同一测试组或其子集来测试其他CADE算法或设计,包括向FDA报告的结果以及未报告的结果。我们建议的控制措施是26A 可在https://www.fda.gov/regulatory-information/search-fda-guidance-documents/requests-feedback-and-meetings-medical-device-submissions-q-submission-program查阅 使用先前的 CADE 算法所使用的相同的测试数据集,在后续研究中评估新的 CADE 算法的机会大大降低。 如果您重新使用测试数据,除了总体性能外,还应报告相关子集的测试性能。这些子集包括:(1) 为新的CADE算法设定的与以前使用的测试组重叠的测试组部分;(2) 测试组中以前从未使用过的部分。由于与新的CADE算法的总体测试方法相比,这些子集的规模较小,因此子集的置信间隔将更大。 但是,平均性能的趋势有助于说明您是否已将CADE系统调整到测试集中以前使用的部分。
VI. 参考标准标准
为本指南的目的,病人数据的参考标准(在成像界中也常常称为“黄金标准”或“地面真相”)表明疾病/状况/异常是否存在,可能包括疾病/状况/异常的程度或地点等属性。我们把病人参考标准(如疾病状况)定性为真相进程。 我们建议你提供真相进程的理由,并说明其是否基于: · 另一个器械的产出;既定的临床诊断(如生物检查、特定实验室检测); 后续临床成像检查; 后续医学检查,但不包括成像; 后续医学检查;由审查临床医生(即临床真人)解释。 我们还建议你描述用来确定这一参考标准的方法(例如,基于病理学或基于护理确定标准)。对于依赖审查临床医生解释的真相,我们建议你提供: 参与的临床真相者人数; 其资格;· 在参与真相进程之前向他们传达的指示;临床真相研究者在确定疾病/状况/异常情况时以及在标明疾病/状况/异常情况的地点和程度时所使用的病人的所有现有临床信息;· 作为真相进程一部分使用的任何具体标准。 当涉及多个临床真相者时您应描述您综合解释以作出总体参考标准确定的过程,以及您的程序如何解释参与真相进程临床医生之间的不一致(真实变异)(见第四节A节)。评估范例和研究终点)。请注意,参与真相进程的临床医生不应与参与CADE器械核心临床性能评估的临床医生相同。
VII. 汇报
性能结果报告可遵循FDA题为“关于评价诊断测试研究报告结果的统计指导”的指导。 27 我们建议以电子方式提交您研究中任何统计分析中使用的数据,其中包括:病人信息、疾病或正常状况、伴随疾病、损伤大小、损伤类型、损伤地点、疾病阶段、器官特征、器官特征、· 成像硬件、成像或扫描程序、成像和数据特性(例如:与使用扫描胶卷的CADE数字化结构差异有关的特征,以及统计分析。 关于以电子方式提交数据的更多资料,请参看FDA关于 " 上市前提交文件的临床数据 " 的网站。
A. 反回顾读者研究中的潜在潜在偏见来源
尽管它们具有实际价值,为评价CADE器械设计读者回顾研究,可得出CADE性能估计数,这种估计取决于一个或多个潜在的统计偏差来源。统计偏差是一种趋势,即一项研究的绩效估计与预期用途人口的真实性能不相符。许多统计偏差的来源往往可以通过良好的研究设计来减少或至少减轻。读者研究中某些潜在的偏见来源包括但不限于:抽样的受试者(或读者)不代表目标人口。 偏倚谱:所研究的学科(或读者)样本不包括目标人口的全部范围。
- 低度参考(金)标准偏倚:参考程序在根据是否存在或没有感兴趣的条件(例如乳腺癌、结肠中的息肉)对对象进行分类时,并非100%准确。
- 核实的预言:对诊断性能的统计分析仅基于根据参考标准核实是否存在或不存在感兴趣条件的问题。
- 阅读命令比阿斯:在比较两个或两个以上的测试时,读者的解释会受到他或她对竞争测试结果的记忆的影响。
- 假设:当异常状况的抽样流行率与目标人群的流行率大不相同时,读者的解释可能会受到影响,导致对他/她的诊断准确性有偏差的估计。 当选定供研究的受试者(案例)不能代表预期用途人口时,就会引入选择偏见。对现有图像进行反向选择对象可引入选择偏差,随机抽样或连续抽样可消除或减少选择偏差。被选中参加研究的读者也可能出现选择偏见。 少数具有类似培训或临床经验的读者(例如:使用 CADE 器械时, 无法向全部读者普及。 视距偏差是一种特殊的选择偏差形式,在这种选择偏差中,研究受试者代表了预期用途人群中各受试者的不完整特征(即:研究中缺少重要的分组)。 丰富CADE研究,研究的受试者难以诊断(即压力测试),可能会偏向CADE效应。例如,如果CADE对这些困难案例最有帮助,那么CADE效应可以通过对照预定用途人口进行压力测试而得到加强。 不过,鼓励压力测试,因为它为评估重要分组的CADE提供了价值,并导致研究设计,在适当应用时,抽样规模较小。 丰富CADE研究, 研究对象有异常情况, 得出有偏差的CADE正值和负预测值估计值, 因为这取决于异常情况的普遍程度。预测值的“经更正”估计必须依靠研究外的流行程度估计。流行率的提高也可能间接导致对塞、以及Sp, 如果读者被“忽略”到 研究的流行程度 并改变他们的阅读行为, 从而造成背景偏见。 对图像集的反向读取也可能给 CADE 性能带来偏差。基本的关切是阅读行为可能与实际临床实践相比有所改变,因为读者知道他们正在参加一项研究,而病人管理不会受到诊断读数的影响。 确定存在或不存在利害关系条件的真相,可能有几个偏见来源。使用参考标准来确定实地真相。不完美的参考标准偏差是指参考标准错误地将某些受试者归类为具有或不具备该条件。如果被诊断为对初步评估异常情况不利的对象没有采取后续行动,确认其确实没有病症,那么,地面真相的确定就不完整。 核查的偏见是指某些问题缺乏实地真相。如果在统计分析中只包括确定事实事实的主体,那么CADE性能估计可能存在偏差。 读者回顾研究的研究设计可产生潜在的统计偏差来源。 例如,在按顺序排列的阅读设计中,读者被指示先按顺序顺序阅读,而后由CADE作为第二位读者提供协助,而CADE则没有帮助。比较是在未加辅助阅读与未加辅助阅读和加加辅助阅读之间。顺序阅读设计具有吸引力,因为两种模式的接近读数会尽量减少阅读器内部的变异性。如果器械使用标志(IFU)中的阅读条件与读者研究中不同的,可能令人担心的是,CADE对读者诊断性能的影响可能会因为读者阅读每一案例的时间增加而令人困惑。另一个关切是,读者可能会低估与CADE所帮助的阅读有关的无助阅读,从而产生增强的CADE效果。如果这种关切是真实的,那么缓解措施可能是随机地将部分案件分解,仅以最初的无辅助阅读模式阅读。仅在初始未辅助读取后才会显示随机化 。每个读者应分别选择案件,以确保一些读者对所有案件进行CADE辅助阅读。 相继阅读设计的一个替代办法是交叉设计。在CADE产出的帮助下,在两次独立的阅读会中,将案例在没有帮助的情况下阅读,并分出一个冲洗期,以抹去读者对图像的记忆。半数案件被随机分配给A组,另一半分配给B组。 在阅读会话1中,A组案件在没有帮助的情况下阅读,B组案件由CADE协助阅读。在阅读第二场课时,案件“交错”到另一种方式(A组的辅助阅读,B组的无辅助阅读)。与这两种方式相比,特定阅读会对某些阅读会取消读数产生的任何影响。然而,与顺序阅读设计相比,两期阅读会有助于对CADE效应的估计产生更多的变化。交叉式设计可能特别适合同时阅读。也可以将其普遍化,用于评价两个以上模式(例如,如果CADE除无助读物外,还有两个或两个以上模式本身)。
B. 附加参考资料
Gallas, B.D., Chen W., Cole E., Ochs R., Petrick N., Pisano E. D., Sahiner B., Samuelson F.W., Myers K.J.,《流行率的影响和实验室诊断成像研究中的病例分布》,《医学成像杂志》,2019年。 6(1):015501。
博叙伊、P.M.、Reitsma、J.B.、Bruns、D.E.、Gatsonis、C.A.、Glassziou、P.P.、Irwig、L.、L.、Lijmer J.G., Moher, D., Rennie, D., de Vet, H.C., Kressel, H.Y., Rifai, N., Golub, R.M., Altman, D.G., Hooft, L., Korevaar, D.A., Cohen, J.F., StARD Group, StARD 2015:《报告诊断准确性研究基本物品最新清单》,放射科,2015年。 277(3):826-832。
Obuchowski、N.A.、Gallas、B.D.、Hillis、S.L.、多阅读者ROC Spllip-plot研究 《设计:统计方法比较》,Acad Radell,2012年,19(12):1508-1517。
奥布丘夫斯基、纳奥布丘夫斯基、纳奥布丘夫斯基、梅齐安、马兹安、达赫曼、阿赫曼、利伯、姆卢尔、马兹赞、P.J、 《测量计算机辅助检测对观察者性能的影响的研究中的控制控制?
Pepe M.S.,对用于分类和预测的医学测试进行统计评价,牛津 大学出版社,2003年,24(16)。
彼得里克、N.、Sahiner、B.、Armato、S.G. 3、Bert、A不愿、Correale、L不愿、Delsanto、S不愿、Freedman, M.T., Fryd, D., Gur, D., Hadjiiski, L., Huo不愿, Z., Jiang, Y., Morra, L., Paquerault, S., Raykar, V., Samuelson, F., Summers, R.M., Tourassi, G., Yoshida, H., Zheng, B., Zhou, C., C., M. T., Fryd, D., G., YoshiChan, H.P.,《计算机辅助检测和诊断系统评估》,医疗物理,2013年,第40(8)页。
Zhou, X., Obuchowski, N.A., McClish, D.K., 《诊断医学统计方法》, 第二版,威利,2011年
脚注
[^2]: 可在以下网址查阅: https://www.fda.gov/AdvisoryCommittees/CommitteesMeetingMaterials/MedicalDevicesAdvisoryCommittee/RadiologyDevicesPanel/ucm124890.htm
[^4]: 见 74 FR 54053。
[^5]: 见“辐射器械;医学图像分析器重新分类(85 FR 3545),载于 + 图像分析器。
[^6]: 见 86 FR 20278。器械是综合系统的一部分,例如计算机辅助综合检测和诊断器械的探测部分。
[^7]: 关于产品编码的更多信息,请参考FDA题为 " 医疗器械分类 " 的指南。
[^8]: 可在以下网站查阅:[参见原文链接] 检测器械-应用放射学-图像-和辐射学-数据-预售市场。放射性计算机辅助处理和通知器械(CADt)(分类于21 CFR 892.2080),无论作为独不愿使用的器械出售,还是与CADE器械捆绑在一起,该指南也不适用于许多也列在21 CFR 892.2050下的许多非CADE器械,例如,产品编码LLZ(系统、图像处理、辐射)和NFJ(系统、图像管理、眼科)。因此,大多数基本的放射性图像处理和图像获取产品不属于本指南文件的范围。
[^9]: 21 CFR 892.2070(b)(1)(二)。
[^10]: 21 CFR 892.2070(b)(1)(三)。
[^13]: 欲了解更多关于Pre-Sub工作的详情,请见FDA题为 " 要求提供反馈和召开会议以征求反馈 " 的指南。
[^14]: 见21 CFR 860/7(e)。
[^15]: 关于这些评估模式的更多详情,见Wagner、R.F.、Metz、C.E.和Campb不愿、G.《医疗成像系统和计算机辅助器具的评估:辅导性审查》。2007年,《Acad. Radiol》,14(6):723-48。
[^18]: 欲了解关于仅依赖一种ROC分析的潜在限制的更多信息,见Gur、D.、Bandos、A.I.不愿再谈,以及Rockete, H.E., H., H.,比较收受者业务特征曲线下的地区:“最后”实验测量操作点的潜在影响。 放射学,2008年。 247(1):12-15。0 (见第五节)。研究人口))(赋予每个组群具有统计意义的权力是没有必要的,除非你正在提出具体的子项目性能申报);· 信任期(CIs),其中考虑到读者的变异性、情况变异性、真相变异性或酌情考虑其他变异性来源。
[^19]: 有关MRMC分析软件的更多信息,见Obuchowski、N.A.、Beiden、S.V.不愿、Berbaum、K.S.、Hillis、S.L.、Ishwaran、H.、Song、H.H.和Wagner、R.F.,等等。多读者,多案例ROC分析:对五种方法的经验比较。Acad. Radiol.,2004年。 11(9);980-995。
[^24]: 可在以下网站查阅:[参见原文链接] 检测器械-应用放射学-图像-和辐射学-数据-预售市场。
[^25]: 21 CFR 814.15. 读者对上一份研究报告的结果一无所知,可解决对使用同一测试数据集的关切。如果CADE算法培训发生在测试之间 或者这是一个新的 CADE算法FDA鼓励利用新获得的独立测试案例(即:如果在评价您的 CADE 器械时考虑数据再利用,您应证明,重新使用测试数据的任何部分不会给CADE性能估计带来不合理的偏差,测试数据的完整性得到维护。
[^27]: 报告结果研究 - 评估 - 诊断 - 诊断 - 测试 - 指导 - 工业 - 信息。
[^28]: 可在 @[参见原文脚注]_

