Skip to content

医疗器械临床试验中使用 (PDF版) 的拜塞统计指南 ​

Guidance for the Use of Bayesian Statistics in Medical Device Clinical Trials (PDF Version)

发布日期:2010-02-05

状态:Final(最终) 类型:Guidance Document 类别:上市前 受试者:Premarket 案卷号:FDA-2006-D-0410

INFO

本内容由英文原文机器辅助翻译,并经结构校对。如有歧义,以英文官方文本为准。


官方文件全文 ​

FDA的指导性文件,包括本指南性文件,没有规定法律上可执行的责任。相反,FDA目前对一个专题的想法,只应视为建议,除非引述具体的规章或法规要求。在FDA的指导意见中使用这个词意味着建议或建议某种东西,但并不要求。

  1. 前言2.1 贝叶斯统计是什么? 贝叶斯统计是在积累过程中从证据中学习的一种方法。在临床试验中,传统的(经常)统计方法只能在设计阶段使用以前研究的信息。然后,在数据分析阶段,这些研究所提供的信息被视为正式分析的补充,但并非正式分析的一部分。相反,贝叶斯方法则利用拜斯理论正式将先前的信息与关于一定数量的利息的当前信息结合起来。Bayesian的构想是考虑先前的资料和试验结果,作为持续数据流的一部分,每次获得新的数据时,都更新了推论。

在整个文件中,我们将使用“优先分配”、“可能性”等术语,或简单地“前”是指这些贝叶斯计算中使用的数学实体(概率分布)。“原始信息”一词是指可用于构建先前分发的所有信息。

2.2 医疗器械为何使用贝叶斯统计? 事先掌握有关器械临床使用情况的可靠信息时,贝叶斯方法可能使这一信息能够纳入对试验的统计分析。在某些情况下,器械的事先资料可能是进行较小或较短期限的枢纽试验的理由。

医疗器械由于其行动和进化发展机制,往往事先掌握良好信息。医疗器械的动作机制通常是物理的,因此,器械效果通常是局部的,而不是系统性的。当器械的修改小时,根据先前关于器械前几代人的资料,局部效应有时可以(参照)。从海外对该器械的研究中也可获得良好的事先信息。在随机控制的试验中,可从历史控制数据获得关于控制情况的事先资料。

我们的经验是,如果先前的信息是基于临床试验数据等经验证据,例如临床试验数据,那么贝叶斯方法通常争议较少。然而,如果先前的信息主要基于个人意见(通常从“专家”的引证中得出),贝叶斯方法可能会引起争议。

在缺乏事先资料的情况下,贝叶斯办法也经常有用。临时分析、改变样本规模或改变随机化计划),甚至一些计划外但必要的试验修改。其次,在频率学派分析难以执行或不存在时,贝叶斯方法可用于分析复杂的模式。其他潜在用途包括调整缺失的数据、敏感性分析、多重比较和最佳决策(贝叶斯决定理论)。 采用 " 贝叶斯办法 " ,如果采用得当,可能比频率学派办法更麻烦。 1 《联邦食品、药品、《化妆品法》和《化妆品法》规定,FDA应考虑采用最简便的适当手段,评价具有合理可能获得批准的器械的有效性(见《美国法典》第21卷,第21卷)。 360c(a)(3)。 2.3 为什么现在使用贝叶斯方法更为普遍? 贝叶斯分析往往在计算上十分密集。然而,最近在计算算法和计算速度方面的突破使得能够对非常复杂和现实的贝叶斯模式进行计算。这些进展使贝叶斯方法的普及程度大大提高(参看Malakoff,1999年)。一种基本的计算工具是称为Markov链条蒙特卡洛(MCMC)取样的方法,一种从随机数量分布中模拟的方法。 2.4 FDA何时应参与规划贝叶斯分析? 任何临床试验 我们建议你安排会议 讨论实验设计和模型对于贝叶斯设计 我们建议你在研究开始前 与FDA讨论你之前的信息如果需要研究用器械豁免(IDE),我们建议您在提交IDE之前与FDA会面。 2.5 贝叶斯方法不能取代健全的科学。 无论采用贝叶斯语还是频率学派语,科学健全的临床试验规划和严格的试验行为都很重要。 我们建议你对随机化、同时控制、 未来规划、盲目、偏见、准确性 保持警惕1 在器械试验中成功使用贝叶斯方法的两个例子是:阿尔斯特坎().先前的资料用于纳入以往研究的结果,从而缩小了样本规模,以证明有效性。 INTERFIX (#见 FDA 官网) 。 进行了一项临时分析;根据贝叶斯(参照)未来成功率的模型,试验提前停止,没有使用先前的资料。 见第4.1节:贝叶斯试验从健全的临床试验设计开始。 2.6 使用贝叶斯方法的潜在好处是什么? 2.6.1 更多的决策信息 本次试验的信息得到扩充,通过将先前的信息纳入贝叶斯分析,精确度可能提高。 贝叶斯分析带来了额外的、相关的、事先的资料,有助于FDA作出决定。 2.6.2 利用事先资料减少样本规模 在某些情况下,使用事先资料可能减轻更大规模试验的需要。 然而,纳入先前资料的贝叶斯分析可能不证明有理由减少目前试验的抽样规模。关于贝叶斯临床试验样本规模问题的进一步讨论,见第4.7节。 此外,如果先前的资料与试验结果不一致,然后,贝叶斯分析实际上可能相对于没有纳入先前资料的频率学派分析或贝叶斯分析较为保守。 2.6.3 通过适应性试验缩小样本体积 设计 适应性设计 利用累积数据决定如何根据事先规定的计划修改试验的某些方面。往往利用这些手段,在条件允许时及早停止试验,从而有可能减少试验的规模。有时,采用贝叶斯方法执行适应性试验设计比频率学派方法更容易。通过遵守 " 可能性原则 " ,贝叶斯方法可以在适应性试验的设计和分析方面提供灵活性(见第3.8和4.10节)。 2.6.4. 在适当规划的情况下,贝叶斯方法还可以为试验的中期修改提供灵活性。有些可能性包括放弃不受欢迎的治疗臂或修改随机处理办法。 对随机化办法的修改对于一项具有道德敏感性的研究或当入学对治疗器官有问题时,尤其具有相关性。贝叶斯方法特别灵活,允许改变治疗方法,以控制试验期间随机比率。讨论见Kadane(1996年)。 2.6.5 其他潜在获益分析 确切分析 贝叶斯方法有时可用于在相应的频率学派分析只是近似或太难执行时获得准确分析。

缺失的数据贝叶斯方法在处理缺失的数据方面有很大的灵活性,关于这些贝叶斯方法的使用情况的讨论见第5.4节。

在临床试验中,多样性十分普遍。例如,多端点的推论或多分组(如种族或性别)的测试是多重的例子。贝叶斯处理多重问题的方法不同于常住问题,可能有利,关于贝叶斯多重调整的讨论见第4.9节。

2.7 采用贝叶斯方法的潜在挑战是什么? 从监管的角度来看,对任何试验的设计、进行和分析进行规划总是重要的,但对贝叶斯分析尤其重要。在贝叶斯分析中,必须在设计阶段就以下方面作出裁决:• 先前的资料,从试验中获得的资料,以及用来将两者结合起来的数学模型。 事先信息的不同选择或模式的不同选择可产生不同的决定。因此,在监管环境中,设计贝叶斯临床试验涉及预先确定和商定先前的信息和模型。由于达成这一协议往往是反复的过程,我们建议你尽早与FDA会晤,以便就贝叶斯试验设计的基本方面达成协议。 2

在试验的后期阶段改变先前的资料或模型,可能危及试验结果的科学有效性。因此,在采用贝叶斯办法时,正式协定会议可能是适当的。

2 中非人阵规定及早举行两类合作会议:协定会议和确定会议,见513(a)(3)(D)、520(g)(7)。详情见FDA关于早期合作会议的指导,地址:_0\ m073604.htm。 具体而言,事先确定信息可能是协议会议的适当议题。 贝叶斯方法可以涉及临床试验的广泛数学模型,包括:• 为反映先前信息而选择的概率分布;• 共同变差对病人结果或缺失数据的影响,以及对模式选择的敏感性分析。 我们建议你与FDA 以及你的统计和临床专家 密切合作并达成协议 来做出模型选择 贝叶斯方法往往涉及贝叶斯分析和计算方面的具体统计专门知识。象MCMC这样的特殊计算算法经常被用来分析试验数据、核对模型假设、评估设计阶段的先前概率、• 进行模拟,以评估各种结果的概率,并估计抽样规模。 成功设计、实施、执行、执行分析贝叶斯试验,可以被通过纳入事先信息或没有事先信息而提高器械性能精确度所抵消,灵活的贝叶斯试验设计的好处(例如,临时分析的预期样本规模较小)。 FDA咨询小组可质疑你和FDA事先商定的事先资料。我们建议你准备在临床和统计上 证明你对事先信息的选择是正当的此外,我们建议你进行敏感性分析,检查你的模型是否稳健,以适应对先前分配的不同选择。 贝叶斯试验的结果与器械标签通常描述试验结果的方式不同。在器械标签中还没有普遍看到贝叶斯术语。 3 一如既往,我们建议你确保器械标签上报告的试验结果易于理解。

贝叶斯模式的灵活性和贝叶斯分析计算方法的复杂性,为错误和误解创造了更大的可能性。与任何提交一样,FDA将进行详细的统计审查,包括使用同一或替代软件核实结果。FDA建议您以电子形式提交数据及统计分析方案使用的任何指示。

贝叶斯和频率学派分析方法在结论中可能有所不同。每个小组都有相同的数据和不同的预先规划分析(一个贝叶斯人和一个频率学派),可以想象得出不同的结论,这些结论在科学上都是有效的。虽然贝叶斯办法往往有利于事先掌握良好信息的调查员,但这种办法也比频率学派方法更为保守(例如,第1款(a)项),因为第1款(b)项(a)项(b)项(b)项(d)目(d)目(d)项(d)目(d)项(d)目(d)项(d)目(d)目(d)项(d)见第四节:规划贝叶斯临床试验)。

我们建议,一旦开始试验,你不要从频率学派转为贝叶西亚分析(反之亦然)。这种事后分析在科学上不健全,往往削弱提交的有效性。

2.8 有哪些软件程序可以进行贝叶斯分析? 一个通用的非商业软件包专门用来计算贝叶斯语,称为WinBUGS4。BUGS缩略语表示使用Gibbs抽样的贝叶斯推论,这是一种常见的MCMC取样,WinBUGS生成了另外两个软件包,即BRUGS和OpenBUGS。BRUGS 使BUGS能够在流行的非商业软件包R中运行。 OpenBUGS是BUGS的开放源版本,用户可以修改软件包中的编程代码。其他贝叶斯软件包今后很可能提供。我们建议,在您选择特定软件产品之前,请与FDA统计人员协商,了解您在提交材料中将进行的计算。

3 然而,在InterFIX标签上(SSE: (见原文标签))可以看到一个例子。 4 WinBUGS方案可从剑桥医学研究中心网站下载:www.mrc-bsu.cam.ac.uk。2.9 现有哪些资源可以用来了解更多有关贝叶斯统计的资料? 非技术性简介性地提到贝叶斯统计及其在医基台面的应用,包括Malakoff(1999年)、Hyle(1996年)、Kadane(1995年)、Brophy和Joseph(1995年)、Brophy和Joseph(1995年),Lilford & Braunholtz(1996年)、Lewis & Wears(1993年)、Bland & Altman(1998年)和Goodman(1999年a,1999年b)。 O'Malley & Normand(2003年)讨论了FDA的程序和贝叶斯医疗器械试验方法。Berry(1997年)专门为FDA撰写了关于贝叶斯医疗器械试验的简介。

Brophy & Joseph(1995年)对使用Bayesian方法进行的三次临床试验进行了众所周知的综合。Spiegelhalter、Abrams和Myles(2004年)全面概述了使用贝叶斯方法设计和分析临床试验或进行保健评价的情况。

不强调医疗应用的贝叶斯统计的简介包括Berry(1996年)、DeGroot(1986年)、Stern(1998)、Lee(1997年)、Lindley(1985年)、Gelman等。(2004年)、Carlin和Louis(2008年)。

Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalhalter等人(2000年)、Spiegelhalhalter等人(2000年)、Spiegelhalter等人(2000年)、Spiegelhalter等人(2000年)、SpiegBerry & Stagl (1996年)、Breslow (1990年)、Stangl & Berry (1998年)、Box and Tiao (1992年)。

用于贝叶斯计算方法的Markov链条蒙特卡洛技术概览包括Gamer和Lopes(2006年)和Gilks、Richardson和Spiegelhalter(1996年)第一章。

贝叶西亚分析的实际应用出现在一些优秀的书籍中,包括Spiegelhalter等人(2004年)、Congdon(2003年)、Broemeling(2007年)、Congdon(2007年)等。Congdon(2005年)、Albert(2007年)和Gilks等人案(2005年) (1996年)。

关于最佳贝叶斯决策(a.k.a.,Bayesian决定理论)的优秀著作包括Berger(1986年)、Robert(2007年)、Raiffa和Schlaifer(2000年)和MH DeGroot(1970年)。

网上资源清单见国际贝叶斯分析学会网站。

  1. 贝叶统计

统计关注对未知利息量作出推论。• 与病人或其他试验或研究单位或参数有关的结果,或a 数量,说明研究被视为样本的人口特征。 例如,器械试验的结果包括:不良事件(例如死亡、肾衰竭、出血、心肌梗塞、重犯),以及效果衡量(例如,心脏功能、视觉敏锐度、病人满意度和诊断测试结果。 参数可以说明: 严重不利事件的比率, 病人的器械有效概率, 病人的生存概率,• 诊断器械的敏感性和特殊性。 3.2 贝叶斯比方范式指出,概率是衡量一个人对未知数量不确定的唯一尺度。在贝叶斯临床试验中,根据概率说明对一定数量的利害关系的不确定性,根据从试验中收集的信息,对概率进行更新。 在贝叶斯分析开始并获得数据之前,概率按利息数量未知的所有可能值(或价值范围)计算。这些概率加在一起构成该数量的先前分配。在进行监管审查的试验中,先前的分发通常以以前试验的数据为依据(尽管从数学上讲,这些试验实际上不需要按时间顺序排列)。 试验数据提供后,先前的分发根据贝叶斯的理论进行更新。这种更新的分布称为后验分布,通过这种分布,人们在观测到数据后,可以得出未知数量值的概率。这种方法是一种科学上有效的方法,将先前的信息(先前的概率)与当前数据合并。随着知识积累:今天的后期概率成为明天的先验概率,这种方法可以反复使用。

贝叶斯推论基于后验分布。例如,如果参数值(按观察数据计算)的事后概率小,贝叶斯决定程序可能会排除一套参数值。

对医疗器械的上市前评估旨在证明对新器械的安全和有效性的合理保证,传统的假设检验是某种裁决规则的例子。一种常见类型的决定规则认为,假设的事后概率足够大( " 足够大 " ,将在下文讨论),即已证明(有合理的保证)。

贝叶斯方法包含若干关键概念,其中一些概念不属于传统统计方法。下面我们简要讨论这些概念,并对比贝叶斯和频率学派主义的做法。

3.3 先前的分配是什么? 假设希腊字母“(“theta”)”代表临床试验中的一个参数。收集数据之前最初了解的...情况是...的先前分发情况,我们用文号表示为P()。

举例来说,假设 是一个严重不利事件的速率,其可能的值介于 0 和 1 之间。 先前的分布可能会偏向于 的较低值。图1显示了这种先前分配的例子。 获取任何一套特定值的概率由该套值曲线下的区域决定。因此,不利事件率_大于0.4(阴影区)的先前概率约为0.38。 0.0 0.2 0.4 0.6 0.8 0.8 1.0 □

图 1. 严重不利事件率的单式、右倾先前分布示例,以表示。前一概率值大于0.4(阴影区)为0.38。

另一种做法是,先前的另一种分配方式是统一分配方式,表示不偏向任何价值的。 (图2)a 0.2至0.3之间的概率为0.10,与 0.7至0.8之间,或0.55至0.65之间,或长度为0.10的任何间距的概率相同。对于前一种情况,的先前概率大于0.4(再次以阴影区域表示)为0.60。 0.0 0.2 0.4 0.6 0.8 0.8 1.0 □

图2. 严重不利事件率先前统一分布的实例,以 ++ 表示。 ++ 大于 0.4(阴影区)的先前概率为 0.60。

3.4 观测到的数据的可能性有多大? 现在假设临床试验的结果已经产生。概率函数是观测结果与参数 之间关系的数学表示。概率函数可以用 P(数据 ) 的符号表示, 即观察数据的有条件概率, 给出参数 的具体值 。每个可能的值为 _。

3.5 后台分布是什么? 最终目标是获得后验分布,以及以观察数据为条件的 参数 的可能的值概率,可以用符号表示为 P( 数据 ) 。Bayes 的理论被用来通过P(data) 的可能性更新以前对 , P( ) 的分布, 以获得 P( ) 的后端分布 。有关_的信息以这种后继分布方式归纳,贝叶斯的推论以此为基础。

例如,图3显示了如果我们从图1所示的先前情况开始,以及10个病人中1个不利事件观察到的数据,将获得的后继分布。由于这些病人观察到的不良事件发生率为0.10,分布已经向左进一步转移(即现在偏向于更低的值)。大于0.4(阴影区)的事后概率约为0.04。不利事件率大于0.4的概率从观察的试验结果的0.38(先前概率)降至0.04(事后概率)。 0.0 0.2 0.4 0.6 0.8 0.8 1.0 □

图3. 严重不利事件率的单式右倾后验分布,以表示,10名患者在观察一次不利事件之后,观察了一次不利事件,并在图1中更新了先前概率。 大于 0. 4 (阴影区) 的事后概率约为 0.04 。

今天获得的后继分发,在收集更多数据后,可作为事先分发。累积的信息越多, 后验分布的不确定性就越小。由于收集的信息越来越多,原先分发的信息的影响通常较小。如果收集到足够的数据,先前分发的相对重要性与可能性相比将微不足道。

3.6 (参照)分布是什么? Bayesian 方法允许产生一种特殊类型的事后概率;即,根据已经观察到的情况,未观测结果(未来或缺失)的概率。这一概率称为后验预测概率。总体而言,未观测结果的所有可能值的概率被称为(参照)分布。· 确定何时停止试验(根据尚未观察到的病人的(参照)结果),· 鉴于临床试验中观察到的病人结果,通过(参照)病人的临床结果帮助医生和病人作出决定,· (参照)该病人早期或较容易衡量的结果的临床结果,增加缺失数据的试验结果(估计)和示范检查。

第5节对这些用途进行了更详细的讨论。 分析贝叶斯临床试验。

3.7 什么是可交换性? 可交换性是统计推论的基本概念,在贝叶斯试验中可能特别重要。我们想说,如果观察这些单位的任何特定结果的可能性对单位的重新排序有差异,则认为单元(病人或试验)是可以交换的。这一定义可以通过实例加以澄清。

病人的可交换性

在临床试验中,在试验期间的病人通常被认为可以交换。病人的结果预计不取决于病人的注册顺序、观察结果的顺序;或病人的任何其他重新索引或重新编号。

如果接受试验的病人可以与接受抽样调查的人口中的病人交换(例如预定用途人口),然后,可以根据所观察的试验病人数据,对人口作出推断。因此,代表性抽样的概念可以用可兑换性来表示。

试验的可交换性

对于贝叶斯临床试验来说,通常假设另一种程度的互换性。也就是说,如果认为先前的试验是事先掌握的良好信息,就可以假定试验可以与其他先前的试验交换。假设试验可互换性使目前的试验能够“借用”以前试验的“力量”,承认试验在所有方面不完全相同。因此,试验的互换性对于制定将试验数据与先前资料相结合的现实模式十分重要。

假设在今后的贝叶斯试验中,对器械的不利事件率将作出估计,并提议将若干历史性试验作为事先资料。 如果任何试验的不利事件率不比其他试验大或小,所有试验都可被视为可以互换。 也就是说,预计试验结果不会取决于对试验的任何具体命令、重新编制索引或重新编号。特别是,今后试验的比率不会比历史试验的比率小或大。

例如,假设有两次历史试验,不利事件率分别为0.05和0.07。如果我们没有资料显示,今后试验的不利事件率将低于以下,则可以支持试验的互换性。或高于两个历史试验率。

可交换的试验可视为一些临床试验超人口的代表性样本。然后,历史试验提供关于超人口的资料,而这一资料则提供未来试验的资料。这样,今后的试验就从历史试验中借用了力量。

在实践中可确定的试验交换情况

从实际角度看,关于可交换性的判断应当从临床、工程和统计角度提供投入。

• 临床医生应确信,先前作为事先资料提出的试验在设计和执行方面与目前的试验足够相似。首先,他们不应有任何理由相信试验在任何特定方向上存在系统性差异。特别是,他们不应能够(参照)拟议试验与以往任何其他试验之间出现差异的方向。 • 工程师应确信试验中器械在设计或制造上的任何差异不应显著改变器械的预期性能,至少从结果或利益参数来看是如此。

• 统计人员应能够商定使用的适当统计模式。统计模型应与临床医生和工程师协商开发,在某些情况下,可以开发一种模式,系统地消除、消除试验之间的方向差异,因此在对这些差异作出调整后,仍可假定可兑换性(见第4.6节)。

采用贝叶斯等级模式,在试验中进行试验和病人的可交换性(见第四节:规划贝叶斯临床试验)。 关于可兑换性的介绍性讨论,见Gelman等人(2004年)、Spiegelhalter等人(2004年)或Lad(1996年)。关于可兑换性的技术定义,见Bernardo & Smith(1995年)。

3.8 什么是“可能原则”? 可能性原则是统计中的一个重要概念,但对于贝叶斯方法至关重要。该原则规定,从临床试验中获得的所有关于关注参数(_)的信息都包含在概率函数中。在贝叶斯办法中,以前分发的_年版本根据试验通过可能性功能提供的信息更新,其他内容除外。贝叶斯分析师的所有推论 都以这种方式产生的后验分布为基础

试验在许多方面可以改变,而不会改变可能性功能。 遵守可能性原则允许在进行贝叶斯临床试验时具有灵活性,特别是在下列方面:• 修改抽样规模、适应性设计、为可能及早停止试验而临时寻找和多重性。 请注意,由于规章方面的考虑,在设计阶段可能需要预先规定对试验的修改。

如上所述,贝叶斯分析师根据后验分布的所有推论,并且(根据可能性原则)只是先前和可能性功能的产物。虽然频率学派做法广泛利用可能性功能,但频率学派分析并不总是遵守可能性原则。例如,p价值的依据是可能已经发生但实际上在试验中没有观察到的结果,即与可能性无关的结果。

更多关于 " 可能性原则 " ,见Berger & Wolpert(1988年)、Berger & Berry(1988年)、Tiny(1993年)和Barlow等人(1989年)。

  1. a 规划贝叶斯临床试验

4.1 贝叶斯试验从健全的临床试验设计开始。 良好试验设计的基本原则对贝叶斯和频率学派试验都是相同的。全面试验议定书的部分内容包括:试验目标;评估终点;试验条件;试验目标;试验目标;评估终点;试验条件;• 将调查的人口和计划统计分析。 我们建议你遵循临床试验设计与执行良好原则,包括尽量减少偏见。随机化尽量减少了在选择病人接受何种治疗时可能引入的偏差。 随机化可以具体说明单因偶然性造成的共变差不平衡的可能性。对于规模相当大的样本,随机化确保所有的共变体,包括研究中未测得的共变体,保持某种程度的平衡。 对医生进行蒙蔽(也称遮瞎)可避免偏见,这种偏见可能由于在患者护理方面有意或无意的差别,或根据在试验期间获得的治疗结果评价病人结果方面出现差别而产生。遮掩病人的面纱可减少偏见,因为他们期望得到好处。 我们建议你事先选择使用的分析类型(贝叶斯或频率学派)。转换为在观察数据后产生更有利结果的分析方法有问题,在分析阶段很难证明这种转换是合理的。在有些情况下,对新试验进行贝叶斯分析可能会挽救先前非贝叶斯临床试验中获得的一些偏离原协议的信息。这种试验所提供的资料可以事先分发,用于未来的贝叶斯临床试验。 关于计划试验的进一步信息,见FDA《非诊断医疗器械统计指南》。 6.4.2 选择相关终点(本文件也称为参数)是用以支持某一声称的安全和有效性措施。理想的情况是,终点是: 临床相关,可直接观察到, 与对器械的声称有关,文件/ucm106757.htm 对病人很重要。 例如,终点可以是衡量试验中观察到的重要结果(死亡率、发病率、生活质量)的平均变化。 临床试验的目的是从试验中的病人那里收集信息,对这些未知的终点或参数作出推断。 4.3 收集其他重要信息:共同变数共变数,也称为混杂因素,是研究病人的特征,可能影响其结果。有许多统计技术(贝叶斯和频率学派)可以调整以适应共变。在无法通过随机计算确保某种程度的共变平衡的任何情况下,共变调整尤其重要,例如贝叶斯分析,其他试验作为事先资料。如果对试验之间协变量的差异不作调整,分析就可能有偏差。 也经常利用因变式调整来减少差异,从而进行更强有力的分析。 4.4 为便利临床试验结果评价,我们建议你使用一个参照或对照组作为参考。可考虑的监管类别类型是:同时监管、自我监管和历史监管。 我们认为,自我控制和历史控制比同时控制更有可能产生偏差,因为:· 可能出现同差调整、安慰效应和向平均值倒退的问题。 确定控制类型的另一种方法是区分用有效疗法(主动控制)处理的控制措施与用有效疗法(主动控制)处理的控制措施与用有效疗法(主动控制)处理的控制措施之间的差别。未经处理(非活性控制)或使用假冒器械(安慰剂控制)处理的控制措施。在积极控制试验中,采用贝叶斯方法特别有用,这种试验旨在证明新器械不仅非主动控制 sectoreferor,而且优于不治疗或假控制。贝叶斯人的试验可以利用以前的研究,将主动控制与非活动控制进行比较,从而调查这一问题。Gould(1991年)和Simon(1999年)讨论了贝叶斯积极控制试验的方法。 Bayesian 方法可用于将历史控制与同时控制相结合,历史控制是同时控制之前的信息。波科克(1976年)和斯皮耶格尔哈尔特等人(Spiegelhalter等人)讨论了利用历史控制方法作为以前的资料。 O'Malley、Normand和Kuntz(2003年),他们运用自己的方法对冠动脉 resolutionsings into his room contractive strenting trial. 4.5 关于终点的初步信息:回顾先前的分发说明我们对于我们进行研究之前的利息程度了解(或不知道)的情况。 应仔细选择适当的事先资料,并正确纳入分析。与FDA就研究设计进行的讨论将包括评价模型,用于将先前的资料纳入分析。 我们建议你尽可能多地确定先前的可靠信息来源。对先前信息“良好”的评价是主观的。 因为你们的试验 是为了让FDA 批准医疗器械您应在研究开始前向FDA审核员(临床、工程和统计)介绍和讨论您对事先信息的选择。 先前可能信息来源包括:海外临床试验、病人登记、关于非常相似产品的临床数据以及试点研究。 需要使用研究用器械豁免时,您必须提交完整的报告,说明先前的调查情况。 7 除本报告外,我们建议,你还应提交你提议在分析中使用的构成先前资料的任何补充资料。在某些情况下,可能无法获得本来有效的事先资料(例如,数据可能属于不愿允许合法查阅的其他人)。我们建议你与FDA举行Pre-Sub会前会议,就使用哪些事先信息以及分析中如何使用这些信息达成一致意见。 直接根据其他研究的数据进行先前的分发最容易评估。虽然我们认识到两项研究从来就不完全相同,但在某些情况下,如果调查人员和现场的研究也相似,则可能是有益的。 包括有利和不利和不利研究。只包括有利和不利研究可造成偏见。• 所包括的研究报告的代表性,以及列入或排除每项研究报告的理由。 以往根据专家意见而不是根据数据进行分配可能会有问题。如果FDA咨询小组成员或其他临床评价人员不同意用于产生先期结果的意见,就有可能推迟或损害对某一器械的批准。 事先分发信息信息时,偏好利息数量的某些值,因为其可能性大于其他值(如图1)。 resolutionsific professional professional professional professional这些偏好通常基于以往的研究。价值之间缺乏偏好或缺乏信息可以通过非信息性事先分配(如图2)来表示。 对目前对新器械的研究进行的Bayesian分析可能包括来自以下各方面的事先资料:• 新器械,控制器械,或两个器械。 在纳入先前研究的先前资料时,前一次研究中的病人很少被视为可与本研究中的病人交换。相反,从前几次研究中往往使用等级模式来“借款力”。在一级等级体系中,这些模型假定病人可在一项研究中交流,而不是在各项研究中交流。 在二级等级制度,假定以前的研究可以与本研究交换,本研究承认研究之间的差异。关于等级模式的更多详情,见第4.6节。 如果一项研究以前的资料是以更多的病人为根据,而更多的病人将参加研究,那么,先前的分发可能信息过多。判断什么构成信息过多是一个个案决定,在这种情况下,可能需要对研究设计和分析计划作一些修改。 在没有事先资料的情况下,在贝叶斯适应性试验中经常使用非信息性先前分发。a/ 用于合并研究的贝叶斯等级模型中,在先前非信息化的分布上可设定 Unionayesian 等级模型的参数,该参数可反映研究之间的变异性,因为,通常,在此参数上没有事先提供信息。

关于先前分发的问题,有广泛的文献,例如“非信息规范”的定义、衡量尺度变化的影响等等。有关这些问题的讨论见Lee(1997年)、Kass & Wasserman(1996年)、Box & Tiao(1973年)、Bernardo & Smith(1993年)、Bernardo、Berger和Sun(2008年)。Ting & Pennello(2001年)讨论在规章审查下预先分发试验材料的问题。

4.6 从其他研究中借款的实力:贝叶斯等级建模模式是一种具体的方法,你可以用来结合多项研究的结果,以获得对安全和有效性参数的估计。名称等级模式源于观测和参数结构的等级方式。 一些贝叶斯分析家将这一方法称为“借款实力”。 对于器械试验,借款实力可以转化为抽样规模。借款的程度取决于目前研究(利息研究)的结果如何密切地反映以前研究的结果(我们从何而来 sector为“借款能力”;注意从数学上讲,这些不一定需要在较早的时间发生)。

如果结果非常相似,目前的研究可以借用相当大的力量。 由于目前的结果与以前的资料不同,本研究报告的借款越来越少。在监管环境下,等级模式非常有吸引力:它们通过减轻证明安全和有效性的负担,奖励事先掌握关于器械性能的良好信息的人。同时,这种办法可以防止过分依赖以往研究,而以往研究对关键研究参数过于乐观。

以等级模式为例 假设你想要将 先前对一个被批准的器械的 两项研究 中 resolutionsubility 概率的信息 和新研究的结果 结合起来您可决定使用等级模式中的两级:患者级别和学习级别。

等级的第一级(住院)假设,在每次研究(目前或历史)中,病人是可以互换的。以前研究的病人无法在本研究中与病人交换,因此,早期研究和本研究的病人数据可能不能简单地 resolutionses from the country studies and the mission for the simply complained.

等级体系的第二个(研究)层次适用一种模式,假设从以前的研究中成功概率,而目前的研究是可以交换的,但成功概率可能有所不同这一假设是审慎的,因为你无法确定以前研究的病人是否可以与目前研究的病人直接交换。然而,这三项研究的成功概率是相关的,因为它们可以相互交换。前几份研究报告就本研究报告的成功概率提供了一些资料;尽管信息量不如这三类患者可直接共享的信息多。

以往研究与当前研究相似性 使用等级模型以借用以往研究的强度的关键临床问题 在于以往 sector级研究是否与当前研究足够相似,可视为可互换的,如第3.7节所述。

为了实现研究的互换性,可能有必要使用病人一级的数据,对诸如人口和(参照)变量等千差万别差异进行统计调整。这称为以共变制为条件的可兑换性。一般来说,正确校准您的研究取决于在患者一级是否拥有与前几次研究相同的共变信息,以及是否适当纳入这些信息。例如,如果将历史控制器的先前信息用于扩大同时同时控制组的样本规模,但共变表示同时控制病人的病人更健康只有在调整了共差之后,历史和同时监管的可互换性才可能合理(Pennello和Thompson,2008年,第3节;O'Malley,Normand和Kuntz,2003年。

仅仅根据共同变式摘要(如文献中的)进行校准可能不够充分,因为共变式水平 sector 与结果的关系在本研究报告中可以确定,但前几份研究报告中不能确定。这就迫使人们假定,在你的研究和以前的研究中,同系效应是相同的,这是无法检验的假设; sectoref和同系效应之间没有相互作用。

以往在等级模式下进行的大量抽样研究可以提供非常丰富的信息。正如我们将在第7.1节中讨论的那样,如果试验成功之前的概率过高,也许有必要修改研究设计和分析 resolutions Project 设计和分析计划。 还可以使用等级模型,在多中心试验中将各中心的数据结合起来。例如,见《PMA P980048安全和有效性摘要》,BAK/Cenvical sectording Suple-Tech Surzer Spine-Tech的体际融合系统。

由于下列差异,器械结果因地点不同而有很大差异:• 医生培训、技术、使用该器械的经验、临床管理和病人人数。

中心等级模式假定,关注参数因中心而异,但中心特定参数通过可交换性而相关。这种模型在估算所有中心的参数时, 都根据中中点的变异性进行调整。

Gelman等人(2004年)对等级模式及其实施的技术细节进行了初步讨论。Ibrahim & Chen(2000年)和Dey等人(1998年)介绍了其他更为复杂的办法。

4.7 临床试验中的样本大小取决于:• 抽样的变异性,先前的资料,分析所用的数学模型,分析模型参数的分布,和具体 sector 具体决定标准。

如果结果变化很大,所需的抽样规模可能很大。如果没有变异性(即人口中的每一个人对利息结果具有同等价值),单一观察即可。试验的系统化目的是收集足够的信息,以便作出决定,同时不浪费资源或使病人处于不必要的危险之中。

在传统的常住临床试验设计中,样本大小是事先确定的。作为指定固定样本规模的替代办法,巴耶西亚人 048. 方法(和一些现代的频率学派方法)可以具体规定停止试验的特定标准。适当的停止标准可以基于有关参数的具体信息量(例如,第5节界定的足够狭窄的可靠间隔):分析贝叶斯临床试验)或适当高的概率,以作预先规定的假设。

在贝叶斯临床试验之前或期间的任何时候,都可以获得样本大小的(参照)分布。因此,在试验的任何时候,你可以计算出达到停止标准所需的额外观测数量。换句话说,随着试验的进行,抽样规模的(参照)分布不断更新。由于样本大小不是停止标准的明确部分,试验可在收集足够资料以回答重要问题的确切地点结束。

将贝叶斯试验进行成斯文试验时 特别考虑FDA建议你们事先根据安全和有效性终点决定最低样本规模,因为安全终点可能会产生更大的样本规模。FDA还建议你列入从目前试验中获得的最起码的资料,以便能够核实模型假设和所用先前资料的适当性。这种做法还使临床界能够利用该器械获得经验。

在使用等级模型时,我们还建议你提供最低限度的样本大小,以确定从其他研究中“借用”的信息数量。

我们建议,应根据经济、道德和监管因素,确定最大样本规模。

Inoue等人介绍了对贝叶斯分析进行规模化的各种方法。 (2005年),Katsis & Toman(1999年),Rubin & Stern(1998年),Lindley(1997年)和Joseph等人(1995年a,b)。

4.8 评估贝叶斯设计的设计的操作特点,因为贝叶斯临床试验的设计具有内在的灵活性,对业务特点的彻底评估应是试验规划的一部分。• 错误批准无效或不安全器械的可能性(第一类误差率),• 错误地不批准安全有效的器械的可能性(第二类误差率), 功率(第二类误差率的反比):适当批准安全有效器械的概率)、样本规模分布(和预期样本规模)、器械声称的先前概率、• 酌情,每次临时检查时可能停止检查。

技术细节第7节载有更详尽的讨论。

“初步”的贝叶斯统计方法不一定象传统的频率学派方法那样,同样强调第一类错误的控制概念。然而,文献中有些建议认为,贝叶斯方法应当“校准”,以便具有良好的频率学派特性(例如Rubin,1984年;Box,1980年)。本着这一精神,并遵循监管惯例,FDA建议你提供你拟议的贝叶斯分析计划(见技术细节,第7节)的第一和第二类误差率。

对于贝叶斯试验,

  1. FDA认为,第1类误差,以及 我们努力对第一类错误率进行合理控制。对任何特定试验设计的运作特点进行充分定性可能需要广泛的模拟。更多讨论见第7.4节,技术细节。

  2. 使用先前信息时,可能适宜控制I型错误 低于以前没有使用过资料时的严格程度。例如,如果先前的资料是有利的,目前的试验可能不需要提供关于安全和有效性的同样多的资料。 我们在多大程度上可以放松I型错误控制是一种个案决定,取决于许多因素,主要是我们对先前信息的信心。

  3. 如果对历史/前信息进行折扣,我们可以建议 与本研究报告相比,先前分发的资料过于丰富,何为“资料过多”也是个案决定。

4.9 临床试验中的贝叶斯多重调整多重可能是一个重要的监管问题,因为FDA担心作出错误的决定;多重性可扩大作出错误批准决定的可能性。

多重性会严重影响临床试验的统计解释。 例如,如果频率学派试验的20个独立分组在I型误差水平5%的情况下,每个分组都接受重大器械效应测试,那么至少一个错误的结果的几率 高达64%典型的常犯做法是降低个别测试的误差水平,从而在合理水平上控制产生虚假重大结果的总体可能性。但是,这一方法也降低了发现实际影响(即力量)的机会,往往大大降低。同样,不发现实际效果(即第二类错误)的机会也增加了。

相反,针对上述分组问题,一种可能的办法,是采用等级模式,将分组视为可相互交换的、先验的。这个模型使贝叶斯人对亚群“ 从其他亚群中吸收强度” 的器械效果进行了估计。 如果观测到的亚群器械效果很大,然后根据其他分组支持或怀疑这一意见的程度调整贝叶斯的估计。更多讨论见Dixon和Simon(1991年)、Pennello和Thompson(2008年)。

贝叶斯对多种形式的调整,FDA可以接受,只要分析计划事先确定,分析的业务特点充分(见第4.8节)。请尽早与FDA协商统计分析计划,其中包括贝叶斯因多重因素进行调整。

有关贝叶斯理理算多重性调整的部分参考资料有:斯科特和伯杰(2006年)、邓肯和狄克逊(1983年)、贝里(1988年)、戈恩等人(1988年)。(2003年)、Pennello(1997年)、Lewis和Thayer(2004年)。

适应性设计利用积累的数据决定如何根据预先指定的计划修改试验的某些方面,同时又不损害试验的有效性和完整性。适应性试验设计有可能提供最佳的统计推论,提高决策的质量、速度和效率。

贝叶斯方法所固有的 " 可能性原则 " 使适应性设计和临时分析具有自然性质。• 暂时考虑调整抽样规模(以停止或继续累积病人) 暂时考虑可能提早停止试验,以便成功和徒劳,• 将非紧急情况的假设改为优越或反之亦然;在试验期间修改随机化率,以增加将病人分配到最佳高效治疗决策的概率 一种适应信息累积情况的试验设计,可允许以有效方式作出决定。根据贝叶斯办法,试验后应收集资料,直至认为足以作出决定为止。然而,在试验开始之前,抽样规模有很大的不确定性,为作出决定提供足够的信息。如果样本的可变性大于预期,则需要较大的样本规模,而如果可变性小于预期,则需要更大的样本规模,a 较小的样本规模就足够了。当采用适应性设计时,随着试验的进行,抽样的变异性就会被了解,而缺少或浪费的信息会更少。

例如,在器械成功率是终点的情况下,考虑主动控制(非急性)试验。这里,抽样规模主要取决于控制和治疗成功率。 例如,考虑非急性差0.10的情况。假设真正的控制和治疗成功率为0.60,要求的抽样规模为每组300名病人。如果治疗组的成功率为0.65,而不是0.60,那么样本规模将减少到每个组大约130名病人。显然,最好在这两种设想方案之间作出调整,因为抽样规模的节省可能很大。

FDA认识到,在试验进行时,纯粹的贝叶斯方法将允许连续设计调整。为了监管目的,并为了保持试验的完整性,同时尽量减少操作上的偏差,我们强烈建议,应事先规划适应性试验,并在IDE阶段的不同情况下评估设计的运作特点(见4.8)。换句话说,贝叶斯适应性试验应当有针对性地适应。

实施适应性设计可能具有挑战性,因为需要保持数据的保密性,以避免操作上的偏差,即:调查员偏见、甄选偏见和病人偏见。例如,如果调查员知道一种治疗在临时分析方面做得更好,他/她可以将较高的概率分配给未来的病人。为了尽量减少操作上的偏差,设计应事先妥善规划,适应性算法应事先确定。建议第三方分析和防火墙。适应设计的细节可能揭示不断变化的处理差异,最好提交机构审查理事会,以避免出现盲目的问题。 入学率对适应性试验有很大影响,如果入学率与后续跟踪的时间过长相比过高,可能无法进行适应,因为到获得临时结果时,所有病人可能都已注册。因此,申办者应能够控制入学率,以便受益于适应性设计。此外,在就适应性设计作出决定之前,应将快速入学的好处与控制较慢的入学率的好处加以权衡。

  1. 分析贝叶斯临床试验

5.1 事后分发摘要贝叶斯试验的结论仅以事后分发为依据。FDA建议你以几个数字(例如后置平均数、标准差、可信的间隔)总结后置分布情况,FDA还建议你列入适当分布的图表。

统计推论可包括假设试验、间隔估计或两者兼有。在贝叶西亚假设测试中,根据观察到的数据,你可以使用事后分布来计算特定假设是否属实的概率。

5.3 贝叶斯期间估计数以后验分布为基础,称为可信的间隔。如果一个端点在间距内的事后概率为 0.95, 那么这个间距被称为95%的可靠间距。 FDA大力鼓励报告在标签中对贝叶斯试验的可靠间隔。例如,关于报告的间隔期如何可靠,见《InFuse Bone Graft安全和有效性摘要》/LT-CAGE TM 9。

两种可信的间隔是后方密度最高的间隔(Lee,1997年)和中央后方间隔。关于可信的间隔期,见Chen & Shao(1999年)和Irony(1992年)。

  1. 5.4 可(参照)性概率 后验预测概率的使用(第3.6节)包括以下内容:如果这是临床试验计划的一部分,在临时阶段可以使用后验预测概率作为停止试验的规则。如果试验成功后验预测概率足够高(根据临时阶段的结果),你也许能够停止试验并宣布成功。如果试验成功的后验预测概率很小,你可以停止徒劳和削减损失的试验。

这里,可交换性是一个关键问题;这些(参照)只有在可以假定未观察到的病人可与已观察到的病人交换的情况下才是合理的。这一假设难以正式评估,但在某些情况下(例如行政审查)可能比其他假设(例如高病人退学率)更可信。

未来患者的(参照)结果 您也可以计算未来患者结果的后验预测概率考虑到在临床试验中观察到的病人的结果,只要目前的病人在试验中可以与病人交换。事实上,这一概率回答了下列问题:• 鉴于临床试验的结果,接受实验治疗的新病人成功的可能性有多大? • 如果病人在控制组接受治疗,这种可能性会有多大?

我们建议你考虑这一信息对帮助医生和病人就治疗选择作出决定是否有用,以及是否应该将其列入器械标签。

(参照)(估计)缺失数据 您可以利用后验预测概率(参照)(或估算)缺失数据,并据此调整试验结果。缺少数据估算也有频率学派方法。

无论采用何种方法,调整都取决于以下假设:结果缺失的患者与观察到结果的患者遵循相同的统计模式。这意味着失踪的病人可以与未失踪的病人交换,或者随机丢失数据。如果这一假设有疑问,FDA建议你利用(参照)模型进行敏感性分析。见Sulzer Spine-Tech的PMA P980048号、BAK/Covic体际融合系统摘要和安全效能。

当怀疑丢失的数据不是随机丢失时可在计算编码中加入敏感度分析,以确定为了改变结论,需要多少偏离随机假设缺失的情况(参考参考第24段)。Sulzer-Spine PMA SSED),这有助于缓解对缺失数据可能导致无效结论的关切。

如果患者在早期和以后的后续访问中都对同一结果进行了测量,您可以对后续访问做出(参照)(即使在后续时间过去之前)。根据先前访问的措施做出的(参照)要求:• 早期和后期的计量之间有相当高度的相关性。 在这个例子中,第一次的结果被用来(参照)第二次的结果。使用这种(参照)来证明及早停止试验INTFIX间脊椎体融合器械的临床试验是合理的。

早先的测量结果也可能不同;例如,对乳房植入而言,破裂可能是以后不利健康结果的(参照)。

5.5 FDA建议你们在试验设计中具体说明分析临时结果的方法,并确保FDA在试验前同意。以下介绍两种具体的贝叶斯临时分析方法:如果临时外观假设的后期概率足够大, 一种方法就能及早停止试验。换句话说,在试验过程中重复了同样的贝叶斯假设检验。 如第5.4节所述,另一种方法在临时阶段计算假设试验成功的可能性。此方法使用 @ 0 @ Q_ 048 。 015. 如果成功率的后验预测概率足够高,试验可能会提前停止。 如果后验预测概率非常低,试验可能因徒劳而提前停止。 这种方法用于提交INTINFIX间脊椎体融合器械。

5.6 模式核对

FDA建议你调查所有对分析很重要的假设 例如,对避孕工具的分析可能假定,在使用避孕工具的第一年,月怀孕率保持不变。为评估这一假设,可将观察到的月份特定费率与其后验预测分布情况进行比较。你可以使用Bayesian p-value来总结这一比较(Gelman等人,1996年、2004年),统计的后验预测概率等于或比模型假设中观察到的极端。你也可以评估贝叶斯偏离措施的示范检查和适用性,例如Spiegelhalter 等人(2002年)所描述的 " 偏离信息标准 " 。或者,可以使用贝叶斯系数比较两种模型,技术细节(第7.2节)对这些评估作了更多讨论。 例如,在较晚的试用期注册的患者使用该器械的成功率可能不同于先前注册的患者,如果:• 医生必须克服使用该器械方面的学习曲线,医生对该器械的最佳治疗对象形成意见;• 向受审的病人提供有效的辅助疗法,• 在试验期间可提供替代治疗,可能改变选择参加试验的病人的特点。 原则上,可以使用上文建议的任何方法,对试验早期的病人可以与试验晚些时候的病人交换的假设进行检查。

敏感度分析用于调查偏离统计模型及其假设的影响,FDA可建议你提交一份敏感度分析。这可包括调查: 偏离分布假设(即偏离关于你模型的随机要素的假设)的情况,• 贵模式中各种关系的其他功能形式,前期分配的替代形式,以及等级模式中的替代“高位”参数,• 偏离对缺失数据的任何“随机”假设。 决策分析是一种规范性办法,使决策者能够从逻辑上分析问题,以便在不确定的情况下选择最佳实验和行动。

决定分析方法考虑决定和试验的后果,以取得最佳行动方针。行动方针可包括决定停止或继续学习,或批准或不批准医疗器械。

在对试验结果的监管审查中可能作出的决定的后果应当得到评估,并反映在提出声称时将使用的事后概率值中。最终点越是关键,就越需要关于该终点的更多信息,而其后端分布应该更加清晰。例如,如果使用该器械有可能造成死亡或严重残疾,FDA将希望确保发生这种事件的可能性很小。合理程度的确定性可以达到90%、95%甚至99%。这些数值将反映在预先确定的后期概率中,即终点低于某一目标,或使用新器械时死亡概率与控制值之间的差小于预先指定的值。

原则上可以使用决定分析方法来制定临时分析计划。Carlin、Kadane、 & Gelfand (1998)提出一种方法,在临时分析中大致采用决策分析方法。 关于对关于推断和假设测试的决定分析方法的极深入了解,见Lee(1997年),第7章。按复杂程度排列,Raiffa(1968年)、Lindley(1984年)、Bernardo和Smith(1993年)、Raiffa和Schlaiffer(1961年)、Berger(1985年)、DeGroot(1970年)、Ferguson(1967年)。

  1. 上市后监视 FDA认为,贝叶斯方法非常适合用于监视目的。" 今天的后验是明天的先行者 " 允许你使用上市前研究的后验分布作为事先分配的监视用途,只要临床研究的数据反映了器械在批准后如何使用。换句话说,如果您可以证明上市前和后数据可以交换,您可以随时更新上市前临床试验提供的信息,并通过贝叶斯理论提供上市后数据。你可以继续透过贝叶斯的理论 更新后市场信息,

您也可以使用贝叶斯模型来挖掘大型的上市后医疗报告数据库。DuMouchel(1999年)讨论了贝叶斯模型,用以分析按所用药物类型对不利事件进行交叉分类的非常大频度表。DuMouchel使用等级模式,平滑对与毒品有关的不利事件的相对频率的估计,以减少由于多种原因预期的具有虚假意义的协会的数目。目前尚不清楚这一方法是否与药物报告一样对医疗器械报告有用。 7. 技术细节

7.1 除了标准的临床试验程序外,还应将建议的信息纳入您的议定书,FDA认为,在你的提交中,应讨论贝叶斯试验设计所特有的统计问题。 以下建议(并非详尽无遗地列出)将促进审议过程的顺利进行,并成为编写议定书的起点。并非所有的要点都适用于所有研究。

FDA建议你事先说明你将使用的所有先前资料以及你提出的假设。 FDA建议,成功的标准是,你提供一项标准,说明你的研究是否成功(与安全和有效性有关)。 FDA还建议你说明拟议样本规模的理由,说明拟议样本规模的理由,说明理由的方法可能不同,取决于试设计。 例如,在固定抽样规模的试验中,你可以选择模拟数据,假设一系列不同的真实参数值和不同的样本大小。 对于每个模拟数据集,我们建议您确定参数的后验分布。例如,事后分布可用于计算研究声称的可靠间隔或后概率。对于每次模拟,都要将可信的间隔或后期概率与模拟中已知的“真实”参数值进行比较。重复模拟用于评估拟议样本规模,这种样本规模计算方法可能涉及密集模拟。对于某些情况,较简单的方法可能适合接近抽样规模,Pennello和Thompson(2008年,第2节)审查了其中一些方法。

对于适应性试验设计而言,抽样规模是研究设计参数和试验结果的函数(例如最大抽样规模,临时看望的时间间隔和时间、停止试验的标准)。 在试验开始前,我们建议你提供最低和最高样本大小、临时分析的数量和每次临时分析的病人人数。

FDA建议你提供表格,说明满足研究声称要求的概率,给新试验给出了各种“真实”参数值(例如,事件率)和不同样本大小。本表还将提供在真实参数值与无效假设相一致的情况下,I型错误概率的估计,如果真实参数值与替代参数一致(定义见第4.8节),则使用功率。

在某些简单的情况下(例如,单一的、具有二元结果的手试),这些概率可以直接计算。如果研究设计复杂,通常需要使用模拟来计算这些概率,一般而言,模拟应反映研究设计。关于模拟的一些建议概述于技术细节第7.2节:模拟以获得操作特征。

研究前概率声称要求,FDA建议,如果使用信息性事先分发,则评估研究前概率声称要求。这是研究声称在看到任何新数据之前的概率,不应太高。 何为“太高”是逐案决定。特别是,我们建议先前的概率不要高于事后概率的成功标准。

FDA提出这项建议,以确保事先资料不会压倒现有数据,可能造成一种情况,即拟议研究的不利结果被先前的有利分配掩盖。 在评估声称的先前概率时,FDA将利用事先信息而不是使用非信息前科,在事先信息的信息性与效率的提高之间取得平衡。

要计算此先前概率, 您只能使用先前的分布模拟数据。 例如,如果您正在使用一个计算机程序来进行Markov 链条 Monte Carlo(MCMC)模拟,您将不提供当前数据,而是让程序模拟这些数值。以这种方式进行的模拟提供了研究声称的先前概率。

如有必要,可以通过修改以前对不同研究之间的差异的分布情况,使先前的平均数高于最初的平均数,降低先前研究声称的概率。或者,差异的先前分配可以限制于大于常数,并且常数可以改变,直到声称的先前概率降低到预期值为止。这些方法可以用于三项或更多项研究。然而,仅供两项研究使用,即一项拟议研究报告和前一项研究报告,先前的分发可能也必须相当精确,因为两项研究的数据本身可能没有提供关于这一差异的多少资料。

利用后方差异信息为任何模拟计算出有用的摘要是新试验中有效的抽样规模。

有效样本规模(ESS)的计算方法是:ESS = n * V1/V2,

n = 新试验V1中的样本大小 = 不借用利息参数的差异(使用非信息性先前分配法计算) V2 = 借款利息参数的差异(使用事先拟议的信息化参数计算)

然后,数量(ESS - n)可以被解释为前一次试验中“借款”的病人人数。本摘要有助于量化您使用先前信息的效率。 如果前一信息信息太丰富, 也可用于衡量前一信息。 例如,如果“借款”的病人人数大于试验的样本数量,那么前一种可能信息信息过多,可能需要通过使用,例如,上述技术(见上一节最后一段)。

程序代码FDA建议您在提交 IDE 时提交程序代码和用于模拟的任何数据。我们还建议你附上一份从该研究得到的数据的电子副本以及同PMA提交材料13 分析时使用的计算机编码。(注意我们不想要实际的软件产品;我们要求的是指导软件如何进行分析的一套指示。 )

7.2 FDA通常建议,在规划(或IDE)阶段提供试验模拟。这将有助于FDA评估贝叶斯试验的业务特点,特别是第一类和第二类误差率。我们建议你们模拟试验 模仿拟议的试验 考虑同样的:· 事先资料、抽样规模、临时分析和可能修改中途试验。

13 关于以电子形式提交临床数据的资料,见“0 ” urDevice/PremarketSubmissions/ucm1363677.htm。 您可以从模拟试验中评估I型错误率, 模拟试验的参数按器械不应被批准的边界值固定。这些模拟中成功试验的比例提供了对第一类最大误差率的估计。FDA建议模拟几种可能的假想情况,并在每种情况下提供预期样本规模和估计的I类误差。

您可以评估模拟试验的功率(和二类误差率),模拟试验的参数是按器械应予批准的合理值固定的。 这些模拟试验失败的比例提供了第二类误差率的估计,补充估计了实验设计所提供的动力。FDA建议模拟几种可能的假想情况,并在每种情况下提供预期的样本规模和估计的第二类误差率和功率。

如果FDA认为Bayesian实验设计中I型误差率太大,我们建议你修改设计或模型,降低这一比率。 确定“过大”是提交材料所特有的,因为某些第一类来源误差通货膨胀(例如:与其他人相比(例如,不适当地选择研究以构建先前不适当的统计模式,第一类错误的严重性(成本)也是一个考虑因素。

降低I型错误率有许多选择。这些选择包括: 提高确定成功试验的后期(或(参照))概率(例如:• 减少临时分析的次数,· 对以前的资料进行贴现,(a) 选择超贵优先参数值b) 扣除历史数据c) 限制“借款”病人的实际人数(从历史控制d) 将“借款”病人的实际人数限制在历史控制d) 包括对等级模式研究之间差异的通货膨胀系数(e) 限制先前研究允许的借款额14

14 在监管环境中,如果当前研究结果与以往研究的结果大相径庭,则最令人关切。因此,在设计阶段,可根据有关专家的投入,确定对借款额的限制。当当前控制臂的严重不利事件率大大低于前一次研究时,可使用以前的控制数据,一项经验性规则可以确定如下:如果现有控制臂的严重不利事件率小于先前研究的这一严重不利事件率的固定数字,以往研究的数据将不予使用,这种经验性规则应反映在操作特性的模拟中。 · 增加最大抽样规模(同时减少前一种的影响),改变在适应性试验中终止注册的标准,· 改变I类误差率的计算方法,(a) 在计算第一类错误(b)时列入(或不列入)先前的资料。 (c) 在计算第一类错误(c)时列入(或不列入)共同变式调整。临床判断将有助于界定“适当”的定义。 d) 计算“平均”型号I的误差,将先前的分布合并,但以无效者为条件。

• 上述备选方案的任何组合

如果实验设计被修改,我们建议你进行一套新的模拟来评价新的设计。

我们还可以要求你说明操作特点对试验假设的敏感性(例如,各种模型和分配假设,以及,与贝叶斯试验、选择先前的试验,以及适应性试验的应计率等。 )

7.3 一些统计分析计划允许在选择最后模型进行分析之前,对若干可能的数据和参数模型进行比较。例如,在对一项从其他研究中借用力量的研究结果进行的贝叶斯分析中,一个因素对结果的影响可能因研究而异。你不妨考虑的两种可能的模式是:(1) 一种研究不会改变因素效应的模型,(2) 一种范围更广的模型。

一种比较两种模型的方法是测试一种模型是真实的无效假设,另一种是真实的假设。这种测试的结果取决于替代模型的后继概率,或替代模型的后继概率。相近的几率是指替代模型的后概率与无效模型的后概率之比。在一套有限的可能模型中选择真实模型以选择一个特定数据集可能模型的最佳决定是选择后继概率最高的模型。因此,后期赔率往往是比较模型的首选方法。

另一方面,先前的概率则是指替代模型的先前概率与无效模型的先前概率之比。对于某个特定替代模式,后差与前差之比称为贝雅斯系数。 因此,据说,贝叶斯系数代表了替代模式与无效模式相比的几率变化,例如,在我们从先验与后验向后移动时。因此,Bayes系数可能被用于示范选择。通过比较后验差异与先验差异,贝叶斯系数可能与先前分配的选择具有很强的说服力。然而,我们应当指出,对于某些非信息化的前题,特别是以前分配不当(不与先前分配不相容)时,没有明确界定贝叶斯因子。Carlin和Louis(2008年)提供了更多关于贝叶斯因素及其计算的细节。

此外,贝叶斯偏离措施,如《偏差信息准则(DIC)》(DIC, Spiegelhalter等人,2002年)。2002年可以用来通过比较一种模式比另一种模式的适合性来选择模式。其计算方法是模型偏离的后置平均值减去模型中有效参数数,其中有效参数数是估计模型参数预期的偏离减少。pD可被估计为偏离的后置值减去参数后置值所评估的偏离值(Gelman等人,2003年,第39页)。采用最低DIC的模型最适于数据。

7.4 使用第5.5节的 " 前景(参照)分布 " 核对可兑换性我们讨论使用(参照)分布来核对 模型的某些假设 用来适应数据在本节中,我们说明如何利用后验预测分布来评估当前研究和若干历史研究的可交换性。在规划阶段,从临床和工程角度确定可交换性,但有时我们也可以统计性地检查这一假设。

假设新研究发现不利事件率比历史研究高得多,尽管临床判断在收集有关新研究的数据之前,研究可以交换。为了简化讨论,假设没有可说明差异的共变单位。然后,我们或许可以利用后期(参照)分析来检查在先前分配中考虑的可交换模式下差异是否不可能。一种可能的测试统计数据是新研究观测率与另一种研究率之间的最小绝对差异,一种是差距统计数据。如果与历史研究之间同样界定的差距相比,观察到的这一差距很大,那么新的和历史研究率可能无法互换。这一观察到的差距统计数字可以与根据可交换模式计算的其后期(参照)分布相比较。 如果观测到的缺口远远位于其后方(参照)分布的右侧,则不支持可交换模型。概要是计算观测至少与观测到的距离相等的距离的后期后验预测概率,即“贝叶斯比值”值。如果Bayesian p 价值很小,那么可交换的模式可能无法维持,在Pennello和Thompson(2008年)中进行了技术性更强的讨论。

7.5 计算贝叶西亚分析中几乎所有利息都涉及计算数学元件。以下所有内容均作为后验分布的有机组成部分表示:• 后置值, 后置标准差, 可信的间隔, 以及假设的后置概率。

以下是用来计算这些整体体的一些数字集成技术:• 重要取样,以及Markov链条蒙特卡洛技术(2006年,Gamerman和Lopes)。

MCMC技术可能是最常用的;最常用的MCMC技术是Gibbs取样器。大都会-哈斯廷斯算法是一种一般化的算法,可用于Gibbs取样器失灵的情况。

MCMC技术很受欢迎,因为在许多分析中,后验分布太复杂,无法写下来,因此,传统的数值集成技术,如二次和拉普尔近似等,无法实施。Gibbs取样员从其他已知分布中提取样本,以创建(Markov)价值链链。 Markov链是一组样本,每个点的价值仅取决于前一个样本。最终,随着链条的趋同,抽样的数值开始与后验分布的数值相似。然后,从Markov链条提取的图纸可用于接近后部分布和计算整体。

Tanner(1996年)对统计中使用的计算技术进行了调查,包括数字集成和MCMC技术。MCMC技术及其应用于各种科学问题,是MCMC技术的解释(1996年)。 Gamerman和Lopes(2006年)、Gelman等人(2004年)和许多其他教科书中也讨论了MCMC和其他技术。 当使用MCMC技术时,FDA建议你检查产生的价值链是否确实在某一点趋同,以便随后从后验分布中提取。已经开发了各种技术来诊断非趋同性,您可参考Gelman等人讨论的诊断技术。 (2004年)、Gilks等人(1996年)、Tanner(1996年)、Gamerman和Lopes(2006年)和CODA手册(Convergence Sudis和产出分析),一组SPlus函数处理程序BUGS的产出(使用Gibbs抽样的Bayesian推论)。

视贝叶斯模型如何参数化而定,马尔科夫链条可能会缓慢地汇合。替代性参数化或替代的MCMC采样器可能有助于加速趋同。一个链条似乎没有趋同的一个可能的解释是,使用了不当的事先分发(见第5节:分析贝叶斯临床试验)。在这种情况下,链条可能不会汇合,因为不存在适当的后验分布。当使用不当的先前分发时,您应该检查后传分发是否正确。如果先前的分配几乎是不适当的,也可能出现趋同困难。

数据增强技术将辅助变量引入一个模型,以便于计算。辅助变量的使用也有助于解释你的分析。例如,在分析正态结果(即仅定购少数可能值的结果)时,现在通常采用潜在变量。此类结果的例子包括对生活素质调查表的多种选择问题的答复。Johnson & Albert(1999年)讨论利用潜在变数对正统结果进行贝叶斯分析。 Tanner(1996年)将数据扩充作为一项一般技术来讨论。

对于需要密集计算的贝叶斯分析或其他分析,FDA将例行检查计算结果(例如:我们建议你以电子方式向FDA提交数据及计算所使用的程序。

15 这两个方案都可以从剑桥医学研究中心下载,下载时间为见 FDA 官网 8. 参考参考资料

Albert Bayesian (2007年) R Springer的计算。 Barlow, R. E., arty, T. Z., & Shor, S. W. W. (1989年)。实验设计对决策、影响图、信仰网和决策分析的影响,Oliver和Smith(Eds.)、John Wiley & Sons。 Berger, J.O.(1986年),《统计决定理论和贝叶西亚分析》,斯普林格。 Berger, J. O. & Berry, D. A. (1988年),《统计推论中停止规则的相关性》,统计决定理论和相关专题,IV 1. S. S. Gupta 和 J. O. O. 柏林:斯普林格,29-72年(经讨论)。 Berger, J. O., & Wolpert, R. L.(1988年),《可能性原则》,第二Ed. CA:Hayward:IMS。 Bernardo & Smith(1993年),Bayesian理论,John Wiley & Sons。 Berry, D.A.(1996年),《统计,巴耶西亚人的观点》,Duxbury出版社。 Berry, D. A. (1997年),在医疗器械开发中采用贝叶斯方法。 技术报告,来自FDA生物统计司器械和放射健康中心。 Berry,D.A.和Stangl,D.K.(Eds)(1996年)。 贝叶斯生物统计学。 纽约:Marcel Dekker。 Berry, D.A.(1988年),《多重比较、多重测试和数据疏导:贝叶西亚视角》,《贝叶西亚统计3》,Bernardo, DeGroot, Lindley, Smith (Eds),第79-94页。 Bland, J. M., & Altman, D. G. (1998年),Byesians和频率学派。 1151. 方框G.E.P.(1980年),《对科学模型和稳健性的抽样和贝斯推论》,《皇家统计学会期刊》,A辑,143,383-430。 方框G.E.P.和Tiao、G.C.(1973年),《贝叶斯在统计分析中的推论》,MA:阅读:Addison Wesley。 Breslow, N.(1990年),《生物统计学和贝叶斯》,Sat Sci 5(3),269-284。 Broemeling, L.D.(2007年),Bayesian生物统计学和诊断医学,Chapman & Hall。 Brophy、J.M.和Joseph、L.(1995年),利用Bayesian的分析将试验置于背景之下:GUSTO,由Bayes牧师复述。 Carlin, B.P.和Louis, T.(2008年),《贝叶斯数据分析方法》,第三版。 查普曼和霍尔 Carlin, B. P., Kadane, J. B., & Gelfand, A. E. (1998年),《临床试验最佳顺序决策分析方法》,《生物测量学》,54, 964-975。 Chen, M.H., & Shao,Q.M.(1999年)。M.(1999年)。M.Monte Carlo 对 Bayesian 可信区间和最高后验密度(HPD)区间估计。《计算和图表统计杂志》,第8卷,N.1,第69-69页。 92. Congdon, P.(2003年),应用贝叶斯模型,Wiley。 Congdon, P.(2007年),《Bayesian统计模型》第二版,Congdon, P.(2005年),《Bayesian分类数据模型》,Wiley。 DeGroot,M.H.(1970年),最佳统计决定,McGraw-Hill。 De Groot, M.H.(1986年),《概率和统计》,Addison Wesley。 Dey、D.、Muller、P.和Sinha、D.(Eds)(1998年),《实用的非参数和半参数贝叶斯统计》,纽约:斯普林格-弗拉格。 狄克逊、D.O、Simon R.(1991年),Bayesian子集分析,生物测定47、871-882。 DuMouchel, W.(1999年)。Bayesian数据挖掘大频表,适用于FDA自发报告系统。 美国统计员,53(3),177-202。 Duncan, D. B. 和 Dixon, D. O. (1983年), k-ratio t 测试, 多次比较的间隔和点估计。纽约:Wiley)Gamerman,D.和Lopes,H.F.(2006年),Markiv链条Monte Carlo:Bayesian推论模拟,第二版。Chapman & Hall. 查普曼 & Hall 。 Gelman, A., Carlin, J. B., Stern, H. S., & Rubin, D. B. (2004年)。 Bayesian数据分析,第二Ed.,伦敦:Chapman和Hall。 Gelman, A., Meng, X., & Stern, H. (1996年),《对通过已实现差异进行模型健身的(参照)性评估》,Sinica统计,6,733-760,讨论760- 807. Gilks, W. R., Richardson, S., & Spiegelhalter, D. J. (1996年),Markov 链 Monte Carlo在实践上,伦敦:Chapman & Hall。 Gonen, M., Westfall, P.H.和Johnson, W.O.(2003年),《Bayesian多重测试:生物计量学两个抽样多变量终点,59,76-82》。 古德曼,S.(1999年a),《关于基于证据的医疗统计,1:价值谬误》,《内科年鉴》,130,995-1004。 Goodman, S.(1999b),《建立循证医疗统计》,2:拜斯系数。 《内科年鉴》,130、1005至1013。 Gould, A.L.L.(1991年),利用先前的调查结果,加强使用小型安慰剂组进行的积极控制试验和试验。 希利雅特(Hyle),W.(1996年,5月),《决定的数学》,《发现》,90-97。 Ibrahim、J.G.和Chen、M.H.(2000年)。 回归模型的电力分配。 统计学,46-60年。 Inoue, L. Y. T., Berry, D. A., & Parmigiani, G. (2005年),Bayesian 和常住者抽样规模确定之间的关系。 美国统计学家,59,79-87。 T. Z. yery, T. Z. (1992年),《Bayesian估计离散分布》,《应用统计杂志》,19, 533-549。 T. Z. yery, T. Z. (1993年),《抽样规则》中的资料,《统计规划和推断杂志》,36, 27-38。 铁、T. Z., & Pennello, G. A. (2001年),在监管环境中选择对贝叶斯医疗器械进行适当试验的事先选择。《美国统计协会2001年生物制药科会议记录》,VA:亚历山大:美国统计协会。 讽刺,T. Z, & Simon, R. (2006年),“Bayesian方法应用于医疗器械试验”,载于《医疗器械临床评估、原则与案例研究》,Becker, K. 。和怀特,J,第二版 T. Z. yrony, T. Z. (2007年),“不断发展的方法:在医学研究所循证医学圆桌会议的议事过程中,评估在快速通量状态下的医疗器械干预情况,该圆桌会议名为“学习保健制度”。V.E.和Albert, J.H.(1999年),Ordinal数据模型,纽约:斯普林格-弗拉格。 Joseph, L., Wolfson, D. B., & Berger, R., du.(1995年a),通过最高后验密度间隔对二进制比例进行抽样规模计算。统计研究所期刊,44, 143-154 Joseph, L., Wolfson, D. B., & Berger, R., du.(1995b).,关于确定贝叶斯抽样规模的一些评论。《统计研究所期刊》,44,167-171 Kadane,J.B.(1995年)。《贝叶斯的黄金时期》,受控制的临床试验,16, 313-318。 Kadane, J.B.(1996年),《Bayesian临床试验设计的方法和伦理学》,John Wiley & Sons。 Kass, R. E., & Wasserman, L. (1996年),根据正式规则选择先前的分发方式,《美国统计协会杂志》,91 (435),1343-1370。 Katsis, A., & Toman, B.(1999年),B.(1999年),Bayesian 样本规模的二元实验计算,《统计规划和推论杂志》,81, 349-362 Lee, P. M.(1997年)。《贝叶斯统计:简介》,纽约:John Wiley & Sons。 Lewis, R. J., & Wears, R. L.(1993年),Bayesian对临床试验分析的简介。 Ann. Regent. Med., 22(8), 1328-1336。 Lewis, C. and Thayer, D. T. (2004年),与FDR有关的损失函数,用于随机效果多重比较。 《统计计划杂志》,第125页,第49至58页。 Lilford, R.J., & Braunholtz, D.(1996年)。 公共政策的统计依据:范式转变已经过时。 BMJ, 313, 603-607。 Lindley,D.V.(1985年),《决策》,John Wiley & Sons。 Lindley, D.V.(1997年),《抽样规模的选择》,统计学家,46,N.2,129-138。 Malakoff, D.(1999年,11月19日)。 Bayes为了解数字提供了“新的”方法。 科学 286 1460 -1464 O’Malley AJ, Normand S-LT(2003年)。统计:跟上医学技术革命的步伐。 Chance, 16(4): 41-44。 O’Malley AJ, Normand S-LT, Kuntz RE(2003年),《医疗器械试验多变混合结果模型的应用:冠动脉衰竭》。 《医学统计》,22(2):313-336。 Pennello, G.(1997年),《平衡双向设计的K-ratio多重比较贝叶斯规则》,JASA,92, 675-684。 Pennello, G.和Thompson, L.(2008年),《审查贝叶斯医疗器械试验的经验》,J生物制药统计,18:1, 81-115。

Raiffa和Schlaifer(2000年),《应用统计决定理论》,威利,最初发表于1961年,Robert C.P.(2007年),《贝叶斯选择:从决策理论基础到计算执行,斯普林格。 Rubin,D.B.(1984年):《统计年鉴》12(4),1151-172。 Rubin, D. B. & Stern, H. S. (1998年),利用后后方(参照)分布进行抽样规模确定。(2006年) 探讨贝叶斯多重测试的各个方面,《统计规划和推断杂志》,136、2144-2162。 Simon,R.(1999年),Bayesian 设计和分析主动控制临床试验。 生物计量,55,484-487。 Spiegelhalter, D. J., Abrams, K. R., & Myles, J. P. (2004年),Bayesian 临床试验和保健评价方法,纽约:Wiley。 Spiegelhalter, D.J., Best, N.G., Carlin, B.P.和van der Linde, A.(2002年),Bayesian 模型复杂性和适用性计量。《皇家统计学会期刊》,B辑,64,583-616 Spiegelhalter,D.J.,Freedman,L.S.和Parmar,M.K.B.(1994年)。《皇家统计学会期刊》,A辑,157,356-416。 Spiegelhalter, D.J., Myles, J.P., Jones, D. R., & Abrams, K. R. (2000年),《Bayesian健康技术评估方法:审查》,《健康技术评估》,4, 38。 Spiegelhalter, D.J.,Thomas, A., Best, N.G., & Gilks, W. R.(1996年)。 BUGS:使用Gibbs抽样推断的Bayesian推论,0.5版(版本二)。MRC生物统计股。2002年2月, 50 Stagl, D.K., & Berry, D.A. (Eds.) (1998年)。Bayesian医学统计数字:我们在哪里,我们要去哪里? Sankhya Ser B, 60, 176-195。 Stern, H. S. (1998年),《贝叶斯统计推论的初级理论》,《统计统计》,23, 3-9。 Tanner, M.A.(1996年),《统计推论工具》,纽约:斯普林格-弗拉格。


脚注 ​

[^5]: 3.1 结果和参数

[^7]: 然而,建议用来构建前一研究的研究在以下方面与当前研究相似:• 程序(终点、目标人口等)和数据收集的时限(例如,确保医学实践和研究人口具有可比性)

[^11]: 见《PMA P970015安全和有效性摘要》,at

[^12]: 见PMA P970015号《安全和有效性摘要》,第0章,第0章,第015页。

内容以 CC BY 4.0 许可证授权