本文首发于公众号「呼气试验」,此处为归档版本。

呼气试验完全指南(终章)

—— VOCs 质量控制与数据分析 ——

【系列说明】

本文是”呼气试验完全指南”系列专题文章的最后一篇(终章),聚焦呼气 VOCs 分析工作中的质量控制与数据分析两大环节。感谢您一直以来的关注与陪伴。

【本文导读】

全文约 1800 字,阅读约需 5 分钟。

本文是”呼气试验完全指南”系列的终章,聚焦 VOCs 分析的质量控制与数据分析。读完本文,您将了解:

一、质量控制

  • 为什么呼吸采集与 VOC 分析流程的一致性,是获得可靠生物标志物数据的关键

  • 呼吸采集中的质量检查:面罩贴合与漏气检查、压力与二氧化碳水平实时监测、呼吸曲线记录,以及呼吸量不足样本的处理

  • VOC 分析中的质量控制:仪器参数的每日/每周 QC 检查、空白样本背景监测、标准化合物的线性度与检测限验证

二、数据分析

  • 数据分析管道如何整合光谱数据与临床数据,输出分类算法

  • 训练集与测试集如何科学划分,排除混杂因素

  • 机器学习分类器的开发流程:10 倍分层交叉验证、敏感性/特异性/ROC 曲线评估

  • 独立队列验证与外部盲法验证性研究,如何为诊断测试的监管审批提供证据

一、质量控制

呼吸采集和VOC分析工作流程的一致性是获得可靠的生物标志物发现数据的关键。本节概述了如何监测工作流程,以确定离群的样品和技术差异的来源。

呼吸采集过程中的质量检查

为确保使用ReCIVA呼吸采样器成功采集呼吸,重要的是要检查呼吸活检面罩是否合适,检查鼻子或嘴周围是否有空气漏出。

在整个采集过程中,ReCIVA内的压力和二氧化碳水平被监测,以警告操作者面罩的泄漏、过度通气、通气不足、浅呼吸或其他不规则的呼吸曲线对VOC采集产生负面影响。实时反馈以纠正不良的采集技术。呼吸曲线和采样时间也与其他病人元数据一起被储存起来,以便为随后的数据分析提供信息。

偶尔,在项目规定的采集时间内可能无法采集到所需的呼吸量。在这种情况下,呼吸样本仍然可以被分析,但这个样本会被标记出来,以防呼吸量减少可能影响结果。

VOC分析过程中的质量控制

成功的VOC生物标志物发现需要一个强大的数据集,对各个VOC的水平进行高度准确的测量。一些VOC生物标志物可能存在于极低的水平,因此,分析技术必须高度敏感,背景水平要低。

Owlstone Medical已经实施了QC检查,每天和每周监测一系列的仪器参数,以确保VOC分析工作流程的高度敏感、准确和可重复性。

呼吸活检盒在呼吸采集前进行检查,并定期检测空白样本,以确保任何背景都低于阈值水平。一组具有一定浓度范围的标准化合物被用来检查线性度、检测极限和信噪比。

每个病人样本的VOC概况也会被检查,看是否存在预计在病人呼吸样本中超过某些阈值的化合物。在开始数据分析之前,这种质量控制是对分析是否成功的初步检查。

图. 含有D-柠檬烯的呼吸样本、空白采集样本和环境空气样本的比较。所有的样品都是使用ReCIVA呼吸采样器收集的,并使用TD-GC-MS进行分析。空白采集样品是使用CASPER便携式空气供应器模仿正常的呼吸采集而采集的。环境空气样品的采集没有使用CASPER便携式空气供应器。该图强调了测量环境VOCs的重要性,以区分不可避免的外部信号和呼吸VOCs产生的信号。此外,它还显示了尽量减少外部VOCs的污染以降低背景噪音的优势。

图. D-柠檬烯标准品在一定范围内应用于呼吸活检盒并使用TD-GC-FAIMS(Lonestar VOC分析仪)测量的校准图。观察到良好的线性关系,能够准确定量到0.2纳克柱上质量,相当于呼吸中约70万亿分之一(ppt),有可能检测到呼吸中低至35 ppt的D-柠檬烯。显示了良好的精确度;所显示的数据是在4个不同日子里分析的4-6个不同的VOC样品管的测量平均值(误差条代表1个标准差)。

二、数据分析

识别VOCs作为疾病的潜在生物标志物需要对原始数据进行处理和分析。为了促进这一过程,我们已经开发了数据分析管道,能够整合原始光谱数据、病人的临床和结果数据,并最终开发和输出分类算法,使用多种生物标志物来准确区分不同的试验组。所用的精确管道是根据每项研究的目标而定制的,以确保对一系列研究问题和临床需求的最佳结果。

图. 基于旨在区分病例样本和对照组的试验的VOC数据分析管道示例。管道是根据每项研究的具体目标定制的。

训练和测试数据集

所有的数据都要经过无监督的数据预处理,以产生校准的保留时间,并确定可用于统计分析的特征(FAIMS或质谱数据中的峰,或没有峰)。然后将数据分成具有统计学可比性的训练集和测试集,其中任何潜在的混杂因素都被平等地代表。任何与系统有关的特征都被排除。

图. 左上:总离子色谱图段。右图:22分钟时柠檬烯的部分质谱。左下:柠檬烯离子的提取色谱段(m/z = 93)。

分类器开发

利用训练数据集,我们应用机器学习来开发分类器,使用10倍分层交叉验证。将分类器应用于测试数据集,并对不同的偏差来源进行系统研究,以确定任何技术变化的来源,并验证分类器对混杂因素的稳健性。然后通过一个迭代过程进一步完善特征和分类器。

为了选择性能最好的分类器,用敏感性、特异性和ROC曲线下的面积来评估性能。

验证

使用一个独立的测试队列对候选的VOC生物标志物进行分析,以验证分类器的性能。

图. 调整控制状态和疾病状态之间的区分阈值可以使测试的阳性和阴性预测值得到优化。

验证性研究

在生物标志物鉴定项目结束时,我们将提供一份与研究目标有关的详细报告,并在可能的情况下,提供对结果的生物学解释。通常情况下,下一步是启动后续研究以验证分类器。

在验证研究中,最终确定的分类器被应用于外部盲法验证队列,该队列规模较大,能代表预期使用人群。该研究的目的是验证VOC生物标志物算法和分析仪器,它们共同构成了一个诊断测试。这提供了所需的证据,以支持进展到监管审批。

【系列合集预告】

至此,“呼气试验完全指南”系列文章已全部推送完毕。后续我们将汇总本系列全部文章内容,整理并发布完整版《呼气试验完全指南》合集指南报告(PDF版本),敬请关注。

—— 全文完 ——

【星标指引】

想第一时间收到《呼气试验完全指南》合集指南报告(PDF版本)的发布通知吗?欢迎把我们设为星标,只需 3 步:

第 1 步: 点击本文标题下方的蓝色公众号名称,进入公众号主页;

第 2 步: 点击主页右上角的「···」按钮;

第 3 步: 在弹出的菜单中选择「设为星标」。

设置成功后,公众号名称旁会显示一颗金色小星星 ⭐。此后我们的每一次推送都将优先展示在您的订阅号消息列表中,新文章与合集报告第一时间送达,精彩内容不再错过。