从“雾里看花”到“三重确证”:非靶向代谢组学Level 1鉴定如何构建可信证据链

非靶向代谢组学的技术价值已获公认,但其临床与生物学意义的真正落地,取决于定性结果的相对可靠性——代谢物注释不能止于数据库的“最优猜测”,而应该是可复核、可佐证的确定性结论。一旦定性环节出现较高的错配或假阳性,后续功能解读、通路富集、验证实验乃至临床转化都将建立在不可靠的数据基础上,不仅拉低验证成功率,更直接削弱研究的可信支撑。
那么在非靶向代谢组学“先天定性不够精准”的条件下,科研学者会思考:为什么很多“非靶代谢物名字”不可信,以及什么样的结果才能经受住顶级期刊的拷问?
Gentry 等人2024年在《Nature》上的研究指出,典型的人类非靶代谢组学研究通常只能对约10% 的检测信号给出结构注释[1]。Salido 等人2025年在《Cell》上的研究中,利用 GNPS 公共谱库对检测到的特征进行注释,结果符合 2007 年 MSI Level 2/3(谱库/候选结构)的仅占约3%;再进一步用商业标准品通过二级质谱与保留时间(RT)双重确认,达到 MSI Level 1 的更是只有7%[2]。

图1 Level 1 鉴定实证案例:保留时间与二级质谱双匹配(红色实测样本;黑色标品)[2]
2.1 陷阱一:谱图库越大,假阳性“盛宴”越狂欢
很多人误以为数据库越大,鉴定就越准。事实恰恰相反。Scheubert 等人2017年在《Nature Communications》上指出,谱库扩容会引入海量异构体与同系物,构成庞大的“随机匹配池”,使得非真实结构更易获得高分值,放大了统计噪音,而非提升可信度[3]。

以“假谱图”(谱图扩容,产生大量结构相似物质)为随机匹配的参照。图中p值表征随机匹配产生当前分数或更高分数(零假设成立)的概率,p值越小,匹配的随机性越低,可信度越高。但图中数据显示,即便p值趋近于0,其对应的假发现率(FDR)仍不容忽视,说明假阳性注释隐藏在“高置信度p≈0”的统计表象之下。
图2 高匹配分≠正确答案[3]
2.2 陷阱二:AI预测注释工具,单独命中率低得惊人
为了弥补标准品库的不足,MetFrag、CFM-ID、MS-FINDER等in silico预测工具被广泛使用。但Blazenović 等人对2016年CASMI挑战赛数据的分析显示,单个工具在训练集上的top-rank正确率仅为10%-17%;即便组合判断,也仅提升至约22%[4]。
如何科学地评价一个代谢物名字的可信度?2007年,代谢组学标准倡议(MSI)提出了四级分类系统[5]。2014年,Schymanski 等进一步细化为五级体系,其中:定性等级最高的Level 1必须使用真实标准品,样本在同一分析条件下匹配标准品的一级质谱、二级质谱和保留时间(RT)[6]。

图3 代谢物鉴定置信度等级图 [6]
保留时间(RT):化合物在色谱柱中从进样到检测到最大信号强度时所经过的时间,固定条件下具有高度重现性,是独立于质谱的正交证据。
一级质谱(MS¹):检测所有离子化化合物的精确质荷比(m/z)与信号强度,用于确定分子式,是鉴定的初筛依据。
二级质谱(MS/MS):筛选特定母离子并打碎后检测碎片谱图,反映化合物结构信息,是区分异构体、确证化学结构的关键证据。
MSI 仅给出鉴定置信度的原则框架,并未对保留时间偏差、质量偏差、二级谱匹配打分给出统一量化阈值。这也意味着,同样是“Level 1”,不同来源的结果可能遵循着宽严迥异的实证标准。
行业严苛标准,一方面来自标杆企业 Metabolon 的商业化落地实践:自建 5400 + 纯品的大规模真实标准品库,执行严苛鉴定流程(RT 偏差≲±0.1 min;一级偏差≤±10 ppm;二级匹配打分≥0.8)[7、8],其 HD4 平台固化仪器、前处理、流动相等全部参数,保障数据跨项目可比;另一方面则体现在《Cell》《Nature》等顶刊公开发表的数据质控参数中(RT 偏差≤±0.5min;一级偏差≤±10 ppm;二级匹配打分≥0.7)[9-12]。

图4 顶刊中level 1定性卡值参数 [9-12]
我司的非靶代谢组-精准版产品,鉴定逻辑全面对标行业标杆,特别是level1交付结果。
真正的MSI Level 1,从来不是一个营销标签,而是一套公认、逐项可查的科学证据链。我们交付的,从来不是一份冷冰冰的代谢物清单,而是每一个名字背后,经得起反复质询的置信度。
* 向下滑动查看详情
中科优品推荐
【中科新生命】非靶代谢组——精准版!自建病生理知识库:覆盖上万种代谢物的深度功能注释。高端仪器+超长分离梯度+多维质控:数据硬核,结果可信。 顶刊级分析思路:从生物学视角精准锁定标志物。 做组学找中科!让你的研究少走弯路,直通顶刊!
滑动图片查看更多>>>
关于中科新生命
上海中科新生命生物科技有限公司(APTBIO)创立于 2004 年,由原中国科学院上海生命科学研究院蛋白质组研究中心孵化而来,是国内质谱多组学应用领域的开拓者。公司以 “AI + 质谱多组学” 双核驱动创新,构建智能化组学生态。拥有自主知识产权的质谱检测平台与 AI 大数据分析系统,聚焦科技服务、生物医药及大健康消费三大领域,为全球科研机构、医院、药企提供从基础研究到临床转化的一站式解决方案。融合多组学技术与人工智能,围绕生物标志物发掘、药物靶点筛选及个性化诊疗等方向,构建具有国际竞争力的组学数据库与算法模型,推动转化医学进程,加速创新药物研发,成为推动生命科学数字化升级的核心引领者。






