新闻资讯

从“雾里看花”到“三重确证”:非靶向代谢组学Level 1鉴定如何构建可信证据链

2026-08-28
中科新生命
4

非靶向代谢组学的技术价值已获公认,但其临床与生物学意义的真正落地,取决于定性结果的相对可靠性——代谢物注释不能止于数据库的“最优猜测”,而应该是可复核、可佐证的确定性结论。一旦定性环节出现较高的错配或假阳性,后续功能解读、通路富集、验证实验乃至临床转化都将建立在不可靠的数据基础上,不仅拉低验证成功率,更直接削弱研究的可信支撑。

那么在非靶向代谢组学“先天定性不够精准”的条件下,科研学者会思考:为什么很多“非靶代谢物名字”不可信,以及什么样的结果才能经受住顶级期刊的拷问?

 

 

一、灵魂拷问:你拿到的非靶代谢组结果,有多少是“真名实姓”?

Gentry 等人2024年在《Nature》上的研究指出,典型的人类非靶代谢组学研究通常只能对约10% 的检测信号给出结构注释[1]。Salido 等人2025年在《Cell》上的研究中,利用 GNPS 公共谱库对检测到的特征进行注释,结果符合 2007 年 MSI Level 2/3(谱库/候选结构)的仅占约3%;再进一步用商业标准品通过二级质谱与保留时间(RT)双重确认,达到 MSI Level 1 的更是只有7%[2]

图1 Level 1 鉴定实证案例:保留时间与二级质谱双匹配(红色实测样本;黑色标品)[2]

 

揭示了一个残酷的真相:非靶数据中绝大部分信号,要么没有名字,要么名字的可信度如同“雾里看花”。

 

 

二、为什么不可信?——两大“信任陷阱”

2.1 陷阱一:谱图库越大,假阳性“盛宴”越狂欢

很多人误以为数据库越大,鉴定就越准。事实恰恰相反。Scheubert 等人2017年在《Nature Communications》上指出,谱库扩容会引入海量异构体与同系物,构成庞大的“随机匹配池”,使得非真实结构更易获得高分值,放大了统计噪音,而非提升可信度[3]

以“假谱图”(谱图扩容,产生大量结构相似物质)为随机匹配的参照。图中p值表征随机匹配产生当前分数或更高分数(零假设成立)的概率,p值越小,匹配的随机性越低,可信度越高。但图中数据显示,即便p值趋近于0,其对应的假发现率(FDR)仍不容忽视,说明假阳性注释隐藏在“高置信度p≈0”的统计表象之下。

图2 高匹配分≠正确答案[3]

具体而言,谱库匹配至少面临三重困境:

 

 

 

 

 

 

 

 

第一,异构体与同位素的“隐形干扰”。 异构体(如亮氨酸/异亮氨酸)常在一级质谱中无法区分,部分甚至二级质谱与保留时间也高度相似;加合离子和源内碎片的归属错误,同样会误导鉴定结果。

 

第二,谱库的“跨平台失效”。 公共谱库(如NIST、HMDB、METLIN)虽涵盖广泛,但谱图来自不同仪器与色谱条件,保留时间与谱图难以跨平台复用。唯有自建谱图——且其检测参数与实际样本分析条件完全一致——方能为鉴定提供真实有效的参照依据。

 

第三,库容膨胀带来“随机命中率”飙升。 库越大,意味着“总能撞上一个像的”。当匹配高分沦为随机噪声的狂欢,假阳性便不再是个例,而是必然。

 

 

 

 

 

 

 

 

 

2.2 陷阱二:AI预测注释工具,单独命中率低得惊人

为了弥补标准品库的不足,MetFrag、CFM-ID、MS-FINDER等in silico预测工具被广泛使用。但Blazenović 等人对2016年CASMI挑战赛数据的分析显示,单个工具在训练集上的top-rank正确率仅为10%-17%;即便组合判断,也仅提升至约22%[4]

 

 

三、什么是可信的?——MSI:一套国际公认的评价系统

如何科学地评价一个代谢物名字的可信度?2007年,代谢组学标准倡议(MSI)提出了四级分类系统[5]。2014年,Schymanski 等进一步细化为五级体系,其中:定性等级最高的Level 1必须使用真实标准品,样本在同一分析条件下匹配标准品的一级质谱、二级质谱和保留时间(RT)[6]

图3 代谢物鉴定置信度等级图 [6]

保留时间(RT):化合物在色谱柱中从进样到检测到最大信号强度时所经过的时间,固定条件下具有高度重现性,是独立于质谱的正交证据。

一级质谱(MS¹):检测所有离子化化合物的精确质荷比(m/z)与信号强度,用于确定分子式,是鉴定的初筛依据。

二级质谱(MS/MS):筛选特定母离子并打碎后检测碎片谱图,反映化合物结构信息,是区分异构体、确证化学结构的关键证据。

那么,在MSI体系的框架下,一个真正可信的level1代谢物鉴定,必须经得起三个追问:

 

 

 

 

 

 

 

 

1.有没有真实标准品在同一平台、同一条件下跑过?

2.除了m/z,有没有RT和MS/MS作为独立正交证据?

3.能否提供标准品与样本中该物质的原始谱图供核验?

 

 

 

 

 

 

 

 

 

 

四、level 1——行业标杆的鉴定参数

MSI 仅给出鉴定置信度的原则框架,并未对保留时间偏差、质量偏差、二级谱匹配打分给出统一量化阈值。这也意味着,同样是“Level 1”,不同来源的结果可能遵循着宽严迥异的实证标准

行业严苛标准,一方面来自标杆企业 Metabolon 的商业化落地实践:自建 5400 + 纯品的大规模真实标准品库,执行严苛鉴定流程(RT 偏差≲±0.1 min;一级偏差≤±10 ppm;二级匹配打分≥0.8)[7、8],其 HD4 平台固化仪器、前处理、流动相等全部参数,保障数据跨项目可比;另一方面则体现在《Cell》《Nature》等顶刊公开发表的数据质控参数中(RT 偏差≤±0.5min;一级偏差≤±10 ppm;二级匹配打分≥0.7)[9-12]

图4 顶刊中level 1定性卡值参数 [9-12]

 

 

五、我司如何鉴定代谢物?

我司的非靶代谢组-精准版产品,鉴定逻辑全面对标行业标杆,特别是level1交付结果。

 

 

 

 

 

 

 

 

5.1 自建标准品库:锚定MSI Level 1的“物质基础”

我们已建立并持续扩充in-house真实标准品库,每一种标准品均在本平台同一色谱-质谱体系下完成检测,逐项记录精确质量数(m/z)、保留时间(RT)及MS/MS二级谱图,形成可直接溯源的多维参考记录——这正是MSI Level 1鉴定所要求的“实证锚点”。

 

5.2 “三重匹配”硬标准:实证门槛

我们严格执行与行业标杆同等级别的鉴定准入标准,三重证据,缺一不可。三项全部满足,方可报告为Level 1确认鉴定,未全达标者降低鉴定级别,不使用自定义的“权重”或“高置信度”等模糊表述混淆level 1概念。

 

5.3 证据链全透明:经得起拷问

我们交付的不仅是一个鉴定结果,对关注物质可提供谱图证据,确保您对核心结果的可靠性有信心。

图5 中科标品库物质分类及实测项目物质谱图

 

 

 

 

 

 

 

 

 

 

六、总结

真正的MSI Level 1,从来不是一个营销标签,而是一套公认、逐项可查的科学证据链。我们交付的,从来不是一份冷冰冰的代谢物清单,而是每一个名字背后,经得起反复质询的置信度。

 

 

参考文献:

1.Gentry, E. C., Collins, S. L., Panitchpakdi, M., et al. (2024). Reverse metabolomics for the discovery of chemical structures from humans. Nature, 626(7998), 419–426. doi:10.1038/s41586-023-06906-8

2.Salido, R. A., Zhao, H. N., McDonald, D., et al. (2025). The International Space Station has a unique and extreme microbial and chemical environment driven by use patterns. Cell, 188(7), 2022–2041.e23. doi:10.1016/j.cell.2025.01.039

3.Scheubert, K., Hufsky, F., Petras, D., Wang, M., Nothias, L.-F., Dührkop, K., Bandeira, N., Dorrestein, P. C., & Böcker, S. (2017). Significance estimation for large scale metabolomics annotations by spectral matching. Nature Communications, 8(1), 1494. doi:10.1038/s41467-017-01318-5

4.Blaženović, I., Kind, T., Torbašinović, H., Obrenović, S., Mehta, S. S., Tsugawa, H., Wermuth, T., Schauer, N., Jahn, M., Biedendieck, R., Jahn, D., & Fiehn, O. (2017). Comprehensive comparison of in silico MS/MS fragmentation tools of the CASMI contest: database boosting is needed to achieve 93% accuracy. Journal of Cheminformatics, 9(1), 32. doi:10.1186/s13321-017-0219-x

5.Sumner, L. W., Amberg, A., Barrett, D., Beale, M. H., Beger, R., Daykin, C. A., Fan, T. W.-M., Fiehn, O., Goodacre, R., Griffin, J. L., Hankemeier, T., Hardy, N., Harnly, J., Higashi, R., Kopka, J., Lane, A. N., Lindon, J. C., Marriott, P., Nicholls, A. W., … Viant, M. R. (2007). Proposed minimum reporting standards for chemical analysis. Metabolomics, 3(3), 211–221. doi:10.1007/s11306-007-0082-2

6.Schymanski, E. L., Jeon, J., Gulde, R., Fenner, K., Ruff, M., Singer, H. P., & Hollender, J. (2014). Identifying small molecules via high resolution mass spectrometry: communicating confidence. Environmental Science & Technology, 48(4), 2097–2098. doi:10.1021/es5002105

7.Evans, A. M., DeHaven, C. D., Barrett, T., Mitchell, M., & Milgram, E. (2009). Integrated, nontargeted ultrahigh performance liquid chromatography/electrospray ionization tandem mass spectrometry platform for the identification and relative quantification of the small-molecule complement of biological systems. Analytical Chemistry, 81(16), 6656–6667. doi:10.1021/ac901536h

8.Ford, L., Kennedy, A. D., Goodman, K. D., et al. (2020). Precision of a clinical metabolomics profiling platform for use in the identification of inborn errors of metabolism. The Journal of Applied Laboratory Medicine, 5(2), 342–356. doi:10.1093/jalm/jfz026

9.Liang, L., Rasmussen, M. L. H., et al. (2020). Metabolic Dynamics and Prediction of Gestational Age and Time to Delivery in Pregnant Women. Cell, 181(7), 1680 1692.e15. doi:10.1016/j.cell.2020.05.002

10.Gentry, E. C., Collins, S. L., et al. (2024). Reverse metabolomics for the discovery of chemical structures from humans. Nature, 626(7998), 419–426. doi:10.1038/s41586 023 06906 8

11.Shen, B., Yi, X., Sun, Y., et al. (2020). Proteomic and Metabolomic Characterization of COVID 19 Patient Sera. Cell, 182(1), 59 72. doi:10.1016/j.cell.2020.05.032

12.Mannochio Russo, H., Charron Lamoureux, V., et al. (2025). The microbiome diversifies long  to short chain fatty acid derived N acyl lipids. Cell, 188(15), 4154 4169.e19. doi:10.1016/j.cell.2025.05.015

 

* 向下滑动查看详情

 

中科优品推荐

【中科新生命】非靶代谢组——精准版!自建病生理知识库:覆盖上万种代谢物的深度功能注释。高端仪器+超长分离梯度+多维质控:数据硬核,结果可信。 顶刊级分析思路:从生物学视角精准锁定标志物。 做组学找中科!让你的研究少走弯路,直通顶刊!

滑动图片查看更多>>>

 

 

 

 

关于中科新生命

 

 

上海中科新生命生物科技有限公司(APTBIO)创立于 2004 年,由原中国科学院上海生命科学研究院蛋白质组研究中心孵化而来,是国内质谱多组学应用领域的开拓者。公司以 “AI + 质谱多组学” 双核驱动创新,构建智能化组学生态。拥有自主知识产权的质谱检测平台与 AI 大数据分析系统,聚焦科技服务、生物医药及大健康消费三大领域,为全球科研机构、医院、药企提供从基础研究到临床转化的一站式解决方案。融合多组学技术与人工智能,围绕生物标志物发掘、药物靶点筛选及个性化诊疗等方向,构建具有国际竞争力的组学数据库与算法模型,推动转化医学进程,加速创新药物研发,成为推动生命科学数字化升级的核心引领者。