首页 > 科研进展 > 正文

我组研发面向公共代谢组数据资源挖掘与利用的跨平台数据整合新方法

作者:时间:2026-09-30点击数:

近日,我组在公共代谢组数据资源的挖掘与利用方面取得新进展,研发了不依赖代谢物结构注释的跨平台数据整合方法X-Align。该方法利用MS/MS谱图蕴含的结构相关线索,将不同平台获得的代谢特征映射到统一的参考色谱体系中,获得可比较的保留信息,进而实现不同平台、研究间代谢特征的高可信对齐,为大规模公共代谢组数据的跨研究整合、深度挖掘与再利用提供工具。

随着非靶向代谢组学数据快速积累,公共数据库已成为重要的数据资源。如何突破不同实验室间色谱条件、质谱平台和采集参数差异,以及大量代谢特征缺乏可靠结构注释等限制,实现跨研究、跨中心的数据整合与再利用,已成为代谢组学领域的重要挑战。

针对该挑战,研究团队构建了Align-ID深度学习模型,以MS/MS谱图嵌入表征为输入,利用804,150张高分辨MS/MS谱图训练模型,预测代谢特征在METLIN SMRT参考色谱体系中的保留行为,进一步结合参考保留行为和谱图相似性,建立了X-Align跨平台特征对齐策略。跨平台基准测试表明,X-Align在52.3%的覆盖度下实现了99.6%的对齐准确率。进一步将X-Align应用于GNPS/MassIVE中的公共血浆代谢组数据集,建立了包含1,402个跨中心一致性代谢特征和60,688张MS/MS谱图的血浆代谢特征库。高脂饮食小鼠的跨中心代谢组学研究验证了其在不同研究间挖掘一致性代谢变化的应用能力。

相关研究成果以“X-Align: Annotation-Independent Cross-Platform Alignment of Untargeted Metabolomics Features”为题发表在Chemical Science上。该工作的第一作者为我组博士研究生包涵。该工作得到国家自然科学基金、大连化物所创新基金项目等资助。(文/图 包涵、 路鑫)

文章链接:https://doi.org/10.1039/D6SC04644D

Laboratory of High Resolution Separation/Analysis and Metabonomics   Dalian Institute of Chemical Physics, Chinese Academy of Sciences. All Rights Reserved.
中国科学院大连化学物理研究所  生物分子高分辨分离分析及代谢组学研究组(1808组)
地址: 大连市中山路457号, 邮编: 116023 电话: 0411-84379531; 传真: 0411-84379559     Email: g1808@dicp.ac.cn