本文目录导读:

代谢通路富集分析(Metabolic Pathway Enrichment Analysis)是生物信息学中的一种核心分析方法,主要用于解释高通量数据(如转录组、蛋白质组、代谢组)背后的生物学意义。
它的目的是:当你有一堆差异表达的基因或差异代谢物时,找出它们主要参与了哪些关键的代谢通路,而不是随机地、孤立地出现在各个地方。
以下是关于该方法的详细通俗解释:
核心逻辑:从“点”到“线”
- 问题背景:你通过实验得到了100个差异基因,直接看这100个基因的名字,你很难得出结论,可能其中3个基因和“糖酵解”有关,5个和“脂肪酸氧化”有关……但这些关系是随机发生的,还是有统计学意义的集中?
- 解决方案:把已知的、功能相关的基因组(如“三羧酸循环”中的所有基因)视为一个集,然后看你这100个差异基因是否显著地、集中地出现在某个特定的集中。
通俗比喻:寻宝游戏
想象一个大型图书馆(整个生物体),里面有无数的书籍(全部基因/代谢物)。
- 书架分类:图书馆按照主题把书分门别类放到不同的架子上(代谢通路,如“糖代谢架子”、“脂代谢架子”)。
- 你搜到的书:你通过实验找到了一些“特殊”的书籍(差异基因/差异代谢物)。
- 富集分析:你需要判断,这些特殊书籍是:
- 随机分布:每个架子上都偶尔有一两本,没有规律。
- 显著富集:绝大多数特殊书籍都集中在“能量代谢”这个架子上。
- 如果发现很多特殊书都集中在“能量代谢”架子,就说明你的实验条件(比如某种药物处理、某种疾病状态)很可能强烈影响了能量代谢这条通路。
经典分析方法(以基因/转录组为例)
常见的方法有两类:
A. 过表达分析(ORA - Over-Representation Analysis)
这是最常用的方法,本质上是一个统计学检验(如Fisher精确检验或卡方检验)。
- 输入:一个差异基因列表(比如筛选出的上调/下调基因)。
- 背景:所有检测到的基因总数。
- 数据库:KEGG、Reactome、WikiPathways 等。
- 判断依据:
- 列出某个通路(Pathway A)中包含的所有基因。
- 计算你的差异基因中,有多少比例落在了Pathway A里。
- 这个比例是否显著高于随机概率?如果是,则称为富集。
- 输出一个P值,P越小,富集的统计显著性越高。
B. 基因集富集分析(GSEA - Gene Set Enrichment Analysis)
ORA的缺陷是它需要你事先设定一个“差异基因”的阈值(fold change > 2,p < 0.05),这可能会丢失一些微弱但一致的信号。
- 方法:它不要求挑选差异基因,而是使用所有基因,按照它们在两组间的变化程度(如表达量的log fold change)从高到低排序。
- 逻辑:看某个通路的基因集,是集中出现在排序列表的顶部(高表达)还是底部(低表达),如果显著集中在顶部,就说明该通路被“激活”了。
- 优点:更敏感,能捕捉到通路内基因表达量协调一致但变化幅度不大的情况。
常用数据库
进行富集分析时,需要依赖权威的数据库,最常用的有:
- KEGG:最经典的通路数据库,包含代谢通路、信号转导通路等。
- GO:基因本体论,包括生物过程(BP)、细胞组分(CC)、分子功能(MF),虽然不完全是“代谢通路”,但功能很类似。
- Reactome:手工注释的、更详细的路径数据库。
- WikiPathways:开放、协作的通路数据库。
结果解读:火山图与气泡图
富集分析的结果通常用气泡图展示:
- X轴:富集因子(Rich Factor,即通路中富集到的基因数占该通路总基因数的比例),越大说明富集程度越高。
- Y轴:通路的名称。
- 气泡大小:表示该通路中富集到的基因数量。
- 气泡颜色:表示P值(或调整后的P值,如FDR),颜色越红(通常代表P值越小),统计显著性越高。
示例解读:在癌症样本中,糖酵解/糖异生”通路的气泡很大且颜色很红,说明癌细胞很可能发生了Warburg效应(有氧糖酵解增强)。
为什么要做?
- 从数据到机理:把上百个零散的差异基因/代谢物,归因到少数几个关键的、有生物学含义的通路(如“癌细胞能量代谢异常”、“炎症通路激活”)。
- 寻找热点:快速锁定导致表型变化的核心调控事件。
- 假设生成:为后续的机制验证实验(比如敲低某个关键通路中的关键酶)提供线索。
如果你正在进行组学数据分析,通常可以在 R 语言(通过 clusterProfiler 包)或在线网站(如 DAVID、MetaboAnalyst)上轻松完成这一步。