本文目录导读:

药物虚拟筛选(Virtual Screening)是现代药物发现中一个关键的计算方法,它通过计算机模拟技术,从海量的化合物库中快速筛选出可能具有生物活性的候选分子,从而大幅降低实验成本,缩短研发周期。
以下是关于药物虚拟筛选的全面解析,包括其核心概念、主要方法、流程、常用工具及面临的挑战。
核心概念与目标
- 定义:利用计算机算法,根据药物靶点(通常是蛋白质)的三维结构或已知活性分子的化学结构,对大型化合物库进行打分和排序,挑选出最有潜力与靶点结合并产生药理效应的化合物。
- 目标:
- 命中率提升:将实验筛选的百万级库缩小至几百或几千个候选物。
- 新颖性发现:发现全新骨架的化合物(不与现有药物结构雷同)。
- 先导化合物优化:预测化合物的代谢性质、毒性(ADMET性质),排除后期易失败的分子。
主要方法:两种经典范式
根据是否依赖靶点蛋白的三维结构,虚拟筛选主要分为两大策略:
基于结构的虚拟筛选 (SBVS,Structure-Based Virtual Screening)
这是目前主流的方法,依赖于靶点蛋白的高分辨率三维结构(来自X射线晶体学、冷冻电镜或同源建模)。
- 核心逻辑:将小分子对接到蛋白的结合位点(口袋),通过计算分子间相互作用力(如范德华力、静电作用、氢键、疏水作用)来评估结合能力。
- 关键技术:分子对接(Docking)。
- 算法:如AutoDock Vina、Glide、GOLD、DOCK等。
- 步骤:
- 准备蛋白质结构(加氢、去除水、优化)。
- 定义结合位点(活性口袋)。
- 生成配体构象(构象搜索)。
- 打分函数评估。
- 优点:直接针对靶点机制,适用于已知结构且机制明确的靶点。
- 缺点:过度依赖蛋白质结构的质量;计算量大,尤其是处理柔性蛋白时;打分函数不够精确,无法完美模拟真实结合自由能。
基于配体的虚拟筛选 (LBVS,Ligand-Based Virtual Screening)
当靶点结构未知,但已有一批已知具有活性的小分子(训练集)时使用。
- 核心逻辑:基于“结构相似的分子具有相似生物活性”的原理(药效团或相似性原理),通过已知活性分子的化学特征寻找新的类似物。
- 关键技术:
- 药效团模型:从一组活性分子中提取出对活性至关重要的共同化学特征(如氢键供体、受体、疏水中心、芳香环),然后用该模型匹配新分子。
- 形状相似性:比较分子的三维形状和静电分布(如ROCS软件)。
- 2D指纹相似性:将分子结构编码成二进制指纹(如Morgan指纹),通过计算Tanimoto系数寻找最相似的分子。
- 优点:无需蛋白质结构,速度快,适合先导化合物优化和骨架跃迁。
- 缺点:高度依赖已知活性数据的质量和多样性;泛化能力有限,难以发现全新骨架。
虚拟筛选的标准工作流程
通常将SBVS和LBVS结合使用,流程如下:
- 靶点准备:获取或建模靶点蛋白结构,优化并确定活性位点。
- 化合物库准备:整理公共或自建化合物库(如ZINC15、ChEMBL、Enamine REAL),生成三维构象,去除杂质和PAINS(泛干扰化合物。)过滤。
- 初步筛选:
- 通常先使用药效团模型或分子形状匹配(LBVS)快速过滤超大型库,将百万级缩小至万级。
- 或直接使用高速分子对接(如AutoDock Vina)进行初步对接。
- 精确对接与打分:对通过初筛的分子进行更精确的分子对接,使用多种打分函数(如Glide XP、ChemScore)进行交叉验证,重新排序。
- ADMET预测:使用ADMET预测软件(如ADMETlab、SwissADME)评估候选分子的吸收、分布、代谢、排泄和毒性,剔除有明显缺陷的分子。
- 聚类与视觉检查:对高分化合物进行聚类(选择不同骨架),并由化学家或计算化学家通过分子可视化软件(如PyMOL、ChimeraX)人工检查对接姿势,排除明显不合理的相互作用。
- 最终清单确认:得到100-200个候选分子,用于后续的实验验证(如体外酶活实验、细胞实验)。
常见工具与平台
| 类别 | 软件/平台 | 特点 | 适用场景 |
|---|---|---|---|
| 分子对接 | AutoDock Vina | 开源,速度快,适用于Linux/Windows | 学术界主流,适合中等规模筛选 |
| Glide(Schrödinger) | 商业软件,精度高,范德华力网格优化 | 制药工业标准 | |
| MOE | 商业软件,集成分子对接、药效团、QSAR | 综合性药物设计平台 | |
| 药效团/相似性 | ROCS(OpenEye) | 形状+静电相似性,速度快 | 骨架跃迁(Scaffold Hopping) |
| Pharmacophore(MOE/Discovery Studio) | 特征匹配 | 已知活性分子的衍生 | |
| 化合物库 | ZINC15 | 免费,包含数亿个可购买化合物 | 筛选起点 |
| Enamine REAL | 商业,巨型集合(>20亿) | 筛选后可快速合成 | |
| ADMET预测 | SwissADME | 免费在线 | 快速评估 |
| ADMETlab 2.0 | 免费在线,多模型集成 | 综合预测 |
挑战与最新进展
挑战:
- 蛋白质柔性:许多靶点蛋白在结合时会发生构象变化(诱导契合),刚性的对接模型可能漏掉正确结合姿势。解决方法: 使用基于分子动力学模拟的柔性对接(如AutoDock FR)或多构象对接。
- 打分函数不精确:至今还没有一个完美的公式能准确预测结合自由能(ΔG),许多高分分子在实验测定时活性很差。
- 假阳性与假阴性:筛选结果中常包含大量结合位点外的非特异性结合分子(假阳性),或漏掉因构象变化而结合的分子(假阴性)。
- 数据质量:蛋白质结构的分辨率、配体数据的活性值差异都会影响模型效果。
最新进展:
- 基于深度学习的虚拟筛选(DLSB):
- AI分子对接:AlphaFold 3 和 RoseTTAFold All-Atom,它们不仅能预测蛋白质结构,还能直接预测蛋白-小分子复合物的结构,精度极高。
- 深度神经网络打分函数:如 DeepDTA、OnionNet,利用图神经网络(GNN)或3D卷积网络直接从分子和蛋白结构中学习结合亲和力,比传统打分函数更准确。
- 生成式AI:利用生成对抗网络(GAN)或变分自编码器(VAE)直接从靶点结构“创造”全新药物分子(如MoleculeKit、REINVENT),而不是仅仅筛选现有库。
- 虚拟筛选与实验的深度融合:虚拟筛选结果直接指导DNA编码化合物库(DEL) 的构建,或与超大规模筛选(如阿斯利康的虚拟筛选平台)结合,实现千万级分子测试。
- 超大规模虚拟筛选:利用云计算和GPU加速,对接库从百万级提升至数十亿级(Berkeley大学的Ultra-large Virtual Screening)。
- 针对难成药靶点:虚拟筛选被用于共价抑制剂(寻找共价结合位点)、蛋白-蛋白相互作用(PPI) 抑制剂(寻找热点残基)、PROTACs 设计(同时对接两个配体)等前沿领域。
- 高度依赖数据与结构:准确度取决于靶点结构已知性和活性数据质量。
- “海选”而非“定论”:虚拟筛选是筛选工具,不是验证工具,所有计算预测的候选分子必须经过实验确认(体外酶活、细胞活性、ADMET实验)。
- 组合策略效果更优:最好的实践是将SBVS、LBVS和AI预测结合使用,形成多层次筛选漏斗。
- 未来方向:随着人工智能(特别是AlphaFold类模型和生成式模型)和超大规模计算的发展,虚拟筛选正在从“辅助工具”迈向“核心引擎”,极大地改变了药物发现的范式。
一个简单例子:假设要寻找治疗新冠的3CL蛋白酶抑制剂:
- 使用AlphaFold2获得3CL蛋白的可靠结构(SBVS基础)。
- 下载ZINC15库中基于药效团(如半胱氨酸可共价结合的亲电基团)过滤后的子集。
- 用AutoDock Vina将过滤后的约50万分子对接到蛋白活性位点。
- 保留打分数最高的前2000个分子。
- 用SwissADME预测这些分子的口服药物性(Lipinski规则),得到约300个合格分子。
- 用深度学习打分函数(如OnionNet)对这300个重排序,取前50个。
- 实验采购或合成这50个分子做酶活性测试,最终可能发现2-5个真实有效的hit。
虚拟筛选正处于从“计算辅助”到“计算驱动”的转折点,是药企节省超80%实验成本的关键技术之一,如果你想针对某个具体靶点(如EGFR、KRAS)或某种方法(如共价对接、AI打分)深入讨论,随时可以继续提问,我们来详细探讨一下“药物虚拟筛选”这个主题,这是一个将计算科学、化学和生物学结合,用于加速药物发现过程的关键技术。
药物虚拟筛选就像是计算机上的“海选”,它利用强大的计算能力,从包含数百万甚至数十亿个分子的庞大化合物“海洋”中,快速找出最有可能与特定疾病靶点(比如一个蛋白质)结合,并产生治疗效果的那些分子,这样可以极大地缩小实验验证的范围,节省大量时间、金钱和资源。
下面,我将从几个核心方面为你拆解这项技术。
为什么需要虚拟筛选?
传统的药物发现流程中,寻找“先导化合物”通常需要进行高通量筛选,即用机器人自动测试成千上万个化合物,这成本高、耗时长、成功率低。
虚拟筛选的优势在于:
- 速度快:计算机一秒钟可以筛选成千上万个化合物,几天内就能完成实验需要数月的工作。
- 成本低:避免了大量昂贵的实验试剂和耗材。
- 拓展化学空间:可以探索罕见的、甚至还未被合成的虚拟分子库。
- 减少盲目性:为实验验证提供明确的方向和优先级。
两大核心策略
虚拟筛选的核心思想围绕着“锁和钥匙”的比喻,主要有两种策略,经常结合使用。
基于结构的虚拟筛选 (Structure-Based Virtual Screening, SBVS)
- 原理:如果知道“锁”(即靶点蛋白)的三维结构,就可以通过分子对接技术,把“钥匙”(候选化合物)一个个放进去试,看哪一把能最好地匹配。
- 分子对接:计算机会计算配体(小分子)和受体(蛋白)之间的结合姿势和结合能,结合能越低,说明结合越稳定,化合物越有潜力。
- 优点:直接针对靶点的作用机制,解释性强。
- 关键输入:靶点蛋白的高分辨率三维结构(来自X射线晶体学、冷冻电镜或AlphaFold预测)。
- 核心软件:AutoDock Vina, Glide, GOLD, MOE Docking.
基于配体的虚拟筛选 (Ligand-Based Virtual Screening, LBVS)
- 原理:如果不知道“锁”的结构,但已经拥有几把能打开类似锁的“钥匙”(已知有活性的化合物),就可以通过分析这些已知钥匙的共同特征,去寻找新的钥匙。
- 药效团模型:提取已知活性分子中共同的关键化学特征(如氢键供体/受体、疏水中心、带正电/负电基团)及其空间位置,形成一个三维“模板”,然后用这个模板去匹配新分子。
- 相似性搜索:比较新分子与已知活性分子在化学结构或形状上的相似度,结构相似,功能也可能相似。
- 优点:不需要靶点蛋白的结构,速度非常快,适用于发现骨架新颖的化合物(骨架跃迁)。
- 核心方法:药效团建模、分子指纹(如ECFP4)和相似度计算(如Tanimoto系数)。
- 常用软件:Phase, ROCS, MOE Pharmacophore, OpenBabel。
工作流程是怎样的?
一个典型的虚拟筛选项目通常遵循以下“漏斗式”流程:
- 靶点准备:获取或建模靶点蛋白三维结构,优化(如加氢、去除水分子、定义活性口袋)。
- 化合物库准备:下载或构建大型化合物库(如ZINC, ChEMBL, Enamine),并进行初步过滤(比如去掉反应性基团、不符合药企规则的分子)。
- 初步筛选:使用计算量小的快速方法(如药效团模型、类药性规则)快速剔除大量最不可能的分子,将百万级库缩减到万级。
- 精确对接与打分:对剩余分子进行高精度分子对接,使用多种打分函数进行评估和排序。
- ADMET预测:评估候选分子的吸收、分布、代谢、排泄、毒性(ADMET性质),剔除那些可能具有毒性或代谢太快的分子。
- 视觉检查与整合:计算化学家会用三维可视化软件逐一检查高分分子的对接姿势,结合经验排除明显不合理的结合方式。
- 最终候选列表:提供精选后的几十到几百个分子,交付实验科学家进行体外生物活性测试。
当前面临的主要挑战
虽然强大,但虚拟筛选并非万能:
- 蛋白质柔性:蛋白不是僵硬的,它会与配体发生“诱导契合”,静态对接难以完全模拟这种动态过程,解决方法是采用柔性对接或分子动力学模拟。
- 打分函数不精确:目前的打分函数大多简化了复杂的物理化学过程,难以准确预测水和溶剂分子的影响、熵效应等,导致排名靠前的分子在实验中可能没有活性(假阳性)。
- 数据质量依赖:预测结果高度依赖于输入数据的质量,如果靶点结构分辨率低或已知配体数据不可靠,结果就会打折扣。
- 计算资源需求:对超大型库(数十亿分子)进行高精度对接仍是巨大的挑战。
最新进展与未来趋势
虚拟筛选正随着人工智能的发展而经历革命:
- 深度学习驱动的对接和打分:例如AlphaFold 3和RoseTTAFold All-Atom不仅预测蛋白结构,还能直接预测蛋白-小分子复合物结构,精度显著提升,深度神经网络(如DenseFP, OnionNet)被训练来学习更精确的结合亲和力。
- 生成式AI:生成式对抗网络(GAN)和变分自编码器(VAE)等模型可以根据靶点结构“设计”出全新的分子,而不仅仅是筛选现有库。
- 超大规模虚拟筛选:利用云计算和GPU加速,科学家可以对数十亿级别的虚拟化合物库进行对接筛选,比如Enamine公司的REAL数据库。
- 针对难成药靶点:虚拟筛选技术正被应用于蛋白质-蛋白质相互作用(PPI)、共价抑制剂、PROTACs(靶向蛋白降解)等前沿领域。
药物虚拟筛选是连接计算与实验的桥梁,是现代药物发现工具箱中不可或缺的利器,它远非“一键生成”的简单过程,而是一个结合了结构生物学、计算化学、药物化学和计算机科学的精妙系统工程。
它不承诺完美答案,但能高效地将寻找答案的范围从“大海捞针”缩小到“碗里寻珠”。
如果你想深入了解某个具体方面,
- 某个特定软件(如AutoDock Vina)的使用方法?
- 如何评估一个虚拟筛选项目的可靠性?
- 深度学习在其中的具体应用案例?
欢迎继续提问,我们可以一起深入探讨。