1. 问题背景
从头设计结合物(de novo binder design)是计算生物学的核心挑战之一。现有方法如RFdiffusion、BindCraft、AlphaProteo各有侧重,但普遍存在两个局限:一是针对特定类型生物分子优化,泛化能力有限;二是在与训练数据相似的靶标上测试,外推能力存疑。
BoltzGen(Stark et al., 2025)试图用单一全原子生成模型同时解决设计和结构预测两类任务,并在9个与PDB中已知结合结构序列相似度低于30%的"新靶标"上进行湿实验验证。
2. 模型架构
BoltzGen的架构基于Boltz-2/AlphaFold3,分为Trunk和Diffusion Module两部分。Trunk负责编码输入条件(靶标结构、结合位点、共价键约束等),通过PairFormer栈生成token和pair表示;Diffusion Module在Trunk输出的条件上,通过去噪过程生成全原子3D坐标。
关键创新在于"几何编码":设计残基的氨基酸类型不是用离散token表示,而是用虚拟原子在主链原子上的位置分布来编码。例如,脯氨酸用7个原子放在主链氧原子上表示,苏氨酸用3个放在氮上、4个放在氧上。这使得整个生成过程在连续空间中进行,无需混合离散和连续表示,从而可以联合训练折叠和设计任务。
扩散过程沿用Boltz-2的公式:dX_t = sqrt(2t)dB_t,通过去噪器D_θ(x,t;z)近似后验均值。训练损失包含MSE项、键长约束项和smooth_lDDT项,噪声采样分布为 σ_data·exp(-1.2 + 1.5·N(0,1))。
3. 设计规范语言
BoltzGen提供了灵活的条件输入:
• 共价键约束:可指定原子间的共价键,支持环肽设计(头尾环化、二硫键等)
• 结构条件:通过成对距离约束部分结构,支持motif scaffolding
• 结合位点:标注靶标上的结合/非结合残基,引导设计朝向目标区域
• 二级结构:可指定设计区域的α螺旋、β折叠或无规卷曲
4. 完整管线
BoltzGen Pipeline包含6个阶段:
① BoltzGen扩散生成(GPU):批量生成候选结合物
② 反向折叠(GPU):用BoltzIF优化序列,提高可溶性和重折叠成功率
③ 折叠验证(GPU):用Boltz-2预测复合体结构,计算设计结构与生成结构的RMSD
④ 亲和力预测(GPU):针对小分子靶标,用Boltz-2亲和力模块预测结合强度
⑤ 物理指标分析(CPU):计算氢键数、盐桥数、 buried surface area、疏水斑块面积等
⑥ 过滤排序(CPU):基于多指标加权排名 + 质量多样性(QD)算法选择最终候选集
5. 工程应用:核酸结合多肽设计
在国内产业实践中,科晶生物https://www.kjfold.com/基于BoltzGen构建了核酸结合多肽从头设计服务。其技术管线如下:
输入:目标核酸序列 + 结合位点(根据翻译起始位点确定)
Step 1 — BoltzGen设计:生成500个长度为30aa的候选结合多肽
Step 2 — HDOCK精筛:参数Spacing=1.2, Angle=15,计算对接分数。置信度公式:Confidence = 1/(1+exp(0.02*(Score+150))),分数<-200时置信度>0.7
Step 3 — AlphaFold3建模:对HDOCK筛选的top候选进行一对一精细建模,评估pTM和ipTM值(>0.75为可靠)
输出:约30个候选多肽,附带pLDDT(结构置信度)、HDOCK结合能、AF3结合位点预测
三层筛选逻辑——BoltzGen生成多样性、HDOCK评估结合能、AF3验证结构可靠性——形成了一个从计算设计到候选交付的完整闭环。
6. 小结
BoltzGen的工程价值在于:统一的模型架构降低了工具链复杂度,灵活的设计规范语言支持多种结合物类型,完整管线覆盖了从生成到筛选的全流程。开源代码和权重(github.com/HannesStark/boltzgen)也降低了复现和二次开发的门槛。对于需要设计核酸结合多肽的团队,基于BoltzGen + HDOCK + AlphaFold3的管线已经是一条可落地的技术路径。