Anthropic 用 Claude 优化 30 多个开源生物分子模型,平均提速约 4 倍并开源全部代码
How Claude is uplifting biomolecular modeling
精选理由
原文给出加速倍数、低内存模式和成本对比等具体结果,读者可以评估 Claude 驱动的推理优化对生物建模工作流的实际影响。
AI 摘要
Anthropic 发布研究,让 Claude 在不到四周内优化了 30 多个开源生物分子模型,平均提速约 4 倍,输出完全一致时约 2 倍。
正文 · AI 翻译
视频 · 前往原文观看
在这篇文章中,我们分享 Claude 如何让科学家用于预测和设计生物分子的开源模型变得更快、更节省内存。Claude 在不到四周的时间里优化了 30 多个此类模型,平均提速约 4 倍。它还创建了一种低内存模式,使得在单个 NVIDIA GPU 节点上即可对超过 10,000 tokens(氨基酸、核苷酸,以及来自小分子和离子的原子)的大型生物分子系统进行准确预测。我们将全部优化代码开源,并宣布与 Adaptyv Bio 联合赞助一场蛋白质设计竞赛,提供最高 100 万美元的 Claude 额度支持,并为超过 5,000 个设计提供湿实验验证。
最近,我们分享了相关成果,展示了 Claude 通过专家级地编排开源蛋白质设计与结构预测模型,设计de novo蛋白质结合体的能力。De novo结合体是通过计算设计的小型蛋白质,能够紧密附着于特定靶标分子,从而对其激活、阻断或递送某种物质。
尽管这是对 AI 科学能力的一次令人鼓舞的展示,也是推进药物发现迈出的早期一步,但它所消耗的资源超出了绝大多数蛋白质设计者所能获得的水平。我们允许 Claude 在 AI 基础设施平台 Modal 上为每个靶标花费最高 10,000 美元,大致相当于 2,500 个 NVIDIA H100 GPU 小时。
为了让这类研究更易于开展,我们开始探索推理优化,以便更高效地运行这些模型。作为这些优化的早期成果,Claude Mythos 5.1 加速了七个开源生物学模型,使其运行速度最高提升至 2.5 倍。
在此,我们展示新的结果,说明一个内部的通用研究模型如何能够优化 30 多个为多种生物学任务训练的深度学习模型,这些任务包括结构预测和蛋白质设计,以及基因组学和蛋白质语言模型。平均而言,Claude 能够将此类任务加速约 4 倍,同时仅牺牲极少的精度;在输出完全相同的情况下则可加速近 2 倍。Claude 还改善了这些模型的内存利用率,使得预测前所未有的规模的生物分子系统成为可能。通过将这些结果与我们对先前智能体蛋白质设计方法的简化相结合,我们表明 Claude 能够以少两个数量级的 GPU 小时数,达到与我们此前报告的成果相当的 in silico 性能。
除了蛋白质设计之外,这些专门的生物学模型还被分子生物学家广泛使用,包括用于药物发现与开发。我们今天将所有这些模型的优化代码开源(在此),以便更广泛的社区能够加以利用。你可以在我们的技术报告(在此)中找到更多细节。
为了进一步支持社区,我们还与 Adaptyv Bio 共同赞助了一项蛋白质设计竞赛,后者开创了 开放蛋白质设计竞赛。我们共同选出了五个处于当今能力前沿的挑战性问题。与 Adaptyv 一起,并得益于 Modal 和 Twist Bioscience 的慷慨捐助,我们承诺提供最高 $1 million 的 Claude 额度以及 $250,000 的 Modal 算力额度,并为超过 5,000 个设计提供湿实验验证。更多信息请见(在此)并(在此申请)。
加速蛋白质结构预测与设计模型
蛋白质结构预测是指仅根据蛋白质的氨基酸序列来确定其三维结构的问题。而蛋白质设计则是创造具有特定结构、功能或一组特性的蛋白质的过程。这两类计算工具结合起来,使科学家能够探究关键的生物分子过程——例如癌症是如何形成的——并创造出有用的分子,例如能够靶向这些癌症的药物。
现代结构预测模型,如 AlphaFold3、OpenFold3 和 Boltz-2,将大部分计算运行时间和内存花在两个操作上:三角注意力和三角乘法,它们作用于 token 三元组。这些操作使得对生物分子系统的几何结构进行建模成为可能,但它们的计算代价极其高昂,因为它们在运行时间和内存上都是三次方复杂度:系统规模翻倍会使用 8 倍的时间和内存,而规模变为三倍则会使用 27 倍。
编写 kernel——面向 GPU 等加速计算硬件的底层软件转换层——是降低这些成本的常规方法。鉴于其重要性,三角注意力和三角乘法一直是专门 kernel 开发工作的对象,最初是 NVIDIA 的 cuEquivariance,最近则是 NVIDIA 的 BioNeMo Inference Runtime(BioNeMo-IR)。
为了我们自身针对结构预测模型优化推理的工作,我们与 Claude 合作开发了 FlashPairformer,这是一组自定义 kernel,可加速三角注意力与三角乘法。它达到了新的 SOTA,在三角注意力上平均比该领域标准快 2.7-2.9x,在三角乘法上快 1.7-3.2x,具体取决于模型配置。
我们与 Claude 合作开发了 FlashPairformer,这是一组自定义 kernel,可加速三角注意力与三角乘法,而这两者是支撑最先进生物分子结构预测模型的 Pairformer 架构的主要组成部分。结果均相对于该领域标准报告。
除了开发可迁移的 kernel 之外,我们还让 Claude 针对每一个单独的模型进行优化,目标是产出更具针对性的优化。这些优化包括缓存重复计算的工作,以及将死分支简化为其常量输出等改动。这些改进的组合使结构预测模型平均加速了 4x,并且对于每个模型,我们都确认了 Claude 的加速版本没有影响下游任务(例如结构预测)的性能。
通常,一个经验丰富的工程师团队需要数周时间才能为每个模型完成此类优化,而且这些工作往往无法在不同模型之间迁移。Claude 在 Anthropic 两位技术人员的监督下——他们具备生物分子建模经验,但此前没有任何推理优化或内核工程方面的经验——在不到四周的时间里,完成了对 30 多个开源模型的加速,涵盖生物分子结构预测、蛋白质设计、蛋白质语言建模和基因组学。
我们的结果表明,前沿 AI 模型将帮助该领域的其他人以更快的速度和更简便的方式构建科学工具。
Claude 的优化加速了十多个生物分子结构预测模型,平均实现了约 4 倍的加速且精度下降极小,以及在输出完全相同的情况下约 1.6 倍的加速。注意:ColabFold 1.6.3 同期发布的可选快速内核尚未在此进行基准测试。
Claude 的优化还加速了多个蛋白质设计模型,涵盖幻觉、结构生成和逆折叠。这些模型依赖于多种架构,包括 AlphaFold 级别的结构 Transformer、扩散模型、流匹配和图神经网络。
我们为结构预测开发的快速模式,在一组汇总的生物分子界面上与默认设置在统计上无法区分。如果预测界面的 DockQ 分数大于 0.23,我们认为该界面是可接受的。
实现大规模生物分子系统的建模
除了让这些蛋白质结构预测与设计模型运行得更快之外,我们还让 Claude 承担了降低大型分子机器建模所涉及的内存占用的任务。细胞中的许多工作都是由这类系统完成的,包括构建蛋白质的核糖体、为细胞供能的呼吸链复合物,以及帮助其他蛋白质折叠的分子伴侣。每一个都由数十个组件构成,其功能取决于这些组件如何组合在一起并相互作用。预测如此庞大系统的结构,通常需要大量计算资源,而大多数分子生物学家无法获得这些资源,例如跨多个 GPU 节点分布的推理。
Claude 创建了一种低内存的“Big”模式,使得对超过 10,000 tokens 的系统进行精确建模成为可能,并且仅使用一个 NVIDIA GPU 节点就能对超过 70,000 tokens 的系统成功完成推理——这在以前是无法企及的任务。使用 Big 模式成功折叠的分子机器包括人类线粒体复合物 I、TRiC 分子伴侣复合物、一个蛋白酶体以及一个细菌核糖体,每一个都与其通过实验测定的结构高度吻合。据我们所知,这些是迄今使用结构预测模型准确折叠出的最大结构之一,其中复合物 I 和 70S 核糖体各自包含超过 10,000 tokens,相比之下,AlphaFold3准确预测的 40S 核糖体包含 7,663 tokens。
Claude 创建的低内存“Big”模式使开源结构预测模型能够在单个 NVIDIA GPU 节点上准确预测由超过 10,000 个 token 组成的生物分子系统,这表明这些专用模型能够在其训练上下文之外泛化近 1.5 个数量级。前三行展示的是准确预测的系统;底行展示的是预测不准确的系统。如果界面的 DockQ 分数至少为 0.23,则认为其是准确的。
为了测试 Claude 优化的极限,我们让 Claude 预测比此前所实现的任何规模都更大的结构。使用单个 8-GPU B300 节点,Claude 生成了对整个病毒衣壳和蛋白质区室的预测,规模从超过 31,000 个 token 到超过 70,000 个 token 不等。
这些系统比这些结构预测模型的训练上下文大了近两个数量级,而且或许并不令人意外的是,它们并未被正确预测。然而,在这一规模上进行推理的门槛如今已显著降低,因为现在只需要一个 NVIDIA B300 节点,这表明随着工具的改进,研究人员很快将能够对日益复杂的生物系统进行计算建模。
“Big”模式使开源结构预测模型能够使用单个 NVIDIA B300 节点以前所未有的规模成功运行推理。能力测试运行以单次主干前向传播(无循环)执行,作为概念验证。预测的结构崩溃,表明在训练上下文之外近两个数量级的范围内缺乏泛化能力。
Claude 高效设计 de novo 蛋白质结合体
在我们早先的蛋白质设计工作中,我们为 Claude 提供了一段约 16,000 词的提示词,鼓励它调用子智能体,并在 24 小时内为每个靶点最多花费 $10,000 使用 Modal(约 2,500 NVIDIA H100 GPU 小时)。
而在这里,我们只给单个 Claude 模型提供了一块 NVIDIA H200 和 24 小时的挂钟时间、一段约 1,100 词的提示词,以及一份预装工具的参考表,没有子智能体,也没有人类对设计过程进行引导。
我们使用本文所述的加速生物分子模型,让三个 Claude 模型(Mythos 5.1、Mythos 5 和 Opus 5)针对 16 个靶点进行了测试。我们通过 ipSAE 对设计进行评分,这是一种 in silico 评分,已被证明能够预测湿实验室中的结合情况。在 16 个靶点上取平均,所有三个 Claude 模型评估所得的中位评分设计和最高评分设计,所达到的 ipSAE 值与我们早先的 Mythos 5.1 系列大致相同,尽管使用的 GPU 小时数少了约两个数量级。我们还考虑了 Claude 的 token 成本,发现 GPU 与 token 合计花费约 $150,我们就能实现与先前系列相当的 in silico 性能。
单个 Claude 模型仅使用一块 NVIDIA H200 和 24 小时挂钟时间,就设计出了 从头(de novo)蛋白质结合体,其 计算机模拟(in silico)结合分数与我们早先 Mythos 5.1 项目(虚线)相当,而后者可以使用子智能体,并消耗约 100 倍的 GPU 小时。每条曲线代表一个 Claude 模型在编排加速生物分子模型时所得 ipSAE 分数(计算机模拟结合分数)的中位数(上图)或最大值(下图)。我们展示了分数与估计 GPU 花费(左)、token 花费(中)以及二者组合(右)的关系。结果在 16 个靶标上取平均,每个靶标最多进行五次独立运行。
与 Adaptyv Bio 联合赞助蛋白质设计竞赛
上述优化帮助我们更高效地预测和设计分子,同时解锁了原本因资源成本过高而无法实现的能力。为了展示这些优化所带来的提升以及 Claude 在分子设计领域更广泛的影响,我们正与 Adaptyv Bio 合作,发起一场蛋白质设计竞赛。我们选出了五个处于当今蛋白质设计能力前沿的问题,包括物种交叉反应性、pH 敏感性和肽-MHC 特异性等挑战,以及 GPCR 等困难靶标。
我们将与 Adaptyv 团队一起,针对这些问题对社区提交的 5,000 多个设计进行实验验证。我们将为参与研究的人员提供最高 100 万美元的 Claude 额度以及用于在 Adaptyv 进行实验验证的额外资金,Modal 将提供最高 25 万美元的计算额度,Twist Bioscience 将为本次竞赛提供 DNA。你可以在此处(here)找到更多信息,包括资格标准,并在此处(apply here)申请。
我们还已开始通过我们的生命科学验证计划,为生命科学家提供用于生物学相关工作的前沿 AI 能力。我们最近招募了第一批组织,并于今天以公开测试版形式开放了该计划。你可以在此处(here)找到更多信息。
延伸阅读
以下资源提供了关于上述结果的进一步技术深度和更详细信息:
蛋白质设计竞赛页面和申请表;
专用分子模型代码;
技术报告。
原文
Original Title
How Claude is uplifting biomolecular modeling
Source
Anthropic:Research(发表成果 · 网页)
Site
anthropic.com
Published
2026-09-18 03:49