自然语言驱动,自主算力支撑:沐曦打造 AI4Science 科研智能体
摘要本文介绍了沐曦开源的生命科学研究工具库MetaX LifeScience Toolkit及其在科研智能体上的应用实践。该工具库基于开源 Harness 框架 OpenScience将 RFdiffusion3、ProteinMPNN、Boltz-2 等领域模型封装为推理微服务MIM及配套技能并搭建了端到端的蛋白质binder从头设计工作流使用户可以用自然语言驱动智能体在沐曦 GPU 上执行复杂科研任务。实验在六个靶点上验证了工作流的正确性四种国产大模型底座均获得合理设计结果阴性对照与 A/B 实验进一步证明了管线的可靠性与技能的必要性。该工具库与 Harness 解耦、可适配不同模型与框架为构建全国产链路的 AI for Science 科研智能体生态奠定了基础。智能体与 MIM 服务的体验链接见文末欢迎广大科研人员试用体验。1. AI4Science新范式科研智能体人工智能技术正在深刻改变人们的日常生活也正在重塑科学与工程的科研范式。在气象预测、材料研发、药物发现和医疗健康等关键领域AI正加速推动研究方法、工具与流程的迭代显著提升科研效率。与此同时AI4SAI for Science科学智能的兴起也在带动相关上下游产业高质量发展涵盖基础软硬件设施的智能融合、教育科研的数智化、产业工程的智能化以及生活方式的智慧化。作为AI4S的重要分支人工智能辅助药物研发AIDD近年来发展迅猛。以诺贝尔奖成果AlphaFold3为代表的生命科学垂直领域模型在精度与速度上均已超越传统方法展现出AI提升制药效率、降低研发成本的巨大潜力。然而这些模型在真实制药管线中的推广仍相对缓慢。其中一个关键原因在于AIDD垂直领域模型的实际使用门槛仍然较高。尤其在生命科学等与底层计算相距较远的学科中一线科研人员长期深耕实验与理论难以直接驾驭复杂的AI模型与高性能计算工具由此形成了技术应用层面的断层。进入2026年人工智能技术延续快速发展智能体技术更迎来质的飞跃。在编程智能体商业化取得显著成功之后国际大模型巨头纷纷布局科学研究智能体Science Agent。例如Anthropic的Claude Science、OpenAI的Rosalind Workbench、Google的Gemini for Science等相关产品均被置于旗舰级战略位置。尽管技术路线与产品形态各异它们共同指向同一趋势研究人员只需用自然语言提出问题系统即可在“human-in-the-loop”的审批与可追踪机制下自主完成后续复杂的计算与分析任务真正打通从科研设想到最终结果的路径。凭借这一优势科研智能体正在成为驱动科学发现的新范式。科研智能体要成为真正可用的新范式仅有自然语言交互与任务编排还不够还必须落到可复现、可审计、可本地化部署的科研基础设施上。若将其开展研发项目的全流程拆开看除了文献检索与分析、数据获取与整理、结果分析与解释等任务外在GPU 上完成高性能推理与计算同样是决定效率与规模的关键环节。因此必须为科研智能体配备面向GPU 的领域专用模型调用技能使其能够稳定、高效地完成计算密集型任务。与此同时在出口管制、数据安全与生物医药敏感性等因素交织的背景下海外平台对中国科研用户的持续可用性存在不确定性因此推动科研智能体从底座模型、框架到算力平台的全链路国产化具有现实必要性。沐曦作为国产GPU 企业希望在这一路径上贡献力量并据此推出沐曦生命科学研究工具库MetaX LifeScience Toolkit重点强化科研智能体在沐曦GPU 上调用领域模型、执行复杂工作流和完成高性能计算的能力。2. 沐曦生命科学研究工具库MetaX LifeScience Toolkit沐曦生命科学研究工具库已经在沐曦官方代码仓库中开源https://github.com/MetaX-MACA/metax-lifescience-toolkit。V0.1.0版本目前包含三个垂直领域模型MIM技能和一个蛋白设计工作流技能。具体使用方法为在任意科研Harness 框架中将上述技能文件放入对应的 skills 目录即可激活。此后用户即可通过自然语言对话的方式指挥智能体执行科研任务。2.1 沐曦推理微服务(MIM)及其配套技能2.1.1 MIM服务与MIM skill概念介绍MIMMetaX Inference Microservices沐曦推理微服务将运行在沐曦 GPU 上的 AI 模型封装为标准化服务。用户或应用通过标准 API 接口提交数据即可获得模型的计算结果例如蛋白质结构预测、氨基酸序列设计或蛋白质骨架生成。MIM Skill 是面向 AI 智能体的领域技能包将专业知识、模型使用方法和沐曦 GPU 部署指南整合为可执行的操作说明。它使智能体具备领域专家级的任务处理能力根据用户需求选择合适的模型在沐曦 GPU 上高效调用 MIM 服务并对计算结果进行检查与解释。2.1.2RFDiffusion3 MIMRFdiffusion3RFD3 由诺贝尔化学奖得主 David Baker 领导的华盛顿大学蛋白质设计研究所团队开发是一款全原子扩散生成模型能以原子为基本单元同时生成蛋白骨架与侧链并在配体、DNA/RNA 等非蛋白原子环境中完成设计[1]。其主要功能包括蛋白 binder 设计、DNA 结合蛋白、小分子结合蛋白、酶活性位点脚手架和对称寡聚体生成。沐曦提供封装好的 RFD3 MIM 服务及其配套技能。技能位于metax-lifescience-toolkit/mim-skills/rfdiffusion-mim。激活该技能以后可通过类似下面的提示词指挥智能体调用 RFD3 模型进行骨架设计Design a de novo protein backbone of 80 residues using RFDiffusion3。2.1.3ProteinMPNN MIMProteinMPNN是 David Baker 实验室于 2022 年发表在 Science 期刊上的深度学习蛋白序列设计模型也是逆折叠inverse folding任务的代表作[2]。其核心功能是从给定的蛋白质三维骨架出发利用消息传递神经网络MPNN预测能折叠成该结构的氨基酸序列实验成功率远高于 Rosetta 等传统方法并支持多链复合物、固定氨基酸位置、同源寡聚体对称性等设计需求。沐曦提供封装好的ProteinMPNN MIM服务及其配套技能。技能位于metax-lifescience-toolkit/mim-skills/proteinmpnn-mim。激活该技能后可通过类似下面的提示词指挥智能体调用 ProteinMPNN 模型生成氨基酸序列I have a PDB backbone from RFDiffusion - run ProteinMPNN to get 10 designed sequences。2.1.4Boltz2 MIMBoltz-2是由 MIT Jameel Clinic 团队与AI制药企业 Recursion 合作开发是一款生物分子基础模型[3]。其主要功能包括对蛋白、核酸、小分子复合物进行全原子共折叠结构预测并同时预测蛋白-小分子结合亲和力。Boltz-2 是首个在精度上接近物理自由能微扰FEP方法、而速度提升 1,000 倍以上的深度学习模型。沐曦提供封装好的由mcEquivalence2.3小节加速的 Boltz2 MIM 服务及其配套技能技能位于metax-lifescience-toolkit/mim-skills/boltz2-mim。激活该技能以后可通过类似下面的提示词指挥智能体调用 Boltz-2 模型进行结构预测Predict the structure of this protein sequence using Boltz2 MIM: MTEYKLVVVGACGVGKSALTIQLIQNHFVDE。2.2蛋白设计工作流技能 Protein-Binder-Design Skill在上述三个 MIM 服务与技能的基础上我们进一步搭建了一个标准化的蛋白设计工作流技能技能位于metax-lifescience-toolkit/workflows/generative_protein_binder_design/protein-binder-design。借助该技能科研智能体可以在沐曦 GPU 上高效完成端到端的蛋白质结合剂从头设计管线。具体来说该管线包含以下六个步骤1.靶点准备: 获取靶点 PDB 及表位信息并将作者标注的表位/热点残基编号映射为 RFdiffusion 所需的 hotspot_res 字符串;2.骨架生成通过rfdiffusion-mim技能调用RFDiffusion3模型MIM服务针对目标靶点生成N个蛋白结合剂骨架3.序列设计通过proteinmpnn-mim技能调用ProteinMPNN模型MIM服务针对每个骨架设计k条氨基酸序列4.共折叠与打分通过boltz2-mim技能调用Boltz-2模型MIM服务对“结合剂-靶点”复合物进行共折叠并收集界面置信度ipTM界面预测对齐误差ipAE和结合剂的pLDDT等指标。5.自洽性检验计算RFDiffusion3设计的原始骨架与预测结合剂之间的α-碳原子均方根偏差(CA-RMSD)6.过滤与排序应用各项阈值对通过筛选的设计进行排序并输出最终设计结果和报告。激活该技能后用户即可通过自然语言指挥智能体在沐曦 GPU 上执行完整的蛋白质结合剂从头设计流程。本文第三章将给出该技能的实战案例一方面通过重跑文献中的设计案例验证管线的正确性另一方面通过 A/B 对照实验验证技能本身的必要性。2.3沐曦自研优化加速库—mcEquivalencemcEquivariance 是一款面向几何感知神经网络的加速库Triangle Attention 与 Triangle Multiplication 是 Boltz-2 等结构预测模型中的核心算子。在 Boltz-2 的 Pairformer 中Triangle Attention 负责更新 token 对表示对于 token 对 (i,j) 它遍历中间 token k 综合 (i,j) 与 (k,j) 的信息从而学习分子中的三角几何关系与空间一致性。该过程同时包含 starting-node 与 ending-node 两个方向但该算法的直接实现会产生随 token 数量立方增长的计算量并生成庞大的注意力中间张量mcEquivariance 采用类似 FlashAttention 的分块在线 Softmax 方案不生成完整注意力矩阵将临时显存复杂度由O(N3)降至O(N2)。在 MetaX C500 上BF16精度下的Triangle Attention 算子在 1536 token 时约加速 3 倍显存占用降低约 10 倍。如图1所示在完整的 Boltz-2 端到端推理recycling_steps3, sampling_steps50, 以及 diffusion_samples5中与不分块的 Torch 基线实现相比1280 token 下显存降低约 2.5 倍、性能提升约 1.8 倍在 2048 token 下与分块的 Torch 基线实现相比约加速 2.1 倍。不分块的基线实现最多只能运行到 1280 tokenmcEquivariance 大幅扩展了实测推理的规模边界。该加速方案同样适用于 OpenFold-3、OpenDDE、Protenix、ESMFold2 等其他结构预测模型。图1mcEquivalence在Boltz-2模型上BF16精度下端到端的性能提升效果3. 实战案例蛋白质结合剂的从头设计 (de novoProtein Binder Design)3.1 Harness以及AI4S Agent整体架构介绍从回答科学问题到执行科研任务大语言模型需要一套连接工具与计算环境的运行框架即 Agent Harness。科研任务通常包含多个相互依赖的计算步骤除规划方案外还需准备输入、调用工具、保存中间结果并根据返回信息推进后续工作。沐曦 AI4S Agent 平台以开源的 OpenScience[4] 作为 Harness连接大语言模型与沐曦生命科学研究工具库大模型负责理解科研目标与规划任务专业AI4S模型负责计算OpenScience 则管理任务上下文、执行工具调用并将结果反馈给大模型使数据准备、模型计算与结果分析能够围绕同一目标连续进行避免研究人员在不同工具间切换和手动传递文件。图2沐曦 AI4S Agent 平台整体架构如图2所示用户在科研工作区提交研究目标与相关文件后智能体读取相应的 Skill 以确定所需工具、参数及调用顺序MIM Skills 描述AI4S垂直领域模型服务的接口、输入输出与参数要求Workflow Skills 说明多步计算的衔接与工作流的构建方式Library Skills 提供加速库的使用方法且这些内容可随工具与研究方法的更新独立维护无需为每个任务重复描述操作流程。智能体据此调用部署在沐曦 GPU 上的 MIM 模型服务及 HPC 应用并从 PDB、UniProt、PubChem 等数据库按需获取结构、序列与化合物数据工具返回的结果进入任务上下文供大模型判断后续步骤遇到输入缺失或计算报错时也便于定位与处理。沐曦AI4S Agent 平台支持通过本地推理服务或官方 API 接入大语言模型研究人员可以根据科研任务选择合适的模型。国产大模型可结合沐曦算力进行本地部署其他厂商的开源、闭源模型也可通过相应接口适配接入。模型接口由 OpenScience 对接科研工具的使用方法和工作流程则由 Skills技能承载。因此同一套生命科学工具库可以配合不同的大模型使用在更换或升级模型时继续沿用有的科研流程。需要指出的是当前沐曦 AI4S Agent 平台基于开源 Harness 框架 OpenScience 搭建但生命科学工具库本身与 Harness 解耦可无缝嵌入其他Harness框架。3.2蛋白质结合剂设计技能验证为验证蛋白质结合剂设计工作流技能的正确性我们参考 ProtDBench[5] 和 PXDesign[6]这两篇文献选取其中六个具有重要生物学意义且覆盖不同设计难度的靶点进行测试靶点的 PDB ID、Crop 范围及 Hot-Spot 残基等信息完全参照文献[5]的表4。测试采用的筛选标准与文献中的 AF2-IG-easy 标准一致具体为ipTM ≥ 0.5、pLDDT ≥ 80、ipAE ≤ 10.85 Å、RMSD ≤ 3.5 Å。此外为验证平台与国产大语言模型的适配性我们分别测试了四种模型底座通过官方 API 接入的Kimi K3DeepSeek V4.1 Flash和上海人工智能实验室自研的Atria-Dawn-Preview模型(https://atria-asi.ai/)以及在沐曦 GPU 集群上本地部署的GLM 5.2。同时为证明工作流技能的必要性我们设计了一组 A/B 对照实验在 DeepSeek V4.1 Flash 底座下分别加载与不加载该技能执行完整设计流程对比二者设计结果的正确性与合理性。需要说明的是本项测试旨在证明通过蛋白设计技能沐曦AI4S 智能体可基于不同的国产大语言模型底座成功构建蛋白设计工作流正确调用MIM 模型并获得合理的设计结果。上述A/B 对照实验即服务于这一目的with-skill 组加载蛋白质结合剂设计技能执行完整流程without-skill 组不加载任何技能、仅依靠底座模型的自身能力完成任务两组在相同提示词与计算环境下运行通过对比输出结果的正确性验证技能对智能体正确执行工作流的必要性。本测试并不比较不同大语言模型底座之间的效果差异也不评估本管线与其他同类蛋白设计管线的优劣管线输出的成功设计是否真正具有活性亦有待湿实验验证。执行测试任务的提示词如下Use the protein-binder-design skill with the deployed RFdiffusion, ProteinMPNN, and Boltz2 MIM services. Use existing endpoints only—do not install or redeploy services.Run one campaign per target. Generate 100 backbones and 8 non-native sequences per backbone (800 candidates/target), with binder length 60-160 aa. Fold and score all candidates, then filter by: ipTM ≥ 0.5, binder pLDDT ≥ 80, RMSD ≤ 3.5 Å, and ipAE ≤ 10.85 Å.Targets (name | PDB | crop | author-numbered hotspots):- IL-7Ralpha | 3DI3 | B17-209 | B58,B80,B139- SC2RBD | 6M0J | E333-526 | E485,E489,E494,E500,E505- PD-L1 | 5O45 | A17-132 | A56,A115,A123- VEGF-A | 1BJ1 | V14-107,W14-107 | W81,W83,W91- TrkA | 1WWW | X282-382 | X294,X296,X333- TNF-alpha | 1TNF | A12-157,B12-157,C12-157 | A31,A32,A113,C73,C87Remap hotspots to 1-based sequence indices with scripts/pdb_utils.remap_to_seq_index when required.For each target, save manifest.json, ranked candidates.csv, artifacts, andREPORT.md with pass rate, top designs, and positive-control comparison:下一小节将展示最终设计结果。3.3沐曦AI4S Agent蛋白设计结果展示我们对上述验证流程的结果进行了收集与分析。首先可以观察到四种模型底座均能成功完成任务并输出正确的交付物针对每一个靶点均产出了排序后的候选蛋白列表、通过筛选的复合物结构以及一份执行报告报告中包含目标靶点基本信息、各模型的调用参数及最终设计成功率等重要信息。图3展示了五个成功获得通过筛选设计的靶点各自的最优设计。图3沐曦 AI4S Agent 蛋白质结合剂设计管线在五个靶点上的最优设计数据取自GLM 5.2模型设计结果。TNF-α 因无设计通过筛选未列入本图。图4展示了沐曦 AI4S Agent 在六个靶点上执行蛋白质结合剂设计流程的设计成功率。成功率的统计方式为通过筛选的设计数 / 总设计数本次测试中采用的筛选标准是ipTM ≥ 0.5、pLDDT ≥ 80、ipAE ≤ 10.85 Å、RMSD ≤ 3.5 Å。图中浅灰色区域为文献[5,6]中各管线在对应靶点上报道的成功率范围上下虚线旁的数字分别为其上限与下限。蓝色、玫红色、橙色、紫色柱分别对应沐曦 AI4S Agent 基于本地 GLM 5.2、官方 Kimi K3官方 Atria Dawn Preview 和官方 DeepSeek V4.1 Flash四种底座模型的设计结果绿色柱则为without-skill的情况下DeepSeek V4.1 Flash的设计结果。从图中可以观察到其一四种模型底座的设计成功率在全部六个靶点上均无显著差异微小偏差处于模型随机性的合理范围内说明工作流技能与底座模型解耦良好其二成功率的分布基本符合各靶点的设计难度预期且与文献基线的趋势一致PD-L1 设计难度最低平均成功率约56%SC2RBD、TrkA 和 VEGF-A 为中等难度靶点平均成功率在10%左右而 IL-7RA 和 TNF- 是公认在基于 RFD 的管线中挑战性最大的靶点本次测试中成功率也最低——IL-7RA 均不足 1%TNF-α 则未获得通过筛选的设计这一结果源于靶点自身的设计难度与管线本身的局限性与蛋白设计技能无关。图中以虚线划定的浅灰色区域为相关文献[5,6]中各蛋白设计管线报道的成功率范围。可以看到沐曦 AI4S Agent 通过蛋白质设计技能产出设计的成功率均落在文献范围内说明设计结果处于合理水平。部分高难度靶点上文献上限明显更高主要原因是管线构成不同相关管线采用了经过针对性优化的蛋白设计模型其性能优于本文管线所用的模型与智能体本身的任务执行能力无关。对比 DeepSeek V4.1 Flash 模型加载紫柱与不加载绿柱技能时的设计成功率可以发现在无工作流技能指引的情况下智能体在全部六个靶点上的设计成功率都非常低除难度最低的 PD-L1 上有不足 3% 的成功率外其余靶点基本没有通过筛选的设计输出与合理结果范围相差甚远说明智能体在不加载技能时无法给出正确的设计结果。对中间过程进行深入分析发现问题主要出在 ProteinMPNN 调用参数的设置上without-skill 组中智能体错误地将 binder设计产物与 target原始靶点一并作为可优化对象输入模型导致原始靶点被修改进而使 Boltz-2 共折叠结构与初始结构的 RMSD 偏差显著增大大部分设计因此无法通过筛选。此外without-skill 组在部分筛选指标的定义与计算细节上也与技能文件中的规范存在偏差进一步拉低了设计通过率。这一结果充分证明了工作流技能的必要性缺少技能指引时智能体容易在执行细节上犯错并最终导致结果的巨大偏差。图4沐曦 AI4S Agent 蛋白质结合剂设计管线在六个靶点上的设计成功率筛选标准为 AF2-IG-easyipTM ≥ 0.5、pLDDT ≥ 80、RMSD ≤ 3.5 Å、ipAE ≤ 10.85 Å。蓝色、玫红色、橙色、紫色柱分别对应沐曦 AI4S Agent 基于本地 GLM 5.2、官方 Kimi K3官方 Atria Dawn Preview 和官方 DeepSeek V4.1 Flash四种底座模型的设计结果绿色柱则为without-skill的情况下DeepSeek V4.1 Flash的设计结果浅灰色区域为文献[5, 6] 中各管线在对应靶点上报道的成功率范围上下虚线旁的数字分别为其上限与下限。文献值的差异主要源于各管线所采用蛋白质模型在不同靶点上生成能力的差别。TNF-α 靶点未获得通过筛选的设计故仅示出文献范围。为证明沐曦 AI4S Agent 蛋白质结合剂设计管线的可靠性我们还设计了阴性对照实验。除正常流程设计的 800 条序列外我们针对每个靶点额外生成 5 条假设计作为阴性对照组即在真实设计的基础上随机打乱氨基酸顺序。阴性对照组与真实设计组筛选指标的分布差异如图5所示可以观察到阴性对照组在 ipTM (0.631 vs 0.770)、pLDDT (47.40 vs 82.87)和 ipAE (23.93 Å vs 18.79 Å) 三项关键指标上均显著劣于真实设计组从而证明该管线能够真实反映结合剂的设计质量结果是可靠的。图5随机打乱序列顺序的阴性对照组与实际设计结果在ipTM, pLDDT和ipAE三项指标均值的差异数据取自GLM 5.2模型测试结果验证实验表明沐曦 AI4S Agent 蛋白设计流程在Kimi K3、DeepSeek V4.1 Flash、Atria-Dawn-Preview及沐曦 GPU 本地部署的 GLM 5.2 四款国产底座模型上均顺利通过测试设计成功率分布符合靶点难度预期阴性对照显著劣于真实设计充分证明了管线在国产模型底座上运行的正确性与可靠性。A/B 对照实验进一步表明若不加载蛋白设计技能仅凭大语言模型与 Harness 框架无法正确完成蛋白设计任务从而印证了工作流技能的必要性。4. 总结与展望本文介绍了沐曦开源的生命科学研究工具库及其在科研智能体上的应用实践。该工具库将专业知识、模型使用方法与沐曦 GPU 部署指南整合为可执行的领域技能使科研智能体能够灵活调用领域模型服务并在此基础上串联端到端的蛋白质结合剂从头设计等复杂工作流。In silico蛋白设计验证表明基于该工具库沐曦 AI4S 智能体可在不同国产大语言模型底座上成功构建蛋白设计流程、正确调用 MIM 服务并获得合理的设计结果证明了方案的有效性与模型适配能力。在工程实现上本文的智能体体验服务基于开源 Harness 框架 OpenScience 搭建但工具库本身与 Harness 解耦可无缝嵌入其他现有或未来推出的先进智能体框架并适配不同的大语言模型底座具有良好的开放性与可扩展性。展望未来我们将从三个方向持续建设沐曦 AI4S 科研智能体生态首先不断充实完善工具库覆盖更多科学领域的模型与服务丰富工作流技能类型其次深化与开源社区及科研机构的协作推动工具库与更多 Harness 框架、大语言模型的适配验证最后坚持全链路国产化以自主可控的国产 GPU 国产模型 国产工具链路支撑国家生命科学研究的智能化发展。开源仓库链接https://github.com/MetaX-MACA/metax-lifescience-toolkit智能体与 MIM 服务体验链接AI4Science - 沐曦开发者(https://developer.metax-tech.com/ai-4science#AI4Science模型与智能体服务)参考文献[1]Butcher J, Krishna R, Mitra R, et al. De novo design of all-atom biomolecular interactions with RFdiffusion3[J]. bioRxiv, 2025. DOI: 10.1101/2025.09.18.676967.[2] Dauparas J, Anishchenko I, Bennett N, et al. Robust deep learning-based protein sequence design using ProteinMPNN[J]. Science, 2022, 378(6615): 49-56. DOI: 10.1126/science.add2187.[3] Passaro S, Corso G, Wohlwend J, et al. Boltz-2: Towards accurate and efficient binding affinity prediction[J]. bioRxiv, 2025. DOI: 10.1101/2025.06.14.659707.[4]Synthetic Sciences. OpenScience[EB/OL].https://github.com/synthetic-sciences/openscience.[5] Liu C, Guan J, Gong C, et al. ProtDBench: A unified benchmark of protein binder design and evaluation[EB/OL]. (2026-05-05).[2605.04118] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation.[6] ByteDance PXDesign Team, Ren M, Sun J, et al. PXDesign: Fast, modular, and accurate de novo design of protein binders[EB/OL]. (2025-08-16).AI4Science - 沐曦开发者.
上一篇/下一篇内容由系统自动关联
返回资讯列表 →