AlphaFold 蛋白质结构预测完整指南:从 FASTA 到 PDB,一次跑通
AlphaFold 蛋白质结构预测完整指南从 FASTA 到 PDB一次跑通【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 解决的是一个具体而昂贵的问题给你一条蛋白质的氨基酸序列它直接算出这个蛋白质折叠后的三维结构。传统上这件事要靠 X 射线晶体学周期以月计、成本高昂用这套开源代码你在一台带 NVIDIA GPU 的机器上就能得到带置信度评分pLDDT的结构文件直接拿去做结合位点分析或突变研究。本文带你装好环境、跑通第一条预测、看懂输出目录里的每个文件。图中是 AlphaFold 在 CASP14 竞赛中的两个靶点蓝色预测结构与绿色实验结构几乎重合GDT 分数分别达到 90.7 和 93.3。可以把它理解为 AlphaFold 实际精度的成绩单。三分钟装好环境系统要求与安装步骤先确认你的机器够不够项目要求说明操作系统仅 Linux不支持 Windows/macOSGPU现代 NVIDIA GPU显存越大能预测的蛋白质越长测试环境用的 A100内存建议 32 GB 以上官方参考配置为 85 GB RAM磁盘完整数据库解压后约 2.62 TB建议 SSD用精简数据库reduced_dbs可降到 600 GB 左右软件Docker NVIDIA Container Toolkit aria2c官方依赖全部打包在 Docker 镜像里本机只需这三样安装命令按顺序执行克隆代码git clone https://gitcode.com/GitHub_Trending/al/alphafold cd ./alphafold安装 Docker、NVIDIA Container Toolkit并设置好非 root 用户运行 Docker用包管理器安装aria2Debian/Ubuntu 下是sudo apt install aria2。下载数据库和模型参数556 GB建议挂后台跑scripts/download_all_data.sh /data/alphafold_dbs download.log 2 download_all.log 注意/data/alphafold_dbs这个下载目录不要放在仓库目录内部否则 Docker 构建时会把它整个拷进构建上下文速度会慢得让人怀疑人生。想省硬盘改用精简数据库scripts/download_all_data.sh /data/alphafold_dbs reduced_dbs确认容器能用 GPUdocker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi能列出你的 GPU 就对了。然后构建镜像并安装宿主机侧的启动脚本依赖docker build -f docker/Dockerfile -t alphafold . pip3 install -r docker/requirements.txt到这里环境就齐了。官方细节可以对照 README 安装章节 和 技术说明文档。第一次实战从一条序列到 ranked_0.pdb整个过程只有三件事写 FASTA → 跑一条命令 → 去输出目录拿结果。第 1 步准备输入。新建monomer.fasta标准 FASTA 格式开头一行写名字下面一行是序列my_protein MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQ输入就是纯文本的氨基酸序列没有别的格式要求。第 2 步跑预测。一条命令所有依赖都在容器里python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2022-01-01 \ --data_dir/data/alphafold_dbs \ --output_dir/home/user/af_out四个参数的作用--fasta_paths指定输入--max_template_date限定只用该日期前已公开的 PDB 结构当模板--data_dir指向上面下载的数据库目录--output_dir是结果存放位置必须是绝对路径。如果用的是精简数据库再加--db_presetreduced_dbs。第 3 步收集输出。跑完后/home/user/af_out/my_protein/以 FASTA 里的名字命名里会出现文件是什么ranked_0.pdb你要的最终结构按置信度排序后的第一名ranked_1~4.pdb置信度第二到第五的备选结构unrelaxed_model_*.pdb神经网络直接输出的原始结构5 个随机种子relaxed_model_*.pdb经 Amber 力场物理精修后的结构result_model_*.pkl模型原始数值输出含每个残基的 pLDDT、距离图等ranking_debug.json每个模型的 pLDDT 分数及排名依据msas/多序列比对MSA的中间结果timings.json各阶段耗时把ranked_0.pdb拖进 PyMOL 等任何 PDB 查看器你就有了第一张自己算出来的蛋白质结构图。原理揭秘三个机制对应你看到的三个现象1. 进化信息它不是只看了你的序列AlphaFold 拿到你的序列后会先到 UniRef90、MGnify、BFD 这些巨型序列数据库里做大海捞针找出所有进化上相关的同源序列拼成一张多序列比对表MSA——这就是输出目录里msas/文件夹的来历。类比一下你要猜一个陌生人的长相光看他的身份证号不行但把他三代同堂的族谱摆在你面前脸型的轮廓就清晰多了。MSA 里某些位置在所有亲戚中都高度保守就暗示这些位置在结构上承担着关键作用。这也解释了为什么序列太短、同源序列太少的蛋白质预测置信度往往偏低。2. 五个模型投票为什么 ranked_0 最可信默认设置下AlphaFold 用 5 个不同的随机种子各跑一遍得到 5 个结构。然后按 pLDDT预测的局部距离差异测试分数给它们打分排序最高的记为ranked_0.pdb——相当于同一道题做五遍取最稳的答案。ranking_debug.json里就是这次投票的原始分数。这也是官方推荐看 ranked 结构而不是 unrelaxed 结构的原因。3. 物理精修relaxed 和 unrelaxed 差在哪神经网络输出的unrelaxed_model_*.pdb在原子层面可能有小碰撞、键长键角不自然等硬伤。AlphaFold 随后用 Amber 力场做能量最小化即分子动力学的松弛把这些局部几何问题抹平得到relaxed_model_*.pdb。类比粗雕出一座雕像unrelaxed再上砂纸精修一遍relaxed。默认只有排名第一的结构会做精修可用--models_to_relaxall/none调整。结果解读如何看懂 pLDDT 置信度评分两个地方能看到 pLDDT一是result_model_*.pkl里每个残基 0–100 的分数二是 PDB 文件的 B-factor 字段注意B-factor 通常是越小越好pLDDT 相反越大越好。按分数区间读pLDDT 区间可靠性怎么用90–100极高可直接用于下游分析精度接近实验结构70–90高结构整体可信个别残基可能有偏移50–70中等大致构象可参考细节谨慎对待50 以下低通常是无序区域位置基本不可信如果用的是 pTM 模型monomer_ptm或multimer预设还会多输出一个 PAE预测对齐误差矩阵行、列分别对应两个残基数值是它们的相对空间位置误差估计。对角线附近看单个结构域稳不稳远离对角线的区域看两个结构域之间的相对摆放有多可信——对多结构域蛋白判断整体折叠对不对特别有用。效率与排坑3 条提速技巧 4 个常见报错提速技巧用 reduced_dbs 预设配合精简数据库要求降到 8 核 CPU、8 GB 内存、600 GB 磁盘速度大幅提升。日常预测完全够用追求极限精度再上 full_dbs。复用 MSA 省时间对同一条序列调不同参数时加上--use_precomputed_msastrue序列搜索这一步通常是大头直接跳过。小蛋白调大 subbatch修改 alphafold/model/config.py 里的global_config.subbatch_size可以加快 A100 上中小结构的速度。常见报错现象 → 原因 → 解决现象docker build时出现NO_PUBKEY A4B469963BF863CC、NVIDIA CUDA 源未签名的 GPG 错误。原因Ubuntu 18.04 源的 CUDA 公钥缺失。解决按 README 提到的 issue #463 中的 workaround 手动导入公钥后重新构建。现象MSA 工具如 hhblits、jackhmmer抛出各种不透明错误日志信息含糊。原因下载目录和数据库文件没有读写权限。解决对下载目录递归设置权限如sudo chmod 755 --recursive $DOWNLOAD_DIR并确认数据库文件完整。现象Docker 构建慢到离谱。原因把数据库下载到了仓库目录内部整个数据库目录被复制进 Docker 构建上下文。解决把数据库移出仓库目录重新执行构建。现象预测长蛋白时报 CUDA OOM显存不足。原因显存大小决定了能一次处理的结构长度。解决换更大显存的卡或先用 reduced_dbs 跑通长蛋白分批、分段处理。延伸方向AlphaFold-Multimer同一个命令换--model_presetmultimer输入多链 FASTA一个文件里多条序列即可预测蛋白质复合物和界面结构详见 README 的 Multimer 章节。突变体研究改几个氨基酸、重新预测再叠合新旧结构对比差异——这是目前用它做机制研究最常见的玩法。现在就可以做的 5 件事你手里已经有一套从序列到带置信度结构的完整推理管线接下来只需按顺序执行按本文配置好 Linux Docker GPU 环境下载 reduced_dbs 精简数据库准备一条 FASTA 序列跑通docker/run_docker.py并打开ranked_0.pdb结合 pLDDT 分数判断哪些区域可以信任【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →