AlphaFold蛋白质结构预测:一条FASTA进,5个PDB出
AlphaFold蛋白质结构预测一条FASTA进5个PDB出【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold是DeepMind开源的蛋白质结构预测推理管线输入一段氨基酸序列FASTA经过MSA检索和5个模型集成推理输出5个按置信度排好序的PDB结构每个原子都带上pLDDT置信度。代价是一块NVIDIA GPU和约556GB的数据下载。需要解释一个新型蛋白的结合界面但PDB里没有它的结构X射线晶体学的周期是三个月起步。AlphaFold开源管线就是为这类场景准备的输入是一个FASTA序列文件输出是排好序的PDB结构每个残基的置信度可以直接读出来。整条流程就是一次管线调用但首次跑通有固定的几个卡点。它解什么、不解什么只做序列到结构这一段说白了AlphaFold只解决一件事从氨基酸序列预测三维结构。它不解决的事同样要说清——不做小分子配体建模不会docking、没有构象动力学输出是静态结构、不给结合亲和力数值。低复杂度、同源序列极少的蛋白也别抱太高期望MSA检索找不到近亲时预测质量会明显掉下来。另一个边界是这个仓库只提供推理管线不含训练代码。单体蛋白是主力路径蛋白质复合物走multimer模型放到最后说。最短路径3步拿到第一个PDB官方推荐Docker部署宿主机只需要Docker和NVIDIA Container Toolkit。第一步拿代码git clone https://gitcode.com/GitHub_Trending/al/alphafold cd alphafold第二步下数据。这是最花时间的一步完整数据库下载约556GB解压后约2.6TBREADME建议用SSD。数据目录千万不要放在仓库里面原因下面坑里讲# 完整数据库约556GB放后台跑 scripts/download_all_data.sh /data/af_db download.log 21 # 磁盘紧张reduced版解压后约600GB需8核CPU # scripts/download_all_data.sh /data/af_db reduced_dbsscripts/download_all_data.sh会一次下齐全部序列数据库和模型参数。第三步建镜像、验证GPUdocker build -f docker/Dockerfile -t alphafold . # 确认容器内能看到GPU docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi pip3 install -r docker/requirements.txt # run_docker.py的宿主机依赖然后指向FASTA开跑python3 docker/run_docker.py \ --fasta_pathstarget.fasta \ --max_template_date2021-11-01 \ --data_dir/data/af_db \ --output_dir/data/af_out跑完后输出目录里以FASTA文件名命名的子目录下会有ranked_0.pdb到ranked_4.pdbranked_0置信度最高。官方在A100上的实测1000残基的蛋白推理环节约96秒不含MSA检索完整速度表见README.md。真正吃时间的是MSA检索——数据库大就是这么来的。--model_preset选模型四个值容易混model_preset行为开销/备注monomer单链预测默认5个模型各出1个结构monomer_casp14同上但8倍集成算力约8倍平均GDT仅0.1monomer_ptm带pTM/PAE置信头精度略低于monomermultimer蛋白复合物多链FASTA需已下载UniProt库结构是算出来的MSA、集成、relax三步模型不是做物理模拟把结构折出来的而是信息驱动的。核心信号来自MSA多序列比对拿序列去556GB的数据库里搜找出上千个同源蛋白。如果某两个位置在几百条序列里总是一起变说明这两个位置在三维空间里大概率挨着。所以同源搜得越多预测越好数据库体积直接决定预测上限。接下来5个独立初始化的网络各折一遍同样的特征按pLDDT排序也就是ranked_0到ranked_4。置信度最高的模型再过一道Amber力场的relax修正局部几何默认--models_to_relaxbest只relax第一名。PDB的b-factor列被填成了pLDDTPyMOL里按置信度上色哪个残基没把握一眼可见。上图是官方CASP14的结果两个靶点上预测结构蓝与实验结构绿几乎重合GDT分别90.7和93.3。当然这是同源充足的基准测试上限真实低同源的靶点建议以逐残基pLDDT为准。⚠️ 三个高频坑数据目录、权限与模板污染docker build奇慢、容器跑不动→ 根因数据目录放在了仓库内Docker构建时把几百GB数据库拷进了镜像构建上下文 → 绕过数据库放仓库外完全独立的目录比如/data/af_dbdocker/run_docker.py里甚至有专门抛错防这一条。MSA检索报各种看不懂的错→ 根因下载目录读写权限不足jackhmmer、hhblits这些外部工具的报错信息一律不可读 → 绕过先chmod 755 -R整个数据目录再跑。目标序列已在PDB里预测好得可疑→ 根因模板检索把目标蛋白自己的实验结构当模板用上了等于偷看答案 → 绕过--max_template_date2021-11-01截断模板日期评估任何测试集都别忘这个参数。另外顺带一句长序列OOM时官方建议是调alphafold/model/config.py里的global_config.subbatch_size或者直接换显存更大的卡。想再进一步复合物预测与MSA复用蛋白复合物的做法是把多条链放进同一个FASTA每条链一段序列同源多聚体就是同一条序列写多份换个presetpython3 docker/run_docker.py \ --fasta_pathscomplex.fasta \ --model_presetmultimer \ --num_multimer_predictions_per_model1 \ --data_dir/data/af_db \ --output_dir/data/af_out默认每个模型跑5个随机种子、共25个结构首次试跑先把--num_multimer_predictions_per_model设1省时间。multimer额外依赖UniProt和PDB seqres数据库缺了会在启动参数校验时直接报错。同一序列反复调参的话加--use_precomputed_msastrue可以复用上次写盘的MSA——MSA检索通常是整条流程最贵的一步省掉它收益很大前提是输出目录和序列都没变。整条链路到此就是序列进、结构出置信度写在文件里各阶段耗时在timings.json里。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →