AlphaFold 蛋白质结构预测指南:一条命令从序列到三维结构,输出怎么读 AlphaFold 蛋白质结构预测指南一条命令从序列到三维结构输出怎么读【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold手头只有一段蛋白质氨基酸序列你需要它的三维结构以及哪些区域可信、整体折叠是否可靠的量化依据。AlphaFold 是 DeepMind 开源的蛋白质结构预测系统当前版本 v2.3.2见 alphafold/version.py输入 FASTA 格式的序列输出排序后的 PDB 结构文件和 pLDDT、pTM、PAE 等置信度指标。本指南带你从零搭建环境、跑通首次预测、处理多链复合物并逐项读懂输出目录里的每个文件。1 搭建环境数据库下载、Docker 镜像与 GPU 验证AlphaFold 只支持 Linux官方验证过的参考配置是 12 vCPU、85 GB 内存、A100 GPU。硬件需求如下项目要求说明操作系统Linux不支持 Windows 和 macOSGPU现代 NVIDIA GPU显存越大能预测的结构越大磁盘约 3 TBSSD 推荐存放遗传数据库完整库下载 556 GB、解压后 2.62 TBCPU / 内存视数据库配置而定reduced_dbs预设最低 8 vCPU、8 GB 内存、600 GB 磁盘序列数据库BFD、MGnify、PDB 等是 MSA 序列搜索的原料——MSA 即多序列比对指把目标序列与大量同源序列比对后得到的结果AlphaFold 从中提取序列的共进化信号。数据库解压后的目录结构以$DOWNLOAD_DIR为根子目录大小解压后用途bfd/约 1.8 TB完整序列库仅完整库下载mgnify/约 120 GB宏基因组序列params/约 5.3 GB16 个模型参数文件CASP14、pTM、Multimer 各 5 个模型pdb70/约 56 GB模板检索用pdb_mmcif/约 238 GB约 19.9 万个 mmCIF 结构模板uniref30/、uniref90/、uniprot/约 206 / 67 / 105 GB序列搜索后两者多聚体模式必需搭建分五步全部命令如下每段后附参数说明git clone https://gitcode.com/GitHub_Trending/al/alphafold cd ./alphafold克隆本仓库并进入目录后续所有命令都在仓库根目录执行。scripts/download_all_data.sh DOWNLOAD_DIR download.log 2 download_all.log DOWNLOAD_DIR数据库存放目录不要放在仓库内部否则会把 2 TB 级数据拖进 Docker 构建上下文、显著拖慢构建。aria2c是下载脚本的依赖需先用包管理器安装如sudo apt install aria2。下载量 556 GB建议放后台执行。加第二个参数reduced_dbs可下载精简库后续运行需配--db_presetreduced_dbs。docker build -f docker/Dockerfile -t alphafold . pip3 install -r docker/requirements.txtdocker build -f docker/Dockerfile -t alphafold .以 docker/Dockerfile 构建名为alphafold的推理镜像需要 Docker 与 NVIDIA Container Toolkit。pip3 install -r docker/requirements.txt安装宿主机侧run_docker.py的依赖它只是容器启动器依赖很少。docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi在容器内执行nvidia-smi输出应列出你的全部 GPU列不出说明 NVIDIA Container Toolkit 未装好先修这一步再往下走。python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/absolute_path_to_the_output_dir--fasta_pathsFASTA 文件路径多个文件用逗号分隔、依次预测文件名会被用作输出子目录名。--max_template_date只用该日期之前解析出的结构作模板模板 PDB 里与目标序列相似的已解析结构可用于排除干扰。--data_dir上一步下载的数据库目录。--output_dir结果输出根目录默认为/tmp/alphafold运行前确保目录存在且可写。2 首次预测一条命令从 FASTA 到 ranked_0.pdb--model_presetmonomer是默认预设预测单条链。输入文件就是一个标准 FASTA一行以开头的头如sequence_name下面若干行为序列例如sequence_name MSRVA...跑完第 1 节最后那条命令后output_dir/目标名/下会生成ranked_0.pdb到ranked_4.pdb——这是按置信度排序的 5 个预测ranked_0.pdb即最可信的那个直接拖进 PyMOL 等分子可视化软件查看。第 5 节会逐项拆解输出目录里的其余文件。预测耗时主要取决于链长。下表为单张 A100、3 次 recycling 的纯结构预测耗时不含 MSA 与模板搜索时间数据见 README.md残基数预测时间秒残基数预测时间秒1004.91,500280500292,0004501,000965,00018,824想拿到可写入timings.json的计时可加--benchmarktrue。3 多链复合物同聚体与异聚体的 FASTA 写法预测蛋白质-蛋白质复合物时切换--model_presetmultimer其余参数不变输入 FASTA 改成多条序列——文件里有几条序列模型就预测几条链同聚体如 3 拷贝同一个序列写 3 遍各给一个sequence_N头。异聚体如 A2B3A 序列 2 遍、B 序列 3 遍共 5 条顺序即链的编号。多聚体模式默认每个模型跑 5 个随机种子5 个模型共 25 次预测显存或时间紧张时加--num_multimer_predictions_per_model1每模型只跑 1 个种子代价是精度略有下降。注意多聚体模式额外要求 UniProt 库已下载完整库脚本默认包含且它仍是官方标注的进行中的工作稳定性弱于单体管线。4 按任务调参数据库规模、模型预设与 MSA 复用四个最常用开关参数可选值何时使用--db_presetfull_dbs默认/reduced_dbs硬件吃紧时选reduced_dbs8 vCPU、8 GB 内存、600 GB 磁盘即可跑MSA 质量与速度做权衡--model_presetmonomer默认/monomer_casp14/monomer_ptm/multimer见下表--use_precomputed_msastrue同一序列换参数重跑时复用上次输出目录里的 MSA跳过最耗时的数据库搜索--models_to_relaxbest默认/all/none松弛指用 Amber 力场对预测结构做能量最小化修正局部几何none最快但可能残留立体化学违例--model_preset的取舍monomerCASP14 使用的原始模型单模型日常首选。monomer_casp148 倍 ensemble 配置计算成本 8 倍CASP14 平均 GDT 仅提升 0.1主要为复现论文结果提供。monomer_ptm加了 pTM 头的微调版额外给出 pTM 与 PAE 两个整体置信度指标但单体精度略低于monomer。multimer多链复合物模式第 3 节。两点提醒松弛默认走 GPU--enable_gpu_relaxtrueGPU 上偶发不稳定时改false回退 CPUv2.3.0 起训练数据切到 2021-09-30、训练 crop 从 384 扩到 640 残基、推理 recycling 增至 20 次详见 docs/technical_note_v2.3.0.md这些改进已包含在当前代码里直接部署即生效。5 输出文件逐项对照结构、置信度与计时--output_dir下按目标名建子目录结构固定target_name/ features.pkl ranked_0.pdb … ranked_4.pdb ranking_debug.json relax_metrics.json relaxed_model_1.pdb … relaxed_model_5.pdb result_model_1.pkl … result_model_5.pkl timings.json unrelaxed_model_1.pdb … unrelaxed_model_5.pdb msas/ # bfd_uniref_hits.a3m、mgnify_hits.sto、uniref90_hits.sto各文件含义文件内容你什么时候看它ranked_0.pdb~ranked_4.pdb按 pLDDT 排序后的预测结构ranked_0置信度最高交付结构时默认看它--models_to_relaxbest默认时只有它经过松弛unrelaxed_model_*.pdb模型原始输出未做松弛排查松弛阶段问题时对照relaxed_model_*.pdbAmber 松弛后的结构需要物理上更合理的坐标时ranking_debug.json用于排序的 pLDDT 值及与原始模型名的映射想知道ranked_0对应哪次预测时result_model_*.pkl模型原始 NumPy 数组逐残基 pLDDT0~100100 最可信、ptm标量、predicted_aligned_errorN_res×N_res 矩阵0 最可信即 PAE、distogram画置信度图、判断域间堆叠是否可靠时relax_metrics.json松弛后残留的几何违例等指标检查结构质量timings.json管线各阶段耗时需--benchmarktrue定位瓶颈msas/各数据库搜索命中的 MSA 文件调参复用或人工检查序列搜索读结果的三个要点pLDDT 存在 PDB 的 B 因子列且语义与 B 因子相反——数值越高越可信做分子置换等依赖 B 因子语义的任务时注意别误用。pTM 与 PAE 只在 pTM 模型monomer_ptm、multimer中出现pTM 是整体 TM 分数的预测值反映模型对全局域堆叠的信心PAE 矩阵可以可视化哪些域之间的相对取向不确定。逐残基 pLDDT 是判断哪段可信的直接依据低分区段通常是无序或柔性区域结论要谨慎。6 适用边界适合什么任务、哪些场景先别用适合无实验结构、需要快速得到结构假设的单链或多链体系用 pTM/PAE 评估预测结构的整体可信度复现 CASP14 结果配monomer_casp14预设。CASP15 的官方基线预测见 docs/casp15_predictions.zip。不适合批量推理——run_alphafold.py面向单个蛋白优化、每次会按输入尺寸重编译网络官方未提供批量脚本需要自行基于RunModel.predict封装并行流水线动态构象变化——它输出的是静态结构任何临床用途——官方声明仅用于理论建模。已知不确定性个别目标如 CASP14 的 T1064跨随机种子方差较大5 个模型取最优的机制只能部分缓解想要精确复现 CASP14 结果还需按 README 指定历史版本的数据库。与相邻方案的关系实验结构X 射线、冷冻电镜可用时优先信实验数据没有实验结构、又不想承担 556 GB 数据库下载时可先用reduced_dbs跑通流程再决定是否升级到full_dbs多聚体模式精度与稳定性仍在演进重要结论建议结合 PAE 人工检查界面。跑完命令后直接打开output_dir/目标名/ranked_0.pdb看结构再对照ranking_debug.json里的 pLDDT 分布判断这份预测在哪些区域可以放心使用——这就是每次运行的完整验收流程。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考