)
AlphaFold 蛋白質結構預測實戰從 FASTA 序列到可信三維結構附 pLDDT 判讀【免費下載鏈接】alphafoldOpen source code for AlphaFold 2.項目地址: https://gitcode.com/GitHub_Trending/al/alphafold輸入一條蛋白質序列AlphaFold 就能輸出它的三維結構和每個殘基的置信度。這是 DeepMind 開源的 AlphaFold 2 結構預測推理管線把過去靠 X 光晶體學才能做的解析變成一次可復現的 GPU 推理。綠色為實驗結果藍色為計算預測 第一次跑預測FASTA 序列和環境要準備什么第一次預測的目標很明確拿到一條序列的三維結構文件。輸入只需一個 FASTA 文件裝著目標蛋白的氨基酸序列多序列會按復合物處理。環境上它要求 Linux 和 NVIDIA GPU官方推薦用 Docker 跑構建邏輯在 docker/Dockerfile。真正的大頭是遺傳數據庫scripts/download_all_data.sh 一次拉全庫約 556 GB解壓后 2.62 TB建議放 SSD。如果你的磁盤緊張或只是試水那么改用reduced_dbs預設它用縮小的 BFD 庫8 核、8 GB 內存、600 GB 磁盤就能跑犧牲一點比對深度換速度。多序列比對和模板搜索數據怎么準備這一步決定預測上限。alphafold/data/pipeline.py 會先調用 JackHMMER 和 HHblits把目標序列和 UniRef90、MGnify、BFD 比對拼出一張多序列比對表也就是 MSA。MSA 是進化留下的痕跡同一位點在多個物種里反復出現的氨基酸往往是結構上動不得的關鍵位點。模型再疊加模板用 HHsearch 從 PDB70 里找同折區參考alphafold/data/parsers.py 把這些工具的輸出解析成張量。如果你的序列太短或太新比對庫幾乎撈不到近親那么 MSA 會偏薄結構就容易不穩。pLDDT 和 PAE 分數怎么讀判斷預測可不可信跑完輸出目錄里每個殘基都有一個 pLDDT 分數預測它和參考結構的吻合度。alphafold/common/confidence.py 把 0~100 分四檔D 是 0~50 的無序區L 是 50~70M 是 70~90H 是 90~100。高分殘基放心看低分殘基多半是柔性區或無序尾。單看 pLDDT 不夠。它只說這個殘基本身像不像不告訴你兩個殘基的相對位置對不對。選monomer_ptm或multimer預設時模型會額外輸出 PAE預測每對殘基的對齊誤差域間關系就看它。如果你的蛋白是復合物而 PAE 交叉區偏高那么亞基間朝向不確定界面別當定論。單鏈還是復合物模型預設怎么選模型不是只有一個。alphafold/model/config.py 里用--model_preset切換monomer是 CASP14 原版monomer_casp14加 8 次集成耗時翻 8 倍、GDT 只多約 0.1復現時才用monomer_ptm多輸出 pTM 和 PAEmultimer處理多鏈需要多序列 FASTA 加 UniProt 庫。如果你的目標是復現 CASP14那么選monomer_casp14想日常批量跑monomer或monomer_ptm更劃算。跑多鏈默認每個模型 5 個種子共 25 次預測嫌慢可用--num_multimer_predictions_per_model降到 1犧牲一點精度。 結構松弛步和輸出結果跑完之后注意什么預測坐標是網絡直接吐出來的未必滿足化學鍵的幾何約束。松弛步用 Amber 力場做能量最小化把局部鍵長鍵角調到物理合理。默認只松弛 pLDDT 最高的模型--models_to_relax可改成 all 或 none。alphafold/relax/relax.py 和 alphafold/relax/amber_minimize.py 是這塊核心。GPU 上更快但偶有波動求穩可關--enable_gpu_relax。最后輸出目錄里有 PDB 結構、置信度 JSON 和 PAE 圖想換參數重跑同一序列開--use_precomputed_msastrue復用 MSA省下最慢的比對那步。把序列存成 FASTA、把庫下完、run_docker.py指過去等進度條走完。輸出目錄里那份帶置信度曲線的結構文件就是你下一個實驗的起點。【免費下載鏈接】alphafoldOpen source code for AlphaFold 2.項目地址: https://gitcode.com/GitHub_Trending/al/alphafold創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考