从 AlphaFold DB 中批量下载 MSA 文件
作者: hughplay创建于 2026年1月12日更新于 2026年4月27日
** 说明:**
我试图从AlphaFold数据库(https://alphafold.ebi.ac.uk/)下载数百万个蛋白质的多序列对接文件(MSA).
对于单个蛋白质,我可以通过蛋白质条目页上"下载文件"部分(如:https://alphafold.ebi.ac.uk/files/msa/AF-G1JSI4-F1-msa v6.a3m)成功下载MSA文件. 然而,我需要使用蛋白质ID列表大规模地下载MSA文件. 我探索了几种选择,但遇到了一些限制:
- 使用单个蛋白质链接的直接API式下载 - 这似乎对单个文件有效, 但我担心,当缩放到数百万个请求时, 潜在的速度会受到限制. 我找不到关于API费率限制或批量下载政策的文件.
- [Google Cloud桶](https://console.cloud.google.com/marketplace/products/bigquery-public-data/deepmind-alphafold?project=gen-lang-client-042345979] - 现有数据似乎限于v4版本,不包括MSA文件.
- EBI FTP服务器(https://ftp.ebi.ac.uk/pub/databases/alphafold/) - 说吧 虽然变更日志提到了MSA更新,但我无法在目录结构中找到实际的MSA文件.
问题:**
- 给蛋白质ID清单的MSA文件批量下载的建议办法是什么?
- 在向个人下载端点提出大量请求时,我是否应该遵循任何费率限制或最佳做法?
谢谢你的协助和保持这一宝贵的资源!
内容来源: google-deepmind/alphafold