Ampere 架构 FlashMLA 启动

作者: pzhao-eng创建于 2025年3月11日更新于 2026年6月1日

基于 Hopper 架构的 FlashMLA 和 FlashAttentionV2, 我们实现了基于 Ampere 架构的 FlashMLA。在不使用双缓冲优化的情况下,在 A100 上的性能可达 300 GB/s 和 125 TFLOPS。此代码仓库位于: https://GitHub.com/pzhao-eng/FlashMLA

内容来源: deepseek-ai/FlashMLA