
FlashMLA —— 专为 Hopper GPU 优化的 MLA 解码内核,释放强劲性能
DeepSeek 最新开源项目 FlashMLA 正式亮相。这是一个针对 Hopper GPU 优化的 MLA 解码内核,专门为处理变长序列而生。通过 FlashMLA,GPU 性能得以充分发挥,成为 AI 模型训练与推理的高效加速器。
极致性能,快速集成
- 性能突破: 在 H800 SXM5 上,结合 CUDA 12.6,FlashMLA 可实现高达 3000 GB/s 的内存受限配置速度和 580 TFLOPS 的计算受限配置速度,显著提升效率。
- 轻松集成: 仅需几行代码,即可将 FlashMLA 的强大加速能力集成到你的模型中,大幅提升训练和推理速度。
- 功能支持: 支持 BF16 和 64 大小的分页 kvcache,轻松应对大规模数据处理,确保性能与效率兼得。
硬件与软件要求
- GPU 支持: 专为 Hopper GPU 优化,充分发挥硬件性能。
- 软件版本: 需 CUDA 12.3 及以上版本,PyTorch 2.0 及以上版本。
灵感来源与背景
FlashMLA 的开发灵感源于 FlashAttention 2&3 和 cutlass 项目,继承了这些经典项目的优化理念,进一步提升了性能表现。
立即体验
GitHub 项目地址,快速集成 FlashMLA,为你的 AI 模型训练与推理注入强劲动力:
https://github.com/deepseek-ai/FlashMLA










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。