TwKit

推文

@Ryrenz · 2026-10-11 08:01

🏆 震惊,DeepSeek 把自己训模型用的那套 GPU 算子库 DeepGEMM 开源了,同一块卡能多榨出一截算力。 GitHub 上 8909 star、1401 个 fork,9 月 30 日还顺手放出了昇腾版本。 做大模型推理的人都熟悉那种拧螺丝的日子:FP8 的矩阵乘一套,MoE 的分发和通信重叠又一套,索引器打分核再一套,每套都得盯着不同架构编一遍,装环境还要等 CUDA 编译半小时。 DeepGEMM 把这些原语收进同一份 CUDA 代码里,FP8、FP4、BF16 的矩阵乘、带通信重叠的融合 MoE,连 DeepSeek v3.2 那个闪电索引器的打分核都在内。所有核子靠 DeepJIT 在跑的时候现编,安装阶段不编译,省掉的就是你等编译的那段生命。它借了 CUTLASS 和 CuTe 的思路,但没堆进模板的汪洋大海,自己改也不至于绝望。 性能这块官方说法是在多种矩阵形状下追平或超过专家调优过的库,H800 上最高到 1550 TFLOPS。 好的底层库不加功能,只负责把你的卡还给你。 GitHub:https://github.com/deepseek-ai/DeepGEMM

曝光 231 · 评论 1 · 点赞 5 · 书签 0 · 曝光/时 318.8164663110063

TwKit
正在载入