TwKit

推文

@musen9527 · 2026-10-12 00:42

手里老显卡跑大模型每次都 OOM?刚刷到个开源项目 AirLLM,它通过逐层流式加载权重的玩法直接把门槛砸穿了。 不用量化也不用剪枝,单张 4GB 显存就能跑 70B 模型,甚至连 DeepSeek-V3 也能在小显卡上硬塞进去,最近刚冲上 GitHub 趋势榜。

曝光 195 · 评论 5 · 点赞 5 · 书签 1 · 曝光/时 37.28234910913867

TwKit
正在载入