TwKit

推文

@vintcessun · 2026-10-11 20:00

长思维链的 KV 缓存,不一定非得在“删掉历史”和“原精度保留”之间二选一。BreadthKV 用低比特量化换取更多 token 的历史:旧 KV 压到 2、3 或 4 bit,保留最近 128 个 token 为 fp16,再按固定字节预算校准位宽。 https://arxiv.org/abs/2610.05685 关键不只是压缩,而是把预算花在更宽的推理轨迹上。18 个模型与评测设置中,17 个胜过单纯淘汰;Qwen3-8B 最紧预算下,AIME 推理撞上 32K 上限的比例从 91% 降到 40%。但校准只用 60 道题,跑偏也没消失,落地效果仍要看模型和预算。

曝光 199 · 评论 3 · 点赞 3 · 书签 2 · 曝光/时 5.168364456991996

TwKit
正在载入