推文
@snwiki238337 · 2026-10-08 22:04
现在多智能体几乎每篇论文都会顺理成章地加上一层持久化记忆。 把过去的推理轨迹存进向量库,宣称 Agent 拥有了长期记忆后,就能越用越聪明、少看上下文等,并附上一张漂亮利落的消融实验表证明拿掉记忆,效果暴跌。 但如果有人用做底层系统工程的严苛标准,把整套逻辑完整测一遍,会发生什么? 今天刚挂上 arXiv 的这篇Persistent Memory in Multi-Agent LLM Inference: What It Costs, What It Buys, and Why It Evades Auditing,用残酷的数据,给整个多智能体圈子泼了一盆冷水: 持久化推理记忆在严格的隔离测试下,除了多吃显存,带来的准确率收益在统计学上基本是 0。 这项研究针对三层架构的多 Agent 系统,做了真正严密的系统级归因,得出了两个结论: 1. 真正对于显存有效果的的是任务拆分 大模型长上下文推理最致命的瓶颈是 KV Cache 峰值显存,硬件必须按最坏情况预留显存,常常把边缘设备直接干爆。很多人以为 RAG 能解决这个问题,但实测发现 RAG 根本压不低峰值 KV Cache。 但是相反管用的是 Agent 任务分解。这样成功削平了显存尖峰,把每次调用的峰值 KV Cache 砍掉了 60%,端到端延迟降低了 1.8~2.3×。 2. 那为什么大家论文里的持久化记忆都涨了 研究团队在多跳 QA、长文档问答等 8 组基准上做了彻底的纯净消融,结果是:开启持久化记忆,让峰值缓存白白增加了 +0.368 MiB,而带来的准确率净收益仅为 +0.015,约等于 0。 那为什么以前那么多学术论文都测出记忆大幅涨点?研究中指出了三个点: * 记忆污染与自引用:很多测试在重跑或对比消融时,并没有严格隔离清空向量库,后跑的 Query 在语义检索时,顺手调出了前面已经跑过的自身答案甚至是真实标签 * 数据集结构的本质缺陷:主流基准的每道题是完全独立自洽的,题与题之间根本没有复用经验的因果逻辑;只要做严格的跨题隔离,Agent 能召回的只有同一次运行里其他无关题目的噪音干扰 * 把服务端波动当成算法红利:云端 API 自身的排队延迟和采样方差,被当作了记忆组件带来的确定性优势。 这篇论文非常难得的地方在于它展现了一种硬核的基础设施视角,用工程思维去解构这些记忆的效果真实情况如何 。 arxiv:https://arxiv.org/abs/2610.07782
曝光 1496 · 评论 2 · 点赞 26 · 书签 20 · 曝光/时 225.628383063594