推文
@byCanen · 2026-10-12 02:13
刚看到一篇研究 Coding Agent Harness 的论文,做了 176 组对照实验,比较四个模型的规划、工具接口和上下文管理。 有几个结果很适合拿来检查自己搭的 Agent: 上下文越紧张,管理上下文越重要,主要作用是避免任务做到一半直接溢出。 先用规则删掉无关历史,再交给 LLM 做摘要,通常比一开始就频繁调用模型总结更省成本。 Plan 对较弱模型有明显帮助,能让它更容易真正进入代码修改阶段;对较强模型,价值更多体现在减少重复动作和成本,成功率不一定明显提升。 工具也不是越多越好。擅长 Bash 的模型,在部分命令行任务里只靠 Bash 就能高效执行;不擅长的模型则更需要预定义工具。 论文:https://arxiv.org/abs/2609.20804 如果正在改自己的 Codex / Claude Code Harness,可以先让 Agent 做一次只读检查: 「读这篇论文,对照我当前的 Agent 工作流,分别检查 Plan、上下文压缩和工具调用是否存在重复开销。结合现有运行日志,提出最多三个可独立验证的修改和 A/B 测试方案。不要直接改代码。」 有了对照数据,再决定哪个组件值得改。
曝光 48 · 评论 0 · 点赞 0 · 书签 0