TwKit

推文

@ErwinWu000 · 2026-10-11 12:56

我们都被 harness 环境保护得太好了,自己做 agent 的时候才发现,模型的推理能力就是 1 ,harness 才是后面的很多个 0。 而且这个东西你很难归因去验证它 最终效果变好了或者变烂了,你根本不知道到底是模型自身抽风、工具链出了 bug,还是系统 Prompt 的某句话产生了副作用。整个系统高度耦合,控制变量法在黑盒模型和多轮交互面前基本失效 就拿现在我做研究用的平面图生成Agent来说。最近试着在每轮对话里显式注入用户当前需求状态以及是否满足最低交付标准,前测后测只能硬着头皮拿“需求覆盖度”做指标去对齐。 但换一个任务,这套 metric 又得推翻重构 当然,最理想的情况就是直接用人类的交互端到端地看一下体验有没有改进。但碰到黑盒模型,过程的配置可能无法完全复现,我们很难通过控制变量法来验证这件事情

曝光 309 · 评论 2 · 点赞 6 · 书签 1 · 曝光/时 81.74609528830683

TwKit
正在载入