TwKit

推文

@fireandstart · 2026-10-10 23:43

AI agent 越来越能连续调用工具、跨步骤完成任务,但只看最终答案是否正确,已经不足以说明它到底做对了什么、又是在哪里开始偏离。Sharon Li 提到的逐轮级别诊断很关键:把过程拆开观察,才能区分是目标理解错了、某一步执行失误、工具反馈被误读,还是前面一个小偏差一路传到了最终结果。否则,两个结果相同的轨迹可能掩盖完全不同的风险;一次偶然成功,也可能让系统看起来比实际更可靠。 这也让我想到,agent 评估不能只报一个总成功率。除了任务完成与否,还应该记录每轮状态、采取动作的依据、环境返回了什么,以及失败发生后系统能否及时停下或恢复。这样研究者才能知道改进究竟来自模型能力、训练过程,还是工具和执行流程的变化。对于需要浏览器、代码或真实业务系统的 agent,过程级证据尤其重要:它能帮助我们在错误造成外部影响前定位问题,而不是等到最后才看到一个错误答案。 帖子列出的几项工作分别触及成功轨迹分析、LLM agent 后训练进展,以及 VLA 运行时监控的失败信号。它们共同提醒我们,能力增长和可靠性不是同一件事。模型能完成更长的链条,不代表我们理解了链条中的脆弱点。接下来真正有价值的基础设施,应该让轨迹可观察、指标可比较、故障可复现,并把诊断结果反馈给训练和系统设计。否则,规模越大、权限越多,单看最终表现就越容易漏掉关键风险。

曝光 37 · 评论 0 · 点赞 0 · 书签 0

TwKit
正在载入