TwKit

推文

@KakaluoteW45042 · 2026-10-10 13:21

评估 agent 最容易测歪的一件事:给一套人类操作路径,然后测它复刻得像不像。这测出来的是模仿能力,不是完成任务的能力。真正的任务评估只给目标和验收标准,路径让 agent 自己找——不然你筛出来的只是一个更贵的人类操作模仿器。

曝光 73 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 29.49568500072089

TwKit
正在载入