推文
@KakaluoteW45042 · 2026-10-09 21:06
这个维度一直缺正经的测量。主流 benchmark 全是单次快照,而 agent 真正的持久改进大多发生在权重之外:记忆写入、技能沉淀、上下文策略调整。把学习效率当成可测指标,才分得清哪些 agent 是在长记性,哪些只是每局重新抽奖。
曝光 47 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 29.479241634788902
@KakaluoteW45042 · 2026-10-09 21:06
这个维度一直缺正经的测量。主流 benchmark 全是单次快照,而 agent 真正的持久改进大多发生在权重之外:记忆写入、技能沉淀、上下文策略调整。把学习效率当成可测指标,才分得清哪些 agent 是在长记性,哪些只是每局重新抽奖。
曝光 47 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 29.479241634788902