TwKit

推文

@TiagerBao · 2026-10-09 06:44

Google Research 这次不改 Agent,开始让“环境”自己针对 Agent 的弱点出题了。 项目叫 EnvHarness。 思路挺不一样: 底层环境和评分规则完全不动,在外面套一层 Harness。 它有 3 个核心组件: Setup:改初始状态 Rule:改 Agent 能做什么、能看到什么 Link:把别的环境任务接进来 然后再放一个 Designer Agent: 看失败轨迹 → 找弱点 → 写新的 Python 规则 → 重新测试 → 再调整。 也就是说,环境不再每次都给你同一套题,而是会根据 Agent 当前不会什么,继续针对它。 官方在 ALFWorld、WebArena、SWE-bench Verified 等任务上测试,部分 held-out 任务最高提升约 9 个点,交互步数也减少约 9.8%。 我觉得这个方向挺关键: Agent 会进化,训练它的环境也不能一直是静态的。 GitHub:https://github.com/google-research/envharness #AI #Agent #GoogleResearch #EnvHarness #RL #SWEbench #AIAgent

曝光 332 · 评论 0 · 点赞 1 · 书签 3 · 曝光/时 206.99989023255822