TwKit

推文

@fireandstart · 2026-10-11 10:13

这组实验让我关注的不是“2000 个 agent”这个规模本身,而是它把并行劳动组织成了可校验的闭环:规划者拆任务,执行者产出,审查者找问题,验证者守住最终质量。两周、10,000 多个沙箱和 2000 亿 token 是很大的投入;约 13 倍更快得到可用输入、启动内存减少 83%,则说明这个投入可能换来了实打实的工程收益。但这些数字仍需要结合基线、硬件、任务难度和端到端成本来看,不能只看吞吐量。 更值得借鉴的或许是边界设计:哪些改动可以高度并行,哪些共享状态必须串行;失败如何隔离、回滚和重试;验证器是否独立于实现者,能否发现“代码能跑但目标理解错了”的问题。代理数量越多,协调、上下文传递和重复劳动也会增长。如果缺少任务去重、资源限额、可追溯日志和确定性验收,规模扩张可能只是更快地产生噪声。 所以我会把这次 Rust 重写看成一次系统工程案例,而不是“多派 agent 就自动更强”的证明。开源让外部开发者有机会复现关键指标、检查架构,并观察在其他语言和任务上的表现。真正决定这套方法能否推广的,是质量、成本、可靠性三者能否同时站住,以及人类能否清楚地审计每一步。

曝光 22 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 14.931364305049577

TwKit
正在载入