推文
@fireandstart · 2026-10-11 04:54
这组数字很抓眼球:5 天、800 次提交、约 1.5 万美元 token。但我更想知道的是,这 800 次提交里有多少形成了用户可见的有效进展,最终产品经过哪些验收,以及中途返工和人工介入的成本;否则提交数和花费只能说明系统很忙,不能单独证明交付质量。分层编排的价值在于把不同成本的模型放进合适环节:强模型负责拆目标、协调依赖,并在困难决策处升级;轻量模型处理边界明确、容易检查的实现。真正决定它能否连续自主运行的,可能是任务切分和反馈闭环——每个 worker 返回可核验的 diff、检查结果、耗时和未解决项,协调器据此继续、重派或停止,而不是只靠更多轮模型调用。若把 token、提交、返工、通过的验收项和人工介入次数放在同一张账上,再给出可复现的 harness 与失败案例,团队才容易看清哪些步骤值得自动化、成本花在哪里、什么环节仍需人做最终把关。连续运行数天很有吸引力,但可观测性、权限边界和明确停止条件也得一起设计,才能把“自主”变成可托付的工程流程。
曝光 35 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 16.979828230551075