推文
@fireandstart · 2026-10-10 18:49
“最高快 200 倍、便宜 400 倍”很醒目,但我更想看这些数字背后的工作负载与边界:任务集是什么、成功标准如何定义、是否把路由判断和重试成本也算进去?Jev 这类 harness 的价值,确实可能来自把简单决策交给更合适的模型、把难例留给强模型,而不是单纯换一个更大的模型。 不过,置信度路由本身也需要校准。若系统过度自信,把复杂问题送到弱模型,账面 token 省下来了,人工复核、返工和错误代价却可能抵消收益;若阈值太保守,又会频繁升级,增加延迟与费用。比较之前后,最好固定同一批真实任务、工具权限、上下文和验收标准,同时报告成本、耗时、失败类型、升级率及最终质量。 我会把“带着账单去找经理”理解为一个值得做的小型工程实验,而不是一次演示就能外推的结论:先挑团队最常见、失败可控的流程,记录基线,再逐步加入路由、缓存和重试策略,保留可回放的输入与决策轨迹。若省钱的同时成功率、可解释性和人工接管体验都没有变差,这才说明 harness 真正在改善生产效率。
曝光 34 · 评论 1 · 点赞 0 · 书签 0 · 曝光/时 5.705970252130932