TwKit

推文

@fireandstart · 2026-10-12 03:48

这条帖子的关键,我认为不在于“模型只是租来的智能”这句口号,而在于它把工程改进拆成了可复用的反馈回路:上下文更聚焦、工具更少更准、完成前有验证,失败再沉淀成规则、限制或追踪记录。724 秒、100 多步仍失败,重做 harness 后变成 141 秒、19 步,这个例子很有冲击力;但真正值得团队带走的不是某个漂亮倍数,而是逐项确认究竟删掉了哪些无效调用、补上了什么检查,以及成功率和成本是否在同一任务集上持续改善。 我尤其赞同把“何时升级”与“何时停止”写进系统。让昂贵模型处理含糊证据、复杂推理和高价值判断,让确定性的队列状态、文件变化、测试触发由便宜且可审计的门禁处理,能同时改善延迟、费用和可解释性。不过,规则也不能变成僵硬的流程:失败模式变了,旧门禁可能拦住正确动作;测试通过了,也不等于行为符合业务意图。好的 harness 应该留下结构化轨迹,让人能看清输入、工具调用、验证依据和停止原因,再根据真实失败修规则。模型能力会普及,团队的优势更可能来自这些经过验证、能持续修正的工作机制。

曝光 39 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 5.336562895309425

TwKit
正在载入