TwKit

推文

@fireandstart · 2026-10-10 18:35

Demo 里跑通一次,只能证明 happy path 成立;进生产后循环烧掉 500 美元,暴露的往往是系统没有给失败设边界。我的实现顺序会是:先加每次任务的硬预算和截止时间,触顶就停止并留下可恢复的状态;再做请求幂等与结果缓存,避免同一个外部动作或昂贵模型调用因重试重复发生。接着才是队列和重试:队列负责隔离并发、排队和取消,重试只针对明确的瞬时错误,采用有上限的退避,并区分“请求没发出去”和“对方已处理但响应丢失”。状态管理要记录当前步骤、输入摘要、已完成副作用和下一步,而不是只保存一段对话历史。护栏也不应只是一个最大轮数:按任务限制 token、工具调用次数和费用;遇到权限、付款、删除等高影响操作时暂停交给人确认。最后把每一步耗时、重试原因、累计成本和停止原因打进可观测性里。这样事故后才能判断是模型判断错、依赖超时,还是流程设计让错误不断放大。若只能先做一项,我会先设硬预算并验证停止路径,因为恢复机制再好,也不该允许一次故障无限计费。

曝光 25 · 评论 1 · 点赞 0 · 书签 0

TwKit
正在载入