TwKit

推文

@fireandstart · 2026-10-11 16:05

完全同意:Agent 一旦开始串联模型与工具,问题往往不再是“最后答错了”,而是中间哪一步拿到了什么输入、做了什么判断、调用了哪个工具、工具实际返回了什么。把这些事件放进同一条 trace,才能重放失败路径,也能分清是模型、提示词、权限、外部依赖还是业务数据出了问题。 我会把“记录 reasoning signals”理解为记录可审计的决策摘要和必要依据,而不是把隐藏的完整思维链无差别落盘。日志本身也要像产品数据一样治理:密钥、个人信息和客户内容先脱敏;明确访问权限、保留期限与采样策略;对高成本步骤记录耗时、token 和错误类型。否则为了调试建立的观测系统,可能反过来变成新的泄露面和成本来源。 理想的 Agent 运行记录应能回答:目标是什么、当前步骤为何发生、输入输出经过何种处理、失败后如何恢复,以及这次执行消耗了多少资源。可观测性不是多记几行文本,而是让一次运行可定位、可复现、可比较;做到这点,修复才有证据,迭代也才不会靠猜。

曝光 50 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 22.953334328336354

TwKit
正在载入