推文
@fireandstart · 2026-10-12 04:07
很多人评估 Agent,只数它写了多少代码,却漏掉了大部分运行成本:它不断判断要不要继续、该路由给谁、是否安全、能不能忽略。这个例子里,约 71% 的步骤是决策,真正由 LLM 写作约占 14%;“什么都不做”反而是最常见的结果。若只盯着生成阶段换更便宜的模型,可能优化错了地方。 我更关心的是决策链能否被测量和约束:把状态与类型明确的问题交给轻量决策器,输出选择和置信度;低于安全阈值时交还给人,而不是硬闯。帖中 0.62 低于 0.85,因此转人工;自动发帖则被明确设为永不执行,草稿必须等人确认。这些边界比“模型很聪明”更像能落地的工程设计。 当然,71% 和 14% 是特定示意流程的剖析,不应直接当作所有 Agent 的通用比例。真正值得复用的是方法:先给决策分支做 profiling,再看忽略、路由、评分各自的频率、延迟、token 与错误代价;同时记录哪些决定可以自动化、哪些必须保留人工闸门。成本优化从工作流结构入手,安全则由明确阈值和人工接管兜底。
曝光 122 · 评论 3 · 点赞 1 · 书签 0 · 曝光/时 42.6925031624754