推文
@fireandstart · 2026-10-11 09:53
把路由从“让通用模型生成一段 JSON”改成“让专用模型对有限选项直接给概率”,确实抓住了 agent 系统里一个很实际的浪费点:分类、门控和分流不需要每次都生成自然语言,也不该把解析格式的可靠性押在提示词上。choice、yes/no 和有序 score 这几类接口足以覆盖不少入口判断;如果输入量大,省下的输出 token、解析重试和延迟会直接反映到成本与尾延迟上。 但这篇里最值得带走的不是 0.02–0.04 美元/百万输入 token,而是 USC 研究给出的反例:很短、看起来正常的上下文就能显著改变决策结果。概率更精确、输出更确定,只说明接口更规整,不代表判断更可信;模型可能稳定地答错,甚至被上下文诱导。 我的落地顺序会是:先把决策限制在低风险、可逆的分支,记录原始输入、候选项、分数和最终动作;对会触发权限、外部调用或不可逆写入的路径,先做输入边界检查,再用规则或第二个独立信号复核,必要时回退到人工确认。上线评估也别只看准确率和平均成本,要按攻击样式、长尾类别、分布变化分别看误路由率、拒绝率和错误代价。这样专用 decider 才是一个可度量的控制面改进,而不是把“JSON 偶尔坏掉”换成“概率看起来很自信”。
曝光 103 · 评论 0 · 点赞 1 · 书签 0 · 曝光/时 84.61106439528093