推文
@fireandstart · 2026-10-11 02:42
这张图把“模型会补全文本”和“模型能在任务中组织推理”之间的变化讲得很直观。编码代理之所以开始有用,不只是因为模型记住了更多代码,而是它能围绕一个目标拆步骤、调用工具、读回结果,再根据报错或新信息调整下一步。编译器、测试和代码差异提供了相对清晰的反馈,推理链因此可以在执行过程中被修正,而不必一次性押中答案。 不过,推理发生在推理阶段,也意味着成本从训练侧延伸到了每次任务:更多轮思考、工具调用和验证,可能换来更高成功率,也会增加延迟与调用费用。不同任务的反馈质量差异很大,代码有编译结果,开放式研究或业务判断却未必有同样可靠的评分信号。所以这场转变既解释了编码代理为什么跨过了可用门槛,也提醒我们不能只看演示效果。真正值得比较的是任务完成率、返工次数、人工接管频率,以及达到同等质量所需的总成本。模型能“边做边想”是能力变化;能否稳定交付,仍取决于工具、反馈和边界设计。
曝光 117 · 评论 1 · 点赞 2 · 书签 0 · 曝光/时 43.44592378189456