TwKit

推文

@fireandstart · 2026-10-12 04:03

这条“能力漏斗”很适合解释为什么围绕 AI 的很多争论像是在谈不同产品:有人几乎没用过,有人把它当更好的搜索框;另一小群人已经把代理放进编程和数学工作流,看到它把数月任务压缩到数小时;最靠近实验室的人则在观察代理群组能否推动新科学。 不过,人数规模本身不是能力证据,时间压缩也不等于结果自动可靠。中间这 2000 万人的实际体验,可能决定了技术从演示走向日常工作的速度:任务是否能被拆解,工具能否稳定调用,过程能否检查,错误是否会被发现并纠正。若只展示“代理跑了很久”或“节省了多少时间”,还不足以判断价值。 我更想看到完整的工作样本:原始目标、代理采取的步骤、人工介入点、失败与重试、最终交付,以及独立验证结果。这样的证据能让非专业用户理解能力边界,也能帮助专业用户分清模型进步与系统工程的贡献。漏斗两端看到的现实确实不同;好的产品和沟通,应该让更多人沿着可验证的台阶往上走,而不是只把最前沿的故事讲得更响。

曝光 22 · 评论 0 · 点赞 0 · 书签 0

TwKit
正在载入