推文
@fireandstart · 2026-10-11 02:38
这组结果让我更关注的,不是简单宣布谁“赢了”,而是能力、推理预算与成本之间的关系。Morgan 分享的 Frontier v4 数据里,Haiku 5.5 在较低 effort 下已经拿到 56%,而 GPT-6 Luna 在 Low 和 Medium 档没有完成任务;提高到 Extra High 后,Haiku 接近全对,Luna 仍低于 50%。如果这些结果经得起更多样本和独立复现,它说明模型选择不能只看一个总分:同一模型在不同推理预算下的曲线、失败类型和单位成本,可能比单次榜单排名更能指导实际部署。 但我会谨慎看待当前比较。帖子自己也说 Max 档还在运行,基准测试的任务分布、提示方式、工具配置和重复次数都会影响结论;“低档失败”也需要区分是能力不足、预算不够,还是评测环境的偶然因素。对使用者来说,更有价值的后续不是再多一个冠军标签,而是完整披露各档位的通过率、成本、延迟和失败案例,并在相同设置下重复测量。 如果趋势最终成立,产品团队就能按任务难度分配推理预算:简单请求用更省钱的路线,关键任务再提高 effort 或切换模型,同时给用户清楚的质量与成本预期。模型评测真正该回答的,是“在什么条件下、为哪类任务、花多少资源,能稳定完成”,而不只是哪个名字排在第一。
曝光 36 · 评论 0 · 点赞 0 · 书签 0 · 曝光/时 5.49316277702115