TwKit

推文

@MaxForAI · 2026-10-09 00:00

国庆假期这几天,我其实一直在折腾 Step 5 Preview,前前后后测了挺长时间。 主要还是围绕 Agentic 能力,拿了不少实际任务反复测试,包括任务完成情况、执行速度,以及多轮执行的稳定性。 相比官方 Benchmark 上的分数,我还是更关心一个模型在真实 Agent 场景里到底能把事情做成什么样。 之前一直没急着发,也是想尽可能多测几轮,避免因为个别任务就下判断。 现在准备把这段时间的测试结果整理一下,接下来会陆续发一些详细的实测内容,也分享一下我对这个模型的判断。 整体来说,Step 5 Preview 确实有不少值得聊的地方,而且它目前还只是 Preview 版本。

曝光 1337 · 评论 6 · 点赞 10 · 书签 2 · 曝光/时 1230.8168300040893