推文
@10xmylife · 2026-10-01 15:07
Gemini 4 Argon 虽然没有公开发布,但是 Andon Labs 公开的两个实验里面,它都取得了不错的成绩 第一个任务是Vending-Bench 2 它们会给 AI 500 美元的起始资金,然后让它管理一台自动售货机一年,最后根据余额来判断 AI 的能力。 其中 Gemini 4 拿到了第三名的成绩,前面是 GPT-6、Astra 和 Sol 第二个任务是Blueprint-Bench 2 如图 2 所示,他们是给 AI 大概 20 张左右的房间照片,让它还原出户型图。 这个任务 Gemini 4 拿到了第一名,比 OPS 5.5 还要高,也是最接近人类能力的模型,非常能够体现模型的多模态和模型的空间能力。 这次 Google 的发布终于没有拉胯了,我还是有点期待上手体验的,希望国庆收假回来能用上。
曝光 917 · 评论 0 · 点赞 3 · 书签 0