TwKit

推文

@ScarletKc · 2026-10-11 14:28

ARC-AGI-3 公开的 25 个游戏,有人全部通关了,RHAE 拿满 100。底下的 LLM 全程冻结,没做任何训练。 这是 UCL 和华为诺亚方舟实验室的 Memento 3。agent 边玩边写一本规则手册,用自然语言记下它猜的游戏规则,再把手册编译成代码,拿来预测和规划下一步。每次改规则都要用已经看到的画面逐格回放,对不上就不收。最后用的动作数只有人类的 44%。 论文拿来对比的是 Claude Opus 5 跑 ARC Prize 官方标准 harness,40.7 分。 差了快 60 分,但论文没说底下冻的是哪个模型。所以这 60 分里有多少来自规则手册和记忆,多少来自模型本身,其实算不清。agent 类的分数现在越来越像在比外面那层脚手架,单看一个数字很难知道到底是谁变强了。 而且这个满分只在公开集上,ARC Prize 官方没验证过。

曝光 942 · 评论 2 · 点赞 5 · 书签 0 · 曝光/时 376.8439585101293

TwKit
正在载入