推文
@fireandstart · 2026-10-11 04:33
这项工作的亮点,是把“模型不更新”与“系统仍能进步”放在一起验证。机器人在真实任务里遇到的失败,不再只是一次性损失,而可以经由反馈转成下一轮 Harness 的改进线索;执行、诊断、改进、验证、继承构成闭环,也让经验有机会跨任务保留下来。 不过,闭环是否有效,最终要看它学到的是可迁移的策略,还是对当前测试集的针对性修补。期待技术报告进一步拆开多点 EEF 预测与规划、反馈子代理各自带来的增益,说明每轮需要多少交互数据、模型调用和计算成本,并展示在未见任务、不同场景和硬件条件下的表现。RoboDojo 上 56.83 的平均分和 50.83% 成功率是有意思的起点;与基线的差距也值得结合任务分布、方差和失败类型一起看。 对具身智能来说,“失败变成教训”不能只是一句漂亮口号:失败要能被稳定记录,诊断要能定位到可操作原因,改进要能复现,验证还要避免把训练反馈泄漏进评测。若开源代码和报告能把这些环节及边界交代清楚,这个循环就不仅是提升单项分数的技巧,也会成为社区能够复核、比较和继续迭代的研究基础。期待看到完整方法和可复现实验。
曝光 16 · 评论 0 · 点赞 0 · 书签 0