TwKit

Axis社区轮结束后的机器人数据增长

AI科技 · 1 篇公开推文 · 1 位作者 · 曝光 949 · 评论 32 · 点赞 33 · 书签 0

作者关注Axis社区轮结束后的Hub数据,提及691万条机器人轨迹和22.2万用户。

创作角度

  • 社区融资结束后的参与情况
  • 轨迹数据规模如何对应实际价值

相关公开推文

@jeonleetogether

Axis 社区轮刚结束,我本来以为热度会先降一波。 结果我刚打开 @axisrobotics Hub 看了一眼: 691 万条机器人轨迹, 22.2 万用户。 而 9 月 28 日社区轮页面记录的还是 548 万条 verified trajectories。 也就是说,钱募完了,数据机器还在继续跑。 很多 Web3 项目在发币前都会遇到一个问题:数据很好看,任务很多,用户也很多,但等激励最强的阶段过去以后,剩下的东西到底还能不能继续跑? Axis 现在刚好进入这个验证阶段。 社区轮已经结束,100 万美元硬顶也进入分配结算,但 Hub 上的机器人训练任务没有停。 现在除了普通 Pre-training 任务,还有 Challenger Program,以及模型自己执行、人类只在失败位置接管的 Post-training。 这里就开始和单纯“做任务刷积分”不一样了。 Axis 最早做浏览器遥操作,本质上是在解决 Physical AI 一个很现实的问题: 真机数据太贵。 一台机器人、一套场景、一个操作员,想把不同物体、不同视角、不同任务都录够,成本非常高。 Axis 把这件事拆到了浏览器里。 用户直接控制机器人完成抓取、移动、摆放,平台再把有效轨迹清洗、验证,变成真正能拿去训练模型的数据。 更关键的是,这些数据不是只挂在 Hub 上好看。 Axis Sim Dataset V1 一共包含 50,129 条人工遥操作轨迹、207 个任务。 拿这些数据继续训练 π0.5 后,LIBERO-Plus 分数从 83.9 提到了 88.8。 而且从 25% 数据一路增加到 100%,模型表现还在继续往上走。 所以 Axis 前面其实已经证明了一件事: 社区采出来的数据,真的能把机器人模型练强。 但我觉得下一阶段更关键。 当数据已经从 100 万、500 万跑到接近 700 万以后,问题会慢慢从: “还能不能继续采更多?” 变成: “下一条最值得采的数据,到底是什么?” 这也是 Axis 现在开始做 Post-training 和 human-gated DAgger 的原因。 让模型先自己跑。 能完成的任务,人不用管;只有模型快失败的时候,人再进去接管,把它从错误状态里拉回来。 这样采到的,就不再是一堆重复的成功动作,而是模型真正不会的地方。 所以我现在再看 Hub 上那个 691 万,已经不会单纯把它当成一个增长数字了。 前面几百万条,是在帮模型学会做事。 后面的数据,开始是在找模型到底哪里不会。 如果这两个阶段真的能接起来,Axis 想做的 Compounding Data Engine 才算真正开始成型: 任务生成 → 人类遥操作 → 模型训练 → 模型自己执行 → 暴露失败 → 人类纠偏 → 再训练。 社区轮结束以后,反而正好进入了我觉得最值得观察的一段。 融资和发币只能证明市场愿意给钱。 现在这 691 万条轨迹,接下来能不能继续变成更强的模型,才是 Axis 真正要交的作业。 仅为个人研究整理,DYOR。

曝光 949 · 评论 32 · 点赞 33 · 书签 0

查看原帖