推文
@NFT_Chen · 2026-10-09 08:51
💥惊了!训练也能“PD 分离”:阶跃星辰 CTO 朱亦博把 Scaling 从“只卷效果”改写成三目标优化,训练成本、推理成本、模型效果,缺一赢就落地不了!而 Step-5 Preview 只是开胃菜! 要点如下: 1️⃣真正能进主航道的,是“三赢”。MoE 当年不纠结等参数量:相对 dense BERT,训练更省、推理更省、效果更好,所以算法和 Infra 都没理由不用。Upcycle、YOCO 往往只赢两项目标,一放大就撞墙。 2️⃣Upcycle 省训练,但社区担心同尺寸效果不如 from scratch;为了把效果补回来把模型做大,推理成本又上去,三赢破局。 3️⃣YOCO 很适合 Agent:Step 3.5 Flash 被全球用户打了几万亿 token 后,他们看到推理成本里 prefill 占比明显上升,省 prefill 的结构值得看。但 DSv4.1 Flash 那条路是用约 2 倍尺寸保效果、再靠 YOCO 压推理,训练成本也按大尺寸付。旗舰团队会觉得:不省训练,就很难替代经典 LLM baseline。 4️⃣KITE 的解法:先训一个更小、专做 prefill 的子结构,生成全部 KV;再扩一块只在 decode 激活、复用这份 KV 的部分,继续预训练。硬约束是扩出来的参数不能改 KV。于是模型可以靠 scale 把效果补回来,prefill 成本却仍按小模型算。Agent 重 prefill 时,综合推理仍可能优于更小的经典 baseline。 5️⃣实例是 Step Scale Transformer(SST):双塔/叠层,Prefiller 出 KV,Decoder 读 KV。论文里 67B SST(prefill 激活约 1.12B,decode 激活约 2.15B)在与 47B classic 等训练 FLOPs 下,EMA loss 1.5900,低于 47B 的 1.6006;推理 proxy 低 6.7%。相对 63B classic,推理 proxy 低约 31.6%。不追求同参数量,追求三赢。 6️⃣他自己也留了口子:这只是“先训半个模型、复制一遍、再续训”的最小架构。Prefiller/Decoder 不对称、KV 以外多传信息、decode 侧倒序用 KV,以及和“不改 KV、只复用第一遍 KV”的 Loop Transformer 的关系,都还没探完。Scaling law 也更复杂:两阶段参数占比、token 占比、学习率都要调。 他把产品现状和这条研究线分开说了: Step 5 Preview(600B MoE / 约 27B 激活 / 1M 上下文)已有开发者反馈可替代 Opus 4.8 做日常开发,和 GPT-6 Astra、Opus 5.5 仍有差距;KITE 上旗舰,还在期待。 #阶跃星辰 #Step5 #KITE #PD分离 #Agent #MoE #ScalingLaw #朱亦博
曝光 354 · 评论 5 · 点赞 10 · 书签 5