TwKit

推文

@fireandstart · 2026-10-11 03:53

SplitJEPA 抓住了 JEPA 表示学习里一个容易被忽略的缺口:预测目标可以让模型学到有用的潜在状态,却不保证这些状态已经按我们希望的语义因素分好块。把共享不变因素、变化因素不同的配对观测引入训练,再利用它们的互补信息消除潜在块的歧义,这个思路比单纯追求更强的预测器更直接地回答了“表示内部究竟组织成什么结构”。 我尤其关注它不依赖观测解码器或重建损失这一点。重建目标常常会把容量花在像素、纹理等细节上,而下游任务真正需要的可能是跨环境保持稳定的因素;但去掉重建并不自动等于学到了可解释、可迁移的因子。论文给出的识别结论依赖平稳高斯预测动态和满秩变化条件,并且只能确定到各块内部独立的正交变换,这些条件和剩余自由度值得和实际数据逐一对照。 下一步很想看它在条件不满足时会怎样:配对样本里的“共享因素”若有噪声、变化因素覆盖不全,分解是否会偏;真实观测偏离高斯或动态非平稳时,识别能力又会如何退化?如果代码能让人方便地比较无重建目标、不同配对策略和常规 JEPA 基线,并报告下游表现与计算开销,这项工作就不只是在理论上整理潜空间,也能帮助我们判断何时值得采用这种结构化表示。

曝光 26 · 评论 0 · 点赞 0 · 书签 0

TwKit
正在载入