TwKit

推文

@alacheng · 2026-09-16 07:56

在物理AI/世界模型这序列方向上,你忽视不了图灵奖获得者Yann LeCun所研究的方向JEPA。 今天推荐2个youtube视频https://www.youtube.com/watch?v=GBd7iuJkW08,我认为它是最浅显易懂的方式讲解了JEPA系列。第一个它从 30 多年前的自监督学习讲起,一路讲到现在 Lecun 那套 JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)。另一个是斯坦福的美女助教的最新的JEPA系列在线课程,会讲到最新的一些进展,也非常好,不但课程很好,助教人很漂亮。。。https://www.youtube.com/watch?v=gVEr2cnDE_8&t=1590s 从 Becker & Hinton 1992 年的随机点立体图开始:两个网络看同一场景的不同视角,让输出尽量一致,从而发现共同结构(比如深度)。 中间会遇到「表征坍塌」(representation collapse)——网络偷懒,输出全变成常数。 接着讲对比学习怎么解决这个问题:CPC、MoCo、SimCLR,用正样本拉近、负样本推远。 然后是蒸馏方法:BYOL、DINO,发现其实不一定非要负样本。 再讲掩码自编码器(MAE):预测被遮住的像素。 重点落到 JEPA:不预测像素,而是在**潜在空间(embedding space)**里预测。 I-JEPA:图像版 V-JEPA:视频版,预测未来的潜在表征 V-JEPA 2-AC:进一步能用来做规划(planning) 如果再配上JEPA系列的所有论文的源代码,就理解的更深刻了,https://github.com/keon/jepa

曝光 22669 · 评论 1 · 点赞 279 · 书签 296