AI INSIGHT

H-JEPA,LeCun世界模型创业交卷,代码权重全部开源

AI新闻 36氪 2026-10-10 16:21
AI 摘要

量子位四年前在Meta时就开始酝酿 LeCun的世界模型初创公司AMI(Advanced Machine Intelligence),刚刚低调交卷了。 在最新的论文H-JEPA中,AMI联合纽约大学、巴黎INRIA和布朗大学的研究者,推出了面向视觉规划的分层世界模型。 H-JEPA将多个JEPA逐层堆叠起来,让各层在自己的表征空间中,预测不同时间跨度后的状态。 规划时,高层先制

量子位
四年前在Meta时就开始酝酿

LeCun的世界模型初创公司AMI(Advanced Machine Intelligence),刚刚低调交卷了。

在最新的论文H-JEPA中,AMI联合纽约大学、巴黎INRIA和布朗大学的研究者,推出了面向视觉规划的分层世界模型。

H-JEPA将多个JEPA逐层堆叠起来,让各层在自己的表征空间中,预测不同时间跨度后的状态。

规划时,高层先制定粗略计划,再把预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可以执行的动作。

通过这种分工,世界模型既能规划长远目标,也能处理眼前动作。

在Visual AntMaze仿真迷宫任务中,三层H-JEPA的成功率达到73%,单层模型为18%。

同时,在多项仿真任务中,分层模型还以更少的规划计算量取得了更好的表现。

除了交出肉眼可见的测试成绩以外,H-JEPA还延续了LeCun在创业之初就强调的开源路线。

团队同步公开了代码和预训练模型权重,研究者可以直接加载模型,复现规划实验。

为什么世界模型需要分层规划?

这件事,LeCun其实念叨很久了。

早在2022年,还在Meta担任首席AI科学家时,他就提出过分层JEPA的构想:

让模型在不同抽象层级和时间尺度上预测,再通过分层规划,把复杂目标落实为动作。

这乍一听可能有点抽象,但如果用LeCun经常举的例子来看,其实很容易理解。

假设你正坐在纽约大学的办公室里,准备去巴黎。规划整趟行程时,你关注的是目的地、航班和时间安排。

确定行程后,你开始进一步安排如何离开办公室、下楼、打车去机场。

等到了真正走出办公室时,你关注的信息又变成了眼前的地面、楼梯,以及下一步该落在哪里,先迈哪只脚。

△

这些规划层级既覆盖不同的时间跨度,也需要不同的信息。规划航程时,脚下某一级台阶的高度并不重要;走下楼梯时,这个细节却直接决定你该怎样迈步。

而这,也并不是人类规划独有的特性。对于机器人来说,高层需要理解任务目标、环境关系和未来方向,低层则需要掌握具体动作和身体控制细节。

比如,四足机器人已经走到了目标位置,但腿部姿态与目标画面不同,模型仍可能因为这些差异,认为自己离目标很远。

于是到这里,问题就变成了:

如何让不同层级分别学习适合自己的信息表征,再把高层计划逐步落实为低层动作?

H-JEPA具体怎么做?

具体来说,为了解决上面的问题,H-JEPA在每一层配置了三个组件,分别处理状态、动作和预测。

其中,状态编码器,负责提取当前环境的表征。最低层直接读取图像,更高层则基于下层表征进一步抽象,保留这一时间尺度下更重要的信息。

动作编码器,负责描述动作带来的变化。低层表示具体动作,高层则将一段连续动作压缩成更粗粒度的变化。

预测器,则结合当前状态和动作,预测未来状态。不同层级覆盖不同时间跨度,论文实验中,相邻高层的一步对应低层的两步预测。

在模型训练方面,上面各层通过端到端训练共同学习,不同层级通过子目标衔接。

高层预测出的中间状态成为低层的子目标,低层会把自己预测的状态转换到高层表征空间,与高层指定的子目标比较,再据此调整动作。

不过,在训练世界模型时,还需要解决一个经典问题:表征坍塌。

如果编码器把所有输入都压缩成同一个向量,预测器只输出这个向量,也能获得很低的预测误差,但模型实际上没有学到任何有用的信息。

为此,H-JEPA沿用了LeCun团队此前在LeJEPA中提出的SIGReg,对表征分布进行约束,避免不同状态被压缩到同一个向量。

今年的LeWorldModel把这套方法用于世界模型训练。H-JEPA则以它为最底层,向上增加更多JEPA,形成共同训练、由上至下规划的结构。

在实验中,研究者进一步观察到了不同层级的信息取舍。迷宫任务里,高层逐渐弱化腿部姿态,但仍保留了机器人的位置信息。

不过,分层也有适用条件。Push-T任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。

论文认为,这可能是较短的任务轨迹可能限制了高层可用的训练数据。

LeCun,还是那个LeCun

总的来说,H-JEPA的这些设计,延续了JEPA的一项基本主张:在表征空间中完成预测。

JEPA的全称是“联合嵌入预测架构”。LLM通常通过预测下一个token来学习生成内容;视觉JEPA则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。

在H-JEPA这类世界模型中,模型还会结合动作,预测未来状态的表征。规划器据此比较不同动作的后果,寻找通向目标的方案。

LeCun一直认为,理解世界、预测行动后果和规划,是走向人类级智能必须具备的能力。他对LLM的判断,也始终围绕这一点。

今年9月,在瑞典马尔默举行的ECCV上,他的演讲幻灯片再次出现了那句熟悉的建议:

如果你对人类级AI感兴趣,就不要研究LLM。

这张幻灯片传到社交平台后,有人怀疑是不是假的。LeCun回复:

包是真的。

他随后补充,基于LLM的AI工具非常有用,大家都在使用。但他认为,单靠LLM本身无法走到人类级智能。

如今,这套研究主张也成为AMI的创业方向。

今年3月,AMI宣布完成10.3亿美元融资,投前估值35亿美元。

公司由LeCun担任董事长,Alexandre LeBrun担任CEO,谢赛宁担任首席科学家,Pascale Fung负责研究与创新,Michael Rabbat负责世界模型,而Rabbat也是这次H-JEPA论文的作者之一。

不过,有一说一,研究成果归研究成果,外界对AMI的另一个期待,仍然是产品。

至少从目前官网来看,公司展示的主要还是技术方向、团队和招聘信息,尚未看到面向公众的产品入口。

另一边,同样押注世界模型的World Labs,已经迎来了新的转折。

9月28日,AMD宣布与李飞飞创办的World Labs签订约82亿美元的全股票收购协议。

可以说,一边正在走向与芯片公司的结合,另一边则继续沿着自己的研究路线往前推进。

但随着李飞飞的世界模型创业有了里程碑进展,Yann LeCun的大结果是不是也只是时间问题而已…了呢?

参考链接

[1]https://venturebeat.com/technology/h-jepa-teaches-world-models-to-plan-at-multiple-levels-of-abstraction

[2]https://arxiv.org/pdf/2610.06805

本文来自微信公众号“量子位”,作者:henry ,36氪经授权发布。

来源:36氪
阅读原文