H-JEPA!LeCun世界模型创业交卷,代码权重全部开源

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
H-JEPA!LeCun世界模型创业交卷,代码权重全部开源
9127点击    2026-10-11 11:31

LeCun的世界模型初创公司AMI(Advanced Machine Intelligence),刚刚低调交卷了。


在最新的论文H-JEPA中,AMI联合纽约大学、巴黎INRIA和布朗大学的研究者,推出了面向视觉规划的分层世界模型。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


H-JEPA将多个JEPA逐层堆叠起来,让各层在自己的表征空间中,预测不同时间跨度后的状态。


规划时,高层先制定粗略计划,再把预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可以执行的动作。


通过这种分工,世界模型既能规划长远目标,也能处理眼前动作。


在Visual AntMaze仿真迷宫任务中,三层H-JEPA的成功率达到73%,单层模型为18%。


同时,在多项仿真任务中,分层模型还以更少的规划计算量取得了更好的表现。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


除了交出肉眼可见的测试成绩以外,H-JEPA还延续了LeCun在创业之初就强调的开源路线。


团队同步公开了代码和预训练模型权重,研究者可以直接加载模型,复现规划实验。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


为什么世界模型需要分层规划?


这件事,LeCun其实念叨很久了。


早在2022年,还在Meta担任首席AI科学家时,他就提出过分层JEPA的构想:


让模型在不同抽象层级和时间尺度上预测,再通过分层规划,把复杂目标落实为动作。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


这乍一听可能有点抽象,但如果用LeCun经常举的例子来看,其实很容易理解。


假设你正坐在纽约大学的办公室里,准备去巴黎。规划整趟行程时,你关注的是目的地、航班和时间安排。


确定行程后,你开始进一步安排如何离开办公室、下楼、打车去机场。


等到了真正走出办公室时,你关注的信息又变成了眼前的地面、楼梯,以及下一步该落在哪里,先迈哪只脚。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


△AI生成


这些规划层级既覆盖不同的时间跨度,也需要不同的信息。规划航程时,脚下某一级台阶的高度并不重要;走下楼梯时,这个细节却直接决定你该怎样迈步。


而这,也并不是人类规划独有的特性。对于机器人来说,高层需要理解任务目标、环境关系和未来方向,低层则需要掌握具体动作和身体控制细节。


比如,四足机器人已经走到了目标位置,但腿部姿态与目标画面不同,模型仍可能因为这些差异,认为自己离目标很远。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


于是到这里,问题就变成了:


如何让不同层级分别学习适合自己的信息表征,再把高层计划逐步落实为低层动作?


H-JEPA具体怎么做?


具体来说,为了解决上面的问题,H-JEPA在每一层配置了三个组件,分别处理状态、动作和预测。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


其中,状态编码器,负责提取当前环境的表征。最低层直接读取图像,更高层则基于下层表征进一步抽象,保留这一时间尺度下更重要的信息。


动作编码器,负责描述动作带来的变化。低层表示具体动作,高层则将一段连续动作压缩成更粗粒度的变化。


预测器,则结合当前状态和动作,预测未来状态。不同层级覆盖不同时间跨度,论文实验中,相邻高层的一步对应低层的两步预测。


在模型训练方面,上面各层通过端到端训练共同学习,不同层级通过子目标衔接。


高层预测出的中间状态成为低层的子目标,低层会把自己预测的状态转换到高层表征空间,与高层指定的子目标比较,再据此调整动作。


不过,在训练世界模型时,还需要解决一个经典问题:表征坍塌。


如果编码器把所有输入都压缩成同一个向量,预测器只输出这个向量,也能获得很低的预测误差,但模型实际上没有学到任何有用的信息。


为此,H-JEPA沿用了LeCun团队此前在LeJEPA中提出的SIGReg,对表征分布进行约束,避免不同状态被压缩到同一个向量。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


今年的LeWorldModel把这套方法用于世界模型训练。H-JEPA则以它为最底层,向上增加更多JEPA,形成共同训练、由上至下规划的结构。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


在实验中,研究者进一步观察到了不同层级的信息取舍。迷宫任务里,高层逐渐弱化腿部姿态,但仍保留了机器人的位置信息。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


不过,分层也有适用条件。Push-T任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。


论文认为,这可能是较短的任务轨迹可能限制了高层可用的训练数据。


LeCun,还是那个LeCun


总的来说,H-JEPA的这些设计,延续了JEPA的一项基本主张:在表征空间中完成预测。


JEPA的全称是“联合嵌入预测架构”。LLM通常通过预测下一个token来学习生成内容;视觉JEPA则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


在H-JEPA这类世界模型中,模型还会结合动作,预测未来状态的表征。规划器据此比较不同动作的后果,寻找通向目标的方案。


LeCun一直认为,理解世界、预测行动后果和规划,是走向人类级智能必须具备的能力。他对LLM的判断,也始终围绕这一点。


今年9月,在瑞典马尔默举行的ECCV上,他的演讲幻灯片再次出现了那句熟悉的建议:


如果你对人类级AI感兴趣,就不要研究LLM。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


这张幻灯片传到社交平台后,有人怀疑是不是假的。LeCun回复:


包是真的。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


他随后补充,基于LLM的AI工具非常有用,大家都在使用。但他认为,单靠LLM本身无法走到人类级智能。


如今,这套研究主张也成为AMI的创业方向。


今年3月,AMI宣布完成10.3亿美元融资,投前估值35亿美元。


公司由LeCun担任董事长,Alexandre LeBrun担任CEO,谢赛宁担任首席科学家,Pascale Fung负责研究与创新,Michael Rabbat负责世界模型,而Rabbat也是这次H-JEPA论文的作者之一。


不过,有一说一,研究成果归研究成果,外界对AMI的另一个期待,仍然是产品。


至少从目前官网来看,公司展示的主要还是技术方向、团队和招聘信息,尚未看到面向公众的产品入口。


H-JEPA!LeCun世界模型创业交卷,代码权重全部开源


另一边,同样押注世界模型的World Labs,已经迎来了新的转折。


9月28日,AMD宣布与李飞飞创办的World Labs签订约82亿美元的全股票收购协议。


可以说,一边正在走向与芯片公司的结合,另一边则继续沿着自己的研究路线往前推进。


但随着李飞飞的世界模型创业有了里程碑进展,Yann LeCun的大结果是不是也只是时间问题而已…了呢?


参考链接

[1]https://venturebeat.com/technology/h-jepa-teaches-world-models-to-plan-at-multiple-levels-of-abstraction

[2]https://arxiv.org/pdf/2610.06805


文章来自于微信公众号 “量子位”,作者 “量子位”

关键词: AI新闻 , 世界模型 , LeCun , H-JEPA
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI