不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界

主页:http://qingkeai.online/
作者:尚书尧 中科院自动化所
自然语言连接了 AI 与人类积累的数字知识。下一步,当AI走入物理世界,PhiZero希望用“物理语言”连接 AI 智能与真实世界。
人类用语言保存经验、传递知识,也用语言进行思考。从日常交流到科学定律,从历史记录到程序代码,自然语言凝结了人类长期积累的知识与经验。今天的大语言模型正是从这些语言材料中学习,逐渐获得了组织知识、表达概念,以及理解和推理数字世界的能力。
但当 AI 从数字空间走向物理空间,一个新的问题随之出现:如果自然语言是理解数字世界的重要接口,那么,物理世界能不能也拥有一套属于自己的“语言”?
论文:PhiZero: A World Model Built Around Physical Language
项目主页:https://Phi-Zero.github.io
作者:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang
机构:中国科学院自动化研究所(NLPR, CASIA)PhiZero 能做什么?
在解释“物理语言”之前,不妨先看 PhiZero 已经能够做什么。
1. 物理真实的视频世界模型
PhiZero 能够建模海浪撞击岩石、液体注入容器、物体落入热油、金属罐爆炸等复杂过程,并生成连贯的后续变化。模型关注的不只是单帧是否逼真,更关注事件是否完整、物理后果是否连续。
海浪、流体、燃烧、爆炸与物体交互:不同场景背后,共享的是对世界状态如何演化的建模。
2. Motion Transfer:保持变化,替换载体
物理语言主要表达“怎样变化”,而不是“谁在变化”。因此,同一段状态转移可以被重新渲染到新的外观、身体形态或视觉域中。
Human Body → G1 Humanoid
PhiZero 从人类运动视频中提取状态转移,再将同一段物理语言渲染到 Unitree G1 人形机器人上。整个过程不需要人类与机器人之间的成对训练视频。
四组跨形态迁移案例;每组左侧为人类源视频,右侧为 G1 迁移结果。
Human Hand → Sharpa Dexterous Hand
人手的接触、抓取和腕部运动也可以迁移到 Sharpa 灵巧手。
Simulation → Reality
相同思路还可以用于 sim-to-real:保留仿真视频中的交互过程,用真实外观替换初始场景,再根据原有物理语言重新渲染。
每一行左侧为仿真源视频,右侧为在真实视觉域中重新渲染的结果。
3. 可交互的 Image-to-World 探索
PhiZero 支持连续、可修改的控制输入。模型根据每一步移动和视角指令更新未来世界,同时尽可能保持场景、地标与空间关系的一致性。
四个可交互世界:异星地貌、月夜湖畔、海岸村落与夕阳原野。
4. Action-conditioned 驾驶世界模型
对同一个初始驾驶场景施加不同控制轨迹,PhiZero 能够生成与转向方向和幅度对应的未来。下方四个场景均同时展示多条候选控制信号及其视频结果。
5. Action-conditioned 机器人世界模型
从抓取、舀取到双臂协作,PhiZero 可以先将动作轨迹“翻译”为物理语言,再渲染对应的细粒度机器人交互。
从这些能力出发:为什么需要“物理语言”?
视频世界模型正在变得越来越强。给定一张图像或一句指令,它们已经能够生成画面逼真的未来视频。然而,视觉上的“像”,并不等于物理上的“对”。
一个网球撞上玩具鸭,鸭子是否会被推开?物体落入热油,液体会如何飞溅?金属罐爆炸后,火焰、碎片与阴影将怎样连续变化?
这些问题真正考验的,不只是模型能否生成清晰的像素,而是它是否理解:当前状态将如何转变,动作会带来什么后果,世界又将沿着怎样的因果链继续演化。
以往的视频世界模型通常直接在高维像素空间中预测未来。物理规律被隐含在庞大的视觉预测器里,模型更像是在“猜下一段画面”,而不是显式地推理“接下来会发生什么”。PhiZero 希望改变这一点。
什么是“物理语言”?
PhiZero尝试从海量真实视频中,通过自监督学习得到一种紧凑、离散的 物理语言(Physical Language)。它不负责描述一个物体是什么颜色、拥有怎样的纹理,也不试图把每一个像素重新编码一遍。它关注的是另一件事:
物体如何运动和交互,世界状态如何从此刻持续演化到下一刻。
例如,“杯子是什么样”可以由第一帧画面提供;而“液体如何倾倒、扩散和流动”,则由物理语言来表达。这样一来,“世界长什么样”与“世界怎样变化”便可以在表示上被分开。
这种设计让物理语言成为一种可复用的状态转移表示:场景外观可以改变,物体形态可以改变,但运动与交互的模式仍有机会被保留、组合和迁移。
状态转移保持不变,物体、材质与场景外观发生变化。
PhiZero:先推理,再渲染
围绕物理语言,PhiZero 建立了一套 Reason-then-Render(先推理、再渲染)的世界建模范式。

整个过程包含两个核心部分:
第一步:学习物理语言。Physical Language Tokenizer 从视频中提取相邻世界状态之间的变化,并将其压缩为离散符号序列。第一帧负责提供场景与物体的静态外观,预训练扩散解码器负责补全视觉细节,因此有限的符号容量可以更专注地记录“发生了什么变化”。
第二步:用物理语言推理未来。Physical Language Reasoner 以当前画面和动作意图为输入,先自回归地预测未来的物理语言序列,再由扩散解码器把这段世界演化渲染成视频。
于是,未来视频的生成不再只是一次从条件到像素的直接映射,而被拆解成两个更清晰的过程:
现在的世界是什么状态 → 接下来会怎样变化 → 这种变化在画面中如何呈现
在一个四秒、8 FPS、分辨率为 512×896 的视频中,PhiZero 只使用 256 个离散物理语言符号来表示第一帧之后的状态转移。作为参照,常规视频 VAE 需要 44,800 个连续视觉 token。
实验显示,在高度压缩的视频 tokenizer 中,物理语言仍能保持领先的重建质量: 它所保留的并不是冗余的外观,而是支撑世界演化的关键信息。
从海量视频中,学习世界如何变化
语言来自经验,物理语言也一样。

PhiZero 首先从约 5 万小时真实世界视频中进行去重、质量过滤与镜头筛选,得到约 1 万小时无标注视频用于 Physical Language Tokenizer 预训练;
随后结合真实与仿真数据,构建约 500 万个四秒视频片段,进一步学习更丰富的状态转移;
最后筛选出约 100 万个运动显著、物理过程清晰的视频片段,用于强化 Physical Language Reasoner 对物理演化的推理能力。
这里没有预先规定“碰撞”“重力”或“流体”应该对应哪个符号。物理语言从观看世界的过程中涌现:模型通过压缩、重建和预测大量视频,逐渐学会哪些变化模式值得被记录,以及它们如何组合成连续的世界演化。
物理语言帮助世界模型理解世界
四组 Physics-IQ 对比案例,橙色边框标识 PhiZero 结果。
PhiZero在物理视频生成与理解任务上进行了系统评测。
在 Physics-IQ Verified、PhyGround 和 WorldModelBench三项视频生成基准上,PhiZero 分别在物理结果一致性、物理规律遵循和综合世界建模指标上取得领先表现。
与直接生成像素的视频模型相比,PhiZero 更能捕捉碰撞后的位移、重力导致的形变、连续的链式反应,以及随物体运动而变化的阴影等物理后果。
在 IntPhys2、LikePhys 和 YoCausal三项视频理解基准上,PhiZero 同样展现出有竞争力或领先的结果。它可以比较两段视频在物理语言空间中的合理程度,从而识别违反直觉物理或因果关系的事件。
这意味着,物理语言不只是生成视频时使用的压缩编码,也可以成为模型判断“什么更可能在真实世界中发生”的依据。
让物理语言成为 AI 与真实世界的新接口
自然语言的重要性,不只在于它能够描述世界,更在于它提供了一种抽象、组合、推理和交流知识的方式。我们对物理语言的期待也是如此。
PhiZero 是这条路线上的早期探索:当世界演化被压缩成一种可预测、可传递的中间语言后,生成、理解、控制与迁移可以在同一个框架中建立联系。
未来,物理语言或许可以进一步服务于多模态模型的时空理解、具身智能体的规划,以及跨机器人形态的技能迁移。更大规模的数据、更强的模型和更长时间跨度的推理,也将帮助它描述更加丰富的真实世界。
正如自然语言连接了 AI 与数字知识,我们希望,物理语言能够成为连接 AI 智能与真实物理世界的一种新接口:
让 AI 不只看见世界,也学会用世界自己的语言,理解它将如何变化。
往期推荐

从 Being-M0.7 看人形机器人的 WAM 路线

谈论 World Model,请先对齐你的坐标!World Model 的四个象限

聊聊 2026 具身新模型架构的几派观点

VLA 模型:从入门到研究实践指南
加入青稞具身智能技术交流群
加入青稞具身智能技术交流群,不仅能与来自MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的Talk分享、青稞Tea、论文精读、招聘内推、国内外硕/博申请、大模型技术报告解读等。备注:姓名+学校/公司+方向,暗号"具身智能"优先审核通过!

都看到这了,点个关注再走吧🧐~