“代码即物理世界(Code‑as‑World)”思想起源与发展历史
圈内口语叫“代码即物理世界”,学术范式名称为 Code‑as‑World,2026年8月27日MirroS团队正式发布同名论文《Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning》,是当前AI圈热议的具身智能/世界模型新范式。
核心主张:不用像素、隐向量、纯文本去表征物理场景;把物体、质量、摩擦、动力学演化全部写成可执行仿真代码(如MuJoCo场景描述),AI把观测(视频/图像)反向还原出这套代码,用代码运行、仿真、干预、验证,以此理解物理世界。
一、思想史前溯源(哲学、早期AI,1980‑2021)
1. 泛计算论(Pancomputationalism)哲学根基
- 哲学源头:宇宙即计算,物理定律本质是可执行程序,物质是运行时状态。物理学方程等价于算法,现实世界是一套大规模运行的计算系统,这是“代码描述物理”最底层思想来源。
- MIT罗德尼·布鲁克斯 包容架构 Subsumption Architecture(1980s):机器人不靠全局符号世界模型,靠简单程序模块和环境交互生成智能。埋下一条关键教训:符号/程序才适合真实物理交互,纯感知预测会失忆、状态崩坏。
- 传统符号AI失败:早期物理推理(Qualitative Physics定性物理)尝试用逻辑方程描述物体碰撞、下落,但很难从原始视觉观测自动推导,只能人工手写规则,无法规模化。
2. 仿真驱动AI与基于模型强化学习(MBRL,2015‑2021)
- MBRL:学习一个环境模型(世界模型),在仿真环境里做规划训练。早期世界模型大多是隐向量 latent 模型,不是显式代码;模型是神经网络黑盒,不可读、不可编辑、无法人工干预参数。
- MuJoCo、Isaac Sim等物理仿真器成熟:人类手写XML/JSON场景代码描述物体、物理参数,运行得到物理演化。人写代码→仿真出物理现象;但AI不能反过来从视频自动写出这套代码,这是当时的瓶颈。
这一阶段:人写代码生成物理世界;AI做感知、做仿真内训练,但不会逆向把现实观测还原成代码。
二、前置技术铺垫(2022‑2025:大模型代码能力爆发,过渡阶段)
三件事凑在一起,催生Code‑as‑World思想:
-
LLM代码生成能力爆发:GPT‑4、CodeLlama等可以稳定输出仿真、机器人控制代码。出现PaLM‑SayCan(2022):大模型输出机器人API调用代码完成物理任务;ProgPrompt用程序式规划做机器人任务规划。
此时代码仍然只是任务输出,不是AI内部表征世界本身。
-
世界模型路线分裂(2023‑2025)
- A路线:视频生成式世界模型(如Gen‑2、Sora):输出像素画面。画面非常逼真,但没有显式物体质量、摩擦、惯性;物体离开画面就丢失状态,干预推理不可靠(幻觉物理)。
- B路线:显式3D几何重建:重建物体mesh,但缺少动力学参数,不知道“物体多重、碰撞会怎样”。 学界越来越意识到:像素、几何、文本都不足以作为物理世界的内部表征,需要可执行、可仿真的显式机制表征。
Code2Worlds(2026‑02,arXiv:2602.11757)
提出闭环范式:Prompt → Code → 仿真世界执行 → 反馈回传 → 修改Code。把代码生成+仿真执行反馈形成闭环,但它是文本生成世界,不是从真实世界视频观测逆向反推代码。
Meta‑斯坦福2026年5月综述《Code as Agent Harness》:提出代码不再只是输出物,而是Agent的运行骨架、推理/环境建模载体,为Code‑as‑World做思想铺垫。
三、范式正式诞生:Code‑as‑World(2026‑08‑27)
MirroS团队arxiv发布论文《Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning》,正式提出完整范式,引爆AI圈讨论。
核心创新点(区别过往工作)
-
逆向方向:从真实视频观测反推可执行物理代码
输入一段现实世界视频,Agent循环迭代:生成MuJoCo仿真场景代码 → 运行仿真 → 和原视频比对误差 → 修改代码里物体质量、位置、摩擦系数,多轮迭代收敛,得到一套可以复现视频物理现象的可执行代码。像素是现象证据,代码才是世界的机制表征。
世界表征三层拆分
组成层:物体、几何、质量、摩擦等物理参数;
演化层:动力学、碰撞、状态变迁规则;
外观层:纹理、光照、相机;
全部编码为可执行仿真程序,不是隐向量。闭环Agent回路:观测→假设代码→仿真执行→对比观测→修正代码。得到的代码既可以做物理推理,也可以作为监督数据训练多模态模型。
团队放出Code‑as‑World‑VL‑9B模型,在QuantiPhy物理推理基准超过Gemini‑3.1 Flash。
同期行业舆论呼应
- Vercel CEO Guillermo Rauch(2026‑07)公开观点:AI告诉我们一切都可以表达为代码,甚至宇宙本身可能就是代码。社交媒体传播,把“万物皆代码”推到公众视野,和Code‑as‑World技术形成舆论共振。
- IJCAI 2026,吴佳俊获奖演讲:“像素只是表象,物理代码通向动力学与因果”,强化学术界共识:视觉生成不等于物理理解。
四、三条并行路线对比(方便区分)
| 范式 | 世界表征形式 | 方向 | 局限 |
|---|---|---|---|
| 视频生成世界模型 | 像素/隐向量 latent | 输入条件→生成画面 | 物理机制是黑盒,状态容易崩坏,干预不可控 |
| Code2Worlds | 仿真代码 | 文本提示生成仿真世界 | 只能正向生成,不能从真实视频逆向还原 |
| Code‑as‑World(代码即物理世界) | 可执行物理仿真代码(MuJoCo等) | 真实观测(视频)逆向推导物理代码 | 计算开销大,只能处理中等复杂度场景,尚处于原型研究阶段 |
五、后续发展与开放问题(2026年8‑9月现状)
-
定位:不是取代视频世界模型,是互补。
Code‑as‑World负责机制、因果、干预推理;视频模型负责渲染真实视觉纹理;架构上可以组合:代码管逻辑状态,大模型负责渲染画面。
当前局限
只能处理简单场景,复杂开放世界逆向推导代码成本极高;
仿真器本身存在物理误差;
从视频反推多组物理参数属于欠定问题,存在多解。
衍生方向
具身机器人:把现实环境自动转成可编辑仿真代码,作为机器人内部世界模型;
物理AI训练:从真实视频自动生成带真实物理标签的训练数据集;
Agent:把物理世界理解变成可调试、可调试、可版本管理的程序,而不是黑盒神经网络。
六、一句话时间线速览
- 80‑90年代:定性物理、包容架构,尝试用程序描述物理世界,但只能人工写,AI不会逆向推导。
- 2015‑2021:MBRL、仿真器成熟;世界模型大多是隐向量黑盒。
- 2022‑2025:大模型写代码能力崛起;机器人领域用代码做任务规划,但代码只是输出,不是内部世界表征。
- 2026‑02:Code2Worlds实现“文本生成仿真代码闭环”,正向生成世界。
- 2026‑08‑27 Code‑as‑World正式发布:实现从真实视频逆向还原可执行物理代码,“代码即物理世界”范式正式成型,成为AI圈热点。
Top comments (0)