世界模型第一次有了“存档”?VAST 想用 Project Eden 重写生成式世界的底层逻辑
世界模型第一次有了“存档”?VAST 想用 Project Eden 重写生成式世界的底层逻辑
过去一年,世界模型成了 AI 圈最热的词之一。
很多团队都在说,模型已经不只是会生成视频,而是在朝“生成世界”迈进:一句话可以换来一段连续画面,一个动作或镜头也能触发人物、场景和物体的连贯变化。问题在于,今天大多数被冠以世界模型之名的方案,本质上仍然更像“会动的视频”,而不是真正可以持续存在、被改变、被多人进入的世界。
VAST 最新发布的 Project Eden,想解决的正是这个根问题。它没有继续沿着“下一帧预测”往前卷,而是试图把世界状态推演和视觉呈现原生解耦,让模型先维护一个持续演化的底层世界,再根据视角、动作和交互需求把它渲染成画面。

主流世界模型,为什么更像“视频”而不是“世界”
要理解 Project Eden,先要看清行业里两条主流路径。
第一类是动作条件视频生成。它根据文本、图像、动作指令或相机轨迹生成一段连续视频,优势是演示直观、交互感强,也最容易让用户产生“世界在响应我”的感觉。但问题也很明显:模型预测的仍然是 2D 像素轨迹,世界里到底有什么、物体在哪里、状态怎么变化,往往都被隐式压缩在最近几帧画面中。一旦物体离开视野,模型并没有一个独立的世界状态去保存它,镜头转回时只能根据上下文重新“幻想”。
第二类是静态 3D 场景生成。相比视频生成,它确实更接近“空间”本身,但如果只有静态空间,没有时间维度、物理逻辑和状态转移机制,它依然很难被称为真正的世界模型。一个真正有用的世界,不只是能被看见,还应该能被改变、持续运行,并支持多个用户或多个智能体同时进入。
VAST 的判断很直接:一套合格的世界模型,至少要同时解决两个问题——世界当下的客观状态是什么,以及这个状态如何随着动作、时间和交互持续演化。只有同时具备这两点,世界模型才可能从“生成内容”走向“生成环境”。
Project Eden 真正的新意:先有世界,再有画面
Project Eden 最关键的架构选择,是把“世界本身”和“世界看起来的样子”拆开。
它的第一层是结构化状态层,负责维护一个跨时间持续存在、可被动作更新、可被任意相机位置查询的全局世界状态。这不是一个昂贵的 4D 点云,而是一种更紧凑、兼顾效率和语义丰富度的隐式表征,用来回答“世界里有什么、发生了什么”。
第二层是条件接口层,把底层的全局世界状态转换成适合特定视角使用的局部条件,包括语义信息、几何线索和事件变化。不同玩家看到的不是彼此独立的视频历史,而是同一个世界在不同位置上的不同窗口。
第三层是生成式渲染层。它不再承担完整的世界逻辑推演任务,而是在底层状态与中间条件的约束下,补全纹理、光照、材质和高频动态细节,生成最终画面。这样一来,模型解决问题的方式就从“预测下一帧”改写成了“先推演下一刻的世界状态,再从这个状态渲染当前画面”。前者更像视频续写,后者才更接近世界模拟。

这套架构,直接换来了三种系统级能力
最直观的一项,是环境长程持久化。
在 Project Eden 里,物体离开视野,并不意味着它从世界里消失。它依然存在于底层状态中,并继续按照世界逻辑运转。当用户转身离开再回来时,系统查询的还是同一个世界状态,而不是根据历史视频帧重新拼接一个相似画面。世界第一次有了接近“存档”的感觉。
第二项能力,是场景自由复用与确定性控制。传统视频生成是一条一次性的时间线:生成过了就固定了,难以回退,也难以分支。但在解耦架构里,底层状态是可以被读写和干预的。用户造成的破坏、建造与修改,可以被真实写入世界;后续进入同一场景的其他用户,也会看到一致的结果。内容形态因此从一次性视频,变成了可编辑、可复用、可持续运营的互动空间。
第三项能力,是原生多人和多智能体并发。传统视频世界模型最怕的就是多人同时在线,因为每个玩家都有自己的视角、动作和上下文,一旦每一路都依赖独立的视频历史来生成,算力和一致性就会迅速失控。而在 Project Eden 里,底层状态只有一份,被所有智能体共享;渲染层只需根据各自位置和视角生成画面。这不只是性能优化,更是商业落地的前提。
难点不只在架构,更在数据
Project Eden 背后的数据策略,同样是这套方案能否成立的关键。
VAST 提出了一套分层数据思路,核心是“双态对齐数据”:既包含底层推演态,也包含视觉渲染态。围绕这个目标,他们在数据端部署了两层策略。
L1 是海量互联网视频自标注。VAST 依托自身 3D 基础模型能力,对无标注 2D 视频做反向解构,提取深度、相机位姿和几何轨迹,把单态视频尽量提炼为双态数据。这一层的价值在于覆盖广度和真实世界泛化。
L2 是引擎合成数据。游戏引擎天然具备世界状态和渲染结果同步存在的特点,可以低成本批量生成带有精确 3D 状态标注、动作指令和环境变化的数据。这一层的价值在于逻辑精度与可控性。
这种“互联网数据泛化 + 引擎数据精准化”的组合,说明 VAST 想做的并不是一个只靠 demo 出圈的视频模型,而是一套更接近底层系统的世界生成方案。

Project Eden 更大的想象空间,不只是生成内容
如果只把 Project Eden 看成一个更强的 3D 生成工具,其实低估了它。
它更大的意义,在于有机会成为下一代互动内容的底层基础设施。过去一个可玩、可交互、可多人进入的世界,通常需要美术、建模、动画、关卡、物理引擎和网络同步等复杂流程来搭建。生成式 AI 已经把 3D 资产生产的门槛压低了很多,但“生成一个模型”和“生成一个能持续运行的世界”之间,仍然隔着很大一段距离。Project Eden 想补的,就是这段距离。
从更长远的角度看,它的潜力也不止于内容生产。因为它维护的是稳定的底层世界状态,而不是一次性视频画面,这让它天然适合作为智能体活动的环境底座。对智能体来说,关键从来不只是看到逼真的画面,而是环境能否按一致规则响应动作、保留变化并持续演化。
所以,Project Eden 的价值不只是把 3D 生成推进到交互内容阶段,更在于为世界规则学习、仿真模拟、具身智能和多智能体协同提供一个可以被反复进入、持续实验的环境。
结尾
如果只看表面,Project Eden 像是在做一个更强的 3D 世界生成模型。但更值得关注的,是它把世界模型的问题重新写了一遍:不是继续预测画面,而是先维护世界本身。
一旦这条路线成立,世界模型就不再只是“把视频做得更真”,而是第一次真正有机会从内容生成走向环境生成。从这个意义上说,Project Eden 最值得关注的地方,不是它又做出了一个惊艳 demo,而是它让世界模型第一次更像“世界”,而不只是“视频”。