
李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?
Quick Answer
Li Feifei's spatial intelligence aims to create robust 3D worlds through AI, addressing the challenge of maintaining state integrity during interactions.
Quick Take
Current models like MiniTown and SceneOrchestra face bottlenecks in speed and state continuity, emphasizing the need for a recursive self-improvement framework to ensure reliable world generation.
Key Points
- AI-generated worlds lack a verifiable state record, hindering their reliability.
- MiniTown integrates time, rules, and behaviors into a cohesive city model.
- Recursive Self-Improvement (RSI) is essential for continuous learning and adaptation.
- Current models struggle with maintaining object identity after local modifications.
- Industry benchmarks now focus on effective result time and constraint adherence.
📖 Reader Mode
~5 min read
作者丨刘紫东
编辑丨幸丽娟
李飞飞押注的空间智能,被视为世界模型的主流路线之一。
这条路线的基本构想是,让 AI 从识别二维画面,走向理解、推理和生成可进入、可操作、可持续编辑的三维世界。
但真正的考验在于:一个“站得住”的世界,是怎样构建出来的?
要回答这个问题,不妨先回到一个更基础的追问:当 AI 的交付形态从“画面”变成“三维世界”,互动方式从“观看”变成“进入和操作”,到底意味着什么?
它意味着 AI 交付的内容开始拥有时间属性:对象需要在多轮操作中保持身份,规则要承受真实行动,局部修改也要与已经成立的关系相容;系统还得从每一次行动的后果中,修正自己对世界的理解。
李飞飞将这组能力概括为 Renderer、Simulator 与 Planner——通俗地说,一个负责把世界“画出来”,一个负责记住“世界现在是什么样、行动之后会变成什么样”,一个负责决定“下一步做什么”;三者之间的连接,尤其是模拟与规划共享的状态层——也就是那本“底账”,直接决定了一个生成世界能否继续运行。
然而,维持这一状态层持续运转并非易事。空间世界的开放性和交互组合的无限性,意味着任何预置规则都无法穷尽所有可能情形。系统必须在实际运行中不断遭遇未知、记录冲突并修正假设。
说白了,就是让系统从每一次操作中自动学习。当这种“自我纠错”从零散的补丁升级为一整套固定流程时,行业称之为递归自我改进(Recursive Self-Improvement, RSI):系统将“状态—目标—行动—新状态—验证—反馈”保存为完整轨迹;在真实交互中识别能力缺口;自动生成新任务和困难样本;再经独立评测、版本门控与回滚,驱动下一轮迭代。
反过来看,空间世界也恰好为这一闭环提供了理想的试验场。它有明确的对象、可执行的动作和可外部核验的结果,使“从可观看世界,到可计算状态,再到持续行动与学习的自主空间智能”不再停留于技术想象,而成为一条可逐步验证的工程路径。

01
生成式 AI 能造出怎样的世界?
生成式 AI 的输出正在获得空间属性:人可以进入、操作,并在其中继续创作。三维世界把感知、推理、代码、物理和交互压进同一项任务,也因此成为前沿模型少见的综合试验场。
▎一句话造出能跑、能玩的空间
Kimi K3 的官方演示里,一段自然语言最终变成浏览器中的程序化开放世界:骑乘、森林、村庄、山地、水体和天气处于同一运行画面中。它展示了模型将三维推理、代码生成、工具调用和视觉反馈串成一条完整工作流的能力。
GPT‑5.6 与 Codex 构建的 MiniTown 则更进一步。房屋和道路之外,分区、居民日程、车辆与昼夜循环也被组织在同一状态里。一幅城市画面由此获得了时间、规则和行为,背后则是资产组织、规则编写、引擎执行和反复检查。
所谓“一句话生成”,实际压缩了一条很长的生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。时间轴把演示和系统区分开来——桌子移动后仍要保有身份,门的开合需要更新通行区域,局部换材质也应限定影响范围。世界开始接受行动,状态维护随即进入智能系统的核心。

【MiniTown 官方画面;分区、道路、居民、车辆与昼夜循环处于同一运行状态。】
▎一个可运行世界如何被构建
一个可运行空间至少包含三类状态:语义状态说明对象是什么、承担什么功能;几何状态保存尺寸、位置、边界与拓扑;运行状态记录门是否打开、角色在执行什么任务、路径是否仍然有效。三者必须绑定在同一对象生命周期中。
系统还要区分“编辑世界”和“在世界中行动”:删除一面墙是在改规则,推开一扇门则是在规则内运行,两者需要不同的权限、依赖和回滚方式。
这使世界生成越来越像软件编译与持续集成。自然语言先被翻译成目标与约束,空间模型提出结构,资产系统补齐对象,求解器处理边界、碰撞和关系,引擎执行并渲染,验证器再决定新状态能否提交。每次修改都应继承上一个稳定版本,并把重算限制在受影响区域。
整条链可以压缩为“表示—转移—验证”:描述当前世界,计算行动带来的变化,再检查新状态是否满足几何、物理和任务目标。通用模型理解意图,专用空间模型求解位置与约束,状态层让模型、资产、求解器和引擎围绕同一个世界协作。评估也随之从首轮画面扩展到有效质量、首次有效时间与单位有效结果成本。工程链能否压低返工,同时维持既有状态,决定了世界生成能走出演示多远。
▎三条技术路线的能力边界
目前,构建可运行三维世界的技术路径主要沿着三条路线展开:以视觉生成驱动的感知式世界生成、以对象身份、规则为核心的符号化/程序化世界生成,以及正在形成的融合架构。

三者起点不同、优势各异,但正朝同一方向收敛。视觉表征开始吸收对象身份和可操作状态,程序化系统则补入视觉经验、连续空间与开放环境泛化。融合架构试图用统一的中间表示承接两者,关键检验发生在行动之后:观察与状态能否同步更新。

02
真正的瓶颈:世界造出来了,
但等不起、也改不动
▎共同技术瓶颈
感知式路线把大量世界信息压在画面或潜在表征里,错误往往藏在镜头之外;符号化路线把对象和程序显式写出,错误则常藏在代码和工具状态之后。它们的表象不同,根因相近:生成结果承担了过多世界状态,却缺少一份独立、可验证、可增量更新的底账。
今天的产品门槛集中在两个问题上:多久能拿到第一个可继续工作的场景;局部修改之后,它能否保持原有身份和关系。影响范围不清、约束无法自动复核,系统便会退回整场重算、多轮截图和人工审阅。
▎速度瓶颈:第一次返回很快,第一个有效结果却很慢
用户实际等待的是第一个通过几何、功能和任务检查的结果。单轮生成即使很快,只要接受率偏低,时间仍会被资产检索、渲染、碰撞检测、视觉审阅和反复修复吞掉。
SceneOrchestra 在同一 A6000 环境复测时,LayoutGPT、Holodeck、SceneOrchestra 和 SceneWeaver 的平均运行时间从 2.3 分钟延伸到 91 分钟;World Labs 文档把 Draft、完整 World 和高质量 Mesh 分别放在约 20 秒、5 分钟和接近 1 小时的时间带。质量越依赖多轮验证和整场重算,工作流越趋近异步生产。衡量高频空间工具,指标需要从“首轮响应”移向“首次有效时间”。

【公开案例中的完整场景生成与修复耗时图,从草图到可用世界,工程等待时间呈现秒、分钟和小时三个工程时间尺度。来源:World Labs 文档、SceneOrchestra 论文】
▎状态瓶颈:局部修改后,全局关系开始失守
世界最容易在局部修改后失去连续性。感知式世界会在视角切换、遮挡和重返场景时改变尺度或细节;符号化系统可能在移动一个对象后破坏碰撞、承托、朝向、绑定或路径。对象仍在,关系已经断裂。
公开评测反复碰到这一层故障:FloorplanQA 中,模型会违反碰撞和路径约束;GameCraft‑Bench 记录了局部机制运行、完整游戏依然失败的案例;GEST 让 LLM 独立输出完整事件图时,50 次尝试全部失败,程序化状态后端接管对象生命周期、时序和合法操作后,执行才稳定下来。SceneSmith 进一步表明,场景图需要补齐碰撞、质量、惯性和摩擦等属性,才能进入仿真系统。
维持这种连续性需要持续对象身份、关系与依赖图、事件日志、版本历史、增量求解器和验证器。快照记录“现在看起来怎样”,事件链解释“世界为什么变成这样”,并为局部回滚、失败定位和长期任务学习提供依据。

【LayoutGPT 室内布局失败图,集中展示家具越界、对象重叠和错误朝向。】
速度与状态瓶颈正在重塑技术栈。每次生成都可以被记录为一次候选状态更新,随后进入行动、检查、提交、回滚与学习。同一份可计算状态贯穿整个过程。

03
解决方向:
生成“状态—行动”闭环的世界模型
▎构建世界模型基础:让每一次观察和行动都有据可查
World Labs 把世界模型按功能分为 Renderer、Simulator 和 Planner:Renderer 产生观察,Simulator 维护几何、物理和动力学状态,Planner 根据目标选择行动。三者需要一层可持续运行的状态作为接口,保存对象身份、几何、关系、约束、行为接口、任务进度、来源、置信度与版本,并把每次修改转化为可检查的局部补丁。
这层状态还要同时容纳离散结构与连续空间。对象、部件、拓扑和规则适合写进场景图;光照、视线、通行、可达性和活动条件随位置连续变化,需要空间场与求解器。RGB、深度、点云、3D 高斯、网格和机器状态也要对齐到同一套对象与状态体系。SceneScript、HDSL 等研究把场景写成可寻址、可局部修复的命令或层级程序,OpenUSD 一类接口则让对象与版本跨工具持续存在。
沿着这一框架观察产业实践,以空间智能创业公司生境科技为代表的国内团队,已经展现出相近的系统思路。其自主空间智能把空间状态模型、空间—行动模型和空间执行引擎围绕同一世界状态组织起来:前者维护对象、几何、关系、规则与历史;中间模型学习目标、动作和未来状态的关系;执行引擎负责生成、修改、渲染并把结果写回。
在状态表示上,其 MST-Builder 尝试把合规图文、商品、3D 资产和 UGC 编译为带语义、几何、关系、来源与许可信息的空间 Token;NSF 研究用连续功能场表达“哪里适合做什么”。这种底账驱动的架构,使局部修改只需重算受影响区域,而非整场重建,工程上已实现 20 秒级增量解算——这正是第二章“等不起、改不动”两个瓶颈的对症解法。

【“状态/行动/执行/验证”架构图,展示四个环节如何围绕同一世界状态运行。】
▎行动学习:把每次修改变成可训练轨迹
一个空间的生成可以被展开为一连串行动:创建、删除、移动、替换、组合、改边界、调规则、规划路径。系统若保存“当前状态—目标—行动—新状态—后果”,训练便能覆盖行动如何改变世界,以及怎样用多步操作抵达目标。
行业研究已在机器人侧展示这种结构:ConceptGraphs 把连续感知整理成可更新的空间图,SayPlan 从任务相关子图生成计划,并根据不可执行反馈重规划;VoxPoser 则把语言约束落到连续三维价值场中。共同趋势是分层:高层维护长期目标,中层规划对象与关系,底层求解几何、路径和控制,失败时回到最近稳定状态。
轨迹还需要真实产品中的连续交互。生境科技等团队也提供了一种可行路径的参考:将反馈采集嵌入空间创作流程后,系统能够积累覆盖对象添加、删除、移动、替换、撤回、保存和评分等操作的完整状态转移轨迹。
这些轨迹由此获得了多重训练价值。撤回操作可转化为反事实负样本,用于训练模型理解“什么不该做”;连续编辑序列则揭示了长期目标如何被拆解为多步行动,为分层规划提供数据基础。
随着数据规模扩大,价值也会从数量转向覆盖:哪些目标经常返工,哪些关系最容易被局部修改破坏,哪类状态通过几何检查却仍未被用户接受。完整事件链可以把最终撤回或任务失败追溯到更早的错误更新,并送入专项训练、困难样本回放和版本门控。

【生境科技等国内团队将反馈采集嵌入空间创作流程示例——森盒二测五层数据闭环图】
▎验证系统:决定哪一个世界可以被提交
闭环最后需要一位“裁判”。确定性规则检查格式、边界、对象生命周期和依赖完整性;几何求解与路径搜索判断空间是否可用;多模态模型观察遮挡、语义与整体视觉后果;用户行为或机器人任务给出最终反馈。单一总分无法指向修复位置。对象越界、门被挡住、承托失效或任务未完成等诊断,能让系统执行局部修复,并把错误送回对应模型和数据环节。
行业正在把验证从“成功渲染”推进到“状态正确、任务可做”。OptiScene 把人工检查转成偏好数据,LayoutVLM 把可微约束接入布局优化,SimWorld Studio 让编译、物理检查和 VLM 反馈共同驱动下一轮修正。验证器由此进入训练、版本门控和回滚环节。
以生境科技团队推出的 HiSQ‑Bench 为例,其把空间质量拆为意图一致性、几何合理性、空间可用性和审美感知,并用智能体执行晨间、归家和探索等任务;研究集覆盖多类空间场景与多样化任务指令。VisAlign 则把结构化决策放入代理房间,让多模态裁判观察组合后的兼容性和视觉瑕疵。
研究稿报告,在 Gemini 2.5 Pro 代理评分中,完整方法的 Scene Compatibility 为 0.73,高于 SFT 的 0.56,Artifact 指标由 0.24 降至 0.15。目前的代理房间仍采用二维近似,评测依赖模型裁判;真实三维碰撞、长期交互和第三方复现将进一步检验这套方法的适用边界。

【HiSQ 智能体自精炼流程图,展示基准评测如何发现能力缺口,并经指标分析、规划、工具开发和技能生成进入下一轮场景生成与评测】

04
结束语
生成式 AI 已经跨过“能否造出一个世界”的门槛,但“这个世界能否经得起行动”仍是一道待解的命题。未来衡量世界模型,首帧画质和演示规模仍然重要,但更关键的指标会转向首次有效时间、局部修改后的约束通过率、长程状态一致性,以及真实任务能否完成。
感知式与符号化路线不会始终困在各自的起点。前者需要稳定对象和可操作状态,后者需要更强的视觉经验与开放泛化;它们会在 Renderer、Simulator 与 Planner 之间,以状态层为接口汇合。到了那个阶段,生成不再等于“画出一个世界”,而是提出一个可验证的世界版本。
空间智能创业公司如生境科技的研究实践,初步论证了这一技术收敛方向的可行性:其尝试将多模态空间编码、连续场、真实交互轨迹和质量验证接入同一闭环。至于这套框架能否扩展到更多空间类型、更多机器形态和更长周期任务,还需要公开的技术口径、第三方评测和持续运行来给出答案。
而将视线拉回整个行业,下一个核心命题已然清晰:AI 不仅要能造出世界,更要让世界在每一次行动之后依然成立。 雷峰网雷峰网雷峰网(公众号:雷峰网)
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网特约稿件,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网 AI 学术
See more →
AMI Labs 冯雁:AI 迈向现实世界,世界模型不可或缺 | ICML 2026
Pascale Fung at ICML 2026 emphasized the necessity of world models for AI in real-world applications, highlighting JEPA's advantages over generative models like Cosmos. JEPA's smaller parameters and faster inference lead to superior performance in tasks like robotic motion planning, outperforming in physical reasoning benchmarks.

