顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈
Quick Answer
At the 2026 RSS conference, experts debated the integration of world models and strategy models in robotics, concluding that they should remain separate for efficiency.
Quick Take
The discussions highlighted the importance of using both human video data and embodied robot data for training, with a preference for internet data to enhance generalization capabilities.
Key Points
- Experts debated the integration of world models and strategy models, favoring separation for efficiency.
- The panel included representatives from Nvidia, Google, and Georgia Tech, among others.
- Data sources discussed included human video data and embodied robot data for training.
- A consensus emerged that both data types are essential for effective model training.
- The audience favored internet data for enhancing model generalization capabilities.
📖 Reader Mode
~4 min read
作者丨张 璐
编辑丨齐铖湧
在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:
要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的“具身数据”,还是该拥抱浩瀚如海的“互联网与人类行为数据”?
2026年RSS大会最后一天的workshop圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。
来自Georgia Tech和Nvidia的徐丹飞,以组合世界模型的研究闻名;Google与NYU的Sherry Yang,专注物理代理的世界模型评估与改进;Physical Intelligence的Laura Smith,强调具身智能的实践落地;NVIDIA的Max Li,长期深耕大模型架构;OpenDriveLab的Li Chen,则在机器人数据与控制领域有丰富经验。
主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。雷峰网(公众号:雷峰网)AI科技评论小队在现场记录下这场思想碰撞,以下是完整实录:

01
第一轮辩论:
世界模型和策略模型,应该合体还是分开?
大家都知道现在搞AI都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题——世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。
▎本轮对阵的双方是:
“大一统”合体派: PI科学家Laura Smith、英伟达Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)
“各司其职”分开派: 谷歌Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)

支持“合体”的一方认为,现在AI的大趋势就是Everything in One。Laura认为,MoE模型都能把成百上千个专家塞进一个网络,为什么世界模型和策略不能合并?最终我们肯定想要一个超级模型,既能理解世界,又能直接行动。
她的观点得到了同阵营 Max Li 的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在AI“能想象到什么”和机器人“实际能做到什么”之间,其实存在着一条巨大的鸿沟。
视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。
听到这里,坐在“分开派”阵营的 陈立(Lee) 坐不住了,他直接从底层工程的“运行效率”出发,给合体派泼了一盆冷水。
陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。
要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试和特殊化处理。
陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:“目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架,训练效果反而下降。”
她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。
徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处——调试和迭代更清晰。
当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。

现场有观众立刻通过Slido提问:“如果合并了,失败了到底怪谁?”这个问题引起全场笑声,也让辩论更加接地气。最终,这一轮“分开派”在观众投票中略占优势。
第一轮辩完,现场观众的投票里,各司其职派胜过了大一统派,但嘉宾最后互相之间算是勉强达成了共识:世界模型和策略最好还是各回各家、各司其职。
但问题马上又来了,既然把世界模型单独拎出来了,那我们怎么知道这个模型到底有没有把这个世界“看懂、学对”呢?
是看它能不能像拍好莱坞大片一样,生成极其逼真的画面?还是看它能不能精准指导机器人的下一个动作?顺着这个话茬,两派圆桌嘉宾在第二轮直接陷入了更深层的技术纠结。

02
第二轮辩论:
可控性到底靠像素,还是动作?
到了第二轮,关于怎么控制世界模型的讨论,让上一轮的阵营直接打破重组,学术新星和产业专家开始各执一词。
▎本轮对阵的是:
“视觉颜值”像素派: Max Li、Laura Smith、陈立(主张视频画面最直观,是人类看懂大模型在想什么的便利接口)
“硬核实操”动作派: 徐丹飞、Sherry Yang(中途根据实验修正立场)(主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值)
第二个问题更加技术化:世界模型的可控性,到底应该主要依赖生成真实像素(视频),还是更应该关注动作层面的 grounding?

支持像素派的英伟达科学家Max Li 一上来就金句频出。他认为视频是目前最自然、最有效的监督信号,而且他生动地打了个比方:生成高保真的视频,能让我们看清这个大模型到底在想什么——这就好比父母总想搞懂自己处于青春期叛逆孩子的内心想法一样。
英伟达的Max 坚信,人类需要这种视觉上的高保真度,这能带来极佳的可解释性,是人类调试黑盒子系统最方便的接口。
同阵营来自PI的Laura Smith 顺着 Max 的话茬表达了支持。她认为,把未来的画面用视频直观地生动展示出来,最大的好处就是当机器人干砸了的时候,人类能一眼看过去进行“责任划分”(blame assignment),瞬间揪出到底是哪个环节在推卸责任。
但支持动作 grounding 的反方很快泼了冷水。他们承认视频作为人类接口很有用,但指出过度追求像素级真实性有时反而是一种干扰和算力浪费。
机器人最终要执行的是可靠的物理动作,而不是去拍一部奥斯卡电影。把算力都花在生成漂亮画面上,可能会牺牲动作的物理一致性和精度,尤其在接触丰富(contact-rich)的任务上。
面对两派的拉扯,Sherry Yang 在这一轮分享了自己的“倒戈”心路历程。她坦言,自己以前也是像素派的坚定支持者,但最近的大模型实验让她开始动摇。

因为她发现即使把模型规模做到极大,单纯靠堆像素和扩大规模,在遇到需要精细接触的任务时画面依然不够稳健。所以她现在更倾向于在视频生成中引入更多语义信息和物理先验,而不是单纯看画面好不好看。
徐丹飞 也表达了类似的观点。他一针见血地指出,视频其实只是现实世界的一个部分切片。人类在黑暗中摸索或者抓取物品时,根本不需要在脑子里想象出一幅画面,而是更依赖触觉和力反馈。

因此,判断一个世界模型好不好,核心不能看它画画美不美,而是要看它能不能产出真正的动作价值。
这一轮讨论虽然没有明确赢家,但大家逐渐形成共识:视频和动作不是对立关系,而是需要更好结合。单纯靠哪一边都走不远。
讨论到这里,台上的气氛已经有点胶着了。大家发现,无论是追求炫酷的视频画面,还是死磕精细的手感反馈,说到底都是“下游”的应用和表现。
科学家们心里都清楚,再聪明的模型、再完美的算法,没有数据喂养也只是个空壳子。
那么,去哪里给机器人找最顶级、最管饱的“自学教材”?是去白嫖铺天盖地的互联网人类视频,还是必须收集机器人自己的亲身体验?这也就是本场圆桌的最后一问。

03
第三轮辩论:数据该从哪里来?
最后一轮辩论直指根本问题:训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据?
▎本轮对阵的双方是:
“借鉴全网”互联网视频派: 徐丹飞、Sherry Yang、Max Li(主张人类视频规模巨大,能极大提升机器人的泛化能力)
崇尚“亲身体验”具身控制派: 陈立、Laura Smith(主张互联网视频难救具体应用,高精度控制必须靠机器人自己的真实数据)

支持具身数据优先的专家认为,机器人数据包含真实的物理参数、动作反馈和接触力,是最“干净”、最直接的信号。
没有这些,模型很难准确学到接触动力学等关键知识。具身数据才是地基,人类视频只是锦上添花。
甚至连作为“细节控”的 陈立(Lee) 这一轮也站出来公开表达了对互联网数据的怀疑。
他直言不讳地指出,现在业界一谈到大模型就盲目崇拜互联网上的海量数据,但在他看来,那些铺天盖地的互联网视频对机器人具体的、高精度的具身应用来说,并没有那么直接的帮助。

陈立认为,互联网视频顶多在宏观上帮机器人规划一个“子目标”(sub-goals),但要解决底层的抓取和手脚控制,还是得死磕机器人自己的具身数据。
但支持人类/互联网数据的一方则从规模和泛化角度反驳。徐丹飞说:“纯靠机器人数据,规模太有限,很难覆盖现实中的长尾场景。人类视频数据量巨大,包含各种各样的交互方式和技能组合,能极大提升模型的泛化能力。”
Sherry补充道:“人类本身就是地球上最强大的物理代理。我们可以把人类视频看作另一种‘机器人数据’,通过端到端控制或者姿态表示来对齐二者,这条路非常值得探索。”
尽管双方最终达成较高共识:两者都不可或缺。但现场观众依然对这轮辩论给出了“现场法官”的评判:“借鉴全网”互联网视频派,以61%的投票率,胜过了39%的崇尚“亲身体验”具身控制派。

当前阶段,如何高效利用人类视频数据、并通过世界模型把它和机器人数据桥接起来,可能是最重要的突破方向。
未来很可能形成一个混合数据飞轮:互联网数据提供广度,机器人数据提供精度,世界模型负责融合和迭代。

04
圆桌总结:技术仍在快速迭代中
三轮辩论结束后,既有输赢,又有共识。
先总结一下投票结果,从现场百位本届RSS参与学者的现场投票来看,第一轮世界模型和策略模型之争,现场投票中,各司其职派的说法更受现场台下学者们的拥护。
第二轮,世界模型的可控性,到底靠像素,还是动作问题上,现场投票更倾向于动作派,也就是主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值。
第三轮关于训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据的辩论中,现场投票更多的,是前者。
进行到这里,现场发生一个小插曲,来自Physical Intelligence的Laura Smith,在三次辩论的投票结果中,都输了,这也让她有一些困惑,但搁置争议,现场还是有很多共识。
几位嘉宾一致认为,世界模型是机器人走向通用的关键,但目前仍面临融合方式、可控性、数据利用等一系列挑战。
真正的突破,可能来自更聪明的组合机制、更平衡的数据策略,以及理论与工程的紧密结合。
徐丹飞在最后说:“我们现在看到的只是冰山一角。未来几年,这个领域会非常热闹。”
现场观众报以热烈掌声。这场圆桌没有标准答案,却留下了大量值得深入思考的问题——这或许正是学术会议最迷人的地方。


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
— Originally published at m.leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from WebSearch (Tavily)
See more →全球AI芯片峰会,9月上海见!
The 2026 Global AI Chip Summit will take place in Shanghai on September 22-23, focusing on the evolving AI chip landscape, including the shift from training to inference, the rise of diverse chip technologies, and the restructuring of industry competition. Notable speakers include experts from leading universities and companies, discussing advancements in AI chip architecture and applications.