对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人? | 雷峰网
Quick Answer
Starry Dynamics' PULSE architecture emphasizes understanding user intent, beliefs, and preferences to enhance home robot interactions.
Quick Take
CTO Li Da highlights the need for robots to interpret human states alongside physical environments for effective decision-making in domestic settings.
Key Points
- PULSE architecture features dual tracks for environmental and user state perception.
- Understanding user beliefs allows robots to correct misconceptions proactively.
- The system employs a three-layer memory architecture for personalized responses.
- Real-time feedback from users is crucial for continuous learning and adaptation.
- Robots must balance task execution with respect for user preferences and boundaries.
📖 Reader Mode
~5 min read
编辑丨李希
今年关于具身智能的讨论里,有一个问题始终绕不开:机器人进了家门,到底靠什么让人愿意留着它?
工厂的逻辑很简单:干得准、跑得稳,得能运行,还能创收。但家庭场景不一样:一个动作失误、一次对意图的理解偏差,用户的心理容错率几乎为零——错一次,机器人就可能就被退货,或者放在角落吃灰。
这个现实,让行业分出了两条路。一条路上的公司,继续死磕物理智能,让机器人能够无限接近理解物理世界;另一条开始往回退一步,先想清楚一件事——机器人要怎么理解人,才能在人身边待得住。
星炽动力显然是后者。为了了解他们的想法,AI 科技评论和公司的 CTO 李达聊了聊。
李达的履历并不神秘。中科院自动化所博士,师从谭铁牛院士,长期做视觉导航和连续学习,成果多次在领域顶级期刊发表,上过 IEEE TIP。进入星炽动力之前,李博士曾在自动化所工作学习十余年,学术底子算得上扎实,但他现在做的,是把这些积累倒进一个家庭场景里,重新审视一个被忽视很久的问题:机器人如果不懂人,凭什么跟人一起生活?
“今天的具身大脑讲的更多的是‘环境动力学’——但我们不光要考虑物理环境的变化,也要把用户的状态推演出来。”讨论中,李达常常强调这一点。
为此,星炽动力推出的 PULSE 架构,是把具身大脑拆成了“双轨”:一条轨跑物理环境的感知和推演,另一条轨跑用户状态的感知和推演。两条轨不是孤立运行,而是在特征层面做交叉验证。

物理信息告诉机器人“环境怎么了”,用户状态信息告诉机器人“人怎么了”,两者合并,才能输出一个更靠谱的决策。
家庭场景里,人不是环境里的一件物体,而是交互的中心。如果机器人的认知模型里只有桌子、杯子、沙发,却没有坐沙发的人的状态,那它永远只能做一个被动的命令行工具——人发指令,机器执行,像在用 CLI(命令行)操作一台机器。
但在家里,如果老人、小孩没法很明确地提出指令,那么机器人是否就没法在家庭场景好好工作?
怎么让机器人理解人?PULSE 的答案落在三个关键词上:意图、信念、偏好。
意图是用户说了什么、做了什么,机器人能不能读懂。
信念更有意思——李达举了一个例子:男主人认为牛奶还在微波炉里,但女主人已经拿出来了。男主人持有的是一个“错误信念”。如果机器人只盯着物理世界,它看到的是微波炉里没有牛奶,它不会理解男主人接下来要去做的动作是基于一个错误的前提。但如果机器人有能力表征人的信念状态,它就能主动提醒:“牛奶已经被拿出来了。”这种纠偏能力,才是家庭场景里真正有用的智能。
偏好则更长期,涉及用户的习惯、边界、隐私,需要靠持续的交互来积累。
这三者构成的理解模型,不是挂在系统外的一个附加模块,而是被李达团队直接嵌入世界模型的条件化输入里。用户状态被表征为隐空间的特征向量,以类似 token 的形式参与跨注意力计算,和环境特征做对齐。
这个技术选择透露了一个清晰的价值判断:理解人和理解物理世界,在认知架构上应该是平权的,甚至人的优先级更高。
为什么?因为落地节奏不同。
物理世界太复杂,泛化太难。一个在80公分高的桌子上训练好的抓取模型,换到75公分的桌子上就可能失效。要在所有家庭、所有物品、所有光照条件下做到物理智能的通用,李达认为短期内难以实现。
但人的理解模型不一样。虽然人也复杂,但人的行为在单个家庭里是有规律的。一个人每天喝水的杯子、回家的时间、说话的语气,都有迹可循。如果机器人能先在一个具体的家庭里把“这个人”理解清楚,它的可用性就会迅速提升。
可用性上去了,用户的使用频率也就能够提升,拿着这些基于用户实际反馈的数据,星炽的机器人也可以借由这些和自家本体强耦合的真机数据,去进一步提升具身大脑的能力。
不追求一个模型解决全宇宙的问题,先让机器人在一户人家里不出错、不惹人烦、偶尔让人觉得贴心。这个目标比通用物理智能近得多。
PULSE 端云结合的落地策略也印证了这一点,云端负责全局迭代,端侧跑测试时适应——机器人在使用中遇到新分布的数据,直接在本地做调优,不用等云端回传。这种设计天然适配家庭场景:每个家庭都不一样,每个家庭的机器人都应该长出自己的理解模型。
说到底,物理智能解决的是“能不能做到”,而人的理解模型解决的是“该不该做、什么时候做、怎么做才合适”。在家庭这个容错率极低的环境里,后者的优先级恐怕还要再往前排一排。
这可能也是李达想表达的最核心的一句话:具身智能在家庭落地的关键,不是让机器人更像一个万能工具,而是让它更像一个懂得察言观色的伙伴。

以下是 AI 科技评论和李达的对谈实录,AI 科技评论做了不变原意的编撰。
▎AI 科技评论:能为我们讲讲 PULSE 架构的特点吗?
李达:PULSE这个名字我们其实是有些寓意的。一方面,我们希望它是一个永续的、能够和人的价值对齐,并能够持续演进的系统。另一方面,"PULSE"这个词本身也有脉搏的意思。我们觉得机器人有了PULSE之后,就有了生命,也就能够真正地伴随用户一起成长。
如果用几个词介绍 PULSE 的核心闭环,就是:看懂环境,理解用户,双轨推演,接受反馈,持续进化。
当前行业内具身世界模型更关注环境动力学,也就是关注周围物理环境的演变。但是星炽动力主打 C 端家庭场景,就离不开和人的交互。所以我们希望能够让机器人具备“社会属性”。
因此,我们在构建PULSE世界动作模型时,跨出了行业的第一步:不仅推演物理环境的变化,更要把“用户状态的变化”也推演出来。机器人在采取行动前,不仅要算清“杯子会不会掉”,还要推演出“这个举动会不会打扰到主人”。
我们最终的目的,是赋予机器人真正的“心智”,但什么是心智呢?人的心智,是他在一个团体当中,我应该知道怎么去做才能更好的融入团体。所以我们也希望机器人不仅可以执行命令,还要懂得主动预判你的需求,贴合你的偏好,并且极其克制地尊重你的家庭边界等等。
▎AI 科技评论:这可能和做情感还不太一样。
李达:纯粹的“情感交互”往往停留在语言层面,通过聊天提供情绪价值和陪伴;而我们在星炽动力要做的是通过“心智理论(ToM)”,将家庭场景中高度复杂的“个性化”,转化为一个可计算、可训练、可验证的数学模型。
这种基于心智的个性化模型,核心锚定在三个维度:信念(Belief)、意图(Intention)和偏好(Preference)。
偏好依赖于机器人的长期情境记忆,而“信念”则是机器人理解人类认知偏差的关键。我举个非常经典的家庭场景:男主人把牛奶放进微波炉加热后离开,女主人随后将其取出。此时,不知情的男主人脑海中就产生了一个“牛奶还在微波炉里”的虚假信念(False Belief)。当他再次走向微波炉时,具备心智模型的机器人就能精准识别出这种“信息差”,主动出声提示甚至直接递上牛奶,完成认知纠偏。
而在“意图”层面,我们不再满足于机器人只能听懂直接指令,而是要求它具备两项核心能力:一是“主动预判”,即通过用户的行为动作提前推断其潜在需求,做到“眼里有活”;二是结合“偏好对齐”,评估机器人的执行动作和分寸,是否真正符合该用户的心理期望。
为了支撑这套复杂的认知中枢,在前期构建用户状态表征时,我们引入了基于自解释增强的多模态大模型来进行底层建模。
▎AI 科技评论:要做个性化,记忆肯定是很重要的。
李达:是的,记忆是个性化的基石。为了兼顾机器人响应的低延迟与理解的深度,我们在PULSE的记忆模块上,设计了一套自适应任务复杂度的“三层记忆架构”:结构化规则层、RAG(检索增强生成)语义层,以及底层的参数化模型层。
比如最直观的结构化规则层,负责处理高确定性的物理时空检索。当用户问“我的剪刀呢?”,这是一个精准匹配的寻物指令,系统无需去激活庞大的底层模型做深层表征挖掘,直接在规则记忆库中调用即可。
但如果用户的指令是模糊或高度意图化的,比如只说了一句“帮我倒杯水”,这就触及了“RAG语义层”。光靠规则是无法匹配这句指令的,系统需要通过 RAG 从过往的历史交互切片(Episodic Memory)中,检索出与“倒水”相关的语境与习惯(比如用什么杯子、常喝的温度),以此对齐当前意图。
当面对更为复杂的长尾场景、深层的情感共鸣,甚至遇到毫无历史规则可循的突发状况(Zero-shot)时,就需要“底层模型层”的重度介入。通过大模型的认知推理与泛化能力,对长期沉淀的用户行为进行深度的因果归因与价值挖掘。这种层层递进的设计,确保了我们的机器人既能做到“极速响应”,又能做到“深思熟虑”。
▎AI 科技评论:不仅有记忆,还得有更好的上下文语境理解。
李达:对的,在家庭真实交互中,一句看似简单的“给我倒杯水”,本质上是一个“高维且高度模糊”的指令。它隐含了海量的决策分支:水温多少?什么杯子?纯净水还是电解质水?这些信息无法单纯靠死记硬背来提取,机器人必须具备基于时空上下文的意图消歧能力。
这种能力的底层支撑,是我们PULSE架构中的“室内态势协同感知”模块。比如,当用户大汗淋漓地推开家门说“倒杯水”,机器人不应该只是机械地去接一杯温水,它需要瞬间完成两个维度的态势融合:
第一是物理环境感知,通过物联网或环境传感器,获取当前的极热天气与室内高温状态;第二是用户状态感知,通过第一视角的视觉模型捕捉“满身是汗”的特征,甚至结合毫米波雷达提取呼吸心率等生理信号。
获取这些多源异构数据在硬件层面并不难,真正的技术壁垒在于后端的多模态融合与跨域决策。基于这套感知,机器人不仅会决定递上一杯补充电解质的运动饮料,还会联动全屋智能生态——比如我们目前已经与海尔智家、涂鸦智能深度打通,机器人可以自主指令空调下调温度。
因此,我们把室内态势感知明确划分为物理环境和用户状态两个维度。这两部分的感知结果,将共同作为输入,接入后续的世界动作模型。而这正是我们提出的"双轨世界模型"的核心:既要对物理世界的演变进行推演,也要对用户状态的变化进行推演。只有将这两者并行处理,机器人才能在家庭场景中真正理解人的需求。
▎AI 科技评论:另一方面其实对于具身来讲,只有正确数据是不是足够了?
李达:远远不够。在具身智能的真实落地中,“正确的常识”只能保证机器人能走通基本流程,而真正的护城河,恰恰是那些“错误数据”、“纠偏数据”以及“长尾的分布外数据(OOD)”。机器人在用户即时纠错中产生的反馈数据,才是我们做后训练(Post-training)最珍贵的燃料。
在PULSE架构的数据回流设计中,我们将这些反馈分成了两条线处理:一条是云端的全局迭代,用于基础大模型能力的长期对齐与泛化;但更关键的是另一条线——端侧的测试时适应(TTA, Test-Time Adaptation)。机器人必须具备实时的不确定性估计(Uncertainty Estimation)与OOD检测能力,一旦识别出歧义数据,就能快速让模型适应新的数据分布。这对机器人的纠偏速度要求很高,因为家庭场景里用户的心理容错率极低——错一次,可能就被退货或闲置。
所以在策略上,我们就需要非常谨慎,不能因为历史数据里用户曾经这么做过,就替用户直接把任务完成了。人的状态有起伏,情绪可能多变。当机器人分析出当前执行某项任务的不确定性较高时,应该主动询问用户:"我帮您把这件事做了,行不行?"如果用户同意,再执行;如果用户表现出不耐烦,就静默处理。
最理想的闭环是,机器人在完成每一个决策或动作后,能够实时捕获用户的多模态显隐式反馈。无论是愤怒的微表情、不耐烦的语气,还是竖起大拇指夸一句“你真棒”,系统都会将这些自然流露的信号回传,转化为偏好对齐模型中的正负奖励。这才是具身大脑“越用越聪明、越用越懂分寸”的本质路径。
▎AI 科技评论:后训练对你们来说是一个很重要的策略。
李达:我觉得后训练肯定很重要,但这个要分时期来看。
从认知仿生学的角度来看,人类成长是一个增量学习的过程,我们在掌握一项新技能时,是基于已有的常识基座进行局部的突触链接调整,而不是把从小到大的所有记忆翻出来“全量重训”一遍。具身大模型的后训练,本质上就是模拟这种人类的“终身学习”机制——在新家庭、新场景中,以极低的算力成本对齐新的偏好。
但我们也非常客观看待现阶段的技术局限。当后训练走向极致,也就是真正意义上的“连续学习(Continual Learning)”时,不可避免会面临灾难性遗忘问题。
这是一个非常现实的风险:如果模型一直接收新知识、不断进行微调,那些此前好不容易建立起来的基础通用技能,会不会因为网络权重的覆写而丢失?这就像俗话说的“狗熊掰棒子”,学了新的家庭习惯,却忘了最基础的物理常识。这种风险不仅存在,而且在现有的大模型架构中概率极高。因此,如何在“敏捷吸收新知”与“稳固历史常识”之间建立有效的参数隔离与记忆重塑机制,也是我们当前在工程落地上投入极大精力去攻克的难点问题。
▎AI 科技评论:今天星炽动力怎么看具身大脑的泛化?我们距离实现动作的即兴和举一反三还有多远?
李达:当前行业距离真正泛化还有相当长的一段路要走。
现在很多VLA模型,一旦物理参数变了,比如实验室精调时桌子高度是80公分,到真实家庭变成了75公分,它大概率就不知道该怎么抓了,这说明现阶段的泛化是非常脆弱的。如果大家只是在实验室里闭门造车,死磕算法架构,这永远是个无解的死循环,因为我们根本穷举不完真实家庭里千奇百怪的参数。
所以,星炽动力破局的思路,是紧紧贴合我们“本体+大脑+数据”三位一体的战略飞轮。我们不寄希望于某种神奇的算法能立刻实现通用泛化,我们走的是用规模换数据、用数据反哺模型泛化的务实路径。所以星炽动力的模型,一定能率先在星炽自己的硬件本体上实现最稳健的泛化。
至于未来动作的即兴编排,那是在我们的原子库泛化能力足够强之后,依靠上层大模型规划和底层具身OS调度来自然实现的水到渠成。
▎AI 科技评论:隐私问题我们会怎么考量?
李达:隐私绝对是C端家庭机器人的生死线。在星炽动力,我们对隐私的考量不仅停留在“获取用户知情同意(Consent)”这种合规底线上,更是将隐私保护机制直接原生地设计在了PULSE的技术架构里,也就是所谓的“Privacy by Design(隐私即设计)”。
具体来说,我们通过“端侧计算”和“模态解耦”来彻底切断隐私泄露的源头。
首先,在核心的行为理解上,我们不需要把包含用户真实面貌、穿着的RGB高清画面传回云端。在端侧,我们就直接将视觉流转化为了低维的骨架点(Skeleton/Pose)信息。脱敏后的骨架序列,在行为识别算法上的性能反而更好!因为衣着纹理、背景光影在很多时候是冗余的噪声,剥离这些反而让模型更专注、更鲁棒。
其次,对于人脸微表情、生理状态这些极度敏感但算力要求不高的感知任务,我们全部在前端直接闭环处理。系统最终传给云端大脑的,只是几个类似于“高兴”、“疲惫”的结构化语义标签,没有任何原始图像。
环境数据也是同理。我们不需要上传用户家里的照片来做预演,我们提取的是场景的结构化语义描述(Semantic Scene Graph)。云端拿到的只是一组描述物体空间关系的文本和拓扑图。
▎AI 科技评论:谢谢李博的分享,我们再问最后一个问题:星炽动力的 Mission 是什么?
李达:让机器人真正走进千家万户。我们聚焦家庭场景,希望打造一款在长期陪伴中不断学习、越来越懂你的家庭伙伴机器人,让机器人更自然地融入每个人的日常生活。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from WebSearch (Tavily)
See more →全球AI芯片峰会,9月上海见!
The 2026 Global AI Chip Summit will take place in Shanghai on September 22-23, focusing on the evolving AI chip landscape, including the shift from training to inference, the rise of diverse chip technologies, and the restructuring of industry competition. Notable speakers include experts from leading universities and companies, discussing advancements in AI chip architecture and applications.