
为了智能体AI,高通「新造」了第六代骁龙8超级至尊版
Quick Answer
Qualcomm's new Snapdragon 8 Gen 2 for AI introduces a 5GHz CPU and 300 billion parameter MoE model, enhancing mobile AI capabilities.
Quick Take
The architecture focuses on breaking memory barriers and optimizing power efficiency, allowing for continuous AI operations across devices.
Key Points
- Snapdragon 8 Gen 2 features the first 5GHz mobile CPU and Matrix Cores in GPU.
- New architecture addresses memory wall challenges for CPU, GPU, and NPU.
- Supports running 300 billion parameter MoE models on-device, enhancing AI workflows.
- Adreno GPU performance improves by 44% with 40% better energy efficiency.
- Hexagon NPU boosts Transformer support, enhancing context handling by 80%.
📖 Reader Mode
~3 min read
“我们正在从以手机为中心的模式,转向以智能体为中心的新体验。手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。”2026骁龙峰会上,高通公司总裁兼CEO安蒙说。
过去二十年,智能手机围绕App运转。智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。
“这是一次令人兴奋的技术变革,智能体AI会创造一种全新的终端工作流程。”安蒙表示,“我们需要重新思考计算引擎的设计。CPU需要更强的性能来完成智能体编排,NPU加速器负责高效的AI推理,GPU负责高度并行的计算,连接能力也比以往任何时候都更加重要。”
高通为智能体AI首次同时推出两款2nm制程移动旗舰平台——第六代骁龙8超级至尊版和第六代骁龙8至尊版。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick解释说:“单一标准,已经无法定义旗舰。保持领导力需要不止一条前进道路。”
两款平台共享多项核心技术,第六代骁龙8超级至尊版位于产品组合顶端,拥有高通最顶级的配置,包括业界首个最高主频达到5GHz的移动CPU、GPU中首次加入的Matrix Cores(矩阵核心),以及可以运行300亿参数MoE模型的NPU。

这些升级背后,藏着一个核心问题,智能体全天运行,到底需要怎样的计算平台?高通给出的答案,是从智能体AI需求出发重新设计SoC。
高通到底如何围绕AI,“新造”第六代骁龙8超级至尊版?
智能体撞上「内存墙」,高通给CPU、GPU、NPU同时「动刀」
第六代骁龙8超级至尊版最醒目的数字是5GHz。

但Chris Patrick强调,“速度只是其中一部分,CPU还需要快速访问数据。”
这指向AI难以绕开的内存墙。“端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。”高通公司产品技术专家朱元堃对雷峰网(公众号:雷峰网)表示。
模型推理需要持续读取模型权重、上下文、KV-cache和中间结果。当数据在系统内存与片上存储之间频繁往返,数据搬运所需的时间和电量也会影响实际性能。
内存墙的挑战同时存在于CPU、GPU和NPU,第六代骁龙8超级至尊版如何打破内存墙?
最高主频达到5GHz的Oryon CPU引入全新Oryon FlexCache,让8个核心访问同一个共享L2缓存池,并根据工作负载动态分配资源。智能体处理一连串任务时,数据不必在每次任务交接时都从系统内存重新加载,从而减少任务切换和等待时间。

这也解释了5GHz对智能体的真正价值。CPU不仅要快速完成单个任务,还要缩短整条决策链中每一次调度和交接的等待时间。频率决定计算速度,缓存则决定高频率有多少时间真正用于计算。
Adreno GPU拥有第二代18MB独立高速显存HPM,用于保存渲染瓦片、帧缓冲和中间结果,减少图形管线对系统内存的反复访问,可实现功耗降低12%。

高通Hexagon NPU的共享内存增加50%,让模型状态、上下文和KV-cache更多留在片上,降低外部DDR的访问频率。

第六代骁龙8超级至尊版还采用LPDDR6内存和UFS 5.0闪存。片上空间无法容纳全部模型和长期数据,模型权重可以保存在闪存中,再根据任务加载到内存。
从片上缓存、系统内存到闪存,高通正在从系统维度解决内存墙挑战。但减少数据等待,只解决了智能体计算的一半问题。
什么是为智能体而生的移动计算平台?
智能体需要持续完成“感知—理解—规划—执行”的循环,在模型、应用服务、终端设备与云端资源之间选择路径,无法由单一计算单元完成。
全天运行的智能体,需要系统级协同。

“在智能体时代,骁龙平台的每个模块各司其职。”Chris Patrick说。需要调用云端API时,由CPU完成调度和路由。多个模型在终端同时运行时,NPU与GPU可以共同承担推理。
在第六代骁龙8超级至尊版上,Oryon CPU负责规划智能体循环,管理控制流程、任务调度和数据移动;Hexagon NPU运行主要模型,完成推理、内容生成和复杂决策;GPU中的Matrix Cores让AI直接进入图形管线;高通传感器中枢则以较低功耗持续处理语音、活动和个人情境。
值得关注的是,高通Hexagon NPU加强了对Transformer的支持。Hexagon Element Accelerator针对Transformer关键运算,与向量和标量计算单元共同处理数学计算、逻辑判断与专家路由,让全新旗舰平台支持最高32K Token上下文,在部分模型上的预填充性能提升最高80%。
传感器中枢的双Micro NPU在性能提升85%的同时,功耗降低20%,可以在不频繁唤醒主应用处理器的情况下,持续处理环境语音、用户活动和个人情境,降低智能体始终在线的功耗成本。
第六代骁龙8超级至尊版搭载的Adreno GPU性能最高提升44%,能效最高提升40%,是高通迄今幅度最大的GPU代际跃升,也是高通首次在Adreno GPU中加入Matrix Cores。

过去,图形管线调用神经网络时,数据通常需要离开GPU交给NPU处理,再把结果送回。Adreno Matrix Cores让超级分辨率、帧生成等AI任务留在图形管线中,也可以加速更通用的AI负载。
当AI工作负载不再只由NPU承担,CPU、GPU和NPU的分工也开始改变。游戏开发者可以调用GPU中的AI能力,大型、持续运行且对能效敏感的模型更适合使用NPU,CPU则承担智能体编排、任务调度以及部分AI计算。
“真正的突破,不在于某一项技术,而在于这些技术如何协同发挥作用。”Chris Patrick说。
这套为智能体AI革新的计算平台是否有效,最终仍要回到手机上的实际体验。
300亿参数MoE上手机,端侧AI从单次问答走向智能体工作流
第六代骁龙8超级至尊版能够在端侧运行300亿参数MoE(混合专家)模型,是最直观的证明。
这一模型每生成一个Token只需激活约30亿个路由参数。300亿参数决定模型能够容纳多少知识,30亿激活参数则影响一次推理实际需要多少计算,让模型能力与手机有限的内存、功耗之间出现新的平衡点。
但让300亿参数模型真正运行在手机上,仍然需要芯片、推理引擎、模型和存储厂商共同配合。
正如安蒙所说,“高通始终相信强大的合作伙伴关系,我们坚信单一公司无法独自构建这样的未来。智能体体验将催生新的合作伙伴关系,也会带来新的机遇,这需要合作伙伴的力量。”

高通与阶跃、无量火、江波龙合作,将StepEdge-Omni 30B-MoE完整部署到手机端。通过推理引擎、CPU、GPU、NPU异构调度和存算协同,模型运行内存需求较常规方案降低超过50%,预填充速度超过330 Token/s,解码速度超过28 Token/s,可以在本地完成邮件理解、行程规划、日历同步、航班酒店推荐和邮件草拟等连续任务。
其中,NPU与GPU双引擎协同的预填充吞吐性能,相比仅使用NPU的通用推理方案提升超过30%。
这组数字更关键的意义,是端侧AI开始从一次问答进入完整的智能体工作流。

传感器中枢可以在主应用处理器不必频繁唤醒的情况下持续处理环境信息。个人记录功能可以在获得用户允许后整理对话和重要信息,形成个人知识图谱。Adreno Neural Fusion让AI参与游戏的超级分辨率和帧生成。Spectra ISP则把图像和视频转化为多模态模型能够理解的上下文。其第二代AI-ISP架构将视频吞吐能力提升2倍,并首次在搭载骁龙移动平台的智能手机上支持8K 60fps视频拍摄。

这些横跨办公、游戏和影像的体验,都指向同一个方向,AI逐渐成为设备持续运行的一部分。
手机既要完成用户主动发起的工作,也要在用户没有操作时代表用户运行。这比跑出一次漂亮的AI Benchmark(基准测试)更难,因为每一项能力都要放进有限的电量和散热空间中。
“智能手机是唯一能够以如此大规模将随身、情境感知和连接这三个要素融为一体的终端。”Chris Patrick说。
所有任务都留在本地并不现实,但与个人情境、隐私和即时响应有关的部分,距离用户越近,体验就越自然。手机不是最大的计算中心,却是最靠近用户的个人AI入口。
从手机到PC,高通开始围绕「智能体AI」造芯片
智能体不会只存在于一部手机里。PC、耳戴式设备、眼镜、手表和汽车承担不同任务,也需要共享对用户的理解,让智能体在设备之间保持连续。
手机仍是这套体系的枢纽,它始终随身,汇集最多个人情境,又连接着应用、其他设备和云资源。
不同终端需要的算力规模不同,但对高通而言底层问题一致,如何用异构计算完成不同任务,又如何通过连接让智能体在终端和云端之间保持连续。
高通的计算产品组合正从手机扩展至PC、汽车等智能体终端,并通过连接云端计算资源,拥有混合AI的完整部剧。
而混合AI的关键,是让用户感知不到任务在不同计算资源之间的切换。这使高通的角色从提供移动计算平台,进一步延伸到搭建智能体AI的计算底座。
“最好的AI,不是向你索取更多,而是替你完成更多,并且它是属于你的AI。”安蒙说。
从App时代进入智能体时代,旗舰SoC的竞争标准也在改变。过去,旗舰SoC的竞争常由CPU和GPU的峰值性能主导。未来还要看一颗芯片能否在内存、功耗和散热限制之下,让智能体保持感知、持续推理并完成复杂任务。
5GHz和端侧运行30B MoE模型,是最容易被看见的结果。藏在这些数字背后的数据搬运、异构调度与系统能效,才是第六代骁龙8超级至尊版真正被重新设计的部分。
AI手机下一阶段的竞争,不只是谁能把更大的模型装进手机,还要看谁能让智能体在手机有限的内存和功耗中全天运行,并与其他终端和云端保持连续协同。第六代骁龙8超级至尊版,就是高通对下一代旗舰标准的回答。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网芯片
See more →隼瞻创始人曾轶:AI推倒芯片设计壁垒,我们要做半导体行业的「Copilot」
Zeng Yi, founder of Sunzhan, emphasizes that AI is reshaping chip architecture, enabling RISC-V's rise as companies like Qualcomm and Google adopt customizable AI processors. He believes RISC-V's flexibility and open-source nature will drive its adoption in the semiconductor industry, particularly in AI applications.

