GMIF 2026:日均140万亿Token调用,正在改变SSD的能力与分工
Quick Answer
At GMIF 2026, the demand for storage is surging, with daily Token calls in China exceeding 140 trillion, prompting a shift in SSD capabilities and roles.
Quick Take
Companies like Samsung and Solidigm are adapting SSDs to meet diverse performance needs driven by AI workloads, while NAND technology is evolving towards higher bandwidth and computational capabilities.
Key Points
- Daily Token calls in China surpassed 140 trillion, highlighting unprecedented AI demand.
- Samsung's Z-NAND and Solidigm's SSDs are evolving to meet diverse AI workload requirements.
- Storage hierarchy is shifting from a fixed model to dynamic data management strategies.
- NAND technology is being enhanced for higher bandwidth and computational capabilities.
- AI workloads are prompting SSDs to adapt to varying performance needs across tasks.
📖 Reader Mode
~3 min read作者 | 陈悦琳
编辑 | 包永刚
HBM热潮之外,其他存储形式也站在风口。
这是今年第五届GMIF2026全球存储器行业创新峰会释放的第一个明显信号。以全球云数据中心资本支出为例,摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年存储占比接近五成,2027年预计进一步升至53%。
热钱涌向存储,背后是前所未有的推理需求增加。截至今年3月,中国日均Token调用量已突破140万亿。对此,三星电子副总裁、Memory事业部首席技术官Kevin Yoon做了一个简单换算:中国每天消耗的Token,是中国国家图书馆全部藏书对应Token量的20倍以上,也接近人类历史上所有出版图书总量的6倍。
面对140万亿量级的推理负载,存储要应对的不只是数据量的增长,还有不同数据在访问频率和生命周期上的巨大差异。这意味着不同存储介质需要为此补齐各自在容量、带宽、时延和耐久性上的短板。
除此之外,Solidigm亚太区销售副总裁倪锦峰还在现场提到,以前存储成本较低时,行业倾向于尽量简化存储层级;随着AI数据需求快速增长和成本压力加剧,原有的“存储金字塔”也在被进一步细分。
规模化推理下,三重压力「夹击」存储
当AI的发展阶段从训练端的模型竞赛进一步走向推理侧的规模化应用后,存储面对的压力也更为具体。倪锦峰将其概括为三个维度。
最直观的是数据丰富度。星河智联现场展示的车载Agent,可以用来说明AI系统如何同时处理和保存多模态数据:除了理解语音、视觉、车辆信号等不同形式的信息之外,Agent还要结合对话历史、长期记忆、用户画像以及实时变化的车身状态完成判断。
这意味着数据丰富度不只体现为数据形式和数量的增加。不同数据的来源、形态和更新频率各不相同,直接导向第二层压力——推理复杂度。
Arm全球存储业务负责人John Xavier Lionel对推理数据的拆解恰好解释这一维度:模型变大,会带来更多权重和运行时状态;上下文越长,需要为后续Token生成保留的KV Cache也在增加;同时服务的用户越多,系统还要为每个请求分别保留KV Cache;进入逐Token生成的Decode阶段,模型权重和KV Cache还会被反复访问。
而当推理模式从一次性问答转向持续运行的Agent时,单个任务持续时间被拉长,随着任务规模扩大,需要长期维护的上下文和运行状态也不断累积,这也引出了倪锦峰所说的第三个维度“运营持久性”。
Dify联合创始人陈璐莎判断,未来企业运行的Agent,数量可能将从个位数上升至数百个,并且能够24小时待命、执行长程任务和承担高并发请求。
这种持续运行,也对应不同的企业AI服务模式。例如并行科技提供的MaaS(Model as a Service,模型即服务)模式允许企业通过API持续调用不同模型并按Token付费。这意味着服务商需要持续保障模型调用的首Token时延、成功率和吞吐量,并监控调用费用;
针对企业本地Token工厂的建设规划,相比追求峰值性能,联想更关注算力资源的实际利用率、服务运行的稳定性,以及最终能以多低的成本持续产出Token。
当SSD、HDD和NAND开始「越界」
当数据、推理和运营三种因素的变化进一步叠加,存储容量扩张、带宽提升、时延降低、耐久性保障等多重挑战随之袭来,不同存储介质自我能力的提升变得更加紧迫。其中,变化最明显的当数过去更多负责大容量和持久化存储的SSD,目前多家企业已经从多个维度展开升级。
不同任务正向同一款SSD提出不同的性能要求。以Agent的工作环节为例,规划阶段强调低时延、检索阶段要求高吞吐,执行阶段则更指向高带宽。对此,慧荣科技通过主机软件和存储软件栈识别任务类型,再由SSD控制器按QoS(Quality of Service,服务质量)等级调整资源配置,使同一块SSD能够响应不同AI负载。
SSD不只是在内部做差异化分配。结合存储与计算单元之间的距离,闪迪资深产品市场总监张丹将SSD拆成三类:直接连接GPU的SSD主要承接热KV等高频访问数据,为计算持续“备料”;通过网络连接GPU的SSD仍然服务计算,但部署规模可以更大;位于计算集群之外的存储型SSD则更强调容量,主要承载不需要被频繁访问的数据。
SSD向上承接更多靠近计算的数据之外,也在向存储金字塔的下层延伸。据倪锦峰观察,为了减少机房空间占用和功耗开销,北美大型互联网公司已经开始用大容量QLC SSD替代部分HDD。
当然,这并不意味着HDD的影响力式微。定位于传统HDD与企业级SSD之间,大数极限设计的PMD试图在传统机械硬盘基础上通过多路并行、扩大I/O请求队列,并结合请求聚合、预取和缓存等方式提高存储带宽和随机访问能力。
工作负载的变化也影响了SSD的测试环节。传统SSD测试常以固定4K、128K数据块进行读写,而AI负载会出现突发、高并发等更加复杂的I/O行为。欧康诺因此在AI SSD测试中加入深度学习I/O负载,以及KV Cache、断点恢复等场景。
更值得注意的是,构成SSD底层介质的NAND,本身也在沿着不同方向突破原有的能力边界。
一种思路是直接提高NAND器件本身的性能。在意识到端侧推理向DRAM施加的成本压力后,三星设计的Z-NAND,其核心Die基于SLC(Single-Level Cell,单层式存储),并集成TSV(Through-Silicon Via,硅通孔)等技术提高读取性能。在Kevin展示的架构中,操作系统和KV Cache仍留在DRAM,大容量、读取密集的模型权重则被放入Z-NAND。
另一种思路则将NAND升级成为HBF(高带宽闪存)。据北京大学集成电路学院院长蔡一茂介绍,目前主要有两条技术路径:一条从NAND阵列本身入手,通过缩小阵列尺寸降低读取时延;另一条则借鉴HBM提高并行度的思路,通过增加接口数量来提升带宽。他同时指出,尽管两种方案都在试图补足传统NAND读取速度和带宽的短板,但仍需要解决如缩小阵列会牺牲部分存储密度、NAND的读取时延仍然偏高、有限的写入寿命难以承受KV Cache等数据的频繁更新等问题。
更加激进的NAND变化体现在从存储继续向计算延伸。蔡一茂提到,当前北大和燕芯微等合作伙伴正在探索利用NAND阵列直接完成部分存内计算,减少数据在存储和计算单元之间的往返。
数据分层管理从「兜底」走向主动调度
传统存储层级建立在速度、容量与成本的权衡之上:越靠近计算单元,速度越快、容量越小、单位成本越高;越向下则相反。这套分工能够长期保持稳定,也与不同数据相对固定的访问需求有关。
如今,软硬件都在发生变化。一边是存储载体自身的能力边界不断外扩:从存储“金字塔”层级出发,SSD同时向计算侧存储和大容量存储侧延伸,更靠近塔底部的HDD试图向更高性能靠拢;聚焦具体存储介质,NAND进一步向高带宽乃至计算能力拓展。
另一边,AI带来更多类型的数据,同一份数据的访问频率和生命周期也会随着计算过程不断变化。原本相对稳定的数据与介质对应关系由此开始松动。
在多位与会嘉宾看来,数据跨层移动本身并不是AI时代的新现象,真正的变化在于,数据管理正从“HBM不够给DRAM、DRAM不够给SSD”的兜底式分层,转化为系统设计之初的主动分层和运行过程中的动态调度。
芯展速副总裁李蓁进一步用三个关键词拆解了当前AI数据供给体系:存储决定什么数据由什么介质承载,连接负责数据稳定、高效地流动,解决方案则通过软件完成调度和应用适配。
而联芸与寅谱联合推出的AI SSD方案则将这种分工落到了推理运行过程中。针对MoE模型参数,当前需要调用的专家权重留在CPU内存和GPU显存中,暂时不会被调用的权重则放入SSD。考虑到SSD访问速度更慢,系统还会预测下一阶段可能调用的专家,提前将相应模型和参数预取回来。针对KV Cache,高频访问的留在内存,低频部分则下沉到SSD。
把范围从单个计算节点放大到整个算力集群,杰创智能搭建的常青云平台还进一步大同“数据——存储——计算”的链路,提前把任务所需的数据准备到相应节点,并结合任务类型、GPU代际和网络带宽等信息,将数据与合适的算力资源匹配起来。
这也呼应了佰维存储董事长孙成思在现场的判断——“数据供给的效率决定算力的产出”。当AI推理走向规模化、高并发和持续运行,存储最终要回答的,已经不只是数据放在哪里,还有如何让数据及时抵达算力。
雷峰网(公众号:雷峰网)雷峰网
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网芯片
See more →隼瞻创始人曾轶:AI推倒芯片设计壁垒,我们要做半导体行业的「Copilot」
Zeng Yi, founder of Sunzhan, emphasizes that AI is reshaping chip architecture, enabling RISC-V's rise as companies like Qualcomm and Google adopt customizable AI processors. He believes RISC-V's flexibility and open-source nature will drive its adoption in the semiconductor industry, particularly in AI applications.

