
从百美元到数千美元,AI互联为什么越卖越贵?
Quick Answer
Astera Labs, valued at nearly $50 billion, highlights the escalating costs of AI interconnects driven by increasing GPU demands, with data transfer speeds doubling annually.
Quick Take
The shift from copper to optical interconnects is influenced by transmission rates and GPU scale, impacting overall system performance and token costs.
Key Points
- Astera Labs predicts optical interconnects will dominate as GPU counts exceed hundreds.
- Data transfer speeds have increased from 8 GT/s to 64 GT/s since Astera's founding.
- AI infrastructure investments by major cloud firms may stabilize after rapid growth.
- Each accelerator's value has surged from under $100 to thousands of dollars with scale-up.
- Chinese AI infrastructure market shows faster adoption and diverse customer needs compared to North America.
📖 Reader Mode
~3 min read2026年的CIOE中国光博会,人潮如织。
社交媒体上甚至有人开出2500元一场的讲解费,希望找到业内人士陪同参观。走进场馆后更直观的感受是,今年光博会几乎所有与AI相关的环节都在升温:从光模块、光器件,到高速互联和数据中心基础设施,AI需求正在把原本相对垂直的光通信产业链整体推向更高热度。
Astera Labs也出现在今年光博会。这家2017年成立的美国半导体公司,最早从PCIe Retimer切入高速互联,如今产品已经延伸至铜互联、光互联和机架级连接;截至九月,这间公司市值已接近500亿美元。
“算力需求越高,处理器之间的数据交换就越需要快速传输,互联这套‘神经系统’也必须跟上。”Astera Labs总裁兼COO Sanjay Gajendra对雷峰网表示。
这股热度背后,是AI基础设施规模持续扩张带来的互联压力。当GPU从几颗扩展到几十颗甚至成百上千颗,处理器之间的数据传输效率,开始直接影响整套基础设施的性能。
铜光之争,最后要算Token成本
为什么早在2017年,大语言模型尚未得到广泛应用时,Astera就开始押注互联方向?
“我们当时判断,那些为上一代处理器设计的连接架构,在单台服务器拥有10个乃至今天数十个处理单元时,将无法继续支撑系统需求。”Gajendra说。
当时常规服务器通常围绕1至2颗CPU设计,存储、网络等设备更多作为外围I/O存在;但随着CPU、GPU、SmartNIC等越来越多处理器开始同时进入服务器,系统内部需要交换的数据量迅速上升。
“就像一台机器里有了很多个‘大脑’,原本围绕少量处理器设计的互联架构,已经难以继续支撑它们之间的数据交换。”Gajendra解释。
来到2026年,这一问题随着AI的发展进一步放大。Gajendra将今天互联架构面临的挑战概括为三个变量:速率、规模和功耗。Astera Labs成立前后,PCIe单通道速率还处在8 GT/s级别,如今已经提升到64 GT/s;AI系统也从早期4至8颗GPU,向数十、上百及更大规模扩展。
“为了跟上当前AI部署的步伐,数据传输速度每年都在翻倍。”Gajendra说。规模扩张带来的同时,通信延迟必须尽可能低,同时还要维持内存一致性和处理器之间的同步;系统规模扩大后,互联本身的功耗也产生了约束。
这种扩展带来的压力,已经对铜光边界带来了改变,打破了短距离更多使用铜、长距离转向光互联的惯性思维,距离已经不再是决定使用光还是铜的主要变量。Gajendra认为,决定机架内部何时进一步从铜转向光,最核心的两个变量是传输速率和GPU规模。
对于200G/lane级别的连接,铜互联依然可以胜任;进一步走向400G/lane之后,光将更多进入机架内部,GPU数量增加带来的连接密度和散热压力,将进一步影响客户选择铜互连还是光互联。
除了以上两点,让铜光边界变得更复杂的,还有成本。所有厂商最终都要算一笔账:不同连接方式,对应的整套系统Token成本究竟是多少。

光博会现场,Astera Labs的工程师告诉雷峰网(公众号:雷峰网),下一代AI系统中,铜和光不会简单形成替代关系。大量短距离连接仍然适合使用成本更低、技术更成熟的铜;而当系统扩大到数千张GPU、跨越多个机架时,衡量连接方案的指标会进一步变成整套系统的单位Token成本。
工程师进一步提到,以英伟达NVL72的72-GPU scale-up域为参照,当计算需求继续扩大后,更大的scale-up域可能减少数据频繁经过scale-out网络。后者通常还需要经过网卡、以太网或InfiniBand交换机等多个子系统,引入额外延迟和系统复杂度。借助光互联扩大scale-up规模,因此可能进一步优化单位Token成本。
在具体技术路径上,Gajendra判断,NPO(近封装光学)将在2027年前后开始进入scale-up部署;CPO(共封装光学)目前虽然已有小规模应用,但在scale-up域的更大规模的部署可能要到2029至2030年以后。
从这个角度看,AI互联面对的问题已经不只是“数据怎么传得更快”,而是如何用不同的连接方式组织越来越多GPU,并让整套系统以更低成本输出更多Token。(关于scale-up域互联的更多信息,欢迎添加作者微信treelog10交流,互相学习)
资本开支趋稳,价值量继续上移
过去两年,AI基础设施最直接的增长逻辑,是超大规模云厂商持续提高资本开支。
但很显然,这种投入不可能永远维持相同增速。当被问及未来一两年头部云厂商放缓AI数据中心建设,是否会影响Astera Labs这样的连接厂商时,Gajendra没有否认这种可能。
他认为,AI目前仍处于基础设施集中建设阶段,仅美国超大规模云厂商已经公开承诺了超过1万亿美元的数据中心投资;但随着大规模建设逐渐完成,资本开支在未来几年终究会趋于稳定。
市场对这一增速能维持多久也越来越敏感。据公开信息,微软、Alphabet、亚马逊、Meta和Oracle五家AI超大规模厂商2026年的资本开支合计约7950亿美元,2027年将接近1.08万亿美元,市场在密切关注这轮支出是否会出现放缓迹象。

对Astera而言,答案并不只是等待云厂商继续扩建更多数据中心,而是提高自己在每颗加速器周围能够获得的价值量。Gajendra给出了一组直观的数字:早期只有Aries PCIe Retimer时,Astera每颗加速器对应的产品价值量不到100美元;后来加入交换芯片和内存产品,这一数字上升到数百美元;到了scale-up交换阶段,每颗加速器对应的价值量已经达到数千美元。
显然,scale-up是Astera正在加码的方向。Gajendra透露,公司原本预计Scorpio系列要到今年第四季度才会成为收入规模最大的产品线,但这一节点已经提前至第三季度。
除了提高单颗加速器对应的产品价值量,Gajendra还把推理市场视为另一个增长来源。
他认为,训练和推理虽然对互联都有高带宽、低延迟和低功耗的共同要求,但两类工作负载的侧重点并不完全相同。训练更依赖计算能力,推理则相对更看重内存和低延迟。
与训练主要集中在大型数据中心不同,Gajendra认为推理市场的参与者和系统形态会更加分散。“尤其是在推理市场,会有更多客户进入。这是一个非常分散的市场,会有很多参与者、很多系统。”Gajendra说。
未来的连接需求,未必只取决于少数头部云厂商继续建设多少超大规模训练集群。随着AI从训练进入大规模推理,连接需求可能进一步扩展到更多不同规模、不同部署形态的系统。
当客户的规模和部署形态进一步增加,连接厂商面对的也不再是一套相对统一的需求。不同市场、不同类型客户对标准化程度、产品迭代速度和系统定制的要求正在逐渐拉开。
这种差异,在中美两类AI基础设施市场中表现得尤其明显。
系统越定制,连接方案越分化
随着推理市场进一步分散,连接厂商面对的客户也会越来越多样。相比北美,中国AI基础设施市场已经呈现出明显不同的客户结构。
Gajendra表示,北美市场目前主要由亚马逊、微软、Google和Meta四家超大规模云厂商主导,同时还有OpenAI、Anthropic等AI实验室;而在中国,除了字节跳动、阿里等大型互联网公司之外,还有大量不同规模的创业公司参与AI基础设施建设。
“如果一定要总结一个区别,中国市场机会推进的速度非常快。”Gajendra说。相比北美,中国市场参与者更多,客户覆盖的应用场景也更加广泛,对供应商的响应和产品落地速度要求更高。
Astera工程师也向雷峰网提到,美国大型客户通常更强调标准化、供应链复用以及不同代际产品之间的兼容性;相比之下,中国客户更愿意尝试不同的技术方案,也更加看重产品能否快速落地。

虽然客户内部的系统会越来越定制,但外部连接接口仍会保持标准化。“定制化会越来越多,这一趋势还会继续,但大家仍然会尽量采用开放标准。外部连接和接口会保持标准化,而处理器内部架构则会根据不同工作负载和性能指标进行定制。”Gajendra说。
他以字节跳动和阿里为例:字节的基础设施更多服务自身业务,而阿里既需要支撑内部应用,也需要向外部客户提供云服务,因此两类公司的处理器和服务器设计不会完全相同。
AI系统内部越来越定制,系统之间的连接接口反而更需要标准化。对于连接厂商而言,需要适配的已经不是一套统一的服务器架构,而是越来越多样的处理器、工作负载和部署形态。
从铜光选择,到scale-up扩展,再到不同客户对定制化和标准化的不同要求,连接正在从一个相对独立的配套环节,变成AI基础设施设计的一部分。
当连接方式开始同时影响GPU规模、系统延迟和Token成本时,它的价值也不再只是“把数据传过去”,而是决定更多算力能否真正转化成可用的系统性能。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网芯片
See more →隼瞻创始人曾轶:AI推倒芯片设计壁垒,我们要做半导体行业的「Copilot」
Zeng Yi, founder of Sunzhan, emphasizes that AI is reshaping chip architecture, enabling RISC-V's rise as companies like Qualcomm and Google adopt customizable AI processors. He believes RISC-V's flexibility and open-source nature will drive its adoption in the semiconductor industry, particularly in AI applications.

