260 lane PCIe 6.0 Switch:AI数据中心Scale-up互联的破局者 📅 发布时间:2026/8/27 2:53:21 👁 浏览次数: 前阵子在整理AI数据中心的互连方案时Marvell发布260 lane PCIe 6.0 Switch的消息让我把刚排好的机柜方案又推翻了一次。这不是普通的换代升级——在PCIe Gen5时代主流交换芯片的lane数基本停留在48到100之间这一下直接跳到260 lane并且把速率拉满到PCIe 6.0的64 GT/s。换算过来单颗芯片就能把机柜内的Scale-up互联带宽推到2 TB/s以上的单向吞吐这放在过去是整个机房级网络才有的量级。这篇文章想把这个新闻背后的逻辑讲透AI数据中心为什么突然需要这么夸张的交换芯片260 lane到底能干什么以及它对自建AI集群、GPU服务器选型有什么实际影响。如果你是做集群规划、AI基础设施选型或者单纯想搞清楚PCIe 6.0 Switch在AI算力里扮演什么角色这篇应该能给你一个比较完整的坐标系。1. Scale-up和Scale-out之争AI训练集群的瓶颈到底在哪里1.1 一张训练图里的两种通信做大模型训练的人都知道算力卡再多卡与卡之间的通信跟不上利用率照样上不去。这里涉及两种完全不同的通信模式一种是Scale-out也就是节点之间的横向扩展。每个节点里的GPU把梯度通过网卡发出去经过InfiniBand或高速以太网交换机汇到其他节点的GPU上。这类通信的特点是带宽受限于网卡数量时延跨过了交换机要依靠NCCL这样的集合通信库去优化多机all-reduce的拓扑。另一种是Scale-up也就是节点内部甚至机柜内部的纵向扩展。多个GPU之间需要进行张量并行TP、专家并行EP这类对时延和带宽极其敏感的通信。张量并行是最典型的例子——每一层Transformer的前向和反向都需要跨卡同步通信频率极高、消息量巨大如果这条路径要走网络交换机训练效率会非常难看。所以业界一直有个共识**Scale-up互联的带宽和时延基本决定了单次训练迭代的下限。**这也是为什么GPU服务器内部一定会做高速互联而不是简单地靠CPU内存转发。1.2 NVIDIA已经把答案做出来了但那是封闭的NVIDIA在Scale-up这件事上走得最激进。NVLink从最初的板载GPU互联发展到NVSwitch机柜级交换再到GB200 NVL72把整个机柜做成一个巨大的GPU域72颗GPU共享一套高速互联通信带宽能做到单卡1.8 TB/s级别的聚合速率。这套方案在性能上确实无人能敌但它是一个封闭生态。NVLink和NVSwitch都是私有协议只有NVIDIA自己的GPU能用。如果你用的是AMD的加速卡、自研AI芯片或者想在同一套系统里混搭异构加速器NVLink这条路根本走不通。1.3 开放体系里PCIe Switch为什么一直当配角在开放生态里把多个GPU连在一起最成熟的方式就是PCIe Switch。以前PCIe Switch在很多服务器里只是扮演“扩展”的角色——主板PCIe通道不够用了插一颗交换芯片让一块x16拆成两个x8或者多插几块NVMe盘。在GPU服务器里它通常是让8颗GPU能够同时共享CPU和网卡带宽的那个桥梁。但过去的PCIe Switch有一个尴尬**lane数不够多速率也不够快。**PCIe Gen4的x16单向带宽才32 GB/sGen5是64 GB/s。你要把16颗GPU以x16全速连到一起主流交换芯片根本做不到。于是大家只能把GPU降速到x8或者拆成两三个交换域通信带宽从源头就被卡住了。Marvell这次发布的260 lane PCIe 6.0 Switch恰恰就是冲着这个痛点来的。它不仅把lane数一口气拉到260还把每条lane的速率翻了一倍等于单芯片就能把十几个GPU以PCIe 6.0全速塞进一个交换域。这一步等于把开放Scale-up互联的硬件基础补上了。2. 260 lane的账怎么算速率、拓扑与真实带宽2.1 PCIe 6.0带来的一倍跳升先看速率演进。PCIe的每一代都是在前一代基础上翻倍但翻倍的方式不同代际单lane单向速率编码方式x16单向理论带宽PCIe 3.08 GT/s128b/130b约16 GB/sPCIe 4.016 GT/s128b/130b约32 GB/sPCIe 5.032 GT/s128b/130b约64 GB/sPCIe 6.064 GT/s128b/130b PAM4约128 GB/sPCIe 6.0的关键变化是从NRZ信号改成了PAM4一个信号周期里能传2 bit同时引入FEC前向纠错和FLIT模式来压制PAM4带来的误码率。这意味着同样物理通道数速率直接翻倍。这里要注意一个常见误区GT/s不是Gbps。64 GT/s说的是每秒64G次数据传输PAM4下每次传输携带2 bit但因为128b/130b编码有少量开销真实有效数据率大约是64 × 128/130 ≈ 63 Gbit/s。换算成字节x16单向就是约128 GB/s正好是PCIe 5.0的两倍。2.2 260 lane能拼出什么拓扑260 lane这个数字很多人第一眼会头疼但把它拆开就清楚多了16个x16端口256 lane还剩4个lane可以留给管理口或低速通道。这是最快的配置16个设备全部跑满PCIe 6.0 x16每个设备单向带宽128 GB/s。32个x8端口256 lane剩下4 lane同理。适合加速器密度更高、单设备带宽要求稍低的场景每个设备单向带宽64 GB/s。混合拆分比如给8个GPU各x16再给8个CXL内存池各x8剩下的x4接NVMe盘。PCIe的Bifurcation机制允许这种灵活组合。260 lane的聚合带宽是多少260 × 64 GT/s × 128/130 ÷ 8单向大约是2048 GB/s也就是2 TB/s双向合计约4 TB/s。这个数字可以这样理解一颗800G网卡的收发带宽才100 GB/s260 lane的PCIe Switch单向吞吐相当于20颗800G网卡同时全速转发。2.3 交换不是堆料时延、fan-out和故障隔离有人会问GPU之间为什么一定要通过Switch不能像NVLink那样直接点对点互联点对点确实时延最低但拓扑灵活性很差。16颗GPU如果全部两两直连每颗GPU需要15条独立链路这在芯片引脚、PCB布线、连接器层面都是灾难。Switch的价值在于做扇出和收敛。一颗260 lane的Switch可以把16颗GPU组织成一个全互联的逻辑拓扑任何两颗GPU之间的通信只需经过一跳交换。PCIe交换的cut-through时延通常在百纳秒量级远低于跨网络交换机的微秒级时延。这对张量并行这种高频小消息通信非常关键。另外交换芯片还承担了故障隔离和热插拔的职责。如果某个GPU或加速卡异常可以通过Switch隔离掉不至于把整机拖垮。这是点对点直连做不到的。3. 光鲜数字背后的硬件现实把260 lane装进机箱有多难3.1 SerDes功耗一枚接近CPU的“电老虎”260 lane的Switch意味着芯片内部要集成260对高速SerDes收发器这是物理层面最大的压力。PCIe 6.0使用PAM4调制后SerDes的功耗比PCIe 5.0的NRZ更高普遍在几百毫瓦到1瓦甚至更高。哪怕按保守的0.5瓦每lane估算260条lane光SerDes部分就要消耗130瓦左右再加上交换核心、缓存、管理逻辑整颗芯片的功耗很可能落在300瓦以上。这个数字意味着什么它已经逼近一颗主流服务器CPU的功耗。如果做成PCIe扩展卡单卡就要吃掉小半个机箱的散热预算如果直接焊在主板上整机散热设计得彻底重新做。风冷方案能不能压住要打个问号液冷会是更现实的选择。3.2 PAM4下的信号完整性线短、层多、料贵PAM4信号比NRZ更容易受噪声和损耗干扰。同样一段PCB走线PCIe 5.0能容忍的损耗预算到了PCIe 6.0可能直接超限。反映到实际设计里就是主板和Switch板卡的PCB层数会增加走线长度要进一步缩短。板材升级到低损耗材料成本跟着涨。连接器选型更苛刻背板和线缆的插入损耗都要重新评估。短距离场景可能需要retimer重定时器来恢复信号质量而retimer本身也需要功耗和空间。这些都是规格表上看不到的隐性成本。20多条高速差分对挤在一起时串扰问题也会被放大板级设计的难度不是线性上升而是指数上升。3.3 系统形态板载、中板还是独立盒260 lane Switch最后会以什么形态出现在数据中心里目前看有三种可能板载集成直接焊在GPU服务器主板上适合8到16卡的中型节点。好处是集成度高、时延最低坏处是散热和信号完整性压力大一旦损坏整板报废。中板/背板模块放在机箱中部的独立交换板上通过高速连接器和GPU板互联。这是目前高端GPU服务器比较常见的方式类似NVIDIA HGX主板的NVSwitch位置。独立交换盒把260 lane Switch做成一个独立盒体通过PCIe线缆或光模块连接多台服务器。这种方式最灵活可以池化多个节点但线缆成本和信号损耗会限制连接距离。个人判断前两种会是主流。独立交换盒虽然灵活但PCIe本身就是短距离协议机柜内走线距离一旦超过一米PAM4信号的可靠性就非常难保障除非搭配专门的PCIe光模块或retimer方案但成本就上去了。4. 市场上还有谁从Broadcom的旧地盘到Marvell的新牌4.1 传统PCIe Switch市场格局PCIe Switch不是一个新市场过去几十年里主要被两家把持Broadcom旗下PLX的PEX系列和Microchip旗下SwiStitch系列。这两家在PCIe Gen3/Gen4时代做得很稳产品线覆盖下游到上游很多服务器主板上都能看到它们的芯片。但到了PCIe Gen5时代传统产品的节奏明显变慢了。主流交换芯片的lane数大多维持在48到100 lane虽然有PCIe Gen5速率但fan-out能力并不足以支撑AI集群里的GPU级Scale-up需求。大家更多还是把PCIe Switch当成“万金油”扩展芯片用而不是当成AI基础设施的核心组件。4.2 Marvell这一代为什么是“业界第一”Marvell这次能喊出“业界第一款260 lane PCIe 6.0 Switch”底气来自于它在数据中心互连上的连续布局。Marvell本身有很强的SerDes技术积累后来通过收购Innovium补足了以太网交换能力再加上定制ASIC业务等于把高速互连的底层能力都攥在了手里。260 lane这个数字就是对传统PCIe Switch厂商的一次正面压制。当别人还在100 lane附近徘徊时直接翻到260 lane意味着单芯片覆盖的GPU数量翻倍。对AI数据中心来说这意味着机柜内Scale-up网络的结构可以大大简化——原来需要两颗甚至四颗Switch并联才能连起来的GPU池现在一颗就搞定了。当然这颗芯片的发布时间点也很微妙。它选在PCIe 6.0生态开始成熟、AI机柜互联需求爆发的时间窗口等于提前卡住了开放Scale-up基础设施的位置。4.3 PCIe 6.0 switch和CXL、UALink的互相缠绕PCIe 6.0 Switch的意义不止在于PCIe协议本身。CXL 3.x是基于PCIe 6.0物理层发展出来的也就是说同一颗高lane交换芯片在硬件上完全有可能通过模式切换来支持CXL内存池化和缓存一致性。未来如果要做机柜级内存池这种260 lane的Switch是天然的基础设施。与此同时UALinkUltra Accelerator Link联盟也盯上了Scale-up这个战场目标是定义一个开放的高速加速器互连标准直指NVLink的封闭生态。PCIe 6.0 Switch和UALink并不是同一套协议但它们解决的是同一个问题——机柜内部的高速互联。PCIe 6.0 Switch的落地至少证明了开放生态在硬件能力上有了能和私有方案掰手腕的底子。对用户来说这颗芯片背后的生态信号比芯片本身更重要开放Scale-up不再是纸上谈兵而是有真芯片可以用了。5. 落到选型什么场景该用什么场景继续等5.1 先算自己的账x16和x8怎么取舍面对260 lane的Switch第一个问题永远是我要用它连多少个设备每个设备给多少带宽给你一个可以直接套用的估算方法。假设你的加速卡支持PCIe 6.0 x1616颗卡全速互联16 × 16 256 lane260 lane基本满配适合高端训练节点。给卡降到x8可以连32颗卡32 × 8 256 lane适合推理集群或对单卡带宽不那么极端的场景。混合模式一部分卡走x16另一部分卡走x8剩余走x4接NVMe或CXL内存灵活性在Bifurcation下完全没问题。算完这步你才能判断这颗芯片适不适合你的场景。如果你的节点只有8颗卡用一颗百lane级别的PCIe Gen5 Switch也许就够了没必要为260 lane的功耗和成本买单。5.2 落地时的几个关键坑第一批产品往往不是给所有人准备的落地时有几个坑要特别注意坑一生态成熟度。新型Switch芯片从发布到服务器厂商批量采用中间隔着BIOS支持、固件更新、Linux内核驱动、故障管理工具链等一系列工作。如果只盯着芯片新闻不等整机方案很容易买回一块“谁的机器都装不上”的板卡。坑二故障域扩大。一颗Switch挂掉意味着连在上面的一整组GPU全部失联。16颗卡共用一个交换域相当于把鸡蛋放在一个篮子里。如果做训练集群要考虑是否需要双Switch冗余或者把关键通信路径做成可失败的降级模式。坑三散热和冷却。前面算了260 lane Switch功耗很可能在300瓦以上。风冷机柜能不能装液冷管路怎么走整个节点的散热方案都要提前和整机厂商确认不能只看芯片规格表。5.3 我的实际建议画图先于采购我的建议是做选型前先画一张拓扑图。把每个GPU、每颗CPU、每张网卡、每块NVMe的PCIe链路都画出来标上速率和lane数再去看Switch的端口怎么分配。你会发现很多问题在画图阶段就暴露了比如CPU的Root Complex有多少个x16端口可用GPU的PCIe控制器是否真的能跑满x16网卡需要占几个lane等等。老话说“瓶颈不在链路在端点的能力”放到这里依然成立。Switch只是把路修宽了如果路两端的设备本身吞吐不够再宽的路也是浪费。所以260 lane是一个好消息但它解决的是互联瓶颈不是算力瓶颈。真正落地时还是要回到你手里有什么GPU、有多少CPU PCIe通道、跑什么模型、通信模式是什么样的这些才是最基础的约束条件。我个人在实际规划中的体会是PCIe 6.0 Switch这类产品真正成熟要到2026年前后届时服务器整机方案会陆续出来。如果你现在就要搭建一个16卡以上的开放生态训练节点不妨先关注这颗芯片的整机落地情况如果只有8卡或更小规模老老实实把PCIe Gen5的拓扑优化好收益反而更大。硬件迭代的窗口面前有时候“等”也是一种效率。