AI硬件13-3层互联讲透:从PCIe到芯片级带宽跃迁,加速卡互联技术,PCIe / 多卡直连 / 芯片级

AI硬件13-3层互联讲透:从PCIe到芯片级带宽跃迁,加速卡互联技术,PCIe / 多卡直连 / 芯片级 基金定投助手为什么你的基金定投总在追涨杀跌价值平均法定投引擎 综合估值模型动态再平衡仓位管理一个单文件 HTML 的免费定投工具-CSDN博客https://download.csdn.net/download/weitingfu/93339607?spm1011.2124.3001.6210本文为《AI 硬件体系深度调研》系列第 13 篇。上一篇我们拆解了加速卡的七大模块留下一个悬念加速卡的血管——互联技术——决定多卡能跑多快。这一篇把三类互联技术一次性讲透。黄金 100 字你是否训大模型多卡一开发现加卡不加速甚至更慢很多人只盯算力却忽略了卡与卡之间’路’的宽度。本文拆解 PCIe、多卡直连、芯片级三类互联告诉你瓶颈常在路上。一、PCIe主机的国道1.1 先认清 PCIe 的定位PCIePeripheral Component Interconnect Express外设组件互连高速标准是加速卡和主机 CPU 之间的通用标准接口。它是国道——所有加速卡、显卡、网卡、SSD 都走这条路和 CPU 通信。它的关键词是**“通用”**任何厂商、任何板卡只要符合 PCIe 标准就能插进任何符合标准的主板。这种通用性让 PCIe 成为整个计算机生态的基础设施级接口也让加速卡能够快速接入现有服务器。1.2 PCIe 的带宽演进一代翻一倍PCIe 每一代都在带宽翻倍演进速度非常稳定代际单链路速率x16 总带宽单向发布时间定位PCIe 4.016 GT/s~32 GB/s上一代主流PCIe 5.032 GT/s~64 GB/s当前主流PCIe 6.064 GT/s~128 GB/s新一代PAM4 编码文档锚点里有个关键表述PCIe 4.0 → 6.0单链路带宽提升近两倍。这里的近两倍指的是单链路速率从 16 GT/s 涨到 64 GT/s——整整翻了四倍64 ÷ 16 4但考虑到 PCIe 6.0 引入 PAM4 编码后有效数据率的换算差异表述为提升近两倍或翻数倍都不影响核心结论PCIe 的带宽一直在快速膨胀。 一句话PCIe 是国道通用、标准、够用但不是为极致多卡通信设计的。它的瓶颈恰恰在下一节要讲的多卡直连里被暴露出来。1.3 PCIe 的架构软肋树形拓扑PCIe 的通用性是有代价的这个代价就是它的树形拓扑。在 PCIe 架构里CPU 是根所有设备包括加速卡都挂在这个根下面。这意味着卡与卡之间通信必须绕经 CPU卡 A 想给卡 B 发数据不能直接发得先把数据送到 CPUCPU 再转发给卡 B。多一跳就多一份延迟带宽共享多张卡同时和 CPU 通信时会争抢 PCIe 的总带宽互相拖累扩展性受限树形结构下卡的规模越大转发和争抢越严重效率越低。⚠️ 避坑提醒“传统总线速度直接限制芯片算力发挥”——这是本篇文章最核心的一句。算力芯片再快如果数据喂不进去、结果送不出来算力就是空转。很多人只盯算力峰值却忽略了这条路的宽度结果多卡训练加卡不加速。1.4 一个关键细节x16 与通道拆分PCIe 带宽的计算方式值得单独讲清楚因为它直接影响一张卡能跑多快。PCIe 由多条通道Lane组成每个通道是一条独立的差分信号对。常见的配置是x11 条通道带宽最低用于声卡、网卡等低速设备x44 条通道用于 NVMe SSDx88 条通道带宽减半x1616 条通道带宽最高加速卡、显卡的标准配置。加速卡通常用x16也就是 16 条通道并行传输。PCIe 5.0 x16 的单向带宽约 64 GB/s如果降成 x8带宽直接减半到 32 GB/s。⚠️ 避坑提醒插槽规格和通道数要匹配。一块 x16 的卡如果插进一个物理上是 x16、但电气上只接出 x8 通道的插槽实际带宽会降一半。装机时务必确认主板插槽的通道配置别让卡吃不满带宽。1.5 为什么 PCIe 一代代在翻倍却还是不够快这是个很反直觉的问题PCIe 每一代都翻倍为什么多卡训练还是觉得它慢答案是AI 模型的规模增长比 PCIe 的带宽增长还快。模型参数从几亿涨到几千亿、上万亿训练时要在多卡之间同步的梯度、参数数据量爆炸式增长算力芯片的算力也在暴涨单位时间内要搬运的数据更多PCIe 的带宽虽然翻倍但它的拓扑瓶颈树形、CPU 转发、共享带宽没有变翻倍只是量变没有解决质变。 一句话PCIe 的慢不是带宽数字小而是架构设计的天花板低。带宽翻倍能缓解症状但治不了树形拓扑这个病根。这就是为什么需要下一节的多卡直连。二、多卡专属互联卡间高铁2.1 多卡直连解决什么问题既然 PCIe 的树形拓扑有软肋那多卡训练这种卡与卡之间要频繁高速通信的场景自然需要一个更合适的方案——多卡专属互联也就是卡间高铁。多卡直连的核心设计目标是让卡与卡之间直接交互不依赖 CPU 转发。典型代表是 NVLink以及各家厂商的类似方案如 AMD 的 Infinity Fabric 部分用法、各家自研的卡间直连。它的关键特性点对点直连卡 A 和卡 B 之间拉一条专用高速通道数据直接走不绕 CPU高带宽单链路带宽是 PCIe 6.0 的数倍无阻塞点对点多卡之间可以同时通信不互相争抢实现全互联或无阻塞交换。2.2 为什么多卡直连带宽能甩开 PCIe多卡直连能提供比 PCIe 6.0 高数倍的带宽原因在于它是为卡间通信这个单一场景深度定制的而 PCIe 要兼顾各种外设的通用性。具体来说专用物理层不用兼容各种历史设备可以用更激进的信号速率、更宽的链路点对点拓扑没有 CPU 转发的中间环节延迟低带宽利用率高可堆叠链路多卡直连可以多条链路并行总带宽成倍叠加。 生活化类比PCIe 像国道什么车都走红绿灯多、要绕道多卡直连像高铁专线专用一站直达运力和速度都高一个量级。多卡训练是高频、低延迟、高带宽的通信需求注定要坐高铁而不是堵在国道上。2.3 多卡直连的拓扑形态多卡直连也不是一根线连到底这么简单它有不同的拓扑形态全互联All-to-All每张卡和其余所有卡都直连通信无阻塞但链路数量随卡数平方增长成本高适合小规模高端系统交换机式Switch卡通过高速交换机互联卡之间通过交换机转发扩展性好适合大规模集群混合拓扑部分直连 部分交换机在成本和性能之间折中。⚠️ 避坑提醒拓扑规划直接影响多卡训练的通信效率。通信不均部分卡直连、部分卡走 PCIe 或交换机会导致木桶效应——最慢的那条路决定整体通信速度。这也是本篇结尾思考题要讨论的核心问题。2.4 多卡直连的代价多卡直连性能虽强但不是免费的午餐它的代价包括成本高专用互联需要额外的物理层、交换机、线缆、背板硬件成本显著上升通用性差NVLink 这类方案是厂商私有的卡和服务器必须配套不能随意混搭设计复杂拓扑规划、线缆布线、故障处理都比 PCIe 复杂得多。 一句话多卡直连是用成本和复杂度换卡间通信的极致性能。值不值取决于你的场景——单卡或少量卡训练PCIe 够用大规模多卡训练直连是刚需。2.5 NVLink 的演进带宽一路狂飙以最具代表性的 NVLink 为例看看多卡直连的带宽是怎么一路涨上来的代际单链路带宽双向主要变化NVLink 1.040 GB/s初代点对点直连NVLink 2.050 GB/s带宽提升NVLink 3.0100 GB/s带宽翻倍NVLink 4.0200 GB/s再翻倍支持更大拓扑可以看到NVLink 的演进节奏比 PCIe 更激进——每一代都在大幅翻倍因为它是专线专用可以放开手脚提升速率不用受兼容各种外设的约束。这也是为什么多卡直连能长期保持对 PCIe 的数倍带宽优势。 一句话多卡直连的带宽优势不是一次性的领先而是持续扩大的领先。因为它专为高性能而生演进可以更激进。2.6 一个真实场景梯度同步为什么吃互联多卡训练里最吃互联的环节是梯度同步AllReduce。以数据并行训练为例一个批次的数据被切分到 N 张卡上每张卡各自算出一份梯度然后要把这 N 份梯度汇总、求平均、再广播回所有卡。这个过程叫 AllReduce。关键点在于AllReduce 的频率极高、每步都要做。训练一个模型要成千上万步每一步都要做一次梯度同步。如果互联慢每一步都卡在同步上训练时间会成倍拉长。用小批次、频繁同步对延迟敏感——需要低延迟的点对点直连大模型、大梯度对带宽敏感——需要高带宽的直连。 生活化类比梯度同步像一群工人协作搬砖——每个人算好自己搬了多少然后要快速对账再继续。如果对账环节慢互联慢哪怕每个人搬砖都快算力强整体进度也会被对账拖垮。多卡训练里互联就是那个对账环节。三、芯片级互联基板上的地铁3.1 芯片级互联是什么如果说 PCIe 是国道、多卡直连是高铁那芯片级互联就是基板上的**“地铁”**——在加速卡内部芯片与芯片、芯片与内存之间还有一层更底层、更高速的互联。芯片级互联的特点是芯片与内存同基板直连也就是多个芯片通过硅中介层Interposer或先进封装CoWoS 等直接连在同一块基板上走线极短。这种同基板直连带来三个关键优势带宽更高走线短、信号速率高带宽可以做到 TB/s 级延迟更低物理距离近信号传播时间极短功耗更低短走线相比长走线传输同样数据的功耗显著下降。3.2 芯片级互联的典型形态芯片级互联最常见的应用就是算力芯片与 HBM 内存之间的连接。前面第 12 篇讲过HBM 通过先进封装紧贴算力芯片部署。这个紧贴靠的就是芯片级互联——通过硅中介层把算力芯片和 HBM 芯片连在同一块基板上用极短的走线实现 TB/s 级带宽。此外多颗算力芯片拼成一颗超级芯片Chiplet / 多芯封装也依赖芯片级互联。比如把两颗或多颗芯片通过先进封装连起来对外看起来像一颗芯片内部用极高速的互联通信。 一句话芯片级互联是最底层、最高速、最短距的互联。它解决的是芯片和芯片、芯片和内存之间的通信是整条互联技术栈的地基。3.3 三个层级的关系从外到内把三类互联放在一起能清楚看到它们的层级关系芯片级互联芯片与 HBM、芯片与芯片之间在同一块基板内部带宽最高、延迟最低多卡直连卡与卡之间在同一台服务器或机柜内部带宽次高、延迟次低PCIe卡与 CPU 之间是跨系统、跨设备的通用接口带宽最低、延迟最高。从外到内带宽递增、延迟递减、距离缩短、专用程度升高。这是一条清晰的互联技术光谱。3.4 芯片级互联的工程底座先进封装芯片级互联能实现TB/s 级带宽、极低延迟靠的不是魔法而是先进封装技术。其中最典型的是CoWoSChip-on-Wafer-on-Substrate和硅中介层Silicon Interposer硅中介层在算力芯片和 HBM 之间放一块硅片上面布好密密麻麻的高速走线让芯片和内存能贴着互连CoWoS把多颗芯片算力芯片 HBM一起封装到中介层上再整体贴到基板实现多芯片同基板直连。这些先进封装技术的核心价值就是把原本芯片与芯片之间的长距离互连压缩到同一块基板、几毫米走线的短距离互连。距离一短带宽、延迟、功耗全都跟着优化。 生活化类比芯片级互联靠的是**“搬家而不是修路”**——与其在芯片之间修一条又长又慢的公路长走线不如直接让它们住进同一栋楼同基板封装出门就是邻居通信自然又快又省。3.5 芯片级互联的三个量级优势把芯片级互联的优势具体化能看到它和另外两级互联的代差带宽芯片级互联可达 TB/s 级是 PCIe x16几十 GB/s的几十倍延迟芯片级互联的延迟是芯片内部量级纳秒甚至更低比经 CPU 转发的 PCIe 低几个数量级功耗短走线传输同样数据功耗显著更低这对功耗敏感的 AI 芯片至关重要。 一句话芯片级互联的高带宽、低延迟、低功耗三者同时成立靠的就是把距离压到最短。这是物理层面最优雅的解法。四、三种互联带宽量级对比4.1 一张表看清三者的差距把三类互联的关键指标摆在一起量级差距一目了然互联类型典型带宽单链路典型延迟物理范围定位PCIe 5.0/6.032-64 GB/sx16高微秒级经 CPU 转发主机与卡之间国道多卡直连NVLink 类数百 GB/s 到 TB/s低纳秒级点对点卡与卡之间高铁芯片级互联TB/s 级极低芯片内部级芯片与 HBM/芯片之间地铁这张表揭示了一个核心规律带宽越高、延迟越低的互联物理距离越短、专用程度越高。 一句话互联技术的本质是用更短的距离、更专用的设计换更高的带宽和更低的延迟。三个层级就是这个交换从通用到专用的三个梯度。4.2 为什么带宽差距是量级而非百分比PCIe x16 是几十 GB/s多卡直连是几百 GB/s 到 TB/s芯片级互联是 TB/s 级——这三者之间的差距是一个数量级不是差个 20%、30%这种量级。为什么会拉开这么大的差距根本原因是物理距离和设计专用度PCIe 要走主板、走插槽、走线很长还要兼容各种设备信号速率受限多卡直连虽然也是卡外但可以专用物理层、点对点直连距离比 PCIe 短速率更高芯片级互联在基板内部走线只有几毫米信号速率可以拉满带宽自然最高。距离每缩短一个量级带宽就能往上跳一个量级。这是高速信号传输的物理规律决定的。4.3 延迟的重要性多卡训练的死穴很多人只看带宽却忽略了延迟——而延迟恰恰是多卡训练的死穴。多卡训练时成千上万张卡要频繁地、小批量地同步梯度。每一次同步数据量可能不大但要快。如果延迟高即使带宽再大每一次同步都要等成千上万次同步累积下来时间就全浪费在等待上了。 生活化类比带宽是高速公路的宽度一次能过多少车延迟是信号灯的响应速度每辆车要等多久才放行。多卡训练的梯度同步是一辆辆小轿车高频往返它要的不是路多宽而是每个路口别等太久。PCIe 的信号灯要经过 CPU 转发等得久多卡直连点对点几乎不用等。这就是为什么多卡训练必须上直连。4.4 带宽与延迟的乘法效应带宽和延迟不是两个孤立指标它们会相乘地影响多卡训练效率。一个直观的理解如果一次 AllReduce 要同步的数据量是 D那么通信耗时大致等于传输时间 固定延迟。数据量大时大模型、大梯度传输时间占主导带宽越重要数据量小时小模型、频繁同步固定延迟占主导延迟越重要。而多卡训练的梯度同步往往是**“中等数据量 极高频次”——所以带宽和延迟都重要**缺一不可。这也是为什么多卡直连要同时做到高带宽和低延迟而不是只追求其中一个。 一句话带宽决定一次能搬多少延迟决定每搬一次要等多久。高频同步场景下两者一起决定总耗时这就是乘法效应。五、选互联就是选扩展性5.1 三种互联的适用场景理解了三种互联的差异选型就清晰了场景推荐互联原因单卡训练 / 推理PCIe通用、够用、成本低少量多卡2-8 卡PCIe 部分直连兼顾成本与性能大规模多卡训练成百上千卡多卡直连全互联/交换机通信是瓶颈必须上高铁芯片内部 / HBM 通信芯片级互联带宽和延迟的极致要求核心结论选互联本质是选扩展性。只跑单卡PCIe 完全够用没必要上昂贵的直连要扩展到几十、几百张卡PCIe 的树形瓶颈会迅速暴露多卡直连成为刚需芯片内部永远是芯片级互联的天下这是物理定律决定的。5.2 加卡不加速的真相回到开头那个痛点为什么多卡一开加卡不加速甚至更慢答案几乎总是出在互联上PCIe 带宽不够数据搬运跟不上算力卡在等数据拓扑不合理通信路径绕远、争抢延迟高通信不均部分卡走快路、部分卡走慢路整体被最慢的拖垮。 一句话算力决定单卡上限互联决定多卡上限。加卡之前先问一句你加的这张卡路够宽吗5.3 未来趋势互联越来越芯片化互联技术还在快速演进一个明显趋势是互联越来越向芯片级靠拢。多卡直连的带宽不断提升越来越接近芯片级互联的水平光电共封装CPO、硅光互联等新技术尝试把光通信引入芯片和卡之间进一步缩短距离、提升带宽芯片级互联的先进封装技术CoWoS、SoIC 等不断成熟让更多芯片装进同一块基板。 一句话互联技术的终极方向是让卡与卡的通信变得像芯片与芯片一样快。当距离不再是瓶颈多卡才能真正像一台超级计算机一样协同工作。5.4 拓扑规划的实战思考选型之外拓扑规划同样关键。这里给出几个实战思考点帮你在通信不均时快速定位问题统一互联等级尽量避免一部分卡走直连、一部分卡走 PCIe的混合状态。因为整体通信速度会被最慢的那条路锁死混搭等于白白浪费直连的性能对称拓扑优先全互联或对称的交换机拓扑能让每张卡的通信负载均衡避免热点卡成为瓶颈预留扩展空间规划时就要想清楚未来要扩到多少卡拓扑要能平滑扩展而不是加卡就要推倒重来监控通信瓶颈训练变慢时先看通信耗时占比。如果大部分时间花在 AllReduce 上说明互联是瓶颈该升级直连或优化拓扑了。 一句话拓扑规划的核心是让每张卡的路一样宽。任何一张卡路窄了整条训练流水线都会被它拖慢。5.5 一句话选型口诀最后把本篇的选型逻辑浓缩成一句口诀方便你记住卡内地铁芯片级卡间高铁直连对外国道PCIe——能坐高铁就别堵国道但也要看钱包。单卡 / 推理国道就够别浪费钱上高铁多卡训练必须上高铁否则加卡不加速芯片内部永远是地铁物理定律说了算。这句口诀就是选互联就是选扩展性的落地版本。配图图 1三类互联层级图主机 PCIe / 卡间直连 / 芯片级flowchart TB CPU[CPU 主机] subgraph 卡1[加速卡 1] 芯片A[算力芯片] 内存A[HBM] 芯片A -- 芯片级互联br/TB/s 级 -- 内存A end subgraph 卡2[加速卡 2] 芯片B[算力芯片] 内存B[HBM] 芯片B -- 芯片级互联br/TB/s 级 -- 内存B end CPU -- PCIe 5.0/6.0br/主机国道 -- 卡1 CPU -- PCIe 5.0/6.0br/主机国道 -- 卡2 卡1 -- 多卡直连 NVLinkbr/卡间高铁 -- 卡2三个层级清晰分层芯片级互联在卡内最短、最快多卡直连在卡间点对点PCIe 连接主机与卡通用、最慢。图 2三种互联带宽与延迟量级对比柱状图xychart-beta title 三类互联带宽量级对比示意非精确数值 x-axis [PCIe 5.0/6.0, 多卡直连, 芯片级互联] y-axis 相对带宽倍 0 -- 100 bar [1, 10, 50]柱状图示意以 PCIe x16 带宽为基准设为 1多卡直连约其 10 倍量级芯片级互联可达其 50 倍量级。层级越靠近芯片带宽越高、延迟越低。写在最后三类互联一条光谱PCIe 是通用国道多卡直连是专用高铁芯片级互联是基板地铁。它们的差异本质是通用性和性能之间的权衡——越通用带宽越低越专用性能越强。理解了这条光谱你就能回答那个最经典的问题为什么多卡训练不能全靠 PCIe因为 PCIe 的树形拓扑、CPU 转发、共享带宽天生不适合高频、低延迟、高带宽的多卡梯度同步。多卡训练要跑得快必须让卡与卡之间坐上高铁。下一篇我们走一遍加速卡的完整工作闭环从指令下发到结果回传并看看 2025-2026 高端卡的真实参数。【思考题】如果集群里一部分卡用PCIe、一部分用直连通信不均会怎样怎么拓扑规划欢迎探讨。【系列文章预告】下一篇走一遍加速卡完整工作闭环并看2025-2026高端卡的真实参数。标签加速卡互联、PCIe、多卡直连、芯片级互联、NVLink类、带宽、多卡训练PCIe 为加速卡与主机 CPU 的通用标准4.0→6.0 单链路带宽提升近两倍多卡专属互联实现卡间直接交互、不依赖 CPU 转发单链路带宽是 PCIe 6.0 数倍支持无阻塞点对点芯片级互联让芯片与内存同基板直连带宽更高、延迟更低、功耗更低传统总线速度直接限制芯片算力发挥。