这个开源项目非常知名https://github.com/corundum/corundum国内也有很多学者业内人士写过不少文章我也都认真拜读过。以前手里有Bittware XUP-P3R的时候就在上面测试过25g版本不得不说质量非常高在那时候就感叹作者Alex Forencich的开源精神并且他还在油管上专门录视频讲解。但是因为Bittware XUP-P3R这款开发板本身项目就支持我也就没研究过如何将这个项目移植/适配到新的开发板上尤其是100g版本。正好手头有Bittware XUP-VV4这款开发板xcvu13p的芯片同时有四个qsfp28接口正好能满足100g版本的移植以及测试。这篇文章不会详细讲如何一步一步移植或许会放在后续文章中来讲而是我想先把我在移植过程中碰到的值得记录的点讲出来我感觉这个比移植本身要更有价值毕竟改改管脚约束没啥大的分享价值。首先我先给出生成bitstream文件后的物理布局布线图如下图。乍一看去绿油油一大片并且可以发现这些绿色区域还挺有规律仿佛被分割了一样分成几块。似乎使用了很多LUT资源但是我们再看接下来的图其实使用的片上资源不多尤其是LUT才用了7%。同时我们看下WNS仅有0.004ns差一点就时序违例。接下来我们再看下时序报告部分。逻辑级数几乎为0所以时序紧张并不是因为组合逻辑过重导致的那这是为啥呢这就引出来一个平时在开发中很少遇到的情况就是跨片走线。我再放一张xcvu13p的芯片图示从xcvu13p芯片的示意图上我们可以发现有三条紫红色的分割区域写着SLR CrossingSLR是啥呢就是超级逻辑区Super Logic Region就是一个芯片不是一整块硅片而是好几块小硅片叠成一个芯片这些小硅片之间通过中介层连接在一起互通起来那你想啊如果两个功能模块或者两个信号他都不是一个硅片上的那要串门子那肯定绕路啊表现到时序上就是跨硅片的电路延迟高。再回过头来看我手里这块开发板Bittware XUP-VV4根据硬件手册所示qsfp_0和qsfp_1在SLR3中qsfp_2和qsfp_3在SLR2中pcie则在SLR1中。在这种情况下跨SLR的布线就是最大的延迟来源我们平时不怎么关注的pblock规划就显得非常重要了。接下来我简要讲下移植步骤corundum项目中不同的板卡工程都在corundum\fpga\mqnic目录下。因为我们要实现100g版本所以最好的方案就是找个类似的复制一份如下图我复制了VCU118这个工程改成VV4。接下来看顶层模块接口信号以及约束文件具体的根据原理图或者硬件手册去修改管脚就不细说因为真的就是改管脚约束。这里注意的是DDR4并不是核心功能必须的即使是板子上没有DDR4也没关系。整个移植过程中最费功夫的是placement.xdc文件的修改因为最开始没在意以为没啥问题结果时序过不了。只能回过头改pblock来约束模块布局。最后调整完毕的一个布局规划如下# Placement constraints # VV4 / xcvu13p-figd2104 # PCIe GTY 224-227 - SLR1, CR X7Y4-Y7 # QSFP3 GTY 228 - SLR2, CR X7Y8, CMACE4_X0Y6 # QSFP2 GTY 229 - SLR2, CR X7Y9, CMACE4_X0Y7 # QSFP1 GTY 232 - SLR3, CR X7Y12, CMACE4_X0Y9 # QSFP0 GTY 233 - SLR3, CR X7Y13, CMACE4_X0Y10 # Split eth pblocks by SLR so CMAC txusrclk paths (e.g. tx_cpl_fifo) stay in-SLR.最终被几次漫长编译折磨后才勉强满足时序。以上是我在移植corundum的过程中遇到的问题的一个总结后续对corundum继续深挖和上板测试后会继续写相关的文章如果大家有其他问题留言或者私信我即可。