共封装光学(CPO)正从网络路线图变成基础设施规划问题。其概念很直接:将光引擎放在交换芯片附近,使高速电信号在转换成光信号之前走更短的路径。实际决策却没有这么直接。团队不仅要证明 CPO 设计在技术上有前景,还要确认特定系统、光学供应链和维护模式能在自己的部署窗口内准备就绪。

这一区分很重要,因为已宣布的交换机、已完成验证的平台和可重复的工厂产出是不同的里程碑。Broadcom 将其 Tomahawk 6 Davisson 描述为 102.4 Tb/s 的 CPO 以太网交换机;NVIDIA 也发布了面向 AI 工厂的 Spectrum-X Photonics 配置。这些都是重要的产品信号,但不能取代买方自己的验证、产能和故障恢复证据。本文提供了一套让这些证据清晰可见的方法。

代表 AI 数据中心基础设施的 NVIDIA 图形卡特写

说明图片来自已完成的来源包,展示的是 AI 计算硬件,而不是共封装光学交换机或客户部署。

将架构声明与部署声明分开

CPO 改变了电信号与光信号交汇的位置。传统可插拔收发器位于交换机前面板,电信号在进行光电转换前要穿过更长的电路板路径。共封装设计将光引擎移近交换 ASIC。这可能降低电损耗及信号调理的功耗,但也改变了封装、散热、测试和维修方式。

先记录对项目真正重要的那项明确声明。供应商承诺的是更低的互连功耗、更高的前面板密度、特定端口数量、更少的链路中断,还是通往更大规模网络的路径?同时记录比较基线、流量模式、温度范围和组件配置。供应商数据可以作为假设,却不是同样结果会出现在另一机架、拓扑或运行环境中的证据。

例如,Broadcom 表示其 Davisson 设计结合了 102.4 Tb/s 容量、每条链路 200 Gb/s 的运行能力以及基于台积电 COUPE 技术的光引擎。NVIDIA 也将 CPO 作为其 AI 网络路线图的一部分。这些一手公告说明了制造商计划提供的产品;不应将其转化为潜在买方的独立可用性、功耗或交付能力结论。

在预留产能前建立验证地图

有效的供应计划会映射整个已验证系统,而不是只把交换机当作一项物料。至少应包含交换芯片、光子引擎、激光器、光纤和连接器组件、基板、封装产能、测试设备、固件、散热部件、系统集成和现场可更换部件。对每一项记录已批准供应商、备选供应商、验证状态、交期、分配状态和负责人。

这张地图要明确三种状态。可获得意味着某个地方能买到该组件。已验证意味着它已在目标系统中通过相关设计和可靠性检查。已承诺意味着已有与部署日期匹配的配额或合同。把三者混为一谈会造成虚假的信心:若配套光引擎尚未验证,再容易获得的激光器也无济于事;而已验证的部件也不等于交付承诺。

台积电的 COUPE 材料描述了从硅光子集成到 CPO 封装的路径。这支持技术方向,却不证明每一种供应商组合都已就绪。应询问每家系统供应商:哪些封装、激光器、连接器和维护配置已共同验证;还应问清工程样品与拟议量产配置之间发生了哪些变化。

将良率和可维护性视为同一个运行问题

光学对准、键合和测试流程会同时影响制造良率与未来维修。因此,部署计划应要求提供实际出货单元的证据:工厂测试覆盖范围、验收阈值、老化测试、光学裕量、热限制、失效模式、维修流程和替换交期。醒目的带宽数字对这些问题几乎没有说明力。

可维护性尤其值得关注。可插拔光学模块让运营方在不干扰主要交换封装的情况下更换前面板模块。CPO 可以使用外置或现场可更换的激光模块,但这并不意味着光路中的每个元件都同样易于接触。应明确哪些组件可在现场更换,哪些需要返厂维修(RMA),哪些故障可远程隔离,以及需要怎样的备件策略。

在扩展部署前进行受控故障演练。模拟激光模块丢失、光功率衰减、端口故障和固件回滚;测量诊断时间、流量恢复、人为干预以及回到已知正常状态的路径。目的不是让新架构显得更危险,而是确认其恢复流程是否符合可用性目标。

将设备订单报道当作信号,而非预测

已完成的来源包报道了与光子封装有关的台湾运动控制、检测和定位设备需求走强。这可以成为向供应商询问制造瓶颈的理由,却不能单独证明具名客户订单、量产产出、超大规模客户的已接受部署或长期短缺。来源报道没有独立确立这些细节。

可用这类报道检验与供应商的沟通。询问哪些组装和检测步骤受产能限制,限制来自设备、技术人员、封装空间、激光器供应还是验证时间;还要了解有多少产能已经预留、多少只是预测。要求对方给出日期和产品范围,而不是笼统地说“光学很紧张”。再将回答与订单确认、工厂验收计划以及自身建设计划中的交付日期交叉比较。

同样的纪律也适用于短缺和扩产。新增设备只有在安装、工艺开发和客户验证后才可能提升产能。报告中的交期可能只反映一个组件类别,而其他环节仍未受限。每一项判断都应对应具体料号、工艺步骤和日期。

采用分阶段的部署决策

分阶段决策通常比对 CPO 作二元判断更有用。先从工程试点开始,覆盖目标交换机、光学组件、布线、散热、软件和遥测。预先定义成功标准:持续错误率、光学裕量、机架功耗、恢复时间、软件兼容性、备件可用性和运维工作量。在仍可行时,也应纳入可比较的可插拔或线性可插拔设计。

随后建立三种供应情景。在按计划情景中,已验证的供应和部署日期与建设计划一致。在受限情景中,激光器、光子引擎、封装或测试步骤发生延误,团队需要找出最小可行部署及替代架构。在维护事件情景中,现场故障检验机架能否在替换硬件到达前继续发挥作用。为每种情景指定决策负责人和触发条件。

不要仅因市场报告预测稀缺就提前下单。只有当架构、验证证据和运行后备方案共同支持同一判断时,才预留产能。反过来,也不应只因 CPO 需要不同维护模式就拒绝它。在功耗和带宽是关键约束的地方,其较短电路径和密度可能很有价值。正确选择取决于工作负载、故障容忍度、安装窗口以及运营最终系统的能力。

让就绪度成为一条证据链

最持久的产出是一份持续更新的就绪记录。它应把每项技术声明关联到来源,把每个已验证组件关联到测试结果,把每项供应承诺关联到交付文件,并把每项运行风险关联到恢复流程。当交换机版本、光引擎、固件、拓扑或部署日期发生变化时,应重新审视该记录。

CPO 不是可插拔光学的通用替代品,也不必如此。它是一种架构选项,其收益和取舍只有在具体 AI 网络部署中衡量才会更清楚。通过把制造商声明与本地证据分开、把供应可得性与验证分开、把工厂良率与维护恢复分开,基础设施团队可以用更少假设、更有把握地作出决定。

我们的编辑方法

我们会结合一手资料、产品文档与实际使用场景,帮助你更清楚地判断工具是否适合你的工作流。

参考来源

浏览工具目录