一句话说清楚:OAC 是什么?
AMD 数据中心架构与战略副总裁 Robert Hmouth:"这是垂直 OAM(vertical OAM)。"
OAC = 一种开放式 AI 加速器外形规格(form factor)。它保留了大家最熟悉的"垂直插卡、现场可更换"服务模型,但把机械、电气、散热边界重新画了一遍——让现代 AI xPU 继续是一张卡,只是这张卡是为 AI 自己设计的。
一、为什么需要 OAC?CEM 与 OAM 的双重瓶颈
在 OAC 之前,AI 加速器主要有两条路线:
PCIe CEM:最通用的扩展卡形态,但为"通用扩展卡"设计——更高互连、更多 lane、更大封装、无缆供电、直插液冷、更高层 PCB、背面高元件空间,这些它都不是为它们准备的。
OAM:曾服务第一代 AI 训练,但设计点停在 1000W,已"跟不上节奏"(规范原文)。
中间出现变宽的空白:企业 AI、Neo-cloud 推理与训练,需要更大封装、更高整板功耗(TBP),同时在 19 英寸机架内实现最高 16 个单宽设备密度。OAC 就是来填补这条空白的。
二、三种卡型:SW / DW / DWO
三者共享统一长度 409 mm、高度 190.6 mm,差异在宽度与正/背面空间分配。
密度:19 英寸内 SW 最高 16 张;DW/DWO 占双槽 → 8 张,但换更大散热/供电。三者可混合部署,但 DWO 偏移会伸入相邻槽位。
三、电气接口:112 条高速 lane + 最高 5000W 供电
由 1 个电源 + 最多 7 个高速连接器(CONN0–CONN6) 组成。CONN0 必选 154 针(含管理/边带 + 16 lane 高速),CONN1–6 各 112 针(纯高速),满配 → 112 条 I/O lane。
- 协议无关:PCIe / NVLink / UALink / Ethernet / 厂商自定义;通过 CID 动态分配引脚,不改机械设计。
- +12V 或 +50V:50V 同电流下功率是 12V 的 4 倍多,可用更细母线排、更低损耗。
- 功率能力(80% 降额):960W / 4000W / 1200W / 5000W(远超 OAM 1000W)。
- 双重防误插:D 形定位销机械键控 + CID 电压声明;不支持热插拔。
四、散热架构:风冷与 DLC 液冷双路线
只有两条路线,无混合方案,100% 热量须被被动散热器或液冷冷板捕获。
- 风冷:被动散热,需提供温度-风量/阻抗/功率曲线,参考支持 ASHRAE A2(最高 35℃ 进风)。
- DLC 液冷:OCP MQDB-04 盲插快接——100 psi 工作压力、≥5000 次插拔、每次断开漏液 ≤0.025 mL;冷却液 30–45℃,不冷凝。
责任分离是跨厂商互操作基础:卡声明冷却需求,平台提供冷却资源——合规基于"运行范围"而非单一工作点。
五、机械设计:渐进式对齐
三级插入:① 粗对齐(隔板+导向肋)→ ② 定位销对齐(D 形键控区分 12V/50V)→ ③ HSIO 啮合。
关键:就位层级让插入/保持/冲击/振动载荷由定位销承担,而非高速连接器本体(满配插入力可近 45kg)。OEM 自由度:凸轮手柄/保持机构自设计,卡侧预留受保护空间。
六、管理与运维:CID 驱动的智能适配
MC(卡上管理控制器)经 CONN0 静态 USB2.0 与平台通信;CID(卡声明需求)× SCD(插槽能力),通电前比对,兼容才断言 OAC_PWR_EN 上电——即"即插即用"互操作核心。
状态机 O0–O7;功率制动(OAC_PWRBRK#) 紧急降功率维持供电完整。基于 DMTF/PLDM 标准,对齐 OCP GPU 管理/RAS/固件规范。
七、不只是技术:对 OEM / ODM 更灵活的生意模式
"我们指定卡,就这些。" —— Robert Hmouth
芯片厂商只定义并交付 OAC 卡;OEM/ODM 在底板上自由创新——想做 5 个就 5 个,想做 12 个就 12 个。对比传统 UBB OEM(巨大底板动辄数十万美元、利润堆叠),OAC 把经济账翻转为有利于 OEM/ODM。这正是"标准接口 + 差异化实现",与 PCIe CEM 成功路径一致。
八、OAC vs PCIe CEM vs OAM 一览
九、行业意义与展望
v0.7 仍是评审稿(1.0 待完成),但已释放四个信号:
① AI 加速器从 PCIe 扩展卡独立;
② 50V 成高功率主流;
③ 互连协议中立是开放生态关键;
④ 标准接口 + OEM 差异化的平衡。
方向已经很清楚:AI xPU 正在获得一张真正为自己设计的"卡"。

