国内 GLM5.2 用 H200 机器可以部署标准版本吗?

发布于

EastHorse: 领导告我说,使用 H200,每个模组 4 块 GPU 卡,2 个模组的话就是 8 块卡,模组与模组之间用 PCIe 连接,没思路啊。为啥不用 NVLink 直接连 8 块卡啊?求指教。

---

原文链接:[点击查看](https://www.v2ex.com/t/1227751)

评论(9)

因为现在国内 HGX 模组买不到啊,只能买走 PCIe 的。不过用 FP8 精度应该能跑起来。

· 0 个赞

H200 绝对跑不了完整体,显存不够用。完整的模型起码得上两个 8 卡节点。

· 0 个赞

想跑满血版的话,起码得两台 8 卡机器(一共 16 张卡)起步吧。

· 0 个赞

同好奇,既然都上 8 卡了,为啥不直接 NVLink 走起?

· 0 个赞

回复

因为你们采购的估计是单张的 GPU,硬件接口上只能走 PCIe。想用 NVLink 的话,必须得买那种把 8 张卡集成在一张主板上的 HGX 模组才行。

· 0 个赞

H200 单卡 141GB 显存,内存带宽 4T 多,其实跑模型性能是完全够了的。如果只是 8 张卡直连 PCIe 总线走流水线并行(Pipeline Parallelism),然后跑个 8bit 量化版的 GLM5.2,能保留原版 98% 的智能水平,日常 20 多个并发绝对扛得住。

· 0 个赞

用 FP8 精度应该没啥大问题。

· 0 个赞

用 PCIE 卡啊,现在 HGX 模组进不来。FP8 应该可以用的

· 0 个赞

H200 可能无法部署完整的版本,因为显存不够,完整的加载至少需要2个8卡节点

· 0 个赞