模型实验记录 · MAGI-2
Sand.ai MAGI-2 多卡部署:为什么加到 8 卡没有更快?
我们在 MAGI-2 Preview 上做过 4 卡与 8 卡的部署和速度实验。关键发现是:更多显卡并不会自动消除权重搬运与主机内存瓶颈。这里把实际测量与推算分开说明。
Read in English on Porncut先分清官方运行方式与本次实验
这份记录对应 2026 年 8 月 13 日的实验。官方 MAGI-2 Preview 仓库提供音视频生成代码;本次消费级 RTX 5090 多卡路径包含实验性适配,不能把它当作官方开箱即用的 5090 安装方案。
本轮速度实验主要使用较低分辨率和 16 步;它不等价于当时官方配置的 100 步 preview 加 5 步 refiner,也不代表 1080p 最终成片性能。
激活参数少,不代表全部权重都能放进显存
本地文件账本记录 preview 权重约 212.442 GiB。模型每次仅使用部分专家,并不意味着其他专家权重可以从系统中消失;它们仍需要驻留,或在需要时搬运。
本次 EP4 即四路专家并行,每卡本地权重约 60.487 GiB,超出 32GB 显卡容量,因此必须借助 CPU offload。这个账本来自测试版本的切分方式,不是所有实现都固定如此。
观察到的瓶颈包括 CPU 权重卸载、PCIe/NUMA 数据传输和首次编译。仅查看 GPU 利用率或已分配显存不足以解释等待时间。
单路 EP4 的已测耗时
以下为 10 秒媒体、16 步的本轮总耗时记录。热运行保留进程和相应缓存;不同分辨率不是同质量对照。
| 输入 / 状态 | 分辨率 | 总耗时 |
|---|---|---|
| 文生视频 / 冷启动 | 640×480 | 611.914 秒 |
| 文生视频 / 热运行 | 640×480 | 423.580 秒 |
| 图生视频 / 冷启动 | 640×480 | 618.426 秒 |
| 文生视频 / 热运行 | 448×256 | 91.852 秒 |
| 文生/图生 / 热运行 | 256×144 | 29.9–46.7 秒 |
两种加卡方式,两个不同的问题
八张卡拆成两路 EP4,可以同时运行两份模型,但本次主机的内存和传输压力明显增加,无法保留与单路优化配置相同的卸载条件。报告对热态吞吐的推算没有显示优势;这不是所有 8 卡机器都会更慢的定律。
单模型 EP8 则遇到了测试实现中的填充:12 路结构需要按 16 路布置,增加了冗余工作。本轮观测也没有证明 EP8 加速,但冷启动、编码时间与配置差异使其不能作为纯粹的卡数因果比较。
部署前更应该记录什么
如果希望复现官方支持的环境,从下方官方仓库开始,固定代码和容器版本。本文没有发布内部多卡适配补丁,因此不能承诺照抄官方命令就复现上述 5090 数字。
- 把主机 RAM、显卡容量与 GPU 互联拓扑一起列入资源预算。
- 先跑一条最小有效输入,再用相同进程、相同 shape 重复请求,分开记录冷启动和热态。
- 分别记录编码、采样、解码和文件写入时间。
- 比较单请求延迟与单位时间完成量,不把同时开始两条等同于吞吐翻倍。
- 固定输出长度、步数与质量检查,再讨论并行配置是否划算。
这份结果适合回答的问题
这些数据可以解释“为什么模型载入了,却仍然很慢”,以及“为什么加卡后效果不如预期”。它们不能证明完整质量下的速度、其他 GPU 的性能或新版本的行为。
我们公开的是测量表与方法说明,未公开服务器信息、私有配置、原始输入和内部补丁。没有依据把这次吞吐实验写成内容能力或“完全无限制”的证明。
官方资料
以下资料用于核对模型与官方运行方式;本文测量来自上述日期的内部实验,不代表厂商性能承诺。