模型实验记录 · MAGI-2

Sand.ai MAGI-2 多卡部署:为什么加到 8 卡没有更快?

我们在 MAGI-2 Preview 上做过 4 卡与 8 卡的部署和速度实验。关键发现是:更多显卡并不会自动消除权重搬运与主机内存瓶颈。这里把实际测量与推算分开说明。

黄果制片编辑组 · 发布 · 实验

Read in English on Porncut

先分清官方运行方式与本次实验

这份记录对应 2026 年 8 月 13 日的实验。官方 MAGI-2 Preview 仓库提供音视频生成代码;本次消费级 RTX 5090 多卡路径包含实验性适配,不能把它当作官方开箱即用的 5090 安装方案。

本轮速度实验主要使用较低分辨率和 16 步;它不等价于当时官方配置的 100 步 preview 加 5 步 refiner,也不代表 1080p 最终成片性能。

激活参数少,不代表全部权重都能放进显存

本地文件账本记录 preview 权重约 212.442 GiB。模型每次仅使用部分专家,并不意味着其他专家权重可以从系统中消失;它们仍需要驻留,或在需要时搬运。

本次 EP4 即四路专家并行,每卡本地权重约 60.487 GiB,超出 32GB 显卡容量,因此必须借助 CPU offload。这个账本来自测试版本的切分方式,不是所有实现都固定如此。

观察到的瓶颈包括 CPU 权重卸载、PCIe/NUMA 数据传输和首次编译。仅查看 GPU 利用率或已分配显存不足以解释等待时间。

单路 EP4 的已测耗时

以下为 10 秒媒体、16 步的本轮总耗时记录。热运行保留进程和相应缓存;不同分辨率不是同质量对照。

单路 EP4 的已测耗时
输入 / 状态分辨率总耗时
文生视频 / 冷启动640×480611.914 秒
文生视频 / 热运行640×480423.580 秒
图生视频 / 冷启动640×480618.426 秒
文生视频 / 热运行448×25691.852 秒
文生/图生 / 热运行256×14429.9–46.7 秒

两种加卡方式,两个不同的问题

八张卡拆成两路 EP4,可以同时运行两份模型,但本次主机的内存和传输压力明显增加,无法保留与单路优化配置相同的卸载条件。报告对热态吞吐的推算没有显示优势;这不是所有 8 卡机器都会更慢的定律。

单模型 EP8 则遇到了测试实现中的填充:12 路结构需要按 16 路布置,增加了冗余工作。本轮观测也没有证明 EP8 加速,但冷启动、编码时间与配置差异使其不能作为纯粹的卡数因果比较。

部署前更应该记录什么

如果希望复现官方支持的环境,从下方官方仓库开始,固定代码和容器版本。本文没有发布内部多卡适配补丁,因此不能承诺照抄官方命令就复现上述 5090 数字。

  1. 把主机 RAM、显卡容量与 GPU 互联拓扑一起列入资源预算。
  2. 先跑一条最小有效输入,再用相同进程、相同 shape 重复请求,分开记录冷启动和热态。
  3. 分别记录编码、采样、解码和文件写入时间。
  4. 比较单请求延迟与单位时间完成量,不把同时开始两条等同于吞吐翻倍。
  5. 固定输出长度、步数与质量检查,再讨论并行配置是否划算。

这份结果适合回答的问题

这些数据可以解释“为什么模型载入了,却仍然很慢”,以及“为什么加卡后效果不如预期”。它们不能证明完整质量下的速度、其他 GPU 的性能或新版本的行为。

我们公开的是测量表与方法说明,未公开服务器信息、私有配置、原始输入和内部补丁。没有依据把这次吞吐实验写成内容能力或“完全无限制”的证明。

官方资料

以下资料用于核对模型与官方运行方式;本文测量来自上述日期的内部实验,不代表厂商性能承诺。