模型实验记录 · H3

RTX 5090 能跑 H3 吗?32GB 显存与生成耗时实测

能,但需要限定模型版本和输入规模。我们的单卡 RTX 5090 在 352×640 下完成了约 15 秒的视频生成,显存已接近上限。下面公开这次实验的设置、测量与排错顺序。

黄果制片编辑组 · 发布 · 实验

Read in English on Porncut

这次到底测了什么

实验日期为 2026 年 8 月 11 日。运行的是经过裁剪的 INT8 ConvRot H3 Ref2VA 版本,不是官方 BF16 权重的原样部署;不要把这份结果套用到不同量化包或不同任务。

参考视频取 3.5 秒并下采样到 352×640、24 fps。最终输出同分辨率、362 帧,约 15.083 秒,使用 12 步、res_multistep 采样器与 beta 调度。

运行环境为 32GB RTX 5090、PyTorch 2.7.1+cu128、CUDA 12.8 和 ComfyUI 0.31.0。环境是当时的测试记录,不是要求读者降级到这些版本。

短任务能跑,不代表长任务有足够余量

表中的客户端耗时包含本轮请求的等待与处理;服务端执行时间单列。两项预检查只用于验证流水线与长度,不能据其少量步数评价画质。

短任务能跑,不代表长任务有足够余量
任务输出长度 / 步数服务端 / 客户端峰值显存
短任务检查2.333 秒 / 2 步115.14 / 116.37 秒31,098 MiB
长度检查15.083 秒 / 1 步113.07 / 114.47 秒29,994 MiB
最终运行15.083 秒 / 12 步258.45 / 260.57 秒31,658 MiB

为什么需要在阶段之间卸载模型

这条链路除了视频生成模型,还会加载文本编码器和音视频 VAE。单看一个权重文件的大小,无法判断完整流程是否会爆显存。

本次运行需要让 ComfyUI 在阶段之间释放模型。使用的启动选项为 --reserve-vram 1.0 和 --disable-smart-memory;它们是这次环境下的处理方式,不保证适用于所有新版节点。

最终峰值离显卡容量很近。提高分辨率、延长参考片或增加参考输入都可能越界;不要在这次结果上推导“32GB 可稳定跑任意 768p 视频”。

复现时先验证哪几步

先确认权重格式和节点支持一致,再验证短任务;把模型加载、采样、解码的耗时分开记录,比只看进度条更容易定位瓶颈。

  1. 记录显卡容量、运行库版本、权重版本、输入尺寸、参考长度与步数。
  2. 使用有权处理的中性参考素材,先跑低分辨率、低步数短片,确认文件可完整解码。
  3. 保持分辨率不变,先增加输出长度,再增加步数,每次只改变一个主要变量。
  4. 发生 OOM 时检查是否仍驻留编码器或 VAE,再缩小输入;不要靠反复重试同一超限任务判断稳定性。
  5. 保存峰值显存和完整输出耗时,并把首次运行与后续热运行分开。

完成生成与画质通过是两件事

当时的抽帧检查记录显示,服装、头发和背景总体稳定,但较长输出主要重复小幅手部动作与机位变化,不能证明复杂动作叙事能稳定延长。人物面部被遮挡,因此这次也无法验证脸部身份保持。

最终运行约比视频播放时长慢 17.3 倍,属于这组设置下的结果。它不是模型横评,也不是新版运行库的最佳速度。本文不附原始参考素材,画面判断来自当时记录,读者无法仅凭本文独立复核视觉质量。

官方资料

以下资料用于核对模型与官方运行方式;本文测量来自上述日期的内部实验,不代表厂商性能承诺。