模型实验记录 · H3
RTX 5090 能跑 H3 吗?32GB 显存与生成耗时实测
能,但需要限定模型版本和输入规模。我们的单卡 RTX 5090 在 352×640 下完成了约 15 秒的视频生成,显存已接近上限。下面公开这次实验的设置、测量与排错顺序。
Read in English on Porncut这次到底测了什么
实验日期为 2026 年 8 月 11 日。运行的是经过裁剪的 INT8 ConvRot H3 Ref2VA 版本,不是官方 BF16 权重的原样部署;不要把这份结果套用到不同量化包或不同任务。
参考视频取 3.5 秒并下采样到 352×640、24 fps。最终输出同分辨率、362 帧,约 15.083 秒,使用 12 步、res_multistep 采样器与 beta 调度。
运行环境为 32GB RTX 5090、PyTorch 2.7.1+cu128、CUDA 12.8 和 ComfyUI 0.31.0。环境是当时的测试记录,不是要求读者降级到这些版本。
短任务能跑,不代表长任务有足够余量
表中的客户端耗时包含本轮请求的等待与处理;服务端执行时间单列。两项预检查只用于验证流水线与长度,不能据其少量步数评价画质。
| 任务 | 输出长度 / 步数 | 服务端 / 客户端 | 峰值显存 |
|---|---|---|---|
| 短任务检查 | 2.333 秒 / 2 步 | 115.14 / 116.37 秒 | 31,098 MiB |
| 长度检查 | 15.083 秒 / 1 步 | 113.07 / 114.47 秒 | 29,994 MiB |
| 最终运行 | 15.083 秒 / 12 步 | 258.45 / 260.57 秒 | 31,658 MiB |
为什么需要在阶段之间卸载模型
这条链路除了视频生成模型,还会加载文本编码器和音视频 VAE。单看一个权重文件的大小,无法判断完整流程是否会爆显存。
本次运行需要让 ComfyUI 在阶段之间释放模型。使用的启动选项为 --reserve-vram 1.0 和 --disable-smart-memory;它们是这次环境下的处理方式,不保证适用于所有新版节点。
最终峰值离显卡容量很近。提高分辨率、延长参考片或增加参考输入都可能越界;不要在这次结果上推导“32GB 可稳定跑任意 768p 视频”。
复现时先验证哪几步
先确认权重格式和节点支持一致,再验证短任务;把模型加载、采样、解码的耗时分开记录,比只看进度条更容易定位瓶颈。
- 记录显卡容量、运行库版本、权重版本、输入尺寸、参考长度与步数。
- 使用有权处理的中性参考素材,先跑低分辨率、低步数短片,确认文件可完整解码。
- 保持分辨率不变,先增加输出长度,再增加步数,每次只改变一个主要变量。
- 发生 OOM 时检查是否仍驻留编码器或 VAE,再缩小输入;不要靠反复重试同一超限任务判断稳定性。
- 保存峰值显存和完整输出耗时,并把首次运行与后续热运行分开。
完成生成与画质通过是两件事
当时的抽帧检查记录显示,服装、头发和背景总体稳定,但较长输出主要重复小幅手部动作与机位变化,不能证明复杂动作叙事能稳定延长。人物面部被遮挡,因此这次也无法验证脸部身份保持。
最终运行约比视频播放时长慢 17.3 倍,属于这组设置下的结果。它不是模型横评,也不是新版运行库的最佳速度。本文不附原始参考素材,画面判断来自当时记录,读者无法仅凭本文独立复核视觉质量。
官方资料
以下资料用于核对模型与官方运行方式;本文测量来自上述日期的内部实验,不代表厂商性能承诺。