MiniMax H3 Video VAE预清理实测封面
MiniMax H3 Video VAE预清理实测封面

这次解决什么问题#

我最近在用 MiniMax H3,把一所普通校园逐步变成修真世界。这既是短片试做,也是一次真实的 H3 图生视频测试。

本地测试时,文本编码和视频采样都能正常完成,但工作流进入 Video VAE 解码后会长时间没有结果。最容易误判的地方是:界面看上去像彻底卡死,但程序未必停止,它可能正在显存、物理内存和虚拟内存之间低效搬运模型。

这篇文章只回答一个问题:采样已经结束,为什么 Video VAE 仍然出不来,以及怎样验证是否与资源释放顺序有关。

测试环境与方法#

项目本次设置
系统Windows
显卡RTX 4090 24GB
系统内存32GB
模型MiniMax H3
显存策略Dynamic VRAM
本地快速测试0.2MP,先用5步验证动作和稳定性
后续复测0.2MP与0.4MP,20步

我的习惯是先在本地用低分辨率快速验证提示词、动作和画面稳定性。低清逻辑通过后,再把同一套关键帧和提示词交给更高规格的工作流,避免一开始就在云端反复消耗时间和费用。

为什么我没有先怪提示词#

我先做了分阶段计时,并依次检查提示词、Seed、采样步数、首帧、分辨率、显存、物理内存,以及采样、Audio VAE和Video VAE的分段耗时。

结果显示,采样已经结束,Video VAE也进入加载流程,但前面使用过的 H3 主模型和文本编码相关资源没有及时让出空间。Video VAE只能在有限的工作空间中继续加载和交换数据。

因此,本次问题的重点不是“模型完全不能运行”,而是资源交换效率已经低到无法接受

预清理节点怎样连接#

TEXT
H3采样器
  ├─ Audio VAE Decode ──> audio_done
  └─ samples ────────────> H3 Pre Video VAE Cleanup
                                └─ samples ──> Video VAE Decode

关键不是节点摆放位置,而是真实连线。清理节点会在 Audio VAE 完成后卸载已经加载的模型、清理缓存,再原样传递 latent。它不会改动提示词、Seed、采样器、步数、latent 数据或 VAE 参数。

修改前后的结果#

条件修改前加入预清理后
0.2MP,Video VAE超过276秒仍未完成20步约5.8秒
0.2MP,完整工作流无法稳定完成本轮20步约64.7秒
0.4MP,Video VAE未形成可接受结果20步约12.3秒
0.4MP,完整工作流未形成可接受结果20步约143.5秒

随后我又重复测试了单图和首尾帧工作流,在本次环境中都能正常完成。

这个方法不能解决什么#

  • 模型文件损坏或缺失。
  • ComfyUI核心版本与自定义节点不兼容。
  • 首帧、参考音频或张量长度不一致。
  • 显卡驱动、PyTorch或CUDA环境异常。
  • 工作流本身接错输入或缺少节点。
  • 显存和系统内存本身无法满足当前分辨率与模型精度。

双参考声音是另一个独立问题#

部分旧版 ComfyUI 会在合并关键帧和纯音频参考时覆盖关键帧 latent,导致采样器出现张量长度不一致。这与 Video VAE 卡顿不是同一问题。

因此我把两个问题拆成了不同的包:

  1. MiniMax_H3_Video_VAE预清理节点_20260826
  2. MiniMax_H3_首帧双参考声音_实验版_20260826

双参考声音包明确标记为实验版。完整 model_base.py 只适用于匹配的旧版基础;已经包含官方修复的新版不要覆盖核心文件。实验包已经完成网盘领取验证并开放下载,但“可以下载”不代表“适配所有版本”,使用前仍须阅读资源页的检查、备份和回滚说明。

资源领取#

如果你也遇到类似问题#

请至少记录显卡与内存、ComfyUI版本、模型精度、启动参数、分辨率、步数、Seed,以及采样、Audio VAE、清理节点和Video VAE的分段耗时。只有把“卡在哪里”记录清楚,才能避免把多个不同问题混成一句“工作流跑不过去”。