Notebookcheck Logo

ComfyUI 搭配 MiniMax H3:在免费版本中,它是否优于 Kling AI、Seedance 及其他视频生成器?

ⓘ AI-generated, MiniMax H3
与ChatGPT等典型的大语言模型(LLM)相比,免费使用AI视频生成器要困难得多,因为大多数服务商对免费配额都很吝啬。要让它们生成完全符合你期望的内容——同时保持良好且一致的视觉效果——就更加困难了。因此,我决定测试另一种方案:部署本地模型,例如MiniMax H3。
AI

与ChatGPT等典型的LLM相比,免费使用AI视频生成器要困难得多,因为大多数提供商对免费配额都十分吝啬。要让它们生成完全符合你期望的内容——同时保持良好且一致的视觉效果——则更加困难。因此,我决定测试另一种方案:部署本地模型,例如MiniMax H3。

我儿子想用AI生成一段关于光剑的、自己搭建乐高积木的视频。他目前对这个主题着迷。但因为我不愿为了他的实验而立即花大钱订阅昂贵的视频AI服务,他起初尝试免费使用Kling AI及类似服务。

大多数AI视频生成器都会通过提供免费初始配额来吸引你注册账号。但其中的陷阱很快就会显现:如果你想持续每天生成超过一两段三秒钟的视频,很快就会被推向昂贵的订阅服务。

即便从视觉效果来看,此前生成的视频也并不特别令人满意。此外,要保持环境、物体和角色的连贯性通常也很困难。这个失望的孩子促使我尝试了一套本地解决方案。

本地模型和解决方案自然需要强大的硬件支持。 我们正在一台搭载 RTX 5090 和 24 GB VRAM 的 Razer Blade 16(2025)上进行测试。一般而言,只有当 VRAM 达到 8 GB 时,视频生成才会变得相当有趣,而在这种情况下,VRAM 越大,效果确实越好。

该模型提供了多种接口——我们选择了 MiniMax H3。它可以在 Ollama 中运行,例如,也可以在 Pinokio 或 Stability Matrix 中运行。后者还包含 ComfyUI,这是一个用于 AI 工作流的图形界面,不仅限于视频生成。 不过,我在使用该组合时遇到了问题,因此我选择了独立版的 ComfyUI(ComfyUI.org),该软件可作为应用程序下载,支持 Windows 及其他平台。

Comfy Desktop
ⓘ Screenshot
Comfy Desktop

对于初学者来说,ComfyUI 需要一段时间才能适应,但它为视频生成开辟了广阔的可能性。您可以通过单个节点构建工作流,这本质上是一个由多个工具/节点组成的模块化工具包。每个节点都有一个输入和一个输出,并且可以与其他节点连接。

每个节点代表流程中的一个工具或一个步骤,并具有一个输入和一个输出
ⓘ AI-generated, ChatGPT
每个节点代表流程中的一个工具或一个步骤,并具有一个输入和一个输出

所有工具均被划分为独立的节点。例如,有一个用于文本提示的节点,多个图像节点(可作为视频生成前的参考或中间步骤),以及其他工具。 理论上,您可以为每个节点加载独立的AI模型——例如,文本提示采用大语言模型(LLM),图像节点采用图像生成模型,以此类推。这些AI模型自然会占用大量存储空间。最终,所有节点的数据都会汇入视频生成节点,从而产出最终结果。

起初,我们尝试了“文本转视频”预设,但很快便转向了“参考图转视频”模式。

最简单的情况,即文本转视频:一个用于选择分辨率的节点,随后是包含视频AI的主节点,最后是视频输出节点,其中包括格式
ⓘ Screenshot Comfy Desktop Screenshot
最简单的情况,即文本转视频:一个用于选择分辨率的节点,随后是包含视频AI的主节点,最后是视频输出节点,其中包括格式

这之所以特别有用,是因为它还能确保环境、物体和人物的一致性。例如,在我们的第一段视频中,我们创建了一艘由积木搭建的战列舰,在画面中飞驰而过。 在480p分辨率下,生成该场景大约需要5.5分钟,而借助合适的硬件,还可以实现更高的分辨率。然而,在即将出现的某个场景中,我们希望再次使用完全相同的战列舰。 于是,我们截取了这艘飞船的前后视图,导入图像后,将其作为名为“Ship_front”和“Ship_rear”的参考素材链接到主节点,并指示AI在另一个场景中使用这艘完全相同的飞船。否则,AI就会生成一种全新的外观。

我们的SHIP-001参考图片,展示的是用乐高积木搭建的船只,截图来自我们的首支视频
我们的SHIP-001参考图片,展示的是用乐高积木搭建的船只,截图来自我们的首支视频
为以防万一,还请附上一张SHIP-001_rear参考图,展示后视图
为以防万一,还请附上一张SHIP-001_rear参考图,展示后视图
我们的反派
我们的反派
舰桥
舰桥

经过一段时间熟悉系统,并在“YouTube教授”的帮助下,我们很快为视频场景搭建了首个工作流程,并生成了令我们俩都非常满意的视频。一个大型语言模型(此处指ChatGPT)帮助我们针对MiniMax H3量身定制了文本提示,使其精准且详尽。

我的工作流程:在ChatGPT中,我描述了脑海中设想的视觉效果,明确指出某些品牌名称不应出现(但视觉风格仍可受其启发),说明应具有电影般的质感,并指定了需要包含的参考素材(如Ship_front)。只有在完成这些步骤后,我才开始描述场景。 我将ChatGPT定制的提示语粘贴到ComfyUI的文本节点中,如有必要,再添加参考图片,至此便大功告成。

ChatGPT 根据我们提供的信息生成了此提示
ⓘ Screenshot ChatGPT
ChatGPT 根据我们提供的信息生成了此提示

您还可以让ChatGPT根据期望的风格和其他参数生成一个通用提示词,并将其保存以备后用。如果您再次将该提示词输入到大型语言模型(LLM)中,模型便会拥有所有必要的信息,您可以立即描述下一场景。

无论如何,相比Kling AI、Seedance及类似服务的免费版本,我和儿子对生成的结果都满意得多。丰富的选项也鼓励用户进行尝试,而且你终于可以摆脱烦人的积分限制、订阅提示、广告以及数据安全方面的担忧。不过,分辨率仍然是个问题。 全高清(Full HD)或更高分辨率甚至没有作为选项出现,这大概是因为硬件要求过高。未来的模型在这方面可能会变得更加高效。目前,你也可以通过升频工具来扩展你的工作流程。

任何拥有必要硬件且对电影生成感兴趣的人,都应该关注一下 ComfyUI 以及一款优质的本地 AI 模型。尤其是 ComfyUI,它能够实现极其复杂、分层的工作流程——当然,前提是你确实需要这些功能。不过,对于入门用户来说,基本功能已经一应俱全,而且可以快速掌握。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 08 > ComfyUI 搭配 MiniMax H3:在免费版本中,它是否优于 Kling AI、Seedance 及其他视频生成器?
Christian Hintze, 2026-08-26 (Update: 2026-08-26)