这些 API 工作流会通过你的 Comfy 账户在 MiniMax 的服务器上运行。如需在自有硬件上本地运行 H3 进行商业用途,你需要获取 MiniMax 商业许可证,该许可证可通过唯一官方经销商 Comfy 购买。
MiniMax H3 擅长什么
- 原生立体声音频:人声、音效和音乐与视频在单次前向传播中一起建模,而不是事后叠加
- 高分辨率输出:每个片段时长为 5-15 秒,分辨率最高可达 2K
- 文生视频:根据文本提示生成带音频的视频
- 首尾帧视频:生成首帧与可选尾帧图像之间的运动
- 参考条件生成:基于最多 9 张参考图像、3 个参考视频和 3 段参考音频生成视频
- MiniMax H3 Max:更快的变体,提供 480P/768P 输出、长提示词和可选的 2K 上采样阶段。H3 Max 下 Reference 节点最多接受 12 个参考文件
- MiniMax H3 Max Turbo:文生视频与首尾帧节点上最快的 H3 Max 选项,每秒费率约为 Max 的一半
示例输出
通过单个提示词进行文生视频生成,并带有原生立体声音频: 首尾帧生成,由模型创建两个帧之间的运动:MiniMax H3 API 工作流
模板库为 H3 基础模型随附三个 API 示例工作流,为 H3 Max 随附四个,为 H3 Max Turbo 随附两个:- 文生视频:根据文本提示词生成视频
- 首尾帧视频:在首帧和末帧图像之间生成视频
- 参考生成视频:根据参考图像、视频和音频生成视频
- H3 Max T2V / I2V / FLF2V / R2V:通过更快的 MiniMax H3 Max 模型运行相同的模式,每个工作流都内置了可选的提示词增强和 2K 上采样阶段
- H3 Max Turbo T2V / I2V:通过最快的 MiniMax H3 Max Turbo 模型运行文生视频与首尾帧视频,同样内置可选的提示词增强和 2K 上采样阶段
MiniMax H3 Max
这四个api_minimax_h3_max_* 模板通过相同的 API 节点在 MiniMax H3 Max 模型上运行:Text to Video 和 First-Last-Frame 节点在 ComfyUI 0.34.2 中加入了 H3 Max 选项,Reference to Video 节点则在 0.34.3 中加入。请将 ComfyUI 更新到至少 0.34.3 以运行全部模板。
H3 Max 以快于实时的速度生成,费率低于基础模型:480P 为 15.09 积分/秒,768P 为 24.14 积分/秒(见 Minimax 定价表)。每个 Max 模板在 Switch 节点后提供两个可选阶段,默认均为关闭:
- 提示词增强:生成前使用 MiniMax H3 Context IR 节点改写提示词。打开
Prompt Enhance布尔值即可启用 - 上采样至 2K:对首次生成的视频运行 MiniMax H3 Regenerate to 2K 节点。打开
Upscale to 2K布尔值即可启用
- 如需上采样请以 768P 生成:Regenerate to 2K 节点仅接受 768P 源视频
- 各节点时长保持一致:生成和提示词增强必须使用相同时长,否则各阶段会不同步。Regenerate to 2K 节点没有时长输入,它会以原始时长重新渲染提交的 768P 视频
- 额外输入需重复接线:这三个节点不会自动共享额外上下文。如果添加参考视频、音频或另一张图像,请将相同的线同时接入 Context IR 和 Regenerate 节点
MiniMax H3 文生视频
通过 MiniMax H3 API 从文本提示词生成视频,并输出原生立体声音频。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 T2V”
提示词技巧
- 提示词:在一个文本块中描述整个场景以及伴随的音频(对白、音效、音乐)
- 时长:时长输入支持 5-15 秒;该工作流自带一个快速的 5 秒预览
- 分辨率和比例:API 以 2K 分辨率渲染;选择宽高比预设,例如
16:9、9:16或1:1 - 水印:AIGC 水印默认关闭;如有需要,可在节点的高级设置中启用
提示词编写指南
MiniMax 发布了一份官方的视频提示词编写指南,适用于 T2VA、I2VA、FL2VA 和 L2VA 基础生成模式。该指南解释了如何将提示词组织成按时序排列的镜头,并配合相机运动和音频(对白、音效、音乐),同时为每种模式提供了示例。MiniMax H3 Max:文生视频
在更快的 H3 Max 模型上根据文本提示词生成视频。该模板默认以 768P 渲染,带有可选的提示词增强和 2K 上采样阶段。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Max: Text to Video”
MiniMax H3 Max Turbo:文生视频
在最快的 H3 Max Turbo 模型上根据文本提示生成视频。模板默认以 768P 和 1:1 渲染,带有与 Max 模板相同的可选提示词增强和 2K 上采样阶段。需要 ComfyUI 0.34.4 或更高版本。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Turbo: Text to Video”
MiniMax H3 首尾帧视频
通过 MiniMax H3 API 在首帧图像和可选末帧图像之间生成视频。输出的宽高比与输入图像保持一致。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 FLF2V”
首帧:angel-warrior-demon-battle-start.png
工作流的首帧图像,或使用您自己的图像。
末帧:angel-warrior-demon-battle-end.png
工作流的末帧图像,或使用您自己的图像。
提示技巧
- 帧:
first_frame输入为必填;last_frame为可选。模型会生成两者之间的运动 - 宽高比:输出跟随输入图像,因此请保持两帧的宽高比一致
- 图像约束:每帧的宽度和高度必须在 256 到 5760 像素之间,宽高比在 2:5 到 5:2 之间
- 提示词:描述两帧之间的过渡,以及您想要的音频(对白、音效、音乐)
提示词编写指南
MiniMax 为基础生成模式(T2VA、I2VA、FL2VA 和 L2VA)发布了官方的视频提示词编写指南。该指南解释了如何将提示词组织为带时间轴的镜头,包含相机运镜和音频(对白、音效、音乐),并为每种模式提供了示例。MiniMax H3 Max:图生视频
在更快的 H3 Max 模型上让静态图像动起来。该模板将首帧输入 First-Last-Frame 节点(末帧保持可选),并带有可选的提示词增强和 2K 上采样阶段。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Max: Image to Video”
输入图像:sneaker_black.png
工作流的输入图像,也可以使用你自己的图像。
MiniMax H3 Max Turbo:图生视频
在最快的 H3 Max Turbo 模型上让静态图像动起来。模板将首帧输入首尾帧节点,并带有可选的提示词增强和 2K 上采样阶段。需要 ComfyUI 0.34.4 或更高版本。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Max Turbo: Image to Video”
MiniMax H3 参考转视频
通过 MiniMax H3 API,以参考图像、视频和音频作为条件生成视频。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 R2V”
参考图像:9panel_storyboard_golden_hour_clay_court.png
该工作流的分镜参考图,也可以使用你自己的图像。
提示词技巧
- 按标签引用:在提示词中按顺序引用每个输入,例如
Image 1、Video 1或Audio 1。 - 限制:最多 9 张参考图像、3 个参考视频和 3 段参考音频。每个视频或音频片段必须为 2–15 秒;参考视频与参考音频的总时长上限均为 15 秒。
- 音频需要视觉锚点:如果没有至少一个参考图像或参考视频,就无法使用参考音频。
- 视频要求:参考视频的帧率必须为 23.976–60 FPS。
- 提示词:为每个参考内容分配一个任务(身份、风格、动作、声音),并描述目标镜头;明确的分配通常效果要好得多。
提示词编写指南
MiniMax 为参考驱动生成(R2V)发布了一份官方的 全参考模式提示词编写指南。该指南涵盖改写输出的结构,包括主体定义、参考标签和保留度分析,以及如何为每个参考内容在目标镜头中分配角色。MiniMax H3 Max:首尾帧视频
在更快的 H3 Max 模型上在首帧和末帧图像之间生成视频,带有可选的提示词增强和 2K 上采样阶段。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Max: FLF2V”
首帧:dream_face_first.png
工作流的首帧图像,或使用您自己的图像。
末帧:dream_face_last.png
工作流的末帧图像,或使用您自己的图像。
MiniMax H3 Max:参考转视频
在更快的 H3 Max 模型上以参考媒体为条件生成视频。H3 Max 下 Reference 节点最多接受 12 个参考文件,并提供reference_detail 选项,可权衡参考图像分辨率与成本。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 Max: Reference to Video”
参考图像:burdened_warrior_in_dreamscape.png
该工作流的参考图像,也可以使用你自己的图像。