献丑AI 上线 MiniMax H3:原生多模态视频模型,文图音视频统一创作

献丑AI 正式接入 MiniMax H3。这是一款开放通用的多模态视频模型,可统一理解文本、图片、视频与音频,支持文生视频、首尾帧图生视频与全能参考生成,覆盖品牌大片、短剧、电商与 UI 动效等商用创作场景。

献丑AI RSS
献丑AI 上线 MiniMax H3:原生多模态视频模型,文图音视频统一创作封面图

献丑AI 正式接入 MiniMax H3。这是一款开放通用的多模态视频模型:不只「把文字变成会动的画面」,而是能统一理解文本、图片、视频和音频,把参考主体、镜头感觉、氛围与叙事意图放进同一次生成里。

一句话总结:MiniMax H3 把文、图、音、视频放进同一套创作上下文,让品牌大片、短剧、电商和 UI 动效都能在献丑画布里直接试。


🎬 MiniMax H3 是什么?

根据 MiniMax 视频生成文档MiniMax H3(模型名 MiniMax-H3)是开放通用的多模态视频模型,可以统一理解文本、图片、视频和音频输入,完成视频生成、参考创作与视频编辑。

对创作者来说,这意味着三条常见路径都被同一模型覆盖:

  • 文生视频:只有 Prompt,从零生成镜头
  • 首帧 / 尾帧图生视频:用图片锁定开始或结束画面,再让画面自然过渡
  • 全能参考生成:用参考图(以及官方支持的参考视频、参考音频)约束角色、动作、风格或节奏

输出规格上,H3 支持 768p / 2K、约 4~15 秒(整数秒)以及多种常见宽高比。献丑画布侧当前提供的参数见下文「参数规格」。

更多官方示例与场景片,见 H3 亮点功能示例


✨ 三大能力:为什么 H3 值得接到画布里?

官方把 H3 的能力概括为三块,也正好对应真实创作里最难的三件事:理解复杂素材、听懂精细指令、覆盖商用场景

1. 原生多模态理解与生成

H3 不是「只能吃一张首帧」的模型。它可以把人物、动作、声音、情绪、镜头、风格与表达意图放在一起理解,再融合成片。适合已经有角色设定、产品图、分镜或氛围参考,希望一次生成就「长得像、动得对」的项目。

2. 多模态精准编辑与控制

对人物、物体、场景、声音与节奏做多维度约束时,H3 更强调指令遵循:你可以在提示词里明确「人物资产参考图 2、包袋参考图 3、ending logo 参考图 4」,而不是把一切赌在一句模糊描述上。

3. 商用级多场景内容生成

官方亮点覆盖影视与品牌大片、视觉创意包装、竖屏短剧、电商广告、UI/UX 动效、游戏与风格化动画等。对献丑用户而言,这意味着同一个模型可以在画布里服务不同节点、不同交付物,而不是每换一个题材就换一套工具链。


🧩 献丑AI 已支持哪些玩法?

这次 MiniMax H3 已进入献丑画布的视频生成路径,覆盖从零创作到素材驱动的常见工作流。

文生视频:一句话生成镜头

适合没有现成素材、先用文字找感觉的阶段。可在描述后补充运镜指令,引导镜头调度。

示例提示词: 「镜头拍摄一位女性坐在咖啡馆里,抬头看向窗外,镜头缓缓移到窗外街道;暖色调,氛围轻松惬意,轻微推轨。」

首帧 / 尾帧图生视频:让指定画面动起来

上传首帧、尾帧,或同时提供两张,再配合文字描述生成过渡。适合产品图动效、人物亮相、成长/变装类叙事,以及「静态分镜补成动态镜头」。

示例提示词: 「A little girl grows up.」(配首帧与尾帧人物图)

全能参考生成:锁定角色、产品与风格

当你已有明确人物、包袋、Logo、场景或画风参考时,用参考生视频把静态资产延展成动态镜头。官方全能参考还可组合参考视频与参考音频;献丑画布里具体开放的素材入口,以实际上线控件为准

示例提示词要点: 说明比例与时长 → 指定每张参考图的用途(人物 / 产品 / logo / 氛围)→ 写清故事节拍与气质(高级、冷感、剪辑节奏等)。


⚙️ 参数规格

献丑AI 当前提供的 MiniMax H3 参数(与官方规格对齐,以画布面板为准):

项目支持范围
分辨率768p / 2K
时长5~15 秒(整数秒)
文生常用比例21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16
生成方式文生视频、首帧/尾帧图生视频、参考生视频

输入侧(官方条件摘要,便于准备素材):

  • 首/尾帧:图片 0~2 张;图生时宽高比通常由输入图决定
  • 全能参考:图片最多 9 张;视频最多 3 段、单段 2~15 秒且总时长 ≤ 15 秒;音频需配合图片或视频,不能单独作为唯一输入
  • 提示词建议控制在官方上限以内(不超过 7000 字符)

注:官方文档还描述原生立体声音频、H3-Context-IR 增强提示词、768p 再生成 2K 等能力。献丑侧以画布已开放功能为准,本文不展开 API 细节。


🎥 典型场景怎么写提示词?

下面场景改编自 官方亮点示例,重点是怎么组织提示词,而不是照抄整段长文。

1. 品牌大片 / 时尚

适合广告与品牌团队。提示词里分开写:氛围参考、人物参考、产品参考、logo 参考,再写 1~2 个故事节拍(走近车尾、取出包袋、对视、离开),并点明气质(高级、冷感、克制)与剪辑节奏。

2. AI 短剧预告(竖屏)

适合短剧与 Reel 创作者。固定 9:16,用参考图锁男女主与场景,故事写成「误入禁区 → 唤醒 → 危险吸引力」这类关系张力,镜头以中近景和特写为主,突出眼神与对峙。

3. 电商 / 产品广告

适合电商与投流素材。用极简棚拍或白底约束环境,分别提供模特参考、面部细节、产品设计图,要求保持秀场气质与产品轮廓(材质、反光、结构)一致。

4. UI / UX 动效演示

适合产品与设计团队。说明这是落地页滚动演示,指明产品主视觉参考图,写清字体气质、背景动态、悬停放大/反色等交互反馈,让模型按「界面在动」而不是「拍真人」来理解。

5. 国风 / 风格化动画

适合 IP 与二次元内容。一张图锁人物服饰细节,另一张(或文字)锁分镜与节奏;约定远景多用背影/空镜、近景才露脸,避免全片脸部漂移。


🚀 在献丑画布里怎么用?

  1. 打开 献丑AI,进入画布工作流
  2. 新建 文生视频 / 首帧生视频 / 首尾帧生视频 / 参考生视频 节点(按你的素材情况选择)
  3. 在模型选择器中选择 MiniMax H3
  4. 选择分辨率(768p 或 2K)、比例与时长,输入提示词;如有素材则连接图片节点
  5. 点击生成,等待成片,再在画布里继续剪辑、放大或接到下一镜头

MiniMax H3 已经上线,今天就可以在画布里试第一条镜头。


🙏 写在最后

视频模型正在从「会动的图」走向「能理解复杂上下文的视听创作系统」。MiniMax H3 的价值,在于把多模态参考和商用场景写进同一套生成逻辑里;献丑AI 要做的,是把它接到你每天真正会用的画布工作流中。

更多官方说明见 视频生成H3 亮点功能示例。若你关注发布动态,也可参阅 MiniMax 公告

好模型不该只停在文档页——它应该出现在你的下一条成片里。

Frequently Asked Questions

MiniMax H3 是什么?

MiniMax H3 是开放通用的多模态视频模型,可统一理解文本、图片、视频和音频输入,完成视频生成、参考创作与视频编辑。

献丑AI 里可以用哪些 H3 玩法?

当前可走文生视频、首帧/尾帧图生视频,以及以参考图为主的全能参考生成。官方还支持参考视频与参考音频,画布入口以实际上线为准。

H3 更适合什么内容?

适合品牌与时尚大片、竖屏短剧预告、电商产品广告、UI/UX 动效演示,以及国风或风格化动画等内容。

Related Articles

追踪主流 AI 视频模型的能力边界、参数变化、成本结构与真实创作表现。