折腾了两周 Hailuo 3 的 prompt,说说视频参考为什么老翻车
MiniMax 7 月 31 号发的 H3 (海螺 3.0 ),最大的卖点是全模态输入——文字、图片、视频、音频可以同时丢进去,用自然语言描述它们之间的关系。官方的例子是“参考视频 1 的镜头运动,让图片 2 里的角色唱歌,声音匹配音频 3”。
看到这个例子我第一反应就是拿来做风格迁移:丢一段参考视频进去,让它照着那个运镜和节奏拍新内容。折腾了两周,结论跟预期差挺多的,记录一下。
## 视频参考的翻车率比想象中高
先说说规格:H3 支持最多 12 个参考文件,9 图 + 3 视频 + 3 音频,最长输出 15 秒,2K 24fps ,原生立体声,API 走 v2 的 video_generation 接口,价格 $0.13/秒。
问题出在视频参考这一块。我遇到的失败模式大概是三类:
**一、参考被直接忽略。** 生成结果跟没给参考一样,完全按文字 prompt 走。这种最气人,因为你付了钱但等于没用参考。
**二、只迁移了表层特征。** 比如参考视频是慢推镜头 + 冷色调,结果只把冷色调抄过来了,运镜完全是另一回事。或者反过来,运镜对了但风格丢了。
**三、参考“污染”了内容。** 参考视频里的物体或人物莫名其妙出现在生成结果里,明明 prompt 里根本没提。
10 个里也有六七效果不行的,但看到视频号里那些博主做的视频效果真的太惊艳了,一次成片的效果吗?
试下来的感受是:**图片参考比视频参考稳得多**。给静帧 + 文字描述运镜,比给一段视频让它自己领会要可控。视频参考这个功能现在更像是 demo 阶段的能力,不适合放进需要稳定产出的流程里。
## 转向纯文本 prompt 之后
放弃视频参考之后我改成了纯文本路线,反而效果会好一些。这里分享一套我一直在调的 prompt 结构,参考了 fal 收集提示词合集。
这套东西用文字描述给 H3 效果还挺不错的,因为它要的动作幅度小,模型不容易崩。prompt 大概是这个结构:
```
[主体与构图] 具体到人物姿态、视线方向、画面占比、前中后景关系
[材质与光线] 皮肤/布料/金属的质感描述,主光源方向,环境光色温
[运动约束]
[镜头] 缓慢推近 / 极轻微横移,速度形容词要写死
[氛围元素] 光斑、尘埃、发丝飘动、布料微动,这些负责“呼吸感”
[负向] 避免大幅度动作、避免镜头快速切换、避免背景人物走动
```
```
15 seconds, 16:9 landscape. Blend live-action footage of a small kitchen at dusk with hand-drawn luminous animation. The last sunset light lingers at the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a lightly fogged glass bottle, and a hanging dish towel.
Shoot as if someone is filming one-handed on a phone: subtle hand tremor, hesitant close-focus pulls, backlit exposure breathing, and slightly coarse noise in the shadows. It should feel like an astonishing event captured in a rush at home, not a carefully dressed commercial.
Do not show giant eyes, split mouths, fangs, threatening behavior, lunges, sudden black frames, or jump scares. Use only room tone, cloth friction, a soft mug clink, faucet drips, the camera operator’s footsteps and quiet breathing, plus gentle electronic tones and tiny vocalizations from the drawn creatures.
```
关键是**运动约束那一段需要写清楚**。不写的话 H3 会自作主张给你加动作,人物开始转头、背景开始有人走过,静止系那个味道立刻就没了。
另外 H3 的原生音频在这个场景下挺好用的——环境音和光影节奏是同一次生成出来的,不用后期对轨。
## 成本
这个我没有细算,我昨天充了 100 块钱,做了 6-8 个视频吧,包括重试的。
按 $0.13/秒算,15 秒 2K 大概 $2 一条,比同分辨率的竞品便宜不少。但考虑到翻车重试,实际成本要按 2-3 倍估。
## 最后
我把这套流程做成了个站:[https://www.maxluo3.com](https://www.maxluo3.com)
主要是面向海外的,看能不能挣点钱贴补一下 api 费用呜呜呜
想问一下:有人成功让 H3 的视频参考稳定工作过吗?我怀疑是我 prompt 里描述参考关系的方式不对,但试了好几种写法都没明显改善。如果有踩通的求指点。
---
原文链接:[点击查看](https://www.v2ex.com/t/1232829)
看到这个例子我第一反应就是拿来做风格迁移:丢一段参考视频进去,让它照着那个运镜和节奏拍新内容。折腾了两周,结论跟预期差挺多的,记录一下。
## 视频参考的翻车率比想象中高
先说说规格:H3 支持最多 12 个参考文件,9 图 + 3 视频 + 3 音频,最长输出 15 秒,2K 24fps ,原生立体声,API 走 v2 的 video_generation 接口,价格 $0.13/秒。
问题出在视频参考这一块。我遇到的失败模式大概是三类:
**一、参考被直接忽略。** 生成结果跟没给参考一样,完全按文字 prompt 走。这种最气人,因为你付了钱但等于没用参考。
**二、只迁移了表层特征。** 比如参考视频是慢推镜头 + 冷色调,结果只把冷色调抄过来了,运镜完全是另一回事。或者反过来,运镜对了但风格丢了。
**三、参考“污染”了内容。** 参考视频里的物体或人物莫名其妙出现在生成结果里,明明 prompt 里根本没提。
10 个里也有六七效果不行的,但看到视频号里那些博主做的视频效果真的太惊艳了,一次成片的效果吗?
试下来的感受是:**图片参考比视频参考稳得多**。给静帧 + 文字描述运镜,比给一段视频让它自己领会要可控。视频参考这个功能现在更像是 demo 阶段的能力,不适合放进需要稳定产出的流程里。
## 转向纯文本 prompt 之后
放弃视频参考之后我改成了纯文本路线,反而效果会好一些。这里分享一套我一直在调的 prompt 结构,参考了 fal 收集提示词合集。
这套东西用文字描述给 H3 效果还挺不错的,因为它要的动作幅度小,模型不容易崩。prompt 大概是这个结构:
```
[主体与构图] 具体到人物姿态、视线方向、画面占比、前中后景关系
[材质与光线] 皮肤/布料/金属的质感描述,主光源方向,环境光色温
[运动约束]
[镜头] 缓慢推近 / 极轻微横移,速度形容词要写死
[氛围元素] 光斑、尘埃、发丝飘动、布料微动,这些负责“呼吸感”
[负向] 避免大幅度动作、避免镜头快速切换、避免背景人物走动
```
```
15 seconds, 16:9 landscape. Blend live-action footage of a small kitchen at dusk with hand-drawn luminous animation. The last sunset light lingers at the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a lightly fogged glass bottle, and a hanging dish towel.
Shoot as if someone is filming one-handed on a phone: subtle hand tremor, hesitant close-focus pulls, backlit exposure breathing, and slightly coarse noise in the shadows. It should feel like an astonishing event captured in a rush at home, not a carefully dressed commercial.
Do not show giant eyes, split mouths, fangs, threatening behavior, lunges, sudden black frames, or jump scares. Use only room tone, cloth friction, a soft mug clink, faucet drips, the camera operator’s footsteps and quiet breathing, plus gentle electronic tones and tiny vocalizations from the drawn creatures.
```
关键是**运动约束那一段需要写清楚**。不写的话 H3 会自作主张给你加动作,人物开始转头、背景开始有人走过,静止系那个味道立刻就没了。
另外 H3 的原生音频在这个场景下挺好用的——环境音和光影节奏是同一次生成出来的,不用后期对轨。
## 成本
这个我没有细算,我昨天充了 100 块钱,做了 6-8 个视频吧,包括重试的。
按 $0.13/秒算,15 秒 2K 大概 $2 一条,比同分辨率的竞品便宜不少。但考虑到翻车重试,实际成本要按 2-3 倍估。
## 最后
我把这套流程做成了个站:[https://www.maxluo3.com](https://www.maxluo3.com)
主要是面向海外的,看能不能挣点钱贴补一下 api 费用呜呜呜
想问一下:有人成功让 H3 的视频参考稳定工作过吗?我怀疑是我 prompt 里描述参考关系的方式不对,但试了好几种写法都没明显改善。如果有踩通的求指点。
---
原文链接:[点击查看](https://www.v2ex.com/t/1232829)
评论
暂无评论。