MiniMax 7 月 31 号发的 H3 (海螺 3.0 ),最大的卖点是全模态输入——文字、图片、视频、音频可以同时丢进去,用自然语言描述它们之间的关系。官方的例子是"参考视频 1 的镜头运动,让图片 2 里的角色唱歌,声音匹配音频 3"。
看到这个例子我第一反应就是拿来做风格迁移:丢一段参考视频进去,让它照着那个运镜和节奏拍新内容。折腾了两周,结论跟预期差挺多的,记录一下。
视频参考的翻车率比想象中高
先说说规格:H3 支持最多 12 个参考文件,9 图 + 3 视频 + 3 音频,最长输出 15 秒,2K 24fps ,原生立体声,API 走 v2 的 video_generation 接口,价格 $0.13/秒。
问题出在视频参考这一块。我遇到的失败模式大概是三类:
一、参考被直接忽略。 生成结果跟没给参考一样,完全按文字 prompt 走。这种最气人,因为你付了钱但等于没用参考。
二、只迁移了表层特征。 比如参考视频是慢推镜头 + 冷色调,结果只把冷色调抄过来了,运镜完全是另一回事。或者反过来,运镜对了但风格丢了。
三、参考"污染"了内容。 参考视频里的物体或人物莫名其妙出现在生成结果里,明明 prompt 里根本没提。
10 个里也有六七效果不行的,但看到视频号里那些博主做的视频效果真的太惊艳了,一次成片的效果吗?
试下来的感受是:图片参考比视频参考稳得多。给静帧 + 文字描述运镜,比给一段视频让它自己领会要可控。视频参考这个功能现在更像是 demo 阶段的能力,不适合放进需要稳定产出的流程里。
转向纯文本 prompt 之后
放弃视频参考之后我改成了纯文本路线,反而效果会好一些。这里分享一套我一直在调的 prompt 结构,参考了 fal 收集提示词合集。
这套东西用文字描述给 H3 效果还挺不错的,因为它要的动作幅度小,模型不容易崩。prompt 大概是这个结构:
[主体与构图] 具体到人物姿态、视线方向、画面占比、前中后景关系
[材质与光线] 皮肤/布料/金属的质感描述,主光源方向,环境光色温
[运动约束]
[镜头] 缓慢推近 / 极轻微横移,速度形容词要写死
[氛围元素] 光斑、尘埃、发丝飘动、布料微动,这些负责"呼吸感"
[负向] 避免大幅度动作、避免镜头快速切换、避免背景人物走动
15 seconds, 16:9 landscape. Blend live-action footage of a small kitchen at dusk with hand-drawn luminous animation. The last sunset light lingers at the window. The lived-in kitchen contains an old wooden table, a half-washed mug, a lightly fogged glass bottle, and a hanging dish towel.
Shoot as if someone is filming one-handed on a phone: subtle hand tremor, hesitant close-focus pulls, backlit exposure breathing, and slightly coarse noise in the shadows. It should feel like an astonishing event captured in a rush at home, not a carefully dressed commercial.
Do not show giant eyes, split mouths, fangs, threatening behavior, lunges, sudden black frames, or jump scares. Use only room tone, cloth friction, a soft mug clink, faucet drips, the camera operator’s footsteps and quiet breathing, plus gentle electronic tones and tiny vocalizations from the drawn creatures.
关键是运动约束那一段需要写清楚。不写的话 H3 会自作主张给你加动作,人物开始转头、背景开始有人走过,静止系那个味道立刻就没了。
另外 H3 的原生音频在这个场景下挺好用的——环境音和光影节奏是同一次生成出来的,不用后期对轨。
成本
这个我没有细算,我昨天充了 100 块钱,做了 6-8 个视频吧,包括重试的。
按 $0.13/秒算,15 秒 2K 大概 $2 一条,比同分辨率的竞品便宜不少。但考虑到翻车重试,实际成本要按 2-3 倍估。
最后
我把这套流程做成了个站:https://www.maxluo3.com
主要是面向海外的,看能不能挣点钱贴补一下 api 费用呜呜呜
想问一下:有人成功让 H3 的视频参考稳定工作过吗?我怀疑是我 prompt 里描述参考关系的方式不对,但试了好几种写法都没明显改善。如果有踩通的求指点。