MiniMax H3 双参考图电商短片实操:多镜头生成的输入设计、分镜控制与验收方法

面向需要将 AI 视频接入电商内容生产的开发者、AIGC 创作者与内容技术团队。本文不做主观模型横评,而是给出一套可复现的 12 秒双参考图工作流:如何定义参考图职责、如何编排多镜头 Prompt,以及如何把成片验收转化为可执行的质量检查。

1. 问题定义:让“人物喝水”成为可交付的商品视频

本次任务不是生成一个人物饮水片段,而是生成一条可用于商品详情页或信息流首测的电商生活方式短片。它至少要同时满足三项约束:

  1. 商品外观可追溯:杯身颜色、杯盖、金属细环、波浪浮雕和底部竖纹在关键镜头中可辨识。
  2. 人物身份可连续:正脸、侧脸、发型和服装在镜头切换、拿杯和饮水动作中保持稳定。
  3. 镜头有转化顺序:先建立商品,再建立人物与商品的关系,最后以完整产品收束;人物不能抢走商品信息。

这三个目标分别对应“参考图”“动作设计”和“镜头时序”。把它们混写成一句“生成高级感电商广告”,通常只会得到不可控的结果。

2. 实际生成配置与素材契约

minimax h3界面

项目本次设置
模型MiniMax H3
参考方式全能参考
参考素材2 张:商品图 + 人物卡
画幅 / 分辨率9:16 / 768p
成片时长12 秒

本次素材不是可随意替换的“灵感图”,而是输入契约。

输入在生成中的职责必须锁定的信息
商品图 @图片1道具外观锚点暖象牙白磨砂杯身、圆角蘑菇盖、香槟金细环、浅金波浪浮雕、底部竖纹
人物卡 @图片2角色身份锚点脸部、发型、浅蓝色连衣裙、正侧背多视角特征
文本分镜时序与镜头锚点每段的景别、人物动作、商品朝向、运镜与声音

人物卡同时包含近景、正面、侧面与背面信息。对于需要转身、侧脸、手持产品的片段,这比单张肖像更有价值;它提供的不是“更漂亮的人像”,而是更完整的角色条件。

3. 12 秒的镜头预算:先分配信息,再写文案

短视频的时长不是一个界面参数,而是镜头的资源预算。此处把 12 秒划为四段,每段只承担一个核心任务:

时间镜头任务商品信息目标人物动作目标
0.0–3.0 秒产品建立完整外观、金色细环、波浪浮雕无人物干扰
3.0–6.0 秒建立使用关系杯身朝向镜头、装饰不被遮挡入画、拿杯、旋开杯盖
6.0–9.2 秒使用情境杯身位于前景、材质可见侧身自然饮水
9.2–12.0 秒产品收束完整正面,作为可用尾帧放回桌面、自然虚化

这个分配的原则是:人物动作需要连续时间,产品展示需要稳定画面,收束镜头需要留出足够的尾帧。不要把“拿起、开盖、饮水、放下”压进同一个镜头,也不要把产品展示全部放在人物动作之后。

4. 可直接复用的 H3 分镜 Prompt

将商品图作为 @图片1、人物卡作为 @图片2 上传;在 H3 中选择全能参考、9:16、768p、12 秒。

实拍电商生活方式广告,清晨通勤氛围。竖版9:16,12s。角色为 @图片2,保持人物面部、发型、浅蓝色连衣裙和整体气质一致;道具为 @图片1,保持暖象牙白磨砂杯身、圆角蘑菇盖、香槟金细环、杯身浅金波浪浮雕和底部竖纹完全一致。

镜头 1|0.0–3.0 秒|产品建立
浅木色办公桌中央,保温杯完整竖直放置。背景是轻微虚焦的笔记本电脑和米白色通勤包。清晨侧光从左侧掠过杯身,镜头由中近景缓慢推近,清楚展示金色细环、波浪浮雕和底部竖纹。安静的室内晨间环境声。

镜头 2|3.0–6.0 秒|人物与产品建立关系
@图片2 中的人物从画面右侧自然入镜,坐在桌前,伸手拿起保温杯并缓慢旋开杯盖。镜头以中景轻微向右平移跟随手部,杯身波浪浮雕始终朝向镜头,人物不抢画面。保留真实、轻微的杯盖旋开声。

镜头 3|6.0–9.2 秒|饮水动作
人物侧面中近景,自然举起保温杯喝一口水,晨光勾勒侧脸和杯身轮廓。镜头缓慢推近,焦点优先保持在保温杯的暖白磨砂质感和香槟金细环上。轻微饮水声,人物表情放松,不看镜头。

镜头 4|9.2–12.0 秒|产品收束
人物将保温杯轻放回桌面中央,背景人物自然虚化。镜头以极小幅度向右环绕,最后停在保温杯完整正面:金色细环、波浪浮雕和底部竖纹均清晰可见。杯底落桌轻响后,环境声自然收弱。

全片保持同一个人物、同一只保温杯、同一套服装和同一晨间办公场景。不要文字、Logo、价格、水印、额外人物或额外商品;不要改变杯子颜色、装饰、比例和杯盖结构;不要手部畸形、快速摇镜、夸张滤镜或卡通化效果。

这里的关键不是提示词写得长,而是每个镜头都重复了与该镜头相关的约束。例如“波浪浮雕始终朝向镜头”只出现在手持镜头中,因为这是最可能被手部遮挡或因转动而消失的阶段。

5. 用关键帧建立验收,而不是凭主观观感

建议从成片截取第 1 秒、第 4 秒、第 7 秒和第 11 秒,并按下面的检查项验收。每项以 0–2 分记录:0 为不可用,1 为可后期修复,2 为可进入候选素材库。

minimax h3双参考图、多镜头生成视频测试结果

维度检查点失败时的优先修复方向
商品属性保留杯身颜色、杯盖、金色细环、波浪浮雕、底部竖纹提升商品图清晰度;减少遮挡与大幅环绕
角色连续性正侧脸、发型、服装在不同镜头保持一致补足人物卡侧脸/背面;减少转头幅度
交互可信度拿杯、旋盖、饮水、落桌动作符合物理直觉一个镜头只保留一个主要动作;减少手部遮挡
商品可见性前 3 秒完整出镜;尾帧可独立用作封面调整主体位置与镜头定格位置
时序完整性四个镜头按建立—交互—使用—收束完成信息闭环重分配镜头时长,而不是追加无关描述

如果需要把验收交给多人协作,可用以下最小评分公式记录结果:

Q = 商品属性保留 + 角色连续性 + 交互可信度 + 商品可见性 + 时序完整性
满分 10 分;低于 8 分的素材不直接进入投放候选池。

这个分数不是通用模型基准,只是团队内判断“是否值得继续修 Prompt 或进入后期”的一致标准。

6. 如何做下一轮迭代

通过首条视频确认参考图与分镜可以协同后,不要一次更改所有条件。建议建立小型测试矩阵:

版本保持不变只改变
A商品图、人物卡、分镜结构办公桌通勤场景
B商品图、人物卡、分镜结构咖啡馆阅读场景
C商品图、人物卡、分镜结构人物将产品放入通勤包的动作

这样,商品结构漂移时可以判断问题来自动作、场景还是参考图;而不是面对多项同时变化的结果,只能继续随机抽样。

结语

MiniMax H3 的价值不只是将两张图片变成一段视频,而是允许把“商品外观、人物身份、镜头调度、声音氛围”放入同一生成任务中。真正决定电商内容是否可交付的,仍然是输入定义与验收机制。

商品图锁定外观 → 人物卡锁定角色 → 分镜锁定动作 → 时长锁定节奏 → 后期模板承载文字与转化信息

MiniMax H3 支持统一处理文本、图像、视频和声音等多模态上下文,可用于广告、品牌和电商等内容生产场景。

参考工具

【1】一站式AI电商与内容创作平台:技灵AI
功能:支持AI脚本解析策划、视频生成复刻、案例参考。

【2】MiniMax H3 官方资料:MiniMax H3 官方介绍
说明:用于查看模型能力与官方应用说明。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值