面向需要将 AI 视频接入电商内容生产的开发者、AIGC 创作者与内容技术团队。本文不做主观模型横评,而是给出一套可复现的 12 秒双参考图工作流:如何定义参考图职责、如何编排多镜头 Prompt,以及如何把成片验收转化为可执行的质量检查。
1. 问题定义:让“人物喝水”成为可交付的商品视频
本次任务不是生成一个人物饮水片段,而是生成一条可用于商品详情页或信息流首测的电商生活方式短片。它至少要同时满足三项约束:
- 商品外观可追溯:杯身颜色、杯盖、金属细环、波浪浮雕和底部竖纹在关键镜头中可辨识。
- 人物身份可连续:正脸、侧脸、发型和服装在镜头切换、拿杯和饮水动作中保持稳定。
- 镜头有转化顺序:先建立商品,再建立人物与商品的关系,最后以完整产品收束;人物不能抢走商品信息。
这三个目标分别对应“参考图”“动作设计”和“镜头时序”。把它们混写成一句“生成高级感电商广告”,通常只会得到不可控的结果。
2. 实际生成配置与素材契约

| 项目 | 本次设置 |
|---|---|
| 模型 | MiniMax H3 |
| 参考方式 | 全能参考 |
| 参考素材 | 2 张:商品图 + 人物卡 |
| 画幅 / 分辨率 | 9:16 / 768p |
| 成片时长 | 12 秒 |
本次素材不是可随意替换的“灵感图”,而是输入契约。
| 输入 | 在生成中的职责 | 必须锁定的信息 |
|---|---|---|
商品图 @图片1 | 道具外观锚点 | 暖象牙白磨砂杯身、圆角蘑菇盖、香槟金细环、浅金波浪浮雕、底部竖纹 |
人物卡 @图片2 | 角色身份锚点 | 脸部、发型、浅蓝色连衣裙、正侧背多视角特征 |
| 文本分镜 | 时序与镜头锚点 | 每段的景别、人物动作、商品朝向、运镜与声音 |
人物卡同时包含近景、正面、侧面与背面信息。对于需要转身、侧脸、手持产品的片段,这比单张肖像更有价值;它提供的不是“更漂亮的人像”,而是更完整的角色条件。
3. 12 秒的镜头预算:先分配信息,再写文案
短视频的时长不是一个界面参数,而是镜头的资源预算。此处把 12 秒划为四段,每段只承担一个核心任务:
| 时间 | 镜头任务 | 商品信息目标 | 人物动作目标 |
|---|---|---|---|
| 0.0–3.0 秒 | 产品建立 | 完整外观、金色细环、波浪浮雕 | 无人物干扰 |
| 3.0–6.0 秒 | 建立使用关系 | 杯身朝向镜头、装饰不被遮挡 | 入画、拿杯、旋开杯盖 |
| 6.0–9.2 秒 | 使用情境 | 杯身位于前景、材质可见 | 侧身自然饮水 |
| 9.2–12.0 秒 | 产品收束 | 完整正面,作为可用尾帧 | 放回桌面、自然虚化 |
这个分配的原则是:人物动作需要连续时间,产品展示需要稳定画面,收束镜头需要留出足够的尾帧。不要把“拿起、开盖、饮水、放下”压进同一个镜头,也不要把产品展示全部放在人物动作之后。
4. 可直接复用的 H3 分镜 Prompt
将商品图作为 @图片1、人物卡作为 @图片2 上传;在 H3 中选择全能参考、9:16、768p、12 秒。
实拍电商生活方式广告,清晨通勤氛围。竖版9:16,12s。角色为 @图片2,保持人物面部、发型、浅蓝色连衣裙和整体气质一致;道具为 @图片1,保持暖象牙白磨砂杯身、圆角蘑菇盖、香槟金细环、杯身浅金波浪浮雕和底部竖纹完全一致。
镜头 1|0.0–3.0 秒|产品建立
浅木色办公桌中央,保温杯完整竖直放置。背景是轻微虚焦的笔记本电脑和米白色通勤包。清晨侧光从左侧掠过杯身,镜头由中近景缓慢推近,清楚展示金色细环、波浪浮雕和底部竖纹。安静的室内晨间环境声。
镜头 2|3.0–6.0 秒|人物与产品建立关系
@图片2 中的人物从画面右侧自然入镜,坐在桌前,伸手拿起保温杯并缓慢旋开杯盖。镜头以中景轻微向右平移跟随手部,杯身波浪浮雕始终朝向镜头,人物不抢画面。保留真实、轻微的杯盖旋开声。
镜头 3|6.0–9.2 秒|饮水动作
人物侧面中近景,自然举起保温杯喝一口水,晨光勾勒侧脸和杯身轮廓。镜头缓慢推近,焦点优先保持在保温杯的暖白磨砂质感和香槟金细环上。轻微饮水声,人物表情放松,不看镜头。
镜头 4|9.2–12.0 秒|产品收束
人物将保温杯轻放回桌面中央,背景人物自然虚化。镜头以极小幅度向右环绕,最后停在保温杯完整正面:金色细环、波浪浮雕和底部竖纹均清晰可见。杯底落桌轻响后,环境声自然收弱。
全片保持同一个人物、同一只保温杯、同一套服装和同一晨间办公场景。不要文字、Logo、价格、水印、额外人物或额外商品;不要改变杯子颜色、装饰、比例和杯盖结构;不要手部畸形、快速摇镜、夸张滤镜或卡通化效果。
这里的关键不是提示词写得长,而是每个镜头都重复了与该镜头相关的约束。例如“波浪浮雕始终朝向镜头”只出现在手持镜头中,因为这是最可能被手部遮挡或因转动而消失的阶段。
5. 用关键帧建立验收,而不是凭主观观感
建议从成片截取第 1 秒、第 4 秒、第 7 秒和第 11 秒,并按下面的检查项验收。每项以 0–2 分记录:0 为不可用,1 为可后期修复,2 为可进入候选素材库。
minimax h3双参考图、多镜头生成视频测试结果
| 维度 | 检查点 | 失败时的优先修复方向 |
|---|---|---|
| 商品属性保留 | 杯身颜色、杯盖、金色细环、波浪浮雕、底部竖纹 | 提升商品图清晰度;减少遮挡与大幅环绕 |
| 角色连续性 | 正侧脸、发型、服装在不同镜头保持一致 | 补足人物卡侧脸/背面;减少转头幅度 |
| 交互可信度 | 拿杯、旋盖、饮水、落桌动作符合物理直觉 | 一个镜头只保留一个主要动作;减少手部遮挡 |
| 商品可见性 | 前 3 秒完整出镜;尾帧可独立用作封面 | 调整主体位置与镜头定格位置 |
| 时序完整性 | 四个镜头按建立—交互—使用—收束完成信息闭环 | 重分配镜头时长,而不是追加无关描述 |
如果需要把验收交给多人协作,可用以下最小评分公式记录结果:
Q = 商品属性保留 + 角色连续性 + 交互可信度 + 商品可见性 + 时序完整性
满分 10 分;低于 8 分的素材不直接进入投放候选池。
这个分数不是通用模型基准,只是团队内判断“是否值得继续修 Prompt 或进入后期”的一致标准。
6. 如何做下一轮迭代
通过首条视频确认参考图与分镜可以协同后,不要一次更改所有条件。建议建立小型测试矩阵:
| 版本 | 保持不变 | 只改变 |
|---|---|---|
| A | 商品图、人物卡、分镜结构 | 办公桌通勤场景 |
| B | 商品图、人物卡、分镜结构 | 咖啡馆阅读场景 |
| C | 商品图、人物卡、分镜结构 | 人物将产品放入通勤包的动作 |
这样,商品结构漂移时可以判断问题来自动作、场景还是参考图;而不是面对多项同时变化的结果,只能继续随机抽样。
结语
MiniMax H3 的价值不只是将两张图片变成一段视频,而是允许把“商品外观、人物身份、镜头调度、声音氛围”放入同一生成任务中。真正决定电商内容是否可交付的,仍然是输入定义与验收机制。
商品图锁定外观 → 人物卡锁定角色 → 分镜锁定动作 → 时长锁定节奏 → 后期模板承载文字与转化信息
MiniMax H3 支持统一处理文本、图像、视频和声音等多模态上下文,可用于广告、品牌和电商等内容生产场景。
参考工具
【1】一站式AI电商与内容创作平台:技灵AI
功能:支持AI脚本解析策划、视频生成复刻、案例参考。
【2】MiniMax H3 官方资料:MiniMax H3 官方介绍
说明:用于查看模型能力与官方应用说明。

587

被折叠的 条评论
为什么被折叠?



