CONSISTENT CHARACTER VIDEO

角色一致 AI 视频:参考可以加强约束,但不是身份承诺

角色一致模式把已授权参考图与可选声线加入生成请求,适合保持发型、服装和人物方向的短镜头;它提供模型条件,不是零漂移保证。

仅限成年人使用;仅处理明确成年且来源合法的素材。

范围

先定义一致性的对象,再减少每镜变量

当前实现最多取 7 张参考图作为 reference_images。提示词没有引用标签时,服务会自动加入 <IMAGE_n>;选择声线后还会加入音频引用。

参考越杂,模型越难判断哪些细节必须保持。先用少量同造型、相近光线的授权图片跑一个 4–8 秒单镜,再决定是否扩展。

输入 · 参数 · 输出 · 边界

真实界面、输入与输出

每条都把提示词、参数、成片和失败限制放在一起。能点开的视频才标成真输出;没单独测过的模式会写明。

角色一致:参考图与声线怎样进入请求

黄果制片真实片场的角色一致模式,显示最多七张参考图、声线和 720p 参数
真实 UI 截图,2026-09-04 从本项目本地构建的 /studio?mode=r2v&age=1 捕获。截图记录操作界面;下方 MP4 才是本次 Grok 请求的真实输出。

输入提示词

Use <IMAGE_0> as the only identity reference. The same clearly adult fictional woman, age 28, stands in an elegant amber hotel lounge. Preserve her face, hairstyle, gold dress, and body proportions. She slowly turns toward the camera, blinks once, and rests one hand on the chair. Locked camera, one continuous shot, subtle breathing and fabric motion, no speech, no text, no new people, no nudity.

可核验参数

模式
角色一致(r2v)
请求 ID
964f3356-6c6e-9e2a-b8b7-3b89f745454d
模型
grok-imagine-video-1.5
参考图
huangguo.chat/characters-v2/guoguo.jpg;SHA-256 f13130a7b5ec6b2837611c47cd3608c0a823bd263819ca37e48842c469318299
请求参数
4 秒 · 3:4 · 480p · 1 张 reference_image
实测输出
H.264 · 480×640 · 24 fps · 97 帧 · 4.041667 秒

角色参考生成结果

Grok 角色一致短镜头:金裙角色转身、眨眼并扶椅

以黄果 Chat 产品族的虚构成年角色果果图片作为唯一身份参考生成。逐帧观察为同一金裙角色转身、眨眼并把手扶在椅背上,短镜内身份总体稳定,但脸型与姿态仍有轻微漂移。

下载 MP4 文件核验
核验数据
请求 ID
964f3356-6c6e-9e2a-b8b7-3b89f745454d
模型 / 处理
grok-imagine-video-1.5
实测文件
480×640 · 24/1 fps · 97 帧 · 4.041667 秒 · 720,497 bytes

SHA-256 9174cb4555eee9b308dfb38b5d59ea7b6a611296b6e42a744de27c87187fcf7e

输出结果

Grok 角色参考输出已落盘

请求成功并保存为本站 MP4。逐帧观察:同一金裙角色完成转身、眨眼和扶椅动作,短镜内身份总体稳定;脸型和姿态仍有轻微漂移,因此这是一条可核验样本,不是“一致性已解决”的结论。

失败与边界

失败与能力边界

  • 这次只测试一张参考图、一个 4 秒固定机位镜头,不能外推到多人物或多镜头。
  • 金裙、发型与整体身份保持较好,但脸型和姿态仍有肉眼可见的轻微漂移。
  • 参考图只提供条件约束,不构成人脸验证,也不保证跨镜头完全同脸。
  • 只可使用明确成年、来源合法且获授权的素材。
用这组配置进入片场

跨产品记录

跨产品实验记录:黄果 Chat 的 H3 图生视频

来源声明:以下是黄果产品族中 huangguo.chat 的真实生产记录,不是 huangguo.design、Grok Imagine 或本页参数生成的结果。它只用于展示“原图 + 明确提示 + 参数 + 落盘文件”应怎样留证。

完整的输入、输出、参数、SHA-256 与失败边界也保存在公开的 GitHub 可复现实验仓库。

idle h3v3(后处理为往返循环)

实测文件:H.264 · 480×640 · 24 fps · 10.333 秒 · 484,910 bytes

核验数据

SHA-256 3f3dd70af5b044868358e2b6dedb45f72ed9e5368a1df733011de8fa8ef3b010

hair zone h3v1(原始单段)

实测文件:H.264 · 480×640 · 24 fps · 5.167 秒 · 285,336 bytes

核验数据

SHA-256 acdb566b06e313b6b916904ef2729200d062f651ae7bd969c88973761a9abb37

原始输入

来源、模型与提示词

模型:minimax/h3-max/image-to-video(经 AtlasCloud 调用)

Locked-off vertical cinematic portrait of the exact same adult character, 果果, in an elegant private lounge with warm amber practical lights and faint teal rim light. Preserve facial identity, adult age, hairstyle, clothing, body proportions, background, framing and lighting exactly. No cuts, no camera movement, no morphing, no text; no speech or lip movement; return close to the opening pose for a loop.

原图 SHA-256 f13130a7b5ec6b2837611c47cd3608c0a823bd263819ca37e48842c469318299

请求和实测

请求参数和实测限制

输入
huangguo.chat /characters-v2/guoguo.jpg
模型
minimax/h3-max/image-to-video
请求规格
480P · 5 秒 · ratio 9:16 · prompt_expansion=false
生产脚本
huangguo.chat/scripts/generate-motion.mjs 与 generate-zone-clips.mjs
  • 请求 ratio 为 9:16,但两个落盘文件实测为 480×640(3:4);页面按实测值披露,不把请求值当输出值。
  • idle 文件经脚本做正放 + 倒放并移除音轨,所以 5 秒请求最终为约 10.33 秒,不能当作原始模型时长。
  • 此记录只能证明黄果 Chat 的 H3 工作流和这两个文件,不能证明 huangguo.design 的 Grok 模式已经成功生成。

WHAT IT DOES

当前可以控制的部分

IDENTITY

点名关键外观

参考图提供视觉条件,提示仍应点名发型、服装、饰品和人物数量。

VOICE

声线是可选参考

启用后作为 reference_audios 提交,并在需要时自动补入提示词。

QUALITY

720p 是真实上限

角色参考或带声线请求会把 1080p 限制为 720p。

WORKFLOW

四步完成一次生成

01

挑少量合法参考

只用明确成年、获授权素材,优先同造型、相近光线和无遮挡面部。

02

写不可变元素

点名发型、服装、饰品和人物数量,并引用对应 <IMAGE_n>。

03

用 720p 短镜验证

从 4–8 秒检查脸、服装和动作,不同时增加人物、对白和复杂运镜。

04

逐镜检查再拼接

人工比较每个结果;相邻镜头连续性可接受后再拼接。

FAQ

常见问题

最多可以上传几张参考图?

当前客户端和请求逻辑最多保留并提交 7 张;更多文件会被截断。

支持 1080p 吗?

当前不支持。界面会禁用 1080p,请求构建也会限制为 720p。

只选声线可以提交吗?

当前校验允许参考图或声线至少一项,但声音不能替代视觉身份参考。

参考图能保证完全同脸吗?

不能。参考图是条件,不是人脸验证;遮挡、侧脸和光线变化都可能漂移。

START SMALL

先用一张参考图验证一个短镜头

准备有权使用的成年合成角色素材,用 720p 和单一动作测试并保留任务记录。