黄果制片 / 角色一致 AI 视频:参考可以加强约束,但不是身份承诺 CONSISTENT CHARACTER VIDEO
角色一致 AI 视频:参考可以加强约束,但不是身份承诺 角色一致模式把已授权参考图与可选声线加入生成请求,适合保持发型、服装和人物方向的短镜头;它提供模型条件,不是零漂移保证。
仅限成年人使用;仅处理明确成年且来源合法的素材。
现在能做什么
真实样本:1 张参考图 Grok 请求:4 秒 · 3:4 · 480p 实测:480×640 · 97 帧 代码最多接收 7 张参考图 范围
先定义一致性的对象,再减少每镜变量 当前实现最多取 7 张参考图作为 reference_images。提示词没有引用标签时,服务会自动加入 <IMAGE_n>;选择声线后还会加入音频引用。
参考越杂,模型越难判断哪些细节必须保持。先用少量同造型、相近光线的授权图片跑一个 4–8 秒单镜,再决定是否扩展。
输入 · 参数 · 输出 · 边界
真实界面、输入与输出 每条都把提示词、参数、成片和失败限制放在一起。能点开的视频才标成真输出;没单独测过的模式会写明。
角色一致:参考图与声线怎样进入请求 真实 UI 截图,2026-09-04 从本项目本地构建的 /studio?mode=r2v&age=1 捕获。截图记录操作界面;下方 MP4 才是本次 Grok 请求的真实输出。 输入提示词 Use <IMAGE_0> as the only identity reference. The same clearly adult fictional woman, age 28, stands in an elegant amber hotel lounge. Preserve her face, hairstyle, gold dress, and body proportions. She slowly turns toward the camera, blinks once, and rests one hand on the chair. Locked camera, one continuous shot, subtle breathing and fabric motion, no speech, no text, no new people, no nudity. 可核验参数
模式 角色一致(r2v)
请求 ID 964f3356-6c6e-9e2a-b8b7-3b89f745454d
模型 grok-imagine-video-1.5
参考图 huangguo.chat/characters-v2/guoguo.jpg;SHA-256 f13130a7b5ec6b2837611c47cd3608c0a823bd263819ca37e48842c469318299
请求参数 4 秒 · 3:4 · 480p · 1 张 reference_image
实测输出 H.264 · 480×640 · 24 fps · 97 帧 · 4.041667 秒 角色参考生成结果
Grok 角色一致短镜头:金裙角色转身、眨眼并扶椅 以黄果 Chat 产品族的虚构成年角色果果图片作为唯一身份参考生成。逐帧观察为同一金裙角色转身、眨眼并把手扶在椅背上,短镜内身份总体稳定,但脸型与姿态仍有轻微漂移。
下载 MP4 文件核验 核验数据
请求 ID 964f3356-6c6e-9e2a-b8b7-3b89f745454d
模型 / 处理 grok-imagine-video-1.5
实测文件 480×640 · 24/1 fps · 97 帧 · 4.041667 秒 · 720,497 bytes SHA-256 9174cb4555eee9b308dfb38b5d59ea7b6a611296b6e42a744de27c87187fcf7e
输出结果
Grok 角色参考输出已落盘 请求成功并保存为本站 MP4。逐帧观察:同一金裙角色完成转身、眨眼和扶椅动作,短镜内身份总体稳定;脸型和姿态仍有轻微漂移,因此这是一条可核验样本,不是“一致性已解决”的结论。
失败与边界
失败与能力边界 这次只测试一张参考图、一个 4 秒固定机位镜头,不能外推到多人物或多镜头。 金裙、发型与整体身份保持较好,但脸型和姿态仍有肉眼可见的轻微漂移。 参考图只提供条件约束,不构成人脸验证,也不保证跨镜头完全同脸。 只可使用明确成年、来源合法且获授权的素材。 用这组配置进入片场 跨产品记录
跨产品实验记录:黄果 Chat 的 H3 图生视频 来源声明: 以下是黄果产品族中 huangguo.chat 的真实生产记录,不是 huangguo.design、Grok Imagine 或本页参数生成的结果。它只用于展示“原图 + 明确提示 + 参数 + 落盘文件”应怎样留证。
完整的输入、输出、参数、SHA-256 与失败边界也保存在公开的 GitHub 可复现实验仓库 。
idle h3v3(后处理为往返循环) 实测文件:H.264 · 480×640 · 24 fps · 10.333 秒 · 484,910 bytes
核验数据 SHA-256 3f3dd70af5b044868358e2b6dedb45f72ed9e5368a1df733011de8fa8ef3b010
hair zone h3v1(原始单段) 实测文件:H.264 · 480×640 · 24 fps · 5.167 秒 · 285,336 bytes
核验数据 SHA-256 acdb566b06e313b6b916904ef2729200d062f651ae7bd969c88973761a9abb37
原始输入
来源、模型与提示词 模型: minimax/h3-max/image-to-video(经 AtlasCloud 调用)
Locked-off vertical cinematic portrait of the exact same adult character, 果果, in an elegant private lounge with warm amber practical lights and faint teal rim light. Preserve facial identity, adult age, hairstyle, clothing, body proportions, background, framing and lighting exactly. No cuts, no camera movement, no morphing, no text; no speech or lip movement; return close to the opening pose for a loop. 原图 SHA-256 f13130a7b5ec6b2837611c47cd3608c0a823bd263819ca37e48842c469318299
请求和实测
请求参数和实测限制
输入 huangguo.chat /characters-v2/guoguo.jpg
模型 minimax/h3-max/image-to-video
请求规格 480P · 5 秒 · ratio 9:16 · prompt_expansion=false
生产脚本 huangguo.chat/scripts/generate-motion.mjs 与 generate-zone-clips.mjs 请求 ratio 为 9:16,但两个落盘文件实测为 480×640(3:4);页面按实测值披露,不把请求值当输出值。 idle 文件经脚本做正放 + 倒放并移除音轨,所以 5 秒请求最终为约 10.33 秒,不能当作原始模型时长。 此记录只能证明黄果 Chat 的 H3 工作流和这两个文件,不能证明 huangguo.design 的 Grok 模式已经成功生成。 WHAT IT DOES
当前可以控制的部分 IDENTITY
点名关键外观 参考图提供视觉条件,提示仍应点名发型、服装、饰品和人物数量。
VOICE
声线是可选参考 启用后作为 reference_audios 提交,并在需要时自动补入提示词。
QUALITY
720p 是真实上限 角色参考或带声线请求会把 1080p 限制为 720p。
WORKFLOW
四步完成一次生成 01
挑少量合法参考 只用明确成年、获授权素材,优先同造型、相近光线和无遮挡面部。
02
写不可变元素 点名发型、服装、饰品和人物数量,并引用对应 <IMAGE_n>。
03
用 720p 短镜验证 从 4–8 秒检查脸、服装和动作,不同时增加人物、对白和复杂运镜。
04
逐镜检查再拼接 人工比较每个结果;相邻镜头连续性可接受后再拼接。
FAQ
常见问题 最多可以上传几张参考图? 当前客户端和请求逻辑最多保留并提交 7 张;更多文件会被截断。
支持 1080p 吗? 当前不支持。界面会禁用 1080p,请求构建也会限制为 720p。
只选声线可以提交吗? 当前校验允许参考图或声线至少一项,但声音不能替代视觉身份参考。
参考图能保证完全同脸吗? 不能。参考图是条件,不是人脸验证;遮挡、侧脸和光线变化都可能漂移。
START SMALL
先用一张参考图验证一个短镜头 准备有权使用的成年合成角色素材,用 720p 和单一动作测试并保留任务记录。