研发笔记

多参考图视频为什么需要资产绑定和镜内时间轴?

多参考图视频不是“上传几张图再写一句提示词”。角色、场景、道具的绑定关系,以及 15 秒镜头中的动作时间轴,决定了生成结果是否连贯。

多参考图视频不是“上传几张图再写一句提示词”。角色、场景、道具的绑定关系,以及 15 秒镜头中的动作时间轴,决定了生成结果是否连贯。

参考图先定义身份

角色、场景和关键道具应分开绑定,让模型知道每张图承担什么职责,避免人物、环境和物件互相污染。

15 秒必须被完整编排

镜头需要覆盖开场、动作、走位、视线、机位变化和收束,不能前 6 秒完成动作、后 9 秒只剩空镜。

状态必须明确

电话、视频通话、画外音、内心独白和系统 UI 是不同表达,混在一起会导致人物错误开口或界面混乱。

减少重生成本靠前置规划

参考资产、分镜、时间轴和禁止项先定义清楚,才能把昂贵的视频生成次数留给真正必要的修正。

分镜提示词需要同时描述动作和相机

只写人物“做什么”不够,还需要写从哪里移动到哪里、视线变化、机位如何跟随、何时切到道具或界面特写。这样 15 秒才会有完整调度,而不是站桩说话。

连续镜头需要上下文呼应

相邻分镜至少要在人物位置、道具状态、情绪或动作方向上有一个可接续点。每个镜头单独漂亮但彼此没有承接,会让整集看起来像随机生成的视频片段。

禁止项也要服务生成而不是堆规则

提示词里只保留真正影响模型行为的限制,例如无水印、无人物台词字幕、允许必要系统 UI。大量解释性文字会稀释核心动作和资产绑定。

15 秒视频提示词最好先写“动作时间表”,再压缩成模型语言

可以先按 0—3 秒、3—7 秒、7—11 秒、11—15 秒标注人物位置、动作、视线、道具状态和机位变化,再把它压缩成最终提示词。这样能提前发现后半段没有内容、人物没有从 A 移动到 B、电话状态突然变化、上一镜道具位置与下一镜不一致等问题。多参考图则先建立角色、场景、关键道具的绑定表,明确每张参考图只负责什么。前置规划越清楚,越能减少昂贵的重复生成。

格物的方法始终从真实问题开始:先看清,再结构化,再进入使用。
GEWU INSIGHTS格物 · 致知 · 践行