Video prompt writer
Skill khanhhuyenngo985-sys/character-scene-design-skills/skills/video-prompt-writer
通用角色与场景设计技能包:角色资产、身高比例锁、三视图一致性、服装状态、道具锚点、场景动线与 AI 图像/视频提示词流程
npx -y skills add khanhhuyenngo985-sys/character-scene-design-skills --skill video-prompt-writerAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
2 things to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
- 5 stars5 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
将分镜脚本/创作简报转化为AI视频平台可执行提示词,支持Seedance/Vidu/海螺/Kling四平台输出。包含白梦客美学系统、Schema结构化输出、视觉序列描述法。触发词:「生成提示词」「分镜转提示词」「生成即梦/Seedance/Vidu/可灵提示词」「Schema」「平台化提示词」「将剧本转化为提示词」。
SKILL.md
48.3 KB, as published. Nobody here has run it
Video Prompt Writer
AI视频分镜提示词规范 + Schema结构化输出。融合白梦客美学系统 + 视觉序列描述法 + 多参照生成模式。
核心理念:视频模型是"视觉序列匹配器"。它理解的是画面A→画面B→画面C的变化,不理解因果逻辑和情绪标签。提示词要写成它能匹配的"视觉序列描述"。
TL;DR
分镜脚本 → 填充Schema → 生成平台化提示词
支持平台:Seedance / Vidu / 海螺 / Kling
启动检查点
激活后先确认:
- 输入:分镜脚本 or 口头描述?
- 目标平台:Seedance / Vidu / 海螺 / Kling?
- 风格线:高定线 or 通用线?
三项确认后再填充Schema,避免平台选错重做。
边界条件处理
| 情况 | 处理方式 |
|---|---|
| 分镜脚本不完整(缺时长/色调) | 用风格线默认值填充,标注 [默认值],告知用户 |
| 平台未指定 | 默认 Seedance,询问是否需要其他平台 |
| 场景总时长与meta.duration不符 | 提示差异,让用户确认是否调整 |
| 风格线未指定 | 询问用途(广告→高定线,故事短片→通用线) |
核心工作流
Step 1: 启动检查点确认(平台/风格线/输入类型)
Step 2: 解析输入 → 提取场景/时长/主体/运镜/情绪
Step 3: 填充Schema(meta/palette/scenes)
Step 4: 生成平台化提示词(按目标平台格式输出)
Step 5: 质量检查清单逐项确认
每步有明确输入/输出。Step 1 必须完成才能进入 Step 2。
专项知识库(快速检索)
| # | 知识库 | 用途 |
|---|---|---|
| 01 | 情绪视觉表达库 | 七种情绪的环境变化+身体反应+组合方案 |
| 02 | 微表情肌肉运动库 | 面部肌肉起点终点+量化指标+真/假笑辨别 |
| 03 | 声音设计策略库 | 七种情绪的声音配合+镜头运动+留白时机 |
| 04 | 构图与走位库 | 九宫格站位+走位模板+视线方向+三人构图 |
| 05 | 运镜手法库 | 推拉摇移跟升降甩切+升格降格+组合运镜 |
| 06 | 景别情绪库 | 远全中近特各占幅+情绪承载力+切换逻辑 |
| 07 | 分镜衔接逻辑库 | 硬切/叠化/续接/跳切/匹配切等12种衔接 |
| 08 | 打光方法库 | 光源位置+软硬光+色温+特殊光效 |
| 09 | 节奏剪辑库 | 快/正常/慢剪节奏+情绪曲线+类型片节奏 |
| 10 | 类型片结构库 | 广告/故事短片/概念片/各场景分镜架构 |
| 11 | 情景喜剧视觉语法库 | 固定机位/反应镜头/笑话节奏/站位模式 |
| 12 | 多参宗角色设定库 | 全部角色背景/金句/互动组合/台词翻译对照 |
| 13 | 白梦客创作方法论 | 用户本人的创作理念/感受力驱动/视觉序列匹配 |
即梦/Seedance专项补充:@引用规则和平台限制见第五节;镜头质感修饰(Level 4隐藏层级)见第十一节第12条;史诗大制作结构见第十三节;传播技巧见第十三·五节。
路径:/Users/baimengke/Documents/白梦客知识库/02-创作方法论/A-视频生成专项/
使用方式:创作时查阅知识库 → 找到对应方案 → 复制到提示词对应位置。
核心结构
【导演开场白】→【全局空间锚点卡】→【多参挂载】→【镜头单元】
字数限制:每个分镜的【本分镜提示词】不超过 2000 字。
一、剧情密度设计(核心原则)
视频模型会"凑时长"——当剧情信息密度不足时,它会自动填充内容,但填充的内容往往不是我们需要的。必须设计足够的剧情密度。
剧情密度对照表
| 时长 | 画面段落数 | 每段时长 | 剧情要求 |
|---|---|---|---|
| 3秒 | 1-2段 | 1.5-3秒/段 | 单一爆发点,1个核心视觉冲击 |
| 5秒 | 2-3段 | 1.5-2秒/段 | 1个核心变化 + 1-2个次要变化 |
| 8秒 | 3-4段 | 2秒/段 | 完整起承转合:蓄力→小变化→再蓄力→爆发 |
| 15秒 | 4-6段 | 2-3秒/段 | 完整情绪弧线:起始→发展→高潮→回落 |
| 20秒+ | 6-8段 | 2-3秒/段 | 多情绪波动或多个独立视觉事件 |
每段剧情必须包含
[时间节点] [人物动作/位置变化] + [环境/道具变化] + [光线/色调变化]
示例(5秒镜头):
[0-1.5s] 她的手从方向盘上抬起 → 按下红色按钮 → 车内光线从暖黄变冷蓝
[1.5-3s] 按钮按下 → 排气口开始有微弱蓝光 → 引擎声降低
[3-5s] 蓝光突然爆发 → 车身轻微后坐 → 冷光蔓延到挡风玻璃
模型自动添加内容的规律
当密度不足时,模型会:
密度不足 → 模型补充内容 → 问题:
① 人物开始无意义眨眼/呼吸
② 背景出现无关人物走动
③ 镜头开始无目的摇移
④ 色调莫名其妙变化
⑤ 出现不该出现的水印/文字
Must-Have 原则
每个镜头必须明确:
【镜头核心】[这场戏最值钱的1句话]
【目标物Must-Show】[必须出现的元素,逗号分隔]
【禁止出现】只在需要规避特定元素时写,比如:
- 特写镜头不需要背景有人走动
- 干净的产品镜头不允许干扰元素
- 某些情绪戏不需要无关动作
示例(普通剧情镜头):
【镜头核心】按钮按下瞬间的能量聚集
【目标物Must-Show】红色按钮 | 手指关节发白 | 幽蓝火焰
示例(需要规避背景干扰的特写):
【镜头核心】她的眼眶泛红到眼泪落下
【目标物Must-Show】眉毛内侧向上抬 | 泪珠滑过颧骨 | 嘴角微微颤动
【禁止出现】背景有人走动 | 任何闪烁光源 | 画面边缘出现文字
原则:背景有人动是真实的,不需要禁止。 只有当它干扰核心表达时才写禁止。
二、镜头类型与情绪节奏
| 类型 | 时长 | 适用场景 | 特征 |
|---|---|---|---|
| D | 2-4s | 情绪冲击/爆发点 | 单一情绪,信息密度最高 |
| C | 4-8s | 情绪推进/过渡 | 起承转合,需要发展 |
| B | 8-15s | 情绪铺垫/蓄力 | 缓慢建立,需要耐心 |
| A | 15s+ | 情绪曲线完整 | 起→承→转→合,完整弧线 |
情绪节奏曲线:
蓄力型(先慢后快):[0-30%平稳] → [30-60%微变] → [60-90%加速] → [90-100%爆发]
爆发型(先静后惊):[0-20%沉默] → [20-40%暗涌] → [40-70%骤变] → [70-100%释放]
平推型(持续压迫):[0-100%均匀递增]
消退型(渐行渐远):[0-30%高潮] → [30-70%缓降] → [70-100%余韵]
分镜衔接类型:
| 衔接 | 适用场景 | 示例 |
|---|---|---|
| 硬切 | 情绪突变,下一镜是独立冲击 | 按钮按下→世界炸开 |
| 叠化 | 情绪延续,时间流逝 | 火焰燃烧→火焰更大 |
| 续接 | 同一动作的连续 | 上一镜手抬起→下一镜手到达顶点 |
三、导演开场白(必须写)
像导演在剧本上的场记。写的是画面序列,不是情绪或原因。
【导演开场白】
谁:在哪里/做什么
画面序列:[0-3s]画面A → [3-6s]画面B → [6-10s]画面C
情绪节奏:[蓄力型/爆发型/平推型/消退型]
衔接方式:[硬切/叠化/续接]
视觉基调:[影调名称,如"王家卫"或"北野武"]
**示例:**
谁:德比斯驾驶820RR在最后直道 画面序列:[0-3s]两车并排冲出弯道,蓝焰稳定输出 → [3-6s]按钮按下,世界先静默一秒,然后蓝焰爆发 → [6-10s]820掠过红车,格子旗挥动 情绪节奏:爆发型 衔接方式:硬切 视觉基调:北野武 + ARRI Alexa 青橙
---
## 四、全局空间锚点卡(必须写)
建立整场戏的坐标系。
【全局空间锚点卡】 固定参照物:______ 人物初始站位:______ 座次排列:______ 续接铆钉:______(如有上一镜,说明承接关系)
---
## 五、多参照挂载(多参方法核心)
多参照的本质:**图片锚定静态,文字驱动动态**。
挂载:@角色图 / @场景图 / @音频 (@音频:仅在有角色对白时使用,用于参考说话音色)
| 挂载类型 | 说明 | 来源 |
|----------|------|------|
| @角色图 | 角色形象参考 | MJ/即梦生成的角色参考图 |
| @场景图 | 场景/氛围参考 | MJ/即梦生成的场景参考图 |
| @音频 | 角色说话音色参考 | 仅在有对白时使用 |
### 即梦平台 @引用规则(Seedance 2.0)
在即梦平台生成时,@引用必须使用官方命名,否则无法识别:
| 类型 | 官方命名 | 数量上限 |
|------|----------|----------|
| 图片 | `@图片1`、`@图片2`、...、`@图片9` | 9 张 |
| 视频 | `@视频1`、`@视频2`、`@视频3` | 3 个 |
| 音频 | `@音频1`、`@音频2`、`@音频3` | 3 个 |
| **混合上限** | 图片+视频+音频合计 | **12 个** |
**禁止使用** `@img1`、`@video1`、`@audio1` 等英文命名。
**编号分配原则:**
1. 公共素材从 `@图片1` 开始依次编号
2. 版本独立素材(首帧、尾帧)在公共素材编号之后递增
3. 每个素材标注用途,方便用户对照上传
4. 写清楚是「参考」(借鉴风格/动作)还是「编辑」(在原素材上修改)
**常用引用写法:**
@图片1为首帧 参考@视频1的运镜效果 背景音乐参考@音频1 将@视频1延长5s
### 即梦平台限制
- **单次生成上限 15 秒**,超出需分段拼接
- **不支持写实真人脸部素材**,系统自动拦截
- 有参考视频时消耗更多算力
- 视频延长时,生成时长选"新增部分"的时长(延长5秒就选5秒)
### 多参方法的分工原则
图片提供:人物外观、场景基调、静态构图、光线质感 文字补充:时间推进中的变化、运动轨迹、因果外化
| 图片能提供 | 文字必须补充 |
|-----------|-------------|
| 人物外观 | 表情的微小变化(眉头动了一下) |
| 场景布局 | 相机运动和视角变化 |
| 光线基调 | 光影的动态变化(从哪到哪) |
| 物体位置 | 物体的运动轨迹 |
| 颜色风格 | 颜色的渐变或突变 |
| 材质质感 | 动态中的质感变化(如水面抖动) |
### 文字与图片的配合规则
**1. 避免冲突**
❌ 图片:侧脸,文字:正面特写(冲突) ✅ 图片:侧脸特写,文字:从侧脸转向正面(连续)
❌ 图片:白天场景,文字:夜色渐暗(冲突) ✅ 图片:黄昏场景,文字:天色从金黄渐变成深蓝(连续)
**2. 明确引用图片元素**
让模型知道文字是在图片基础上的延伸:
✅ 挂载:@角色图:张雪正面,表情平静 / @场景图:维修区 文字:她的眉头动了一下——不是皱眉,是某种轻微的变化, 像平静水面下的暗流。
✅ 挂载:@场景图:维修区冷光角落,右侧有排气管 文字:左侧的阴影向右侧蔓延——光线比张雪的动作更快。
**3. 多图片的主次关系**
主参考(决定70%视觉):@角色图 次参考(决定30%视觉):@场景图
文字描述应该主要补充主参考没有的信息。
**格式:**
挂载:@角色图:张雪,26岁短发工作服侧脸特写 / @场景图:维修区冷光角落 Audio:冷却嘀嗒声放大 / 引擎咆哮金属过载
---
## 六、镜头单元结构
每个分镜包含:
【分镜N|时长】 挂载:@角色图 / @场景图 Audio:[音效/BGM描述,含时间节点] FORMAT:[时长] / [镜头数] / [对话] / [画幅] STYLE:[影调] + [机型] + [质感代号]
【本分镜提示词】 [时间] [画面描述——模型能看到的具体视觉元素和变化] [时间] [画面描述——模型能看到的具体视觉元素和变化] [时间] [画面描述——模型能看到的具体视觉元素和变化]
【镜头核心】[1句话:这场戏最值钱的是什么] 【目标物Must-Show】[必须出现的元素] 【续镜衔接】[下一镜的开头如何承接这一镜的结尾]
### 续镜衔接
每个分镜的结尾要留有承接点,让下一镜能自然续上。
分镜01结尾:德比斯的手离开按钮 → 分镜02开头:按钮已经被按下(续接)
分镜01结尾:蓝焰喷涌而出 → 分镜02开头:蓝焰吞没车身(叠化/续接)
分镜01结尾:格子旗挥动 → 分镜02开头:彩带飘落(硬切,情绪独立)
**衔接方式:**
| 衔接 | 描述 | 适用 |
|------|------|------|
| 续接 | 同一动作/元素的连续 | 分镜01手抬起 → 分镜02手到达顶点 |
| 叠化 | 前一镜的延续 | 火焰燃烧 → 火焰更大 |
| 硬切 | 情绪独立,下一镜是新的冲击 | 爆炸 → 平静的下一个场景 |
---
## 七、白梦客美学系统
### 通用线(故事/情绪/概念短片)
融合:胡金铨 + 王家卫 + 北野武 + 李安
色调:大地色50% + 苍青20% + 琥珀霓虹20% + 饱和红10% 光影:侧逆光+烟雾70% + 霓虹漫射30% 构图:前景遮挡+极简留白 + 情绪元素点缀 节奏:长镜头留白70% + 抽帧慢动作20% + 硬切断刀10% 质感:RED V-Raptor 8K / 35mm / F003质感 / 霓虹/烟雾 / T2.8 / 9:16
### 高定线(高端品牌广告)
融合:Apple + Chanel/Dior + 北野武 + 李安
色调:黑白40% + 大地灰20% + 冷白20% + 克制金/铜20% 光影:自然光50% + 单一致光源30% + 极轻霓虹20% 节奏:长镜头凝视60% + 静默留白30% + 偶尔快切10% 质感:Sony Venice 2 / 50mm / F005质感 / 自然光 / T2.8 / 16:9
---
## 八、影调库(17种)
引用格式:在STYLE中写`[影调名称]`
| 影调 | 原典 | AI速写参数 |
|------|------|------------|
| Kodak Vision3 500T | 《1917》 | teal-orange + warm highlight + film grain |
| Fuji Pro 400H | 富士400H | cream highlight + teal shadow + soft |
| Leica M9 CCD | 徕卡M9 | orange-red + vignette + painterly |
| ARRI Alexa 青橙 | 《银翼杀手2049》 | teal-orange + log contrast + cinematic |
| Wes Anderson | 《布达佩斯大饭店》 | candy color + symmetry + pastel |
| Nolan IMAX | 《星际穿越》 | bleach bypass + cold blue + IMAX |
| Dune 沙丘 | 《沙丘》 | desert gold + cold violet + muted |
| 王家卫 | 《花样年华》 | soft focus + neon flare + vignette |
| 北野武 | 《坐头市物语》 | high contrast + cold blue + crush |
| 岩井俊二 | 《情书》 | soft diffusion + cool blue + overexpose |
| 滨口龙介 | 《驾驶意外》 | natural contrast + neutral gray |
| Film Noir | 《双重赔偿》 | B&W + high contrast + chiaroscuro |
| Cyberpunk | 《银翼杀手》 | neon purple-cyan + wet reflection |
| 70s复古 | 70s Technicolor | sepia + soft focus + warm blow |
| 白梦客通用线 | 胡金铨+王家卫+北野武+李安 | earth + cyan + amber neon |
| 白梦客高定线 | Apple+Chanel/Dior+北野武+李安 | BW gray + cold white + restrained gold |
**使用方式:** 在STYLE中引用影调名称,如:
STYLE: 北野武 + ARRI Alexa Mini LF + F002质感 色调:teal-orange + warm highlight(引用影调参数)
### 影调混用
当需要两种影调混合时,说明哪个是主导、哪个是辅助:
STYLE: 北野武(70%)+ 王家卫(30%) 色调:北野武的high contrast + cold blue,叠加王家卫的soft focus + neon flare
STYLE: 白梦客通用线(80%)+ Film Noir(20%) 色调:earth + cyan + amber neon,压暗边缘增加film noir的chiaroscuro感
**混用格式:**
主导影调(XX%)+ 辅助影调(XX%) 色调:[主导影调参数],叠加[辅助影调特征]
---
## 九、技术参数
### 机型系统
| 机型 | 特点 | 适用场景 |
|------|------|----------|
| ARRI Alexa Mini LF | 电影级宽容度,柔和高光 | 剧情片、高端广告 |
| RED V-Raptor 8K | 高分辨率、锐利细节 | 科幻、动作 |
| Sony Venice 2 | 优异高感、电影化色调 | 夜景、情绪片 |
| Blackmagic 6K Pro | 性价比、电影纹理 | 独立制作 |
### 质感代号
| 代号 | 组合 | 视觉特征 |
|------|------|----------|
| F001 | ARRI Alexa Mini LF / 5207日光片 / 3200K | 柔和高光、奶滑肤色 |
| F002 | ARRI Alexa Mini LF / 500T夜片 / 5600K | 浓郁色彩、高光溢出 |
| F003 | RED V-Raptor / K53 Export / 柔光箱 | 锐利、高对比 |
| F004 | Sony Venice / Cine EI / 800ISO | 优异高感、干净暗部 |
### 镜头焦段
| 焦段 | 视角 | 适用场景 |
|------|------|----------|
| 14mm/16mm | 超广角 | 建筑、车内、压迫感 |
| 24mm | 广角 | 环境人像、空间感 |
| 35mm | 标准广角 | 叙事镜头,自然透视 |
| 50mm | 标准 | 最接近人眼 |
| 85mm | 人像 | 背景虚化、空气感 |
| 100mm/135mm | 长焦 | 压缩感、特写 |
---
## 十、提示词书写核心原则
### 铁律:写看到的,不写想到的
视频模型处理的是像素,不是心理活动。
❌ 紧张(模型不懂这是什么画面) ✅ 手指在方向盘上收紧,关节处发白;额头有汗珠滑下;呼吸带着胸腔起伏
❌ 她感到绝望(模型不懂什么是绝望的表情) ✅ 她的眼睛慢慢从画面中心移开,落在某个空白处;手从某人身上缩回
❌ 世界安静了(模型不懂"安静"是什么视觉元素) ✅ 声音渐弱直到消失;背景的轮廓变得清晰;空气像凝固了
### 视觉变化 > 静态描述
模型理解的是变化,不是状态。
❌ 两车并排,引擎声很大(静态描述) ✅ 两车并排,引擎声浪交织——一个低沉稳定地输出,一个尖锐暴躁地喘息
❌ 灯光变冷(静态描述) ✅ 光从暖金变成冷蓝,被她的影子压过去,阴影边缘变得锐利
❌ 蓝焰喷射(静态描述) ✅ 蓝焰从排气口喷出,从细变粗,从安静到爆发,火焰边缘在慢动作里撕裂空气
### 具体细节让模型匹配到正确的视觉模式
模型学的是千万个"画面+文字"的对齐。越具体,它越能匹配到正确的模式。
❌ 火焰(太模糊,模型可能匹配到任何火焰) ✅ 幽蓝火焰从排气口喷涌而出,火焰根部比边缘更亮,边缘有细碎的火星散落
❌ 手在发抖(太模糊) ✅ 手指在方向盘上微微抖动,腕关节处的青筋在皮肤下跳动
❌ 表情痛苦(太模糊) ✅ 眉头皱在一起,嘴角往下拉,眼眶边缘有细纹
### 环境变化是情绪的外化
模型不理解"情绪",但它能理解"环境变化"。
人物做动作 → 环境发生变化 → 这就是情绪的视觉表现
人物离开庆典走进维修区 → 光从暖金变成冷蓝,背景从模糊变清晰 人物踩下油门 → 车身震动,背景快速后退,景深变浅 人物感到恐惧 → 呼吸变快导致的肩膀起伏,手电筒的光在抖
### 禁止项(必须遵守)
**模型无法处理以下内容:**
❌ 任何文字:中文、英文、logo、水印、字幕 ❌ 直接的情绪标签:紧张、愤怒、悲伤、快乐 ❌ 抽象概念:自由、希望、梦想、时间 ❌ 模糊的因果:因为他很紧张所以发抖 ❌ 未量化的变化:灯光变亮、声音变大、速度变快
---
## 十一、模型能识别的视觉要素
### 1. 运动轨迹要具体
模型对运动方向和轨迹敏感。
❌ 手在动(模糊) ✅ 手从方向盘上抬起,划过画面,从左到右,轨迹带着汗水的反光
❌ 火焰喷射(模糊) ✅ 火焰从右侧向左侧喷出,弧线轨迹,边缘有火星拖尾
### 2. 材质和表面细节
模型能识别材质特征。
❌ 金属(太泛) ✅ 拉丝金属表面,有细微的平行线纹理,边缘有倒角反光
❌ 皮肤(太泛) ✅ 额头皮肤有细微毛孔,汗珠在上面滚动时有折射
### 3. 光影变化的精确描述
不是"灯光变",而是具体的明暗、色温、光源位置。
❌ 灯光变暗(模糊) ✅ 主光源从画面右侧移开,高光从右脸转移到左脸,阴影覆盖60%的面部
❌ 霓虹灯效果(模糊) ✅ 青色霓虹从画面底部向上漫射,在皮肤表面形成条状高光,边缘有紫色溢出
### 4. 景深和焦点
帮助模型理解清晰/模糊的区域。
❌ 背景虚化(模糊) ✅ 焦点落在人物眼睛上,前景的手和背景的墙都在焦外,轮廓有渐变的模糊边缘
❌ 浅景深(模糊) ✅ f/1.4大光圈效果,主体清晰,背景散成圆形光斑,边缘有棱角
### 5. 时空连续性
描述帧与帧之间的过渡,帮助模型保持一致性。
❌ 镜头切换(模糊) ✅ 上一帧的手在右侧,下一帧移动到左侧,中间有运动模糊轨迹连接
❌ 火焰持续(静态) ✅ 火焰在第1帧很小,第3帧突然变大30%,第5帧达到最大,边缘在抖动
### 6. 视角和构图
明确相机位置和角度。
❌ 低角度拍摄(模糊) ✅ 相机高度在膝盖以下,向上仰拍,建筑的垂直线在画面里向上延伸汇聚
❌ 特写镜头(模糊) ✅ 画面只包含脸部从眉毛到下巴,额头占画面的40%,眼睛在焦点中心
### 7. 纹理和质感
具体的表面特征。
❌ 旧墙(模糊) ✅ 墙面有剥落的涂料,露出底下的灰泥,有裂纹从左上向右下延伸,边缘有阴影
❌ 脏的表面(模糊) ✅ 金属表面有指纹痕迹,油污在顶部形成不规则的深色斑块,有氧化产生的红褐色边缘
### 8. 遮挡和层次
物体间的前后关系。
❌ 有人走过(模糊) ✅ 人物从背景走向前景,比例从15%增加到80%,在第3秒时完全遮挡背后的门
❌ 烟雾遮挡(模糊) ✅ 烟雾从画面右侧向左漫射,第2秒覆盖到人物肩膀,第4秒完全遮挡脸部,只露出眼睛
### 9. 人物站位和走位
模型对人物在画面中的位置变化敏感。
❌ 人物走进画面(模糊) ✅ 人物从画面右侧边缘进入,第1秒时占画面10%,第3秒时移动到画面中心占60%
❌ 人物靠近(模糊) ✅ 人物从占画面15%逐渐增大到50%,脸部的毛孔和皮肤细节逐渐清晰
❌ 两人对话(模糊) ✅ 两人脸部分别占画面左侧和右侧,各占25%,中间留有50%的背景空间
❌ 背对观众(模糊) ✅ 人物背部占画面中心,头发遮住后颈,肩胛骨轮廓透过薄布料隐约可见
❌ 侧脸(模糊) ✅ 人物侧脸占画面右侧60%,可见颧骨到下颌的线条,睫毛在脸颊上投下阴影
**人物方位坐标系(九宫格 + 纵深)**
┌─────────────────────────────────────────────────────┐ │ 左上角 上方中心 右上角 │ │ LEFT-TOP TOP-CENTER RIGHT-TOP │ │ │ │ 左侧中心 画面中心 右侧中心 │ │ LEFT CENTER RIGHT │ │ │ │ 左下角 下方中心 右下角 │ │ LEFT-BOT BOT-CENTER RIGHT-BOT │ └─────────────────────────────────────────────────────┘ ↑ 纵深变化 FRONT(前/靠近)←→ BACK(后/远离)
**常用站位模板:**
| 站位 | 占画面比例 | 适用场景 |
|------|-----------|---------|
| 中心特写 | 80%+ | 情绪爆发、内心戏 |
| 中心胸像 | 50-60% | 对话、反应 |
| 偏心(左侧/右侧) | 60-70% | 单人叙事、留白 |
| 二人对话(左/右) | 各25-30% | 对话、对比 |
| 三人三角 | 主体50%/辅助各20% | 三角关系 |
| 背影/后景 | 60-80% | 悬念、诗意 |
| 纵深(从远到近) | 10%→80% | 走近、强调 |
**走位变化模板:**
入门型:画面边缘(10%) → 画面中心(60%) [从右向左/从左向右] 离开型:画面中心(60%) → 画面边缘(10%) [向画面外走去] 纵深型:远处小(10%) → 近处大(80%) [向镜头走来] 横穿型:左侧(10%) → 右侧(90%) [穿过画面] 对峙型:左侧(30%) ←距离→ 右侧(30%) [中间留40%空间] 环绕型:围绕画面中心移动,保持60%占幅
**两人对话走位变化:**
正反打:左(30%) ↔ 右(30%) [视线交汇在画面中心] 并肩型:左前(35%) + 右后(30%) [一前一后] 背反打:背影(60%) ↔ 正面(40%) [说话者背对,被说话者面向镜头] 过肩型:后方人物占20%(肩膀入画),前方人物占40%
### 10. 常见模糊词转化表
| 模糊词 | 模型能理解的具体描述 |
|--------|---------------------|
| 紧张 | 手指收紧发白、喉结滚动、额头冒汗、呼吸起伏加快、嘴唇抿成一条线 |
| 放松 | 肩膀下沉、嘴角微微上扬、眼睛半闭、手臂自然下垂靠在身侧 |
| 愤怒 | 眉头下压皱紧、嘴角向下拉、手握拳青筋凸起、胸部剧烈起伏 |
| 悲伤 | 眼皮下垂、嘴角向下、泪珠从睫毛滑落、肩膀微微颤抖、手无力垂下 |
| 快乐 | 眼尾纹、嘴角上扬露出牙齿、眉毛弯成弧形、身体轻微晃动 |
| 恐惧 | 瞳孔放大、眼白占比增加、嘴唇微张、身体僵住向后仰 |
| 惊讶 | 眉毛抬高、眼睛睁大、嘴微微张开、身体向后微仰 |
| 沉思 | 眼神聚焦在某处不动、眉头微皱、手指轻敲下巴、身体静止 |
| 犹豫 | 眼神在两个方向之间移动、手悬在半空、脚步停顿、重心左右转移 |
| 孤独 | 人物独自处于画面边缘、周围大面积空白、身体蜷缩占画面很小比例 |
| 压抑 | 室内空间狭小、天花板压低、人物头顶贴近画面边缘、光线暗淡 |
| 速度感 | 横向运动模糊、背景线条向后快速拉伸、景深极浅、主体周围有速度线 |
| 力量感 | 低角度仰拍、主体占据画面上方60%、垂直线条占据主导 |
| 柔光 | 边缘渐变模糊、光线穿透薄窗帘在地面形成光斑、人像轮廓有光晕 |
| 硬光 | 边缘锐利的阴影、亮部与暗部明显分割、皮肤表面有强烈反光 |
| 冷调 | 蓝色色偏、阴影偏青、高光偏冷白、暗部不死黑有细节 |
| 暖调 | 黄色/橙色偏、阴影偏橙、皮肤有健康红润感、整体氛围温暖 |
### 11. 微表情描述
微表情是AI最难理解的细节,需要用肌肉运动描述。
**核心方法:描述肌肉运动的起点和终点**
❌ 惊讶的表情(太泛) ✅ 眉毛内侧突然向上抬,抬高约2-3mm,上眼皮向上离开瞳孔边缘
❌ 恐惧的表情(太泛) ✅ 眉毛内侧向上拉并聚拢,额头的横纹从2条变成4条,眼睛睁大到眼白露出
❌ 愤怒(太泛) ✅ 眉毛下压聚拢,眉心出现一道竖纹,咬肌在动但下颌没有完全咬死
**用对比描述(从X变成Y)**
❌ 她的表情变了(模型不知道变成什么) ✅ 下颌从紧绷变成松开,嘴唇从抿成一条线变成微微张开
❌ 眼神里有情绪(模糊) ✅ 瞳孔从放大突然收缩回正常大小,眼球从直视变成微微向旁侧移
**结合时间标记(微表情持续0.2-0.5秒)**
✅ 第1帧:眉毛内侧开始向上抬 第3帧:到达最高点,抬高约2mm 第5帧:开始回落 全程约0.3秒
✅ 按下按钮的瞬间,她的眼睛眨了一下——不是正常的眨眼, 是那种持续了0.2秒的僵硬,然后恢复正常
**常见微表情的具体描述**
| 微表情 | 具体描述 |
|--------|----------|
| 惊讶 | 眉毛内侧向上抬2-3mm,上眼皮向上离开瞳孔,眼白露出增加,嘴巴微微张开 |
| 恐惧 | 眉毛内侧向上拉且聚拢形成三角,额纹出现,眼睛睁大到眼白占30% |
| 愤怒 | 眉毛下压聚拢,眉心出现一道竖纹,咬肌凸起,下颌紧闭 |
| 悲伤 | 眉毛内侧向上抬像小狗眼,嘴角向下拉,眼眶有湿润感 |
| 厌恶 | 眉毛下压,鼻子皱起横纹,上唇向上卷起,脸颊向上推 |
| 轻蔑 | 一侧嘴角先向上抬,比另一侧高约1-2mm,眼睛微微眯起 |
| 犹豫 | 眼神在两个方向之间移动,瞳孔在两个焦点之间调整,眨眼比正常慢 |
| 掩饰 | 笑容在嘴角出现但眼轮匝肌没有参与,眼角没有皱纹,笑容不对称 |
**情绪组合(真实的情绪很少是单一的)**
❌ 愤怒(太单一) ✅ 眉毛下压但眉心没有完全皱紧,咬肌在动但下颌没有完全咬死——在压制的愤怒
❌ 悲伤(太单一) ✅ 眼眶红了但在掉眼泪之前停住,嘴角向下拉但没有抖动——还没有哭出来的悲伤
❌ 惊讶+恐惧(太泛) ✅ 眼睛睁大,瞳孔却收缩——睁大眼睛是在看,瞳孔收缩是在认出了什么
**微表情与环境配合**
✅ 她的下唇被牙齿轻轻咬住,约0.3秒后松开,嘴唇回到原位 同时周围的声音消失——像世界在她脸上那一刻静止了
✅ 眉头皱了0.2秒就松开,但嘴角的弧度变了——像有什么东西在心里闪了一下
### 12. 镜头运动描述
模型能理解镜头运动带来的视觉变化。
**运镜三级进阶(即梦/Seedance适用):**
| 级别 | 内容 | 示例 |
|------|------|------|
| Level 1 基础动作 | Pan/摇移、Dolly/推轨、Zoom/变焦、Crane/升降、Orbit/环绕、Tracking/跟踪 | 覆盖80%需求 |
| Level 2 修饰词 | 速度(Smooth/Slow/Fast)、情绪(Cinematic/Dreamy/Aggressive)、风格(Handheld/Aerial/POV) | Smooth Dolly In |
| Level 3 组合技 | 2-3个运镜叠加,用`+`连接,一次不超过3个 | Orbit + Zoom In |
| **Level 4 镜头质感修饰(隐藏层级)** | 在运镜动作之外叠加镜头本身的物理状态 | 见下表 |
**镜头质感修饰词库(区分普通视频和大制作质感的关键):**
| 效果 | 关键词 | 适用场景 |
|------|--------|----------|
| 镜头附着物 | 雾水珠附着镜头前、雾粒粘镜细节清晰、雨滴溅到镜头、水珠在镜头前滚动 | 雨景、雾景、水下 |
| 光学畸变 | 镜头畸变效果、雾层折射、超广角边缘畸变 | 广角镜头、超现实 |
| 镜头震动 | 镜头剧烈抖动、能量波动震动镜头、爆炸冲击波震动镜头 | 爆炸、冲击、动作 |
| 镜头耀斑 | 镜头耀斑(lens flare)、逆光眩光、光斑散射 | 逆光、强光源 |
这类"不完美"效果反而大幅提升真实感和沉浸感。
❌ 镜头推进(模糊) ✅ 相机从距离人物5米逐渐移动到1米,人物在画面中从占20%增大到占80%,背景逐渐虚化
❌ 镜头拉远(模糊) ✅ 相机从距离人物1米后退到5米,人物在画面中从占80%缩小到占20%,背景从虚化变成清晰
❌ 摇镜头(模糊) ✅ 相机从左侧人物缓慢转向右侧人物,横向移动约90度,过程保持人物在焦内
❌ 手持晃动(模糊) ✅ 画面边缘有轻微的随机位移,周期约0.3秒,幅度在5像素内,偶尔有呼吸般的上下浮动
❌ 升格镜头/慢动作(模糊) ✅ 每秒24帧的画面用120帧拍摄,水花在空中停留时间变长,边缘有拖影
---
## 十二、声音设计
声音是视觉序列的"第二轨道"。画面和声音的节奏必须绑定:画面快→声音快/留白;画面慢→声音简化/留白。
### 核心原则
| 画面节奏 | 声音策略 | 原因 |
|---------|---------|------|
| 上升 | 声音逐渐叠加(+layer) | 跟随情绪积累 |
| 高峰 | 留白或突然切断 | 情绪顶点,不需要再加码 |
| 下降 | 声音简化(-layer) | 余韵,不要过度 |
| 静止 | 留白或纯环境音 | 让观众呼吸、消化 |
### 情绪节奏与声音配合
| 画面节奏 | 声音策略 | 典型场景 |
|---------|---------|---------|
| 上升 | 声音逐渐叠加 | 情绪积累、追逐、紧张升级 |
| 高峰 | 留白或突然切断 | 情绪顶点、爆发、揭示 |
| 下降 | 声音简化 | 情绪余韵、结局 |
| 静止 | 留白或纯环境音 | 呼吸、消化、诗意时刻 |
### 镜头运动与声音响应
| 镜头运动 | 声音响应 |
|---------|---------|
| 快切/跳切 | 声音也跳、节奏感强 |
| 慢推 | 声音渐强或渐弱 |
| 拉远 | 声音淡化、空间感 |
| 固定镜头 | 声音稳定、留白机会 |
| 摇镜 | 声音跟随摇动方向 |
### 剪辑节奏与声音密度
| 剪辑节奏 | 声音策略 |
|---------|---------|
| 快剪(1-3秒/镜) | 音乐节奏强、音效密集 |
| 正常剪(3-8秒/镜) | 声音正常、留白机会多 |
| 慢剪(8秒+/镜) | 声音简化、大量留白 |
### Audio写法模板
Audio: [时间节点]描述 | [时间节点]描述 | [时间节点]描述
**示例:**
Audio: 按钮按下瞬间静默(0-1s) → 咆哮爆发+金属过载音(1-3s) Audio: 模糊欢呼(背景) → 张雪轻说(清晰) → 合伙人低沉质问(压迫) Audio: 引擎低沉稳定(0-2s) → 转速拉升音调升高(2-3s) → 爆裂截止(3s)
### 七种情绪的声音策略
| 情绪 | 上升 | 高峰 | 下降 | 静止 |
|------|------|------|------|------|
| 哀·消逝 | 弦乐渐强 | 突然切断/淡出 | 简化/环境音 | 完全留白 |
| 喜·重生 | 音乐渐强 | 留白或切断 | 简化 | 短留白 |
| 怒·暴烈 | 加速+打击乐叠加 | 突然切断 | 突然安静 | 完全留白 |
| 惧·不安 | 低频持续+高频叠加 | 切断+留白 | 低频持续但淡化 | 低频/白噪 |
| 爱·亲密 | 弦乐渐强 | 留白或淡出 | 简化/心跳 | 留白或极简 |
| 恶·排斥 | 不和谐音/低频 | 突然切断 | 简化 | 留白 |
| 欲·执念 | 循环元素渐强 | 留白或切断 | 简化 | 留白+低频 |
### 实用场景对照
| 场景 | 画面节奏 | 推荐声音策略 |
|------|---------|------------|
| 追逐戏 | 快→更快→顶峰 | 声音随镜头加速,高峰留白 |
| 告白戏 | 慢推近→特写 | 音乐渐强,高峰留白 |
| 车祸/意外 | 快切→静止 | 突然切断+长留白 |
| 悬疑揭示 | 慢剪→定格 | 声音先停,悬念留白 |
| 诗意结尾 | 慢剪→淡出 | 全程留白,声音逐渐消失 |
| 战斗爆发 | 快切+升格 | 声音顶峰突然切断 |
| 梦中场景 | 慢+超现实 | 声音变形+长留白 |
### 留白时机决策
声音回来的时机决定情绪走向:
□ 情绪顶点后立即回来 = 延续紧张 □ 情绪顶点后留白2-3秒 = 让观众消化 □ 情绪顶点后留白5秒+ = 诗意/仪式感 □ 下一镜开始才回来 = 情绪独立,硬切感
---
## 十三、史诗大制作结构(高品质视觉作品专用)
适用于科幻/灾难/奇幻/动作等需要大制作质感的视频。与基础结构的核心差异在四个层级:
[时长][品质锚定:渲染引擎+画质规格+VFX等级],[核心氛围宣言:美学风格+整体感受], [大气连贯声明:全片统一的物理/氛围效果,如"每帧都有薄雾弥散效果"],
0-Xs:[画面动作] + [运镜] + [可选逐段帧率,如"慢镜头120帧/秒"] + [大气在本段的具体表现]; ...(时间戳分镜继续)...
光影:[①光源:主光类型和角度] + [②光行为:如何影响大气/材质] + [③色调:冷暖对比], [收束句:后期处理词叠加] + [张力宣言:一句话锚定全片情绪]。
### 四个核心层级说明
**1. 品质锚定**(开头声明,效果远优于泛词"电影感")
| 类别 | 关键词 |
|------|--------|
| 渲染引擎 | UnrealEngine5渲染、Octane物理渲染引擎、V-Ray光追渲染 |
| 画质规格 | 8K超高清、4K超采样、IMAX级画质 |
| HDR标准 | 杜比视界HDR、HDR10+ |
| VFX等级 | 工业光魔级VFX特效、好莱坞A级特效、漫威级视觉特效 |
**2. 大气连贯声明**(防止不同分镜氛围断裂,史诗风格的核心句)
全程暴雨倾盆,镜头前附着雨水珠肌理,每帧都有自然的雨雾弥散效果
**3. 光影三层结构**(三层各司其职,效果远优于泛写"好莱坞光影")
光影:暴雨逆光+爆炸橙红火光(光源层), 薄雾柔化高光但强化阴影对比、丁达尔效应清晰(光行为层), 冷蓝底调+熔岩红高光(色调层)。
| 风格 | 光源层 | 色调层 |
|------|--------|--------|
| 灾难/压迫 | 暴雨逆光+爆炸橙红 | 冷蓝底调+熔岩红高光 |
| 赛博朋克 | 霓虹灯漫射+防空警报红光 | 冷蓝底调+霓虹紫红高光 |
| 奇幻/仙侠 | 怪兽熔岩自发光+荧光酸液光 | 暗青底调+金色/荧光高光 |
**4. 收束句**(后期处理词 + 张力宣言,为全片定格情绪)
暗角+胶片颗粒+电子噪点混雾粒收尾,窒息式压迫感+诡谲朦胧氛围,无冗余画面,全程高张力。
| 风格 | 收束句示例 |
|------|-----------|
| 压迫/灾难 | 窒息式压迫感+诡谲朦胧氛围,无冗余画面,全程高张力 |
| 科幻/未来 | 冰冷机械美学,每帧可截图成壁纸,镜头感拉满 |
| 仙侠/奇幻 | 仙气飘渺,如梦似幻,全程不要现代感痕迹 |
| 动作/热血 | 肾上腺素拉满,节奏紧绷,剪辑感强烈 |
---
## 十三·五、传播技巧(短视频实战)
**前2秒是生死线**:短视频信息流中用户滑动决策不到2秒。最震撼的视觉放在开头,禁止用"缓缓推进"开场。
| 原则 | 说明 |
|------|------|
| 前2秒生死线 | 最震撼的视觉放开头,禁止"缓缓推进"开场 |
| 一个视频一件事 | 15秒内只做一个核心概念,越简单模型执行越精准 |
| 参考素材 > 纯文本 | 大部分优质AI视频都用了首帧图或参考视频引导 |
| 不要在15秒里讲故事 | ≤15秒的本质是"一个不可能的瞬间",不是微型电影 |
| 静→动突变 > 持续运动 | 一段静止中突然爆发一个动作,比全程运动更抓人 |
| 留"想看第二遍"的钩子 | 结尾呼应开头、隐藏细节、或视觉效果震撼到想确认真假 |
---
## 十四、完整提示词模板
【分镜N|时长】 挂载:@角色图 / @场景图 Audio:[音效/BGM描述,含时间节点] FORMAT:[时长] / [镜头数] / [对话] / [画幅] STYLE:[影调] + [机型] + [质感代号]
【本分镜提示词】 [时间] [画面描述——具体的视觉元素和变化] [时间] [画面描述——具体的视觉元素和变化] [时间] [画面描述——具体的视觉元素和变化]
【镜头核心】[1句话:这场戏最值钱的是什么] 【目标物Must-Show】[必须出现的元素]
禁止:任何文字、字幕、LOGO或水印
---
## 十五、优秀范例
### 范例:第16集蓝焰爆发
---
### 【导演开场白】
谁:德比斯驾驶820RR在最后直道 画面序列: [0-3s] 两道车影冲出弯道并排,820在外道,蓝焰细长稳定输出;红车在内道,火星零乱 [3-6s] 按钮按下,世界先静默一秒,然后蓝焰爆发,像深海里的什么东西苏醒 [6-10s] 820外侧掠过红车,瞳孔里映出蓝光,格子旗挥动 视觉基调:北野武 + ARRI Alexa 青橙
---
### 【全局空间锚点卡】
固定参照物:夜赛道长直道,两道车影并排冲出弯道 人物初始站位:820在外道(右侧),豪门红车在内道(左侧) 座次排列:双车并排占满画面,820略靠前 续接铆钉:首段建立
---
### 【分镜01|3s】
**挂载:** @角色图:820RR银色车身蓝焰输出 / @场景图:夜赛道长直道双车并排
**Audio:** 引擎轰鸣对比(820低沉稳定(0-1s),红车尖锐暴躁(1-3s))
**FORMAT:** 3s / single shot / no dialogue / 9:16
**STYLE:** 北野武 + ARRI Alexa Mini LF / F002质感 / teal-orange
**【本分镜提示词】**
[0-1s] 两道车影从弯道出口冲出。820在画面右侧占60%,红车在画面左侧占55%,两车之间有10%的间隙。 820尾部蓝焰细长,约占车身的1/8,焰心比边缘亮2档,边缘有细微的蓝色碎屑飘散。 红车尾部喷出的火星大小不一,在夜风里形成不规则的散射轨迹,约每0.2秒喷出一簇。
[1-2s] 两车引擎声浪在空间里交织。820的低频从画面中心向两侧扩散, 红车的高频尖锐刺耳,刺穿820的低频后在空气中形成短暂的回响。
[2-3s] 德比斯的脸在头盔内占画面80%。眉头下压,眉心距离缩短30%, 嘴角向下拉成一条直线。额角有汗珠从发际线滑向眉毛,关节处的青筋在皮肤下凸起。
**【镜头核心】** 两车并排的几何关系——外道稳定 vs 内道狼狈
**【目标物Must-Show】** 820RR银色车身 | 蓝焰稳定输出 | 红车杂乱火星 | 德比斯头盔内
---
### 【分镜02|3s】
**挂载:** @角色图:张雪手指贴红色按钮特写 / @场景图:排气口蓝焰爆发
**Audio:** 按钮按下瞬间静默(0-1s) → 咆哮爆发+金属过载音(1-3s)
**FORMAT:** 3s / single shot / no dialogue / 9:16
**STYLE:** 北野武 + RED V-Raptor 8K / F002质感 / cyan-blue冷光
**【本分镜提示词】**
[0-1s] 手指贴上红色按钮。按下。 一秒。两秒。三秒。 声音消失——背景的一切变得异常清晰,像凝固了。
[1-2s] 然后画面炸开。 幽蓝火焰从排气口喷出,第1帧只有2px,第3帧突然扩展到占车身1/3, 焰心比边缘亮3档,边缘有更亮的蓝色碎片向外飞溅。 冷光从车尾向车头蔓延,银色车身表面有蓝色的液体般的反光。
[2-3s] 引擎声音从低频的嗡鸣突然升级成撕裂金属的尖叫。 车身在画面里轻微后坐,火焰在第5帧时完全吞没整个车尾, 只剩下蓝色的光晕轮廓。
**【镜头核心】** 按钮按下的瞬间——能量从聚集到爆发
**【目标物Must-Show】** 820RR排气口蓝焰大股喷涌 | 银色车身被冷光浸透
---
### 【分镜03|4s】
**挂载:** @角色图:德比斯头盔内瞳孔映蓝光 / @场景图:蓝焰尾迹划过夜空
**Audio:** 引擎呼啸撕裂空气(0-2s) + 观众惊呼炸裂(2-4s)
**FORMAT:** 4s / single shot / no dialogue / 9:16
**STYLE:** 北野武 + RED V-Raptor 8K / F002质感 / 速度感
**【本分镜提示词】**
[0-2s] 外线视角。820在画面左侧占40%,红车在右侧占35%,两车间距在扩大。 蓝焰从820尾部喷出,在画面里拉成占宽度80%的长光线, 焰尾有更亮的蓝色碎屑形成3度角的拖尾。 德比斯头盔里的瞳孔占面部的30%,整个瞳孔被蓝光填满,虹膜边缘有亮线。
[2-3s] 蓝焰继续拉长。820从红车外侧掠过,两车间距在0.5秒内从15%扩展到40%。 红车在画面里从占35%缩小到15%,轮廓变虚,只剩下红色的光斑。
[3-4s] 820冲过终点线。格子旗在画面上方占20%,黑白格子在挥动时形成动态模糊。 彩色纸带从上方飘落,每条纸带占画面宽度5%,下落速度是正常速度的1/5, 边缘有从亮到暗的渐变。
**【镜头核心】** 瞳孔里的蓝光——整个世界都变成蓝色的了
**【目标物Must-Show】** 820外侧超越 | 蓝焰幻影尾迹 | 德比斯瞳孔映蓝光 | 格子旗
---
**禁止:** 任何文字、字幕、LOGO或水印
---
## 十六、分场景类型模板
### 场景类型速查
| 场景类型 | 重点 | 时长 | 情绪节奏 | 衔接 |
|---------|------|------|----------|------|
| 人物对话 | 两人站位、视线、距离 | 5-15s | 平推型 | 硬切 |
| 动作追逐 | 速度感、运动轨迹 | 3-8s | 爆发型 | 续接 |
| 情感内心 | 微表情、环境呼应 | 5-15s | 蓄力型 | 叠化 |
| 高定产品 | 克制、留白、质感 | 5-15s | 平推型 | 叠化 |
完整示例见:知识库 `02-创作方法论/A-视频生成专项/视频模型思维与提示词优化方法论.md`
---
## 十七、Schema结构化输出
### Schema字段
```json
{
"meta": {
"title": "项目名称",
"platform": "seedance",
"duration": 15,
"style_line": "高定线",
"director_style": ["王家卫", "北野武"]
},
"palette": {
"primary": "黑白40%",
"secondary": "大地灰20%",
"accent": "克制金20%"
},
"scenes": [...]
}
palette 默认值
| 风格线 | primary | secondary | accent |
|---|---|---|---|
| 高定线 | 黑白40% | 大地灰20% | 克制金20% |
| 通用线 | 大地色50% | 苍青20% | 琥珀霓虹20% |
平台化输出
| 平台 | 语言 | 格式 |
|---|---|---|
| Seedance | 中文优先 | [00:00-00:05] 镜头描述... |
| Vidu | 中英混合 | 风格词前置,| 分隔 |
| 海螺 | 中文 | 图生视频,动态预期描述 |
| Kling | 英文为主 | --duration --motion --camera 参数 |
Seedance示例:
高定线香水广告,[女子在极简空间],
[00:00-00:05] 远景建立,缓慢推近,自然光50%侧逆光,Kodak Ektachrome 1970s
[00:05-00:10] 中景凝视,固定镜头,克制金色点缀光源,过曝1/3档
[00:10-00:15] 远景拉远,背影剪影,渐隐fade to black
黑白40% 大地灰20% 冷白20% 克制金20%,16mm胶片,2.35:1
Vidu示例:
王家卫风格 电影感广告,优雅女子在极简空间,
Wong Kar-wai cinematic style, slow push-in, side-backlight,
黑白60% 金铜20% 苍青20%, Kodak Portra 800, light grain
| 烟雾弥漫 dreamy mist | 手部特写 wrist close-up |
Kling示例:
旗袍女子背影,雨夜上海街道,侧逆光,青灰与琥珀霓虹
handheld跟拍,中景,60%负空间
earth tones 50%, teal 20%, amber neon 20%
--duration 45 --motion MEDIUM --camera handheld --aspect 2.35:1
十七·五、质量检查清单(Schema)
- meta.platform 与 output.platform 一致
- scenes总时长 ≈ meta.duration
- palette 已按风格线配置
- lighting.direction 具体化
- camera.movement + angle + distance 三者完整
- rhythm百分比加起来≈100%
十七、质量检查清单
生成前检查:
□ 没有情绪标签(紧张/愤怒/悲伤)
□ 没有因果逻辑词(因为/所以/为了)
□ 没有抽象概念(希望/梦想/自由)
□ 没有文字/字幕/LOGO
□ 没有未量化的变化(变亮/变大/变快)
□ 画面描述具体到像素级(占画面X%、亮X档)
□ 时间节点明确(0-1s/1-2s/2-3s)
□ 运动轨迹描述清楚(从哪到哪/弧线/直线)
□ 环境变化有描述(不是孤立的人物动作)
□ 微表情有肌肉运动起点和终点
□ 续镜衔接有承接点
□ 禁止项全部检查
生成后评估:
□ 画面是否连续(没有跳帧)
□ 运动是否符合物理规律(没有违反重力)
□ 光影是否一致(光源位置、色温)
□ 角色一致性(人物外观是否保持)
□ 情绪外化是否自然(不是表情特写)
□ 是否有塑料拼贴感(边缘是否自然)
□ 信息密度是否合理(不是静态定格)
十八、长镜头分段生成策略
超过15秒的镜头建议分段生成:
原始需求:20秒完整镜头
分段策略:
分镜01:0-5s(建立场景+引入)
分镜02:5-10s(主体动作)
分镜03:10-15s(高潮/冲突)
分镜04:15-20s(收尾/落位)
分段原则:
- 每段5-8秒为宜
- 每段结尾要有承接点
- 使用相同STYLE保持一致性
- 分镜之间用硬切衔接
续接说明:
分镜01结尾:人物站在门口 → 分镜02开头:人物已经迈出第一步
分镜02结尾:手触到按钮 → 分镜03开头:按钮已经按下
分镜03结尾:火焰爆发 → 分镜04开头:火焰持续燃烧
十九、常见失败案例避坑
| 失败现象 | 原因 | 修正方案 |
|---|---|---|
| 画面像PPT | 只有静态描述,没有时间变化 | 增加"从X到Y"的动态变化 |
| 角色不一致 | 每帧描述差异太大 | 锚定图片要稳定,文字只补充微变化 |
| 光影混乱 | 多个光源描述矛盾 | 明确主光源位置,保持一致 |
| 塑料感 | 边缘过于锐利清晰 | 增加soft focus或柔光 |
| 运动违反物理 | 速度不合理 | 增加参照物(背景速度、拖影) |
| 情绪跳变 | 缺少过渡 | 增加中间状态(从安静到爆发之间加蓄力) |
| 画面闪烁 | 描述不稳定 | 明确占画面比例,不要模糊表述 |
| 续接断裂 | 段间没有承接 | 每段结尾描述要留承接点 |
| 色彩不统一 | 影调描述矛盾 | 保持同一影调,不要混用矛盾色调 |