Designing ai video storyboards
Skill venscn/dream-skills/skills/designing-ai-video-storyboards
Use when 为 AI 电影、短剧、漫剧、口播、广告或知识视频把剧本转成分镜,规划逐镜生成,约束角色、场景与道具一致性,设计对白、音效、音乐与镜头拼接,或交付可供生图、图生视频、多模态生成和后期剪辑使用的镜头包。From its SKILL.md
npx -y skills add venscn/dream-skills --skill designing-ai-video-storyboardsAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
12.6 KB, ~4.6k tokens by cl100k_base, as published. Nobody here has run it
设计 AI 视频分镜
核心原则
- 先服务故事变化和观众接收,再适配模型时长与平台能力。
- 先锁定不可缺的主镜,再只为明确缺口补连接镜。
- 把单镜定义成一个可生成、可验证的视觉微节拍;若模型支持单段多拍点,仍显式记录内部变化。
- 为角色、场景、道具和声音分配稳定 ID;用版本与状态区分已确认资产和推测资产。
- 为每镜同时声明首状态、末状态和连续性锁;不要只写“保持一致”。
- 把声音作为时间、表演和剪辑的一等输入;不要在视觉完成后才临时补声音。
- 把平台能力当作执行时输入;不要把当前网页能力写成长期事实。
- 把文字、UI、精确标识、复杂手部和长动作视为高风险项;优先准备拆镜或后期替代。
按需加载参考
- 在选择和细化镜头语言前,读取 storyboard-methods.md;按问题调用八种方法,不要把八种方法机械套到每镜。
- 在创建或校验
storyboard-package.json前,完整读取 production-contract.md;严格复用字段名和类型。 - 在选择声音主时钟、带声参考片段或平台落地方式前,读取 platform-and-audio-strategies.md;在执行当天现场核验能力。
处理输入缺口
- 读取小说片段、剧本、大纲、世界观、内容结构、资产表、声音素材、成片规格和目标生成环境。
- 把缺失信息标为
unknown,把可逆推测标为provisional;不要把推测升级成approved。 - 缺少剧本时,从大纲提炼场景目标、冲突、信息变化和可见动作;不要代写完整小说。
- 缺少角色、场景或道具表时,先建立最小资产 registry,只登记当前分镜实际引用的资产。
- 缺少模型能力时,采用保守默认:短单一动作、无原生音频依赖、有限参考图、文字后期合成;把所有默认写入
generator_capabilities.assumptions。 - 缺少目标时长时,按叙事微节拍给出估算版,并在输出中标记总时长待锁定;若需要通过校验器,先明确目标时长与容差。
- 缺少声音素材时,先确定声音职责和时间位置,使用临时轨占位;不要凭空承诺口型或原生音频质量。
执行完整分镜工作流
1. 建立生产约束
- 写明成片类型、受众、画幅、目标时长、帧率、语言、发布渠道和交付分辨率。
- 记录目标生成器的单段时长、参考输入、首尾帧、角色一致性、镜头运动、原生音频、口型、文字与并发限制。
- 把未核验能力写成假设,并为每项假设指定现场核验动作和失败回退。
2. 建立稳定资产表
- 为角色使用
character.*,为场景使用location.*,为道具使用prop.*,为声音使用audio.*。 - 为每项资产写入
type、status和version;需要时追加外观锚点、尺度、材质、声音特征和参考文件。 - 固定可跨镜复用的身份特征;把本镜可变化的表情、姿势、光线和损坏状态放入镜头状态,不要塞进永久身份定义。
- 先生成资产参考图或带声参考片段时,为其登记新版本,并记录允许后续继承的图像、运动和声音维度。
3. 提炼主镜和连接镜
- 把每场戏压成一句“谁发生什么变化,观众必须理解什么”。
- 按不可替代的事实、动作结果、情绪转折、伏笔或观点变化划分内容格。
- 对每个候选镜头做删除测试;只把删除后会损失关键信息的画面保留为主镜。
- 只看主镜做无对白通读;若无法复述起因、变化和结果,先补主镜。
- 逐对检查动作、方位、反应、因果、时间和节奏缺口;只为明确缺口补连接镜。
4. 规划观众接收与镜头语言
- 把信息分为必须记住、应该理解和只需感知;降低非重点竞争,不要让所有信息同时强调。
- 选择段落默认视角;用“角色反应—角色所见”控制代入,用持续更新的线索控制延迟揭示。
- 建立人物关系轴和屏幕方向地图;在换互动组时选择与旧可拍区重叠最大的侧。
- 按表情、身体动作、关系、空间或局部信息选择景别;建立默认视高,并只为明确任务设置例外。
- 为每镜指定唯一首视目标;沿上一镜末焦点和运动惯性设计下一镜接手点。
- 把复杂动作先压成色块方向;用同向衔接建立可读基线,只在转折与高潮安排少量反向动势。
- 用已有元素建立可见面、前中后层、疏密和带状稳定;不要用无任务装饰掩盖扁平构图。
5. 选择声画策略
- 在
audio-first、clip-native、hybrid和reference-performance中只选一个主模式。 - 让对白、口播、歌曲或节拍决定镜头时码时,选择
audio-first。 - 让动作与原生声音高度耦合且能力已验证时,选择
clip-native,并保留可替换分轨。 - 需要稳定人声与音乐、又希望保留逐镜环境声灵感时,优先选择
hybrid。 - 需要先锁定角色表演、口型、动作、场景气氛或道具声音时,选择
reference-performance。 - 把声音时码状态标为
provisional、locked或verified;在完成完整干读、时间码落点和试听核验前,不要把audio-first标成locked或verified。 - 把跨全片继承的环境床、音乐母线或统一人声登记为
sound_strategy.global_buses;不要为了表示继承而在每镜重复音频层。 - 为逐镜音频层写入种类、资产引用、状态、绝对主时间线入出点和跨切类型。
- 为切点标注硬切、J-cut、L-cut、声音桥、静音或尾响;让每个 J-cut 或 L-cut 的绝对时码真实跨过画面边界。
6. 切分可生成镜头
- 让每镜只承担一个主要可见变化;把同时发生的复杂动作拆成多个镜头或明确的内部拍点。
- 把镜头时长控制在已核验上限内;不要为了凑固定秒数切断动作准备、作用和反应。
- 为每镜写入故事任务、资产引用、首尾状态、连续性锁、图像提示、视频提示、负面约束、声音层和剪辑交接。
- 把角色身份、服装、场景结构、道具持有、屏幕方向、天气、光线和损坏状态中的必要项写入
continuity_lock。 - 为每镜写入
handoff;让首镜inherits_from为null,让后续镜继承前一镜 ID。changes_from_previous只比较“前一镜end_state→ 本镜start_state”;不要把本镜start_state → end_state的镜内变化写入 handoff。两端相同就不要伪造变化。 - 为双人同框、复杂手部、镜面、文字、口型、长动作和大幅摄影运动添加风险与回退。
7. 生成分镜图与低成本预演
- 先生成关键帧、分镜图或低分辨率 animatic;不要直接批量生成高成本终片。
- 优先测试最可能失败且会影响后续镜头的高风险镜头。
- 比较生成结果的首尾状态、资产版本、关系轴、视觉焦点、动势和声音时码。
- 把可接受的意外升级为新版本或显式设计;不要让随机漂移无记录地传给后续镜头。
8. 校验并交付
- 按 production-contract.md 输出
storyboard-package.json。 - 运行
python scripts/validate_storyboard_package.py storyboard-package.json。 - 修复全部错误后,再渲染人读分镜表、提示词包、资产引用清单和生成队列。
- 保留 JSON 为唯一机器事实源;不要让表格与 JSON 各自演化。
执行语义一致性门
- 按
project → assets → shots → 人读派生物的顺序逐层核对;让下游只引用上游已经声明的事实。 - 检查
generation.image_prompt完整符合本镜start_state,不要在首帧提示中提前发生镜内变化。 - 检查
generation.video_prompt明确执行可见变化并抵达本镜end_state,不要只描述氛围或摄影风格。 - 对每个非首镜先并排放置“前一镜
end_state”与“本镜start_state”,只把这一次跨切比较中新增、消失或改变的道具、位置、朝向、运动向量和其他状态写入handoff.changes_from_previous。禁止从本镜end_state抄取变化;镜内变化只属于start_state → end_state和video_prompt。 - 检查首镜
handoff.inherits_from为null,并检查每个后续镜只继承紧邻前一镜 ID。 - 通过
sound_strategy.global_buses继承全片环境床、音乐母线或统一人声;不要把全局 bus 机械重复为每镜音频层。 - 检查每个逐镜音频层使用绝对主时间线;让 J-cut 满足
timeline_in < edit.in < timeline_out,让 L-cut 满足timeline_in < edit.out < timeline_out。 - 检查
audio-first的干读、停顿、重音和时码落点证据;未完成 dry-read 时只允许timing_status: provisional。 - 搜索
story_function、start_state、end_state、图像/视频提示、risk和fallback中出现的每一条可听事件;除全局 bus 外,都必须同时拥有已登记音频资产、本镜asset_refs和带绝对时码的本镜音频层。让声音的起落点与它所宣告的可见状态变化发生在同一主时间点;若存在两个同类门、设备或声源,用不同资产 ID 和明确名称消除歧义。不要用提示词或回退方案偷偷引入未登记声音。 - 从 JSON 渲染人读分镜表,并逐项反查;删除人读表中未出现在 JSON 的事件、资产、动作、声音或状态。
执行质量门
- 检查总镜头时长与目标时长的差值不超过容差。
- 检查每镜时长不超过
generator_capabilities.max_clip_duration_s。 - 检查所有稳定 ID 唯一,所有
asset_refs均指向已登记资产。 - 检查所有临时资产明确标为
provisional,所有版本均可追溯。 - 检查每镜都有非空故事任务、首状态、末状态和连续性锁。
- 检查相邻镜的末状态与下一镜首状态可解释;把有意跳变明确写入转场或风险说明。
- 检查每镜的
handoff继承关系正确;逐项确认它只描述“前镜末态 → 本镜首态”,没有混入本镜内部变化。 - 检查每镜只有一个主要可见变化,并为复杂镜头声明内部拍点或拆镜方案。
- 检查每镜都有非空的结构化声音层;需要静音时使用
kind: silence、asset_ref: null,不要留下空白决策。 - 检查所有非空音频资产既在全局资产表中,也在本镜
asset_refs中。 - 检查对白、口播和音乐绝对时间码不互相抢占;检查 J-cut、L-cut 和声音桥真实跨越画面边界。
- 检查高风险镜头都包含可执行回退;把文字、UI 和精确标识默认放到后期。
- 用无声缩略图验证故事、方位和焦点;用有声正常速度验证节奏、表演和切点。
遵守输出契约
- 交付可由校验器读取的
storyboard-package.json。 - 把
project、generator_capabilities、sound_strategy、assets和shots作为必需顶层字段。 - 把额外的人读表格、图像提示词、视频提示词、声音表和生成任务视为 JSON 的派生物。
- 对照 production-contract.md 的完整最小示例生成首版,再扩展非必需字段。
- 在交付说明中区分已核验平台能力、待现场核验假设和已启用回退。
避免常见错误
- 不要按每句台词机械切镜;按不可替代的信息变化切内容格。
- 不要把课程中的“主镜”误作单条大全景 master shot。
- 不要用“保持角色一致”替代资产 ID、版本、状态和连续性锁。
- 不要默认所有模型只能生成 4–6 秒,也不要超出未核验的模型上限。
- 不要把每个镜头都设计成全—特—全—特或每切必跳焦;建立稳定基线后再破格。
- 不要只写静态画面提示;同时写动作、镜头运动、首尾状态和负面约束。
- 不要把
clip-native音频视为不可替换母版;保留对白、环境声、音效和音乐的独立后期路径。 - 不要只验证单帧美观;验证动态连播、声音时码和跨镜状态。
- 不要把某个网站当前展示的功能写成永久能力;在执行时重新核验。
What ships with it: 6 files
69.6 KB alongside SKILL.md, 2 of them executable
agents/
- openai.yaml274 B
references/
- platform-and-audio-strategies.md8.5 KB
- production-contract.md14.3 KB
- storyboard-methods.md5.1 KB
scripts/
- test_validate_storyboard_package.pyruns25.6 KB
- validate_storyboard_package.pyruns15.8 KB
Gives 0 of the 12 instructions most video audio skills give in ~4.6k tokens
Counted across 622 of the 795 authors here whose files we hold, read 2026-08-07
- Read individual rule files for detailed explanationsin 21 of 622, across 10 files
- Render final videoin 13 of 622, across 6 files
- Use WAV PCM 16kHz mono audio formatin 12 of 622, across 3 files
- Use this skill when dealing with Remotion codein 11 of 622, across 4 files
- Save generated audio to a WAV filein 11 of 622, across 4 files
- Handle conversion errors gracefullyin 10 of 622, across 6 files
- Add captions to videos alwaysin 10 of 622, across 4 files
- Generate music from text descriptions using MusicGenin 9 of 622, across 2 files
- Do not skip pipeline layersin 9 of 622, across 3 files
- Do not make one tool do everythingin 9 of 622, across 3 files
- Use Azure Document Intelligence for complex PDFsin 9 of 622, across 4 files
- Never ask the user to paste their full API keyin 9 of 622, across 3 files
Said here and by no other author read
- assign stable IDs to characters, locations, props, and sound
- declare start state, end state, and continuity lock per shot
- split complex actions into multiple shots
- specify exact handoff states between adjacent shots
- choose exactly one audio-video strategy per project
- generate storyboard images before high-cost final clips
Grouped from the skills themselves: near-identical wordings counted once, and counted by distinct author, so one author publishing three of these counts once. Length counted with cl100k_base; the agent that loads this file may tokenize it differently.