agentsclimarketplace

Designing ai video storyboards

Skill venscn/dream-skills/skills/designing-ai-video-storyboards

Use when 为 AI 电影、短剧、漫剧、口播、广告或知识视频把剧本转成分镜,规划逐镜生成,约束角色、场景与道具一致性,设计对白、音效、音乐与镜头拼接,或交付可供生图、图生视频、多模态生成和后期剪辑使用的镜头包。From its SKILL.md

Install
npx -y skills add venscn/dream-skills --skill designing-ai-video-storyboards

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

12.6 KB, ~4.6k tokens by cl100k_base, as published. Nobody here has run it

设计 AI 视频分镜

核心原则

  • 先服务故事变化和观众接收,再适配模型时长与平台能力。
  • 先锁定不可缺的主镜,再只为明确缺口补连接镜。
  • 把单镜定义成一个可生成、可验证的视觉微节拍;若模型支持单段多拍点,仍显式记录内部变化。
  • 为角色、场景、道具和声音分配稳定 ID;用版本与状态区分已确认资产和推测资产。
  • 为每镜同时声明首状态、末状态和连续性锁;不要只写“保持一致”。
  • 把声音作为时间、表演和剪辑的一等输入;不要在视觉完成后才临时补声音。
  • 把平台能力当作执行时输入;不要把当前网页能力写成长期事实。
  • 把文字、UI、精确标识、复杂手部和长动作视为高风险项;优先准备拆镜或后期替代。

按需加载参考

  • 在选择和细化镜头语言前,读取 storyboard-methods.md;按问题调用八种方法,不要把八种方法机械套到每镜。
  • 在创建或校验 storyboard-package.json 前,完整读取 production-contract.md;严格复用字段名和类型。
  • 在选择声音主时钟、带声参考片段或平台落地方式前,读取 platform-and-audio-strategies.md;在执行当天现场核验能力。

处理输入缺口

  1. 读取小说片段、剧本、大纲、世界观、内容结构、资产表、声音素材、成片规格和目标生成环境。
  2. 把缺失信息标为 unknown,把可逆推测标为 provisional;不要把推测升级成 approved
  3. 缺少剧本时,从大纲提炼场景目标、冲突、信息变化和可见动作;不要代写完整小说。
  4. 缺少角色、场景或道具表时,先建立最小资产 registry,只登记当前分镜实际引用的资产。
  5. 缺少模型能力时,采用保守默认:短单一动作、无原生音频依赖、有限参考图、文字后期合成;把所有默认写入 generator_capabilities.assumptions
  6. 缺少目标时长时,按叙事微节拍给出估算版,并在输出中标记总时长待锁定;若需要通过校验器,先明确目标时长与容差。
  7. 缺少声音素材时,先确定声音职责和时间位置,使用临时轨占位;不要凭空承诺口型或原生音频质量。

执行完整分镜工作流

1. 建立生产约束

  1. 写明成片类型、受众、画幅、目标时长、帧率、语言、发布渠道和交付分辨率。
  2. 记录目标生成器的单段时长、参考输入、首尾帧、角色一致性、镜头运动、原生音频、口型、文字与并发限制。
  3. 把未核验能力写成假设,并为每项假设指定现场核验动作和失败回退。

2. 建立稳定资产表

  1. 为角色使用 character.*,为场景使用 location.*,为道具使用 prop.*,为声音使用 audio.*
  2. 为每项资产写入 typestatusversion;需要时追加外观锚点、尺度、材质、声音特征和参考文件。
  3. 固定可跨镜复用的身份特征;把本镜可变化的表情、姿势、光线和损坏状态放入镜头状态,不要塞进永久身份定义。
  4. 先生成资产参考图或带声参考片段时,为其登记新版本,并记录允许后续继承的图像、运动和声音维度。

3. 提炼主镜和连接镜

  1. 把每场戏压成一句“谁发生什么变化,观众必须理解什么”。
  2. 按不可替代的事实、动作结果、情绪转折、伏笔或观点变化划分内容格。
  3. 对每个候选镜头做删除测试;只把删除后会损失关键信息的画面保留为主镜。
  4. 只看主镜做无对白通读;若无法复述起因、变化和结果,先补主镜。
  5. 逐对检查动作、方位、反应、因果、时间和节奏缺口;只为明确缺口补连接镜。

4. 规划观众接收与镜头语言

  1. 把信息分为必须记住、应该理解和只需感知;降低非重点竞争,不要让所有信息同时强调。
  2. 选择段落默认视角;用“角色反应—角色所见”控制代入,用持续更新的线索控制延迟揭示。
  3. 建立人物关系轴和屏幕方向地图;在换互动组时选择与旧可拍区重叠最大的侧。
  4. 按表情、身体动作、关系、空间或局部信息选择景别;建立默认视高,并只为明确任务设置例外。
  5. 为每镜指定唯一首视目标;沿上一镜末焦点和运动惯性设计下一镜接手点。
  6. 把复杂动作先压成色块方向;用同向衔接建立可读基线,只在转折与高潮安排少量反向动势。
  7. 用已有元素建立可见面、前中后层、疏密和带状稳定;不要用无任务装饰掩盖扁平构图。

5. 选择声画策略

  1. audio-firstclip-nativehybridreference-performance 中只选一个主模式。
  2. 让对白、口播、歌曲或节拍决定镜头时码时,选择 audio-first
  3. 让动作与原生声音高度耦合且能力已验证时,选择 clip-native,并保留可替换分轨。
  4. 需要稳定人声与音乐、又希望保留逐镜环境声灵感时,优先选择 hybrid
  5. 需要先锁定角色表演、口型、动作、场景气氛或道具声音时,选择 reference-performance
  6. 把声音时码状态标为 provisionallockedverified;在完成完整干读、时间码落点和试听核验前,不要把 audio-first 标成 lockedverified
  7. 把跨全片继承的环境床、音乐母线或统一人声登记为 sound_strategy.global_buses;不要为了表示继承而在每镜重复音频层。
  8. 为逐镜音频层写入种类、资产引用、状态、绝对主时间线入出点和跨切类型。
  9. 为切点标注硬切、J-cut、L-cut、声音桥、静音或尾响;让每个 J-cut 或 L-cut 的绝对时码真实跨过画面边界。

6. 切分可生成镜头

  1. 让每镜只承担一个主要可见变化;把同时发生的复杂动作拆成多个镜头或明确的内部拍点。
  2. 把镜头时长控制在已核验上限内;不要为了凑固定秒数切断动作准备、作用和反应。
  3. 为每镜写入故事任务、资产引用、首尾状态、连续性锁、图像提示、视频提示、负面约束、声音层和剪辑交接。
  4. 把角色身份、服装、场景结构、道具持有、屏幕方向、天气、光线和损坏状态中的必要项写入 continuity_lock
  5. 为每镜写入 handoff;让首镜 inherits_fromnull,让后续镜继承前一镜 ID。changes_from_previous 只比较“前一镜 end_state → 本镜 start_state”;不要把本镜 start_state → end_state 的镜内变化写入 handoff。两端相同就不要伪造变化。
  6. 为双人同框、复杂手部、镜面、文字、口型、长动作和大幅摄影运动添加风险与回退。

7. 生成分镜图与低成本预演

  1. 先生成关键帧、分镜图或低分辨率 animatic;不要直接批量生成高成本终片。
  2. 优先测试最可能失败且会影响后续镜头的高风险镜头。
  3. 比较生成结果的首尾状态、资产版本、关系轴、视觉焦点、动势和声音时码。
  4. 把可接受的意外升级为新版本或显式设计;不要让随机漂移无记录地传给后续镜头。

8. 校验并交付

  1. production-contract.md 输出 storyboard-package.json
  2. 运行 python scripts/validate_storyboard_package.py storyboard-package.json
  3. 修复全部错误后,再渲染人读分镜表、提示词包、资产引用清单和生成队列。
  4. 保留 JSON 为唯一机器事实源;不要让表格与 JSON 各自演化。

执行语义一致性门

  1. project → assets → shots → 人读派生物 的顺序逐层核对;让下游只引用上游已经声明的事实。
  2. 检查 generation.image_prompt 完整符合本镜 start_state,不要在首帧提示中提前发生镜内变化。
  3. 检查 generation.video_prompt 明确执行可见变化并抵达本镜 end_state,不要只描述氛围或摄影风格。
  4. 对每个非首镜先并排放置“前一镜 end_state”与“本镜 start_state”,只把这一次跨切比较中新增、消失或改变的道具、位置、朝向、运动向量和其他状态写入 handoff.changes_from_previous。禁止从本镜 end_state 抄取变化;镜内变化只属于 start_state → end_statevideo_prompt
  5. 检查首镜 handoff.inherits_fromnull,并检查每个后续镜只继承紧邻前一镜 ID。
  6. 通过 sound_strategy.global_buses 继承全片环境床、音乐母线或统一人声;不要把全局 bus 机械重复为每镜音频层。
  7. 检查每个逐镜音频层使用绝对主时间线;让 J-cut 满足 timeline_in < edit.in < timeline_out,让 L-cut 满足 timeline_in < edit.out < timeline_out
  8. 检查 audio-first 的干读、停顿、重音和时码落点证据;未完成 dry-read 时只允许 timing_status: provisional
  9. 搜索 story_functionstart_stateend_state、图像/视频提示、riskfallback 中出现的每一条可听事件;除全局 bus 外,都必须同时拥有已登记音频资产、本镜 asset_refs 和带绝对时码的本镜音频层。让声音的起落点与它所宣告的可见状态变化发生在同一主时间点;若存在两个同类门、设备或声源,用不同资产 ID 和明确名称消除歧义。不要用提示词或回退方案偷偷引入未登记声音。
  10. 从 JSON 渲染人读分镜表,并逐项反查;删除人读表中未出现在 JSON 的事件、资产、动作、声音或状态。

执行质量门

  • 检查总镜头时长与目标时长的差值不超过容差。
  • 检查每镜时长不超过 generator_capabilities.max_clip_duration_s
  • 检查所有稳定 ID 唯一,所有 asset_refs 均指向已登记资产。
  • 检查所有临时资产明确标为 provisional,所有版本均可追溯。
  • 检查每镜都有非空故事任务、首状态、末状态和连续性锁。
  • 检查相邻镜的末状态与下一镜首状态可解释;把有意跳变明确写入转场或风险说明。
  • 检查每镜的 handoff 继承关系正确;逐项确认它只描述“前镜末态 → 本镜首态”,没有混入本镜内部变化。
  • 检查每镜只有一个主要可见变化,并为复杂镜头声明内部拍点或拆镜方案。
  • 检查每镜都有非空的结构化声音层;需要静音时使用 kind: silenceasset_ref: null,不要留下空白决策。
  • 检查所有非空音频资产既在全局资产表中,也在本镜 asset_refs 中。
  • 检查对白、口播和音乐绝对时间码不互相抢占;检查 J-cut、L-cut 和声音桥真实跨越画面边界。
  • 检查高风险镜头都包含可执行回退;把文字、UI 和精确标识默认放到后期。
  • 用无声缩略图验证故事、方位和焦点;用有声正常速度验证节奏、表演和切点。

遵守输出契约

  1. 交付可由校验器读取的 storyboard-package.json
  2. projectgenerator_capabilitiessound_strategyassetsshots 作为必需顶层字段。
  3. 把额外的人读表格、图像提示词、视频提示词、声音表和生成任务视为 JSON 的派生物。
  4. 对照 production-contract.md 的完整最小示例生成首版,再扩展非必需字段。
  5. 在交付说明中区分已核验平台能力、待现场核验假设和已启用回退。

避免常见错误

  • 不要按每句台词机械切镜;按不可替代的信息变化切内容格。
  • 不要把课程中的“主镜”误作单条大全景 master shot。
  • 不要用“保持角色一致”替代资产 ID、版本、状态和连续性锁。
  • 不要默认所有模型只能生成 4–6 秒,也不要超出未核验的模型上限。
  • 不要把每个镜头都设计成全—特—全—特或每切必跳焦;建立稳定基线后再破格。
  • 不要只写静态画面提示;同时写动作、镜头运动、首尾状态和负面约束。
  • 不要把 clip-native 音频视为不可替换母版;保留对白、环境声、音效和音乐的独立后期路径。
  • 不要只验证单帧美观;验证动态连播、声音时码和跨镜状态。
  • 不要把某个网站当前展示的功能写成永久能力;在执行时重新核验。

What ships with it: 6 files

69.6 KB alongside SKILL.md, 2 of them executable

agents/

Gives 0 of the 12 instructions most video audio skills give in ~4.6k tokens

Counted across 622 of the 795 authors here whose files we hold, read 2026-08-07

  • Read individual rule files for detailed explanationsin 21 of 622, across 10 files
  • Render final videoin 13 of 622, across 6 files
  • Use WAV PCM 16kHz mono audio formatin 12 of 622, across 3 files
  • Use this skill when dealing with Remotion codein 11 of 622, across 4 files
  • Save generated audio to a WAV filein 11 of 622, across 4 files
  • Handle conversion errors gracefullyin 10 of 622, across 6 files
  • Add captions to videos alwaysin 10 of 622, across 4 files
  • Generate music from text descriptions using MusicGenin 9 of 622, across 2 files
  • Do not skip pipeline layersin 9 of 622, across 3 files
  • Do not make one tool do everythingin 9 of 622, across 3 files
  • Use Azure Document Intelligence for complex PDFsin 9 of 622, across 4 files
  • Never ask the user to paste their full API keyin 9 of 622, across 3 files

Said here and by no other author read

  • assign stable IDs to characters, locations, props, and sound
  • declare start state, end state, and continuity lock per shot
  • split complex actions into multiple shots
  • specify exact handoff states between adjacent shots
  • choose exactly one audio-video strategy per project
  • generate storyboard images before high-cost final clips

Grouped from the skills themselves: near-identical wordings counted once, and counted by distinct author, so one author publishing three of these counts once. Length counted with cl100k_base; the agent that loads this file may tokenize it differently.

Keep looking

Skills are one crate of 326,144. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.