Ai tech video production
三土沉淀的 AI Agent Skills 合集,包含中文 AI 科技口播视频生产等可复用工作流。
npx -y skills add Amazing-soil/santu61ai-skill --skill ai-tech-video-productionAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
AI 科技中文口播短视频的端到端生产工作流。用户提供口播视频和文案后,用于先切真实口播时间线,再匹配素材,混合生成 React/Remotion/Anime.js 动效、GPT Image/AI 图片和实操录屏素材,可按需生成字幕轨,并产出最终高码率 MP4、生产图片素材、预览检查图,按规则清理中间工程文件。适合知识型 AI 工具、AI 工作流、GEO、科技观点和产品实操类短视频。
SKILL.md
13.7 KB, ~5.1k tokens by cl100k_base, as published. Nobody here has run it
AI Tech Video Production
把「口播视频 + 文案 + 素材」做成可编辑的视频工程。这个 skill 是独立端到端流程;安装本 skill 后即可完成时间线、素材规划、剪辑工程、字幕轨、导出和验收。
Core Positioning
ai-tech-video-production:负责真实时间线、素材规划、素材匹配、剪辑工程、PIP、字幕轨、转场、导出和验收。- 本 skill 不依赖其他自定义 skill。若环境中另有素材/生图/Remotion 辅助 skill,可以作为可选增强,但不能作为完成任务的前置条件。
- 如果某个工具只能把图片返回到聊天界面、无法提供本地文件路径,不得直接把该图片写进工程;必须先让素材落盘到工程媒体目录,或改用可落盘的生成/API/CLI/用户提供素材路径。
Default Workflow
- 获取口播视频、口播文案、已有素材目录。
- 先切真实口播时间线,不按文案估算硬配素材;用户给的文案/字幕只做语义参考,最终字幕和关键句以视频里的真实语音口播为准。
- 使用本 skill 的内置素材规划规则,判断每段素材类型:
- 实操录屏/截图:优先保留真实操作,不叠复杂概念图。
- React/Remotion/Anime.js 动效:用于观点、趋势、对比、任务关系。
- GPT Image 图片:用于抽象场景和情绪钩子。
- 太短段落:宁可不用素材,也不要让素材播不完。
- 检查素材节奏:不要整条视频都用文字信息图;每
30 秒至少安排1个 GPT Image / AI 图片素材,最好1-2个,除非该 30 秒全部是真实实操录屏。 - 先定视觉色彩策略,再生成素材和 Remotion 模板;默认不要把 AI 科技感做成整条青绿/荧光绿。
- 生成或整理素材,统一放入工程媒体目录。
- 如果用户要求字幕/烧录字幕,基于真实 ASR/SRT/时间线生成可编辑字幕轨;用户文案与口播不一致时,字幕以语音口述为主。优先按自然句切分,尽量一整句一条,不为视觉整齐强行断成多行。
- 生成临时可编辑 Remotion 工程,核心可改项进入
src/timeline.json;除非用户要求保留工程,默认把它当作渲染工作区。 - 抽关键帧检查布局、色彩占比、顶部安全区、字幕区、正文中间下方 PIP,以及开头/结尾居中强化出镜的进出场,再导出完整高码率 MP4。
- 整理干净交付区:最终视频、实际使用的图片素材、预览检查图。验证通过后清理当前任务生成的临时工程和中间文件。
Built-in Asset Planning
独立安装时,按以下规则完成素材规划,不需要调用外部素材 skill:
- 先按真实口播切成语义段,每段记录:
startend- 真实口播句子
- 核心观点
- 素材类型
- 素材位置/安全区
- 是否需要图片、动效、实操录屏或无素材
- 素材类型选择:
- 真实产品演示、工具操作、网页流程:优先用实操录屏/截图。
- 对比、误区、分层、判断标准:优先用 React/Remotion/Anime.js 动效或信息结构。
- 抽象隐喻、情绪钩子、商业场景、人物群像:优先用 GPT Image/AI 图片。
- 3 秒以内的过渡句:优先并入相邻素材或使用无素材/轻背景,不硬塞新图。
- GPT Image/AI 图片提示词必须要求:
- 竖屏
9:16。 - 不在图片里生成标题、字幕、金句、Logo、假 UI 或播放按钮。
- 主体在上半区/中部,给字幕区和真人 PIP 留白。
- 深炭黑/冷白为基底,琥珀金或冷蓝为主强调,青绿只做少量信号色。
- 竖屏
- 图片落盘规则:
- 工程引用的图片必须保存到
public/media/images/或等价工程媒体目录。 src/timeline.json只能引用本地可读路径,例如media/images/scene-01.png。- 如果生图工具只返回聊天图片、不返回本地路径,必须先通过可落盘路径取得文件;否则改用代码动效、用户提供素材,或向用户说明该图片不能进入工程。
- 工程引用的图片必须保存到
- 素材密度检查:
- 不要整条视频全是文字信息图。
- 每
30 秒至少1个 GPT Image/AI 图片素材,最好1-2个;如果该窗口全部是真实实操录屏,可以例外。 - 每个素材只服务一个核心意思,不要一张图承载多个段落。
Mixed Material Rule
- 默认必须混合
AI 图片 + React/Remotion/Anime.js 动效;不能只做图片幻灯片,也不能只做代码文字信息图。 - 没有真实实操录屏时,每条视频至少包含
1个 AI 图片段和1个 React/Remotion/Anime.js 动效段;超过60 秒的视频,应在每个完整30 秒窗口内检查是否有 AI 图片,并在主要观点段穿插动效。 - AI 图片负责情绪钩子、隐喻、商业场景和人物群像;React/Remotion/Anime.js 动效负责结构、对比、流程、判断标准和数据关系。
- 同一个观点段优先用一种主素材表达,不把 AI 图片、动效、字幕和 PIP 堆成互相遮挡的画面。
- 如果某条视频无法满足混合素材要求,必须在交付说明中写明原因,例如全程真实实操录屏、用户指定只用截图、或生图工具无法落盘。
Alignment Rule
- 素材、字幕和口播必须以真实音频为主轴;用户文案只做语义地图,不做硬时间线。
- 每个素材段的进入点应贴近对应口播关键词或停顿,原则上不晚于核心词后
0.3 秒;关键结论、反转、数字和 CTA 必须单独检查对齐。 - 字幕开始/结束必须跟真实话音贴合;如果 ASR 和口播画面明显漂移,先校准字幕和段落时间,再渲染成片。
- 字幕文案不要把含逗号的长句塞进一条字幕;遇到中文逗号、英文逗号或明显停顿,优先拆成下一条字幕。只有很短的并列词组可以保留逗号。
Non-Negotiable Rules
- 默认画幅:
1080x1920,默认不额外加字幕,必须给用户后期字幕留空间。 - 默认交付高码率 MP4,不产出低码率交付版。
1080x1920/30fps/H.264的最终成片默认视频目标码率8M,maxrate 10M,bufsize 20M,音频 AAC 不低于128k。运动素材多、录屏细节多或用户明确要求更清晰时,用10M-12M目标码率。只有用户明确要求“预览版/小文件/压缩版”时,才额外生成低码率预览,并且不能替代高码率最终版。 - 不使用单纯 CRF/质量模式作为唯一最终交付编码;静态图多的项目会被压得很小。最终交付必须使用目标码率或等价的高码率控制,并用
ffprobe验证视频码率。 - 如果用户要求配字幕或烧录字幕,正文字幕默认放在中间偏下安全区,不要贴正下方;推荐放在中部偏上或 PIP 左右侧安全空位,并避开中间下方真人 PIP。开头/结尾居中强化出镜时,字幕应避开人物脸部和胸口,必要时缩短或临时下移。
- 字幕生成必须保持可编辑字幕轨,不只烧进最终 MP4;时间、文案、位置和样式应进入
src/timeline.json或等价配置。 - 用户提供的文案、旧字幕或标题稿不是最终字幕底稿;如果它们和真实口播不一一对应,最终字幕以音频 ASR/人工校准后的真实口述为准,脚本文案只用于辅助断句、理解语义和发现明显错听。
- 字幕切分优先按真实口播自然句、语义短句或停顿切分;每条字幕尽量单行显示,不要为了卡宽频繁换行。长句优先动态缩小字号,其次按语义拆成下一条字幕,最后才允许两行。
- 字幕字体在 Mac 渲染时优先使用
苹方 / PingFang SC;Remotion 字幕组件应继承全局 CSS 的 PingFang SC 字体栈,避免在组件内另写不一致的字体。 - 字幕视觉样式:
fontWeight: 900、白字、黑色阴影、动态字号;黑色阴影必须保证浅色画面和图片段上的可读性。 - 字幕位置必须避开人像:正文阶段不压中间下方 PIP;开头/结尾居中人物阶段不压脸、嘴、手和胸口。若字幕与人物冲突,优先移动字幕到人物旁侧/上方安全空位,或临时降低字号。
- 非图片素材(React/Remotion/Anime.js 动效、文字信息图、流程卡、图表、代码/窗口模拟)的整体布局必须下移:
Y=0-260只放背景氛围,不放标题、卡片、图标组、流程节点等核心信息;可读核心信息优先放在Y=280-1080,首个核心元素顶部不要进入Y=0-260,建议Y>=280。 - 正文阶段素材核心信息集中在安全的中部偏上区域,不贴近屏幕上沿,不进入中间偏下字幕区和中间下方真人 PIP 区;开头/结尾居中强化出镜时,素材围绕人物重新排版。
- 正文短标签默认不用发光小矩形框。对比/反常识文案优先用分屏对照;步骤/特征/判断标准文案优先用HUD 坐标清单。实现时用细线、编号、弱分割、扫描光和字重层级承载信息,避免按钮感。
- 默认视觉色彩:深炭黑/近黑背景、冷白正文、琥珀金或冷蓝做主强调,青绿/信号绿只作为 AI 识别、扫描、信号、增长等语义强调,建议占比约
10%-20%。除非用户品牌或素材明确需要绿色,不要让背景、标题、图形、粒子、图片提示词同时偏青绿。 - 素材类型必须混合:文字信息图、React/Remotion/Anime 动效、GPT Image 图片、实操录屏按语义搭配;不要整条视频全是文字信息图。
- GPT Image 图片密度:每
30 秒至少1个,最好1-2个;图片段不在图内生成字幕、标题、金句或假 UI。 - 真人 PIP 必须来自原口播视频,不允许素材进入 PIP 轨道。
- PIP 默认采用三阶段动态布局:开头前
3 秒居中放大强化出镜,正文移动至中间下方小 PIP,结尾最后3 秒回到居中放大;如果真实口播钩子或收束段不足3 秒,按真实边界缩短。 - 开头和结尾的居中人物不能成为唯一画面:必须保留语义相关背景素材,并搭配少量钩子词、结论词或信息标签;不要直接切成全屏纯人像。
- 居中强化出镜与中间下方 PIP 之间必须平滑移动和缩放,不能硬切。
- PIP 使用等比例裁切,不把
9:16原片直接缩小拉伸。 - 相邻素材不要硬切闪屏,也不要双透明交叉淡化漏出底图;使用覆盖式淡入。
- MP4 动效要根据真实口播段时长变速,尽量完整播放。
- 如果口播段太短,删除该段素材或换静态图,不硬塞完整动效。
- 只清理当前任务创建的临时目录和中间文件;不得删除用户提供的原始视频、已有素材目录、其他任务正在使用的工程目录或同级未知文件夹。
Output And Cleanup Policy
默认交付区只保留:
final/:最终高码率 MP4。images/:本次实际使用或生成的 AI 图片、手绘/设计图片、封面图等图片素材。previews/:关键帧检查图、封面预览、对齐检查图或 contact sheet。
默认自动清理:
- Remotion 临时工程、
node_modules、.cache、dist、build、中间渲染 MP4/MOV、临时 WAV、ASR 草稿、未使用图片候选、抽帧散图、测试导出、失败重试产物。 - 低码率预览视频,除非用户明确要求保留。
保留工程文件的例外:
- 用户明确要求“可编辑工程”“后续还要改模板”“交给剪辑师继续剪”。
- 质量检查失败,需要保留现场排查。
- 工程内包含尚未导出到
images/的必要素材。
清理前必须确认最终 MP4、图片素材和预览图已复制到交付区;清理只作用于本次任务新建的工作区。
When To Read References
- 生成 Remotion 工程或修改模板:读 references/remotion-rules.md。
- 做时间线和素材匹配:读 references/timeline-workflow.md。
- 做交付前验收:读 references/quality-checks.md。
Required Outputs
默认成片交付只输出:
- 最终高码率 MP4
- 本次实际使用/生成的图片素材
- 关键帧检查图、封面预览或对齐检查图
过程产物只在需要时输出:
- 时间线与素材匹配表
- 素材生成/整理目录
- 可编辑 Remotion 工程
- 剪辑师交付说明
Do Not
- 不要默认把庞大的工程目录当成交付物;除非用户要求可编辑工程,默认只交付最终视频、图片素材和预览检查图。
- 不要把低码率或 CRF 自动压缩出的“小文件”当成最终交付;默认最终文件应为高码率版本,必要时另存预览版。
- 不要先剪再猜文案;必须先确认或切分时间线。
- 不要把用户给的文案或旧字幕直接当成最终字幕;必须听音频或用 ASR 校准真实口播。
- 不要让素材切换中间露出口播底图。
- 不要把字幕安全区理解成不能铺背景;背景可以铺满,但核心信息必须避让。
- 不要把 AI 科技感等同于满屏绿色、青绿色数据流或全片单一色相;绿色只能是局部信号色,不是默认主视觉。
- 不要清理本次任务之外的文件夹;看到其他任务正在渲染或已有工程时,只处理当前任务明确创建的路径。
What ships with it: 7 files
28.0 KB alongside SKILL.md
agents/
- openai.yaml395 B
references/
- quality-checks.md4.5 KB
- remotion-rules.md11.7 KB
- timeline-workflow.md3.2 KB
templates/
- editor-handoff.md1.9 KB
- timeline-table.md134 B
- README.md6.1 KB