Santu ai voiceover editing
Skill Amazing-soil/santu61ai-skill/santu-ai-voiceover-editing
生成“三土学AI”黑底头像声波竖屏口播视频和爆款短视频封面。用于用户提供中文文案后,默认用本地 MiniMax 中国站 API CLI `minimax-tts` 调用已克隆音色做文字转语音,固定音色 `SantuVoice20260618B`,固定 HD 模型 `speech-2.8-hd`,再按音频和文案切真实时间线,规划并生成 gpt-image2 黑底简笔画图片素材,最后制作 1080x1920 成片:黑色背景,上方戴眼镜西装小人简笔画,图片按真实像素记录并为抖音/视频号四周安全区做等比例轻缩和居中留边,中部字幕按逗号/句读分段并带黑色阴影安全区,中间偏下圆形头像,头像左右固定动态声波。若用户提供封面标题或要求封面,视频完成后用 gpt-image2 直接生成带精准中文标题的爆款封面,并交付 9:16 和 6:7 两种比例。代码只负责音频对齐、字幕、圆形头像裁切、声波、布局、转场、简单图形和必要的封面尺寸整理,不生成简笔画主体素材或封面主视觉。From its SKILL.md
npx -y skills add Amazing-soil/santu61ai-skill --skill santu-ai-voiceover-editingAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
10.7 KB, ~3.7k tokens by cl100k_base, as published. Nobody here has run it
三土学AI黑底头像声波口播
把一篇中文文案做成竖屏口播视频:用本地 minimax-tts 把文案转成三土克隆声音,按音频切时间线,生成黑底 gpt-image2 简笔画配图,再用固定头像声波版式剪成成片。若用户给出封面标题,成片后继续生成 9:16 和 6:7 两版爆款视频封面。
核心定位
santu-ai-voiceover-editing:负责完整生产链路、时间线、剪辑版式、Remotion 工程和交付检查。santu-ai-voiceover-illustrations:负责把文案片段转成黑底 gpt-image2 简笔画图片素材方案与提示词。- 头像素材默认使用已裁剪好的透明圆形头像
assets/santu-avatar.png。若用户提供新头像,先裁剪保存,再替换该资产或在项目素材清单中指定新路径。 - TTS 默认使用本机全局 CLI:
minimax-tts tts --model speech-2.8-hd --voice-id SantuVoice20260618B。 - gpt-image2 图片不是“聊天里看到了”就算完成;必须保存为项目内可读文件,并写入
src/timeline.json。 - 封面标题必须由模型直接生成在图里,不默认做后期中文文字叠加;只有用户明确要求才用代码补字或排版。
固定画面结构
- 画幅:
1080x1920。 - 背景:纯黑或近黑,默认
#050505。 - 插画素材:使用 gpt-image2 生成的黑底整图,素材清单记录真实像素;剪辑层可为抖音/视频号四周安全区做等比例轻缩,默认保留左右
80-110px、顶部60-100px空余。 - 插画缩放:只允许等比例缩放,不拉伸、不裁切、不压扁。常用显示比例
0.90-0.95,不要把正常图片缩成小贴图。 - 插画内容:关键人物和物件应集中在上方视觉区;如果图太大压到字幕,先用 prompt 让主体上移,剪辑层用字幕阴影安全带兜底。
- 字幕区:头像和插画之间,推荐
Y=960-1240,居中显示 1-2 行中文字幕。 - 字幕安全带:字幕背后必须有黑色/近黑柔边阴影区域,放在插画层之上、字幕层之下,覆盖字幕可能出现的位置。
- 头像区:中间偏下,推荐圆心
X=540, Y=1400,圆形头像直径240-280。 - 声波区:头像左右两侧固定动态声波,推荐左侧
X=120-390、右侧X=690-960,垂直中心跟头像一致。 - 底部:保持黑色呼吸区,只放很轻的品牌名或完全留空。
素材职责边界
- 简笔画配图必须是 gpt-image2 生成的图片素材,不能用 Remotion/SVG/CSS/Canvas 代码生成。
- 每张简笔画生成后必须落盘到工程媒体目录,例如
public/media/images/img-01.png,并用文件系统校验存在、尺寸和格式。 - 代码可以生成文字、字幕、简单几何、声波、圆形头像裁切、遮罩、淡入淡出和轻微位移动效。
- 缺插画时,回到
santu-ai-voiceover-illustrations生成 gpt-image2 提示词和图片,不要临时用代码补画。 - 内置生图结果默认先保存在
$CODEX_HOME/generated_images/...;项目素材必须从该目录复制到工程public/media/images/,不能只停留在聊天预览或默认生成目录。 - 先检查
$CODEX_HOME/generated_images/...并复制新增文件;只有该目录也没有新增图片文件时,才暂停并向用户确认保存方式。 - 不要说“只能预览、不能保存本地”就停止;先用文件系统查找、复制、校验内置生图落盘文件。
- 不要改用外部生图工具,也不要用代码画图或占位图继续剪。
- 声波是剪辑层固定组件,不是 gpt-image2 素材。
- 爆款封面主视觉和中文标题必须是 gpt-image2 生成的图片内容;代码最多用于保存、校验、等比例尺寸整理、生成清单和预览图。
默认工作流
- 获取中文文案、头像、输出目录和可选封面标题;若用户已提供音频,可跳过 TTS。
- 清理文案口播稿:去掉不适合朗读的括号、长列表符号和视觉说明,保留自然口语节奏。
- 用本地 MiniMax 中国站 CLI 生成音频:
minimax-tts tts --text-file script.txt --output voice.mp3 --model speech-2.8-hd --voice-id SantuVoice20260618B --language-boost Chinese --subtitle。 - 拿到音频后,按音频真实时长切时间线。有词级时间戳优先用词级;没有时按句子/停顿估算,再用音频波形和试听校准。
- 按
4-7 秒一个视觉单元拆分文案,给每个视觉单元规划一张黑底简笔画或沿用上一张图。 - 调用或复用
santu-ai-voiceover-illustrations生成黑底 gpt-image2 图片素材。逐张保存到public/media/images/,生成prompts.json和asset-manifest.json。 - 校验每张插画文件真实存在且可读;只有校验通过的图片才能进入时间线。
- 生成
timeline.json:音频、分段字幕、插画真实尺寸、字幕阴影带、头像、声波、转场全部可编辑。 - 生成或修改 Remotion 工程,固定版式为“上方插画 + 字幕黑影安全带 + 中部字幕 + 下方圆形头像 + 左右声波”。
- 抽关键帧检查黑底、插画清晰度、字幕位置、字幕背后黑影、头像圆裁、声波动态和音画同步。
- 导出 MP4,并交付音频、时间线、gpt-image2 prompt、素材清单、工程路径和关键帧检查图。
- 若用户提供封面标题或要求封面,继续生成两张爆款封面:
9:16竖屏封面和6:7信息流封面;保存到public/media/covers/,生成cover-manifest.json,并返回文件路径、真实像素尺寸和标题校验结果。若用户没有提供封面标题,不要擅自编标题;在交付时提示可补充封面标题后再生成双尺寸封面。
爆款封面要求
- 封面标题来自用户输入,必须在 prompt 中声明“精确生成以下中文标题”,并逐字列出标题;生成后人工查看图片,确认没有错字、漏字、多字、乱码或笔画严重变形。
- 默认分别生成两张封面,不从
9:16直接裁出6:7,除非用户明确要求复用同一主视觉。9:16常用目标比例为1080x1920,6:7常用目标比例为1080x1260。 - 封面保持“三土学AI”黑底商业草图风格:黑色或近黑背景,高对比大标题,白色/浅灰线稿,少量蓝色 AI 信号和橙色行动/成交强调,戴眼镜西装小人要参与核心动作。
- 封面可以比正文插画更有冲击力,但不要做成白底海报、PPT、密集信息图、赛博 HUD、机器人俗套图或真人照片。
- 标题是封面核心,必须足够大、清楚、适合手机缩略图;辅助小字最多 0-2 组,不能抢主标题。
- 生成后从
$CODEX_HOME/generated_images/...找到新增 PNG,复制到public/media/covers/cover-9x16.png和public/media/covers/cover-6x7.png;保留原始生成文件,不删除。 - 如果生图结果不是精确目标像素,先记录真实像素;只有在平台交付明确需要固定像素时,才做不改字、不重排标题的等比例背景扩展或安全裁切,并同时保留原始模型输出。
cover-manifest.json至少记录:id、title、ratio、path、source、status、width、height、prompt、titleCheck。- 抽查两版封面缩略图可读性:主标题完整、中文准确、主体不贴边、黑底不发灰、6:7 版本没有把标题或核心人物裁掉。
时间线要求
- 字幕跟随音频,不按文案字数硬切。
- 优先把 MiniMax 字幕按
,。!?;:等中文停顿拆成短段,去掉末尾标点后逐段显示;逗号前后不要堆在同一屏。 - 每条字幕建议
8-18个汉字,最多 2 行。 - 强观点句可以单独成段,停顿处可以留 4-8 帧呼吸。
- 插画切换不要太频繁;老板/创业者口播优先稳、清晰、有压迫感。
- 同一张插画可以覆盖多个短句,直到语义切换。
- 生成时间线后检查:插画显示框离画布左右和顶部有安全边距,字幕底部至少离头像顶部和声波顶部各
20px,并且layout.subtitleShadow覆盖字幕区域。
何时读取参考
- 版式、色彩、头像声波风格:读
references/editing-style.md。 - MiniMax CLI、TTS、音频对齐、时间线字段:读
references/timeline-workflow.md。 - 需要确认或复用 TTS 命令:读
references/minimax-tts-cli.md。 - 生成、保存、校验 gpt-image2 图片资产:读
references/image-asset-workflow.md。 - Remotion 工程和固定组件:读
references/remotion-rules.md。 - 交付前验收:读
references/quality-checks.md。
必要输出
根据任务阶段至少输出以下内容:
- MiniMax TTS 命令记录和生成好的克隆声音音频
- 音频对齐后的时间线
- 黑底简笔画 gpt-image2 prompt 列表
- 已落盘且可读的插画图片素材清单
- 可编辑 Remotion 工程
- 最终 MP4
- 关键帧检查图
- 若提供封面标题:
9:16和6:7两版封面、封面 prompt、cover-manifest.json、标题准确性和缩略图可读性检查结果
不要做
- 不要再按白底手绘口播素材处理。
- 不要要求真人口播视频;这个版本默认是音频驱动。
- 不要把头像当 PIP 视频;它是固定圆形头像图片。
- 不要把字幕放到头像下方或贴底。
- 不要让字幕、头像和声波互相遮挡;插画与字幕有重叠风险时,用黑色字幕阴影带保护字幕可读性。
- 不要为了遮字幕把正常生成的插画图片缩成小图;允许为平台四周安全区做
0.90-0.95左右的等比例轻缩和居中留边。 - 不要用代码生成简笔画主体素材。
- 不要默认用代码给封面叠中文标题;封面标题应直接由 gpt-image2 生成,除非用户明确要求后期排版。
What ships with it: 15 files
1963.5 KB alongside SKILL.md
agents/
- openai.yaml534 B
assets/
- santu-avatar.jpg163.1 KB
- santu-avatar-original.jpg645.8 KB
- santu-avatar.png962.1 KB
- santu-avatar-square.jpg163.1 KB
references/
- editing-style.md2.4 KB
- image-asset-workflow.md3.2 KB
- minimax-tts-cli.md1.1 KB
- quality-checks.md2.4 KB
- remotion-rules.md5.2 KB
- timeline-workflow.md4.6 KB
templates/
- customization-brief.md897 B
- init-checklist.md2.2 KB
- minimax.env.example354 B
- README.md6.3 KB