agentsclimarketplace

Santu ai voiceover editing

Skill Amazing-soil/santu61ai-skill/santu-ai-voiceover-editing

三土沉淀的 AI Agent Skills 合集,包含中文 AI 科技口播视频生产等可复用工作流。

Install
npx -y skills add Amazing-soil/santu61ai-skill --skill santu-ai-voiceover-editing

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

生成“三土学AI”黑底头像声波竖屏口播视频和爆款短视频封面。用于用户提供中文文案后,默认用本地 MiniMax 中国站 API CLI `minimax-tts` 调用已克隆音色做文字转语音,固定音色 `SantuVoice20260618B`,固定 HD 模型 `speech-2.8-hd`,再按音频和文案切真实时间线,规划并生成 gpt-image2 黑底简笔画图片素材,最后制作 1080x1920 成片:黑色背景,上方戴眼镜西装小人简笔画,图片按真实像素记录并为抖音/视频号四周安全区做等比例轻缩和居中留边,中部字幕按逗号/句读分段并带黑色阴影安全区,中间偏下圆形头像,头像左右固定动态声波。若用户提供封面标题或要求封面,视频完成后用 gpt-image2 直接生成带精准中文标题的爆款封面,并交付 9:16 和 6:7 两种比例。代码只负责音频对齐、字幕、圆形头像裁切、声波、布局、转场、简单图形和必要的封面尺寸整理,不生成简笔画主体素材或封面主视觉。

SKILL.md

10.7 KB, ~3.7k tokens by cl100k_base, as published. Nobody here has run it

三土学AI黑底头像声波口播

把一篇中文文案做成竖屏口播视频:用本地 minimax-tts 把文案转成三土克隆声音,按音频切时间线,生成黑底 gpt-image2 简笔画配图,再用固定头像声波版式剪成成片。若用户给出封面标题,成片后继续生成 9:16 和 6:7 两版爆款视频封面。

核心定位

  • santu-ai-voiceover-editing:负责完整生产链路、时间线、剪辑版式、Remotion 工程和交付检查。
  • santu-ai-voiceover-illustrations:负责把文案片段转成黑底 gpt-image2 简笔画图片素材方案与提示词。
  • 头像素材默认使用已裁剪好的透明圆形头像 assets/santu-avatar.png。若用户提供新头像,先裁剪保存,再替换该资产或在项目素材清单中指定新路径。
  • TTS 默认使用本机全局 CLI:minimax-tts tts --model speech-2.8-hd --voice-id SantuVoice20260618B
  • gpt-image2 图片不是“聊天里看到了”就算完成;必须保存为项目内可读文件,并写入 src/timeline.json
  • 封面标题必须由模型直接生成在图里,不默认做后期中文文字叠加;只有用户明确要求才用代码补字或排版。

固定画面结构

  • 画幅:1080x1920
  • 背景:纯黑或近黑,默认 #050505
  • 插画素材:使用 gpt-image2 生成的黑底整图,素材清单记录真实像素;剪辑层可为抖音/视频号四周安全区做等比例轻缩,默认保留左右 80-110px、顶部 60-100px 空余。
  • 插画缩放:只允许等比例缩放,不拉伸、不裁切、不压扁。常用显示比例 0.90-0.95,不要把正常图片缩成小贴图。
  • 插画内容:关键人物和物件应集中在上方视觉区;如果图太大压到字幕,先用 prompt 让主体上移,剪辑层用字幕阴影安全带兜底。
  • 字幕区:头像和插画之间,推荐 Y=960-1240,居中显示 1-2 行中文字幕。
  • 字幕安全带:字幕背后必须有黑色/近黑柔边阴影区域,放在插画层之上、字幕层之下,覆盖字幕可能出现的位置。
  • 头像区:中间偏下,推荐圆心 X=540, Y=1400,圆形头像直径 240-280
  • 声波区:头像左右两侧固定动态声波,推荐左侧 X=120-390、右侧 X=690-960,垂直中心跟头像一致。
  • 底部:保持黑色呼吸区,只放很轻的品牌名或完全留空。

素材职责边界

  • 简笔画配图必须是 gpt-image2 生成的图片素材,不能用 Remotion/SVG/CSS/Canvas 代码生成。
  • 每张简笔画生成后必须落盘到工程媒体目录,例如 public/media/images/img-01.png,并用文件系统校验存在、尺寸和格式。
  • 代码可以生成文字、字幕、简单几何、声波、圆形头像裁切、遮罩、淡入淡出和轻微位移动效。
  • 缺插画时,回到 santu-ai-voiceover-illustrations 生成 gpt-image2 提示词和图片,不要临时用代码补画。
  • 内置生图结果默认先保存在 $CODEX_HOME/generated_images/...;项目素材必须从该目录复制到工程 public/media/images/,不能只停留在聊天预览或默认生成目录。
  • 先检查 $CODEX_HOME/generated_images/... 并复制新增文件;只有该目录也没有新增图片文件时,才暂停并向用户确认保存方式。
  • 不要说“只能预览、不能保存本地”就停止;先用文件系统查找、复制、校验内置生图落盘文件。
  • 不要改用外部生图工具,也不要用代码画图或占位图继续剪。
  • 声波是剪辑层固定组件,不是 gpt-image2 素材。
  • 爆款封面主视觉和中文标题必须是 gpt-image2 生成的图片内容;代码最多用于保存、校验、等比例尺寸整理、生成清单和预览图。

默认工作流

  1. 获取中文文案、头像、输出目录和可选封面标题;若用户已提供音频,可跳过 TTS。
  2. 清理文案口播稿:去掉不适合朗读的括号、长列表符号和视觉说明,保留自然口语节奏。
  3. 用本地 MiniMax 中国站 CLI 生成音频:minimax-tts tts --text-file script.txt --output voice.mp3 --model speech-2.8-hd --voice-id SantuVoice20260618B --language-boost Chinese --subtitle
  4. 拿到音频后,按音频真实时长切时间线。有词级时间戳优先用词级;没有时按句子/停顿估算,再用音频波形和试听校准。
  5. 4-7 秒 一个视觉单元拆分文案,给每个视觉单元规划一张黑底简笔画或沿用上一张图。
  6. 调用或复用 santu-ai-voiceover-illustrations 生成黑底 gpt-image2 图片素材。逐张保存到 public/media/images/,生成 prompts.jsonasset-manifest.json
  7. 校验每张插画文件真实存在且可读;只有校验通过的图片才能进入时间线。
  8. 生成 timeline.json:音频、分段字幕、插画真实尺寸、字幕阴影带、头像、声波、转场全部可编辑。
  9. 生成或修改 Remotion 工程,固定版式为“上方插画 + 字幕黑影安全带 + 中部字幕 + 下方圆形头像 + 左右声波”。
  10. 抽关键帧检查黑底、插画清晰度、字幕位置、字幕背后黑影、头像圆裁、声波动态和音画同步。
  11. 导出 MP4,并交付音频、时间线、gpt-image2 prompt、素材清单、工程路径和关键帧检查图。
  12. 若用户提供封面标题或要求封面,继续生成两张爆款封面:9:16 竖屏封面和 6:7 信息流封面;保存到 public/media/covers/,生成 cover-manifest.json,并返回文件路径、真实像素尺寸和标题校验结果。若用户没有提供封面标题,不要擅自编标题;在交付时提示可补充封面标题后再生成双尺寸封面。

爆款封面要求

  • 封面标题来自用户输入,必须在 prompt 中声明“精确生成以下中文标题”,并逐字列出标题;生成后人工查看图片,确认没有错字、漏字、多字、乱码或笔画严重变形。
  • 默认分别生成两张封面,不从 9:16 直接裁出 6:7,除非用户明确要求复用同一主视觉。9:16 常用目标比例为 1080x19206:7 常用目标比例为 1080x1260
  • 封面保持“三土学AI”黑底商业草图风格:黑色或近黑背景,高对比大标题,白色/浅灰线稿,少量蓝色 AI 信号和橙色行动/成交强调,戴眼镜西装小人要参与核心动作。
  • 封面可以比正文插画更有冲击力,但不要做成白底海报、PPT、密集信息图、赛博 HUD、机器人俗套图或真人照片。
  • 标题是封面核心,必须足够大、清楚、适合手机缩略图;辅助小字最多 0-2 组,不能抢主标题。
  • 生成后从 $CODEX_HOME/generated_images/... 找到新增 PNG,复制到 public/media/covers/cover-9x16.pngpublic/media/covers/cover-6x7.png;保留原始生成文件,不删除。
  • 如果生图结果不是精确目标像素,先记录真实像素;只有在平台交付明确需要固定像素时,才做不改字、不重排标题的等比例背景扩展或安全裁切,并同时保留原始模型输出。
  • cover-manifest.json 至少记录:idtitleratiopathsourcestatuswidthheightprompttitleCheck
  • 抽查两版封面缩略图可读性:主标题完整、中文准确、主体不贴边、黑底不发灰、6:7 版本没有把标题或核心人物裁掉。

时间线要求

  • 字幕跟随音频,不按文案字数硬切。
  • 优先把 MiniMax 字幕按 ,。!?;: 等中文停顿拆成短段,去掉末尾标点后逐段显示;逗号前后不要堆在同一屏。
  • 每条字幕建议 8-18 个汉字,最多 2 行。
  • 强观点句可以单独成段,停顿处可以留 4-8 帧呼吸。
  • 插画切换不要太频繁;老板/创业者口播优先稳、清晰、有压迫感。
  • 同一张插画可以覆盖多个短句,直到语义切换。
  • 生成时间线后检查:插画显示框离画布左右和顶部有安全边距,字幕底部至少离头像顶部和声波顶部各 20px,并且 layout.subtitleShadow 覆盖字幕区域。

何时读取参考

  • 版式、色彩、头像声波风格:读 references/editing-style.md
  • MiniMax CLI、TTS、音频对齐、时间线字段:读 references/timeline-workflow.md
  • 需要确认或复用 TTS 命令:读 references/minimax-tts-cli.md
  • 生成、保存、校验 gpt-image2 图片资产:读 references/image-asset-workflow.md
  • Remotion 工程和固定组件:读 references/remotion-rules.md
  • 交付前验收:读 references/quality-checks.md

必要输出

根据任务阶段至少输出以下内容:

  • MiniMax TTS 命令记录和生成好的克隆声音音频
  • 音频对齐后的时间线
  • 黑底简笔画 gpt-image2 prompt 列表
  • 已落盘且可读的插画图片素材清单
  • 可编辑 Remotion 工程
  • 最终 MP4
  • 关键帧检查图
  • 若提供封面标题:9:166:7 两版封面、封面 prompt、cover-manifest.json、标题准确性和缩略图可读性检查结果

不要做

  • 不要再按白底手绘口播素材处理。
  • 不要要求真人口播视频;这个版本默认是音频驱动。
  • 不要把头像当 PIP 视频;它是固定圆形头像图片。
  • 不要把字幕放到头像下方或贴底。
  • 不要让字幕、头像和声波互相遮挡;插画与字幕有重叠风险时,用黑色字幕阴影带保护字幕可读性。
  • 不要为了遮字幕把正常生成的插画图片缩成小图;允许为平台四周安全区做 0.90-0.95 左右的等比例轻缩和居中留边。
  • 不要用代码生成简笔画主体素材。
  • 不要默认用代码给封面叠中文标题;封面标题应直接由 gpt-image2 生成,除非用户明确要求后期排版。

What ships with it: 15 files

1963.5 KB alongside SKILL.md

agents/

Gives 0 of the 12 instructions most video audio skills give in ~3.7k tokens

Counted across 622 of the 795 authors here whose files we hold, read 2026-08-07

  • Read individual rule files for detailed explanationsin 21 of 622, across 10 files
  • Render final videoin 13 of 622, across 6 files
  • Use WAV PCM 16kHz mono audio formatin 12 of 622, across 3 files
  • Use this skill when dealing with Remotion codein 11 of 622, across 4 files
  • Save generated audio to a WAV filein 11 of 622, across 4 files
  • Handle conversion errors gracefullyin 10 of 622, across 6 files
  • Add captions to videos alwaysin 10 of 622, across 4 files
  • Generate music from text descriptions using MusicGenin 9 of 622, across 2 files
  • Do not skip pipeline layersin 9 of 622, across 3 files
  • Do not make one tool do everythingin 9 of 622, across 3 files
  • Use Azure Document Intelligence for complex PDFsin 9 of 622, across 4 files
  • Never ask the user to paste their full API keyin 9 of 622, across 3 files

Said here and by no other author read

  • generate audio with local TTS CLI
  • clean script for natural speech
  • split audio into real timeline
  • generate black background images
  • save generated images to project directory
  • verify generated image files exist

Grouped from the skills themselves: near-identical wordings counted once, and counted by distinct author, so one author publishing three of these counts once. Length counted with cl100k_base; the agent that loads this file may tokenize it differently.

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.