Santu ai voiceover illustrations
Skill Amazing-soil/santu61ai-skill/santu-ai-voiceover-illustrations
生成适合“三土学AI”黑底头像声波竖屏口播视频的 gpt-image2 简笔画配图方案与提示词。用于把中文文案、口播脚本、观点判断、流程、状态和商业隐喻,转成竖屏黑色背景、白色/浅灰线稿、少量蓝橙红点缀的简洁图片素材;固定人物形象是戴眼镜西装小人,插画位于上方视觉区,给中部字幕、下方圆形头像和左右声波留空间;直接出图时必须从内置生图落盘目录复制到项目媒体目录,记录真实像素尺寸和校验结果,不能用代码简笔画替代。From its SKILL.md
npx -y skills add Amazing-soil/santu61ai-skill --skill santu-ai-voiceover-illustrationsAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
5.7 KB, ~1.9k tokens by cl100k_base, as published. Nobody here has run it
三土学AI黑底简笔画配图
把中文 AI/商业文案转成黑底 gpt-image2 简笔画图片素材,用于“三土学AI黑底头像声波口播”视频。
核心输出
根据用户需求输出以下之一:
- 配图策略 / shot list:说明哪些语音片段需要图。
- gpt-image2 单张生图提示词。
- 已有 prompt 或图片的诊断与改写建议。
- 用户明确要求生成图片时,直接生成并整理图片资产。
除非用户明确要求“直接出图”,否则先输出配图策略和 prompt。
用户明确要做成剪辑素材时,不能只生成聊天预览图;必须把图片保存为项目目录里的可读文件,并返回路径。
内置生图结果通常会落在 $CODEX_HOME/generated_images/...;先查找新增文件并复制到项目 public/media/images/,不要直接判断“预览图不能保存本地”。
视觉定位
画面像黑板上的商业判断草图:黑色背景、白色或浅灰线稿、少量蓝/橙/红强调。整体要克制、专业、清晰,面向老板、企业家、创业者。
固定人物形象
默认每张图都使用“三土学AI戴眼镜西装小人”作为核心角色:
- 黑底白线稿小人,戴细框眼镜,穿简化西装外套、衬衫和领带或翻领点缀。
- 角色要承担核心动作:称量、拉杠杆、开闸门、分拣、修补、连接、推飞轮、照亮盲区。
- 角色不是头像本人肖像,不是真人照片,不是吉祥物,不是可爱 Q 版。
- 如果去掉西装小人,图仍然完整成立,说明角色太装饰,要重写 prompt。
细化人物形象时读取 references/character-ip.md。
不要做成白底图、PPT 课件、科技 HUD、复杂 UI、海报、商业矢量插画、机器人科幻图或写满字的信息图。
画布与安全区
默认画幅:1080x1920,竖屏 9:16。
Y=0-100:顶部呼吸区,保持干净。Y=120-820:核心插画区。简笔画主体、流程、隐喻物件主要放这里。Y=900-1240:字幕区预留。不要放关键物件和小字;剪辑层会加黑色字幕阴影带,但 prompt 仍要尽量留干净黑底。Y=1240-1580:圆形头像和左右声波区预留。不要放插画主体。Y=1600-1920:底部呼吸区,保持黑底。
插画主体不要撑满全屏。生成图片时可以整张是黑底,但可读内容必须集中在上方视觉区。
抖音/视频号四周有平台安全区,prompt 要要求主体离左右边框和顶部都有空余,不要贴边。
实际生成文件可能不是精确 1080x1920,要以文件真实像素为准记录;剪辑层会按安全区等比例轻缩居中展示,不要为了适配而拉伸或裁剪。
工作流
- 读文案或时间线,只提炼适合配图的认知锚点。
- 默认每
4-7 秒一个视觉单元;短句可以沿用上一张图。 - 每张图只表达一个判断、流程、状态或隐喻。
- 图内文字尽量少;重要表达交给视频字幕,不交给图片模型写长字。
- 写 gpt-image2 prompt,明确黑底、戴眼镜西装小人、简笔画、上方视觉区、字幕/头像/声波安全区、四周平台安全边距。
- 使用内置 gpt-image2 / image generation 能力逐张生成图片。
- 每张图生成后,先从
$CODEX_HOME/generated_images/...找到新增 PNG,再复制到项目public/media/images/,例如img-01-hook.png,并用文件系统确认可读。 - 记录真实图片尺寸到
asset-manifest.json,例如941x1672就写941x1672,不要假写1080x1920。 - 生成后按 QA 检查,不符合就重写 prompt 或重生成。
如果生图能力只在聊天里显示图片,且 $CODEX_HOME/generated_images/... 中也找不到新增图片文件,立即暂停并向用户确认保存方式;不要用代码、SVG、Canvas、PIL 或占位图替代 gpt-image2 图片,也不要改用外部生图工具,除非用户明确要求。
构图类型
- 判断对照:旧方式 vs 新杠杆。
- 三类/三步:三个简洁对象或三个小格。
- 流程路径:输入 -> 动作 -> 结果。
- 状态隐喻:卡住、分化、提效、掉队、试错、协作。
- 物理隐喻:天平、杠杆、闸门、滤网、漏斗、地图、桥、飞轮、信号塔。
Prompt 必须包含
- vertical 9:16, 1080x1920 composition。
- black background / near-black background。
- minimalist white line art / simple doodle sketch。
- recurring bespectacled suited little business operator。
- upper illustration zone only,保留中部字幕区和下方头像声波区。
- very few Chinese handwritten labels,最多 0-4 个短词。
- no white background, no full-screen poster, no subtitle text, no long Chinese sentences, no UI panels, no PPT, no cyberpunk HUD, no robot cliche。
写最终 prompt 时读取 references/prompt-template.md。
输出口径
策略输出要短、准、能直接进入剪辑时间线。prompt 输出要能直接复制给 gpt-image2,并给每张图一句用途说明。
直接生成图片时,输出必须包含:
- 图片
id - 对应口播片段
- gpt-image2 prompt
- 已保存文件路径
- 文件校验结果和真实像素尺寸
What ships with it: 7 files
11.2 KB alongside SKILL.md
agents/
- openai.yaml406 B
references/
- character-ip.md901 B
- composition-patterns.md887 B
- prompt-template.md3.7 KB
- qa-checklist.md1.4 KB
- vertical-layout.md1.2 KB
- README.md2.8 KB