agentsclimarketplace

Santu ai voiceover illustrations

Skill Amazing-soil/santu61ai-skill/santu-ai-voiceover-illustrations

生成适合“三土学AI”黑底头像声波竖屏口播视频的 gpt-image2 简笔画配图方案与提示词。用于把中文文案、口播脚本、观点判断、流程、状态和商业隐喻,转成竖屏黑色背景、白色/浅灰线稿、少量蓝橙红点缀的简洁图片素材;固定人物形象是戴眼镜西装小人,插画位于上方视觉区,给中部字幕、下方圆形头像和左右声波留空间;直接出图时必须从内置生图落盘目录复制到项目媒体目录,记录真实像素尺寸和校验结果,不能用代码简笔画替代。From its SKILL.md

Install
npx -y skills add Amazing-soil/santu61ai-skill --skill santu-ai-voiceover-illustrations

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

5.7 KB, ~1.9k tokens by cl100k_base, as published. Nobody here has run it

三土学AI黑底简笔画配图

把中文 AI/商业文案转成黑底 gpt-image2 简笔画图片素材,用于“三土学AI黑底头像声波口播”视频。

核心输出

根据用户需求输出以下之一:

  • 配图策略 / shot list:说明哪些语音片段需要图。
  • gpt-image2 单张生图提示词。
  • 已有 prompt 或图片的诊断与改写建议。
  • 用户明确要求生成图片时,直接生成并整理图片资产。

除非用户明确要求“直接出图”,否则先输出配图策略和 prompt。

用户明确要做成剪辑素材时,不能只生成聊天预览图;必须把图片保存为项目目录里的可读文件,并返回路径。 内置生图结果通常会落在 $CODEX_HOME/generated_images/...;先查找新增文件并复制到项目 public/media/images/,不要直接判断“预览图不能保存本地”。

视觉定位

画面像黑板上的商业判断草图:黑色背景、白色或浅灰线稿、少量蓝/橙/红强调。整体要克制、专业、清晰,面向老板、企业家、创业者。

固定人物形象

默认每张图都使用“三土学AI戴眼镜西装小人”作为核心角色:

  • 黑底白线稿小人,戴细框眼镜,穿简化西装外套、衬衫和领带或翻领点缀。
  • 角色要承担核心动作:称量、拉杠杆、开闸门、分拣、修补、连接、推飞轮、照亮盲区。
  • 角色不是头像本人肖像,不是真人照片,不是吉祥物,不是可爱 Q 版。
  • 如果去掉西装小人,图仍然完整成立,说明角色太装饰,要重写 prompt。

细化人物形象时读取 references/character-ip.md

不要做成白底图、PPT 课件、科技 HUD、复杂 UI、海报、商业矢量插画、机器人科幻图或写满字的信息图。

画布与安全区

默认画幅:1080x1920,竖屏 9:16

  • Y=0-100:顶部呼吸区,保持干净。
  • Y=120-820:核心插画区。简笔画主体、流程、隐喻物件主要放这里。
  • Y=900-1240:字幕区预留。不要放关键物件和小字;剪辑层会加黑色字幕阴影带,但 prompt 仍要尽量留干净黑底。
  • Y=1240-1580:圆形头像和左右声波区预留。不要放插画主体。
  • Y=1600-1920:底部呼吸区,保持黑底。

插画主体不要撑满全屏。生成图片时可以整张是黑底,但可读内容必须集中在上方视觉区。 抖音/视频号四周有平台安全区,prompt 要要求主体离左右边框和顶部都有空余,不要贴边。 实际生成文件可能不是精确 1080x1920,要以文件真实像素为准记录;剪辑层会按安全区等比例轻缩居中展示,不要为了适配而拉伸或裁剪。

工作流

  1. 读文案或时间线,只提炼适合配图的认知锚点。
  2. 默认每 4-7 秒 一个视觉单元;短句可以沿用上一张图。
  3. 每张图只表达一个判断、流程、状态或隐喻。
  4. 图内文字尽量少;重要表达交给视频字幕,不交给图片模型写长字。
  5. 写 gpt-image2 prompt,明确黑底、戴眼镜西装小人、简笔画、上方视觉区、字幕/头像/声波安全区、四周平台安全边距。
  6. 使用内置 gpt-image2 / image generation 能力逐张生成图片。
  7. 每张图生成后,先从 $CODEX_HOME/generated_images/... 找到新增 PNG,再复制到项目 public/media/images/,例如 img-01-hook.png,并用文件系统确认可读。
  8. 记录真实图片尺寸到 asset-manifest.json,例如 941x1672 就写 941x1672,不要假写 1080x1920
  9. 生成后按 QA 检查,不符合就重写 prompt 或重生成。

如果生图能力只在聊天里显示图片,且 $CODEX_HOME/generated_images/... 中也找不到新增图片文件,立即暂停并向用户确认保存方式;不要用代码、SVG、Canvas、PIL 或占位图替代 gpt-image2 图片,也不要改用外部生图工具,除非用户明确要求。

构图类型

  • 判断对照:旧方式 vs 新杠杆。
  • 三类/三步:三个简洁对象或三个小格。
  • 流程路径:输入 -> 动作 -> 结果。
  • 状态隐喻:卡住、分化、提效、掉队、试错、协作。
  • 物理隐喻:天平、杠杆、闸门、滤网、漏斗、地图、桥、飞轮、信号塔。

Prompt 必须包含

  • vertical 9:16, 1080x1920 composition。
  • black background / near-black background。
  • minimalist white line art / simple doodle sketch。
  • recurring bespectacled suited little business operator。
  • upper illustration zone only,保留中部字幕区和下方头像声波区。
  • very few Chinese handwritten labels,最多 0-4 个短词。
  • no white background, no full-screen poster, no subtitle text, no long Chinese sentences, no UI panels, no PPT, no cyberpunk HUD, no robot cliche。

写最终 prompt 时读取 references/prompt-template.md

输出口径

策略输出要短、准、能直接进入剪辑时间线。prompt 输出要能直接复制给 gpt-image2,并给每张图一句用途说明。

直接生成图片时,输出必须包含:

  • 图片 id
  • 对应口播片段
  • gpt-image2 prompt
  • 已保存文件路径
  • 文件校验结果和真实像素尺寸

What ships with it: 7 files

11.2 KB alongside SKILL.md

agents/

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.