agentsclimarketplace

Santu ai voiceover illustrations

Skill Amazing-soil/santu61ai-skill/santu-ai-voiceover-illustrations

三土沉淀的 AI Agent Skills 合集,包含中文 AI 科技口播视频生产等可复用工作流。

Install
npx -y skills add Amazing-soil/santu61ai-skill --skill santu-ai-voiceover-illustrations

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

生成适合“三土学AI”黑底头像声波竖屏口播视频的 gpt-image2 简笔画配图方案与提示词。用于把中文文案、口播脚本、观点判断、流程、状态和商业隐喻,转成竖屏黑色背景、白色/浅灰线稿、少量蓝橙红点缀的简洁图片素材;固定人物形象是戴眼镜西装小人,插画位于上方视觉区,给中部字幕、下方圆形头像和左右声波留空间;直接出图时必须从内置生图落盘目录复制到项目媒体目录,记录真实像素尺寸和校验结果,不能用代码简笔画替代。

SKILL.md

5.7 KB, ~1.9k tokens by cl100k_base, as published. Nobody here has run it

三土学AI黑底简笔画配图

把中文 AI/商业文案转成黑底 gpt-image2 简笔画图片素材,用于“三土学AI黑底头像声波口播”视频。

核心输出

根据用户需求输出以下之一:

  • 配图策略 / shot list:说明哪些语音片段需要图。
  • gpt-image2 单张生图提示词。
  • 已有 prompt 或图片的诊断与改写建议。
  • 用户明确要求生成图片时,直接生成并整理图片资产。

除非用户明确要求“直接出图”,否则先输出配图策略和 prompt。

用户明确要做成剪辑素材时,不能只生成聊天预览图;必须把图片保存为项目目录里的可读文件,并返回路径。 内置生图结果通常会落在 $CODEX_HOME/generated_images/...;先查找新增文件并复制到项目 public/media/images/,不要直接判断“预览图不能保存本地”。

视觉定位

画面像黑板上的商业判断草图:黑色背景、白色或浅灰线稿、少量蓝/橙/红强调。整体要克制、专业、清晰,面向老板、企业家、创业者。

固定人物形象

默认每张图都使用“三土学AI戴眼镜西装小人”作为核心角色:

  • 黑底白线稿小人,戴细框眼镜,穿简化西装外套、衬衫和领带或翻领点缀。
  • 角色要承担核心动作:称量、拉杠杆、开闸门、分拣、修补、连接、推飞轮、照亮盲区。
  • 角色不是头像本人肖像,不是真人照片,不是吉祥物,不是可爱 Q 版。
  • 如果去掉西装小人,图仍然完整成立,说明角色太装饰,要重写 prompt。

细化人物形象时读取 references/character-ip.md

不要做成白底图、PPT 课件、科技 HUD、复杂 UI、海报、商业矢量插画、机器人科幻图或写满字的信息图。

画布与安全区

默认画幅:1080x1920,竖屏 9:16

  • Y=0-100:顶部呼吸区,保持干净。
  • Y=120-820:核心插画区。简笔画主体、流程、隐喻物件主要放这里。
  • Y=900-1240:字幕区预留。不要放关键物件和小字;剪辑层会加黑色字幕阴影带,但 prompt 仍要尽量留干净黑底。
  • Y=1240-1580:圆形头像和左右声波区预留。不要放插画主体。
  • Y=1600-1920:底部呼吸区,保持黑底。

插画主体不要撑满全屏。生成图片时可以整张是黑底,但可读内容必须集中在上方视觉区。 抖音/视频号四周有平台安全区,prompt 要要求主体离左右边框和顶部都有空余,不要贴边。 实际生成文件可能不是精确 1080x1920,要以文件真实像素为准记录;剪辑层会按安全区等比例轻缩居中展示,不要为了适配而拉伸或裁剪。

工作流

  1. 读文案或时间线,只提炼适合配图的认知锚点。
  2. 默认每 4-7 秒 一个视觉单元;短句可以沿用上一张图。
  3. 每张图只表达一个判断、流程、状态或隐喻。
  4. 图内文字尽量少;重要表达交给视频字幕,不交给图片模型写长字。
  5. 写 gpt-image2 prompt,明确黑底、戴眼镜西装小人、简笔画、上方视觉区、字幕/头像/声波安全区、四周平台安全边距。
  6. 使用内置 gpt-image2 / image generation 能力逐张生成图片。
  7. 每张图生成后,先从 $CODEX_HOME/generated_images/... 找到新增 PNG,再复制到项目 public/media/images/,例如 img-01-hook.png,并用文件系统确认可读。
  8. 记录真实图片尺寸到 asset-manifest.json,例如 941x1672 就写 941x1672,不要假写 1080x1920
  9. 生成后按 QA 检查,不符合就重写 prompt 或重生成。

如果生图能力只在聊天里显示图片,且 $CODEX_HOME/generated_images/... 中也找不到新增图片文件,立即暂停并向用户确认保存方式;不要用代码、SVG、Canvas、PIL 或占位图替代 gpt-image2 图片,也不要改用外部生图工具,除非用户明确要求。

构图类型

  • 判断对照:旧方式 vs 新杠杆。
  • 三类/三步:三个简洁对象或三个小格。
  • 流程路径:输入 -> 动作 -> 结果。
  • 状态隐喻:卡住、分化、提效、掉队、试错、协作。
  • 物理隐喻:天平、杠杆、闸门、滤网、漏斗、地图、桥、飞轮、信号塔。

Prompt 必须包含

  • vertical 9:16, 1080x1920 composition。
  • black background / near-black background。
  • minimalist white line art / simple doodle sketch。
  • recurring bespectacled suited little business operator。
  • upper illustration zone only,保留中部字幕区和下方头像声波区。
  • very few Chinese handwritten labels,最多 0-4 个短词。
  • no white background, no full-screen poster, no subtitle text, no long Chinese sentences, no UI panels, no PPT, no cyberpunk HUD, no robot cliche。

写最终 prompt 时读取 references/prompt-template.md

输出口径

策略输出要短、准、能直接进入剪辑时间线。prompt 输出要能直接复制给 gpt-image2,并给每张图一句用途说明。

直接生成图片时,输出必须包含:

  • 图片 id
  • 对应口播片段
  • gpt-image2 prompt
  • 已保存文件路径
  • 文件校验结果和真实像素尺寸

What ships with it: 7 files

11.2 KB alongside SKILL.md

agents/

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.