agentsclimarketplace

Agent experiment

Skill hashiruu/agent-experiment/skills/agent-experiment

用于给 7×24 小时不间断运行的科研自动化项目装上工作纪律:常驻实验队列、半自动批处理、用 Git 维护的公开仓库、持续更新的 LaTeX/Overleaf 论文。用户说"装工作流""设置长任务纪律""加任务记录""setup the workflow"时用;长时间运行中出了事故、教训要当场记下来时也用。部署 CLAUDE.md 规则、三份记录文件(RULES / TODO / PROVENANCE)和可断点续跑的任务骨架。Use when setting up a 24/7 semi-automated research automation project - long-running experiment queues, Git-maintained public repos, continuously updated LaTeX/Overleaf papers.From its SKILL.md

Install
npx -y skills add hashiruu/agent-experiment --skill agent-experiment

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

4.7 KB, ~1.6k tokens by cl100k_base, as published. Nobody here has run it

长任务工作纪律

给三件事同时在转的项目用:实验在跑,仓库在推,论文在改,人只在决策点出现。 这种项目最贵的失败不是代码写错,是记错账。出事时没人在场,等发现已经很晚。

素材来自一个长期半自动运行的真实项目。那里攒下约 800 行规则,26 条换个项目照样成立。 这个 skill 部署的就是这 26 条,外加一套让它们真被执行的脚手架。

规则正文是中文。事故是中文记的,翻译会丢掉那点让规则管用的精确度。

什么时候部署

长任务开始前就部署,不要等第一次事故。每条规则都是"已经出过的事": 抄一条几分钟,自己踩一遍几小时。

怎么部署

跑脚本,不要手工拷文件。

# 在要设置的项目根目录下
bash ~/.claude/skills/agent-experiment/deploy.sh

# 先预览
bash ~/.claude/skills/agent-experiment/deploy.sh --dry-run

# 指定目标和层
bash ~/.claude/skills/agent-experiment/deploy.sh --target /path/to/project --layers l1,l2

选哪几层

什么时候留内容
l1永远11 条,跑长任务的 agent 都需要:绝不编辑正在执行的脚本、完成标记带时间戳校验、起任务前先查队列、判据先于数据、承认推翻
l2跑 GPU / 长批处理8 条:同一块卡有三种编号、nvidia-smi 的假故障、管线隔离、阶段断点、平凡基线、先查上游、baseline 公平性协议
l3LaTeX + 远程协作仓库7 条:推前先拉且推后断言、编译而不是静态检查、页数只信编译器、表格与正文同步、可追溯性、声明所有偏离

默认三层全上。项目类型不明显就问用户;拿不准只留 l1,回头再加,重跑脚本原地刷新。

去掉哪一层,规则编号都不变,"见 L1 第 5 条"这类交叉引用照样不会指错。

落到项目里的东西

CLAUDE.md            agent 开工前读的规则,夹在一对注释标记之间,重跑只换这一段
docs/RULES.md        这个项目自己踩过的坑:出了什么事、下次怎么做
docs/TODO.md         还剩什么要做、什么卡在等别人、什么砍了不做
docs/PROVENANCE.md   每个对外数字是从哪算出来的,以及动手前定好的判断标准
docs/monitoring.md   怎么监控跑几十小时的任务:静默失败的八种防法(现成的,不用填)
scripts/run_task.sh  长任务脚本模板:中断能接着跑,失败不会假装成功

docs/scripts/ 下那五份文件,一旦存在就永不覆盖,它们会变成这个项目自己的记录。 脚本只动 CLAUDE.md 里那对注释标记之间的内容。

部署之后

三件事,按这个顺序做:

  1. 看到任何结果之前,先把 docs/PROVENANCE.md 里的判断标准填掉:显著性阈值、 baseline 公平性协议、可证伪的预测。事后补的不是判据,是给结论配尺子。
  2. 把真正的活写进 docs/TODO.md:用户新给的指令入队,手上的活不丢, 除非用户明确说先停下。碰到关键决策(不可逆、改对外数字、改判据或实验协议、要花大钱) 停下来等待用户决策,挂进"⏸ 阻塞中"写清在等什么,然后立刻去做不依赖它的下一件事; 非关键的自行推进,别逐步请示。
  3. 接好 scripts/run_task.sh。一个阶段一个 step 调用,最后一步失败, 代价是几分钟,不是整条链。

让它保持活着

规则是产物,产生规则的机制才是重点。

  • 踩坑当场写进 docs/RULES.md,附上怎么踩的。没实例的规则是噪音,会把真教训淹掉。
  • 推翻就在原地追加更正,不删旧的。看得见"曾经错过"比看起来一贯正确有用 —— 不然下一个读它的人(通常就是同一个 agent)会把同样的推理再走一遍。
  • 数字要对外,先指得到三样东西:权重、代码、日志。
  • 不造任务。队列空了、没东西可跑,正确动作就是什么都不做。

What ships with it: 7 files

26.8 KB alongside SKILL.md, 2 of them executable

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.