Agent experiment
用于给 7×24 小时不间断运行的科研自动化项目装上工作纪律:常驻实验队列、半自动批处理、用 Git 维护的公开仓库、持续更新的 LaTeX/Overleaf 论文。用户说"装工作流""设置长任务纪律""加任务记录""setup the workflow"时用;长时间运行中出了事故、教训要当场记下来时也用。部署 CLAUDE.md 规则、三份记录文件(RULES / TODO / PROVENANCE)和可断点续跑的任务骨架。Use when setting up a 24/7 semi-automated research automation project - long-running experiment queues, Git-maintained public repos, continuously updated LaTeX/Overleaf papers.From its SKILL.md
npx -y skills add hashiruu/agent-experiment --skill agent-experimentAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
2 things to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
- 2 stars2 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
4.7 KB, ~1.6k tokens by cl100k_base, as published. Nobody here has run it
长任务工作纪律
给三件事同时在转的项目用:实验在跑,仓库在推,论文在改,人只在决策点出现。 这种项目最贵的失败不是代码写错,是记错账。出事时没人在场,等发现已经很晚。
素材来自一个长期半自动运行的真实项目。那里攒下约 800 行规则,26 条换个项目照样成立。 这个 skill 部署的就是这 26 条,外加一套让它们真被执行的脚手架。
规则正文是中文。事故是中文记的,翻译会丢掉那点让规则管用的精确度。
什么时候部署
长任务开始前就部署,不要等第一次事故。每条规则都是"已经出过的事": 抄一条几分钟,自己踩一遍几小时。
怎么部署
跑脚本,不要手工拷文件。
# 在要设置的项目根目录下
bash ~/.claude/skills/agent-experiment/deploy.sh
# 先预览
bash ~/.claude/skills/agent-experiment/deploy.sh --dry-run
# 指定目标和层
bash ~/.claude/skills/agent-experiment/deploy.sh --target /path/to/project --layers l1,l2
选哪几层
| 层 | 什么时候留 | 内容 |
|---|---|---|
l1 | 永远 | 11 条,跑长任务的 agent 都需要:绝不编辑正在执行的脚本、完成标记带时间戳校验、起任务前先查队列、判据先于数据、承认推翻 |
l2 | 跑 GPU / 长批处理 | 8 条:同一块卡有三种编号、nvidia-smi 的假故障、管线隔离、阶段断点、平凡基线、先查上游、baseline 公平性协议 |
l3 | LaTeX + 远程协作仓库 | 7 条:推前先拉且推后断言、编译而不是静态检查、页数只信编译器、表格与正文同步、可追溯性、声明所有偏离 |
默认三层全上。项目类型不明显就问用户;拿不准只留 l1,回头再加,重跑脚本原地刷新。
去掉哪一层,规则编号都不变,"见 L1 第 5 条"这类交叉引用照样不会指错。
落到项目里的东西
CLAUDE.md agent 开工前读的规则,夹在一对注释标记之间,重跑只换这一段
docs/RULES.md 这个项目自己踩过的坑:出了什么事、下次怎么做
docs/TODO.md 还剩什么要做、什么卡在等别人、什么砍了不做
docs/PROVENANCE.md 每个对外数字是从哪算出来的,以及动手前定好的判断标准
docs/monitoring.md 怎么监控跑几十小时的任务:静默失败的八种防法(现成的,不用填)
scripts/run_task.sh 长任务脚本模板:中断能接着跑,失败不会假装成功
docs/ 和 scripts/ 下那五份文件,一旦存在就永不覆盖,它们会变成这个项目自己的记录。
脚本只动 CLAUDE.md 里那对注释标记之间的内容。
部署之后
三件事,按这个顺序做:
- 看到任何结果之前,先把
docs/PROVENANCE.md里的判断标准填掉:显著性阈值、 baseline 公平性协议、可证伪的预测。事后补的不是判据,是给结论配尺子。 - 把真正的活写进
docs/TODO.md:用户新给的指令入队,手上的活不丢, 除非用户明确说先停下。碰到关键决策(不可逆、改对外数字、改判据或实验协议、要花大钱) 停下来等待用户决策,挂进"⏸ 阻塞中"写清在等什么,然后立刻去做不依赖它的下一件事; 非关键的自行推进,别逐步请示。 - 接好
scripts/run_task.sh。一个阶段一个step调用,最后一步失败, 代价是几分钟,不是整条链。
让它保持活着
规则是产物,产生规则的机制才是重点。
- 踩坑当场写进
docs/RULES.md,附上怎么踩的。没实例的规则是噪音,会把真教训淹掉。 - 推翻就在原地追加更正,不删旧的。看得见"曾经错过"比看起来一贯正确有用 —— 不然下一个读它的人(通常就是同一个 agent)会把同样的推理再走一遍。
- 数字要对外,先指得到三样东西:权重、代码、日志。
- 不造任务。队列空了、没东西可跑,正确动作就是什么都不做。
What ships with it: 7 files
26.8 KB alongside SKILL.md, 2 of them executable
assets/
- CLAUDE.md12.0 KB
- practices/monitoring.md3.0 KB
- scaffold/PROVENANCE.md1.2 KB
- scaffold/RULES.md1.1 KB
- scaffold/run_task.shruns3.7 KB
- scaffold/TODO.md1.1 KB
- deploy.shruns4.7 KB