agentsclimarketplace

Agent experiment

Skill hashiruu/agent-experiment/skills/agent-experiment

一个 7×24 小时不间断运行,帮你跑实验、用 Git 维护公开仓库、更新 LaTeX(Overleaf)论文的科研自动化工作流。实测效率提升 25 倍。Claude Code Skill,一条命令装进任意项目。

Install
npx -y skills add hashiruu/agent-experiment --skill agent-experiment

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

3 things to look at

  • 12 days oldThe repository was created 12 days ago. New is not bad, but a brand new repository carrying a familiar-sounding name is the shape a typosquat arrives in, and there has been no time for anyone else to find a problem with it.
  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 1 stars1 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

What its author says it does

Copied from the file, not written here

用于给 7×24 小时不间断运行的科研自动化项目装上工作纪律:常驻实验队列、半自动批处理、用 Git 维护的公开仓库、持续更新的 LaTeX/Overleaf 论文。用户说"装工作流""设置长任务纪律""加任务记录""setup the workflow"时用;长时间运行中出了事故、教训要当场记下来时也用。部署 CLAUDE.md 规则、三份记录文件(RULES / TODO / PROVENANCE)和可断点续跑的任务骨架。Use when setting up a 24/7 semi-automated research automation project - long-running experiment queues, Git-maintained public repos, continuously updated LaTeX/Overleaf papers.

SKILL.md

4.7 KB, ~1.6k tokens by cl100k_base, as published. Nobody here has run it

长任务工作纪律

给三件事同时在转的项目用:实验在跑,仓库在推,论文在改,人只在决策点出现。 这种项目最贵的失败不是代码写错,是记错账。出事时没人在场,等发现已经很晚。

素材来自一个长期半自动运行的真实项目。那里攒下约 800 行规则,26 条换个项目照样成立。 这个 skill 部署的就是这 26 条,外加一套让它们真被执行的脚手架。

规则正文是中文。事故是中文记的,翻译会丢掉那点让规则管用的精确度。

什么时候部署

长任务开始前就部署,不要等第一次事故。每条规则都是"已经出过的事": 抄一条几分钟,自己踩一遍几小时。

怎么部署

跑脚本,不要手工拷文件。

# 在要设置的项目根目录下
bash ~/.claude/skills/agent-experiment/deploy.sh

# 先预览
bash ~/.claude/skills/agent-experiment/deploy.sh --dry-run

# 指定目标和层
bash ~/.claude/skills/agent-experiment/deploy.sh --target /path/to/project --layers l1,l2

选哪几层

什么时候留内容
l1永远11 条,跑长任务的 agent 都需要:绝不编辑正在执行的脚本、完成标记带时间戳校验、起任务前先查队列、判据先于数据、承认推翻
l2跑 GPU / 长批处理8 条:同一块卡有三种编号、nvidia-smi 的假故障、管线隔离、阶段断点、平凡基线、先查上游、baseline 公平性协议
l3LaTeX + 远程协作仓库7 条:推前先拉且推后断言、编译而不是静态检查、页数只信编译器、表格与正文同步、可追溯性、声明所有偏离

默认三层全上。项目类型不明显就问用户;拿不准只留 l1,回头再加,重跑脚本原地刷新。

去掉哪一层,规则编号都不变,"见 L1 第 5 条"这类交叉引用照样不会指错。

落到项目里的东西

CLAUDE.md            agent 开工前读的规则,夹在一对注释标记之间,重跑只换这一段
docs/RULES.md        这个项目自己踩过的坑:出了什么事、下次怎么做
docs/TODO.md         还剩什么要做、什么卡在等别人、什么砍了不做
docs/PROVENANCE.md   每个对外数字是从哪算出来的,以及动手前定好的判断标准
docs/monitoring.md   怎么监控跑几十小时的任务:静默失败的八种防法(现成的,不用填)
scripts/run_task.sh  长任务脚本模板:中断能接着跑,失败不会假装成功

docs/scripts/ 下那五份文件,一旦存在就永不覆盖,它们会变成这个项目自己的记录。 脚本只动 CLAUDE.md 里那对注释标记之间的内容。

部署之后

三件事,按这个顺序做:

  1. 看到任何结果之前,先把 docs/PROVENANCE.md 里的判断标准填掉:显著性阈值、 baseline 公平性协议、可证伪的预测。事后补的不是判据,是给结论配尺子。
  2. 把真正的活写进 docs/TODO.md:用户新给的指令入队,手上的活不丢, 除非用户明确说先停下。碰到关键决策(不可逆、改对外数字、改判据或实验协议、要花大钱) 停下来等待用户决策,挂进"⏸ 阻塞中"写清在等什么,然后立刻去做不依赖它的下一件事; 非关键的自行推进,别逐步请示。
  3. 接好 scripts/run_task.sh。一个阶段一个 step 调用,最后一步失败, 代价是几分钟,不是整条链。

让它保持活着

规则是产物,产生规则的机制才是重点。

  • 踩坑当场写进 docs/RULES.md,附上怎么踩的。没实例的规则是噪音,会把真教训淹掉。
  • 推翻就在原地追加更正,不删旧的。看得见"曾经错过"比看起来一贯正确有用 —— 不然下一个读它的人(通常就是同一个 agent)会把同样的推理再走一遍。
  • 数字要对外,先指得到三样东西:权重、代码、日志。
  • 不造任务。队列空了、没东西可跑,正确动作就是什么都不做。

What ships with it: 7 files

26.8 KB alongside SKILL.md, 2 of them executable

Keep looking

Skills are one crate of 328,083. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.