Ccdawn ai research loop
Skill CCDawn/codex-skills/skills/research/ccdawn-ai-research-loop
Chinese-first Codex skill pack for intent alignment, dynamic routing, lightweight development, code review, UI design, and AI research workflows.
npx -y skills add CCDawn/codex-skills --skill ccdawn-ai-research-loopAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
One thing to look at
- 4 stars4 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
What its author says it does
Copied from the file, not written here
Use when AI/ML research engineering needs baseline reproduction, hypothesis-driven experiments, ablations, evaluation design, findings synthesis, research direction selection, plateau recovery, or a reproducible loop from a paper/repository/research question to evidence-backed results.
The file declares its own license as MIT. That is the author’s claim about this one file, and it is not the same thing as the license GitHub reports for the repository, which is listed with the other numbers below.
SKILL.md
7.3 KB, as published. Nobody here has run it
AI 研究工程循环
目标
把 AI 研究从“不断尝试代码”变成两个相互连接的轻量循环:
内层:可信 baseline -> 可证伪假设 -> 最小实验 -> 评估 -> 接受/拒绝/保留
外层:汇总多轮证据 -> 提炼规律 -> 更新假设组合 -> 继续/分支/转向/停止
本 skill 是 AI 研究工程的主 owner。ccdawn-score-loop 只承接一条可量化实验 lane;竞赛规则、提交和 leaderboard 全生命周期仍由 ccdawn-competition-research-lifecycle 适配。
BRT interface
- Context Boundary: 研究问题、代码和数据来源、active baseline、评价协议、允许修改面、计算预算、实验记录和当前证据。
- Output Contract: baseline 复现结论、假设组合、实验 lane、证据综合、研究方向决策或可复现交接。
- Allowed Action: 在已锁定的可编辑面和预算内复现、修改、运行、评估和记录;不静默改变数据划分、metric、baseline 或研究目标。
- Success Evidence: 可复现命令、baseline 指纹、metric 与方差、diff/config、实验 artifact、对照/消融结果以及有来源的研究结论。
- Stop Condition: baseline 不可信、评价协议漂移、数据泄漏、预算或权限不足、结果不可复现、关键假设无法区分,或继续实验已无新的信息价值。
- Route Out:
ccdawn-score-loop、ccdawn-feature-reuse-research、ccdawn-bug-review、ccdawn-research-rigor-review、ccdawn-competition-research-lifecycle、完成交接或 BLOCKED。
统一调用契约
- 只处理 BRT interface 范围;不匹配时回
ccdawn-brt或更具体 owner,复合任务不吞其他 owner。 - 用户可见内容默认中文,完成只报状态、产出、证据和剩余风险;代码、命令、路径、错误原文、API/协议、skill 名和枚举保留原样;Route Out 仅以 BRT interface 为准,末行写
下一步建议: <一个具体动作>。
所有权判断
- 用户要推进一个 AI/ML 研究问题、复现论文、做消融或从多轮实验中决定方向:本 skill 主责。
- 用户已经给出明确 baseline、metric 和单个低成本候选:本 owner 可直接比较;只有反复晋升、榜单反馈或持久 score lane 才路由
ccdawn-score-loop。 - 主要问题是训练脚本、metric、数据 schema、seed、shape、NaN 或环境的确定性故障:临时路由
ccdawn-bug-review,修复后返回研究循环。 - 主要问题是 Kaggle、竞赛规则、提交包或 public leaderboard:由竞赛生命周期主责,本 skill 只承接其研究阶段。
- 需要搜索论文、仓库、模型或可复用实现且结果会改变方案:使用
ccdawn-feature-reuse-research;研究 owner 保留方向决策权。
启动快照
先从仓库、论文、日志和配置读取已有事实,只补会改变研究决策的缺口:
- 研究问题与可观察成功标准;
- baseline 来源、版本、命令和已知结果;
- 数据版本、split、metric、seed 与评估预算;
- 可编辑面、保护面和算力/时间限制;
- 已尝试方向、失败证据和当前最可信结论。
缺少正式工件时可先运行可逆 probe,不因模板不全阻塞探索。只有 baseline、metric 或数据边界不清会让实验失去解释性时才暂停询问。
自适应流程
按当前研究不确定性选择最低充分重量:
QUICK:可信 baseline 上的 1-2 个低成本假设;内部维护短记录,直接实验和汇报。STANDARD:需要多轮消融、多个候选或跨会话延续;维护紧凑研究契约和 append-only 实验记录。DEEP:高成本训练、结论将用于论文/发布、数据或评价风险高;增加协议冻结、复现检查、严谨性审查和明确停止预算。
不按文件数或描述长度升级。不强制每轮新建 worktree、派子代理、写规划文档或使用 BDD/TDD。并行且会相互污染的实验才隔离工作区。
Baseline Gate
研究实验开始前确认:
- baseline 能在当前环境运行,或已明确记录不可复现原因;
- 代码、数据、配置、依赖和评价命令可定位;
- 结果与已知值的偏差有解释或被标记为风险;
- 后续候选使用同一评价协议,除非研究目标就是改变协议。
baseline 未通过时,当前产出是复现诊断,不把候选分数解释为研究结论。
内层实验循环
每条 lane 只要求一个能区分结果的主假设:
- 写出机制、预期信号和最早否证条件。
- 先找项目内复用;外部候选可能改变实现时再研究。
- 选择能推翻或支持假设的最小充分 evaluation。
- 可在当前上下文完成的简单比较直接执行;反复晋升、leaderboard 或持久 lane 才交给
ccdawn-score-loop。 - 区分 metric 结果、实现故障、环境故障和评价设计故障。
- 保留失败实验的差异、命令和教训,不用 TDD RED/GREEN 描述实验结果。
一次可顺序完成的实验不拆任务。只有独立假设、写入边界和资源允许时才并行。
外层综合与转向
出现以下任一信号时,从单次分数跳到证据综合:
- 完成一组相关实验或关键消融;
- 连续候选没有信息增益;
- 结果相互矛盾或对 seed/split/规模敏感;
- 当前解释无法预测下一结果;
- 准备晋升 baseline、形成 claim 或投入高成本训练。
综合时回答:哪些机制得到支持、哪些被否证、哪些仍不可区分;结果适用范围是什么;下一实验能减少哪项关键不确定性。然后只选一个决策:
CONTINUE:同一方向仍有高信息价值实验;BRANCH:两个独立解释都值得有界验证;PIVOT:当前假设族收益低,切换机制或表示;CONSOLIDATE:补复现、消融、统计和 artifact;STOP:目标已满足、预算到达或没有合理的新变量。
重要 baseline 晋升、论文级结论或反直觉结果先进入 ccdawn-research-rigor-review。普通失败 lane 不增加正式审查。
证据纪律
- 区分观测、解释和推测,不把相关性写成机制证明。
- 保留 negative result,但压缩重复失败;记录可复用 lesson 和触发条件。
- 指标提升必须关联 baseline、数据、协议、seed 和 artifact;不能只引用聊天结论。
- smoke/proxy 用于淘汰和排序,不替代目标评估。
- 外部论文或仓库只提供先验,当前项目证据决定是否晋升。
- 不运行无限循环;每轮必须受实验数量、时间、算力或信息增益停止条件约束。
输出与延续
用户可见输出默认中文。普通一轮只报告:当前判断、关键证据、决策、下一实验;不展示完整内部账本。
跨会话、高成本或需要交接时,读取 research-contract.md 并维护最小契约。目标未变时,用户说“继续”就从 active baseline、未决假设和推荐实验续接,不重开需求对齐。
正文末尾输出:下一步建议: <信息价值最高且当前可执行的一个动作>。