agentsclimarketplace

Thesis critical review

Skill Skydooooog0221/claude-code-skills/thesis-critical-review

A collection of Claude Code skills for academic writing and literature work.From the repository description

Install
npx -y skills add Skydooooog0221/claude-code-skills --skill thesis-critical-review

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

19.7 KB, ~7.7k tokens by cl100k_base, as published. Nobody here has run it

thesis-critical-review — 学术论文对抗性批判审查

版本:0.1.0-draft 创建日期:2026-04-13 来源:从真实论文项目多轮critical review + 答辩预演经验中提炼 定位:模拟答辩委员/审稿人对论文的深度攻击。纯LLM判断,无机械检测


设计哲学

这个skill的角色是对抗者,不是帮手。它的工作不是让论文"更好",是找到论文中审稿人/答辩委员最可能攻击的点,让用户在被攻击之前先堵上。

  • 不评价写作质量——只关注论证逻辑
  • 不写替换文字——只给攻击路径和防御方向。写作是humanizer的领地
  • 不做引用核查——假设引用是正确的(那是thesis-qc M4的事),只检查引用的论证角色
  • 不做格式检查——那是thesis-qc M6的事
  • 发现的问题按"审稿人会不会因为这个reject"排优先级,不按"学术上是否完美"排

触发条件

以下任一情况触发:

  • 用户提到"critical review""批判审查""审稿人会怎么说""答辩会问什么""挑毛病""攻击面"
  • 用户要求审查论文的讨论/局限性部分
  • 用户上传研究提纲/开题报告并要求质疑
  • 用户上传单章草稿并要求审查论证
  • thesis-qc在Phase 8调用

三阶段模式

stage=design 设计期审查

审查对象: Research Blueprint / 研究提纲 / 开题报告

输入:

  • 研究蓝图文档(md/txt/docx),至少包含:研究问题、各部分分解、数据来源、方法选择
  • 无需完整论文

维度(B1-B6):

#维度核心质疑
B1问题价值这个问题的答案对谁有用?文献留下的gap是真gap还是别人不做是因为不值得做?如果答案是"和预期一致",论文还有贡献吗?
B2方法-问题匹配你选的方法能回答这个问题吗?有没有更直接的方法被跳过了?方法的固有局限是否会让结论打折到不值得做?
B3数据架构各部分用的数据之间是什么关系?同一队列/独立队列/子集?这个关系对论证是优势还是弱点?如果是独立队列,是否需要披露?如果是子集,嵌套偏倚怎么处理?
B4逻辑递进从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?如果某部分结论不支持预期,后续还能立住吗?呈现顺序和研究顺序如果不同,是否需要管理?
B5Fallback最可能失败的环节是什么?失败后论文还能成立吗?有Plan B吗?Plan B是降级版本(缩小scope)还是替代路径(换方法)?
B6攻击预演如果审稿人只看摘要就写reject,最可能的理由是什么?如果答辩委员只问一个问题,最可能问什么?

输出特点:

  • 这个阶段的建议可以是"换方法""重新设计队列关系""调整研究问题"——因为还没开始写,一切都能改
  • ★★★发现在这个阶段的含义是"不解决这个问题就不值得往下写"

stage=drafting 写作中审查

审查对象: 单章草稿(引言+方法+结果+讨论的任意组合)

输入:

  • 单章或多章草稿(md/txt/docx)
  • 可选:Research Blueprint(如果有,用于检查草稿是否偏离了蓝图)

维度(D1-D5,章级版本):

#维度章级审查聚焦
D1跨章逻辑连贯性这章的引言是否承接了上一章的结论?这章的结论是否为下一章铺路?章间是否有逻辑断层?
D2因果与时间假设这章的因果推断链条是否清晰?观察性数据是否被当作因果证据?时间尺度是否匹配?
D3选择偏倚与外推性这章的样本筛选过程是否透明?排除标准是否合理?结论外推到什么范围?
D4测量效度这章用的指标是否在测想测的东西?替代指标的局限是否在方法或讨论中说明?
D5统计方法充分性计划/已用的统计方法是否匹配数据结构?假设是否满足?样本量是否足够?

D6(临床解读)和D7(内容比例)在这个阶段不跑——讨论和全文结构还没成型。

输出特点:

  • 建议可以是"这一章的论证角度需要调整""结果section需要补充XX分析"——写作中还有调整空间
  • 如果提供了Blueprint,会检查草稿是否偏离了蓝图设计,偏离本身不一定是问题,但需要记录原因

stage=final 成文后审查

审查对象: 完整论文

输入:

  • thesis_full.txt(完整论文)
  • 可选:study_design.md(研究设计摘要——有则审查精度更高)
  • 可选:known_limitations.json(用户已知局限——避免重复指出)

维度(D1-D7,全文级):

#维度全文级审查聚焦
D1跨章逻辑连贯性各章之间的递进关系是否自洽?数据来源关系是否披露?前一章的结论是否被后一章真正使用?呈现顺序与研究顺序的差异是否被管理?
D2因果与时间假设全文的因果推断链是否一致?即时测量→长期结局的推断是否有disclaimer?中介分析/回归分析的因果暗示是否过强?
D3选择偏倚与外推性跨章的样本嵌套关系是否交代?各章排除标准的差异是否说明?子集代表性是否讨论?
D4测量效度同一指标在不同章节的测量精度是否一致?观察者一致性是否评估?影像终点vs临床终点是否区分?
D5统计方法充分性各章统计方法的选择是否一致(如GEE vs logistic,患者级 vs 侧级)?不一致是否解释?敏感性分析是否覆盖关键假设?
D6临床/实践解读深度统计显著→临床意义的转化是否完成?对临床实践的建议是否具体?还是停留在"有待进一步研究"?
D7内容比例恰当性非核心内容是否过长?局限性是否流于形式?创新点是否overclaim?禁用词检查(首次/首个/开创性/突破性/革命性)。

输出特点:

  • 这个阶段能改的有限——建议聚焦于"加disclaimer""补充一段讨论""调整措辞强度",不建议"换方法"或"重做分析"
  • ★★★发现在这个阶段的含义是"不修这个就不送审"

执行指令(Claude读这里)

当thesis-critical-review被触发时,Claude按以下流程执行。这不是给用户看的文档,是给Claude自己的操作手册。

总体原则

  1. 你是对抗者。 不要找"可以改进的地方"——找"审稿人会用来reject的理由"和"答辩委员会追着不放的弱点"
  2. 每个发现必须有原文证据。 引用论文原文(前后各一句+位置),不允许泛泛而谈
  3. 优先级校准: ★★★ = 审稿人会因此写major revision或reject;★★ = 会被提到但不致命;★ = 挑剔的审稿人才会提
  4. 默认给攻击路径和防御方向,不写替换文字。 当用户进入修改落地阶段并要求具体文本时,提供旧/新文本对(含精确位置),供用户判断后粘贴。主动写替换文字的边界:用户明确要求,或用户已确认防御方向后需要落地执行
  5. 逐维度扫描,不要跳维度。 即使某个维度看起来没问题,也要在覆盖确认表中标注"已扫描,0条发现"

stage=design 各维度执行指令

B1 问题价值

  • 视角:你是一个见过太多无聊论文的资深审稿人
  • 找什么:
    • 研究问题的答案是否只有"符合预期"一种可能?如果是,论文的贡献在哪?
    • 文献gap是真的还是别人不做是因为不值得?
    • 即使结果完全符合预期,有没有方法学/数据层面的独立贡献?
  • 校准:如果答案是"确认了XX和YY已经发现的东西"且没有新的方法/数据/视角,那就是★★★

B2 方法-问题匹配

  • 视角:方法学审稿人
  • 找什么:
    • 选的方法是否是回答这个问题最直接的方法?有没有更简单的替代方案被跳过?
    • 方法的固有局限(如FEA的材料假设、回顾性设计的混杂控制)是否会让结论打折到没意义?
    • 多个方法之间的逻辑链是否完整?前一个方法的输出是否真的是后一个方法需要的输入?
  • 校准:如果方法的固有局限直接削弱核心结论(如"线性弹性假设让应力值不可信"),那就是★★★

B3 数据架构

  • 视角:统计审稿人看到多队列/多数据源时的第一反应
  • 找什么:
    • 各部分用的数据是同一队列、独立队列、还是子集?关系是否显式写出?
    • 如果是子集,嵌套抽样是否引入选择偏倚?
    • 如果是独立队列,纳入标准/时间段/中心的差异是否说明?
    • 如果呈现顺序和研究顺序不同,这个差异是否被管理?
  • 校准示例:某论文 Ch1 和 Ch2 使用的是独立时间窗口的独立队列,但章节之间的队列关系未披露,导致漏斗叙事暗示了不存在的从属关系——这是 ★★★ 问题

B4 逻辑递进

  • 视角:答辩委员读完全文后问"为什么是这个顺序"
  • 找什么:
    • 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?
    • 如果某部分的结论不支持预期(如中介分析CI含0),后续的论证链是否断裂?
    • 各部分的结论是否被后续部分真正使用,还是只是"前面做了这个,接下来做那个"?
  • 校准:如果删掉某一章后剩余章节的论证链不受影响,那这一章的定位需要重新审视——★★

B5 Fallback

  • 视角:务实的导师
  • 找什么:
    • 最可能失败的环节是什么?(数据不足/方法不work/结果不显著)
    • 失败后论文还能成立吗?
    • Plan B是缩小scope还是换路径?
    • 有没有"如果XX不显著就不报告"的隐性选择偏倚风险?
  • 校准:如果唯一的Plan B是"那就只发两章",★★

B6 攻击预演

  • 视角:最刻薄的审稿人,只看摘要就写意见
  • 找什么:
    • 如果只看摘要,最可能的reject理由是什么?
    • 如果答辩委员只问一个问题,最可能问什么?
    • novelty claim是否有一篇已发表的论文可以直接反驳?
  • 产出:写出1-2条模拟的审稿意见(用英文reviewer comment的口吻)

stage=final 各维度执行指令

D1 跨章逻辑连贯性

  • 视角:读完全文后检查"三章是不是一个故事"
  • 扫描位置:前言中的研究框架段、每章引言的第一段、每章讨论的最后一段、总讨论
  • 找什么:
    • 前言声称的递进关系(如"先确认高危群体→锁定剂量指标→检验力学机制"),在正文中是否真正实现?
    • 前一章的具体结论(如"前移量是独立危险因素")是否在后一章被引用和使用?
    • 数据来源关系(同一队列/独立/子集)是否在每个出现的位置都一致?
    • 呈现顺序和研究顺序如果不同,是否有显式说明?
  • 校准示例:某论文队列独立性未披露 = ★★★;前后章节空间分辨率从热力图到标量的断层未讨论 = ★★

D2 因果与时间假设

  • 视角:因果推断方法学审稿人
  • 扫描位置:讨论中所有"导致""引起""介导""预测"相关的句子
  • 找什么:
    • 观察性研究的数据被当作因果证据?(如"前移量导致吸收"vs"前移量与吸收相关")
    • 即时测量→长期结局的推断是否有时间尺度disclaimer?
    • 中介分析/路径分析是否被表述为因果证据?(Baron & Kenny是相关框架,不是因果框架)
    • 回归系数β被解释为"每增加1单位X,Y增加β"——这个因果语言是否合适?
  • 校准锚点:即时应力vs12月吸收的时间尺度不对称 = ★★★;中介分析CI含0但叙事暗示因果 = ★★★

D3 选择偏倚与外推性

  • 视角:流行病学审稿人
  • 扫描位置:方法中的纳入排除标准、样本流程图、讨论中的局限性段
  • 找什么:
    • 各章样本的嵌套关系是否透明?(如 Ch3 是 Ch2 的子集,子集主结局阳性率 40% 显著高于全集 23.6%,代表性存疑)
    • 排除标准跨章是否一致?不一致的是否说明?
    • 缺失数据的模式是否随机?(如并发症分析n=276 vs 体积分析n=336,缺失的60例是什么人?)
    • 结论的外推范围是否清晰?(如"骨性II类患者"的结论能推到非II类吗?)
  • 校准示例:分层抽样子集的代表性问题 = ★★;缺失模式未说明 = ★★

D4 测量效度

  • 视角:测量学/方法学审稿人
  • 扫描位置:方法中的测量描述、讨论中的局限性
  • 找什么:
    • 核心结局指标是否真的在测想测的东西?(如净变化量指标可能掩盖同时存在的正向和负向子变化)
    • 观察者一致性(ICC/Kappa)是否评估?是内还是间?
    • 同一指标在不同章节的测量方法是否一致?(如自动处理 vs 手动处理)
    • 替代指标的局限是否在讨论中说明?(如替代终点 vs 临床终点)
  • 校准示例:缺少观察者间一致性 = ★★★(答辩必问);标量指标掩盖空间异质性 = ★★

D5 统计方法充分性

  • 视角:统计审稿人
  • 扫描位置:方法中的统计分析段、结果中的所有统计量
  • 找什么:
    • 每种统计方法的前置假设是否满足?(如GEE的工作相关结构选择、卡方检验的期望频数)
    • 各章统计方法不同的(如 Ch1 用非参数检验,Ch2 用聚类/混合模型),是否解释了为什么?
    • 小样本(如n=20, n=22)的效能是否讨论?"无显著差异"是否被错误解读为"无差异"?
    • 多重比较是否校正?校正方法是否说明?
    • 敏感性分析是否覆盖了关键假设?
  • 校准示例:中介分析在小样本(n<25)下效能不足 = ★★;GEE 相关结构未做敏感性检验 = ★★;小亚组比较效能 = ★★

D6 临床/实践解读深度

  • 视角:临床医生读讨论
  • 扫描位置:讨论的临床意义段、结论
  • 找什么:
    • 统计显著性是否被等同于临床意义?(如 OR=1.128 统计显著,但临床上每单位暴露风险仅增 12.8%——这个增幅够改变决策吗?)
    • 对临床实践的建议是否具体?还是只说"有待进一步研究"?
    • 如果研究有直接的临床启示(如"前移量>Xmm时应特别关注TMJ"),是否写出来了?
    • 结论是否过度保守(明明数据支持一个具体结论,却缩回到"需要更多研究")?
  • 校准示例:建议太泛(如"应关注高危群体"但未定义"高危")= ★★;小效应量的临床解读缺失 = ★

D7 内容比例恰当性

  • 视角:主编看论文整体质量
  • 扫描位置:全文,特别是讨论
  • 找什么:
    • 非核心内容是否过长?(如分子生物学推测段落在一个影像/FEA论文中占了多少?)
    • 局限性section是否流于形式?("本研究有以下不足:第一...第二..."的模板感)
    • 创新点是否overclaim?检查禁用词:首次/首个/开创性/突破性/革命性
    • 讨论是否在重复结果?("本研究发现X"在讨论中出现几次?)
    • 各章的讨论长度是否与该章的贡献匹配?
  • 校准示例:特定分子机制段在非分子学论文中占比过长 = ★★;局限性编号模板化 = ★

优先级校准总则

在扫描完所有维度后,用以下标准做最终优先级调整:

  • ★★★的判定标准: 审稿人会在major revision意见中写"the authors must address..."或"this is a fatal flaw"。答辩委员会追问直到你给出满意答复。如果不修,论文不应送审
  • ★★的判定标准: 审稿人会写"the authors should discuss/clarify..."。修了会显著提升论文说服力,不修也不至于reject
  • ★的判定标准: 挑剔的审稿人可能提,多数审稿人不会注意到。修了更好,时间不够可以不修
  • 降级规则: 如果论文讨论中已经自己提到了某个局限性,该发现降一级(★★★→★★)——因为审稿人看到作者已经知道就不会追着不放
  • 升级规则: 如果同一个问题在多个维度中被独立发现,升一级——这说明是系统性弱点

执行方式

全量扫描

跑当前stage的全部维度。

/thesis-critical-review stage=final

选择性扫描

只跑指定维度。

/thesis-critical-review stage=final dimensions=D1,D5

追问模式

用户给出具体担忧,skill围绕这个点深度挖掘,不限于预设维度。

/thesis-critical-review stage=final focus="我担心中介分析那段的论证力度不够"

输出格式

三个stage共享同一输出格式。

critical_review_report.md

# 批判审查报告
> 生成时间: YYYY-MM-DD HH:MM
> 技能版本: thesis-critical-review 0.1.0
> 审查阶段: design / drafting / final
> 维度范围: [B1-B6 / D1-D5 / D1-D7 / 用户选择的子集]
> 输入文件: [列表]

---

## 第一部分:优先级汇总

| # | 维度 | 问题摘要 | 位置 | 优先级 |
|---|------|---------|------|--------|
| 01 | D1 | ... | Ch2讨论, 约第400行 | ★★★ |
| 02 | D5 | ... | Ch3方法, 约第480行 | ★★★ |
| ... | | | | |

**优先级说明:**
- ★★★ = 必须处理(逻辑缺陷或答辩/审稿必问)
- ★★ = 强烈建议(显著提升论证说服力)
- ★ = 时间允许时处理(打磨)

**统计:** ★★★: N条 / ★★: N条 / ★: N条

---

## 第二部分:逐条详述

### #01 [问题标题] ★★★
**维度:** D1 跨章逻辑连贯性
**位置:** Ch2讨论, 约第400行
**原文:**
> ......前一句。**包含问题的句子或段落**。后一句......

**问题描述:**
[用审稿人/答辩委员的口吻描述这个问题]

**攻击路径:**
[审稿人最可能怎么写这条意见?答辩委员最可能怎么追问?]

**建议处理方向:**
[不写具体文字,只给方向。如"在某章引言中加一段显式说明某关键设计点及其对结论的影响"]

---
[后续条目...]

---

## 第三部分:维度覆盖确认

| 维度 | 状态 | 发现数 |
|------|------|--------|
| D1 跨章逻辑 | ✅ 已扫描 | 3 |
| D2 因果假设 | ✅ 已扫描 | 2 |
| D3 选择偏倚 | ✅ 已扫描 | 1 |
| D4 测量效度 | ✅ 已扫描 | 2 |
| D5 统计充分性 | ✅ 已扫描 | 4 |
| D6 临床解读 | ✅ 已扫描 | 2 |
| D7 内容比例 | ✅ 已扫描 | 1 |

---

## 第四部分:已知局限声明

本审查基于LLM对论文文本的理解,受以下限制:
- 无法验证原始数据的正确性(那是thesis-qc M1-M4的职责)
- 无法评估图表与数据的一致性(那是thesis-qc M7的职责)
- 领域判断基于训练数据,可能遗漏高度专业化的方法学问题
- 审查结果是"供决策参考",不是审稿意见本身

与thesis-qc的接口

  • thesis-qc在Phase 8调用 stage=final
  • 输出 critical_review_report.md 注册到MASTER_QC.md文件清单
  • ★★★发现进入MASTER的Action Items表(状态="待用户确认")
  • thesis-qc不参与design和drafting阶段——那两个阶段QC管线还没启动

独立调用

不经过thesis-qc直接触发:

  • /thesis-critical-review — 自动检测输入内容判断stage
  • /thesis-critical-review stage=design — 显式指定阶段
  • "帮我审查这个研究提纲" → stage=design
  • "看看这章讨论有没有逻辑问题" → stage=drafting
  • "审稿人会怎么攻击我的论文" → stage=final

迭代计划

  • v0.1: SKILL.md设计文档(当前)
  • v0.2: stage=final 的prompt工程和维度定义细化
  • v0.3: stage=design 和 stage=drafting 实现
  • v0.4: 在真实论文上验证三个stage
  • v1.0: 英文论文支持 + 领域自适应(医学/CS/交叉)

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.