Thesis critical review
Skill Skydooooog0221/claude-code-skills/thesis-critical-review
A collection of Claude Code skills for academic writing and literature work.
npx -y skills add Skydooooog0221/claude-code-skills --skill thesis-critical-reviewAssembled from the repository path, not quoted from the project. Check it against their README if it does not work.
2 things to look at
- no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
- 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.
SKILL.md
19.7 KB, as published. Nobody here has run it
thesis-critical-review — 学术论文对抗性批判审查
版本:0.1.0-draft 创建日期:2026-04-13 来源:从真实论文项目多轮critical review + 答辩预演经验中提炼 定位:模拟答辩委员/审稿人对论文的深度攻击。纯LLM判断,无机械检测
设计哲学
这个skill的角色是对抗者,不是帮手。它的工作不是让论文"更好",是找到论文中审稿人/答辩委员最可能攻击的点,让用户在被攻击之前先堵上。
- 不评价写作质量——只关注论证逻辑
- 不写替换文字——只给攻击路径和防御方向。写作是humanizer的领地
- 不做引用核查——假设引用是正确的(那是thesis-qc M4的事),只检查引用的论证角色
- 不做格式检查——那是thesis-qc M6的事
- 发现的问题按"审稿人会不会因为这个reject"排优先级,不按"学术上是否完美"排
触发条件
以下任一情况触发:
- 用户提到"critical review""批判审查""审稿人会怎么说""答辩会问什么""挑毛病""攻击面"
- 用户要求审查论文的讨论/局限性部分
- 用户上传研究提纲/开题报告并要求质疑
- 用户上传单章草稿并要求审查论证
- thesis-qc在Phase 8调用
三阶段模式
stage=design 设计期审查
审查对象: Research Blueprint / 研究提纲 / 开题报告
输入:
- 研究蓝图文档(md/txt/docx),至少包含:研究问题、各部分分解、数据来源、方法选择
- 无需完整论文
维度(B1-B6):
| # | 维度 | 核心质疑 |
|---|---|---|
| B1 | 问题价值 | 这个问题的答案对谁有用?文献留下的gap是真gap还是别人不做是因为不值得做?如果答案是"和预期一致",论文还有贡献吗? |
| B2 | 方法-问题匹配 | 你选的方法能回答这个问题吗?有没有更直接的方法被跳过了?方法的固有局限是否会让结论打折到不值得做? |
| B3 | 数据架构 | 各部分用的数据之间是什么关系?同一队列/独立队列/子集?这个关系对论证是优势还是弱点?如果是独立队列,是否需要披露?如果是子集,嵌套偏倚怎么处理? |
| B4 | 逻辑递进 | 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?如果某部分结论不支持预期,后续还能立住吗?呈现顺序和研究顺序如果不同,是否需要管理? |
| B5 | Fallback | 最可能失败的环节是什么?失败后论文还能成立吗?有Plan B吗?Plan B是降级版本(缩小scope)还是替代路径(换方法)? |
| B6 | 攻击预演 | 如果审稿人只看摘要就写reject,最可能的理由是什么?如果答辩委员只问一个问题,最可能问什么? |
输出特点:
- 这个阶段的建议可以是"换方法""重新设计队列关系""调整研究问题"——因为还没开始写,一切都能改
- ★★★发现在这个阶段的含义是"不解决这个问题就不值得往下写"
stage=drafting 写作中审查
审查对象: 单章草稿(引言+方法+结果+讨论的任意组合)
输入:
- 单章或多章草稿(md/txt/docx)
- 可选:Research Blueprint(如果有,用于检查草稿是否偏离了蓝图)
维度(D1-D5,章级版本):
| # | 维度 | 章级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 这章的引言是否承接了上一章的结论?这章的结论是否为下一章铺路?章间是否有逻辑断层? |
| D2 | 因果与时间假设 | 这章的因果推断链条是否清晰?观察性数据是否被当作因果证据?时间尺度是否匹配? |
| D3 | 选择偏倚与外推性 | 这章的样本筛选过程是否透明?排除标准是否合理?结论外推到什么范围? |
| D4 | 测量效度 | 这章用的指标是否在测想测的东西?替代指标的局限是否在方法或讨论中说明? |
| D5 | 统计方法充分性 | 计划/已用的统计方法是否匹配数据结构?假设是否满足?样本量是否足够? |
D6(临床解读)和D7(内容比例)在这个阶段不跑——讨论和全文结构还没成型。
输出特点:
- 建议可以是"这一章的论证角度需要调整""结果section需要补充XX分析"——写作中还有调整空间
- 如果提供了Blueprint,会检查草稿是否偏离了蓝图设计,偏离本身不一定是问题,但需要记录原因
stage=final 成文后审查
审查对象: 完整论文
输入:
thesis_full.txt(完整论文)- 可选:
study_design.md(研究设计摘要——有则审查精度更高) - 可选:
known_limitations.json(用户已知局限——避免重复指出)
维度(D1-D7,全文级):
| # | 维度 | 全文级审查聚焦 |
|---|---|---|
| D1 | 跨章逻辑连贯性 | 各章之间的递进关系是否自洽?数据来源关系是否披露?前一章的结论是否被后一章真正使用?呈现顺序与研究顺序的差异是否被管理? |
| D2 | 因果与时间假设 | 全文的因果推断链是否一致?即时测量→长期结局的推断是否有disclaimer?中介分析/回归分析的因果暗示是否过强? |
| D3 | 选择偏倚与外推性 | 跨章的样本嵌套关系是否交代?各章排除标准的差异是否说明?子集代表性是否讨论? |
| D4 | 测量效度 | 同一指标在不同章节的测量精度是否一致?观察者一致性是否评估?影像终点vs临床终点是否区分? |
| D5 | 统计方法充分性 | 各章统计方法的选择是否一致(如GEE vs logistic,患者级 vs 侧级)?不一致是否解释?敏感性分析是否覆盖关键假设? |
| D6 | 临床/实践解读深度 | 统计显著→临床意义的转化是否完成?对临床实践的建议是否具体?还是停留在"有待进一步研究"? |
| D7 | 内容比例恰当性 | 非核心内容是否过长?局限性是否流于形式?创新点是否overclaim?禁用词检查(首次/首个/开创性/突破性/革命性)。 |
输出特点:
- 这个阶段能改的有限——建议聚焦于"加disclaimer""补充一段讨论""调整措辞强度",不建议"换方法"或"重做分析"
- ★★★发现在这个阶段的含义是"不修这个就不送审"
执行指令(Claude读这里)
当thesis-critical-review被触发时,Claude按以下流程执行。这不是给用户看的文档,是给Claude自己的操作手册。
总体原则
- 你是对抗者。 不要找"可以改进的地方"——找"审稿人会用来reject的理由"和"答辩委员会追着不放的弱点"
- 每个发现必须有原文证据。 引用论文原文(前后各一句+位置),不允许泛泛而谈
- 优先级校准: ★★★ = 审稿人会因此写major revision或reject;★★ = 会被提到但不致命;★ = 挑剔的审稿人才会提
- 默认给攻击路径和防御方向,不写替换文字。 当用户进入修改落地阶段并要求具体文本时,提供旧/新文本对(含精确位置),供用户判断后粘贴。主动写替换文字的边界:用户明确要求,或用户已确认防御方向后需要落地执行
- 逐维度扫描,不要跳维度。 即使某个维度看起来没问题,也要在覆盖确认表中标注"已扫描,0条发现"
stage=design 各维度执行指令
B1 问题价值
- 视角:你是一个见过太多无聊论文的资深审稿人
- 找什么:
- 研究问题的答案是否只有"符合预期"一种可能?如果是,论文的贡献在哪?
- 文献gap是真的还是别人不做是因为不值得?
- 即使结果完全符合预期,有没有方法学/数据层面的独立贡献?
- 校准:如果答案是"确认了XX和YY已经发现的东西"且没有新的方法/数据/视角,那就是★★★
B2 方法-问题匹配
- 视角:方法学审稿人
- 找什么:
- 选的方法是否是回答这个问题最直接的方法?有没有更简单的替代方案被跳过?
- 方法的固有局限(如FEA的材料假设、回顾性设计的混杂控制)是否会让结论打折到没意义?
- 多个方法之间的逻辑链是否完整?前一个方法的输出是否真的是后一个方法需要的输入?
- 校准:如果方法的固有局限直接削弱核心结论(如"线性弹性假设让应力值不可信"),那就是★★★
B3 数据架构
- 视角:统计审稿人看到多队列/多数据源时的第一反应
- 找什么:
- 各部分用的数据是同一队列、独立队列、还是子集?关系是否显式写出?
- 如果是子集,嵌套抽样是否引入选择偏倚?
- 如果是独立队列,纳入标准/时间段/中心的差异是否说明?
- 如果呈现顺序和研究顺序不同,这个差异是否被管理?
- 校准示例:某论文 Ch1 和 Ch2 使用的是独立时间窗口的独立队列,但章节之间的队列关系未披露,导致漏斗叙事暗示了不存在的从属关系——这是 ★★★ 问题
B4 逻辑递进
- 视角:答辩委员读完全文后问"为什么是这个顺序"
- 找什么:
- 从第一部分到最后一部分的递进关系是"必须这个顺序"还是"看起来顺"?
- 如果某部分的结论不支持预期(如中介分析CI含0),后续的论证链是否断裂?
- 各部分的结论是否被后续部分真正使用,还是只是"前面做了这个,接下来做那个"?
- 校准:如果删掉某一章后剩余章节的论证链不受影响,那这一章的定位需要重新审视——★★
B5 Fallback
- 视角:务实的导师
- 找什么:
- 最可能失败的环节是什么?(数据不足/方法不work/结果不显著)
- 失败后论文还能成立吗?
- Plan B是缩小scope还是换路径?
- 有没有"如果XX不显著就不报告"的隐性选择偏倚风险?
- 校准:如果唯一的Plan B是"那就只发两章",★★
B6 攻击预演
- 视角:最刻薄的审稿人,只看摘要就写意见
- 找什么:
- 如果只看摘要,最可能的reject理由是什么?
- 如果答辩委员只问一个问题,最可能问什么?
- novelty claim是否有一篇已发表的论文可以直接反驳?
- 产出:写出1-2条模拟的审稿意见(用英文reviewer comment的口吻)
stage=final 各维度执行指令
D1 跨章逻辑连贯性
- 视角:读完全文后检查"三章是不是一个故事"
- 扫描位置:前言中的研究框架段、每章引言的第一段、每章讨论的最后一段、总讨论
- 找什么:
- 前言声称的递进关系(如"先确认高危群体→锁定剂量指标→检验力学机制"),在正文中是否真正实现?
- 前一章的具体结论(如"前移量是独立危险因素")是否在后一章被引用和使用?
- 数据来源关系(同一队列/独立/子集)是否在每个出现的位置都一致?
- 呈现顺序和研究顺序如果不同,是否有显式说明?
- 校准示例:某论文队列独立性未披露 = ★★★;前后章节空间分辨率从热力图到标量的断层未讨论 = ★★
D2 因果与时间假设
- 视角:因果推断方法学审稿人
- 扫描位置:讨论中所有"导致""引起""介导""预测"相关的句子
- 找什么:
- 观察性研究的数据被当作因果证据?(如"前移量导致吸收"vs"前移量与吸收相关")
- 即时测量→长期结局的推断是否有时间尺度disclaimer?
- 中介分析/路径分析是否被表述为因果证据?(Baron & Kenny是相关框架,不是因果框架)
- 回归系数β被解释为"每增加1单位X,Y增加β"——这个因果语言是否合适?
- 校准锚点:即时应力vs12月吸收的时间尺度不对称 = ★★★;中介分析CI含0但叙事暗示因果 = ★★★
D3 选择偏倚与外推性
- 视角:流行病学审稿人
- 扫描位置:方法中的纳入排除标准、样本流程图、讨论中的局限性段
- 找什么:
- 各章样本的嵌套关系是否透明?(如 Ch3 是 Ch2 的子集,子集主结局阳性率 40% 显著高于全集 23.6%,代表性存疑)
- 排除标准跨章是否一致?不一致的是否说明?
- 缺失数据的模式是否随机?(如并发症分析n=276 vs 体积分析n=336,缺失的60例是什么人?)
- 结论的外推范围是否清晰?(如"骨性II类患者"的结论能推到非II类吗?)
- 校准示例:分层抽样子集的代表性问题 = ★★;缺失模式未说明 = ★★
D4 测量效度
- 视角:测量学/方法学审稿人
- 扫描位置:方法中的测量描述、讨论中的局限性
- 找什么:
- 核心结局指标是否真的在测想测的东西?(如净变化量指标可能掩盖同时存在的正向和负向子变化)
- 观察者一致性(ICC/Kappa)是否评估?是内还是间?
- 同一指标在不同章节的测量方法是否一致?(如自动处理 vs 手动处理)
- 替代指标的局限是否在讨论中说明?(如替代终点 vs 临床终点)
- 校准示例:缺少观察者间一致性 = ★★★(答辩必问);标量指标掩盖空间异质性 = ★★
D5 统计方法充分性
- 视角:统计审稿人
- 扫描位置:方法中的统计分析段、结果中的所有统计量
- 找什么:
- 每种统计方法的前置假设是否满足?(如GEE的工作相关结构选择、卡方检验的期望频数)
- 各章统计方法不同的(如 Ch1 用非参数检验,Ch2 用聚类/混合模型),是否解释了为什么?
- 小样本(如n=20, n=22)的效能是否讨论?"无显著差异"是否被错误解读为"无差异"?
- 多重比较是否校正?校正方法是否说明?
- 敏感性分析是否覆盖了关键假设?
- 校准示例:中介分析在小样本(n<25)下效能不足 = ★★;GEE 相关结构未做敏感性检验 = ★★;小亚组比较效能 = ★★
D6 临床/实践解读深度
- 视角:临床医生读讨论
- 扫描位置:讨论的临床意义段、结论
- 找什么:
- 统计显著性是否被等同于临床意义?(如 OR=1.128 统计显著,但临床上每单位暴露风险仅增 12.8%——这个增幅够改变决策吗?)
- 对临床实践的建议是否具体?还是只说"有待进一步研究"?
- 如果研究有直接的临床启示(如"前移量>Xmm时应特别关注TMJ"),是否写出来了?
- 结论是否过度保守(明明数据支持一个具体结论,却缩回到"需要更多研究")?
- 校准示例:建议太泛(如"应关注高危群体"但未定义"高危")= ★★;小效应量的临床解读缺失 = ★
D7 内容比例恰当性
- 视角:主编看论文整体质量
- 扫描位置:全文,特别是讨论
- 找什么:
- 非核心内容是否过长?(如分子生物学推测段落在一个影像/FEA论文中占了多少?)
- 局限性section是否流于形式?("本研究有以下不足:第一...第二..."的模板感)
- 创新点是否overclaim?检查禁用词:首次/首个/开创性/突破性/革命性
- 讨论是否在重复结果?("本研究发现X"在讨论中出现几次?)
- 各章的讨论长度是否与该章的贡献匹配?
- 校准示例:特定分子机制段在非分子学论文中占比过长 = ★★;局限性编号模板化 = ★
优先级校准总则
在扫描完所有维度后,用以下标准做最终优先级调整:
- ★★★的判定标准: 审稿人会在major revision意见中写"the authors must address..."或"this is a fatal flaw"。答辩委员会追问直到你给出满意答复。如果不修,论文不应送审
- ★★的判定标准: 审稿人会写"the authors should discuss/clarify..."。修了会显著提升论文说服力,不修也不至于reject
- ★的判定标准: 挑剔的审稿人可能提,多数审稿人不会注意到。修了更好,时间不够可以不修
- 降级规则: 如果论文讨论中已经自己提到了某个局限性,该发现降一级(★★★→★★)——因为审稿人看到作者已经知道就不会追着不放
- 升级规则: 如果同一个问题在多个维度中被独立发现,升一级——这说明是系统性弱点
执行方式
全量扫描
跑当前stage的全部维度。
/thesis-critical-review stage=final
选择性扫描
只跑指定维度。
/thesis-critical-review stage=final dimensions=D1,D5
追问模式
用户给出具体担忧,skill围绕这个点深度挖掘,不限于预设维度。
/thesis-critical-review stage=final focus="我担心中介分析那段的论证力度不够"
输出格式
三个stage共享同一输出格式。
critical_review_report.md
# 批判审查报告
> 生成时间: YYYY-MM-DD HH:MM
> 技能版本: thesis-critical-review 0.1.0
> 审查阶段: design / drafting / final
> 维度范围: [B1-B6 / D1-D5 / D1-D7 / 用户选择的子集]
> 输入文件: [列表]
---
## 第一部分:优先级汇总
| # | 维度 | 问题摘要 | 位置 | 优先级 |
|---|------|---------|------|--------|
| 01 | D1 | ... | Ch2讨论, 约第400行 | ★★★ |
| 02 | D5 | ... | Ch3方法, 约第480行 | ★★★ |
| ... | | | | |
**优先级说明:**
- ★★★ = 必须处理(逻辑缺陷或答辩/审稿必问)
- ★★ = 强烈建议(显著提升论证说服力)
- ★ = 时间允许时处理(打磨)
**统计:** ★★★: N条 / ★★: N条 / ★: N条
---
## 第二部分:逐条详述
### #01 [问题标题] ★★★
**维度:** D1 跨章逻辑连贯性
**位置:** Ch2讨论, 约第400行
**原文:**
> ......前一句。**包含问题的句子或段落**。后一句......
**问题描述:**
[用审稿人/答辩委员的口吻描述这个问题]
**攻击路径:**
[审稿人最可能怎么写这条意见?答辩委员最可能怎么追问?]
**建议处理方向:**
[不写具体文字,只给方向。如"在某章引言中加一段显式说明某关键设计点及其对结论的影响"]
---
[后续条目...]
---
## 第三部分:维度覆盖确认
| 维度 | 状态 | 发现数 |
|------|------|--------|
| D1 跨章逻辑 | ✅ 已扫描 | 3 |
| D2 因果假设 | ✅ 已扫描 | 2 |
| D3 选择偏倚 | ✅ 已扫描 | 1 |
| D4 测量效度 | ✅ 已扫描 | 2 |
| D5 统计充分性 | ✅ 已扫描 | 4 |
| D6 临床解读 | ✅ 已扫描 | 2 |
| D7 内容比例 | ✅ 已扫描 | 1 |
---
## 第四部分:已知局限声明
本审查基于LLM对论文文本的理解,受以下限制:
- 无法验证原始数据的正确性(那是thesis-qc M1-M4的职责)
- 无法评估图表与数据的一致性(那是thesis-qc M7的职责)
- 领域判断基于训练数据,可能遗漏高度专业化的方法学问题
- 审查结果是"供决策参考",不是审稿意见本身
与thesis-qc的接口
- thesis-qc在Phase 8调用
stage=final - 输出
critical_review_report.md注册到MASTER_QC.md文件清单 - ★★★发现进入MASTER的Action Items表(状态="待用户确认")
- thesis-qc不参与design和drafting阶段——那两个阶段QC管线还没启动
独立调用
不经过thesis-qc直接触发:
/thesis-critical-review— 自动检测输入内容判断stage/thesis-critical-review stage=design— 显式指定阶段- "帮我审查这个研究提纲" → stage=design
- "看看这章讨论有没有逻辑问题" → stage=drafting
- "审稿人会怎么攻击我的论文" → stage=final
迭代计划
- v0.1: SKILL.md设计文档(当前)
- v0.2: stage=final 的prompt工程和维度定义细化
- v0.3: stage=design 和 stage=drafting 实现
- v0.4: 在真实论文上验证三个stage
- v1.0: 英文论文支持 + 领域自适应(医学/CS/交叉)