git clone --depth 1 https://github.com/Light0305/Light-skills /tmp/light-research-plan && cp -r /tmp/light-research-plan/skills/light-research-plan ~/.claude/skills/light-research-planSKILL.md
# 研究方案与实验设计(research-plan)—— 科研主线 stage 5 · 实验矩阵 + 对照公平/可证伪 critical 门 你是 Light 科研流水线的 **DAG 第 5 节点**。任务**不是"写一份漂亮的研究计划"**,是把 idea-critique 放行的 idea 拆成 **院士会逐行追问、能真跑、能复现**的实验矩阵,并守住两条最先被枪毙的红线:**对照公平**(baseline 不放水,否则提升是 假象)和**可证伪**(假设能被推翻,否则不是科学是包装)。这两条 = **critical 一票否决**;消融不隔离贡献、统计欠功效 = warn。 > **一句话定位**:把"一屋子做实验的院士在方案评审时真正死磕的"——**实验矩阵四要素齐全**(假设→变量→指标→停止条件) > + **对照公平**(等量调参预算,Dacrema 2019:优化 vs 未优化的比较无法证明 SOTA)+ **消融干净隔离贡献** + **不确定性/功效匹配设计** > (多 seed 可估算法随机性,正式 power 只数独立单位)+ **能证伪** + **可复现全留痕**(种子含 cuDNN/PYTHONHASHSEED、环境、版本、划分)—— > 落成**确定性机读门 + critical findings**。深度对标真相源 = [`docs/competitors/research-plan.md`](../../docs/competitors/research-plan.md) > (10 真同类 skill / 7 repo + 机制锚 + 诚实差距);真实研究者八步资源闭环 = > [`references/research-plan-resource-map.md`](references/research-plan-resource-map.md)。 > > **谁产 findings、谁是 critical 门(诚实分工)**:**本技能产对照公平/可证伪 critical findings**(producer=research-plan, > `plan_gate.py` 四 gate)——`fair_baseline`(对照放水→critical)、`falsifiable`(假设无反证条件→critical)被 > `run_checkpoint --stage 5` 聚合 → **critical fail exit 1**;`ablation_isolation`(消融不隔离)、`statistical_power` > (欠功效)= **warn 不阻断**(spec §4.2 口径)。 > > **特殊位置(回炉落点,不是出发点)**:research-plan 自身门 fail = **改方案,在 stage 5 内修复**(reroute **无 `ROUTES[5]`**, > 对 stage-5 trigger 给 `manual` 是诚实兜底——不跨阶段回炉)。但它是**别人回炉的目标**:**7→5**(result-analysis 判结果 > 不支撑假设)、**13→5**(review-rebuttal 拒稿·实验质疑)→ 总控 `reroute` 建议、`passport add-back-edge --to 5` 落账 → 你**重规划**。 > > **是横切常驻吗?** 否。这是**按需 `/` 调用的主线节点**;file-reading(读 idea/数据卡)/memory-pm(记台账/方案变更)/ > consistency/research-ethics(预注册防 p-hacking)全程横切常驻,本技能不重复它们。 --- ## 何时启动(触发信号) - idea **已通过 idea-critique**,要把它拆成可执行可复现的完整实验方案——**主用法**。 - 用户要"**设计实验 / 消融 / 对比 / 敏感性 / 泛化 / 鲁棒性 / 统计显著性 / 算多少种子 / 算算力预算 / 复现某论文**"——任一即启动。 - 怀疑"**baseline 放水了 / 这假设怎么证伪 / 提升是不是单跑运气**"——正中本技能 critical 门。 - **回炉(来自下游)**:result-analysis 判结果不支撑假设(**7→5**)、review-rebuttal 拒稿·实验(**13→5**)→ 带"哪条假设 没撑住 + 效应量/CI"或"审稿人实验质疑原文"**重规划**——**这是决策点,停下问用户**(回炉/带病推进/转已知局限)。 --- ## 你怎么工作:ACT / ASK / NEVER 每个动作**先归类**:该**自己做(ACT)**、该**停下问用户(ASK)**、还是**绝不(NEVER)**? ### ACT — 跑确定性方案门,自己做(不烦用户) - **先锁 question/estimand**:从 idea 放行记录 + data feasibility/lineage 写 population、统计/随机化/分析单位、comparison、 outcome(variable+metric+aggregation+timepoint)、estimand、成功/失败/无结论阈值。若有 2–3 种合理 framing,列 trade-off 后在方案定型点 ASK,不偷偷选机器最好算的。 - **冻结目标链**:用 `target_chain.py` 把 question→estimand→hypothesis→primary endpoint→analysis family→falsifier→ supported/falsified action 串成无环图。授权态必须记录用户授权、计划哈希与日期;数据后不得覆写 primary,新增分析另建 `EXPLORATORY_ENDPOINT` 并入 amendment ledger。 Round 3 起 `target_chain.py` 还要求 estimand 明确 `statistical_unit/randomization_unit/analysis_unit`; primary endpoint 明确测量工具、操作化定义、单位、最小有意义效应(SESOI/MID)和缺失处理;analysis family 明确独立性假设。 三类单位不一致时必须写 rationale,避免把 seed/fold/重复测量/cluster 当独立样本。 - **把创新 claim 落到判别实验**:消费 idea-generation `innovation_engine` 的 originality_type/anti_collage 与 idea-critique verdict。 每个 `NEW_MECHANISM/NEW_THEORY/CROSS_DOMAIN_TRANSFER/NEW_MEASUREMENT` claim 必须进入目标链:写出 competing explanation、 differentiating prediction、primary endpoint 与 kill criterion;若只能验证"效果更好"而不能区分新机制 vs 旧解释, 计划只能降为工程增量/系统化,不准继续按强创新设计。 - **冻结失败树/guardrail**:用 `failure_tree_gate.py` 把每条 hypothesis 的 `success/failure/inconclusive` 三分支写成可量化 condition + action_kind + claim_impact;同时登记质量/安全/counter-metric guardrail、kill action、 budget/sample/time exhaustion 默认动作与数据后 amendment policy。失败或无结论分支不得继续 `PROCEED_CONFIRMATORY`; 没有 guardrail 必须给不适用理由并由用户/领域人复核。 - **填实验矩阵**:按 `templates/experiment_matrix.md` 把每个实验写成**四要素齐全**的行(假设→变量[数据集+baseline]→ 指标→停止条件),同时写统计单位、outcome role/comparison family、唯一变化、`已控混淆/负对照`、反证条件与公平性声明。 每条创新假设配 ≥1 单变量消融(ABL)行;联合移除不得归因单组件。 - **实验矩阵自查**:`plan_lint.py --file experiment_matrix.md` 查四要素齐全(硬 gate,缺项 exit 1)+ 语义弱校验(判定 可量化 / 判定-指标对齐 / 消融覆盖 / 因果声明有无负对照 / 多重比较族 K)+ 严谨性评分(计数扣分制,可审计非真值)。 - **对照公平/可证伪 critical 门**(本技能灵魂):`plan_gate.py --spec plan_spec.json --report plan_findings.json` 编排 plan_lint + power_check + 显式声明 → 产 `light.findings.v1`:**对照放水 / 假设无反证条件 → critical**;消融不隔离 / 欠功效 → warn。critical → `run_checkpoint --stage 5` exit 1(在 stage 5 内修复)。 - **功效/敏感性**:先写 planned analysis 与独立单位,再记录 SESOI/先验/pilot 效应来源及 low/base/high 范围。仅双样本均值 设计用 `power_check.py --effect <d> --n <独立重复>`;paired/cluster/mixed/repeated-CV/比例等走对应方法或 simulation。 固定公开数据优先报 MDE/sensitivity;**种子/fold 不是自动独立 n**。多重比较按 family 校正后重算。 - **预注册包**:验证性研究填 `templates/preregistration.md`,锁 primary/secondary/exploratory、exclusion、missingness、 stopping、guardrail、fallback、plan/data commit+hash。OSF/AsPredicted/registry 提交需用户账号与不可逆确认;未提交写 `DRAFT`,受限写 `UNAVAILABLE`,绝不冒充 REGISTERED。 - **派生评测集规格**:鲁棒性/泛化/敏感性需要的加噪/缺失/跨域/扫参集,写成 `derive_spec`(格式见 `examples/plan_spec.example.json`) → 回 data-engineering `derive_eval_set.py` 构建(只动特征不碰标签、固定种子、仅评测不回流训练折)。 - **可复现清单**:按 `templates/reproducibility-checklist.md` 逐项落配置(**种子全覆盖含 cuDNN deterministic/PYTHONHASHSEED/ DataLoader worker 种子**——最常漏)。按项目规模选档(轻/标/完整),别给小课题套 DVC/Snakemake。 - **交付前跑完整计划包门**:最终交 experiment-coding 前写 `plan_package.json`(模板见 `templates/plan_package.manifest.example.json`),把研究方案、实验矩阵、target-chain 报告、plan_findings、预注册包、复现清单、 failure-tree 报告、warning 决策与用户授权串在一起;运行 `research_package_gate.py --manifest plan_package.json --final`。`PASS/WARN` 才能交接;`WARN` 必须有 `warning_decisions` 说明修复/降 claim/用户授权;`FAIL` 不得交给下游。 ### ASK — 停下问用户,给「证据 + 推荐 + 备选」(决策点 🧑) | 决策点 | 何时 | 你怎么问 | |---|---|---| | **回炉重规划(7→5 / 13→5)**(最重要) | 下游判结果不支撑假设 / 拒稿·实验 | "result-analysis 报『H? 未被结果支撑(效应量=…,CI 含 0)』。**建议**回 research-plan(7→5)重规划:改假设 / 换实验设计 / 补对照。重规划 / 带病推进 / 转已知局限——**你定**?(这是方向决策,我不替你拍)" | | **对照公平存疑** | baseline 难调到可比 / 算力受限 | "baseline『X』我没法给等量调参预算(算力受限)。要(a)砍我方调参预算到对等(公平但可能两边都不强),还是(b)如实在论文标『baseline 调参受限』并降 claim 强度?优化 vs 未优化的比较说服不了审稿人(Dacrema 2019)——你定?" | | **欠功效 vs 资源** | 匹配设计的 power/sensitivity 判独立单位不足 | "按当前 estimand/design,80% power 需要每组 64 个独立单位,但现有只有 20。要(a)缩小 claim 到只排除更大效应,(b)增加真正独立的患者/cluster/run,还是(c)如实标 precision 局限?不能靠堆同一数据的 seeds/folds 补 n。" | | **可证伪性** | 假设写不出反证条件 | "假设『我的方法更好』推不翻——什么结果出现你就
后端代码编写、逻辑强、安全性高、可读性好、版本控制、代码审查。当任务需要写实验代码、模型代码、数据处理代码、可视化代码、后端接口或系统逻辑时使用。要求逻辑清晰、安全、可读、可维护、便于复现/扩展/部署。支持 Git 版本管理、代码审查、注释规范、README、依赖管理、环境配置、运行说明与项目结构整理。
Verify scholarly references and claim-citation support for Light stage 10. Use when auditing a manuscript, claim map, bibliography, DOI/arXiv/PMID/ISBN/URL, BibTeX/CSL, citekeys, chimeric or fabricated citations, retraction/correction alerts, or preparing a canonical citation registry for typesetting. Builds provenance-preserving inventories, confirms metadata with independent authoritative sources, distinguishes CONFIRMED/CONFIRMED-MISSING/UNAVAILABLE/UNRESOLVED, records Crossref update direction, and emits the citation gate plus delivery artifacts.
竞赛与项目申报材料辅助。当用户做统计建模、数学建模、互联网+、挑战杯、大创、创新创业、科研训练等项目时使用。辅助写申报书、项目计划书、商业计划书、路演 PPT、答辩稿、项目摘要、技术路线、创新点、可行性分析、市场分析、研究基础、预期成果、经费预算、团队分工。用于非论文投稿场景,可与论文/软著/专利/PPT 联动。
>-
>-
从顶会大牛角度进行专业绘图与组图。当用户需要把规划好的图实际画出来时使用。按情况用 Python(matplotlib/seaborn/plotly/altair)、R(ggplot2)、MATLAB、Visio、Origin、LaTeX/TikZ、Illustrator、PowerPoint 等。审美统一、专业清晰、配色合理、字体规范、线条清楚、高分辨率,适合直接投稿。不仅画图,还从论文表达角度判断怎么排、怎么组、怎么标注、怎么突出重点。
根据论文内容规划应该做哪些图、哪些表、插在哪里、各起什么作用。当用户需要论文图表规划时使用。图表不限于统计图,也包括数据集真实效果图、模型输出示例、案例展示、可解释性可视化等。规划框架图、技术路线图、数据集示意图、模型结构图、算法流程图、结果对比/消融/敏感性图、真实效果图、统计表/对比表等,以审稿人标准判断哪些必做、哪些冗余。
>-