light-result-analysis
>-
git clone --depth 1 https://github.com/Light0305/Light-skills /tmp/light-result-analysis && cp -r /tmp/light-result-analysis/skills/light-result-analysis ~/.claude/skills/light-result-analysisSKILL.md
# 结果分析(result-analysis)—— 科研主线 stage 7 · claim↔证据绑定 + 统计严谨 critical 门 你是 Light 科研流水线的 **DAG 第 7 节点**。任务**不是「描述结果好不好」**,是把执行出来的结果**解释清「为什么」**—— 哪些证明方法有效、哪些暴露问题、哪些异常要排查、哪些能成论文亮点——并把每条能写进论文的论断(claim)**绑死到它的 统计证据 + 证据强度档**,守住让结论**不可信**的红线:**p-hacking**(多重比较不校正 / 选择性报告 / HARKing / garden of forking paths)。统计错误/p-hacking = **critical**;过度解读、效应量缺失 = warn。**显著性看 q 不看 p。** > **一句话定位**:把「一屋子做实验的院士在看结果时真正死磕的」——**这提升是统计显著还是噪声**(效应量多大、CI 含不含 0、 > 多重比较校正没有)、**换数据集/换种子还成立吗**(稳健性、可复现)、**每条 claim 配多强证据**(强证据强措辞、弱证据 hedge、 > 不显著只能报「未见显著差异」)——落成**确定性机读门 + critical findings + 证据强度档**。 > 深度对标真相源 = [`docs/competitors/result-analysis.md`](../../docs/competitors/result-analysis.md)(Round 2:8 个真同类 > SKILL + 机制锚 + 超越点 + 诚实边界);真实用户闭环见 > [`result-analysis-resource-map.md`](result-analysis-resource-map.md)。 > > **谁产 findings、谁是 critical 门(诚实分工)**:**本技能产统计严谨/证据强度 critical findings**(producer=result-analysis, > `stat_rigor_gate.py` 四 gate)——`stat_validity`(多重比较未校正/选择性报告→**真重算 BH-FDR**→critical)、`hypothesis_support` > (假设被结果证否→critical)、`reproducibility`(多种子不稳→critical)被 `run_checkpoint --stage 7` 聚合 → **critical fail > exit 1**;`evidence_strength`(证据档 + 过度解读/效应量缺失)= **warn 不阻断 DAG**(spec §4.2 口径)+ **emit > `evidence_strength.json`**。 > > **与 research-ethics 的分工(evidence_contract 是桥)**:result-analysis 在 **stage 7 定证据强度**(产 `evidence_strength.json`: > 每条 claim 的 q/效应量/CI → 证据档 strong/moderate/weak/none + 允许/禁止措辞);research-ethics 在 **stage 8 `claim_evidence_bind` > 查措辞是否超过证据**(消费同一个 `evidence_strength.json`)。**本技能定强度、它查措辞,不重叠**;`_shared/evidence_contract` > 是两者共用的桥。 > > **特殊位置(回炉发起方,与 experiment-coding 相反)**:experiment-coding 是 7→6 的**回炉落点**(被动接);**result-analysis > 是 7→5 + 7→6 两条回边的发起方(主动发)**——判**结果不支撑假设**(findings 带「假设/支撑/效应」信号)→ 总控 `reroute --stage 7` > 建议 **7→5** 回 research-plan;判**结果不可复现**(带「种子/复现」信号)→ 建议 **7→6** 回 experiment-coding。**这是本技能的 > 非线性核心:不是终点,是把结果送回上游修的枢纽。**(p-hacking critical 则是 **stage 7 内重做分析**,reroute 给 manual。) > > **是横切常驻吗?** 否。这是**按需 `/` 调用的主线节点**;file-reading / memory-pm / project-structure / consistency / > research-ethics 全程横切常驻,本技能不重复它们。 --- ## 何时启动(触发信号) - 实验**跑完了要解读结果**(experiment-coding 交来 `run_manifest.md`:多种子指标 + 产物路径)——**主用法**。 - 用户问「**这些结果说明什么 / 这提升靠谱吗 / 是显著还是噪声 / 效应量多大 / 换数据集还成立吗**」——任一即启动。 - 要做**显著性检验 + 效应量 + 置信区间 + 多重比较校正**(不只报 p)/ **配对检验** / **切片分析** / **SHAP 可解释性**。 - 怀疑「**指标好得反常(藏泄漏?)/ 报了一堆 p<.05(多重比较校正了吗?)/ 只报了成功的那个(选择性报告?)**」——正中本技能 critical 门。 - 要给每条 claim **定证据强度**供下游写作校准措辞(产 `evidence_strength.json`)。 - **回炉判定(本技能主动发起)**:判结果**不支撑假设**(→7→5 回 research-plan)/ **不可复现**(→7→6 回 experiment-coding)—— **这是决策点,停下问用户**(回哪 / 带病推进 / 转已知局限)。 --- ## 你怎么工作:ACT / ASK / NEVER 每个动作**先归类**:该**自己做(ACT)**、该**停下问用户(ASK)**、还是**绝不(NEVER)**? ### ACT — 跑确定性统计门,自己做(不烦用户) - **先审分析计划与证据来源(warn-only,不扩大 critical 面)**: `python scripts/analysis_plan_audit.py --spec analysis_audit.json --report analysis_audit_findings.json --json-out analysis_audit_full.json`——核结果前 plan lock、统计单位/复杂设计、comparison family、 expected↔observed seed/fold/sample coverage,以及 raw result 的 hash/owner/time/run manifest/commit。 - **先判方法能不能用**:解释器、统计检验或诊断法运行前用 `method_compatibility.py` 核对 `domain_scope/input_modalities/task_types/requires_access/supported_dependence/labels`; 已知不兼容 `FAIL`,条件缺失 `UNRESOLVED`,不得把“脚本能跑”误写成“方法适用”。 - **一键统计分析**:`python scripts/analyze_results.py results.csv --group method --metric acc f1`——EDA(n/均值±std/中位/95%CI/ 正态性)+ **按正态性与组数自动选检验**(2 组正态→Welch t / 非正态→Mann-Whitney;≥3 组→先 Levene 方差齐性→ANOVA+Tukey 或 Welch-ANOVA / 非正态→Kruskal-Wallis)+ 每对 Cohen's d(Hedges 校正)+ **BH-FDR 跨比较校正**。共享种子/折加 `--paired-by seed` 走**配对 t / Wilcoxon**(功效更高)。**给了 `--paired-by` 后,claim/evidence 只采用配对比较;独立样本结果仅留 advisory,不得生成 duplicate claims**。`--slice-by <col>` 切片分析防聚合掩盖子群失败(小 n 切片自动标「待核查」)。 - **统计严谨/证据强度 critical 门**(本技能灵魂):`python scripts/stat_rigor_gate.py --spec stat_spec.json --report stat_findings.json --evidence-out evidence_strength.json` 编排 **BH-FDR 真重算 + 消费 evidence_contract** → 产 `light.findings.v1`:**多重比较未校正/ 选择性报告 / 假设证否 / 多种子不稳 → critical**;过度解读/效应量缺失 → warn。critical → `run_checkpoint --stage 7` exit 1。 - **产标准机读工件**:`analyze_results.py --emit-claim-table`(`claim_evidence_table.md`:每个比较↔检验/p/q/d/CI/n)+ `--emit-evidence`(`evidence_strength.json`:挂接 `_shared/evidence_contract`,q/效应量/CI→证据档+措辞档)。**显著性一律以 BH-FDR 后 q 为准**,不显著的比较标「不得声称更好」。 - **效应量 + CI + DeLong**:`significance_test.py`(`cohens_d`/`mean_diff_ci`/`bootstrap_ci`/`benjamini_hochberg`/**`delong_two_auroc`** 比较同测试集两模型 AUROC 差是否显著)。**只报 p 不报效应量 = 误用**:p 小不代表差异大。 - **R/Python 真交叉核验**:`python scripts/r_analysis_crosscheck.py --input results.csv --group method --metric acc --paired-by seed --out r_acc.csv`。launcher 会找 `RSCRIPT`/PATH/Windows Program Files;base R 真算 paired t 或 independent Welch。R 不可用就明确返回 unavailable;复杂 mixed/repeated/nested 设计仍需专门模型。 - **可解释性 / 失败案例 / 泄漏体检**:`explain_shap.py`(SHAP beeswarm/bar/waterfall,**非因果**,shap 缺失优雅降级)+ `leakage_overfit_check.py`(train/val/test gap + 特征-标签高相关泄漏 + 重复行)——指标好得反常先查泄漏。 - **出分析报告**:按 `assets/result_analysis_report_template.md` 每个发现写「现象→原因→证据→对论文的意义」+ 亮点/异常/待补实验清单。 ### ASK — 停下问用户,给「证据 + 推荐 + 备选」(决策点 🧑) | 决策点 | 何时 | 你怎么问 | |---|---|---| | **回炉发起 7→5(不支撑假设)**(最重要) | hypothesis_support 判主假设 grade=none | 「主假设 H1『新模块提升 acc』**未被结果支撑**:BH-FDR 后 q=0.2≥.05、CI=[-0.2,0.4] 含 0、效应量 d=0.1 过小。**建议**回 research-plan(7→5)重审假设/设计(也许 H 本就不成立,或需更强实验)。回炉带『哪条假设没撑住 + 对应效应量/CI』——还是带病推进 / 转已知局限?(方向你定,**绝不 HARKing 删掉换个成功假设重报**)」 | | **回炉发起 7→6(不可复现)** | reproducibility 判多种子 sign-flip/CV 过大 | 「结果不可复现:claim X 的效应跨 5 个种子 **sign-flip**([-0.31,+0.55]),换次跑结论会飘。**建议**回 experiment-coding(7→6)查种子覆盖 / 实现 bug,带『失败的复现证据』。还是多种子报均值±std 并 hedge?别把单次峰值当结论。」 | | **查出 p-hacking** | stat_validity 多重比较未校正/选择性报告 | 「扫到 5 个比较未做多重比较校正:4 个裸 p<.05 中 4 个经 BH-FDR 后 q≥.05(**假阳性**)。**建议**在 stage 7 内重做分析:对全部比较做 BH-FDR,显著性以校正后 q 为准。要我直接重算吗?校正后『显著』可能消失——那才是真值。」 | | **证据弱却想强措辞** | evidence_strength 判 asserted_grade 强于实算档 | 「claim Y 证据档=**weak**(显著但小效应 d=0.2),但措辞写了『显著优于』。**建议**降到『在本实验中略优 / 初步提示』并加 hedge。强措辞会被 research-ethics 的 stage-8 措辞门拦。」
后端代码编写、逻辑强、安全性高、可读性好、版本控制、代码审查。当任务需要写实验代码、模型代码、数据处理代码、可视化代码、后端接口或系统逻辑时使用。要求逻辑清晰、安全、可读、可维护、便于复现/扩展/部署。支持 Git 版本管理、代码审查、注释规范、README、依赖管理、环境配置、运行说明与项目结构整理。
Verify scholarly references and claim-citation support for Light stage 10. Use when auditing a manuscript, claim map, bibliography, DOI/arXiv/PMID/ISBN/URL, BibTeX/CSL, citekeys, chimeric or fabricated citations, retraction/correction alerts, or preparing a canonical citation registry for typesetting. Builds provenance-preserving inventories, confirms metadata with independent authoritative sources, distinguishes CONFIRMED/CONFIRMED-MISSING/UNAVAILABLE/UNRESOLVED, records Crossref update direction, and emits the citation gate plus delivery artifacts.
竞赛与项目申报材料辅助。当用户做统计建模、数学建模、互联网+、挑战杯、大创、创新创业、科研训练等项目时使用。辅助写申报书、项目计划书、商业计划书、路演 PPT、答辩稿、项目摘要、技术路线、创新点、可行性分析、市场分析、研究基础、预期成果、经费预算、团队分工。用于非论文投稿场景,可与论文/软著/专利/PPT 联动。
>-
>-
从顶会大牛角度进行专业绘图与组图。当用户需要把规划好的图实际画出来时使用。按情况用 Python(matplotlib/seaborn/plotly/altair)、R(ggplot2)、MATLAB、Visio、Origin、LaTeX/TikZ、Illustrator、PowerPoint 等。审美统一、专业清晰、配色合理、字体规范、线条清楚、高分辨率,适合直接投稿。不仅画图,还从论文表达角度判断怎么排、怎么组、怎么标注、怎么突出重点。
根据论文内容规划应该做哪些图、哪些表、插在哪里、各起什么作用。当用户需要论文图表规划时使用。图表不限于统计图,也包括数据集真实效果图、模型输出示例、案例展示、可解释性可视化等。规划框架图、技术路线图、数据集示意图、模型结构图、算法流程图、结果对比/消融/敏感性图、真实效果图、统计表/对比表等,以审稿人标准判断哪些必做、哪些冗余。
>-