Skip to main content
ClaudeWave
Skill450 repo starsupdated 16d ago

light-literature-search

强大地搜索并规范化整理科研资料。当用户需要调研某研究方向、找文献综述、了解某领域有哪些工作、搜集中英文论文/专利/标准/政策/数据集/开源项目/竞赛方案/行业报告/技术博客/官方文档时使用。不只罗列结果,而是筛选去重分类、判断可信度与重要性,整理为文献表、研究脉络、代表方法、优缺点对比与可复用资源。

Install in Claude Code
Copy
git clone --depth 1 https://github.com/Light0305/Light-skills /tmp/light-literature-search && cp -r /tmp/light-literature-search/skills/light-literature-search ~/.claude/skills/light-literature-search
Then start a new Claude Code session; the skill loads automatically.

SKILL.md

# 资料搜索与规范化整理

## 目标
帮用户真正快速理解一个方向,而非堆搜索结果。产出可直接用于写综述、提 idea、做方案的结构化资料。

## 输入澄清(缺失则先问或合理假设)
研究方向、核心问题、关键词(中英文)、目标期刊/会议、项目背景、时间范围、语言偏好、深度(速览/中等/穷尽)。

## 检索策略
1. **多源并行**:英文论文(arXiv/OpenAlex/Semantic Scholar/Crossref/DOAJ)、生医论文(PubMed/Europe PMC,详见下"优先免费无 key 的学术 API"与生医纪律)、中文论文(优先 OpenAlex/Crossref 按 ISSN 检中文期刊;知网/万方/维普/CSCD 无免费 API,走机构访问或浏览器取元数据,详见下"中文文献检索")、专利(Google Patents/CNIPA/Espacenet/Lens)、标准、政策、数据集(HF/Kaggle/OpenML)、开源(GitHub/PwC)、竞赛方案、行业报告、技术博客、官方文档。
2. **多角度扫**(multi-modal sweep):按概念、按方法、按作者/团队、按时间、按引用关系分别检索,互补盲区。
   - **跨领域轴(创新高发区)**:窄应用领域近三年好文常稀少,但前沿创新多靠**把别的领域的最新方法迁移过来**(如 CV 目标检测/扩散模型/Transformer SOTA → 病理识别、畜牧行为、遥感)。此时**别把"应用词+方法词"拼成一个 query**(实测拼词+被引排序会顶出通用高被引跑题文),改用 `scripts/cross_domain_search.py` 做应用轴 × 方法轴正交检索,方法轴强时效抓 SOTA,迁移判断交研究者(喂 m03)。
3. **检索式构造**:给出每个库的实际可用 query(布尔逻辑、字段限定、同义词扩展、中英对照)。
4. **滚雪球**:从代表作做前向(被引)+后向(参考)追踪。

### 优先免费的学术 API(多数免 key;OpenAlex 2026 起需免费 key,接入口径见 references「OpenAlex 接入真相源」。端点详见 references.md,落地前再核校)
- **OpenAlex** `https://api.openalex.org/works`:`search=` 全文检索;`filter=` 组合(`from_publication_date:`、`cited_by_count:>N`、`is_oa:true`、`type:article`、`primary_topic.id:`、`authorships.author.id:`);`sort=cited_by_count:desc`;`select=` 省字段;深翻用 `cursor=*`(`page` 上限 1 万);带 `mailto=` 进礼貌池。`group_by=` 可一键做年度/期刊分布。摘要是 inverted index 需还原。**接入需免费 key,额度/限流口径见 references「OpenAlex 接入真相源」节。**
- **Crossref** `https://api.crossref.org/works`:`query.bibliographic/author/title=`;`filter=from-pub-date:,type:journal-article`;`sort=is-referenced-by-count&order=desc`;深翻 `cursor=*`;带 `mailto=` 提速。作 DOI 规范化与去重的"真相源"。
- **Semantic Scholar** `https://api.semanticscholar.org/graph/v1`:`/paper/search?query=&fields=title,abstract,year,authors,citationCount,influentialCitationCount,externalIds,openAccessPdf,tldr`;穷尽式扫库用 `/paper/search/bulk`(返回 `token` 续翻);滚雪球用 `/paper/{id}/citations` 与 `/references`(看 `isInfluential`);批量详情 `/paper/batch`(POST)。匿名限速严,量大申请 `x-api-key`。
- **arXiv** `http://export.arxiv.org/api/query`:`search_query=ti:/au:/abs:/cat:/all:` + 布尔;`start`/`max_results`(≤100) 翻页;`sortBy=submittedDate&sortOrder=descending`;请求间隔 ≥3 秒。
- **PubMed E-utilities** `https://eutils.ncbi.nlm.nih.gov/entrez/eutils/`:两步式 `esearch.fcgi?db=pubmed&term=...` 取 PMID → `efetch.fcgi`/`esummary.fcgi` 取详情;`term` 支持 `[MeSH Terms]`/`[tiab]`/`[ti]`/`[au]`/`[dp]`;`retmax`/`retstart` 翻页,大集合用 `usehistory=y`+`WebEnv`/`query_key`;建议带 `&email=&api_key=`(无 key 3 req/s、有 key 10 req/s)。**MeSH 受控词检索与 Clinical Queries 临床过滤器此源独有,OpenAlex 替代不了。**
- **Europe PMC** `https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=&format=json&resultType=core`:完全免 key;`pageSize`(≤1000)+`cursorMark`(传 `*`,响应 `nextCursorMark` 续翻);返回直接含 `abstractText`、`pmid`/`pmcid`/`doi`、`isOpenAccess`/`inEPMC`/`hasPDF`、`citedByCount`;`/{source}/{id}/citations` 与 `/references` 做滚雪球;覆盖 MED+PMC+PPR。
- **DOAJ** `https://doaj.org/api/v2/search/articles/{query}?pageSize=N`:完全免 key;**按相关度排序**(非被引),补 OpenAlex/Crossref 纯被引排序顶出跑题高被引文的盲区;`bibjson` 含 title/year/author/journal/abstract/identifier(DOI);只覆盖开放获取期刊、不出被引;已落地 `search_normalize.py` 第三源,详见 references「DOAJ API」。
- **跨源去重锚点**:优先按 DOI 归并,无 DOI 再按 arXiv id / 规范化标题+作者+年。被引数跨库不可直接比(Crossref 低估、S2 含估计、OpenAlex 口径不同、Europe PMC/PubMed 又是另一口径),注明来源。
- **生医纪律(必做)**:涉生医/临床/系统综述方向,**PubMed+MeSH 检索式为必做项**(对齐已宣称的 PRISMA),不能只靠 OpenAlex/S2 的全文检索冒充规范检索;MeSH 受控词与 Clinical Queries 临床过滤器是 PubMed 独有能力。**已落地脚本 `scripts/biomedical_search.py`(Europe PMC+PubMed)兑现此项**——PubMed 支持把 MeSH 检索式写在 `term` 里透传(如 `lameness[MeSH Terms] AND goat[tiab]`);但"自由词→MeSH 主题词"的自动映射本脚本不做(需接 NCBI MeSH 库,属 P2 增强),MeSH 受控词需你按规范写好。Europe PMC 作免 key 补充(直接给 abstract+开放获取标记+引用端点)。**预印本最前沿**用 `scripts/arxiv_search.py` 补 arXiv 与 bioRxiv/medRxiv(免 key;bioRxiv 无服务端关键词检索,脚本拉时间窗后本地过滤并如实标注,预印本须按可信度分级标注)。四源(OpenAlex+Europe PMC+PubMed+arXiv/bioRxiv)并查互补盲区,前两源在 `search_normalize.py`、后多源在 `biomedical_search.py`/`arxiv_search.py`。

### 中文文献检索(必做,勿只做英文)
中文核心成果大量在知网/万方等库,但这些库**无公开免费 API**;OpenAlex/Crossref 却**已收录大量中文期刊**(按 ISSN 可直接命中),应作为低门槛主力(OpenAlex 需免费 key,Crossref 免 key),机构访问的中文库作补充。
- **OpenAlex 检中文期刊(已实测可用)**:按刊名/ISSN 定位 source 再拉 works。例:计算机学报 = `https://api.openalex.org/sources/issn:0254-4164`(实测 OpenAlex ID `S4210175330`、`country_code:CN`、1264 篇),再 `GET /works?filter=primary_location.source.id:S4210175330&sort=cited_by_count:desc`。**坑**:OpenAlex 常把中文论文的标题/摘要存成英译,`group_by=language` 可能显示 `en` 而非 `zh`,故按 source.id 检索比按 `language:zh` 更可靠。
- **Crossref 检中文期刊(已实测可用)**:`https://api.crossref.org/journals/0254-4164`(实测命中"Chinese Journal of Computers"、出版商 China Science Publishing & Media、1264 DOI);`/journals/{ISSN}/works?query=` 在刊内检索。先用中文核心刊 ISSN 清单批量探源。
- **知网 CNKI / 万方 Wanfang / 维普 VIP / CSCD(无公开 API,仅网页或机构订阅)**:均需机构/IP 授权或人工网页检索,无对外免费 API。用 browser-use / agent-browser 走"真人式浏览"取**元数据/摘要/链接**(遵守 robots/ToS,不抓全文);或让用户在机构账号下导出题录(EndNote/RefWorks/NoteExpress/RIS 格式)再入库。CSCD(中国科学引文数据库)被引数据同样仅机构端可得,标"免费源不可得"。
- **百度学术 / 谷歌学术(无官方 API)**:仅网页,反爬强;只作发现入口,命中后回 OpenAlex/Crossref 按 DOI 或刊名核实元数据再入表,不直接采信其页面被引数。
- **中文主题词检索建议**:① 中英双语同义词都要试(如"大语言模型/大模型/LLM/large language model");② 用《汉语主题词表》/学科规范词 + 同领域核心刊高频关键词扩展;③ 简繁体、全半角、专有名词缩写都要兼顾;④ 优先锁定中文核心刊范围(北大核心/CSCD/CSSCI),可先建目标刊 ISSN 清单再逐刊检索。
- **GB/T 7714 引用格式**:中文条目按 GB/T 7714-2015 著录。期刊示例:`主要责任者. 题名[J]. 刊名, 年, 卷(期): 起止页码.`;带 DOI 末尾加 `DOI: 10.xxxx/xxxx.`。文献类型标识:专著[M]、期刊[J]、论文集[C]、学位论文[D]、报告[R]、标准[S]、专利[P]、电子资源[EB/OL]。入表时中英文条目分别按各自规范(中文 GB/T 7714、英文 APA/IEEE 等)著录并注明。

### 无 API 的源用浏览器 agent 取数
知网/万方网页、政府标准/政策站、Google Scholar 等无开放 API 或反爬时,用 **browser-use**(本地 Python+Playwright) 或 **Browserbase/Stagehand agent-browser**(云端,`observe→act→extract` 抽结构化字段)走"真人式浏览"取元数据。只取元数据/摘要/链接,遵守 robots/ToS 与版权;结果非确定,须二次校验。

### 补充网络检索
arXiv/学术库覆盖不到的官方文档、技术博客、项目页、行业报告:用 **Exa**(`/search` neural/keyword + `contents` 取正文高亮,`/findSimilar` 以网页为种子滚雪球) 或 **Parallel Search**(为 LLM 优化、返回排序摘录)。网络结果一律回到 DOI/OpenAlex 核实元数据后才入表。

## 整理流程(不可省)
- **筛选**:相关度阈值,剔除明显跑题。综述类任务按 PRISMA 思想留痕:记录每个库的检索式与命中数 → 去重数 → 标题/摘要筛掉多少 → 全文筛掉多少 → 最终纳入,全程可复现。
- **去重**:跨库按 DOI 优先,无 DOI 按 arXiv id / 规范化标题+作者+年 归并。
- **分类**:按子方向/方法族/任务/时间分组。
- **可信度判断**:来源层级(顶刊顶会 > 普
light-backend-codingSkill

后端代码编写、逻辑强、安全性高、可读性好、版本控制、代码审查。当任务需要写实验代码、模型代码、数据处理代码、可视化代码、后端接口或系统逻辑时使用。要求逻辑清晰、安全、可读、可维护、便于复现/扩展/部署。支持 Git 版本管理、代码审查、注释规范、README、依赖管理、环境配置、运行说明与项目结构整理。

light-citationSkill

论文引用规划、审查与多格式生成。当用户需要处理参考文献、引用、bibtex 时使用。审查引用的关联度、真实性、权威性、时效性、数量、中外占比,是否引用了经典/最新/代表性/对比工作。避免虚假引用、过度引用、无关引用、堆砌、遗漏关键文献、低质量来源、引用与正文不匹配。生成 BibTeX/EndNote/GB-T 7714/APA/IEEE 等格式并按目标 venue 调整。

light-competitionSkill

竞赛与项目申报材料辅助。当用户做统计建模、数学建模、互联网+、挑战杯、大创、创新创业、科研训练等项目时使用。辅助写申报书、项目计划书、商业计划书、路演 PPT、答辩稿、项目摘要、技术路线、创新点、可行性分析、市场分析、研究基础、预期成果、经费预算、团队分工。用于非论文投稿场景,可与论文/软著/专利/PPT 联动。

light-consistencySkill

统一风格与一致性维护。在论文、PPT、图表、代码、项目文档之间保持术语一致、视觉风格一致、逻辑线索一致、创新点表述一致(常驻,所有任务后台生效)。避免同一项目在不同材料中出现说法不一致、指标名称不统一、图表风格混乱、创新点前后矛盾、方法名称变化、数据集名称不统一、论文与 PPT 逻辑不一致、软著与系统功能不一致。

light-data-engineeringSkill

数据处理、数据质量分析与数据集构建。当用户需要清洗数据、处理缺失/异常值、特征工程、数据增强、划分数据集、评估数据质量,或需自建数据集(采集、标注规范、格式、说明文档、隐私合规、发布)时使用。在提 idea 前优先判断现有数据是否足以支撑研究。

light-figure-drawingSkill

从顶会大牛角度进行专业绘图与组图。当用户需要把规划好的图实际画出来时使用。按情况用 Python(matplotlib/seaborn/plotly/altair)、R(ggplot2)、MATLAB、Visio、Origin、LaTeX/TikZ、Illustrator、PowerPoint 等。审美统一、专业清晰、配色合理、字体规范、线条清楚、高分辨率,适合直接投稿。不仅画图,还从论文表达角度判断怎么排、怎么组、怎么标注、怎么突出重点。

light-figure-planningSkill

根据论文内容规划应该做哪些图、哪些表、插在哪里、各起什么作用。当用户需要论文图表规划时使用。图表不限于统计图,也包括数据集真实效果图、模型输出示例、案例展示、可解释性可视化等。规划框架图、技术路线图、数据集示意图、模型结构图、算法流程图、结果对比/消融/敏感性图、真实效果图、统计表/对比表等,以审稿人标准判断哪些必做、哪些冗余。

light-file-readingSkill

强大地读文件并学习——Word、PDF、PPTX、Excel、CSV、图片、视频、代码、压缩包等。当用户提供任何文件、问"这个文件讲了什么"、或任务需要理解已有材料时使用(常驻,自动触发)。不只提取文字,而是理解结构、逻辑、图表、数据、实验结果、格式要求、章节关系、视觉风格、隐含要求与可复用内容,并转化为可执行任务。