解析 PDF、Word、知网文档,基于文献撰写可追溯综述,适配期刊风格并生成 Word。
--- name: write-literature-review description: 解析 PDF、Word、知网文档,基于文献撰写可追溯综述,适配期刊风格并生成 Word。 version: 1.2.0 --- # 文献综述写作 ## 目标 基于用户实际提供且成功读取的参考文献,完成证据可追溯、观点有综合、引用不虚构的中文或英文综述。当用户提供多篇目标期刊文章时,提炼其共同结构、论证方式、语言语气和呈现习惯,并在不复制原句的前提下进行风格适配。完整综述默认生成 `.docx` 文件并作为附件或下载链接交付。 ## 核心原则 - 只把实际读取的内容作为证据。 - 不虚构作者、题目、期刊、年份、DOI、数据、方法、结果或结论。 - 只有摘要可用时,明确标注“基于摘要提取”,不得声称完成全文分析。 - 区分文献原作者结论、跨文献综合判断和综述作者提出的未来方向。 - 不直接比较数据集、任务、样本或评价协议不同的数值结果。 - 不把叙述性综述称为系统综述,除非检索、筛选、纳排标准和报告过程满足系统综述要求。 - 目标期刊文章只用于学习共同风格,不得复制句子、独特表达或原有论证内容。 ## 开始前确认 尽量从用户材料和当前对话中确定以下信息;仅在缺失信息会影响科学正确性时提问: - 综述主题和核心问题 - 综述类型:叙述性、范围综述、系统综述、批判性综述、方法综述或研究背景 - 输出语言、长度和用途 - 目标期刊和文章类型 - 引用格式 - 是否允许补充外部文献 - 哪些文件是主题参考文献,哪些是目标期刊范文 若用户没有指定综述类型,默认采用“主题综合型叙述性综述”,不得默认宣称为系统综述。 ## 工作流程 ### 0. 解析输入文档 收到 PDF、Word 或知网格式文件时,先读取 [references/document-ingestion.md](references/document-ingestion.md),使用统一解析脚本将文件转换为 UTF-8 文本和解析清单: ```bash python3 scripts/extract_documents.py <文件或目录> --out-dir extracted ``` 支持: - PDF:文本型 PDF;扫描型 PDF 可使用 `--ocr` - Word:`.docx`,以及具备 `antiword`、`catdoc` 或 LibreOffice 时的旧版 `.doc` - 知网全文:`.caj`、`.nh`、`.kdh`,需要可用的 `caj2pdf` - 知网题录:`.txt`、`.ris`、`.enw`、`.nbib`、`.xml` 不得把空文本、乱码、加密文件或转换失败标记为成功。保留原文件名、解析方式、字符数、状态和错误原因。 ### 1. 建立文献清单 为每个文件分配稳定编号,如 `[R01]`、`[R02]`。记录: - 文件名、题目、作者、年份、期刊和 DOI - 全文、摘要或不可读状态 - 相关性、重复状态和纳入状态 - 文献角色:证据文献、目标期刊范文或双重用途文献 证据文献提供事实和论据;目标期刊范文只提供风格线索。双重用途文献的两种用途必须分别记录。 ### 2. 逐篇提取证据 读取 [references/evidence-extraction.md](references/evidence-extraction.md),按统一模式提取每篇证据文献。记录关键结论所在的页码、章节、表格或图号,以便回溯核验。 ### 3. 建立证据矩阵 至少包含: | 编号 | 研究问题 | 数据或样本 | 方法 | 主要发现 | 贡献 | 局限 | 主题 | |---|---|---|---|---|---|---|---| 定量结果只有在解释主要发现时才保留,并同时记录其数据集、样本、指标和验证条件。 ### 4. 进行主题编码与综合 根据综述问题选择一种主结构: - 时间脉络:适合技术或理论演进 - 主题综合:适合多个核心问题 - 方法比较:适合模型、数据、任务和评价体系 - 问题—方案:适合围绕研究瓶颈组织 - 证据—不足—方向:适合提炼研究缺口和未来工作 必要时使用混合结构。读取 [references/synthesis-and-structure.md](references/synthesis-and-structure.md)。 ### 5. 建立目标期刊风格画像 仅当用户提供目标期刊文章时执行。优先分析 3 篇以上、与拟投稿文章类型相同或相近的近期全文文章;5–10 篇通常能形成更稳定的画像。 读取 [references/journal-style-profile.md](references/journal-style-profile.md),分析共同特征: - 标题和摘要组织 - 章节名称、顺序和篇幅比例 - 引言、主体、讨论和结论的修辞功能 - 段落长度、主题句位置和过渡方式 - 单篇引用与组合引用习惯 - 谨慎语气、报告动词、主动或被动语态 - 局限、争议和未来方向的表达方式 - 表格、分类框架和概念图的使用 把每项特征标为高、中或低置信度,并记录支持该特征的样本数量。单篇文章的独特写法不得概括为期刊风格。 期刊范文体现的是观察到的惯例,不等同于官方投稿要求。如果用户需要严格投稿适配,优先采用目标期刊当前官方作者指南。 ### 6. 生成段落级提纲 每个计划段落先写明: - 段落功能 - 中心论点 - 支撑文献编号 - 文献之间的一致、互补、差异或冲突 - 批判性判断 - 与下一段的过渡 - 对应的目标期刊风格特征 若一个段落只有“作者A做了什么、作者B做了什么”,重新组织为以问题或论点为中心的综合段落。 ### 7. 撰写综述 遵循“观点—证据—比较—判断—过渡”的段落逻辑。 优先使用综合性表达: - 多项研究共同表明…… - 这些研究的主要差异在于…… - 早期研究关注……,随后逐渐转向…… - 尽管相关方法改善了……,但仍受到……限制。 - 综合现有证据可以认为…… 不要机械地逐篇罗列。每个实质性论断必须能映射到一篇或多篇证据文献。 ### 8. 提炼不足与未来方向 使用以下推理链: `已有证据 → 未解决的限制 → 科学问题 → 可验证的研究方向` 每个未来方向说明: - 哪些文献或共同缺口支持它 - 为什么值得研究 - 可以研究什么 - 需要何种数据、实验或外部验证 - 是原文建议还是综述作者的综合推断 ### 9. 执行质量审计 读取 [references/citation-and-quality-audit.md](references/citation-and-quality-audit.md),至少检查: - 全部文件是否有阅读状态 - 纳入文献是否进入证据矩阵 - 正文引用是否映射到真实文献 - 参考文献表中的条目是否在正文出现 - 主要论断是否被相应来源支持 - 冲突结果是否被如实报告 - 推测是否被误写为共识 - 目标期刊风格是否来自多篇文章 - 是否出现近似复制或句级改写 - 风格适配是否扭曲科学证据 ### 10. 生成并交付 Word 文档 正文和引用审计完成后,读取 [references/word-output.md](references/word-output.md)。 默认同时保留用于生成文档的 UTF-8 Markdown 源文件,并运行: ```bash python3 scripts/build_review_docx.py review.md review.docx --title "综述题目" ``` 如果当前目录不是本 Skill 根目录,先定位本 Skill 的安装目录,再使用脚本的绝对路径。输出文件名应简洁、安全并以 `.docx` 结尾。 生成后必须验证: - 文件存在且大小大于 0 - ZIP/OOXML 结构可打开 - `word/document.xml` 存在 - 标题、各级标题、正文、表格和参考文献均已写入 - 文档内容与审计通过的最终正文一致 优先通过当前渠道可用的文件发送或附件能力,把 `.docx` 直接发送给用户,并在最终回复中提供可点击的下载链接。若当前渠道不支持附件或下载链接,明确说明限制并返回文件的绝对保存路径,不得只说“已经生成”。 ## 默认输出顺序 对于完整综述任务,依次输出: 1. 文献清单与阅读状态 2. 文献角色分类 3. 逐篇结构化摘要 4. 证据矩阵 5. 主题编码与研究脉络 6. 目标期刊风格画像(如适用) 7. 段落级提纲 8. 综述正文 9. 现有不足与未来方向 10. 引用覆盖与风格适配审计 11. 可下载的 Word 文档 用户可以只要求其中一个或若干阶段。 ## 最终报告 简要报告: - 收到、成功读取、纳入和排除的文献数量 - 仅能读取摘要或无法读取的文件 - 目标期刊范文数量及风格画像置信度 - 是否使用外部文献 - 尚未解决的证据缺口 - Word 文件名、保存位置和交付状态 - 文档解析成功、警告和失败数量
don't have the plugin yet? install it then click "run inline in claude" again.