从研究选题、文献核验、实验分析,到论文写作和审稿回复:一套面向计算机科学与机器学习研究者的半自动科研工作流。
写在前面
如果你已经使用过 ChatGPT、Claude 或 Codex 辅助科研,可能有过这样的体验:
- AI 可以一次生成十几个研究点,却不告诉你哪些已经有人做过;
- AI 可以列出大量参考文献,但其中可能混入不存在的论文;
- AI 可以编写实验代码,却可能忽略随机种子、数据泄漏和统计显著性;
- AI 可以分析实验结果,却容易把微小的性能提升包装成重大突破;
- AI 可以润色论文,却不知道某个结论是否真的得到实验支持;
- 每次打开一个新对话,都要重新解释研究背景、数据、实验和论文进度。
问题并不完全在于大模型不够聪明。
更深层的原因是,大多数人仍然把 AI 当作一个“即时问答工具”:想到什么问什么,得到回答后再手工搬运到文献管理软件、实验目录、论文草稿和科研笔记中。
真正的科研却不是一组彼此孤立的问题,而是一条持续演进的证据链:
研究问题
↓
文献证据
↓
研究假设
↓
实验设计
↓
结果分析
↓
可支持的结论
↓
论文写作
能否让 AI 不只回答某一个问题,而是沿着这条路径持续协助研究?
这正是 Claude Scholar 试图解决的问题。
Claude Scholar 是由 Galaxy-Dawn 开源的一套半自动科研助手工作流,主要面向计算机科学、人工智能、机器学习以及其他以软件和实验为核心的研究项目。它支持 Claude Code、Codex CLI、Kimi Code CLI 和 OpenCode,并且为不同平台维护了对应分支。
本文重点介绍它的 Codex 版本,并回答以下问题:
- Claude Scholar 到底是什么?
- 为什么名字里有 Claude,却可以安装到 Codex?
- 它包含哪些技能和科研工作流?
- 完整安装和选择性安装有什么区别?
- 如何避免覆盖已有的 Codex 配置?
- 如何用它发现研究点、分析实验和检查论文?
- 它有哪些风险、局限和使用边界?
- 它是否值得机器学习研究者安装?
本文介绍的是 Galaxy-Dawn/claude-scholar。GitHub 上还存在其他同名项目,安装前请确认仓库所有者。
一、Claude Scholar 到底是什么?
Claude Scholar 不是一个新的大语言模型,也不是一个单独的 Skill。
它更像一套安装在 AI Agent 上的“科研工作台”,主要由以下部分组成:
Claude Scholar
├── Skills:特定科研任务的操作规程
├── Agents:承担专门任务的研究角色
├── AGENTS.md:约束整体工作方式
├── config.toml:Codex 配置和 Agent 注册
├── Scripts:安装、卸载和辅助程序
├── Templates:实验、写作和知识管理模板
├── Zotero:文献管理集成
└── Obsidian:长期科研知识库
截至 2026 年 7 月,我检查的 Codex 分支中包含:
- 45 个 Skills;
- 6 个专门 Agents;
- Codex 配置模板;
- 中英文全局规则;
- Zotero MCP 配置;
- Obsidian 知识库工作流;
- 安装、更新和卸载脚本。
它的目标不是取代研究者,而是帮助研究者处理科研中那些重复、结构化、可以规范化的工作,例如:
- 整理文献;
- 记录证据;
- 建立论文笔记;
- 设计实验;
- 分析结果;
- 生成统计材料;
- 绘制科研图表;
- 总结实验;
- 检查论文;
- 回复审稿意见。
项目对自己的定位比较克制:
研究者负责决定什么问题值得研究、哪些证据可信、哪些结论可以写进论文;AI 负责加速周围的工作流程。
因此,Claude Scholar 更接近“有操作规程的研究助理”,而不是“一键自动发论文的 AI 科学家”。
二、什么是 Agent Skill?
要理解 Claude Scholar,首先要理解 Agent Skill。
传统提示词通常只服务于当前对话。例如:
帮我检查这篇论文的参考文献。
AI 会根据模型知识和当前上下文回答,但它可能没有稳定的核验流程,也不知道应该查询哪些数据库、如何处理 DOI 不匹配、如何标记无法验证的信息。
Skill 则会把专业工作流程保存成独立文件。一个典型 Skill 可能包含:
citation-verification/
├── SKILL.md
├── scripts/
├── references/
└── assets/
其中:
SKILL.md规定什么时候使用该技能;scripts包含可以执行的辅助程序;references保存规则和参考资料;assets保存模板或其他资源。
当用户任务与技能描述匹配时,Codex 可以读取完整的 SKILL.md,按照其中的流程执行任务。
Agent Skills 官方将它定义为一种轻量、开放的 AI Agent 能力扩展格式。技能可以携带专业知识、工作流程、脚本、模板和参考资料,并在不同兼容 Agent 之间复用。Agent Skills 官方说明
普通提示词和 Skill 的区别可以概括为:
| 普通提示词 | Agent Skill |
|---|---|
| 通常只服务当前对话 | 可以长期重复使用 |
| 需要用户每次重新说明 | Agent 可以根据任务发现 |
| 内容散落在聊天记录中 | 以独立目录保存 |
| 不容易进行版本管理 | 可以通过 Git 更新 |
| 难以附带大量脚本和模板 | 可以携带完整资源 |
| 流程可能每次不同 | 更适合形成稳定操作规范 |
Claude Scholar 的核心,就是将科研中的多种操作流程整理成一组能够相互协作的 Skills 和 Agents。
三、名字叫 Claude Scholar,为什么 Codex 也能安装?
这是很多读者看到项目名称后的第一个疑问。
Claude Scholar 最初主要面向 Claude Code,但项目后来为不同 AI Agent 维护了单独分支:
| 分支 | 对应平台 |
|---|---|
main | Claude Code |
codex | OpenAI Codex CLI |
kimi | Kimi Code CLI |
opencode | OpenCode |
本文使用的是 Claude Scholar Codex 分支。
Codex 分支不是简单复制 Claude Code 版本,而是针对 Codex 的工作方式进行了适配:
- 技能安装到
~/.codex/skills/; - 专门 Agent 安装到
~/.codex/agents/; - 使用
~/.codex/config.toml; - 使用
AGENTS.md约束全局工作方式; - 不依赖 Claude Code 的 Slash Commands;
- 支持自然语言自动调用技能;
- 支持
$skill-name显式指定技能; - 提供 Codex 专用安装和卸载脚本;
- 对已有配置提供备份和增量合并机制。
例如,在 Claude Code 中,用户可能习惯通过斜杠菜单调用某个命令;在 Codex 中,更常见的调用方式是:
请使用 $results-analysis 分析这个实验目录。
或者直接用自然语言:
请严格分析这个实验目录中的结果,
检查统计显著性、效应量和数据完整性,
然后告诉我下一轮最值得运行什么实验。
如果技能描述与任务匹配,Codex 可以自动发现相应技能。
四、Claude Scholar 的核心思想:建立科研证据链
Claude Scholar 最值得关注的地方,不是技能数量,而是它试图建立一条可追踪的科研路径:
Question
↓
Evidence
↓
Experiment
↓
Analysis
↓
Claim
↓
Writing
1. Question:研究问题
首先明确:
- 研究对象是什么?
- 研究问题是否具体?
- 为什么值得研究?
- 哪个假设可以被实验检验?
- 什么结果会证伪当前想法?
2. Evidence:文献与证据
然后检查:
- 已有研究做到了什么?
- 哪些论文真实存在?
- 哪些论文与当前问题真正相关?
- 哪些结论有论文原文支持?
- 哪些内容只是研究者或 AI 的推断?
3. Experiment:实验
进一步明确:
- 实验变量是什么?
- 对比基线是否充分?
- 数据划分是否合理?
- 是否存在数据泄漏?
- 是否需要消融实验?
- 如何控制随机性?
4. Analysis:分析
实验完成后检查:
- 数据是否足够完整?
- 应采用什么统计检验?
- 是否属于配对实验?
- 是否需要多重比较校正?
- 性能差异是否具有实际意义?
- 是否存在异常值或实验失败?
5. Claim:可支持的结论
只有完成证据与实验检查后,才判断:
- 哪些结论已经得到支持?
- 哪些结论只能写成初步观察?
- 哪些结论证据不足?
- 是否存在过度宣称?
6. Writing:论文写作
最后再把稳定结论写入:
- 摘要;
- 引言;
- 方法;
- 实验;
- 讨论;
- 局限性;
- 审稿回复。
这条流程的价值在于,它试图阻止 AI 从一个实验表格直接跳到“我们的方法显著优于现有方法”这样的论文结论。
五、Claude Scholar 包含哪些能力?
Claude Scholar 当前包含的技能比较多。对于初学者,没有必要一次掌握全部技能,可以按照科研阶段理解。
1. 研究启动与选题
代表技能:
research-ideationdaily-paper-generatordefuddle
research-ideation
用于:
- 从模糊方向形成研究问题;
- 通过 5W1H 梳理研究对象;
- 进行初步研究空白分析;
- 形成可检验假设;
- 确定所需证据;
- 设置证伪条件;
- 生成下一步行动。
它最重要的价值不是“批量生成 idea”,而是要求 idea 与证据需求和证伪条件绑定。
daily-paper-generator
用于定期发现和筛选论文。它更适合已经具有明确研究方向的用户,而不是替代系统综述。
defuddle
用于解释难懂的论文、证明、概念和技术材料,帮助用户补齐前置知识。
2. 文献与引用
代表技能:
citation-verificationobsidian-literature-workflowzotero-obsidian-bridgeobsidian-source-ingestion
citation-verification
用于检查:
- 论文是否真实存在;
- 题名、作者和年份是否匹配;
- DOI 是否正确;
- arXiv 信息是否一致;
- 引用格式是否完整;
- 是否存在张冠李戴;
- 论文内容是否支持当前陈述。
它强调优先使用:
- arXiv;
- DOI 和 Crossref;
- Semantic Scholar;
- 出版社页面;
- Zotero 元数据。
需要注意:
Google Scholar 可以用于发现论文,但通常不应作为最终元数据核验的唯一来源。
Zotero 与 Obsidian 工作流
Claude Scholar 可以将文献管理和长期科研笔记连接起来:
论文发现
↓
Zotero 导入
↓
PDF 与元数据
↓
结构化论文笔记
↓
Obsidian 知识库
↓
研究问题、实验和论文写作
这部分属于进阶能力,不是使用 Claude Scholar 的必要条件。
3. 实验与结果分析
代表技能:
results-analysisresults-reportpublication-chart-skillkaggle-learner
results-analysis
这是 Claude Scholar 中比较有价值的技能之一。
它负责:
- 检查实验输入是否完整;
- 整理不同算法和数据集的结果;
- 进行严格统计分析;
- 生成科研图表;
- 建立可用于论文写作的分析材料。
在输入充分时,它预期生成:
analysis-report.md
stats-appendix.md
figure-catalog.md
figures/
它还明确限制:
- 数据不足时不应生成伪造图片;
- 统计输入无效时不能直接下结论;
- 审查模式下不应随意修改文件;
- 不能替代论文 Results 部分的正式写作。
results-report
results-report 位于 results-analysis 之后。
两者的分工是:
| 技能 | 负责什么 |
|---|---|
results-analysis | 统计分析、真实图表、证据和分析附件 |
results-report | 实验复盘、决策总结和下一轮实验建议 |
这种拆分比让一个提示词同时完成“统计、绘图、解释、写论文”更加可靠。
publication-chart-skill
用于生成论文级图片和表格,主要围绕:
pubfig:论文图片;pubtab:论文表格和 Excel/LaTeX 转换。
它适合处理:
- 预算—性能曲线;
- 多数据集算法比较;
- 消融实验图;
- 论文结果表;
- Excel 到 LaTeX 的转换;
- 现有图表的质量检查。
4. 论文写作与投稿
代表技能:
ml-paper-writingpaper-self-reviewreview-responsepost-acceptancelatex-conference-template-organizerwriting-anti-ai
ml-paper-writing
主要面向:
- NeurIPS;
- ICML;
- ICLR;
- ACL;
- AAAI;
- COLM。
它包含:
- 论文结构;
- LaTeX 模板;
- 引用核验;
- Related Work;
- 方法与实验写作;
- Camera-ready 检查。
如果你的目标是机器学习或人工智能会议,这个技能比较有价值。但如果主要撰写中文学位论文,仍然需要结合学校模板和中文学术写作规范。
paper-self-review
用于投稿前系统自查,包括:
- 论文结构是否完整;
- 研究动机是否清楚;
- 方法能否复现;
- 结果是否支持结论;
- 是否存在逻辑跳跃;
- 是否遗漏重要基线;
- 是否存在过度宣称;
- 局限性是否充分。
review-response
用于处理审稿意见:
- 解析审稿意见;
- 区分 Major、Minor、Typo 和 Misunderstanding;
- 决定接受、解释、补实验还是合理辩护;
- 生成逐条回复;
- 检查语气;
- 确保回复与论文修改一致。
writing-anti-ai
这个名字容易引发误解。
更合理的使用方式是:
- 删除机械化套话;
- 减少重复句式;
- 改善论证连贯性;
- 让文字更符合作者原本的表达习惯。
不应把它用于规避学术诚信检查,也不能把 AI 生成内容伪装成未经 AI 辅助的原创研究。最终仍应遵守学校、期刊和会议的 AI 使用政策。
5. 科研知识管理
代表技能:
planning-with-filesobsidian-project-kb-coreobsidian-kb-artifactssession-wrap-up
它们试图解决一个常见问题:
AI 完成了一次很有价值的分析,但结论只存在于某个聊天窗口中,过几周就无法找到。
Claude Scholar 建议把长期研究信息保存到文件系统中,例如:
Sources/Papers/
Knowledge/
Experiments/
Results/
Results/Reports/
Writing/
Daily/
Maps/
这种方式比较适合持续数月甚至数年的研究项目。
6. 软件开发能力
Claude Scholar 还包含:
architecture-designbug-detectivecode-review-excellencegit-workflowverification-loopwebapp-testingdaily-coding
这些技能适合科研代码开发,但并非所有科研人员都需要安装。已经有成熟开发类 Skills 的用户,可以跳过这一组。
六、哪些人适合使用 Claude Scholar?
比较适合
Claude Scholar 尤其适合:
- 人工智能和机器学习研究者;
- 计算机科学研究生;
- 需要同时处理文献、代码、实验和论文的人;
- 使用 Codex 或 Claude Code 开发科研代码的人;
- 希望建立长期科研知识库的人;
- 经常分析多算法、多数据集实验的人;
- 正在准备论文投稿、返修或 Rebuttal 的人。
不一定适合
以下用户未必需要完整安装:
- 只偶尔使用 AI 润色句子;
- 不需要代码和实验;
- 不希望 AI 读取本地文件;
- 已经建立成熟且封闭的科研流程;
- 不愿意检查 AI 生成的文献和统计结果;
- 希望安装后完全无人监督地自动做科研。
Claude Scholar 可以提高工作效率,但不能替代研究者承担学术责任。
七、安装前需要准备什么?
本文以 macOS 和 Codex 为例。Linux 的操作基本相同,Windows 用户建议使用 Git Bash 或 WSL。
1. Codex
检查 Codex 是否可用:
codex --version
如果能够显示版本号,说明 Codex 已安装。
2. Git
检查 Git:
git --version
3. Python 和 uv
部分实验、统计和绘图技能需要 Python。
python3 --version
uv --version
Python 和 uv 并不是所有技能的强制要求,但涉及实验分析和绘图时通常需要。
4. 检查现有 Codex 配置
在安装之前,先查看以下位置:
~/.codex/config.toml
~/.codex/skills/
~/.codex/agents/
~/.codex/AGENTS.md
重点检查:
- 是否已经安装其他 Skills;
- 是否存在同名技能;
- 是否已经配置 MCP;
- 是否有自己的全局
AGENTS.md; - 是否使用自定义模型服务商;
- 是否有不能覆盖的配置。
如果你已经长期使用 Codex,建议优先采用后文的“选择性安装”。
八、三种安装方案怎么选?
| 方式 | 适合谁 | 风险 |
|---|---|---|
| 完整安装 | 全新环境,希望使用全部工作流 | 会增加全局规则和大量技能 |
| 最小安装 | 希望获得核心科研流程 | 仍需检查同名目录 |
| 选择性安装 | 已有 Codex 配置和其他技能 | 需要自己记录安装内容 |
我的默认建议是:
新用户可以考虑完整安装;已有成熟 Codex 环境的用户优先选择性安装。
九、方案一:完整安装
官方 Codex 分支的安装方式是:
git clone -b codex \
https://github.com/Galaxy-Dawn/claude-scholar.git \
/tmp/claude-scholar
bash /tmp/claude-scholar/scripts/setup.sh
其中:
-b codex表示获取 Codex 专用分支;/tmp/claude-scholar是临时存放项目的位置;setup.sh是安装程序。
安装程序会处理:
skills/;agents/;scripts/;utils/;templates/;config.toml;AGENTS.md;- 可选 Zotero MCP。
安装程序如何处理现有配置?
当前安装脚本具有一定的保护机制:
- 检测现有
config.toml; - 尽量保留现有模型和服务商;
- 检测现有
auth.json; - 修改前创建备份;
- 对仓库管理的文件生成清单;
- 保存安装状态;
- 为安全卸载记录文件归属。
如果已经存在 ~/.codex/AGENTS.md,安装程序会保留原文件,并将 Claude Scholar 版本保存成类似:
AGENTS.scholar.md
用户需要人工阅读并合并需要的内容。这个 Sidecar 文件不会自动全部生效。
如果原来不存在 AGENTS.md,完整安装可能创建全局规则文件,从而影响之后的所有 Codex 任务。
安装完成后
关闭并重新打开 Codex,然后检查:
~/.codex/skills/
~/.codex/agents/
~/.codex/config.toml
不要立即启用所有 MCP,也不要把真实论文和敏感数据作为第一个测试任务。
十、方案二:选择性安装
如果你已经安装其他科研技能,我更推荐只安装 Claude Scholar 中最有价值的一部分。
第一批建议选择:
research-ideation
citation-verification
results-analysis
results-report
paper-self-review
review-response
publication-chart-skill
第一步:获取 Codex 分支
git clone --depth 1 -b codex \
https://github.com/Galaxy-Dawn/claude-scholar.git \
/tmp/claude-scholar
第二步:检查同名技能
逐个查看以下目录是否已经存在:
~/.codex/skills/research-ideation
~/.codex/skills/citation-verification
~/.codex/skills/results-analysis
~/.codex/skills/results-report
~/.codex/skills/paper-self-review
~/.codex/skills/review-response
~/.codex/skills/publication-chart-skill
如果存在,不要直接覆盖。应先比较来源、版本和内容。
第三步:创建技能目录
mkdir -p "$HOME/.codex/skills"
第四步:复制需要的技能
cp -R /tmp/claude-scholar/skills/research-ideation \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/citation-verification \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/results-analysis \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/results-report \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/paper-self-review \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/review-response \
"$HOME/.codex/skills/"
cp -R /tmp/claude-scholar/skills/publication-chart-skill \
"$HOME/.codex/skills/"
选择性安装不会自动写入完整安装程序的卸载清单。因此,应记录自己复制了哪些目录。
不建议第一批安装什么?
建议暂时跳过:
- 与现有环境同名的 Skills;
- 全局
AGENTS.md; expression-skill;planning-with-files;- 前端和 Web 开发技能;
- Zotero MCP;
- Obsidian 工作流;
- 所有专门 Agents。
等核心技能验证通过,再逐步扩展。
十一、如何确认安装成功?
安装完成后,重新启动 Codex。
测试一:读取技能
输入:
请读取 $citation-verification。
告诉我:
1. 这个技能适用于什么任务;
2. 它推荐的核验流程是什么;
3. 它需要哪些数据源;
4. 它在什么情况下不能给出确定结论。
本次只做说明,不修改任何文件。
如果 Codex 能够识别并读取该技能,说明基础安装成功。
测试二:小规模引用核验
输入一条已经知道答案的真实参考文献:
请使用 $citation-verification 核验下面这条参考文献。
要求:
1. 检查题名、作者、年份和 DOI;
2. 至少使用两个可验证来源;
3. 区分已核验字段和无法核验字段;
4. 不得根据模型记忆补充信息。
测试三:只读实验审查
准备一个小型 CSV,然后输入:
请使用 $results-analysis 检查这个实验结果文件。
本次使用只读审查模式:
1. 不修改原文件;
2. 不生成论文结论;
3. 只检查数据结构是否足以支持统计分析;
4. 列出缺失信息和下一步建议。
如果技能在输入不完整时主动报告限制,而不是编造分析结果,说明它的边界发挥了作用。
十二、实战一:从研究方向到候选研究点
下面以主动学习研究为例。
研究方向
在序分类任务中,如何利用标签顺序信息,在有限成本下主动获取缺失特征?
不要直接要求:
帮我生成十个创新点。
这容易得到大量看似新颖、实际上缺乏文献证据的组合式 idea。
更合理的提示词是:
请使用 $research-ideation 帮助我研究以下方向:
在序分类任务中,如何利用标签顺序信息,
在有限预算下主动获取缺失特征?
请依次完成:
1. 定义问题边界;
2. 区分主动学习、主动特征获取、特征选择和缺失值填补;
3. 使用 5W1H 梳理研究问题;
4. 提出不超过三个候选研究假设;
5. 为每个假设列出需要检索的证据;
6. 指出最接近的已有研究方向;
7. 为每个假设设计证伪条件;
8. 不要把未经文献验证的想法称为创新点;
9. 给出下一步最小可执行任务。
预期输出
Claude Scholar 应帮助形成:
- 研究对象;
- 输入和输出;
- 获取预算;
- 特征成本模型;
- 标签顺序信息的使用位置;
- 候选研究假设;
- 所需文献证据;
- 可能证伪假设的条件;
- 下一步检索任务。
例如,一个候选假设可以写成:
在具有类别顺序结构的数据中,将序关系引入特征获取效用估计,可能在相同预算下减少远距离分类错误。
但这还不能直接写成创新点。
下一步需要验证:
- 是否已有方法使用序关系指导特征获取;
- 已有方法使用的是普通分类不确定性还是序分类损失;
- 是否已经存在相同效用函数;
- 标签顺序信息只是用于分类器,还是直接进入获取策略;
- 现有方法在哪些条件下失效。
接着进行引用核验
请使用 $citation-verification 检查候选文献表。
要求:
1. 逐条核验题名、作者、年份、venue 和 DOI;
2. 记录核验来源;
3. 标记无法确认的信息;
4. 检查论文是否真的讨论主动特征获取;
5. 区分论文真实存在和论文支持当前结论;
6. 不得补造缺失字段。
建立证据矩阵
最终可以形成:
| 文献 | 问题设置 | 获取对象 | 是否考虑成本 | 是否利用序信息 | 理论结果 | 局限 |
|---|---|---|---|---|---|---|
| Paper A | 普通分类 | 特征 | 是 | 否 | 无 | 未考虑标签顺序 |
| Paper B | 序分类 | 标签 | 是 | 是 | 有 | 不获取特征 |
| Paper C | 缺失数据 | 特征 | 否 | 否 | 无 | 成本模型缺失 |
真正的研究空白应该来自文献矩阵中的结构性差异,而不是简单判断某两个关键词从未同时出现。
十三、实战二:严格分析机器学习实验
假设已经完成三种算法的实验:
experiments/
├── dataset_a/
│ ├── random.csv
│ ├── uncertainty.csv
│ └── proposed.csv
├── dataset_b/
│ ├── random.csv
│ ├── uncertainty.csv
│ └── proposed.csv
├── metadata.yaml
└── README.md
其中:
random:随机获取特征;uncertainty:基于不确定性的获取方法;proposed:待验证方法。
第一步:先做输入审查
请使用 $results-analysis 审查 experiments 目录。
先不要写论文结论,也不要自动补齐缺失数据。
请检查:
1. 数据集名称是否完整;
2. 算法名称是否一致;
3. 不同算法是否使用相同随机种子;
4. 每个预算点是否有足够重复实验;
5. 指标方向是否明确;
6. 是否存在缺失值、重复值和异常值;
7. 当前数据是否足以进行配对统计检验;
8. 还缺少哪些元数据。
如果输入不完整,应先解决数据问题,再进入统计分析。
第二步:正式分析
请使用 $results-analysis 分析实验结果。
研究问题:
在相同特征获取预算下,Proposed 是否优于
Random 和 Uncertainty?
要求:
1. 比较不同预算点的 Macro-F1;
2. 报告均值、标准差和置信区间;
3. 判断实验是否属于配对设计;
4. 选择合适的统计检验;
5. 检查统计检验假设;
6. 进行必要的多重比较校正;
7. 报告效应量;
8. 区分统计显著性和实际提升;
9. 生成预算—性能曲线;
10. 对证据不足的结论明确降级。
为什么要报告效应量?
假设某方法在大样本条件下提高了 0.1%,统计上可能显著,但实际价值可能很小。
因此,不能只报告:
p < 0.05
还要回答:
- 提升幅度有多大?
- 置信区间多宽?
- 是否在多个数据集上稳定?
- 是否只在某个预算点有效?
- 计算成本是否显著增加?
- 是否值得为这点提升引入复杂模型?
第三步:生成实验复盘
完成严格分析后再调用:
请使用 $results-report,
基于现有分析材料写一份实验复盘报告。
报告需要回答:
1. 哪些结论已经比较稳定;
2. 哪些结果只在部分数据集成立;
3. 哪些实验存在异常;
4. 当前最强的反证是什么;
5. 哪些补充实验最可能改变结论;
6. 下一轮实验的优先级;
7. 当前是否已经具备论文写作条件。
这份报告不是论文 Results 部分,而是帮助研究者决定下一步做什么。
十四、实战三:投稿前论文自查
在投稿前,可以依次执行三类检查。
第一步:引用核验
请使用 $citation-verification 检查论文参考文献。
需要分别检查:
1. 正文引用是否在参考文献中存在;
2. 参考文献是否在正文中被引用;
3. 题名、作者、年份和 DOI 是否匹配;
4. 是否存在重复文献;
5. 是否存在真实论文与错误题名拼接;
6. 每条关键引用是否真的支持当前陈述;
7. 无法核验的引用必须单独列出。
第二步:论文自查
请使用 $paper-self-review 审查这篇论文。
重点检查:
1. 摘要是否包含定量结果;
2. 引言是否清楚定义研究缺口;
3. 贡献是否与实验和理论一致;
4. 方法描述是否足以复现;
5. 是否遗漏强基线;
6. 消融实验是否支持模块设计;
7. 结论是否存在过度宣称;
8. 局限性是否充分;
9. 图表是否能独立理解;
10. 给出 Major、Minor 和 Optional 三类修改建议。
第三步:模拟审稿
可以进一步要求从审稿人角度提出反对意见:
请从严格机器学习审稿人的角度审查论文。
不要帮助作者辩护,先寻找最可能导致拒稿的问题:
1. 新颖性是否不足;
2. 问题设置是否不现实;
3. 理论假设是否过强;
4. 基线是否不充分;
5. 实验规模是否太小;
6. 统计分析是否不严谨;
7. 是否存在数据泄漏;
8. 结论是否超过证据;
9. 哪些问题必须通过补实验解决。
收到真实审稿意见后
请使用 $review-response 处理这些审稿意见。
先不要直接写回复信。
请先:
1. 拆分每一条评论;
2. 判断是 Major、Minor、Typo 还是 Misunderstanding;
3. 判断应接受、解释、补实验还是合理辩护;
4. 找出评论之间的依赖关系;
5. 给出修改论文和回复审稿人的对应计划;
6. 标记需要作者决定的地方。
确认策略后,再让它生成逐条回复。
十五、Zotero 集成:让文献管理进入工作流
Claude Scholar 可以通过 Zotero MCP 访问文献库。
它适合:
- 通过 DOI、arXiv 或 URL 导入论文;
- 管理文献集合;
- 获取 PDF;
- 读取全文;
- 生成结构化论文笔记;
- 清理重复文献;
- 导出引用信息。
Zotero 是可选组件。即使不安装 Zotero,Claude Scholar 的核心 Skills 仍然可以使用。
安装 Zotero MCP
项目安装脚本给出的安装方式为:
uv tool install --reinstall \
git+https://github.com/Galaxy-Dawn/zotero-mcp.git
安装后仍需在 config.toml 中正确配置 Zotero 信息。
安全提醒
配置文件可能涉及:
- Zotero API Key;
- Library ID;
- 用户或群组类型;
- Unpaywall 邮箱;
- 写入权限。
不要把 API Key:
- 写进论文仓库;
- 上传到 GitHub;
- 复制到公开截图;
- 提交到公开配置文件。
Claude Scholar 的模板中可能包含较宽泛的操作权限。不了解权限含义时,应保持 MCP 禁用,从只读测试开始。
EndNote 用户怎么办?
Claude Scholar 当前主要围绕 Zotero 进行深度集成,没有同等级的 EndNote 原生工作流。
EndNote 用户仍然可以:
- 导出 RIS;
- 导出 BibTeX;
- 导出 XML;
- 将文献表格提供给 Codex;
- 使用
citation-verification核验文献信息。
但自动导入、PDF 管理和知识库联动能力可能不如 Zotero 流程完整。
十六、Obsidian 集成:建立长期科研记忆
对持续数月的项目,聊天记录不是理想的科研知识库。
Claude Scholar 提供以文件系统为核心的 Obsidian 工作流:
Sources/Papers/
Knowledge/
Experiments/
Results/
Results/Reports/
Writing/
Daily/
Maps/
Sources/Papers
保存:
- 论文笔记;
- 原始来源;
- 可核验摘录;
- 文献元数据。
Knowledge
保存:
- 已经得到充分支持的概念;
- 稳定的方法知识;
- 可以跨实验复用的结论。
Experiments
保存:
- 实验假设;
- 配置;
- 运行记录;
- 失败原因;
- 下一步行动。
Results
保存:
- 原始结果;
- 汇总表;
- 统计分析;
- 图表;
- 实验报告。
Writing
保存:
- 论文大纲;
- 章节草稿;
- 待核验论点;
- 投稿材料。
Daily
保存每天的:
- 研究进展;
- 当前阻塞;
- 新发现;
- 下一步任务。
这种设计的优点是,研究记忆属于用户自己的文件,而不是只存在于某个 AI 平台中。
但它也带来维护成本。如果你不使用 Obsidian,或者研究项目比较短,可以暂时跳过。
十七、完整安装可能带来哪些影响?
这是安装前必须了解的部分。
1. 全局 AGENTS.md
Claude Scholar 的 AGENTS.md 会规定:
- 默认表达方式;
- 复杂任务的规划方式;
- 哪些任务应路由到哪些技能;
- 如何报告文件修改;
- 如何记录长期任务;
- 如何使用 Obsidian 知识库。
这些规则会影响很多 Codex 任务,不仅仅是科研任务。
2. 同名技能覆盖
如果已经安装:
nature-writing
nature-polishing
nature-response
nature-data
或者其他同名 Skill,完整安装可能写入 Claude Scholar 自带版本。
虽然官方安装程序会备份现有文件,但仍应在安装前比较版本。
3. config.toml 合并
安装程序会尝试保留现有模型、服务商和认证信息,并添加缺失的 Agent 或 MCP 配置。
但任何自动合并配置的操作都值得人工检查。安装后应对比:
config.toml
config.toml.bak
4. 外部服务
某些工作流需要:
- Zotero;
- OpenAlex;
- Crossref;
- Semantic Scholar;
- arXiv;
- 其他论文或数据服务。
Skill 本身并不会自动赋予网络访问、API Key 或数据库权限。
十八、如何更新和卸载?
更新完整安装
如果最初保留了仓库目录,可以运行:
cd /tmp/claude-scholar
git pull --ff-only
bash scripts/setup.sh
更新前仍然建议阅读项目更新日志。
预览卸载
官方卸载脚本支持只读预览:
cd /tmp/claude-scholar
bash scripts/uninstall.sh --dry-run
确认目标无误后再正式卸载:
bash scripts/uninstall.sh
完整安装程序会记录:
~/.codex/.codex-scholar-manifest.txt
~/.codex/.codex-scholar-install-state
卸载程序依赖这些文件判断哪些内容属于 Claude Scholar。
如果采用手动选择性安装,则需要根据自己的安装记录逐个处理,不应假设完整卸载脚本一定知道这些文件的归属。
十九、Claude Scholar 与其他科研技能库有什么区别?
| 项目 | 主要强项 | 更适合 |
|---|---|---|
| Claude Scholar | 连续科研项目、实验、证据与知识管理 | AI/ML 和计算机研究者 |
| Academic Research Suite | 深度研究、文献综述、论文和审稿 | 通用学术研究 |
| Scientific Agent Skills | 科学软件、数据库与专业分析工具 | 生物、医学、化学和 AI for Science |
| AI Research Skills | ML 工程、训练、评估和顶会写作 | AI/ML 工程实验 |
Claude Scholar 的特点不是单项能力最多,而是比较重视科研项目的连续性:
研究点不是单独生成的
实验不是单独运行的
图表不是单独绘制的
论文也不是脱离证据直接写出的
它试图把这些工作放到同一条科研链路中。
二十、Claude Scholar 的优点
1. 非常贴近 AI/ML 研究流程
它覆盖了:
- 文献;
- 代码;
- 实验;
- 统计;
- 图表;
- 写作;
- Rebuttal。
2. 强调证据边界
它要求区分:
- 已核验事实;
- 根据证据作出的推断;
- 尚未验证的假设。
3. 重视实验产物
不是只输出一段聊天总结,而是鼓励保存:
- 分析报告;
- 统计附件;
- 图表目录;
- 实验复盘;
- 论文笔记。
4. 支持长期项目
Zotero 和 Obsidian 可以让文献与研究记忆持续积累。
5. 专门适配 Codex
Codex 分支提供了独立配置、安装脚本和调用方式,不需要强行使用 Claude Code 的命令系统。
二十一、Claude Scholar 的局限
1. 它不是全自动科研系统
仍然需要研究者决定:
- 问题是否重要;
- 文献是否相关;
- 假设是否合理;
- 实验是否充分;
- 结论是否可信。
2. 数学定理能力有限
它没有完整的“自动发现并证明新定理”系统。
它可以帮助:
- 梳理定义;
- 检查推导;
- 寻找反例;
- 使用 SymPy;
- 分解证明任务。
但新定理的发现和严格证明仍需人工验证。
3. 安装范围较大
完整安装不仅增加科研技能,还会增加:
- 全局规则;
- 开发技能;
- Agent 配置;
- Zotero 配置;
- Obsidian 工作流。
已有复杂 Codex 环境的用户需要谨慎。
4. 部分能力与其他技能库重复
例如论文写作、Nature 风格写作和代码开发技能,可能已经通过其他技能库安装。
5. 外部数据库仍有不确定性
可能遇到:
- API 频率限制;
- 网络不可用;
- 元数据错误;
- PDF 无法访问;
- API Key 缺失。
数据库访问失败时,AI 不应根据记忆补造结果。
二十二、常见问题
问:不使用 Zotero,可以用吗?
可以。Zotero 是进阶集成,不是基础 Skills 的必要条件。
问:不使用 Obsidian,可以用吗?
可以。只是长期科研记忆和知识库功能会减弱。
问:为什么 Codex 中看不到 Slash Command?
Codex 分支主要通过自然语言和 $skill-name 调用,不依赖 Claude Code 的斜杠菜单。
问:安装后会自动发现研究创新点吗?
它可以提出候选研究空白,但必须通过系统文献检索和实验验证。不能把 AI 生成的候选想法直接写成论文创新点。
问:能自动完成博士论文吗?
不能可靠地自动完成。它更适合协助拆解、整理、检查和执行其中可以标准化的工作。
问:能保证参考文献不出错吗?
不能。它能提供更严格的核验流程,但最终仍应检查 DOI、出版社页面和论文原文。
问:能直接相信统计检验结果吗?
不能。应保留分析脚本、原始数据和软件版本,并重新运行验证。
问:应该一次安装全部技能吗?
已有 Codex 环境的用户不建议这样做。先安装 5~8 个核心技能更加稳妥。
二十三、它适合主动学习研究者吗?
我的判断是:
很适合,但它提供的是科研工作流,而不是主动学习算法大全。
对主动学习、主动特征获取和序分类研究者,它可以帮助:
- 系统检索文献;
- 建立概念边界;
- 形成文献矩阵;
- 发现候选研究空白;
- 设计基线和消融实验;
- 管理多次实验;
- 进行统计比较;
- 绘制学习曲线和预算曲线;
- 检查论文结论;
- 准备审稿回复。
它不能直接保证:
- 某个 idea 从未有人提出;
- 某个数学定理一定成立;
- 某个算法一定优于现有方法;
- 某篇 AI 生成论文可以投稿;
- 某个实验结果具有充分学术价值。
对于主动学习研究,最推荐的初始组合是:
research-ideation
citation-verification
results-analysis
results-report
publication-chart-skill
paper-self-review
review-response
如果目标是 ICML、NeurIPS、ICLR 或 AAAI,再考虑增加:
ml-paper-writing
latex-conference-template-organizer
二十四、是否值得安装?
推荐安装
如果你:
- 经常使用 Codex 进行科研;
- 研究方向是 AI、ML 或计算机科学;
- 需要同时处理文献、代码、实验和论文;
- 愿意检查 AI 生成结果;
- 希望建立长期科研流程。
建议选择性安装
如果你:
- 已经安装多个科研 Skill;
- 已经有自己的
AGENTS.md; - 已经配置多个 MCP;
- 只需要实验分析或引用核验;
- 不使用 Zotero 和 Obsidian。
暂时不建议安装
如果你:
- 只需要简单问答或语言润色;
- 不希望 AI 访问本地研究文件;
- 无法检查代码和统计结果;
- 希望安装后完全自动完成科研;
- 正在处理不允许进入外部模型的敏感数据。
二十五、总结
Claude Scholar 最有价值的地方,不是它拥有 45 个技能,而是它试图建立一套更接近真实科研的工作方式:
先定义问题
再寻找证据
然后设计实验
严格分析结果
控制结论强度
最后进行写作
它不会自动让 Codex 变成真正的科学家,也不能替代研究者阅读论文、判断创新性和验证数学证明。
但它能够帮助 Codex 从“临时回答问题的聊天助手”,逐渐变成一个具有流程意识、证据意识和项目记忆的科研助手。
如果你已经在使用 Codex,我的建议是:
- 不要直接完整安装;
- 先选择 5~8 个核心科研技能;
- 使用公开数据和非敏感论文进行测试;
- 检查技能是否真正遵守证据和统计边界;
- 再决定是否启用 Zotero、Obsidian 和全局 Agent;
- 根据自己的研究方向编写专用 Skill。
真正理想的状态不是让 AI 取代研究者,而是:
让研究者把精力放在问题定义、理论创新和科学判断上,把可以标准化、记录和验证的工作交给 AI Agent。
这可能才是 Claude Scholar 对科研工作最现实的意义。
参考链接
- Claude Scholar 官方仓库
- Claude Scholar Codex 分支
- Agent Skills 开放标准
- citation-verification 技能页面
- paper-self-review 技能页面
- results-analysis 技能页面
- review-response 技能页面
本文依据 2026 年 7 月公开仓库和 Codex 分支整理。项目仍在持续更新,技能数量、配置格式和安装方法可能变化。实际安装前请再次阅读官方 README,并对重要配置做好备份。

384

被折叠的 条评论
为什么被折叠?



