Claude Scholar 保姆级教程:把 Codex 变成贯穿文献、实验与论文写作的科研助手

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

从研究选题、文献核验、实验分析,到论文写作和审稿回复:一套面向计算机科学与机器学习研究者的半自动科研工作流。

写在前面

如果你已经使用过 ChatGPT、Claude 或 Codex 辅助科研,可能有过这样的体验:

  • AI 可以一次生成十几个研究点,却不告诉你哪些已经有人做过;
  • AI 可以列出大量参考文献,但其中可能混入不存在的论文;
  • AI 可以编写实验代码,却可能忽略随机种子、数据泄漏和统计显著性;
  • AI 可以分析实验结果,却容易把微小的性能提升包装成重大突破;
  • AI 可以润色论文,却不知道某个结论是否真的得到实验支持;
  • 每次打开一个新对话,都要重新解释研究背景、数据、实验和论文进度。

问题并不完全在于大模型不够聪明。

更深层的原因是,大多数人仍然把 AI 当作一个“即时问答工具”:想到什么问什么,得到回答后再手工搬运到文献管理软件、实验目录、论文草稿和科研笔记中。

真正的科研却不是一组彼此孤立的问题,而是一条持续演进的证据链:

研究问题
    ↓
文献证据
    ↓
研究假设
    ↓
实验设计
    ↓
结果分析
    ↓
可支持的结论
    ↓
论文写作

能否让 AI 不只回答某一个问题,而是沿着这条路径持续协助研究?

这正是 Claude Scholar 试图解决的问题。

Claude Scholar 是由 Galaxy-Dawn 开源的一套半自动科研助手工作流,主要面向计算机科学、人工智能、机器学习以及其他以软件和实验为核心的研究项目。它支持 Claude Code、Codex CLI、Kimi Code CLI 和 OpenCode,并且为不同平台维护了对应分支。

本文重点介绍它的 Codex 版本,并回答以下问题:

  1. Claude Scholar 到底是什么?
  2. 为什么名字里有 Claude,却可以安装到 Codex?
  3. 它包含哪些技能和科研工作流?
  4. 完整安装和选择性安装有什么区别?
  5. 如何避免覆盖已有的 Codex 配置?
  6. 如何用它发现研究点、分析实验和检查论文?
  7. 它有哪些风险、局限和使用边界?
  8. 它是否值得机器学习研究者安装?

本文介绍的是 Galaxy-Dawn/claude-scholar。GitHub 上还存在其他同名项目,安装前请确认仓库所有者。


一、Claude Scholar 到底是什么?

Claude Scholar 不是一个新的大语言模型,也不是一个单独的 Skill。

它更像一套安装在 AI Agent 上的“科研工作台”,主要由以下部分组成:

Claude Scholar
├── Skills:特定科研任务的操作规程
├── Agents:承担专门任务的研究角色
├── AGENTS.md:约束整体工作方式
├── config.toml:Codex 配置和 Agent 注册
├── Scripts:安装、卸载和辅助程序
├── Templates:实验、写作和知识管理模板
├── Zotero:文献管理集成
└── Obsidian:长期科研知识库

截至 2026 年 7 月,我检查的 Codex 分支中包含:

  • 45 个 Skills;
  • 6 个专门 Agents;
  • Codex 配置模板;
  • 中英文全局规则;
  • Zotero MCP 配置;
  • Obsidian 知识库工作流;
  • 安装、更新和卸载脚本。

它的目标不是取代研究者,而是帮助研究者处理科研中那些重复、结构化、可以规范化的工作,例如:

  • 整理文献;
  • 记录证据;
  • 建立论文笔记;
  • 设计实验;
  • 分析结果;
  • 生成统计材料;
  • 绘制科研图表;
  • 总结实验;
  • 检查论文;
  • 回复审稿意见。

项目对自己的定位比较克制:

研究者负责决定什么问题值得研究、哪些证据可信、哪些结论可以写进论文;AI 负责加速周围的工作流程。

因此,Claude Scholar 更接近“有操作规程的研究助理”,而不是“一键自动发论文的 AI 科学家”。


二、什么是 Agent Skill?

要理解 Claude Scholar,首先要理解 Agent Skill。

传统提示词通常只服务于当前对话。例如:

帮我检查这篇论文的参考文献。

AI 会根据模型知识和当前上下文回答,但它可能没有稳定的核验流程,也不知道应该查询哪些数据库、如何处理 DOI 不匹配、如何标记无法验证的信息。

Skill 则会把专业工作流程保存成独立文件。一个典型 Skill 可能包含:

citation-verification/
├── SKILL.md
├── scripts/
├── references/
└── assets/

其中:

  • SKILL.md 规定什么时候使用该技能;
  • scripts 包含可以执行的辅助程序;
  • references 保存规则和参考资料;
  • assets 保存模板或其他资源。

当用户任务与技能描述匹配时,Codex 可以读取完整的 SKILL.md,按照其中的流程执行任务。

Agent Skills 官方将它定义为一种轻量、开放的 AI Agent 能力扩展格式。技能可以携带专业知识、工作流程、脚本、模板和参考资料,并在不同兼容 Agent 之间复用。Agent Skills 官方说明

普通提示词和 Skill 的区别可以概括为:

普通提示词Agent Skill
通常只服务当前对话可以长期重复使用
需要用户每次重新说明Agent 可以根据任务发现
内容散落在聊天记录中以独立目录保存
不容易进行版本管理可以通过 Git 更新
难以附带大量脚本和模板可以携带完整资源
流程可能每次不同更适合形成稳定操作规范

Claude Scholar 的核心,就是将科研中的多种操作流程整理成一组能够相互协作的 Skills 和 Agents。


三、名字叫 Claude Scholar,为什么 Codex 也能安装?

这是很多读者看到项目名称后的第一个疑问。

Claude Scholar 最初主要面向 Claude Code,但项目后来为不同 AI Agent 维护了单独分支:

分支对应平台
mainClaude Code
codexOpenAI Codex CLI
kimiKimi Code CLI
opencodeOpenCode

本文使用的是 Claude Scholar Codex 分支

Codex 分支不是简单复制 Claude Code 版本,而是针对 Codex 的工作方式进行了适配:

  • 技能安装到 ~/.codex/skills/
  • 专门 Agent 安装到 ~/.codex/agents/
  • 使用 ~/.codex/config.toml
  • 使用 AGENTS.md 约束全局工作方式;
  • 不依赖 Claude Code 的 Slash Commands;
  • 支持自然语言自动调用技能;
  • 支持 $skill-name 显式指定技能;
  • 提供 Codex 专用安装和卸载脚本;
  • 对已有配置提供备份和增量合并机制。

例如,在 Claude Code 中,用户可能习惯通过斜杠菜单调用某个命令;在 Codex 中,更常见的调用方式是:

请使用 $results-analysis 分析这个实验目录。

或者直接用自然语言:

请严格分析这个实验目录中的结果,
检查统计显著性、效应量和数据完整性,
然后告诉我下一轮最值得运行什么实验。

如果技能描述与任务匹配,Codex 可以自动发现相应技能。


四、Claude Scholar 的核心思想:建立科研证据链

Claude Scholar 最值得关注的地方,不是技能数量,而是它试图建立一条可追踪的科研路径:

Question
   ↓
Evidence
   ↓
Experiment
   ↓
Analysis
   ↓
Claim
   ↓
Writing

1. Question:研究问题

首先明确:

  • 研究对象是什么?
  • 研究问题是否具体?
  • 为什么值得研究?
  • 哪个假设可以被实验检验?
  • 什么结果会证伪当前想法?

2. Evidence:文献与证据

然后检查:

  • 已有研究做到了什么?
  • 哪些论文真实存在?
  • 哪些论文与当前问题真正相关?
  • 哪些结论有论文原文支持?
  • 哪些内容只是研究者或 AI 的推断?

3. Experiment:实验

进一步明确:

  • 实验变量是什么?
  • 对比基线是否充分?
  • 数据划分是否合理?
  • 是否存在数据泄漏?
  • 是否需要消融实验?
  • 如何控制随机性?

4. Analysis:分析

实验完成后检查:

  • 数据是否足够完整?
  • 应采用什么统计检验?
  • 是否属于配对实验?
  • 是否需要多重比较校正?
  • 性能差异是否具有实际意义?
  • 是否存在异常值或实验失败?

5. Claim:可支持的结论

只有完成证据与实验检查后,才判断:

  • 哪些结论已经得到支持?
  • 哪些结论只能写成初步观察?
  • 哪些结论证据不足?
  • 是否存在过度宣称?

6. Writing:论文写作

最后再把稳定结论写入:

  • 摘要;
  • 引言;
  • 方法;
  • 实验;
  • 讨论;
  • 局限性;
  • 审稿回复。

这条流程的价值在于,它试图阻止 AI 从一个实验表格直接跳到“我们的方法显著优于现有方法”这样的论文结论。


五、Claude Scholar 包含哪些能力?

Claude Scholar 当前包含的技能比较多。对于初学者,没有必要一次掌握全部技能,可以按照科研阶段理解。

1. 研究启动与选题

代表技能:

  • research-ideation
  • daily-paper-generator
  • defuddle

research-ideation

用于:

  • 从模糊方向形成研究问题;
  • 通过 5W1H 梳理研究对象;
  • 进行初步研究空白分析;
  • 形成可检验假设;
  • 确定所需证据;
  • 设置证伪条件;
  • 生成下一步行动。

它最重要的价值不是“批量生成 idea”,而是要求 idea 与证据需求和证伪条件绑定。

daily-paper-generator

用于定期发现和筛选论文。它更适合已经具有明确研究方向的用户,而不是替代系统综述。

defuddle

用于解释难懂的论文、证明、概念和技术材料,帮助用户补齐前置知识。


2. 文献与引用

代表技能:

  • citation-verification
  • obsidian-literature-workflow
  • zotero-obsidian-bridge
  • obsidian-source-ingestion

citation-verification

用于检查:

  • 论文是否真实存在;
  • 题名、作者和年份是否匹配;
  • DOI 是否正确;
  • arXiv 信息是否一致;
  • 引用格式是否完整;
  • 是否存在张冠李戴;
  • 论文内容是否支持当前陈述。

它强调优先使用:

  • arXiv;
  • DOI 和 Crossref;
  • Semantic Scholar;
  • 出版社页面;
  • Zotero 元数据。

需要注意:

Google Scholar 可以用于发现论文,但通常不应作为最终元数据核验的唯一来源。

Zotero 与 Obsidian 工作流

Claude Scholar 可以将文献管理和长期科研笔记连接起来:

论文发现
   ↓
Zotero 导入
   ↓
PDF 与元数据
   ↓
结构化论文笔记
   ↓
Obsidian 知识库
   ↓
研究问题、实验和论文写作

这部分属于进阶能力,不是使用 Claude Scholar 的必要条件。


3. 实验与结果分析

代表技能:

  • results-analysis
  • results-report
  • publication-chart-skill
  • kaggle-learner

results-analysis

这是 Claude Scholar 中比较有价值的技能之一。

它负责:

  • 检查实验输入是否完整;
  • 整理不同算法和数据集的结果;
  • 进行严格统计分析;
  • 生成科研图表;
  • 建立可用于论文写作的分析材料。

在输入充分时,它预期生成:

analysis-report.md
stats-appendix.md
figure-catalog.md
figures/

它还明确限制:

  • 数据不足时不应生成伪造图片;
  • 统计输入无效时不能直接下结论;
  • 审查模式下不应随意修改文件;
  • 不能替代论文 Results 部分的正式写作。

results-report

results-report 位于 results-analysis 之后。

两者的分工是:

技能负责什么
results-analysis统计分析、真实图表、证据和分析附件
results-report实验复盘、决策总结和下一轮实验建议

这种拆分比让一个提示词同时完成“统计、绘图、解释、写论文”更加可靠。

publication-chart-skill

用于生成论文级图片和表格,主要围绕:

  • pubfig:论文图片;
  • pubtab:论文表格和 Excel/LaTeX 转换。

它适合处理:

  • 预算—性能曲线;
  • 多数据集算法比较;
  • 消融实验图;
  • 论文结果表;
  • Excel 到 LaTeX 的转换;
  • 现有图表的质量检查。

4. 论文写作与投稿

代表技能:

  • ml-paper-writing
  • paper-self-review
  • review-response
  • post-acceptance
  • latex-conference-template-organizer
  • writing-anti-ai

ml-paper-writing

主要面向:

  • NeurIPS;
  • ICML;
  • ICLR;
  • ACL;
  • AAAI;
  • COLM。

它包含:

  • 论文结构;
  • LaTeX 模板;
  • 引用核验;
  • Related Work;
  • 方法与实验写作;
  • Camera-ready 检查。

如果你的目标是机器学习或人工智能会议,这个技能比较有价值。但如果主要撰写中文学位论文,仍然需要结合学校模板和中文学术写作规范。

paper-self-review

用于投稿前系统自查,包括:

  • 论文结构是否完整;
  • 研究动机是否清楚;
  • 方法能否复现;
  • 结果是否支持结论;
  • 是否存在逻辑跳跃;
  • 是否遗漏重要基线;
  • 是否存在过度宣称;
  • 局限性是否充分。

review-response

用于处理审稿意见:

  1. 解析审稿意见;
  2. 区分 Major、Minor、Typo 和 Misunderstanding;
  3. 决定接受、解释、补实验还是合理辩护;
  4. 生成逐条回复;
  5. 检查语气;
  6. 确保回复与论文修改一致。

writing-anti-ai

这个名字容易引发误解。

更合理的使用方式是:

  • 删除机械化套话;
  • 减少重复句式;
  • 改善论证连贯性;
  • 让文字更符合作者原本的表达习惯。

不应把它用于规避学术诚信检查,也不能把 AI 生成内容伪装成未经 AI 辅助的原创研究。最终仍应遵守学校、期刊和会议的 AI 使用政策。


5. 科研知识管理

代表技能:

  • planning-with-files
  • obsidian-project-kb-core
  • obsidian-kb-artifacts
  • session-wrap-up

它们试图解决一个常见问题:

AI 完成了一次很有价值的分析,但结论只存在于某个聊天窗口中,过几周就无法找到。

Claude Scholar 建议把长期研究信息保存到文件系统中,例如:

Sources/Papers/
Knowledge/
Experiments/
Results/
Results/Reports/
Writing/
Daily/
Maps/

这种方式比较适合持续数月甚至数年的研究项目。


6. 软件开发能力

Claude Scholar 还包含:

  • architecture-design
  • bug-detective
  • code-review-excellence
  • git-workflow
  • verification-loop
  • webapp-testing
  • daily-coding

这些技能适合科研代码开发,但并非所有科研人员都需要安装。已经有成熟开发类 Skills 的用户,可以跳过这一组。


六、哪些人适合使用 Claude Scholar?

比较适合

Claude Scholar 尤其适合:

  • 人工智能和机器学习研究者;
  • 计算机科学研究生;
  • 需要同时处理文献、代码、实验和论文的人;
  • 使用 Codex 或 Claude Code 开发科研代码的人;
  • 希望建立长期科研知识库的人;
  • 经常分析多算法、多数据集实验的人;
  • 正在准备论文投稿、返修或 Rebuttal 的人。

不一定适合

以下用户未必需要完整安装:

  • 只偶尔使用 AI 润色句子;
  • 不需要代码和实验;
  • 不希望 AI 读取本地文件;
  • 已经建立成熟且封闭的科研流程;
  • 不愿意检查 AI 生成的文献和统计结果;
  • 希望安装后完全无人监督地自动做科研。

Claude Scholar 可以提高工作效率,但不能替代研究者承担学术责任。


七、安装前需要准备什么?

本文以 macOS 和 Codex 为例。Linux 的操作基本相同,Windows 用户建议使用 Git Bash 或 WSL。

1. Codex

检查 Codex 是否可用:

codex --version

如果能够显示版本号,说明 Codex 已安装。

2. Git

检查 Git:

git --version

3. Python 和 uv

部分实验、统计和绘图技能需要 Python。

python3 --version
uv --version

Python 和 uv 并不是所有技能的强制要求,但涉及实验分析和绘图时通常需要。

4. 检查现有 Codex 配置

在安装之前,先查看以下位置:

~/.codex/config.toml
~/.codex/skills/
~/.codex/agents/
~/.codex/AGENTS.md

重点检查:

  • 是否已经安装其他 Skills;
  • 是否存在同名技能;
  • 是否已经配置 MCP;
  • 是否有自己的全局 AGENTS.md
  • 是否使用自定义模型服务商;
  • 是否有不能覆盖的配置。

如果你已经长期使用 Codex,建议优先采用后文的“选择性安装”。


八、三种安装方案怎么选?

方式适合谁风险
完整安装全新环境,希望使用全部工作流会增加全局规则和大量技能
最小安装希望获得核心科研流程仍需检查同名目录
选择性安装已有 Codex 配置和其他技能需要自己记录安装内容

我的默认建议是:

新用户可以考虑完整安装;已有成熟 Codex 环境的用户优先选择性安装。


九、方案一:完整安装

官方 Codex 分支的安装方式是:

git clone -b codex \
  https://github.com/Galaxy-Dawn/claude-scholar.git \
  /tmp/claude-scholar

bash /tmp/claude-scholar/scripts/setup.sh

其中:

  • -b codex 表示获取 Codex 专用分支;
  • /tmp/claude-scholar 是临时存放项目的位置;
  • setup.sh 是安装程序。

安装程序会处理:

  • skills/
  • agents/
  • scripts/
  • utils/
  • templates/
  • config.toml
  • AGENTS.md
  • 可选 Zotero MCP。

安装程序如何处理现有配置?

当前安装脚本具有一定的保护机制:

  • 检测现有 config.toml
  • 尽量保留现有模型和服务商;
  • 检测现有 auth.json
  • 修改前创建备份;
  • 对仓库管理的文件生成清单;
  • 保存安装状态;
  • 为安全卸载记录文件归属。

如果已经存在 ~/.codex/AGENTS.md,安装程序会保留原文件,并将 Claude Scholar 版本保存成类似:

AGENTS.scholar.md

用户需要人工阅读并合并需要的内容。这个 Sidecar 文件不会自动全部生效。

如果原来不存在 AGENTS.md,完整安装可能创建全局规则文件,从而影响之后的所有 Codex 任务。

安装完成后

关闭并重新打开 Codex,然后检查:

~/.codex/skills/
~/.codex/agents/
~/.codex/config.toml

不要立即启用所有 MCP,也不要把真实论文和敏感数据作为第一个测试任务。


十、方案二:选择性安装

如果你已经安装其他科研技能,我更推荐只安装 Claude Scholar 中最有价值的一部分。

第一批建议选择:

research-ideation
citation-verification
results-analysis
results-report
paper-self-review
review-response
publication-chart-skill

第一步:获取 Codex 分支

git clone --depth 1 -b codex \
  https://github.com/Galaxy-Dawn/claude-scholar.git \
  /tmp/claude-scholar

第二步:检查同名技能

逐个查看以下目录是否已经存在:

~/.codex/skills/research-ideation
~/.codex/skills/citation-verification
~/.codex/skills/results-analysis
~/.codex/skills/results-report
~/.codex/skills/paper-self-review
~/.codex/skills/review-response
~/.codex/skills/publication-chart-skill

如果存在,不要直接覆盖。应先比较来源、版本和内容。

第三步:创建技能目录

mkdir -p "$HOME/.codex/skills"

第四步:复制需要的技能

cp -R /tmp/claude-scholar/skills/research-ideation \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/citation-verification \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/results-analysis \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/results-report \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/paper-self-review \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/review-response \
  "$HOME/.codex/skills/"

cp -R /tmp/claude-scholar/skills/publication-chart-skill \
  "$HOME/.codex/skills/"

选择性安装不会自动写入完整安装程序的卸载清单。因此,应记录自己复制了哪些目录。

不建议第一批安装什么?

建议暂时跳过:

  • 与现有环境同名的 Skills;
  • 全局 AGENTS.md
  • expression-skill
  • planning-with-files
  • 前端和 Web 开发技能;
  • Zotero MCP;
  • Obsidian 工作流;
  • 所有专门 Agents。

等核心技能验证通过,再逐步扩展。


十一、如何确认安装成功?

安装完成后,重新启动 Codex。

测试一:读取技能

输入:

请读取 $citation-verification。

告诉我:
1. 这个技能适用于什么任务;
2. 它推荐的核验流程是什么;
3. 它需要哪些数据源;
4. 它在什么情况下不能给出确定结论。

本次只做说明,不修改任何文件。

如果 Codex 能够识别并读取该技能,说明基础安装成功。

测试二:小规模引用核验

输入一条已经知道答案的真实参考文献:

请使用 $citation-verification 核验下面这条参考文献。

要求:
1. 检查题名、作者、年份和 DOI;
2. 至少使用两个可验证来源;
3. 区分已核验字段和无法核验字段;
4. 不得根据模型记忆补充信息。

测试三:只读实验审查

准备一个小型 CSV,然后输入:

请使用 $results-analysis 检查这个实验结果文件。

本次使用只读审查模式:
1. 不修改原文件;
2. 不生成论文结论;
3. 只检查数据结构是否足以支持统计分析;
4. 列出缺失信息和下一步建议。

如果技能在输入不完整时主动报告限制,而不是编造分析结果,说明它的边界发挥了作用。


十二、实战一:从研究方向到候选研究点

下面以主动学习研究为例。

研究方向

在序分类任务中,如何利用标签顺序信息,在有限成本下主动获取缺失特征?

不要直接要求:

帮我生成十个创新点。

这容易得到大量看似新颖、实际上缺乏文献证据的组合式 idea。

更合理的提示词是:

请使用 $research-ideation 帮助我研究以下方向:

在序分类任务中,如何利用标签顺序信息,
在有限预算下主动获取缺失特征?

请依次完成:

1. 定义问题边界;
2. 区分主动学习、主动特征获取、特征选择和缺失值填补;
3. 使用 5W1H 梳理研究问题;
4. 提出不超过三个候选研究假设;
5. 为每个假设列出需要检索的证据;
6. 指出最接近的已有研究方向;
7. 为每个假设设计证伪条件;
8. 不要把未经文献验证的想法称为创新点;
9. 给出下一步最小可执行任务。

预期输出

Claude Scholar 应帮助形成:

  • 研究对象;
  • 输入和输出;
  • 获取预算;
  • 特征成本模型;
  • 标签顺序信息的使用位置;
  • 候选研究假设;
  • 所需文献证据;
  • 可能证伪假设的条件;
  • 下一步检索任务。

例如,一个候选假设可以写成:

在具有类别顺序结构的数据中,将序关系引入特征获取效用估计,可能在相同预算下减少远距离分类错误。

但这还不能直接写成创新点。

下一步需要验证:

  • 是否已有方法使用序关系指导特征获取;
  • 已有方法使用的是普通分类不确定性还是序分类损失;
  • 是否已经存在相同效用函数;
  • 标签顺序信息只是用于分类器,还是直接进入获取策略;
  • 现有方法在哪些条件下失效。

接着进行引用核验

请使用 $citation-verification 检查候选文献表。

要求:
1. 逐条核验题名、作者、年份、venue 和 DOI;
2. 记录核验来源;
3. 标记无法确认的信息;
4. 检查论文是否真的讨论主动特征获取;
5. 区分论文真实存在和论文支持当前结论;
6. 不得补造缺失字段。

建立证据矩阵

最终可以形成:

文献问题设置获取对象是否考虑成本是否利用序信息理论结果局限
Paper A普通分类特征未考虑标签顺序
Paper B序分类标签不获取特征
Paper C缺失数据特征成本模型缺失

真正的研究空白应该来自文献矩阵中的结构性差异,而不是简单判断某两个关键词从未同时出现。


十三、实战二:严格分析机器学习实验

假设已经完成三种算法的实验:

experiments/
├── dataset_a/
│   ├── random.csv
│   ├── uncertainty.csv
│   └── proposed.csv
├── dataset_b/
│   ├── random.csv
│   ├── uncertainty.csv
│   └── proposed.csv
├── metadata.yaml
└── README.md

其中:

  • random:随机获取特征;
  • uncertainty:基于不确定性的获取方法;
  • proposed:待验证方法。

第一步:先做输入审查

请使用 $results-analysis 审查 experiments 目录。

先不要写论文结论,也不要自动补齐缺失数据。

请检查:

1. 数据集名称是否完整;
2. 算法名称是否一致;
3. 不同算法是否使用相同随机种子;
4. 每个预算点是否有足够重复实验;
5. 指标方向是否明确;
6. 是否存在缺失值、重复值和异常值;
7. 当前数据是否足以进行配对统计检验;
8. 还缺少哪些元数据。

如果输入不完整,应先解决数据问题,再进入统计分析。

第二步:正式分析

请使用 $results-analysis 分析实验结果。

研究问题:
在相同特征获取预算下,Proposed 是否优于
Random 和 Uncertainty?

要求:
1. 比较不同预算点的 Macro-F1;
2. 报告均值、标准差和置信区间;
3. 判断实验是否属于配对设计;
4. 选择合适的统计检验;
5. 检查统计检验假设;
6. 进行必要的多重比较校正;
7. 报告效应量;
8. 区分统计显著性和实际提升;
9. 生成预算—性能曲线;
10. 对证据不足的结论明确降级。

为什么要报告效应量?

假设某方法在大样本条件下提高了 0.1%,统计上可能显著,但实际价值可能很小。

因此,不能只报告:

p < 0.05

还要回答:

  • 提升幅度有多大?
  • 置信区间多宽?
  • 是否在多个数据集上稳定?
  • 是否只在某个预算点有效?
  • 计算成本是否显著增加?
  • 是否值得为这点提升引入复杂模型?

第三步:生成实验复盘

完成严格分析后再调用:

请使用 $results-report,
基于现有分析材料写一份实验复盘报告。

报告需要回答:

1. 哪些结论已经比较稳定;
2. 哪些结果只在部分数据集成立;
3. 哪些实验存在异常;
4. 当前最强的反证是什么;
5. 哪些补充实验最可能改变结论;
6. 下一轮实验的优先级;
7. 当前是否已经具备论文写作条件。

这份报告不是论文 Results 部分,而是帮助研究者决定下一步做什么。


十四、实战三:投稿前论文自查

在投稿前,可以依次执行三类检查。

第一步:引用核验

请使用 $citation-verification 检查论文参考文献。

需要分别检查:

1. 正文引用是否在参考文献中存在;
2. 参考文献是否在正文中被引用;
3. 题名、作者、年份和 DOI 是否匹配;
4. 是否存在重复文献;
5. 是否存在真实论文与错误题名拼接;
6. 每条关键引用是否真的支持当前陈述;
7. 无法核验的引用必须单独列出。

第二步:论文自查

请使用 $paper-self-review 审查这篇论文。

重点检查:

1. 摘要是否包含定量结果;
2. 引言是否清楚定义研究缺口;
3. 贡献是否与实验和理论一致;
4. 方法描述是否足以复现;
5. 是否遗漏强基线;
6. 消融实验是否支持模块设计;
7. 结论是否存在过度宣称;
8. 局限性是否充分;
9. 图表是否能独立理解;
10. 给出 Major、Minor 和 Optional 三类修改建议。

第三步:模拟审稿

可以进一步要求从审稿人角度提出反对意见:

请从严格机器学习审稿人的角度审查论文。

不要帮助作者辩护,先寻找最可能导致拒稿的问题:

1. 新颖性是否不足;
2. 问题设置是否不现实;
3. 理论假设是否过强;
4. 基线是否不充分;
5. 实验规模是否太小;
6. 统计分析是否不严谨;
7. 是否存在数据泄漏;
8. 结论是否超过证据;
9. 哪些问题必须通过补实验解决。

收到真实审稿意见后

请使用 $review-response 处理这些审稿意见。

先不要直接写回复信。

请先:

1. 拆分每一条评论;
2. 判断是 Major、Minor、Typo 还是 Misunderstanding;
3. 判断应接受、解释、补实验还是合理辩护;
4. 找出评论之间的依赖关系;
5. 给出修改论文和回复审稿人的对应计划;
6. 标记需要作者决定的地方。

确认策略后,再让它生成逐条回复。


十五、Zotero 集成:让文献管理进入工作流

Claude Scholar 可以通过 Zotero MCP 访问文献库。

它适合:

  • 通过 DOI、arXiv 或 URL 导入论文;
  • 管理文献集合;
  • 获取 PDF;
  • 读取全文;
  • 生成结构化论文笔记;
  • 清理重复文献;
  • 导出引用信息。

Zotero 是可选组件。即使不安装 Zotero,Claude Scholar 的核心 Skills 仍然可以使用。

安装 Zotero MCP

项目安装脚本给出的安装方式为:

uv tool install --reinstall \
  git+https://github.com/Galaxy-Dawn/zotero-mcp.git

安装后仍需在 config.toml 中正确配置 Zotero 信息。

安全提醒

配置文件可能涉及:

  • Zotero API Key;
  • Library ID;
  • 用户或群组类型;
  • Unpaywall 邮箱;
  • 写入权限。

不要把 API Key:

  • 写进论文仓库;
  • 上传到 GitHub;
  • 复制到公开截图;
  • 提交到公开配置文件。

Claude Scholar 的模板中可能包含较宽泛的操作权限。不了解权限含义时,应保持 MCP 禁用,从只读测试开始。

EndNote 用户怎么办?

Claude Scholar 当前主要围绕 Zotero 进行深度集成,没有同等级的 EndNote 原生工作流。

EndNote 用户仍然可以:

  • 导出 RIS;
  • 导出 BibTeX;
  • 导出 XML;
  • 将文献表格提供给 Codex;
  • 使用 citation-verification 核验文献信息。

但自动导入、PDF 管理和知识库联动能力可能不如 Zotero 流程完整。


十六、Obsidian 集成:建立长期科研记忆

对持续数月的项目,聊天记录不是理想的科研知识库。

Claude Scholar 提供以文件系统为核心的 Obsidian 工作流:

Sources/Papers/
Knowledge/
Experiments/
Results/
Results/Reports/
Writing/
Daily/
Maps/

Sources/Papers

保存:

  • 论文笔记;
  • 原始来源;
  • 可核验摘录;
  • 文献元数据。

Knowledge

保存:

  • 已经得到充分支持的概念;
  • 稳定的方法知识;
  • 可以跨实验复用的结论。

Experiments

保存:

  • 实验假设;
  • 配置;
  • 运行记录;
  • 失败原因;
  • 下一步行动。

Results

保存:

  • 原始结果;
  • 汇总表;
  • 统计分析;
  • 图表;
  • 实验报告。

Writing

保存:

  • 论文大纲;
  • 章节草稿;
  • 待核验论点;
  • 投稿材料。

Daily

保存每天的:

  • 研究进展;
  • 当前阻塞;
  • 新发现;
  • 下一步任务。

这种设计的优点是,研究记忆属于用户自己的文件,而不是只存在于某个 AI 平台中。

但它也带来维护成本。如果你不使用 Obsidian,或者研究项目比较短,可以暂时跳过。


十七、完整安装可能带来哪些影响?

这是安装前必须了解的部分。

1. 全局 AGENTS.md

Claude Scholar 的 AGENTS.md 会规定:

  • 默认表达方式;
  • 复杂任务的规划方式;
  • 哪些任务应路由到哪些技能;
  • 如何报告文件修改;
  • 如何记录长期任务;
  • 如何使用 Obsidian 知识库。

这些规则会影响很多 Codex 任务,不仅仅是科研任务。

2. 同名技能覆盖

如果已经安装:

nature-writing
nature-polishing
nature-response
nature-data

或者其他同名 Skill,完整安装可能写入 Claude Scholar 自带版本。

虽然官方安装程序会备份现有文件,但仍应在安装前比较版本。

3. config.toml 合并

安装程序会尝试保留现有模型、服务商和认证信息,并添加缺失的 Agent 或 MCP 配置。

但任何自动合并配置的操作都值得人工检查。安装后应对比:

config.toml
config.toml.bak

4. 外部服务

某些工作流需要:

  • Zotero;
  • OpenAlex;
  • Crossref;
  • Semantic Scholar;
  • arXiv;
  • 其他论文或数据服务。

Skill 本身并不会自动赋予网络访问、API Key 或数据库权限。


十八、如何更新和卸载?

更新完整安装

如果最初保留了仓库目录,可以运行:

cd /tmp/claude-scholar
git pull --ff-only
bash scripts/setup.sh

更新前仍然建议阅读项目更新日志。

预览卸载

官方卸载脚本支持只读预览:

cd /tmp/claude-scholar
bash scripts/uninstall.sh --dry-run

确认目标无误后再正式卸载:

bash scripts/uninstall.sh

完整安装程序会记录:

~/.codex/.codex-scholar-manifest.txt
~/.codex/.codex-scholar-install-state

卸载程序依赖这些文件判断哪些内容属于 Claude Scholar。

如果采用手动选择性安装,则需要根据自己的安装记录逐个处理,不应假设完整卸载脚本一定知道这些文件的归属。


十九、Claude Scholar 与其他科研技能库有什么区别?

项目主要强项更适合
Claude Scholar连续科研项目、实验、证据与知识管理AI/ML 和计算机研究者
Academic Research Suite深度研究、文献综述、论文和审稿通用学术研究
Scientific Agent Skills科学软件、数据库与专业分析工具生物、医学、化学和 AI for Science
AI Research SkillsML 工程、训练、评估和顶会写作AI/ML 工程实验

Claude Scholar 的特点不是单项能力最多,而是比较重视科研项目的连续性:

研究点不是单独生成的
实验不是单独运行的
图表不是单独绘制的
论文也不是脱离证据直接写出的

它试图把这些工作放到同一条科研链路中。


二十、Claude Scholar 的优点

1. 非常贴近 AI/ML 研究流程

它覆盖了:

  • 文献;
  • 代码;
  • 实验;
  • 统计;
  • 图表;
  • 写作;
  • Rebuttal。

2. 强调证据边界

它要求区分:

  • 已核验事实;
  • 根据证据作出的推断;
  • 尚未验证的假设。

3. 重视实验产物

不是只输出一段聊天总结,而是鼓励保存:

  • 分析报告;
  • 统计附件;
  • 图表目录;
  • 实验复盘;
  • 论文笔记。

4. 支持长期项目

Zotero 和 Obsidian 可以让文献与研究记忆持续积累。

5. 专门适配 Codex

Codex 分支提供了独立配置、安装脚本和调用方式,不需要强行使用 Claude Code 的命令系统。


二十一、Claude Scholar 的局限

1. 它不是全自动科研系统

仍然需要研究者决定:

  • 问题是否重要;
  • 文献是否相关;
  • 假设是否合理;
  • 实验是否充分;
  • 结论是否可信。

2. 数学定理能力有限

它没有完整的“自动发现并证明新定理”系统。

它可以帮助:

  • 梳理定义;
  • 检查推导;
  • 寻找反例;
  • 使用 SymPy;
  • 分解证明任务。

但新定理的发现和严格证明仍需人工验证。

3. 安装范围较大

完整安装不仅增加科研技能,还会增加:

  • 全局规则;
  • 开发技能;
  • Agent 配置;
  • Zotero 配置;
  • Obsidian 工作流。

已有复杂 Codex 环境的用户需要谨慎。

4. 部分能力与其他技能库重复

例如论文写作、Nature 风格写作和代码开发技能,可能已经通过其他技能库安装。

5. 外部数据库仍有不确定性

可能遇到:

  • API 频率限制;
  • 网络不可用;
  • 元数据错误;
  • PDF 无法访问;
  • API Key 缺失。

数据库访问失败时,AI 不应根据记忆补造结果。


二十二、常见问题

问:不使用 Zotero,可以用吗?

可以。Zotero 是进阶集成,不是基础 Skills 的必要条件。

问:不使用 Obsidian,可以用吗?

可以。只是长期科研记忆和知识库功能会减弱。

问:为什么 Codex 中看不到 Slash Command?

Codex 分支主要通过自然语言和 $skill-name 调用,不依赖 Claude Code 的斜杠菜单。

问:安装后会自动发现研究创新点吗?

它可以提出候选研究空白,但必须通过系统文献检索和实验验证。不能把 AI 生成的候选想法直接写成论文创新点。

问:能自动完成博士论文吗?

不能可靠地自动完成。它更适合协助拆解、整理、检查和执行其中可以标准化的工作。

问:能保证参考文献不出错吗?

不能。它能提供更严格的核验流程,但最终仍应检查 DOI、出版社页面和论文原文。

问:能直接相信统计检验结果吗?

不能。应保留分析脚本、原始数据和软件版本,并重新运行验证。

问:应该一次安装全部技能吗?

已有 Codex 环境的用户不建议这样做。先安装 5~8 个核心技能更加稳妥。


二十三、它适合主动学习研究者吗?

我的判断是:

很适合,但它提供的是科研工作流,而不是主动学习算法大全。

对主动学习、主动特征获取和序分类研究者,它可以帮助:

  • 系统检索文献;
  • 建立概念边界;
  • 形成文献矩阵;
  • 发现候选研究空白;
  • 设计基线和消融实验;
  • 管理多次实验;
  • 进行统计比较;
  • 绘制学习曲线和预算曲线;
  • 检查论文结论;
  • 准备审稿回复。

它不能直接保证:

  • 某个 idea 从未有人提出;
  • 某个数学定理一定成立;
  • 某个算法一定优于现有方法;
  • 某篇 AI 生成论文可以投稿;
  • 某个实验结果具有充分学术价值。

对于主动学习研究,最推荐的初始组合是:

research-ideation
citation-verification
results-analysis
results-report
publication-chart-skill
paper-self-review
review-response

如果目标是 ICML、NeurIPS、ICLR 或 AAAI,再考虑增加:

ml-paper-writing
latex-conference-template-organizer

二十四、是否值得安装?

推荐安装

如果你:

  • 经常使用 Codex 进行科研;
  • 研究方向是 AI、ML 或计算机科学;
  • 需要同时处理文献、代码、实验和论文;
  • 愿意检查 AI 生成结果;
  • 希望建立长期科研流程。

建议选择性安装

如果你:

  • 已经安装多个科研 Skill;
  • 已经有自己的 AGENTS.md
  • 已经配置多个 MCP;
  • 只需要实验分析或引用核验;
  • 不使用 Zotero 和 Obsidian。

暂时不建议安装

如果你:

  • 只需要简单问答或语言润色;
  • 不希望 AI 访问本地研究文件;
  • 无法检查代码和统计结果;
  • 希望安装后完全自动完成科研;
  • 正在处理不允许进入外部模型的敏感数据。

二十五、总结

Claude Scholar 最有价值的地方,不是它拥有 45 个技能,而是它试图建立一套更接近真实科研的工作方式:

先定义问题
再寻找证据
然后设计实验
严格分析结果
控制结论强度
最后进行写作

它不会自动让 Codex 变成真正的科学家,也不能替代研究者阅读论文、判断创新性和验证数学证明。

但它能够帮助 Codex 从“临时回答问题的聊天助手”,逐渐变成一个具有流程意识、证据意识和项目记忆的科研助手。

如果你已经在使用 Codex,我的建议是:

  1. 不要直接完整安装;
  2. 先选择 5~8 个核心科研技能;
  3. 使用公开数据和非敏感论文进行测试;
  4. 检查技能是否真正遵守证据和统计边界;
  5. 再决定是否启用 Zotero、Obsidian 和全局 Agent;
  6. 根据自己的研究方向编写专用 Skill。

真正理想的状态不是让 AI 取代研究者,而是:

让研究者把精力放在问题定义、理论创新和科学判断上,把可以标准化、记录和验证的工作交给 AI Agent。

这可能才是 Claude Scholar 对科研工作最现实的意义。


参考链接

本文依据 2026 年 7 月公开仓库和 Codex 分支整理。项目仍在持续更新,技能数量、配置格式和安装方法可能变化。实际安装前请再次阅读官方 README,并对重要配置做好备份。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

代码转载自:https://pan.quark.cn/s/a4b39357ea24 在本项研究中,我们研究了如何运用8155微处理器扩展单元74LS164串行到并行转换电路来操控八段数码管的显示。74LS164被视为一个核心部件,它使得串行数据能够转化为并行输出,这对于驱动数码管极为关键,因为数码管普遍需要并行数据输入来点亮不同的段。74LS164的功能机制在于接收串行输入的数据,并在每个时钟脉冲之后将其转化为并行输出。在该配置中,8155的PB0引脚被用来管理数据位的输入,而PB1则承担时钟信号的角色。这表明我们可以通过调控8155的这两个引脚来决定何时将数据传输至74LS164,以及何时执行位移操作。 在编程层面,我们需要开发一段代码来处理上述流程。在提供的代码示例中,`DAT164`标识数据位地址,`CLK164`指代时钟位地址。`LEDBuf`是一个用于存放待显示数字的缓冲存储区,而`Num`则用于保存待显示的数值。`DisplayLED`子程序负责将数据从缓冲区`LEDBuf`搬运到74LS164,并通过8155的PB0和PB1引脚来调控74LS164的输入时钟。 在`DisplayLED`子程序的操作中,首先会关闭所有的八段数码管,然后逐位从缓冲区`LEDBuf`中读取数据,通过循环右移指令(`rlc`)进行数据位移,并将最低位送入74LS164。在每次数据传输完成后,会通过变换PB1的电平(交替高低电平)来生成时钟脉冲,使74LS164能够接收新的数据。这一过程会重复8次,确保所有8段数码管的段码都被精确设置。通过调整`OUTBIT`的值来选择特定的数码管进行显示。 另外,实验还包含了8155 I/O/RAM扩展单元的应用。8155芯片提供...
内容概要:本文系统研究了计及电动汽车充电站接入的配电网承载能力评估优化问题,提出了一套完整的基于Matlab代码实现的双层评价模型。通过构建涵盖系统安全性、经济性、电能质量及设备利用率等多维度的指标体系,采用熵权法进行客观权重计算,并结合模糊综合评价法实现承载能力的量化评分,全面评估不同渗透率下电动汽车接入对配电网的影响。研究通过算例仿真深入分析了各项指标的变化规律灵敏度特性,验证了所提模型在承载能力动态评估中的科学性实用性,为高比例电动汽车接入背景下的配电网规划、扩容改造运行调度提供了有力的决策支持和技术路径。; 适合人群:具备电力系统分析基础、熟悉Matlab编程工具,从事新能源并网、智能配电网、电动汽车电网互动(V2G)、电网承载力评估等相关领域的科研人员、工程技术人员及研究生。; 使用场景及目标:①科学评估大规模电动汽车充电负荷对配电网安全稳定运行的冲击及其承载极限;②优化充电站选址接入策略以提升电网接纳能力;③为配电网的扩容规划、无功优化调度运行提供量化的分析依据;④支撑相关科研项目、学位论文的建模、仿真实证分析工作。; 阅读建议:建议结合文中提供的Matlab代码详细的仿真算例进行复现,重点掌握熵权法确定权重模糊综合评价的实现逻辑,深入理解各评估指标的物理含义及其在不同场景下的灵敏度表现,并可尝试将其拓展应用于其他类型的分布式电源接入评估或采用不同的优化算法进行模型改进。
打开链接下载源码: https://pan.quark.cn/s/a4b39357ea24 UDP(用户数据报协议)TCP(传输控制协议)构成了互联网协议体系中的两大核心传输机制,它们在计算机网络通信过程中发挥着核心作用。本文将系统阐述这两种协议的特性以及相关的端口检测手段。 UDP是一种非连接型且不可信赖的传输协议。该协议无需建立连接即可传输数据,因此具备低时延高效率的优势,常应用于视频会议、在线游戏等即时性应用场景。然而,由于缺乏可靠性保障,UDP无法确保数据包的顺序性、完整性及无重复性,可能引发数据遗失或错乱的情况。 另一方面,TCP是一种基于连接且可靠的传输协议。该协议在数据传输前必须先建立连接,从而确保数据能够准确且有序地抵达接收端,适用于文件传输、网页浏览等对稳定性要求较高的应用场景。尽管如此,这种可靠性也导致了较高的时延和资源消耗。 端口在网络通信领域中占据着关键地位,每个端口号均特定的服务或应用程序相对应。端口号的取值范围介于0至65535之间,其中0-1023为知名端口,一般由系统进行预留使用;1024-49151为注册端口,可供应用程序选用;49152-65535为动态或私有端口。实施端口检测的主要目的是确认特定端口是否处于开放状态、是否已被占用,或是网络服务是否正常运作。 “UDP&TCP测试程序.exe”或许是一款用于检测UDP和TCP端口状态的实用工具,它能够协助用户评估网络连接的性能状况及潜在问题。此类工具通常具备以下几项功能: 1. 扫描:对指定的IP地址或IP地址段执行端口扫描,识别已开启的服务及其对应的端口。 2. 发送/接收数据:向特定端口发送UDP或TCP数据包,并记录接收到的响应,以此来验证端口的可用程度。 3. 连接测...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

牛魔小丸子

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值