从文献检索、实验设计、统计分析,到科研绘图与论文写作,一套面向科研人员的开源 Agent Skills 工具箱。
写在前面
如果你经常使用 ChatGPT、Codex、Claude Code 或 Cursor 辅助科研,可能遇到过这些问题:
- AI 能解释一个算法,却不一定知道如何设计严谨的对比实验;
- AI 能生成代码,却可能忽略数据泄漏、随机种子和统计显著性;
- AI 能搜索论文,却可能给出不存在的参考文献;
- AI 能画图,但生成的图片未必符合论文发表规范;
- AI 能润色论文,却无法判断研究结论是否真的得到实验结果支持;
- 同一个任务询问两次,AI 给出的工作流程可能完全不同。
造成这些问题的一个重要原因是:大语言模型拥有广泛的知识,却不一定掌握稳定、专业、可复现的科研操作流程。
假如我们能够把“如何检索文献”“如何设计实验”“如何进行统计检验”“如何绘制论文图片”等科研经验,整理成一份份标准操作规程,然后让 AI 在遇到相应任务时自动读取并执行,会发生什么?
这正是 Agent Skills 试图解决的问题。
本文要介绍的开源项目叫做 Scientific Agent Skills。它由 K-Dense-AI 维护,目标是为 Codex、Claude Code、Cursor 等 AI Agent 提供可复用的科研知识和工作流程。
截至 2026 年 7 月,官方仓库已经包含 148 个科研技能,涉及 100 多个科学数据库,覆盖机器学习、统计分析、科研写作、生物信息学、化学信息学、医学研究、科学可视化和实验室自动化等方向。Scientific Agent Skills 官方仓库
这篇文章将回答以下问题:
- Scientific Agent Skills 到底是什么?
- Skill 和普通提示词有什么区别?
- 它能够帮助科研人员完成哪些工作?
- 如何为 Codex、Claude Code 或 Cursor 安装这些技能?
- 机器学习研究者应该优先安装哪些技能?
- 如何用它完成文献综述和机器学习实验?
- 它有哪些局限、风险和使用边界?
一、Scientific Agent Skills 是什么?
Scientific Agent Skills 可以理解为一套面向 AI Agent 的“科研操作手册”。
它并不是一个新的大语言模型,也不会重新训练 Codex 或 Claude。它所做的事情,是把专业知识、操作步骤、代码示例、工具说明和检查规则组织成 AI Agent 可以读取的标准化文件。
一个最简单的 Skill 通常具有以下结构:
my-skill/
├── SKILL.md
├── scripts/
├── references/
└── assets/
其中:
SKILL.md是技能的核心说明;scripts可以存放能够直接运行的程序;references可以存放参考资料;assets可以存放模板、示例和其他资源。
Agent Skills 官方标准将其定义为一种轻量、开放的能力扩展格式。AI Agent 在启动时通常只读取技能名称和简介;当用户任务与某个技能匹配时,Agent 才读取完整的 SKILL.md,并根据需要调用脚本或参考资料。这种机制被称为“渐进式披露”。Agent Skills 官方说明
可以用一个简单的类比来理解:
大语言模型像一位知识面很广的研究助理,而 Skill 像实验室为研究助理编写的标准操作规程。
研究助理可能知道什么是交叉验证,但如果没有明确要求,他不一定会主动固定随机种子、检查类别不平衡、避免数据泄漏,也不一定会报告均值和标准差。
一个实验设计 Skill 则可以明确告诉他:
- 先定义研究问题和假设;
- 再确定自变量、因变量和控制变量;
- 设计训练集、验证集和测试集;
- 选择评价指标;
- 确定重复实验次数;
- 进行统计显著性检验;
- 检查实验能否复现;
- 最后再解释结果。
这就是 Skill 的核心价值:它不是单纯给 AI 增加知识,而是给 AI 增加一套更加稳定的工作方法。
二、Scientific Agent Skills 包含什么?
Scientific Agent Skills 不是一个单一技能,而是一个大型科研技能库。
官方当前将其能力划分为多个方向。
1. 机器学习与人工智能
包括:
- scikit-learn;
- PyTorch Lightning;
- Transformers;
- SHAP;
- PyMC;
- statsmodels;
- PyMOO;
- Stable Baselines3;
- Torch Geometric;
- UMAP;
- 时间序列分析;
- 生存分析;
- 强化学习。
这些技能不仅告诉 Agent 如何调用软件包,还可能包含推荐流程、常见错误、代码示例和结果解释方法。
2. 数据分析与科学可视化
包括:
- 探索性数据分析;
- 假设检验;
- 统计建模;
- 实验设计;
- 统计功效分析;
- Matplotlib;
- Seaborn;
- 科研绘图;
- 网络分析;
- 时间序列;
- 大规模数据处理;
- 地理空间数据分析。
对于大多数机器学习研究者来说,这一组技能比某些专业领域技能更加实用。
3. 文献检索与科研写作
包括:
- Paper Lookup;
- Literature Review;
- Citation Management;
- Scientific Writing;
- Peer Review;
- Paperzilla;
- 学术海报;
- 科研幻灯片;
- 科研示意图;
- 文档处理;
- 期刊和会议模板。
Paper Lookup 可以连接或利用 PubMed、arXiv、OpenAlex、Crossref、Semantic Scholar、CORE 和 Unpaywall 等论文资源。官方仓库还列出了更高级的论文检索、文献综述和引用管理工作流。项目技能目录
4. 生物信息学与基因组学
包括:
- RNA-seq;
- 单细胞数据分析;
- Biopython;
- Scanpy;
- scVelo;
- 变异注释;
- 系统发育分析;
- 基因调控网络;
- 通路富集分析。
这是整个项目目前非常重要的一部分。
5. 化学信息学与药物发现
包括:
- RDKit;
- DeepChem;
- Datamol;
- 分子性质预测;
- 分子对接;
- 虚拟筛选;
- ADMET 分析;
- 分子动力学;
- 蛋白质结构与功能分析。
6. 临床研究与医学数据
包括:
- 临床试验数据库;
- 药物安全信息;
- 医学影像;
- 临床决策支持;
- 生理信号分析;
- 临床报告;
- 治疗方案整理。
7. 材料、物理和工程计算
包括:
- SymPy;
- MATLAB/Octave;
- Qiskit;
- PennyLane;
- 天文学数据分析;
- 离散事件模拟;
- 多目标优化;
- 计算流体动力学;
- 材料结构分析。
8. 实验室自动化
包括:
- Opentrons;
- PyLabRobot;
- Benchling;
- Protocols.io;
- LabArchives;
- 云实验室工作流。
因此,Scientific Agent Skills 更像一个大型“AI for Science 工具箱”,而不是专门面向某一个研究方向的小型插件。
三、它和普通提示词有什么区别?
有读者可能会问:
我把实验步骤直接写到提示词里,不也能得到类似效果吗?
理论上当然可以。但普通提示词与 Skill 在复用性、组织方式和调用机制上存在明显区别。
| 普通提示词 | Agent Skill |
|---|---|
| 通常只服务于当前对话 | 可以在多个任务中重复使用 |
| 内容容易散落在聊天记录中 | 以独立文件和目录保存 |
| 需要用户每次重新描述要求 | Agent 可以根据任务自动发现 |
| 很难进行版本管理 | 可以通过 Git 进行版本管理 |
| 不容易附带大量参考资料 | 可以包含脚本、模板和文档 |
| 流程可能随回答发生变化 | 更适合保存固定操作规程 |
| 跨平台复用困难 | 可以被多个兼容 Agent 使用 |
普通提示词更像一次性的口头要求,Skill 更像经过整理的科研标准操作规程。
不过,这并不意味着安装 Skill 后,AI 就一定会完美执行任务。最终效果仍然受到以下因素影响:
- 模型本身的推理能力;
- Agent 是否支持执行代码和访问文件;
- 本地是否安装了所需依赖;
- 是否能够访问外部数据库;
- Skill 文档是否完整;
- 用户任务是否描述清楚;
- 研究数据是否可靠。
Skill 能提高流程的专业性和稳定性,但不能消除所有错误。
四、哪些人适合使用?
Scientific Agent Skills 比较适合以下人群:
1. 硕士生和博士生
如果你正在进行文献综述、实验设计、数据分析、绘图和论文写作,这套技能库可能帮助你建立更加完整的科研工作流。
2. 机器学习研究者
如果你需要频繁完成算法实现、基线对比、消融实验、统计检验和结果可视化,可以重点使用机器学习、实验设计、统计分析和科研绘图类技能。
3. 生物、医学和药物研究人员
这是该项目覆盖最深入的方向之一,已经包含大量相关数据库、软件包和分析流程。
4. 跨学科研究人员
跨学科研究经常需要同时使用多个领域的软件和数据库。Skill 可以帮助 AI Agent理解不同工具之间如何衔接。
5. 经常使用 Codex、Claude Code 或 Cursor 的科研人员
如果你已经习惯让 AI 读取文件、编写代码、执行程序和修改文档,那么 Agent Skills 的价值会更加明显。
以下人群则不一定适合立即安装:
- 只需要偶尔询问概念性问题;
- 完全不需要代码或数据分析;
- 不希望 AI 访问本地文件;
- 没有时间检查 AI 输出;
- 希望安装后完全无人监督地自动完成科研。
Scientific Agent Skills 是科研助手的操作手册,而不是无人监督的“自动发论文机器”。
五、安装前需要准备什么?
1. 一个支持 Agent Skills 的客户端
官方仓库列出的兼容工具包括:
- Codex;
- Claude Code;
- Cursor;
- Gemini CLI;
- Google Antigravity;
- Pi;
- OpenClaw;
- 其他支持开放 Agent Skills 标准的客户端。
本文主要以 Codex 为例。其他客户端的操作思路基本相同,但技能目录和界面可能不同。
2. Node.js 和 npx
官方推荐使用 npx skills 安装。一般情况下,安装 Node.js 后就会同时获得 npm 和 npx。
可以在终端中检查:
node --version
npm --version
npx --version
只要能够正常显示版本号,就说明相应工具已经可用。
3. GitHub CLI
如果希望使用 gh skill 安装,需要另外安装 GitHub CLI。
检查方法:
gh --version
官方说明要求 GitHub CLI 版本达到相应要求,旧版本可能没有 gh skill 功能。
4. Python 与 uv
Scientific Agent Skills 中的大量数据分析技能需要 Python 软件包。官方当前建议使用 uv 管理 Python 依赖。
需要注意:
安装一个 Skill,不等于已经安装它所涉及的全部 Python 软件包。
例如,安装 scikit-learn Skill 后,Agent 获得的是一套关于 scikit-learn 的操作知识。如果本地尚未安装 scikit-learn,真正执行代码时仍然需要安装相应依赖。
每个技能的要求可能不同,应优先阅读它自己的 SKILL.md。
六、如何安装 Scientific Agent Skills?
方法一:使用 npx 安装
官方推荐的跨平台安装命令是:
npx skills add K-Dense-AI/scientific-agent-skills
执行后,安装程序会获取仓库中的技能,并根据当前环境完成安装或让用户选择安装目标。
第一次运行时,系统可能询问是否允许安装相应的命令行工具。确认来源无误后,可以按照终端提示继续。
方法二:使用 GitHub CLI 安装
如果你的 GitHub CLI 支持 gh skill,可以使用:
gh skill install K-Dense-AI/scientific-agent-skills
这个命令适合交互式浏览和选择技能。
如果只想安装某一个技能,例如 Scanpy,可以使用:
gh skill install K-Dense-AI/scientific-agent-skills scanpy
如果要明确安装给 Codex,可以使用:
gh skill install K-Dense-AI/scientific-agent-skills --agent codex
安装给其他客户端时,可以修改 --agent 后面的名称。官方当前给出的示例包括:
gh skill install K-Dense-AI/scientific-agent-skills --agent cursor
gh skill install K-Dense-AI/scientific-agent-skills --agent claude-code
gh skill install K-Dense-AI/scientific-agent-skills --agent codex
gh skill install K-Dense-AI/scientific-agent-skills --agent gemini
以上命令来自项目当前的官方安装说明。由于项目持续更新,实际操作时应再次查看仓库 README。
安装完成后做什么?
安装完成后,建议依次进行以下操作:
- 关闭并重新打开 Codex 或相应客户端;
- 查看客户端是否识别到新技能;
- 找到目标技能目录;
- 打开该技能的
SKILL.md; - 阅读它会调用哪些软件、脚本和外部服务;
- 检查是否需要 Python 包或 API Key;
- 使用一个小任务测试技能。
不要一安装完成,就直接交给它处理重要论文或敏感数据。
七、为什么不建议一次安装全部技能?
看到 148 个技能,很多人的第一反应可能是:
全部安装,能力不是最完整吗?
我不建议这样做,官方目前也明确建议用户只安装真正需要的技能。
主要原因有四个。
1. 大量技能与你的研究方向无关
如果你研究的是主动学习,没有必要立即安装实验室液体处理、临床影像和分子对接等技能。
2. 不同技能需要不同依赖
某些技能需要额外的 Python 包、系统软件、数据库账号或 API Key。全部安装可能增加环境管理难度。
3. 技能来源和成熟度不完全相同
项目中既有 K-Dense-AI 维护的技能,也可能包含社区贡献内容。官方提醒用户在安装前阅读 SKILL.md 并检查技能来源。
4. 技能越多,越需要管理
Agent 启动时通常不会一次读取所有技能全文,但技能过多仍然会增加发现、选择、更新和安全审查的成本。
更合理的方法是:
从一个明确的科研任务出发,选择完成该任务所需的最小技能组合。
例如,你要做文献综述,可以先安装:
paper-lookup
literature-review
citation-management
scientific-writing
你要做机器学习实验,可以先安装:
experimental-design
scikit-learn
statistical-analysis
scientific-visualization
你要做贝叶斯建模,再增加:
pymc
statsmodels
你要解释模型,再增加:
shap
这比一次安装所有技能更加容易管理。
八、机器学习研究者优先安装哪些技能?
Scientific Agent Skills 中有大量生命科学技能,但机器学习研究者仍然可以找到一套实用组合。
第一组:文献研究
推荐:
paper-lookupliterature-reviewcitation-management
它们可以分别处理论文检索、综述整理和引用信息管理。
第二组:研究问题与实验设计
推荐:
scientific-brainstorminghypothesis-generationexperimental-designstatistical-power
它们可以帮助研究者梳理研究问题、生成可检验假设、设计对比实验和估计样本量。
需要特别注意:
AI 生成的研究点只能作为候选,不能直接视为真正的学术创新。必须通过系统文献检索和实验验证判断新颖性。
第三组:算法实现
推荐:
scikit-learnpytorch-lightningstatsmodelspymcpymoosympy
这组技能适合经典机器学习、深度学习、统计建模、贝叶斯推断、多目标优化和符号数学。
第四组:实验评价
推荐:
statistical-analysisexperimental-designstatistical-powershap
它们可以帮助进行显著性检验、实验设计、功效分析和模型解释。
第五组:论文输出
推荐:
scientific-visualizationscientific-writingpeer-reviewscientific-slidesvenue-templates
这组技能适合生成论文图片、组织论文内容、模拟审稿和准备汇报材料。
对于普通机器学习研究者,我建议第一批只选择大约 8~12 个技能,不必追求数量。
九、第一次测试:确认 Skill 是否真正生效
安装完成后,可以先用一个小任务测试。
例如:
请使用 experimental-design 和 scikit-learn 技能,
为一个多分类数据集设计基线实验。
要求:
1. 对比逻辑回归、随机森林和支持向量机;
2. 使用分层五折交叉验证;
3. 报告 Accuracy、Macro-F1 和训练时间;
4. 固定所有随机种子;
5. 检查数据泄漏;
6. 输出可以复现的 Python 代码;
7. 在执行前说明你使用了哪些技能以及原因。
观察 Agent 是否做到以下几点:
- 明确识别并读取目标技能;
- 在执行前说明实验设计;
- 将数据预处理放进交叉验证流程;
- 避免先对全部数据标准化再划分训练集;
- 固定随机种子;
- 同时报告均值和标准差;
- 给出可以实际运行的代码;
- 说明结果的适用范围。
如果 Agent 只是给出一段普通代码,没有体现 Skill 中规定的工作流程,可以进一步明确:
请先读取相关 SKILL.md,再开始设计实验。
请列出你从技能中采用的检查项。
还可以直接要求:
请告诉我哪些步骤来自技能说明,
哪些步骤是你根据当前任务补充的。
这样能够提高流程的透明度。
十、实战案例一:用 Skill 完成主动学习文献综述
下面设计一个与机器学习研究密切相关的案例。
研究主题
分类任务中的主动特征获取:如何同时考虑特征缺失、获取成本和预测不确定性?
这是一个涉及主动学习、缺失数据、成本敏感学习和特征选择的交叉问题。
建议使用的技能组合是:
paper-lookup
↓
literature-review
↓
citation-management
↓
scientific-writing
第一步:把研究主题转化为检索问题
不要只给 Agent 一句话:
帮我查找主动特征获取的论文。
更好的提示词是:
请使用 paper-lookup 和 literature-review 技能,
研究以下问题:
在分类任务中,主动特征获取方法如何同时处理:
1. 特征获取成本;
2. 未观测特征;
3. 标签或预测不确定性;
4. 不同特征之间的依赖关系?
要求:
1. 优先检索近五年的研究,同时保留奠基性论文;
2. 覆盖期刊论文、会议论文和可信预印本;
3. 记录题名、作者、年份、发表 venue、DOI 和网页链接;
4. 区分 active learning、active feature acquisition、
budgeted learning、cost-sensitive feature acquisition
和 missing-data imputation;
5. 不得编造论文;
6. 无法核验的信息必须单独标记。
第二步:建立概念边界
文献综述中一个常见问题,是把相近概念混在一起。
可以要求 Agent 先建立概念表:
| 概念 | 主要获取对象 | 典型目标 |
|---|---|---|
| 主动学习 | 样本标签 | 减少标注成本 |
| 主动特征获取 | 样本的未观测特征 | 在获取成本下提高预测性能 |
| 特征选择 | 全局特征子集 | 降维和提高泛化能力 |
| 缺失值填补 | 缺失特征值 | 恢复或估计完整数据 |
| 成本敏感学习 | 预测错误或信息获取成本 | 优化总体决策代价 |
这一步非常重要,因为如果概念边界不清楚,最终得到的文献列表会包含大量与研究主题只有表面关联的论文。
第三步:设计多轮检索式
可以让 Agent 生成多组检索式,而不是只使用一个关键词:
"active feature acquisition" AND classification
"cost-sensitive feature acquisition" AND missing data
"budgeted learning" AND feature acquisition
"sequential feature acquisition" AND classification
"test-time feature acquisition" AND uncertainty
"active sensing" AND classification AND feature cost
然后要求记录:
- 使用的数据库;
- 检索日期;
- 检索式;
- 返回结果数量;
- 纳入标准;
- 排除标准;
- 去重方法。
第四步:核验参考文献
这是不能完全交给 AI 的环节。
至少应核验:
- 论文是否真实存在;
- 作者信息是否正确;
- 年份是否正确;
- 会议或期刊是否正确;
- DOI 是否与题名匹配;
- 网页是否指向原论文;
- 论文内容是否真的支持当前结论。
要特别区分两种“正确”:
论文真实存在,不代表它支持你写下的那句话。
因此,在引用一篇论文之前,还应要求 Agent 提供:
- 支持该判断的摘要内容;
- 对应章节;
- 实验设置;
- 原文中的证据位置;
- Agent 对论文的概括是否属于推断。
第五步:建立文献矩阵
推荐让 Agent 输出以下字段:
| 字段 | 含义 |
|---|---|
| 文献编号 | 内部管理编号 |
| 题名 | 完整论文题名 |
| 作者 | 主要作者 |
| 年份 | 发表年份 |
| 问题设置 | 论文解决的问题 |
| 获取对象 | 标签、特征或其他信息 |
| 获取策略 | 如何选择下一项信息 |
| 成本模型 | 是否考虑不同获取成本 |
| 预测模型 | 使用的分类器 |
| 理论结果 | 是否有定理或误差界 |
| 数据集 | 实验数据 |
| 基线方法 | 对比对象 |
| 局限性 | 尚未解决的问题 |
| DOI/链接 | 核验入口 |
文献矩阵比普通摘要列表更适合发现研究空白。
第六步:发现候选研究点
在完成文献矩阵后,可以继续询问:
请基于已经核验的文献矩阵寻找候选研究空白。
要求:
1. 区分“文献没有讨论”和“理论上没有解决”;
2. 不得仅凭关键词缺失判断创新性;
3. 每个候选研究点都要列出最接近的已有工作;
4. 说明与已有工作的实质区别;
5. 给出可以验证该研究点的实验或理论问题;
6. 对新颖性置信度进行分级。
比较有价值的研究空白通常不是“没人把两个名词放在一起”,而是:
- 现有方法依赖某个不合理假设;
- 某类数据结构下方法失效;
- 理论保证与实际算法之间存在缺口;
- 获取成本模型过于简单;
- 缺乏对序分类、标签顺序或结构信息的利用;
- 实验只覆盖小规模或完全数据场景;
- 没有同时处理不确定性、成本和特征依赖。
Skill 可以帮助系统化整理这些问题,但研究者仍需阅读原文、验证新颖性并判断研究价值。
十一、实战案例二:设计主动特征获取实验
接下来设计一个机器学习实验案例。
研究问题
在有限特征获取预算下,利用分类不确定性和特征相关性的策略,是否优于随机获取和单纯成本优先策略?
建议使用:
experimental-design
↓
scikit-learn
↓
statistical-analysis
↓
scientific-visualization
↓
scientific-writing
第一步:要求 Agent 明确研究假设
提示词示例:
请使用 experimental-design 技能,
将下面的研究想法转化为可检验的实验假设:
在有限预算下,同时利用预测不确定性、
特征获取成本和特征相关性的主动特征获取方法,
比随机获取和成本优先方法具有更好的分类性能。
请明确:
1. 自变量;
2. 因变量;
3. 控制变量;
4. 零假设和备择假设;
5. 需要排除的混杂因素;
6. 可能导致结论不成立的条件。
第二步:确定实验对象
建议至少考虑三类数据集:
- 小规模公开分类数据集;
- 高维数据集;
- 具有类别不平衡或特征缺失的数据集。
如果研究的是序分类,还应选择标签具有自然顺序的数据集,并明确普通分类指标是否足够。
第三步:设置基线方法
至少包括:
- Random Acquisition:随机获取特征;
- Cheapest First:优先获取成本最低的特征;
- Global Importance:按全局特征重要性获取;
- Uncertainty Based:基于预测不确定性获取;
- Oracle 或近似上界:用于判断仍有多大提升空间;
- Proposed Method:待验证方法。
基线不能只选择明显较弱的方法。否则即使获得更好的结果,也难以证明方法的真正价值。
第四步:设计预算曲线
主动特征获取不能只比较一个预算点。
可以设置:
预算比例:
5%、10%、20%、30%、40%、50%、70%、100%
或者按照实际成本设置:
累计成本:
1、2、5、10、20、50
在每个预算点上分别计算模型性能,最终得到“预算—性能曲线”。
第五步:选择评价指标
普通分类可以考虑:
- Accuracy;
- Macro-F1;
- Balanced Accuracy;
- AUROC;
- 累计特征获取成本;
- 推理时间;
- 单位成本性能提升。
序分类还应考虑能够反映类别顺序的指标,例如:
- Mean Absolute Error;
- Mean Squared Error;
- 邻近类别误差;
- Kendall 或 Spearman 相关指标;
- 序分类专用损失。
如果只使用 Accuracy,模型把真实类别 1 预测为 2,与预测为 5 可能受到相同惩罚,这无法反映序信息。
第六步:控制随机性
建议要求:
1. 至少使用多个随机种子;
2. 对训练集划分、模型初始化和采样过程分别控制随机性;
3. 报告均值、标准差和置信区间;
4. 保存每一次实验的原始结果;
5. 记录 Python 和依赖版本。
不要只运行一次实验就进行显著性检验。
第七步:统计检验
可以让 Agent 根据实验结构选择检验方法,但不能直接接受它的第一建议。
需要检查:
- 多个算法是否在相同数据集和随机种子上配对;
- 数据是否近似满足正态性;
- 是否需要非参数检验;
- 是否进行了多重比较校正;
- 是否报告效应量;
- 统计显著是否具有实际意义。
如果比较多个算法、多个数据集,可以考虑 Friedman 检验以及适当的事后比较。如果只比较两个方法,可以根据实验结构考虑配对检验或非参数替代方法。
提示词示例:
请使用 statistical-analysis 技能分析实验结果。
要求:
1. 先判断实验是否属于配对设计;
2. 解释所选统计检验的假设;
3. 检查这些假设是否满足;
4. 报告 p 值、效应量和置信区间;
5. 进行必要的多重比较校正;
6. 区分统计显著性和实际改进幅度。
第八步:生成论文图片
提示词示例:
请使用 scientific-visualization 技能,
绘制预算—性能曲线。
要求:
1. 横轴为累计获取成本;
2. 纵轴为 Macro-F1;
3. 显示均值和置信区间;
4. 所有方法使用色盲友好的配色;
5. 黑白打印时仍可区分;
6. 字体、线宽和图片尺寸适合论文双栏排版;
7. 导出 PDF 和 300 DPI PNG;
8. 图注能够独立说明实验设置。
最终至少检查:
- 坐标轴是否有单位;
- 图例是否遮挡曲线;
- 字体是否过小;
- 颜色是否可区分;
- 误差带是否表达清楚;
- 图注是否说明误差线含义;
- 是否使用了测试集信息调节参数。
十二、如何让 Agent 的科研输出更加可靠?
Scientific Agent Skills 能改善流程,但仍然需要研究者建立验证机制。
1. 要求先计划,后执行
推荐提示:
先不要编写代码。
请先说明:
1. 你准备使用哪些技能;
2. 每个技能解决什么问题;
3. 整体工作流是什么;
4. 哪些步骤需要我确认;
5. 哪些环节存在不确定性。
这可以避免 Agent 在问题尚未定义清楚时直接生成大量代码。
2. 要求区分事实、推断和建议
推荐提示:
请将输出分成三类:
1. 已通过来源核验的事实;
2. 基于事实作出的推断;
3. 尚未验证的研究建议。
这对文献综述和研究点发现非常重要。
3. 要求保存中间结果
科研任务不应只保留最终结论,还应保留:
- 检索式;
- 原始文献列表;
- 排除记录;
- 数据预处理记录;
- 配置文件;
- 随机种子;
- 单次实验结果;
- 统计分析脚本;
- 图片生成脚本;
- 软件版本。
4. 让 Agent 自我检查
可以增加一次审查任务:
请重新审查刚才的结果,重点检查:
1. 是否存在数据泄漏;
2. 是否使用测试集进行模型选择;
3. 是否遗漏重要基线;
4. 统计检验是否符合实验设计;
5. 结论是否超过证据支持范围;
6. 是否存在无法核验的引用;
7. 是否能够由其他研究者复现。
5. 使用独立流程进行核验
最可靠的方式不是让同一个 Agent 重复说“我检查过了”,而是使用不同证据进行交叉核验:
- 用 DOI 或出版社页面核验文献;
- 实际运行代码;
- 重新计算统计结果;
- 检查原始数据;
- 人工阅读关键论文;
- 使用审稿技能从反方角度评价结论。
十三、常见问题与解决办法
问题一:安装后找不到技能
可以依次检查:
- 技能是否安装到了正确客户端;
- 技能文件夹中是否存在
SKILL.md; - 是否重新启动了 Codex 或编辑器;
- 客户端是否支持 Agent Skills;
- 安装程序是否把技能放到了其他 Agent 的目录。
官方还提醒,较新版本中的技能目录位于 skills/,某些旧文章可能仍然使用过去的目录名称。遇到路径问题,应以当前仓库说明为准。
问题二:Skill 存在,但代码无法运行
这通常不是 Skill 没有安装成功,而是相关软件依赖没有安装。
解决步骤:
- 打开该技能的
SKILL.md; - 查看所需 Python 包;
- 检查 Python 版本;
- 创建独立环境;
- 安装缺失依赖;
- 再运行一个最小示例。
问题三:数据库查询失败
可能原因包括:
- 当前网络无法访问;
- API Key 缺失;
- API Key 无效;
- 请求频率超过限制;
- 数据库接口发生变化;
- 目标服务临时不可用。
不要让 Agent 在查询失败后凭记忆补齐结果。应明确要求:
如果数据库查询失败,请停止并报告失败原因,
不要根据模型记忆生成替代文献。
问题四:Agent 没有自动调用 Skill
可以在提示词中直接指定:
请使用 paper-lookup 和 literature-review 技能完成任务。
开始前请先读取对应的 SKILL.md。
如果仍然没有生效,应检查客户端是否真正识别到技能。
问题五:装了 Skill,为什么结果仍然会错?
因为 Skill 不是正确性证明。
它只能帮助 Agent 获得更好的流程说明,但不能保证:
- 数据源没有错误;
- 软件包没有 Bug;
- Agent 没有误解任务;
- 统计模型选择正确;
- 引用一定支持当前论点;
- 研究设计不存在缺陷。
科研结论最终仍然需要作者负责。
十四、安全、隐私和学术规范
这是使用科研 Agent 时不能忽略的一部分。
1. 安装前阅读 SKILL.md
官方明确建议用户只安装需要的技能,并在安装前检查:
- 技能做什么;
- 会运行哪些脚本;
- 会访问哪些网络服务;
- 需要哪些环境变量;
- 是否会读取本地文件;
- 技能由谁贡献;
- 最近是否仍在维护。
项目会进行安全扫描,但官方同时说明,扫描结果不能保证每个技能完全没有风险。官方安全说明
2. 不要随意上传敏感科研数据
以下内容尤其需要谨慎:
- 未公开论文;
- 审稿意见;
- 专利前的研究材料;
- 患者和临床数据;
- 包含个人身份的信息;
- 合作单位的内部数据;
- 受保密协议约束的数据;
- 尚未公开的实验结果。
需要先确认 Agent、模型和外部服务的数据处理政策。
3. 检查单个技能的许可证
整个仓库采用 MIT 许可证,但官方说明单个技能可能拥有不同许可证。用于商业项目或公开发布时,应阅读相应 SKILL.md 中的许可证字段。
4. AI 不能替代作者责任
AI 可以帮助:
- 搜索资料;
- 整理文献;
- 编写代码;
- 检查逻辑;
- 修改语言;
- 生成图表;
- 模拟审稿。
但作者仍然要对以下内容负责:
- 数据真实性;
- 方法正确性;
- 引用准确性;
- 结果可复现性;
- 研究伦理;
- 论文最终结论。
十五、Scientific Agent Skills 的优点与局限
主要优点
1. 覆盖面广
它将机器学习、统计分析、科研写作、科学数据库和多个专业领域整合到了同一个技能库中。
2. 强调工作流程
相比单纯告诉 AI“使用某个软件包”,Skill 更适合保存完整的多阶段操作流程。
3. 支持复用和版本管理
技能以文件形式保存,可以审查、修改、共享和更新。
4. 适合跨学科研究
当一个研究任务同时涉及文献、数据库、代码、统计和写作时,多个技能可以组合使用。
5. 降低科研工具使用门槛
研究者不必每次都从头阅读一个软件包或数据库的全部文档。
主要局限
1. 不是所有方向都同样深入
目前生命科学、医学和药物发现方面的内容非常丰富。某些机器学习细分方向可能没有专门技能。
2. 技能质量可能存在差异
不同技能的作者、更新时间、依赖和成熟度可能不同。
3. 环境配置仍然需要时间
复杂的科研软件可能涉及 Python 版本、系统依赖、GPU、API Key 和数据格式等问题。
4. 本地算力限制依然存在
Skill 可以告诉 Agent 如何进行训练,却不能自动增加计算机的显存和计算能力。
5. 仍然需要人类监督
项目无法替代真正的文献阅读、实验判断、数学证明和同行评议。
十六、它适合主动学习研究者吗?
我的判断是:
适合,但应当选择性安装,并把它定位为科研基础设施,而不是主动学习专用算法库。
对于主动学习研究者,它最有价值的地方包括:
- 系统检索主动学习和主动特征获取文献;
- 建立文献矩阵;
- 发现候选研究空白;
- 设计基线方法和消融实验;
- 编写 scikit-learn 或 PyTorch 实验代码;
- 进行多数据集统计比较;
- 绘制学习曲线和预算—性能曲线;
- 检查实验可复现性;
- 辅助撰写论文;
- 模拟审稿人寻找实验漏洞。
它目前不一定直接提供:
- 所有主动学习算法的现成实现;
- 针对序分类主动特征获取的完整理论;
- 自动发现并证明数学定理的可靠系统;
- 对研究创新性的最终判断。
因此,主动学习研究者可以把它与自己的算法代码、论文库、实验模板和领域 Skill 结合起来。
如果未来经常重复同一种工作,还可以进一步编写自己的专用 Skill,例如:
ordinal-active-feature-acquisition/
├── SKILL.md
├── references/
│ ├── problem-definition.md
│ ├── evaluation-protocol.md
│ └── related-work-taxonomy.md
├── scripts/
│ ├── run_experiment.py
│ ├── statistical_test.py
│ └── plot_budget_curve.py
└── assets/
├── experiment-config.yaml
└── paper-table-template.xlsx
这个自定义 Skill 可以规定:
- 序分类问题的数学定义;
- 主动特征获取的预算约束;
- 必须使用的评价指标;
- 必须包含的基线;
- 推荐的数据集;
- 统计检验方法;
- 图片格式;
- 实验结果保存结构;
- 论文写作术语。
这可能比盲目安装大量通用技能更有长期价值。
十七、我是否推荐安装?
我的建议分为三种情况。
强烈推荐
如果你:
- 经常使用 Codex、Claude Code 或 Cursor;
- 需要处理科研数据和代码;
- 经常进行文献综述;
- 希望建立可复现的研究流程;
- 愿意检查 Skill 和 AI 输出。
可以尝试
如果你:
- 主要用 AI 进行论文润色;
- 偶尔需要数据分析;
- 还不熟悉 Agent 工具;
- 希望先了解 AI 科研工作流。
可以先安装 3~5 个技能,不必一次搭建完整环境。
暂时不推荐
如果你:
- 希望安装后完全自动完成科研;
- 不愿意检查引用和实验结果;
- 无法处理基本的软件环境问题;
- 需要处理高度敏感的数据,却不了解外部服务的数据政策。
十八、总结
Scientific Agent Skills 最值得关注的地方,不是“148”这个数字,而是它展示了一种新的 AI 使用方式:
不再只是向大模型提出一次性问题,而是把科研经验整理成可以反复调用、检查和改进的标准工作流程。
普通聊天机器人更像一个知识丰富的问答助手,而加载了科研 Skill 的 Agent,更接近一位能够读取文件、调用工具、执行代码并遵守实验流程的研究助理。
不过,Skill 不是魔法。
它不能保证参考文献绝对正确,不能替代实验验证,也不能自动判断一个研究点是否真正创新。它最大的价值,是帮助研究者减少重复劳动、规范研究流程,并让 AI 的工作方式更加透明、稳定和可复现。
如果你是一名机器学习研究者,我建议从以下组合开始:
paper-lookup
literature-review
citation-management
experimental-design
scikit-learn
statistical-analysis
scientific-visualization
scientific-writing
peer-review
先用这些技能完成一次小规模、可核验的科研任务,再根据自己的研究方向逐步增加其他能力。
真正值得追求的并不是“让 AI 代替研究者”,而是:
让研究者把更多精力放在问题定义、理论创新和科学判断上,把重复、机械且能够标准化的工作交给 AI Agent。
这或许才是 Scientific Agent Skills 对科研工作最实际的意义。
参考链接
- Scientific Agent Skills GitHub 仓库
- Scientific Agent Skills 安装说明
- Scientific Agent Skills 安全说明
- Agent Skills 开放标准
本文依据 2026 年 7 月公开资料整理。Scientific Agent Skills 仍在快速更新,技能数量、目录结构、依赖要求和安装命令可能发生变化,实际使用时请以官方仓库最新说明为准。

397

被折叠的 条评论
为什么被折叠?



