大模型技能使用指南:提升效率,收藏必备!小白程序员轻松掌握

文章探讨了大模型技能使用的现状,指出技能使用效果主要取决于 harness 和文档质量,而非模型本身。腾讯混元团队的 Skill-Use 基准测试了多个模型在真实场景中的技能使用情况,发现即使是顶级模型,技能使用率也较低。文章还介绍了 Capability Pages 方法,通过为每个技能编写包含正向触发器、负向边界和判别性主体的档案,有效提升了技能检索和使用的准确性。对于想要提升大模型技能使用效率的读者,这篇文章提供了宝贵的指导和建议。

你给 Agent 装了满满一库 skill,指望它遇事掏出对应的那一页。现实是:它可能连看都没看一眼。

图片

腾讯系团队连出两篇 skill 论文——腾讯混元参与的 Skill-Use 基准先把全行业顶级模型拉去体检,腾讯优图和 IMA 的 Capability Pages 紧接着交出药方。

图片

skill 用得好不好,主要不取决于模型,取决于 harness 和文档。

第一篇:Skill-Use

图片

Skill-Use 模拟的是真实场景里的渐进式披露:Agent 一开始只看到 skill 的名字和一行描述,想用就得自己去把完整文档翻出来。基准收了 79 个来自 GitHub 的真实 skill,配上 177 个可执行任务、九个领域,每个任务在隔离 Docker 沙箱里真跑,按执行轨迹打分。评分拆成三刀:Trigger(该调的时候调了吗)、Compliance(规定流程走完了吗)、Boundary(禁止操作碰了吗),最后合成一个 SU 分数——不触发,后面做得再好也是零分。

Skill-Use 基准的数据构造流水线:从十万级候选筛到79个skill

Skill-Use 基准的数据构造流水线:从十万级候选筛到79个skill

八个前沿模型,两个当家 harness(Claude Code 和 Codex),考出来的成绩是这样的:最强的 GPT-5.5 跑在 Claude Code 里,SU 也只有 0.613,刚过及格线。

Skill-Use 主结果:8个模型 × 2个harness 的完整成绩单

Skill-Use 主结果:8个模型 × 2个harness 的完整成绩单

更有意思的是结构性发现:Boundary 全线高于 Compliance——模型不去做禁止的事挺可靠,把规定流程完整走下来反而难;

图片

触发和遵循是两个独立的瓶颈,DeepSeek-V4-Pro 的触发率只有 0.324,但只要触发了,条件合规 0.588 并不输给 SU 高它一倍的模型。卡住它的不是不会做,是没想到要去做。

图片

换个壳,成绩单重写

这篇论文最扎心的部分叫 harness 依赖。同一个 GPT-5.5,在 Claude Code 里是全场第一(SU 0.613),搬进 Codex 直接掉到 0.503;Claude Opus 4.8 反过来,在 Codex 里登顶(0.559)。中档开源模型更玄学:跨 harness 的任务级相关性只有 0.28 到 0.29,换壳之后有些模型反而涨分。作者的表述很直白:skill 使用是以 harness 为条件的属性,不是模型的固定属性。

图片

还有两个对一线团队特别实用的数字。一是库规模:从 1 个 skill 加到 10 个,成绩断崖式下跌,之后加到 30 个反而没什么变化——大部分失败不是选错,是压根没调用。

图片

二是生死线:把 779 次带 skill 的运行和关掉 skill 库的基线一一配对,SU 低于 0.5 时,用 skill 比不用还糟——模型承诺了规定的工具链和格式却走不完,半途而废比从头自由发挥伤害更大。顺带一提,范围内最会跟流程的模型,范围外滥触发也最狠,Claude Opus 和 GPT-5.5 包揽了大多数不当调用。

图片

第二篇:

图片

第二篇论文接着第一篇的瓶颈往下挖。第一篇已经证明触发、检索是主要瓶颈,第二篇问的是:为什么检索老是失败?答案有点反直觉——问题一大半出在被检索的文本本身。

图片

论文把一个 skill 真正能解决的查询集合定义成它的可执行区域,而 skill 文档只是这个区域的有损观测。两个 skill 文档写得几乎一样、实际能力不同时,论文给了一个数学下界:任何只读文档的检索器都无法区分它们,编码器再强、重排序再精也救不回来。真实案例就在那:MedCalc-Bench 里一个明确要求 Bazett 公式校正 QT 间期的查询,Rautaharju 校正器以 77.79% 排第一,正确的 Bazett 计算器 77.66% 屈居第二——差 0.13 分,两份文档都写着用心率校正 QT,区别只是公式名字。

正确skill进top-10远多于拿到rank-1,池内排序误差巨大

正确skill进top-10远多于拿到rank-1,池内排序误差巨大

这个误差是结构性的:六个数据集上,正确 skill 挤进 top-10 的频率远高于登顶的频率,对最强的 Qwen3-Embedding-8B 这个缺口还有 29.6 分。

解药:让 skill 说清自己不是什么

既然文本里缺失的信息没法靠模型脑补,那就改文本。Capability Pages 给每个 skill 编一页三段式档案:T⁺ 正向触发器(什么请求该选我)、T⁻ 负向边界(什么请求长得像我但该找别人)、B 判别性主体(我的核心公式和决策规则)。编译完全离线:先把 26,262 个 skill 聚成邻域簇,再让 DeepSeek-V4-Pro 读完整个簇、对比着邻居给每个成员写档案——T⁻ 没法从单个文档推导,必须簇级对比才写得出来,这是整套方法的关键。

图片

部署也讲究:索引侧只用 T⁺ + B + 原文,T⁻ 只喂给路由器。消融实验证明把 T⁻ 混进索引,三个密集检索器 Recall 反而全掉——把邻居的描述写进自我介绍,嵌入会往该拒绝的方向漂。

图片

效果是全线一致的。检索侧,五个检索器 Recall@10 平均 +2.94 分,越弱的检索器受益越大——BM25 直接 +7.63。端到端侧,四个执行器 × 六个数据集共 24 个组合,任务成功率平均 +3.62 分,BigCodeBench 上最高 +7.53。中文场景迁移到 SSL-SkillDiscovery,同一个编码器不动,MRR@50 做到 73.07%。注意一个前提:在线的模型和检索器一个都没换,涨的全是文档工程的分。

端到端结果:加入T⁻后24个组合平均+3.62分

端到端结果:加入T⁻后24个组合平均+3.62分

最后

2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!

金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代

现在企业疯狂紧缺一类人才:懂业务、懂 AI、能做出可上线项目的大模型开发工程师,岗位缺口大,薪资待遇十分可观。

在这里插入图片描述

风口再好,不如手握高薪 offer 实在。行情火热,普通人、程序员该怎样从零入门大模型,抓住这波机会?

今天整理好【2026 最新版】AI 大模型全套免费学习资源,覆盖零基础入门、项目实战、理论知识、大厂面试,从基础一路进阶。所有资料分类归档,没有多余杂料,无套路免费分享给想要入局 AI 赛道的程序员与零基础小白!

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

1、大模型系统化完整学习路线

在这里插入图片描述

2、大模型经典书籍&文档

在这里插入图片描述

3、AI 大模型最新行业研究报告

在这里插入图片描述

4、企业级实战项目 + 完整配套源码

img

5、大厂大模型面试真题汇总

img

6、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
在这里插入图片描述
在这里插入图片描述

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值