DeepSeek-R1采用了一种直接蒸馏的方法将大模型的推理能力迁移到小模型上。具体而言,DeepSeek-R1作为教师模型,通过生成大规模高质量的问答和推理示例,然后直接微调(SFT)多个开源小模型,使小模型模仿教师模型的输出。在这一过程中,小模型(如Qwen和Llama系列)的参数得到调整,以匹配DeepSeek-R1的推理模式和回答风格。这种直接蒸馏跳过了传统知识蒸馏中复杂的多阶段流程,不需要让小模型单独进行强化学习优化,而是一次性利用教师模型生成的数据进行训练。结果表明,这种直接将大模型知识“倾倒”到小模型中的策略显著提升了小模型的推理能力。例如,研究团队使用DeepSeek-R1作为教师模型生成了约80万条训练样本,然后用这些数据直接微调Qwen和Llama等较小的模型,所得的蒸馏模型在推理任务上表现出了远超同规模模型的能力。
1、蒸馏是什么?为什么要蒸馏?
蒸馏就是把一个大的教师模型的知识萃取出来,把他浓缩到一个小的学生模型,可以理解为一个大的教师神经网络把他的知识教给小的学生网络,这里有一个知识的迁移过程,从教师网络迁移到了学生网络身上,教师网络一般是比较臃肿,所以教师网络把知识教给学生网络,学生网络是一个比较小的网络,这样就可以用学生网络去做一些轻量化网络做的事情。
AI大模型(如:DeepSeek-R1)在众多领域中均取得了令人难以置信的性能和潜力。但是,大多数模型在计算上过于昂贵,无法在移动端或嵌入式设备上运行。因此需要对模型进行压缩,这样小的模型就适用于部署在终端设备上了。

2、R1蒸馏与传统蒸馏的差异
DeepSeek-R1的蒸馏优化策略与传统方法有所不同,主要体现在以下几点:
侧重推理链的知识迁移:传统知识蒸馏往往只关注最终答案或软标签概率分布,而DeepSeek-R1强调将思维链(Chain-of-Thought)迁移给小模型。教师模型在回答问题时会生成详细的推理过程(CoT),小模型通过学习这些完整的推理轨迹来掌握复杂问题的解题模式。这种方式确保小模型不仅知道答案,还学到如何推导答案的逻辑。
高质量数据筛选:DeepSeek-R1采用拒绝采样策略确保训练数据的正确性和可读性。对于每个问题,教师模型生成多条回答,仅保留其中正确且格式良好的输出作为训练样本。特别地,过滤掉了语言混杂、段落过长或包含代码段等混乱的推理链,只保留清晰正确的解答。这种优化避免了将教师模型可能产生的错误或不良习惯传递给学生模型,提高了蒸馏效果。
无需软标签蒸馏损失:传统蒸馏有时使用教师的概率分布作为软标签(通过KL散度损失等)来训练学生模型,而DeepSeek-R1采取了直接监督微调的方法,即用教师模型生成的答案作为硬标签进行训练。研究报告称这种直接蒸馏已经显著增强了小模型的推理能力。没有额外的复杂蒸馏损失,简化了训练流程。
不对学生模型使用RL微调:与有些方法在小模型上再进行强化学习调整不同,DeepSeek-R1蒸馏出的学生模型仅通过SFT训练而不进行额外RL阶段。尽管理论上在学生模型上附加RL或对抗训练可能进一步提升性能,团队选择不这么做,以突出蒸馏本身的效果。这一决策减少了训练开销,也区别于传统需要多阶段调整的小模型训练方案。
涵盖多领域能力:蒸馏数据不仅包含数学、编程等推理任务,还包括写作、问答、角色扮演等一般场景的监督数据,从而赋予小模型全面能力。相比之下,传统蒸馏若仅针对单一任务,模型通用性可能受限。DeepSeek-R1通过在蒸馏数据中加入非推理任务(约20万样本)来保持模型在助理对话、常识问答等方面的表现。
综上,DeepSeek-R1的优化策略突出大模型推理模式的直接移植和数据质量管控,与传统方法相比更关注让小模型复现大模型的思维过程和正确输出。这种策略被证明比让小模型自身去探索(如直接在小模型上用RL训练)更加高效。

3、训练数据生成
用于蒸馏的小模型训练数据主要由DeepSeek-R1教师模型生成,并经过精心筛选和组合,总规模约80万样本。数据生成过程包括以下几个步骤:
收集推理问题和生成初始解答:研究团队首先整理了大量需要复杂推理的提示/问题集合,涵盖数学证明、编程题、逻辑推理等领域。然后利用DeepSeek-R1模型针对这些提示生成回答。为了获取多样且高质量的解答,他们对每个提示采样多次,从而得到不同的推理链和答案。
拒绝采样筛选正确推理:对于每个问题的候选回答,采用自动评价手段筛选出正确的解答轨迹。在数学、代码等有明确对错的任务上,使用基于规则的奖励或对比真实答案的方式筛选;在开放性任务上,则借助生成式奖励模型(例如将模型输出与参考答案送入DeepSeek-V3模型判别优劣)来评估回答质量。通过拒绝采样,只保留那些答案正确、推理链可靠的样本作为训练数据。另外,为保证可读性,还过滤掉了输出中存在语言混杂、段落冗长或格式混乱(如夹杂代码块)的推理过程。这一过程最终收集了约60万条高质量的推理相关训练样本。
扩充非推理领域数据:除了推理题,模型还需要在日常对话和知识问答等方面表现良好。因此,团队引入了非推理类监督数据进行补充。这部分数据部分来自先前DeepSeek-V3模型的SFT数据集,包括写作改进、事实问答、自我认知、翻译等任务。对于其中一些需要推理的非推理任务,使用了DeepSeek-V3生成了可能的思维链以辅助回答,但对于非常简单的提示(如“你好”),则不附加思维链。经过筛选清理,这部分通用场景数据约20万条。
合并构建训练集:将约60万条推理数据与20万条非推理数据合并,形成总计约80万条样本的大型训练集。在最终的蒸馏过程中,这些数据用作小模型的微调样本。值得注意的是,这些样本的问答格式包含了完整的推理过程(通常以特殊标记或格式嵌入),以及最后的答案,使模型能够学习在回答中展示推理步骤。
通过以上步骤,DeepSeek-R1团队生成了一套覆盖复杂推理和一般对话场景的高质量大规模数据集。这为小模型的蒸馏训练奠定了坚实基础,确保学生模型看到的示例既具有卓越的推理深度又保持输出的准确和连贯。
4、小模型的训练流程与关键技术
在获得教师模型生成的海量高质量数据后,DeepSeek-R1对小模型的训练流程主要是基于监督微调的单阶段训练,配合一些关键技术调整:
选择合适的基础模型:团队挑选了多种开源基座模型作为蒸馏的起点,包括Qwen2.5系列(1.5B、7B、14B、32B参数,带Math扩展)和Llama3系列(8B和70B版本)。这些模型本身在预训练或初始微调时已具备一定的推理或数学能力(如Qwen2.5-Math在数学方面有所加强),为蒸馏提供了良好的基础。另外,选择Llama-3.3系列(而非3.1)也是因为其原始推理能力稍强,有利于达到更好效果。
调整模型配置与词表:由于教师模型输出中引入了特殊格式(例如…标签用于标记思维链,小模型需要能处理这些标记和长序列输出。因此,在微调前对小模型的配置和分词器(tokenizer)进行了轻微修改。这可能包括增加特殊标记符到词表、扩展模型的上下文长度上限,以及确保模型能够正确地学习生成类似格式的输出。通过这些调整,小模型可以无缝地模仿教师模型的推理过程表达方式。

监督微调训练:训练采用标准的有监督微调(SFT)过程。使用前述准备的约80万条训练样本,对小模型进行若干轮次(epoch)的微调,使其最小化与教师模型答案之间的损失。研究报告中提到,在对大模型(DeepSeek-V3-Base)进行这80万数据的微调时训练了2个epoch;对小模型也进行了类似程度的训练,以充分学习数据模式。在损失函数方面,以交叉熵为主,让小模型逐词预测教师模型的输出序列。由于样本中包含思维链和答案,小模型学习到在回答用户问题时先推理后作答的模式,并按照教师的风格给出完整的解决过程。
无额外强化学习阶段:正如前述,团队未对蒸馏后的小模型进行RL微调。整个小模型训练一次完成,即通过上述SFT直接得到最终模型。这避免了可能的“奖励模型偏差”或“奖励黑客”等复杂问题。团队选择将RL探索限定在大模型阶段完成,而小模型只是纯粹模仿,从而简化训练管线并减少计算成本。
关键技术总结:小模型训练的关键在于“中国教育”式的精调:以预训练良好的小模型为基底,辅以教师模型精心生成的海量标注数据,通过标准梯度下降让小模型的行为逼近教师模型。配合细节上的处理(如特殊标记和格式、一致的词表),小模型成功继承了大模型的推理技巧和知识。在实现上,这相当于一次大规模的知识蒸馏微调,而不涉及复杂的师生互动训练或多轮蒸馏。
5、蒸馏后小模型的性能优势
经过DeepSeek-R1的直接蒸馏,小模型在多项任务中展现出远超传统同规模模型的性能优势。以下是主要的性能亮点:
小模型达到大模型水平:DeepSeek-R1蒸馏出的模型表现出接近甚至超越更大规模模型的能力。例如,蒸馏后的Qwen-7B模型在美国高中数学邀请赛题集AIME 2024上的单次答对率达到55.5%,已经超过了未蒸馏的开源32B模型(QwQ-32B-Preview)的50.0%成绩。一个7B参数的小模型性能超越了原本参数近5倍的大模型,显示出蒸馏带来的巨大收益。
14B小模型超越32B SOTA模型:团队公布的蒸馏版14B模型显著胜过当时最先进的32B开源模型。据报告,DeepSeek-R1蒸馏的14B模型比QwQ-32B-Preview在推理任务上高出大量幅度。这意味着通过蒸馏,即便将模型规模削减一半,其推理性能仍可超越此前更大的模型,性价比和实用价值大大提升。
刷新密集模型推理纪录:更大规模的蒸馏模型(如32B和70B版本)在推理基准上创造了新的记录。例如,DeepSeek-R1-Distill-32B在AIME数学竞赛、MATH-500数学题、LiveCodeBench编程题等多个基准上取得业界领先成绩。特别地,在MATH-500基准上,蒸馏32B模型的正确率高达94.3%,而同类开源模型此前未达到这一水平。
媲美o1封闭模型:DeepSeek-R1团队指出,这些蒸馏的小模型已经可与OpenAI的o1-mini模型相媲美。OpenAI o1系列是闭源的大型模型,而经过蒸馏的32B模型在各种推理任务上的成绩与o1-mini相当,体现了开源小模型经过正确蒸馏后能够达到接近专有模型的水准。此外,DeepSeek-R1-Distill-Qwen-32B模型在多个基准上超越了OpenAI-o1-mini,被认为是密集架构小模型的新标杆。
特定领域超越GPT-4o:令人瞩目的是,一些蒸馏后的模型在特定任务上甚至超过了GPT-4o等更强大的闭源模型。据报道,这些蒸馏模型在数学和编程基准测试上击败了包括GPT-4o在内的更大型模型。这说明通过蒸馏获得的推理技巧,使小模型在高度专业的任务上也能取得一流表现。
总体而言,DeepSeek-R1蒸馏后的小模型在数学推理、代码生成、逻辑问答等复杂任务上展现出明显优势。它们往往优于同等参数规模的其它开源模型,并能接近甚至部分超越远超自身规模的先进模型(包括OpenAI的新一代模型)。这充分验证了“大模型可将推理能力传承给小模型”,让小模型也具备强大的问题求解能力。
6、实验结果与对比分析
DeepSeek-R1团队在报告中提供了大量实验数据,对比了蒸馏小模型和其他模型/训练策略的性能差异,主要结论和数据如下:
蒸馏 vs RL训练(小模型):为了检验小模型能否通过自身强化学习达到类似效果,研究者对一个32B基础模型进行了大规模RL训练(1万+步)得到“DeepSeek-R1-Zero-Qwen-32B”模型,并与直接蒸馏DeepSeek-R1的32B模型比较。结果显示,RL策略的小模型性能仅与原始基准相当,例如在AIME 2024上RL模型得分约47.0%,与未经蒸馏的QwQ-32B基线50.0%相近;而蒸馏模型大幅领先,AIME成绩高达72.6%。如下表所示,蒸馏版32B在所有推理相关基准上都显著优于RL版32B模型:

(32B小模型不同训练方式在推理基准的比较)
从上述数据可以得出两个结论:
一方面,将强大模型的知识蒸馏到小模型上可以取得卓越效果,而让小模型自身通过大规模RL学习不仅耗费巨大计算,而且效果不及蒸馏。
另一方面,尽管蒸馏高效,小模型性能的天花板仍受限于教师模型的水平,若要进一步突破仍可能需要更强的基础模型和更大规模的训练。
蒸馏小模型 vs 开源同类模型:蒸馏后的各档次模型均拿到了当时开源模型中的最佳成绩。例如,DeepSeek-R1-Distill-Qwen-7B在AIME 2024上取得55.5%的正确率,超过了先前业界最好的32B模型QwQ-32B-Preview的50.0%。再如,蒸馏的Qwen-32B在数学基准MATH-500上达到了94.3%的成绩,在代码题LiveCodeBench上也有57.2%的高得分。这些分数显著超越此前公开的任何同规模模型,也几乎追上了OpenAI封闭模型的水准。由此可见,通过蒸馏,可以用更小的参数规模实现以往需要更大模型才能达到的性能。
蒸馏模型 vs 更大型闭源模型:DeepSeek-R1论文和后续报道中也将蒸馏模型与Claude 3.5、GPT-4等进行对比。在部分基准上(如数学竞赛问题AIME、数学题库MATH-500),DeepSeek-R1及其蒸馏模型超越了Claude 3.5和GPT-4o等模型。在代码生成挑战(如Codeforces和LiveCodeBench)中,蒸馏模型也展现出强于大部分开源模型、可比肩GPT系模型的实力。这些对比实验证明,蒸馏策略使小模型受益良多,以致性能曲线大幅上移,逼近更大型模型的表现。
综上所述,DeepSeek-R1的实验结果清晰地展示了直接蒸馏的有效性:小模型通过学习大模型产出的数据,在各种推理基准上都实现了跨越式提升。相比之下,无论是让小模型自己做RL训练,还是与未蒸馏的开源模型相比,都难以企及蒸馏模型的表现。这项研究的对比分析为AI应用发展提供了重要启示——大模型蕴含的推理模式和知识可以高效地传承给小模型,从而在计算资源受限的情况下仍能构建出强大的推理AI模型。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


2281

被折叠的 条评论
为什么被折叠?



