大模型知识点总结01

1、大模型温度系数

在长文本生成模型中,采用温度系数(Temperature)动态递增策略(从 T=0.4T=0.4 逐渐升至 T=0.8T=0.8 )是一种旨在平衡“局部连贯性”与“全局多样性”的高级解码技巧。

这种策略的核心逻辑在于:让模型在开头保持严谨和确定,随着文本展开逐渐释放创造力和发散性。

以下是对该策略的深度解析、数学实现及工程注意事项:

为什么要这样做?(设计动机)

生成阶段温度设定目的与作用解决的问题
起始阶段T≈0.4T≈0.4高确定性、强约束。确保Prompt的续写紧密贴合指令,语法正确,逻辑锚点稳固。防止开篇跑题、幻觉或格式错误;建立稳定的上下文基调。
过渡阶段0.4→0.80.4→0.8平滑过渡。避免风格突变导致的文本割裂感。防止因温度跳变引起的语义断层或语气不一致。
后半程T≈0.8T≈0.8增加熵值、提升多样性。引入更丰富的词汇和句式,避免长文陷入重复循环。解决长文本生成中常见的“退化”问题(Repetition Degeneration)和内容枯燥。

在长文本生成中,将温度系数恒定保持在 T=0.8T=0.8 是一种与动态升温策略截然不同的设计哲学。其核心目标是:在整个生成过程中维持恒定的随机性水平(即熵值稳定),确保模型在任何位置的“探索-利用”权衡保持一致。

以下是对该策略的深度解析、适用场景及工程要点:

为什么选择恒定 T=0.8?

特性恒定 T=0.8动态升温 (0.4→0.8)
概率分布形态全程一致,softmax输出的熵不变从尖锐到平坦,熵递增
风格一致性✅ 全文语气、创造力水平均匀⚠️ 前稳后放,可能存在风格断层
开篇稳定性⚠️ 相对较弱,依赖Prompt质量✅ 强约束,锚定效果好
长文抗退化✅ 持续抑制重复模式✅ 后期才发力抑制
可预测性✅ 行为均匀,调试简单⚠️ 需额外调参调度曲线
计算开销✅ 零额外开销✅ 几乎零开销

2、为什么现在的大模型都是Decoder-only架构

参考: https://www.zhihu.com/question/588325646/answer/3357252612

3、强化学习框架PPO、DPO、GRPO等

基本原理介绍:https://zhuanlan.zhihu.com/p/1984387073625593089

3.1、PPO

PPO使用clipping机制的原因:clip 函数的核心作用是截断。它将新旧策略的概率比率r强制限制在[1−ϵ,1+ϵ] 这个区间内。这意味着我们只允许模型在旧策略的基础上进行小步调整,防止模型因为一次性更新幅度过大(步子迈太大)而导致训练崩溃(扯着蛋),从而保证了强化学习过程的稳定性。

4、梯度消失与梯度爆炸

参考:https://zhuanlan.zhihu.com/p/15391570214

5、最大似然估计

参考:https://zhuanlan.zhihu.com/p/32341102

(1)考题:二项分布的最大似然估计

解答:二项分布 B(n, p)中成功概率p的最大似然估计量是 x/n(其中n为总试验次数,x为成功次数)

(2)考点:似然函数的定义

题解:似然是观测样本联合概率或密度关于参数的函数,最大似然估计是一种使用观测数据来估计未知参数的方法。其工作原理是通过寻找最大化似然函数的参数组合,以使在假设的模型下,我们所观察到的数据具有最高的概率。

6、循环神经网络

6.1、循环神经网络特点

循环神经网络(RNN)的本质特征需同时涵盖以下三点,缺一不可:

  1. 序列数据处理能力:天然适配变长时序输入。
  2. 跨时间步参数共享:同一组权重 {W,U,b}在所有时间步重复使用,使模型能泛化到任意长度序列。
  3. 隐状态记忆机制:通过参数递归更新,将历史信息压缩为状态向量,实现对上下文的动态记忆。

6.2、Transformer

参考:https://zhuanlan.zhihu.com/p/1888714210940285525

(1)缩放点积为什么要除以根号dk

6.3、LSTM

参考:https://zhuanlan.zhihu.com/p/42717426

与RNN对比的主要改进点:

LSTM(Long Short-Term Memory)被提出的根本动机,就是为了解决标准 RNN 在处理长序列时因反向传播通过时间(BPTT)导致的 梯度消失或梯度爆炸问题,从而无法有效学习长距离依赖关系

其核心创新——门控机制(遗忘门、输入门、输出门)与细胞状态(Cell State)——正是为此设计:

  • 细胞状态作为“信息高速公路”,允许梯度以近乎恒定的方式跨多个时间步流动(类似残差连接),避免连乘导致的指数级衰减/增长。
  • 遗忘门选择性丢弃无关历史信息,输入门控制新信息写入,使网络能主动维持关键长期记忆,而非被动依赖隐状态的线性变换。

7、SFT

参考:https://zhuanlan.zhihu.com/p/2006404476056142687

(1)SFT出现过渡道歉现象的原因

SFT(监督微调)后模型出现“过度道歉”现象,最可能的原因是:训练数据中对齐语料的安全/拒绝回复模板高度同质化,导致模型将“礼貌性致歉”与“安全合规响应”形成了过强的统计绑定。

这本质上是一个数据分布偏差问题,而非模型架构或训练算法的缺陷。以下是分层归因分析:

核心原因:对齐数据的模板污染

在RLHF/SFT的对齐阶段,标注者或合成数据生成管线通常使用固定模板处理敏感/边界请求:

❌ "很抱歉,我无法回答这个问题。作为AI助手,我..."
❌ "对不起,我不能提供此类信息..."
❌ "I apologize, but I cannot..."

当这类模板在训练集中占比过高且变体极少时,模型会学到两个错误的启发式:

  • 任何不确定性 → 触发道歉前缀(即使问题完全无害)
  • 任何用户负面反馈/纠正 → 触发道歉(而非直接修正答案)

次要放大因素

因素机制严重程度
DPO/RLHF奖励模型偏差奖励模型本身偏好"礼貌但无用"的回复胜过"直接但有风险"的回复,强化学习进一步放大了道歉倾向⭐⭐⭐⭐
SFT数据去重不足同一安全模板被重复采样数千次,远超正常对话中道歉的自然频率⭐⭐⭐⭐
负样本缺失训练集中缺乏"无需道歉的正常拒绝"和"被纠正后直接修正"的正例⭐⭐⭐
Base模型预训练偏差预训练语料中客服/论坛道歉文本比例偏高,SFT未充分覆盖⭐⭐
Loss权重均匀安全回复与普通回复使用相同loss权重,高频模板主导梯度方向⭐⭐

(2)SFT的关键认知

参考:https://zhuanlan.zhihu.com/p/1972451664461038930

关键认知:SFT 的数据量远小于预训练,但其价值不在于"注入新知识",而在于激活和格式化预训练阶段已学到的能力。这也是为什么 SFT 数据质量比数量更重要——少量高质量数据即可显著提升指令遵循能力。

(3)SFT的难点:

现有研究已意识到“数据质量比数量更重要”,但仍存在两大缺口:

  1. 缺乏定量指标:无法精准衡量单个指令样本对特定LLM能力提升的贡献度,数据选择依赖经验或间接指标(如任务复杂度)。
  2. 缺乏通用方法:现有方法要么依赖外部模型(如Alpagasus用ChatGPT标注),要么绑定特定任务(如Nuggets针对特定任务集),难以适配不同架构、不同能力范围的LLM。

8、贝叶斯网络

参考:https://zhuanlan.zhihu.com/p/573883337

(1)给定父节点的条件下,每个节点与其非后代节点条件独立,但后代节点在被观测到的前提下,仍可作为证据影响该节点

9、KV Cache

参考:https://zhuanlan.zhihu.com/p/1896199264121644180

参考:https://zhuanlan.zhihu.com/p/685853516

(1)计算复杂度

阶段 / 指标 无 KV 缓存 (1) 有 KV 缓存 (2)
单步 Token 计算量 O(t²) O(t)
完整生成总计算复杂度 O(n³) O(n²)
显存空间复杂度(内存开销) O(1)(不存历史) O(n)(随序列线性增长)

(2)KV缓存大小

设输入序列的长度为 s ,输出序列的长度为 n ,模型深度为l,维度为h,以 FP16 来保存KV cache,那么KV cache的峰值显存占用大小为 b(s+n)h∗l∗2∗2=4blh(s+n) 。这里第一个2表示K/V cache,第二个2表示 FP16 占2个bytes。
以 GPT3 (175B) 为例,对比 KV cache 与模型参数占用显存的大小。GPT3 模型weight占用显存大小为350GB (FP16),层数 l为96,维度h为12888。

batch sizes+nKV cache(GB)KV cache/weight
4409675.50.22
1640963020.86
64409612083.45

10、机器学习管道(Machine Learning Pipeline)

10.1、Lasso回归

参考:https://zhuanlan.zhihu.com/p/88698511

通过正则化实现泛华

10.2、PCA

参考:https://www.zhihu.com/question/40956812

降维前,必须进行标准化,PCA不进行缩放,仅进行旋转

10.3、Permutation Importance

参考:https://zhuanlan.zhihu.com/p/563422607

对相关性高的变量会低估重要性,模型默认的Feature Importance同样存在该问题

10.4、特征哈希

参考:https://zhuanlan.zhihu.com/p/504100961

特征哈希(Feature Hashing / Hashing Trick):特征哈希是AI设计模式中的一种数据表示模式,能够有效解决分类数据不完整、高基数(特征类别不均)、以及冷启动问题(推理时无法处理新出现的类别)

10.5、KNN

参考:深入浅出KNN算法(一) KNN算法原理 - zzzzMing - 博客园

10.6、MLP(多层感知机,前馈神经网络)

参考:https://zhuanlan.zhihu.com/p/63184325

考点:使用 MLP 预测每月降雨量时,输出层推荐使用什么激活

预测每月降雨量是一个典型的回归问题(输出为连续数值),输出层激活函数的选择取决于任务类型:

选项输出范围是否适合原因
A. ReLU[0, +∞)存在"死神经元"问题,梯度可能消失
B. Tanh[-1, 1]输出被压缩到有限区间,无法表示实际降雨量
C. Sigmoid(0, 1)同上,范围严重受限
D. 线性(无激活)(-∞, +∞)输出不受限,适合任意连续值预测

核心原则

回归任务 → 输出层使用线性激活(即不加激活函数)

原因:

  1. 无范围约束:降雨量可以是任意非负实数(如 0mm、150mm、300mm…),不应被人为压缩到某个固定区间。
  2. 梯度畅通:线性输出配合 MSE 损失函数,梯度计算简洁稳定,不会引入饱和问题。
  3. 建模灵活性:让网络自由学习输出尺度,无需额外做反归一化映射。

10.7、聚合层次聚类

参考:Agglomerative Hierarchical Clustering-聚合层次聚类-CSDN博客

聚合层次聚类是一种自下而上的算法,首先将每个样本都视为一个簇,然后开始按一定规则,将相似度高的簇进行合并,最后所有样本都形成一个簇或达到某一个条件时,算法结束。

  确定簇与簇之间相似度是该算法的要点,而这里的相似度是由簇间距离来确定的,簇间距离短(小)的相似度高,簇间距离长(大)的相似度低。


考点:关于 HAC 层次凝聚聚类的增量更新能力

层次凝聚聚类(Hierarchical Agglomerative Clustering)的每一步合并决策都依赖于当前所有簇之间的成对距离矩阵。当新增一个样本时:

  1. 该样本与所有现有簇的距离需要计算
  2. 新距离可能改变任意两个簇之间的相对优先级(尤其在 average/complete linkage 下)
  3. 之前的某一步合并可能在新的距离矩阵下不再是最优选择
  4. 因此,整个树状图(dendrogram)的结构都可能发生变化

这种全局依赖性使得严格的增量更新在理论上等价于全量重跑,实践中难以高效实现。✅

选项判断说明
A. 完全无法接收新增样本过于绝对。虽然困难,但存在近似增量方法(如 BIRCH、CURE 的变体),只是不保证与全量结果一致
B. 全局依赖性导致增量困难准确描述了 HAC 的理论瓶颈,"通常较困难"的表述既严谨又符合实际
C. 新增样本无需计算距离明显错误。任何基于距离的聚类算法都必须计算新样本与已有结构的距离
D. 可高效在线更新且结果完全一致与 HAC 的全局依赖性质矛盾。目前没有任何通用 HAC 增量算法能保证与全量重跑完全一致的同时保持高效

10.8、马尔科夫不等式

11、大模型量化

11.1、量化影响因素

参考:https://zhuanlan.zhihu.com/p/2025924994631221677

12、Prefill和Decode

参考:https://zhuanlan.zhihu.com/p/2020090480008930343

(1)Prefill和Decode为什么不能放到一起:https://zhuanlan.zhihu.com/p/2063134827772130211

Prefill 负责一次性处理完整 prompt,更依赖 GPU compute,主要影响 TTFT

Decode 负责逐 token 生成答案,需要频繁读取 KV cache,更依赖 memory bandwidth,主要影响 TPOT

如果两者一直运行在同一组 GPU 上,长 prompt 的 Prefill 很容易干扰正在进行的 Decode,导致 latency spike、GPU utilization 不稳定,以及 TTFT 和 TPOT 很难同时优化。

13、多头注意力机制

13.1、基本原理

参考:深度学习之MHA|MQA|GQA|MLA注意力机制对比分析-腾讯云开发者社区-腾讯云

考题:注意力机制的主要作用是什么?

自注意力通过 O(1)O(1) 路径长度直接连接任意位置,使全局上下文交互成为可能,每个输出 token 都是所有输入 token 的加权组合,权重由内容动态决定,可以建模序列元素之间的长距离依赖。

13.2、多头注意力机制计算量

参考:LLM注意力机制计算量分析 https://zhuanlan.zhihu.com/p/1948538300169172299

MHA的原理和参数量计算: 第8讲、Multi-Head Attention 的核心机制与实现细节 - 何双新 - 博客园

  • A. 并非所有注意力变体都需计算 QKTQKT 

  • 标准Attention确实需要计算 QKTQKT (复杂度 O(N2)O(N2) ),但线性注意力(Linear Attention,如Performer、RWKV、Mamba等)通过核技巧或状态空间模型将注意力转化为线性递推形式,完全避免了显式的 QKTQKT 矩阵乘法。因此“并非所有”这一表述是正确的。

  • B. MHA的参数量可能不随头数线性增长 ❌
    在标准MHA中,当总维度 dmodeldmodel​ 固定时,无论头数 hh 如何变化, WQ,WK,WVWQ​,WK​,WV​ 的总参数量恒为 3×dmodel23×dmodel2​ ,与头数完全无关(即参数量恒定,而非“可能不线性增长”)。该选项表述模糊且易误导,不属于准确描述。若改变总维度则另当别论,但这已超出MHA标准定义范畴。

  • C. MLA的训练速度通常快于MHA ❌
    MLA(Multi-head Latent Attention)的核心设计目标是推理时压缩KV Cache,其训练过程涉及联合压缩/解压及额外的投影操作,计算开销通常不低于甚至略高于标准MHA。MLA并未以训练加速为主要优化方向,该表述错误。

  • D. GQA在推理时可减少K/V缓存的内存占用 ✅
    GQA(Grouped Query Attention)让多个Query头共享同一组Key/Value头,使推理时KV Cache大小降为MHA的 1/G1/G ( GG 为每组Q头数),显著降低显存占用,同时保持接近MHA的性能。这是GQA被Llama-3、Qwen2等主流模型采用的核心原因,表述准确无误。

13.3、Flash Attention / Flash Decoding

Flash Decoding原理参考:https://zhuanlan.zhihu.com/p/2006503288565163143     

https://zhuanlan.zhihu.com/p/661478232

Flash Attention的基本原理参考:https://zhuanlan.zhihu.com/p/2006503288565163143

Flash Attention 的核心是融合注意力计算流程,减少注意力权重矩阵的读写操作。GPU 的计算速度远快于内存访问速度,减少内存交互可显著提升整体效率。本节将详细介绍 Flash Attention 的实现原理。由于 Flash Attention 1.0 版本和 2.0 版本在实现细节上有巨大差异,而后续版本的改进主要集中在实现细节上,因此我这里主要基于 Flash Attention 2.0 版本的核心思想进行介绍。

Flash-Decoding,可以推理过程中显著加速attention操作(例如长序列生成速度提高8倍)。其主要思想是最大化并行加载keys和values的效率,通过重新缩放组合得到正确结果。

14、截断误差和舍入误差

参考:https://www.zhihu.com/question/392307362

  • 截断误差(Truncation error)是最为重要的误差,会出现在微分方程的求解、数值积分、数值微分等方方面面。所谓的“截断”,即是指在将物理量进行离散处理时,抛弃了高阶项。一般使用阶数来描述离散方法的精度。
  • 收敛误差一般出现在使用迭代方法求解问题时,由于未能完全收敛而引入的误差(实际上也不可能实现真正意义上的收敛),例如用高斯赛德尔迭代求解线性方程组、牛顿方法求解非线性方程组、幂迭代求解最大本征值、使用Picard迭代求解大型的非线性物理场耦合问题等。
  • 舍入误差由有限位数的浮点数来表示实数的时引入。具体大小与浮点数类型相关,舍入误差常从Random walk的角度对其进行量化。
  • 随机方法中的误差,是指使用基于概率论的方法来求解问题时引入的“误差”,例如使用蒙特卡罗方法估计面积、模拟粒子的random walk。在粒子蒙卡模拟领域,随机方法中的误差更严谨地来说可以分为系统误差与统计偏差。后者是我们常见的方差,即投入模拟的粒子数不足时引入的随机波动;而前者,则是由于粒子数不足,导致无法对复杂的几何和物理量进行准确描述而引入的误差。


15、分词算法

15.1、分词算法基本原理

现代大语言模型(LLM)子词分词算法

  • 字节对编码(BPE) :从基础字符(或字节)出发,统计语料中最高频的相邻对并不断合并,直到达到设定的词表大小。如 GPT 系列、Llama 均采用此法。 [1]
  • WordPiece :与 BPE 类似,但合并标准基于语言模型的似然得分最大化而非单纯频率,如 BERT 使用带有 ## 前缀的 WordPiece。 [1]
  • Unigram :采用“自顶向下裁剪”策略,从一个超大词汇表开始逐步删除对整体似然影响最小的词元。 [1]
  • SentencePiece :谷歌推出的无损分词库,直接将空格视为特殊字符处理,对中文、英文等多语言无缝支持。

参考:

(1)BPE分词算法 NLP-分词算法(一):Byte-Pair Encoding (BPE) / Byte-level BPE【BPE是char级别】_bpe算法-CSDN博客

(2)WordPiece分词算法:【大模型实战篇】大模型分词算法WordPiece分词及代码示例-CSDN博客

15.2、BPE和WordPiece分词算法对比

考点:下面哪些说法是正确的?

  • A. 在BPE中,每轮迭代总是合并出现频次最高的符号对(正确)
    这是 BPE 算法的核心机制。BPE 从字符级词表开始,统计所有相邻符号对的出现频率,贪心地选择频次最高的符号对进行合并,并将该合并操作加入规则列表,然后更新语料中的符号序列,重复此过程直到达到预设词表大小或满足停止条件。因此,“每轮合并频次最高符号对”是 BPE 的定义性特征。

  • B. WordPiece在每次合并时基于语言模型最大化似然,而非简单频次(正确)
    WordPiece 与 BPE 的关键区别在于合并准则。WordPiece 并不直接选择频次最高的符号对,而是选择使训练数据语言模型似然增加最大(等价于 perplexity 下降最多)的符号对进行合并。

  • C. 两者都会把罕见词切分为更频繁的子词单元(正确)
    这是子词分词的共同设计目标。无论是 BPE 还是 WordPiece,都通过自底向上的合并策略,将高频子词保留在词表中,而低频词或未见词则被分解为这些高频子词的组合。例如,“unhappiness”可能被切分为 “un”, “happi”, “ness”,每个子词都比原词更常见。这种机制有效缓解了未登录词问题,并平衡了词表大小与语义表达能力。

❌ 错误选项解析

  • D. 如果使用相同语料训练,BPE与WordPiece最终得到的词表一定完全相同(错误)
    尽管两者输入相同,但由于合并准则不同(频次 vs. 似然增益),它们在每一步选择的合并对可能不同,导致后续符号序列演化路径分歧,最终词表通常不一致。大量实证研究(如 Hugging Face Tokenizers 文档、相关论文)已证实:即使词表大小相同,BPE 和 WordPiece 生成的词表存在显著差异。此外,实现细节(如预处理、Unicode 处理、初始词表等)也会进一步加剧差异。

16、因果编码

基础原理参考:一步一步理解大模型:因果掩码_causal mask-CSDN博客

掩码矩阵的构建:https://zhuanlan.zhihu.com/p/16961969131

GPT的训练方法是使用因果掩码(causal mask),让模型在预测当前令牌时不能看到未来的令牌

17、激活函数

参考:激活函数总结sigmoid,tanh,relu,Leaky ReLU,RRelu,ELU,PRelu,SELU,swish_rrelu,prelu-CSDN博客

17.1、激活函数对应参数初始化算法

参考:https://cloud.tencent.com/developer/article/1587082  深度学习参数初始化(weights initializer)策略大全_glorot uniform-CSDN博客

考点:隐藏层使用 Tanh 时,权重初始化应注意什么

Tanh 激活函数的输出范围为 [-1, 1],且在输入接近 ±∞ 时梯度趋近于 0(饱和区)。权重初始化必须与之匹配:

选项问题
A. 全零初始化❌ 所有神经元输出相同 → 对称性问题,网络无法学习
B. 很大的值❌ Tanh 进入饱和区 → 梯度消失,训练停滞
C. Xavier 等小值随机初始化✅ 保持各层方差一致,避免饱和与梯度问题,Xavier (Glorot) 初始化专门为 Sigmoid / Tanh 类激活函数设计,目标:使每一层的输入方差 ≈ 输出方差,从而:
  • 信号在前向传播中不会逐层爆炸或消失
  • 梯度在反向传播中保持稳定
  • Tanh 工作在其线性敏感区(接近原点),梯度最大
D. 全负数❌ 同样存在对称性/偏差问题,无理论依据
激活函数推荐初始化原因
Tanh / SigmoidXavier (Glorot)对称、零中心,需控制方差
ReLU / Leaky ReLUHe (Kaiming)非对称、半波整流,方差需补偿
SELULeCun Normal自归一化特性要求特定方差

17.2、ELU/SELU激活函数

参考:https://zhuanlan.zhihu.com/p/7891858656

17.3、哪些激活函数更有助于缓解深层网络的梯度消失?

核心原理

梯度消失的根源在于激活函数导数在大部分输入区间内 远小于 1,导致反向传播时梯度连乘后指数级衰减。缓解该问题的关键是:在正区间(甚至全区间)保持导数恒为 1 或接近 1


逐项分析

选项是否缓解梯度消失说明
A. Sigmoid❌ 加剧导数最大值仅 0.25,饱和区趋近 0,是梯度消失的典型元凶
B. Leaky ReLU✅ 有效缓解正区间导数=1;负区间有非零小斜率,同时缓解梯度消失与神经元死亡
C. Tanh❌ 仍会消失虽比 Sigmoid 好(零中心化),但饱和区导数仍趋近 0,深层网络中问题依旧
D. ReLU✅ 有效缓解正区间导数恒为 1,梯度无衰减地反向传播,是深度学习复兴的关键设计

18、模型对齐

参考:https://zhuanlan.zhihu.com/p/704550807

大模型的对齐技术旨在使模型的行为和人类的意图和价值相一致[1]对齐算法(例如SFT和RLHF[2])能够对齐因训练数据集中不可避免的偏见与有害内容而产生不对齐行为的大语言模型,然而这种对齐是否真正深入模型表征或是仅仅停留于表面任然不得而知。现有的研究已经表明:经过安全对齐的模型通过极少量恶意数据微调即可以再次变得不安全[3];即使使用非恶意数据微调经过安全对齐的大语言模型也会削弱模型安全机制[4]

✅ 模型对齐风险因素考点:

模型对齐(Alignment)旨在使大语言模型的输出符合人类价值观与安全规范。当对齐失效时,有害内容生成风险显著上升。所有选项均为已验证的风险因素,具体机制如下:


A. 安全微调数据质量不足

  • 安全对齐(如 RLHF、DPO、SFT)高度依赖高质量、覆盖全面的拒答/安全响应样本
  • 若数据存在以下问题:
    • 有害类别覆盖不全(如遗漏新型攻击模式)
    • 安全回复模板化、缺乏多样性
    • 标注噪声或错误标签
  • 模型将无法泛化到真实世界的复杂恶意查询,导致对齐“表面化”。

✅ 增加风险


B. 推理温度设置过高导致低概率不安全输出更易被采样

  • 温度(Temperature)控制输出分布的平滑度。高温使采样更随机,提升长尾(包括不安全)token 的被选概率
  • 即使模型在 greedy decoding 下安全,高温可能激活训练中被抑制但未完全消除的有害模式。
  • 实验表明:温度 > 1.0 时,越狱成功率和毒性评分显著上升。

✅ 增加风险


C. 训练语料含大量未妥善处理的有害内容

  • 预训练阶段若未有效过滤或去毒,模型会内化有害知识表征
  • 后续对齐难以彻底“擦除”这些深层表征,仅能表层抑制。
  • 尤其在对抗性输入下,预训练中学到的有害关联易被重新激活(即“对齐脆弱性”)。

✅ 增加风险


D. 攻击者构造越狱提示词

  • 越狱(Jailbreaking)通过语义伪装、角色扮演、编码转换等手段绕过安全对齐机制
  • 常见策略包括:
    • 指令注入(“忽略之前指令”)
    • 多轮诱导逐步突破防线
    • 利用模型对特定格式(如代码、诗歌)的宽松处理
  • 这直接暴露对齐的鲁棒性缺陷,是当前最主要的实际攻击面。

✅ 增加风险

19、精确率计算

考点:混淆矩阵 TP=40、FP=10、FN=20、TN=30,精确率是多少

淆矩阵一览

预测正预测负
实际正TP=40FN=20
实际负FP=10TN=30
指标公式本题值
精确率 (Precision)TP/(TP+FP)80% ✅
召回率 (Recall)TP/(TP+FN)40/60 ≈ 66.7%(选项C)
F1-Score2·P·R/(P+R)2×0.8×0.667/1.467 ≈ 72.7%
准确率 (Accuracy)(TP+TN)/Total70/100 = 70%
特异度 (Specificity)TN/(TN+FP)30/40 = 75%

20、模型运行环境问题

20.1、模型运行异常检查

考点:排查模型未在 NPU 上运行时,应优先检查哪项

当模型未在 NPU 上运行时,最直接的根因往往记录在模型转换/编译日志中。NPU 工具链(如 ATC、torch_npu 编译器)在遇到以下情况时会明确输出关键信息:

  • unsupported op:算子不被 NPU 支持,导致整个图或部分子图回退 CPU
  • fallback:框架自动将不支持的操作降级到 CPU 执行
  • compile fail:图编译失败,模型根本无法部署到 NPU

这些日志提供了确定性的诊断证据,能直接定位问题根因。✅

21、浮点运算

考点:浮点运算的特点

浮点运算是计算机数值计算的基石,其设计遵循 IEEE 754 标准。与数学中的实数运算相比,浮点运算具有一系列独特且必须警惕的特点。以下是系统性总结:


核心特点总览

特点说明是否成立
有限精度用固定位数表示无限实数集,必然存在舍入✅ 根本特性
非均匀分布数值密度随量级变化,越靠近0越密
交换律(+、×)fl(a∘b)=fl(b∘a)fl(a∘b)=fl(b∘a)✅ 对有限数成立
结合律(a+b)+c=a+(b+c)(a+b)+c=a+(b+c)❌ 不成立
分配律a×(b+c)=a×b+a×ca×(b+c)=a×b+a×c❌ 不成立
精确表示整数/十进制小数所有整数或十进制小数都能精确表示❌ 仅部分成立
运算结果确定性相同输入 → 相同输出✅ IEEE 754 保证

22、RAG

RAG的作用:

检索增强生成(RAG)是解决大语言模型(LLM)实际使用中的一套完整的技术,它可以有效解决LLM的三个主要问题:数据时效性幻觉数据安全问题

22.1、检索ReRank

参考 :https://zhuanlan.zhihu.com/p/676996307

主要作用:提高检索精度

23、量化

大模型常采用的两个算法:https://zhuanlan.zhihu.com/p/662881352

23.1、权重量化

参考:https://zhuanlan.zhihu.com/p/11886909512

大模型权重量化是 将模型参数(如权重 W)从高精度浮点数(如 FP16、BF16 或 FP32)转换为低精度表示(如 INT8、INT4、FP8)的技术 。它的核心是用极小的精度损失换取模型体积的大幅缩小和推理速度的提升。

23.2、KV Cache量化

参考:大模型推理优化技术-KV Cache量化

KV cache 量化 是 一种大模型推理优化技术 。它把推理时缓存的 Key 和 Value 矩阵从高精度(如 FP16 或 BF16)压到低比特(如 INT8、INT4 或 FP8)。这能大幅减少显存占用、支持更长的文本输入、提升并发处理能力。

考点:端侧部署 3B Transformer 时采用 INT4 权重量化与 INT8 KV Cache 量化,正确的有哪些?

解析:

A【正确】:降低KV Cache占用后可以支持更长生成序列

B【错误】:量化必然提升精度并增加延迟

C【正确】:量化可降低显存占用

D【正确】:长文本生成中量化误差可能累积

24、剪枝

参考:https://zhuanlan.zhihu.com/p/691160917

模型剪枝(Model Pruning)是一种用于减少神经网络模型参数数量和计算量的技术。它通过识别和去除在训练过程中对模型性能影响较小的参数或连接,从而实现模型的精简和加速。

通常,模型剪枝可以分为两种类型:结构化剪枝(Structured Pruning)、非结构化剪枝(Unstructured Pruning)。

结构化剪枝和非结构化剪枝的主要区别在于剪枝目标和由此产生的网络结构。结构化剪枝根据特定规则删除连接或层结构,同时保留整体网络结构。而非结构化剪枝会剪枝各个参数,从而产生不规则的稀疏结构。

    评论
    添加红包

    请填写红包祝福语或标题

    红包个数最小为10个

    红包金额最低5元

    当前余额3.43前往充值 >
    需支付:10.00
    成就一亿技术人!
    领取后你会自动成为博主和红包主的粉丝 规则
    hope_wisdom
    发出的红包
    实付
    使用余额支付
    点击重新获取
    扫码支付
    钱包余额 0

    抵扣说明:

    1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
    2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

    余额充值