大模型面试八股整理 bert 篇

节前,我们星球组织了一场算法岗技术&面试讨论会,邀请了一些互联网大厂朋友、参加社招和校招面试的同学.

针对算法岗技术趋势、大模型落地项目经验分享、新手如何入门算法岗、该如何准备、面试常考点分享等热门话题进行了深入的讨论。

汇总合集:《大模型面试宝典》(2024版) 发布!


今天对 bert 大厂常见面试题进行汇总,喜欢点赞、收藏、关注,更多技术、面试,文末入群交流。

a. Self-Attention的表达式
b. 为什么上面那个公式要对QK进行scaling
c. self-attention一定要这样表达吗?
d. 有其他方法不用除根号dk吗?
e. 为什么transformer用LayerNorm?有什么用?
f. 为什么不用BN?
g. Bert为什么要搞一个positionembedding?
h. Bert为什么三个embedding可以相加?
i. transformer为什么要用三个不一样的Qkv?
j. 为什么要多头?举例说明多头相比单头注意力的优势
k. 为什么Bert中要用WordPiece/BPE这样的subwordToken?
l. Bert中为什么要在开头加个[CLS]?
m. 不用cLS]的语义输出,有其他方式可以代替吗?
n. Bert中有哪些地方用到了mask?
o. 预训练阶段的mask有什么用?
p. attention中的mask有什么用?(BERT中)
t. Bert是如何处理传统方法难以搞定的溢出词表词(oov)的语义学习的?
u. 中文是如何处理溢出词表词(oov)的语义学习的?
x. 为什么说GPT是单向的Bert是双向的?
y. Bert如何处理一词多义?
z. Bert中的transformer和原生的transformer有什么区别?
z+. Albert是通过什么方法压缩网络参数的?有什么问题?
z+2. attention计算方式以及参数量,attentionlayer手写,必考。

技术交流

前沿技术资讯、算法交流、求职内推、算法竞赛、面试交流(校招、社招、实习)等、与 10000+来自港科大、北大、清华、中科院、CMU、腾讯、百度等名校名企开发者互动交流~

我们建了算法岗面试与技术交流群, 想要进交流群、需要源码&资料、提升技术的同学,可以直接加微信号:mlc2040。加的时候备注一下:研究方向 +学校/公司+CSDN,即可。然后就可以拉你进群了。

方式①、微信搜索公众号:机器学习社区,后台回复:技术交流
方式②、添加微信号:mlc2040,备注:技术交流+CSDN

用通俗易懂的方式讲解系列

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值