文章主要内容与创新点总结
一、主要内容
本文聚焦大型语言模型(LLMs)的模拟自我评估能力,采用心理测量学方法,改编10项一般自我效能感量表(GSES),对10个不同规模(大型≥100B参数、中型10-100B参数、小型<10B参数)的LLM在四种条件(无任务、计算推理、社会推理、总结任务)下开展研究。
研究核心围绕三大目标展开:评估LLMs的模拟自我评估能力、对比不同模型自我效能感表达的差异、探索模型自我评估的稳定性与后续提示对评估结果的影响。通过重复测试、随机调整题目顺序、后续置信度提示等实验设计,结合定量(线性混合效应模型、克朗巴赫系数、组内相关系数等)与定性分析,得出关键发现:
- 所有LLM在计算推理和社会推理任务中均达到100%准确率,但总结任务表现差异显著,主要因遗漏关键信息、启发式假设偏差等导致;
- LLM的自我效能感得分在模型间差异显著(如Grok 4得分最高,Qwen3-30B-A3B-2507在无任务条件下得分最低),且整体低于人类常模(LLMs均值23.58,人类均值29.55);
- 自我评估与实际表现关联性弱,部分低自我效能感模型表现精准,高自我效能感模型在总结任务中未必出色;
- 后续置信度提示多导致自我效能感得分小幅下调,暗示初始评估存在轻微过度自信;
- 高自我效能感模型倾向于更果断、拟人化的推理风格,低得分模型则表现出谨慎、去拟人化的解释逻辑。
二、创新点
- 方法创新:首次将经过验证的心理测量工具
订阅专栏 解锁全文

1321

被折叠的 条评论
为什么被折叠?



