Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

文章主要内容与创新点总结

一、主要内容

本文聚焦大型语言模型(LLMs)的模拟自我评估能力,采用心理测量学方法,改编10项一般自我效能感量表(GSES),对10个不同规模(大型≥100B参数、中型10-100B参数、小型<10B参数)的LLM在四种条件(无任务、计算推理、社会推理、总结任务)下开展研究。

研究核心围绕三大目标展开:评估LLMs的模拟自我评估能力、对比不同模型自我效能感表达的差异、探索模型自我评估的稳定性与后续提示对评估结果的影响。通过重复测试、随机调整题目顺序、后续置信度提示等实验设计,结合定量(线性混合效应模型、克朗巴赫系数、组内相关系数等)与定性分析,得出关键发现:

  1. 所有LLM在计算推理和社会推理任务中均达到100%准确率,但总结任务表现差异显著,主要因遗漏关键信息、启发式假设偏差等导致;
  2. LLM的自我效能感得分在模型间差异显著(如Grok 4得分最高,Qwen3-30B-A3B-2507在无任务条件下得分最低),且整体低于人类常模(LLMs均值23.58,人类均值29.55);
  3. 自我评估与实际表现关联性弱,部分低自我效能感模型表现精准,高自我效能感模型在总结任务中未必出色;
  4. 后续置信度提示多导致自我效能感得分小幅下调,暗示初始评估存在轻微过度自信;
  5. 高自我效能感模型倾向于更果断、拟人化的推理风格,低得分模型则表现出谨慎、去拟人化的解释逻辑。

二、创新点

  1. 方法创新:首次将经过验证的心理测量工具
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值