Synthetic Cognitive Walkthrough: Aligning Large Language Model Performance with Human Cognitive W...

文章总结与翻译

一、主要内容

本文聚焦于利用大型语言模型(LLMs)自动化认知走查(CW)这一可用性测试方法,核心探索LLMs能否模拟人类在CW中的行为,以降低传统测试的成本和资源消耗。

研究设计

  1. 双角色LLM代理架构:设计了 facilitator(引导者)和 evaluator(评估者)两个AI代理,分别模拟CW中的研究人员引导角色和用户评估角色,通过迭代优化的提示词实现界面导航、思维外显和流程推进。
  2. 两项对比研究
    • 研究1:对比GPT-4、Gemini-2.5-pro与10名人类评估者在两款移动应用(语言学习类、旅行预订类)上的CW表现,从任务完成率、导航路径一致性、潜在失败点识别三个维度展开分析。
    • 研究2:探索通过额外提示词优化LLM对人类潜在失败点的预测能力,对比“有上下文”(LLM完整走查流程)和“无上下文”(仅单屏独立评估)两种模式的效果。

核心发现

  1. LLM与人类的行为差异
    • LLM的任务完成率更高(GPT-4达100%,Gemini-2.5-pro达97.2%,人类为88.2%),导航路径更接近最优路径,步骤更少;
    • 人类评估者在不确定下一步时更倾向于广度优先搜索(探索性行为),且易受记忆误差影响;LLM则更理性,优先选择最可能的
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值