文章总结与翻译
一、主要内容
本文聚焦于利用大型语言模型(LLMs)自动化认知走查(CW)这一可用性测试方法,核心探索LLMs能否模拟人类在CW中的行为,以降低传统测试的成本和资源消耗。
研究设计
- 双角色LLM代理架构:设计了 facilitator(引导者)和 evaluator(评估者)两个AI代理,分别模拟CW中的研究人员引导角色和用户评估角色,通过迭代优化的提示词实现界面导航、思维外显和流程推进。
- 两项对比研究:
- 研究1:对比GPT-4、Gemini-2.5-pro与10名人类评估者在两款移动应用(语言学习类、旅行预订类)上的CW表现,从任务完成率、导航路径一致性、潜在失败点识别三个维度展开分析。
- 研究2:探索通过额外提示词优化LLM对人类潜在失败点的预测能力,对比“有上下文”(LLM完整走查流程)和“无上下文”(仅单屏独立评估)两种模式的效果。
核心发现
- LLM与人类的行为差异:
- LLM的任务完成率更高(GPT-4达100%,Gemini-2.5-pro达97.2%,人类为88.2%),导航路径更接近最优路径,步骤更少;
- 人类评估者在不确定下一步时更倾向于广度优先搜索(探索性行为),且易受记忆误差影响;LLM则更理性,优先选择最可能的
订阅专栏 解锁全文

3430

被折叠的 条评论
为什么被折叠?



