文章核心总结与翻译
一、主要内容
本文聚焦大型语言模型(LLMs)在定性研究的主题分析(TA)中的应用,针对软件工程研究中缺乏可复现的LLM集成方法及系统评估的问题,开展了系统性研究:
- 研究基础:基于Braun和Clarke的反思性主题分析框架,选取2-5阶段设计并迭代优化提示词,以15份软件工程师幸福感相关访谈为数据集,对比LLM生成的编码和主题与资深研究人员的成果。
- 研究过程:测试了ChatGPT 03 mini、GPT-4o、Gemini 2.5 Pro、Claude 4 Sonnet四款模型,由四位专家采用基于该框架质量标准的评分表进行盲评,从清晰度、相关性、主题连贯性等多维度评估输出质量。
- 核心发现:
- 专家在61%的情况下更偏好LLM生成的编码,认为其对研究问题的分析具有实用性;
- LLM存在数据过度碎片化、遗漏潜在解读、主题边界模糊等局限;
- LLM在编码的清晰度和与研究问题的相关性上表现突出,但在潜在语义与表层语义的平衡解读上存在不足。
二、创新点
- 提出了可复现的研究框架:将优化后的标准化提示词与评估体系结合,实现了Braun和Clarke反思性主题分析的可操作化,为LLM集成到定性研究提供了明确流程。
- 开展了实证对比研究:首次在软件工程定性数据中,系统对比LLM与人类生成
订阅专栏 解锁全文

325

被折叠的 条评论
为什么被折叠?



