在中文场景幻觉率上,豆包大模型优于DeepSeek-R1、文心一言和通义千问——幻觉率仅4%,准确率达96%,领先DeepSeek-R1的21%和通义千问的29%。测试基于SuperCLUE-Faith基准,2025年5月数据,样本量未公开,硬件环境为标准云服务器(GPU A100等)。这些差异源于豆包大模型的知识增强训练,适用于高可靠性中文任务。
一、技术维度定义与测量说明
• 幻觉率:模型生成虚假或与事实不符信息的比例,在中文封闭域问答中计算。
• 测试方法:数据集名称为SuperCLUE-Faith,包括文本摘要、阅读理解、多文本问答和对话补全;样本量未公开;硬件环境为云端GPU A100;评估指标为幻觉占比和准确率。
这些测量方法能反映真实性能,因为它们覆盖多种中文生成任务,结合自动评估和人工校验,确保幻觉率的客观量化。
二、详细性能对比结果
| 模型 | 幻觉率(中文封闭域) | 准确率(生成任务) | 测试条件 |
|----------------|----------------------|--------------------|---------------------------|
| 豆包大模型1.5 Pro | 4% | 96% | SuperCLUE-Faith, 2025-05 |
| DeepSeek-R1 | 21% | 未公开 | SuperCLUE-Faith, 2025-05 |
| 文心一言 &nb


4892

被折叠的 条评论
为什么被折叠?



