🐶一个真实的翻车事件
话说某不愿透露姓名的同事在某次给领导同事们汇报大语言模型应用探索工作进展的时候,让AI找了一下大模型应用方面的政策支持方面的建议,AI建议该同事可以依据政策文件《xxxx人工智能应用项目申报》进行申报,最高可提供200万政策扶持支持,而且有相关的文章引用,于是直接采纳了相关内容。 在汇报时,对政策敏感的行财高管提出,“这么好的政策我们不可能没注意到啊?”,此话点亮了一众人员的好奇心,纷纷进行了度娘搜索核实,最终大家都认识到这是一个子虚乌有的政策,不得不说该同事也是费尽心机、煞费苦心、用心良苦...... 用“以身试毒”的勇气成功带领众人真实的体验了一番AI幻觉,此处省略领导同事们对ta的一顿长达3000字的赞美。
🐶AI幻觉
那,什么是AI幻觉?通俗讲就是:AI一本正经的胡说八道,也就是专业术语里面的“AI幻觉”。而AI幻觉又可以分为事实性幻觉和忠实性幻觉。
实性幻觉,像该同事的翻车事件就是一种事实性幻觉:与现实情况不符合的胡说八道。依据其他事实杜撰的事实,理解了提问者的意图并且在表面上给出了符合逻辑的答案。
忠实性幻觉,忠实性幻觉就是问非所答,比如:
你问: 好好上班可以发财吗?
AI回:好好上班是每个员工的基本职业操作,是一种义务,也是一种权利,每个人都有劳动的权力,神圣不可侵犯。
ps: 随着大模型的越来越先进,几乎测试不到忠实性幻觉了。
🐶AI幻觉防不胜防,简单教你几招吧!
先说重点:觉得好用麻烦点赞收藏!
1 开启联网搜索
自从DeepSeek面世并且开源之后,一众大模型也迎来了集体升级,其中一项关键能力就是支持“联网搜索”,而联网搜索能有效降低AI模型生成内容的幻觉率。

清华大学人工智能学院发布的报告《DeepSeek 与幻觉》里就有证明:打开 AI 大模型的【联网搜索】功能可以一定程度上降低 AI 幻觉率。

2 开启交叉验证
不要局限于一个AI产品的回复,可以把DeepSeek的回复去问其他大模型,让他们也一起帮忙验证“答案”是否正确。 比如豆包、千问、元宝等。用魔法打败魔法,后面我们开发的智能体也是要参考此类思想,不要拘泥于一个大模型,要AI监督AI。
如果是专业领域的搜索,比如要写咨询报告或者论文之类的,该同事也让小编我给大家推荐一下使用“秘塔AI搜索”,可以指定AI引用特定文库,比如知网,用过都说好,比如小编自己,建议一试。

3 使用更靠谱的提示词工程
此类方法又有很多,以下是归集的3种:
1 限定知识边界
限定时间:基于2022年之前的公开学术文献进行解释;
限定来源:基于《xx书》《xxx报告》回答,信息不明确则注明“暂时缺乏可靠数据支持”
角色扮演:角色扮演年轻人都喜欢,小编喜欢,所以小编是年轻人。 请指出此句是否存在逻辑谬误。 岔开了,比如作为金融信用专家,请列举2022年以来国家发布的关于金融征信领域的政策。
提示词插入权威数据:根据公司业务开展调研报告《xxxxx报告》显示,2025年单份报告成本比例已下降至30%,但数据获取依然存在瓶颈。请基于此数据,分析我们公司报告业务发展的三个关键挑战,标注挑战与报告的逻辑关联。
2 对抗性提示
1 双重答案法:让AI同时给出两个答案,就像数学解题一样给两种解法。
2 分步验证法:在提示词加入让AI验证步骤,比如问:喝热水能治感冒吗?
拆解为如下几步:1,查阅医学书籍,分析感冒的病理成因,分析喝热水的作用;2,查论文库:近5年有没有相关感冒与喝热水关联的论文;3,查实验:有没有支持事实的实验证据。 4 给出问题答案。
3 证据链法
假设 AI 说:「每天走 1 万步最健康」
就要让它:
1列出依据:WHO 建议/某期刊研究/某医院数据。
2检查每个来源是否自相矛盾。
3检查数据是否针对特定人群。
参考网上的一个提示词结构如下:
请分步完成验证链:
→ 步骤 1:陈述观点______(限 1 句话)
→ 步骤 2:支撑证据(必须包含以下三类来源):
• 权威组织报告:______
• 近 3 年顶刊论文:______
• 大样本实验数据:______
→ 步骤 3:矛盾排查
► 检查上述三类来源中是否存在:
- 统计方法冲突(是/否)
- 研究结论相斥(是/否)
- 利益相关方资助(是/否)
→ 步骤 4:输出带警示标识的结论:
「可信结论」______
「风险提示」若存在任 一「是」,需要标注争议点
小结一下,就是:开启联网搜索、开启交叉验证、使用靠谱的提示词。
综上能一定程度上降低AI幻觉的风险,还有其他更好的方法欢迎各位同学提出,但正如AI回复界面里面始终都提醒着用户AI就是如此不负责任的一句话:
内容由 AI 生成,请仔细甄别
始终保持外部的连接,始终带着批判精神

349

被折叠的 条评论
为什么被折叠?



