一句话定义
在生成式AI中,幻觉是生成内容不真实或未经输入、提供的来源或可验证证据支持的常见简称——即使听起来合理 [1][2]。
快速回答
当生成的内容没有得到充分证据支持时,就会发生幻觉。流利或自信的措辞会使问题更难被发现。它可能会编造一个事实,错误地陈述一个真实来源,将不同上下文中的细节结合起来,或给出一个看起来正确但不支持该主张的引用。
研究人员和标准机构并不总是以完全相同的方式使用该术语。NIST 常常使用“混淆”。本页面专注于事实性和基础性失败,而不是每一种弱质量或低质量的 AI 输出。
幻觉不仅仅是用户的错误或罕见的打字错误。NIST将虚构和相关可靠性问题识别为需要治理、测量和监控的生成式AI系统中的风险[1]。2024年ACL调查将幻觉视为大型语言、图像、视频和音频基础模型中的广泛问题,不同领域有不同的原因和检测方法[2]。
为什么重要
幻觉很重要,因为AI输出通常以精炼的形式出现。流畅的写作可能使薄弱的证据看起来很强。一个整洁的要点列表可能隐藏缺失的上下文。一个假的引用可能比诚实的“我不知道”更可信。
对于日常用户,主要风险不是每个答案都是错误的。风险是有些错误的答案难以察觉。如果AI工具虚构了一个产品规则、会议引用、研究来源或政策例外,用户可能会将错误带入学业、客户服务、管理决策或公共内容中。
当用户疲惫、匆忙或对主题不熟悉时,问题会更加尖锐。流畅的回答可能感觉像确认,尤其是当它与用户预期听到的内容相匹配时。Richbay应教导读者在某个主张变得足够有用以采取行动时放慢速度,因为那是证据重要的时刻。
如何工作
语言模型从模式和上下文中生成文本。它不会自动知道哪些主张已被验证。如果提示要求的信息缺失、模糊、过时或超出提供的材料,模型仍可能生成一个流畅的答案。该答案可能包含从未被提示或来源支持的细节。
ACL调查将幻觉描述为多原因问题,而不是单一错误和单一修复 [2]。原因可能包括训练数据、模型行为、解码选择、缺失的依据、模糊的提示或评估差距。在产品环境中,周围系统可能增加更多故障点,例如错误的检索、过时的文档或不安全的工具使用。
OpenAI向其用户解释,ChatGPT可能会有误,重要信息应进行核实,这对该产品系列是有用的特定供应商指导[3]。OpenAI在面向研究的材料中还指出,某些评估激励措施可能会奖励自信的答案,即使不确定性更好[4]。这些观点支持谨慎,但不应转化为普遍的幻觉率。
幻觉可以以不同的形式出现。有些是虚构的事实。有些是真实事实被用在错误的地方。有些是省略了条件的摘要。有些是指向真实来源但不指向其旁边声明的引用。对用户来说,实际问题是不仅“答案是假的吗?”还有“这个具体声明是否足够支持此用途?”
端到端示例
在假设的例子中,一名学生向AI助手提问:“找到三篇关于睡眠和记忆的同行评审文章,并给我引用。”助手返回了三个看起来正式的引用。其中一篇论文确实存在,一篇标题接近但作者错误,另一篇引用完全是虚构的。
生成的答案并非无用,但尚未准备好提交。学生应分别在图书馆数据库或出版商网站中搜索每个标题,打开论文记录,确认作者和出版详情,并检查该论文是否确实支持所写的句子。如果找不到引用,应将其删除而不是信任它。
常见误解
一个常见的误解是,通过更礼貌地提问或在提示中添加“不要幻觉”可以解决幻觉问题。明确的提示可以帮助设定边界,但不能保证真实性。当任务要求的事实模型没有时,或者提供的上下文不完整时,模型仍可能产生无依据的声明。
另一个误解是引用可以自动解决问题。只有当引用是真实的、相关的并且确实支持该说法时,引用才有帮助。来源链接可能已失效、不相关、过时,或者与错误的句子相关联。
风险和限制
风险取决于决策。电影推荐中的虚构细节通常风险较低。而虚构的安全程序、法律规则、财务细节、医疗声明或客户账户事实可能会造成真正的伤害。NIST将生成式AI的风险视为与上下文相关的,这意味着审查过程应与风险程度相匹配[1]。
没有适用于每个模型、任务、语言、产品和日期的通用公共幻觉率。幻觉率会随着评估设计、领域、提示、检索设置和模型版本而变化。在没有检查来源和上下文的情况下发布一个数字会误导读者。
实用判断检查表
当AI答案包含事实性陈述时,问:哪些陈述如果错误会有影响?每个重要陈述是否有来源?我是否打开了来源?来源是否说了同样的内容?来源是否足够新?该陈述是否超出提供的材料?AI是否在应该表达不确定的地方表达了不确定性?
当答案包含引用、统计数据、引语、政策规则、命名人物、日期、技术限制、法律语言、医学语言、安全指南或影响他人的指令时,请使用更高的谨慎态度。将输出视为调查的线索,而不是证明。
如果无法核实一个声明,就降低其地位。将其重写为一种可能性,删除它,或要求提供可打开的来源。如果任务风险很高且没有可靠来源可用,正确的答案可能是停止而不是润色AI输出。细心的用户不需要不信任每一个答案;他们需要根据证据、上下文和可能的危害来匹配信任。