一句话定义
大型语言模型是一种在非常大的文本数据集上训练的机器学习模型,用于预测标记(文本的小单位)并根据接收到的上下文生成语言 [1]。
快速回答
LLM是许多聊天机器人、写作助手、编码助手和文档工具的引擎。你给它一个提示。它使用提示、对话和训练期间学到的模式来预测下一个标记或一系列标记。答案可以是有帮助的、结构化的和快速的,但默认情况下是生成的输出,而不是经过验证的知识。
最安全的思维模型很简单:LLM非常擅长从上下文中生成合理的语言。它可以解释、总结、翻译、起草、分类、通过示例进行工作并生成结构化分析。现代LLM深受Transformer架构的影响[2]。它们也可能遗漏事实、编造细节或在证据薄弱时显得过于确定。NIST将生成式AI的风险视为组织必须在设计、使用、监控和评估过程中进行管理的问题,而不是仅通过模型选择就能解决的问题[3]。
为什么重要
如今,LLM已经嵌入到搜索工具、办公套件、代码编辑器、支持系统、学习产品和分析工作流中。如果用户不了解他们正在使用的系统类型,他们可能会将草稿视为已验证的答案,或在不考虑数据规则的情况下将私人材料粘贴到工具中。
理解LLMs也有助于人们提出更好的问题。一个包含任务、受众、材料和限制的提示通常会为模型提供更清晰的路径。这并不能保证准确性,但可以减少歧义。它也有助于用户将生成的措辞与仍需要来源的事实区分开来。
这对团队和个人都很重要。教师可以使用LLM来创建练习题,经理可以使用它来重写政策摘要,开发人员可以使用它来起草代码。在每种情况下,模型输出都可以节省时间,但用户仍需在负责任地使用之前检查其适用性、证据和风险。
如何工作
从高层次来看,LLM将输入转换为较小的文本单元,通过模型处理这些单元,并预测接下来应该是什么。现代LLM受到Transformer架构的强烈影响,该架构在2017年的论文《注意力就是你所需要的一切》[2]中引入了基于注意力的序列建模。这篇论文是当今模型架构的重要起源点,但它本身并不定义每一个现代LLM、产品、训练方法或安全系统。
在训练期间,模型从数据中学习统计模式。在使用时,模型通常不会根据您的提示重新训练。它使用提示和可用上下文来生成输出。Google的LLM介绍对于语言模型机制(如标记、上下文、预测和生成文本)很有用,但供应商教育页面不应被视为风险或安全声明的唯一权威来源 [1]。
许多已部署的助手在模型周围添加了额外系统:指令、检索、安全过滤器、工具调用、日志、产品政策和用户界面选择。这些系统可以提高实用性,但可见的回答仍然是生成的语言。OpenAI自己的用户指南指出,其系统可能不准确,用户应验证重要信息;该指南作为特定供应商的建议是有用的,而不是对所有AI系统的普遍保证[4]。
训练与使用之间的区别尤其重要。训练在用户到来之前塑造模型。提示在交互过程中为模型提供特定任务的上下文。检索工具可能添加外部文档。产品规则可能阻止某些输出。当用户看到一个答案时,所有这些层可能都参与其中,因此简单地说'模型知道'或'模型查找'而不了解系统设计是不准确的。
端到端示例
想象一个经理将新的退货政策粘贴到AI助手并问:“用五个要点总结一下,供一线支持人员使用。只使用提供的政策。标记任何需要法律审查的内容。” LLM将提示和粘贴的政策作为上下文读取,然后生成符合要求结构的摘要。
结果可能是一个强有力的初稿。经理仍应检查每个要点是否得到政策支持,是否遗漏了任何条件,以及法律审查标志是否合理。如果政策规定退款取决于国家、产品类型和购买日期,用户应在将摘要发送给团队之前,从源文档中验证这些细节。
常见误解
最常见的误解是LLM像数据库一样工作。数据库存储记录并返回匹配的记录。LLM根据上下文和学习到的模式生成可能的语言。它可能会产生正确的事实,但机制与打开可信记录并复制答案不同。
这种区别很重要。如果你要求定义、草稿邮件或需要考虑的问题列表,生成可能有用。如果你要求法律引用、客户特定账户详情、医疗剂量或当前政策截止日期,你需要权威来源和审查步骤。
风险和限制
LLM可能会产生幻觉,反映数据或设计选择中的偏见,可能错过超出上下文窗口的信息,并对小的提示变化做出不同的反应。当用户在不检查该工具政策的情况下将个人、机密、受监管或专有信息粘贴到工具中时,它们也可能暴露风险。
更长的答案不一定是更好的答案。自信的答案不一定是经过验证的答案。看起来像引用的字符串不一定是真实来源。提示可以改善输出的形状,但不能保证真实性。人工审查可以发现许多问题,但如果审查者缺乏时间、上下文或专业知识,也会失败。
实用判断检查表
在依赖LLM答案之前,请问:它使用了哪些来源材料?哪些主张是重要的?哪些主张是意见、总结或猜测?如果这个答案是错误的,会发生什么?是否包含任何敏感数据?我是否需要人类专家、原始资料或第二次系统检查?
使用LLM进行起草、解释、头脑风暴、总结提供的文本以及使工作更容易开始。在涉及金钱、健康、法律、安全、就业、私人数据、安全或公共主张的决策中要放慢速度。在这些情况下,将LLM的输出视为必须与真实证据核对的草稿。
一个实用的工作流程是让模型生成一个结构化的草稿,然后将输出分为主张、建议和风格选择。风格选择可能只需要编辑。建议需要判断。主张需要来源。这可以保持工具的实用性,而不会让流畅的语言取代验证。