一句话定义
对于本指南,敏感数据是一个实用的总称,指如果未经适当控制而被泄露、滥用或共享,可能会造成隐私、安全、商业或个人伤害的信息。
快速回答
敏感数据的范围比个人身份信息更广。它可能包括个人数据、凭证、财务记录、健康信息、雇佣详情、机密商业文件、私人通信、客户记录、专有代码、安全发现和内部系统详情。
敏感数据的确切法律含义因司法管辖区、政策、行业和上下文而异。本文不是法律建议。它为AI使用提供了一个实用的安全视角:在粘贴、上传、检索或围绕信息生成之前,问一问泄露是否可能对个人、客户、雇主、合作伙伴、产品或系统造成伤害。
为什么重要
AI工具使数据共享显得随意。用户可以在几秒钟内将合同、支持工单、电子表格、源文件、医疗记录或私人消息粘贴到聊天框中。这种速度很有用,但它可能会绕过电子邮件、存储、分析或客户系统中相同信息的正常检查。
NIST将隐私风险管理视为企业风险管理的一部分,关注个人数据在系统、产品和服务中的流动方式 [1]。生成式AI增加了更多工作流程问题:进入工具的数据是什么,工具可以检索什么,保留了什么,谁可以查看日志,以及输出是否会泄露私人或机密信息 [2]。
OWASP将敏感信息泄露描述为LLM和生成式AI应用程序的主要风险,包括个人信息、财务细节、健康记录、机密业务数据、安全凭证和法律文件[3]。这些例子很有用,但并不是完整的列表。更安全的做法是考虑可能的危害和授权。
如何工作
敏感数据风险可能在AI工作流的多个点进入。用户可能将数据粘贴到提示中。产品可能检索私人文档。工具可能调用数据库。日志可能存储请求。模型输出可能揭示来源细节。同事可能比原始数据允许的范围更广泛地分享输出。
良好的实践始于数据最小化。使用完成任务所需的最小信息量。当不需要时,删除姓名、账户号码、秘密、确切地址、内部ID和不必要的文档部分。NIST隐私框架描述了与组织风险策略一致地管理数据,并明确将数据最小化作为隐私原则[1]。
批准的工具很重要。不同的AI产品有不同的条款、保留设置、管理控制、训练使用选项、日志行为和数据处理协议。用户不应声称每个供应商都使用提示进行训练,也不应声称任何供应商从不这样做。正确的问题是:这个已批准的产品、计划、设置和合同今天允许什么?
访问控制也很重要。增强检索的助手不应检索用户无权查看的文档。编码助手不应泄露存储库中的秘密。支持工具不应泄露其他客户的记录。需要知道的共享适用于AI工作流程,就像适用于其他软件一样。
端到端示例
想象一个经理希望AI助手总结员工反馈。原始文件包括姓名、绩效问题、医疗假说明、薪资问题和私人投诉。即使目标是无害的,将整个文件粘贴到通用工具中也是有风险的。
一个更好的工作流程首先检查该工具是否已批准用于该数据类别。经理删除姓名和不必要的细节,只保留摘要所需的主题,将原始文件存储在批准的系统中,并要求一个不揭示个别故事的汇总摘要。即使这样,在共享之前,仍应有人审查输出以查找重新识别的线索。
常见误解
一个常见的误解是,删除(redaction)可以保证安全。删除可以降低风险,但如果剩余的细节可以识别个人、客户、公司、事件或系统,它可能会失败。伪匿名化也可以减少直接识别,但当其他线索仍然存在时,它不能保证匿名性。
另一个误解是敏感数据仅指个人数据。私有API密钥、未发布的产品路线图、客户合同、漏洞报告、专有代码片段、销售管道或内部调查即使不包含任何个人姓名,也可能具有敏感性。
风险和限制
敏感数据的错误可能导致隐私损害、账户被入侵、客户信任丧失、知识产权暴露、就业损害、监管审查或安全事件。风险可能来自提示、检索的文档、生成的输出、日志、插件、共享链接或复制的摘要。
风险降低不等于保证。批准的工具、访问控制、脱敏、伪匿名化、保留设置和合同控制都有帮助,但它们不能保证所有使用都安全。当数据高度敏感或规则不明确时,最安全的选择可能是避免使用AI工具,直到所有者批准工作流程。
实用判断检查表
在使用数据进行AI处理之前,请问:此工具是否已获准用于此数据?该任务是否需要原始数据?我可以删除标识符或细节吗?输出是否会暴露个人、客户、机密信息、合同、代码库或系统?谁可以查看日志和共享对话?适用的保留和培训使用设置是什么?
对于工作用途,如果不确定,请遵循更严格的规定。使用经过批准的工具,最小权限访问,需要知道的共享,以及记录保留。不要将凭据、秘密、私人客户记录或机密文件粘贴到未经批准的系统中。如有疑问,请在共享前咨询数据所有者或安全/隐私负责人。