单位 10 / 12

使用安全:无泄漏、保密

收益:

  • 能够对包含秘密、个人数据和机密业务资产的数据进行分类并识别红线
  • 输入数据之前使用合成数据进行屏蔽、匿名和保护
  • 经过批准的工具选择、上下文最小化以及在泄漏时应用关键旋转反射的能力

您粘贴到编码助手中的任何内容都可能超出您的控制。 API 密钥、客户数据库转储、尚未公布的专有源代码或患者记录——一旦进入未经批准的工具,这些内容可能会成为不可逆转的泄漏。对于软件团队来说,人工智能的最大风险不是来自线路错误,而是来自不小心的复制粘贴。本单元旨在确保复制粘贴安全。

在这里,我们区分三件事:哪些数据不应该输入,哪些工具可以使用哪些保护措施,以及如何在输入数据之前保护数据(屏蔽、合成数据、本地工作)。这不是一个可选的“那就太好了”;这是大多数机构的合同和法律义务。

为什么它如此重要?

您发送到人工智能工具的数据;在提供商的服务器上处理的数据,有时会存储一段时间,可用于改进某些产品设置中的模型。仅仅说“我删除了聊天记录”通常是不够的;数据离开网络的那一刻,风险就出现了。此外,泄露的成本很高:泄露的云密钥可能在几分钟内被滥用,泄露的客户数据可能会导致根据 KVKK/GDPR 等法规进行通知和处罚,泄露的私有源代码可能会破坏竞争优势。

因此,经验法则很简单:不要将任何您无法承受丢失的东西放入未经批准的车辆中。如有疑问,请勿进入。

注意:“一次就快”的心态是泄漏的最常见原因。在解决紧急错误时粘贴生产日志或配置文件正是在压力下做出的此类决策所发生的情况。紧急情况并不暂停保密规则。

绝对不应该输入的内容(红线)

  • 秘密:API 密钥、密码、云访问密钥、私有证书、令牌、连接字符串。
  • 个人数据 (PII):姓名、TR ID 号、电子邮件、电话、地址、健康/财务记录、客户数据。
  • 机密商业资产:未公开的源代码、专有算法、内部架构秘密、合同细节。
  • 受监管数据:特殊受保护类别,例如医疗保健、支付卡 (PCI)、个人理财。

一步一步:安全使用流程

  1. 对数据进行分类。您所拥有的属于哪一类——公开的、内部的、保密的、受监管的?
  2. 按类别选择车辆。机密/受监管数据仅在机构批准的提供数据保证的工具中进行处理(不在教育中使用、保留限制、区域处理)。
  3. 进入前确保安全。剥离秘密、屏蔽/匿名化 PII、如果可能的话使用合成(虚构但真实的)数据而不是真实数据。
  4. 最小化上下文。将您的问题减少到不包括敏感部分的最小可重现示例。
  5. 还要检查输出。检查人工智能生成的代码中是否存在硬编码秘密或数据残留。

三个迷你箱

情况 1 — 粘贴的密钥被取消。一名开发人员在修复错误时将整个配置文件粘贴到AI中;该文件包含实时第三方 API 密钥。当团队注意到后,他们立即取消(轮换)密钥并制作了一个新密钥;虽然没有发生虐待事件,但这是一起“廉价”事件。经验教训:在粘合之前先除去釉料,如果釉料泄漏,请立即转动钥匙。

案例 2 — 综合数据拯救了业务。一个团队在实际客户记录中遇到解析错误。他们没有输入真实数据,而是生成了 20 行结构相同但完全伪造的合成数据,用它重现了错误,并用人工智能解决了它。 PII 既没有泄露,诊断也没有放缓;合成数据既安全又充足。

案例 3 — 打印输出中隐藏的秘密。在生成示例配置时,AI 在其中嵌入了一个看起来逼真的“示例”密钥,并在开发人员没有注意到的情况下将其获取到代码中;代码库扫描(秘密扫描器)发现了这一点并发出警告。不可变的秘密永远不应该写入代码中;正确的方法是使用环境变量或机密管理器。教训:也扫描输出中的秘密。

四个可复制模板

进入前屏蔽检查表(自我):

在将此文本提供给 AI 之前,请确保我删除了以下内容并将您找到的内容替换为 [MASKED]:API 密钥、密码、令牌、连接字符串、姓名、电子邮件、电话、ID 号、客户数据。文字:{{文字}}

综合测试数据生成:

根据以下方案生成完全捏造的(与真人/机构无关){{N}}行测试数据。使其看起来真实,但不要使用任何真实的 PII。架构:{{字段和类型}}包括边缘情况(空、边界、格式错误)。

固定秘密狩猎(在代码中):

在此代码/配置中查找硬编码的秘密:密钥、密码、令牌、自定义 URL。如果找到它,请指定其位置并建议正确的方法(环境变量/秘密管理器)。代码:{{代码}}

车辆合格评定(按数据类别):

我有以下类型的数据:{{class:公共/内部/机密/受监管}}。我打算使用的工具是:{{tool}}。在使用此工具处理这些数据之前,我应该确认哪些保护措施(存储、不在教育中使用、区域、访问)?给出一个清单。决定权在我;你澄清一下标准。

弱提示/强提示

弱:(粘贴从生产数据库中提取的 200 条真实用户行)“为什么此数据存在解析错误?”
Strong:“下面有 15 行,其结构与真实数据相同,但完全是合成的(无 PII)。parse_user() 在其中 3、8 和 12 行上抛出 ValueError。常见模式可能是什么,如何修复它?”

强版本不包含真实的个人数据,同时保留重现错误所需的结构。诊断保持不变,风险被重置。

数据类

可以用AI处理吗?

先决条件

公开的

是的

内部使用(非精度)

一般来说

遵守公司政策

机密(源代码、商业秘密)

仅限经批准的车辆

企业保证+最小化

PII / 受监管

一般来说没有

屏蔽/匿名或使用合成

政策合规与追踪

安全使用不仅仅是一种个人习惯,它是一个公司系统:哪些工具得到批准,哪些数据类可以去哪里,以及发生违规时该怎么做,都应该在书面政策中定义。如果机密被泄露,最重要的第一步不是惊慌,而是立即恢复(取消并生成新的)泄露的凭证并报告事件。如果您不知道组织的批准工具和数据分类规则列表,您的首要任务就是学习它们。

提示:在编辑器/CLI 工具中定义特定于项目的“忽略”列表(例如 .env、隐藏文件夹、身份文件),以便这些文件不会意外包含在助手的上下文中。预防总是比清理便宜。

常见错误

  • “仅粘贴一次”敏感数据。紧急不暂停红线;最常见的泄漏发生在此处。
  • 想着“我要删除对话”。数据离开网络的那一刻,风险就产生了;删除并不会撤消它。
  • 选择车辆时不考虑其类别。使用个人账户处理企业机密数据属于严重违法行为。
  • 不扫描输出。人工智能可以将不可变的秘密嵌入到代码中;还可以使用秘密扫描仪检查生产情况。
  • 当秘密泄露时不转动它。不撤销泄露的密钥会将泄露变成实时攻击。

综上所述

软件中的人工智能最大的风险是隐私泄露,而其中大部分源于在胁迫下做出的复制粘贴决定。规则很明确:秘密、个人数据、机密商业资产和受监管数据不得输入未经批准的工具。在输入之前对数据进行分类,按类别选择代理,提取机密,屏蔽 PII 或使用合成数据,最小化上下文,并扫描输出以查找机密。如果发生泄漏,第一件事:返回凭证并报告。

应用任务

取一段你最近向人工智能提供(或正在考虑提供)的代码/日志/数据。首先,使用“屏蔽清单”模板识别其中的秘密和 PII 候选者。然后,如果它包含真实数据,则生成与“合成测试数据生成”模板相同但完全组成的版本,并使您的问题可以用它重现。最后,查找并阅读您所在机构批准的工具列表和数据分类政策;否则,请注意此遗漏。

清单

  • [ ] 我在输入数据之前对其进行分类(公开/内部/机密/受监管)。
  • [ ] 我绝不会将机密、PII 和机密业务资产输入未经批准的工具中。
  • [ ] 我尽可能使用屏蔽或合成数据而不是真实数据。
  • [ ] 我将上下文简化为不包含敏感部分的最小示例。
  • [ ] 我扫描人工智能输出,寻找难以掩埋的秘密。
  • [ ] 我知道,如果泄密,我会立即归还身份信息并报告事件。