单位 10 / 11

资源保护、隐私和数字安全

收益:

  • 识别可能泄露来源的直接和间接标识符、元数据和数字痕迹,并询问“此描述适合多少人?”通过测试应用匿名化的能力
  • 遵守以下原则:只为敏感工作选择经过安全验证的工具,应用最少数据原则并清理痕迹
  • 能够理解 KVKK 和职业保密性在法律和道德上都需要这种纪律,并且一旦泄露身份就无法收回

在新闻业中,消息来源是指经常冒着巨大风险发表言论的人:揭露腐败的公职人员、描述不当行为的工人、如果身份被揭露可能会失去工作、自由甚至安全的人。消息来源保护——对举报人身份保密的原则——是该行业最神圣的义务之一,并且在大多数法律制度中都受到保护。人工智能 (AI) 时代既简化了这项任务,又带来了新的风险:您用来理解文档的工具可能会隐藏该文档;如果你未能匿名,你在人工智能上留下的痕迹可能会暴露来源。该单元的原理很明确:任何可能泄露来源的数据都不会进入不安全的人工智能工具;匿名化和数字卫生是在使用人工智能之前完成的,而不是之后。一旦泄露,身份将无法找回。

泄露源头的痕迹是什么?

资源保护不仅仅是“无名”。以下痕迹也可能揭示身份:

  • 直接标识符:姓名、电话、电子邮件、TR ID、地址、工作单位。
  • 间接描述:诸如“三人圈中唯一的女工程师”等描述;它指的是一个小团体中的一个人。
  • 文档元数据:作者姓名、编辑历史记录、创建日期、GPS 位置、文件中嵌入的打印机轨迹。
  • 上下文线索:谁有权访问该文档;泄漏时间;叙述中的特定事件。
  • 数字跟踪:从哪个设备、哪个网络、哪个帐户进行了联系。

人工智能的关键风险:将任何这些痕迹粘贴到工具中都会使数据脱离您的控制。大多数免费/公共人工智能工具都会存储输入或可以在模型细化中使用它们。

循序渐进:使用人工智能同时节省资源

步骤 1 — 对车辆进行分类。只有经过安全验证和数据处理条件(最好是企业、非数据存储或离线)的工具才能用于敏感工作。敏感数据不会输入公共/免费工具中。

第 2 步 — 清理元数据。在将文档导出到工具之前删除元数据;如果可能,将文档转换为纯文本或手动总结内容并匿名化,而不是屏幕截图。

第 3 步 — 匿名。概括所有直接和间接标识符:“来源 A”、“公职人员”,模糊日期和地点。更改针对小团体中的单身人士的食谱。

第 4 步 — 最低数据政策。只为人工智能提供工作所需的东西。不要总结整个文档,而是给出相关的非识别部分。

第 5 步 — 验证并保存。通过检查步骤测试匿名化的充分性(模板如下)。通过单独、安全的渠道与消息来源保持沟通。

第 6 步 — 清洁轨道。工作完成后,清除工具中的历史记录/会话;安全地存储或删除敏感文件。

注意:仅仅说“我匿名”是不够的;在一个小群体中,即使是单一的间接描述也能揭示身份。您可以使用匿名来询问“这个食谱适合多少人?”用问题来测试一下。如果答案为“一”,则资源不受保护。

KVKK 和专业保密

在土耳其,KVKK(个人数据保护法)对个人数据进行监管;健康和政治观点等信息属于特殊数据,需要更高的保护。将来源数据提供给任意工具可能会导致道德和法律责任。职业保密是一项独立于法律的荣誉义务。

三个迷你箱子

案例 1 — 防止元数据泄露。一名记者正要总结一份泄露的报告;在最后一刻,他意识到组织者的名字被嵌入到文件的元数据中。他在将文档转换为纯文本并删除名称后使用了它。如果上传原始文件,元数据将直接泄露来源。

案例 2 — 间接标识符危险。记者在咨询YZ时用了一句话,将消息人士描述为“总部唯一的残疾员工”。无论人工智能是否将文本存储在某个地方,这个描述都指向一个人。编辑注意到了,将描述改为“机构雇员”。在小团体中,间接的描述和名字一样危险。

案例 3 — 选择安全的车辆。在分析一批高度敏感的文件时,调查团队选择使用无数据/离线解决方案,而不是通用人工智能工具;另外还对文件进行了匿名处理。分析速度稍慢,但资源的安全性丝毫没有受到损害。

可复制模板

1)匿名化能力测试:

标记下面文本中可能揭示来源身份的每个元素:直接标识符(姓名、标题、单位)和间接标识符(指向小组中单个人的描述、特定事件、日期/地点)。对于每个标志,“这个描述适合多少人?”提出问题并提出更安全的概括。更改文本。文本:[此处]

2)文档共享前检查:

在将文档输入人工智能工具之前,制定一个我应该做的安全检查清单:元数据清理、直接/间接标识符扫描、最小数据策略、工具安全级别、历史记录清理。为每个项目添加一个句子“如何”。

3)源头沟通风险评估:

我会联系敏感消息来源。创建一个数字安全措施清单,以保护您的身份和通信(频道选择、不留痕迹、元数据、设备卫生)。提出具体、可操作的建议;不承诺绝对安全。

4)发表前源码保护控制:

在以下准备发布的新闻中包含任何可能识别来源的详细信息:间接描述、归属时间、有权访问该文档的人数、具体事件详细信息。突出显示每个危险点并建议如何模糊它。新闻:[此处]

弱提示/强提示

弱提示:“总结本文档。” (通过按原样上传敏感的元数据源文档)

结果:元数据和间接标识符超出您的控制范围;来源可能会在您不知情的情况下受到损害。

强烈提示:首先将文档转换为纯文本并删除元数据,概括直接/间接标识符,仅给出相关部分:“总结以下匿名文本;同时标记其中任何剩余的身份线索。”

区别:强方法会清理数据而不将其提供给车辆,共享最少的数据,并使用人工智能作为额外的控制层;资源受到保护。

对比图

轨道类型

例子

风险

预防措施

直接标识符

姓名、电话、单位

删除/概括

间接标识符

“唯一的女工程师”

高(隐藏)

“适合多少人?”测试

元数据

文件作者/日期/GPS

转换为纯文本,清晰

上下文线索

泄漏时间

中等

模糊时间/地点

数字踪迹

设备、网络、帐户

中高

安全通道、卫生

常见错误

  • 忘记元数据。按原样上传文件并泄露嵌入的作者/日期/位置信息。
  • 把名字删掉就好了忽略间接标识符也会暴露身份。
  • 将敏感数据导出到公共工具。将源数据输入到存储数据/在模型训练中使用它的工具中。
  • 共享太多数据。通过提供比工作所需更多的文件/详细信息来增加风险面。
  • 不清理轨道。工作完成后留下会话历史记录和敏感文件。

安全车辆选择:要寻找什么?

决定人工智能工具对于敏感工作是否“安全”是记者必须掌握的技术素养。要考虑的主要问题是:该工具是否存储您输入的数据、存储多长时间以及存储在何处?您的输入是否用于模型训练(在大多数免费消费者工具中是的,在企业版本中通常没有)?数据在哪个国家/地区以及根据什么法律进行处理?该工具可以离线工作(在您自己的设备上,无需将数据发送到互联网)吗?您的组织是否与此工具签订了数据处理协议?在不知道这些问题答案的情况下将敏感资源数据输入工具会使资源面临盲目信任的风险。

通用层次结构很有帮助:对于最敏感的文档,​​首选离线运行或在您自己的基础设施上运行的解决方案;不存储中等精度数据的合同企业工具;通用消费者工具只能用于未识别的、公开的或匿名的内容。一开始就进行这种分类可以防止“匆忙地将错误的数据输入错误的工具”的错误。此外,在企业新闻编辑室中,这一决定不应留给个别记者,而应通过书面工具批准列表进行标准化;因为一个人的一个错误就可能毁掉整个调查的源头。车辆安全是资源保护的技术支柱,应该像匿名化一样得到重视。

总之

人工智能时代的资源保护带来了新的风险:工具可以隐藏数据、元数据,间接标识符可能会泄露身份。安全的方式;根据其安全类别选择工具,清理元数据,匿名所有直接和间接标识符(“有多少人符合此描述?”测试),应用最少数据和清理痕迹的原则。 KVKK 和职业保密在法律和道德上都需要这种纪律。一旦泄露,身份将无法找回。

应用任务

采取真实或虚构的源文档/笔记。首先按照“匿名化能力测试”提示进行操作;标记出现的每个直接和间接描述符,并询问“它适合多少人?”带着问题来评价。然后安全地匿名化文档并手动应用一次“文档预共享检查”列表。

清单

  • [ ] 我仅使用经过安全验证的工具来进行敏感工作。
  • [ ] 我在导出文档之前清除了元数据。
  • [ ] 使用所有直接和间接描述符作为“它适合多少人?”我通过测试将其匿名化。
  • [ ] 遵循最少数据原则;我只分享必要的部分。
  • [ ] 我下班后清除会话历史记录和敏感文件;我遵守 KVKK 和职业保密规定。