收益:
- 根据法律准备对信息请求的答复,解释不多也不少。
- 它在发布之前对开放数据进行匿名化,并在存在重新识别风险的组合级别上对其进行扫描。
- 知道透明度是一种治理工具,可以增加公众信任并区分应保密的内容。
民主公共行政的基石是透明度:公民有能力了解如何以及在什么基础上做出与他们有关的决策。这一原则通过两种具体机制得以实现。首先是信息权(信息权法第4982号;公民可以向公共机构索取信息和文件,但有例外)。二是开放数据(公共机构以所有人都可以访问和使用的方式公布其产生的数据的非个人和非机密部分)。在这里,人工智能在对传入的信息请求进行分类、生成响应草案、预先评估哪些信息可以提供、哪些信息可以豁免以及准备要发布的开放数据集方面提供了强大的帮助。但该单元的两重警告很重要:透明度不应该更多,也不应该更少——公民应该获得他有权获得的信息,但个人数据和真正的例外情况应该受到保护;这种平衡是由负责的公职人员而不是人工智能建立的。
获取知识的两个错误目的
在信息请求中,可能会在两个方向上犯错误:
- 缺乏透明度:不必要地拒绝提供“机密/例外”信息。这既侵犯了权利,又造成了对机构的不信任,并常常最终进入司法部门。
- 过度披露:提交文件时意外泄露第三方个人数据、商业秘密或真正的例外情况(安全等)。这违反了 KVKK 并造成损害。
人工智能可以在两端提供帮助:它可以扫描文档,标记其中的个人数据,并建议编辑(模糊/删除文档的机密/个人部分);它可能会列出您将在其下评估请求的例外类别。但最终的决定权——是否提供这些信息,哪一部分被遮盖——属于承担法律责任的人。
注意:AI关于“该信息属于例外范围”或“可以给出”的声明不属于法律意见书。依据信息公开法相关条款进行异常评估并证明其合理性; AI 只产生预审和草稿。
安全发布开放数据
开放数据提高公共效率和问责制;企业家、记者、研究人员从这些数据中创造价值。但在发布数据集之前,应该检查重新识别的风险(被认为是匿名的数据通过与其他数据相结合来链接回个人)。例如,组合“年龄+邻居+稀有职业”可以指示单个人。在准备要发布的数据集时,人工智能有助于标记有风险的列组合并编写数据字典(每列含义的描述)。
提示:在发布开放数据之前,请询问:“我可以通过组合此集合中的两到三列来找到一个人吗?”如果答案是“也许”,则进行聚合(分组而不是个人)、合并罕见类别或删除敏感区域。
逐步的信息流
- 了解需求并对其进行分类。要求什么,涉及哪个单位,持续时间是多长?
- 信息是否存在或者是否需要产生?法律涵盖现有知识;该机构可能不必进行新的分析(已确认)。
- 异常评估。是否有个人数据、安全、商业秘密、内部意见等例外情况?
- 密文。删除可导出文档中需要保留的部分。
- 有理有据的回答。给出/未给出的部分及其依据;如果被拒绝,提出异议的方法。
- 日志和审计跟踪。请求、决定和理由均被记录。
三个迷你箱子
案例 1 — 避免了编辑错误。机构将根据信息自由请求提交招标文件。 AI扫描了文件并标记了三个人的电话号码和TR ID号码。如果未经校对就发送,则违反了 KVKK;个人数据被黑化,文件安全送达。
案例 2 — 纠正不公平拒绝。一个单位会习惯性地以“内部”为由拒绝活动数据的请求。当人工智能被问及例外类别时,发现这些数据实际上已经可以作为开放数据发布。请求得到满足,可能的反对和诉讼也被阻止。
案例 3 — 重新识别风险。市政府将其“服务请求”数据集作为开放数据发布。该集包括社区+完整地址区域细分。 AI警告地址字段可能指向单个数字;该地址已聚合到街道级别,并且该地址集已安全发布。
四个可复制模板
1)信息请求分类:
您的角色:信息获取专家。处理以下请求:(1) 请求的具体内容,(2) 涉及哪个单位,(3) 是否需要现有信息或新产品,(4) 可能的例外类别(个人数据、安全、商业秘密等)。指定每个例外“必须由相关文章证明其合理性”。决策、预评估。请求:[文本]
2) 编辑(标记个人/机密数据):
在下面的文档中,标记信息响应中应隐藏的所有部分:姓名、TR ID 号、地址、电话、健康/犯罪信息、第三方数据、商业秘密。为每个标志写下简短的理由。保留文档的可导出部分不变。文件:[文本]
3)合理答复草案:
针对以下请求起草一份合理的答复:(1) 提供了哪些信息,(2) 未提供哪些部分以及原因(例外条款[待确认]),(3) 申诉方式和期限[待确认]。语言应该正式且尊重。未给出部分的理由应该是具体的,而不是笼统的。请求:[摘要] 决定:[给出/未给出什么]
4)开放数据重认证控制:
检查下面数据集的列。列出哪些列组合可能表明一个人(重新识别的风险)。针对每种风险提出一些缓解措施:聚合、稀有类别聚合、字段提取。只需使用给定的列列表。栏目:[列表]
弱提示/强提示
弱:“回应此信息请求。”
Güçlü:“你的角色是一名信息单位专家。首先,对请求进行分类:请求什么、哪个单位可用、可能的例外情况是什么。将每个例外标记为‘有相关文章证明其合理性’,不要自己做出法律决定。然后,在要提交的文档中标记出需要屏蔽的个人/机密部分并提出修订建议。最后,生成一份合理的答复草案,包括给出/未给出的部分以及反对的方式;提出理由具体”。
区别:强烈的提示平衡了透明度和保护,将例外与理由联系起来,增加了编辑和上诉路径。
按信息类型划分的方法
信息类型
默认
注意
统计、汇总数据
打开
重新识别检查
行政行为的理由
可以给予
编辑第三方数据
第三方个人数据
受保护的
KVKK;但经许可/例外
安全/隐私例外
受保护的
是否真的异常,确认
内部意见/协商
视情况而定
根据相关文章进行评估
匿名化和重新识别的风险
发布开放数据中技术性最高但最关键的步骤是匿名化(使个人无法直接或间接从数据中识别)。姓名和 T.R.删除身份证号码通常是不够的;因为几个普通区域的组合使得一个人可以被重新识别。这称为重新识别(通过将被认为是匿名的数据与其他信息交叉匹配来找到该人)。例如,如果某个街区有一位 92 岁的鳏夫,“街区+年龄+婚姻状况”三重奏将揭示他的身份。人工智能可以帮助筛选数据集中哪些字段组合存在泄露风险,并建议更安全的分组(将年龄转换为范围、组合罕见类别);但公布的决定和最终审核是该机构的责任。
迷你案例——三个区域的披露。一个市政府“匿名”公布了社会救助数据:没有姓名,只有社区、出生年份和残疾类型。一名记者注意到一个社区的一个人患有一种罕见的残疾,并确定了这个人的身份。数据已撤回;当出生年份转换为10年间隔时,它被重新发布,并且罕见的类别被分组在“其他”下。
筛选重新识别风险的模板:
任务:检查以下数据集的列;我不发布个人数据,我只想风险筛查。列:[列名称]输出:1)直接标识符(必须删除)。 2)间接标识符组合(重新识别的风险)。 3) 针对每个风险组合的建议分组/屏蔽。 4)发布前的最终检查问题。规则:我没有粘贴任何真实的个人价值观;只需考虑列结构。
注意:“我删除了名字,现在是匿名的”是最常见和最危险的误解。匿名性不是由字段本身决定的,而是由字段的组合以及与外部数据匹配的概率决定的。如有疑问,请勿发布;匿名是一个不可撤销的决定。
常见错误
- 习惯性地拒绝。将可提供的信息视为不必要的“机密”是侵犯权利并引发诉讼的原因。
- 提交未经编辑的文件。泄露第三方数据违反了 KVKK。
- 无正当理由地使用异常。拒绝必须有具体内容和具体理由;光说“内部”是不够的。
- 依靠AI的法律判断。破例的决定是人为的; AI 进行资格预审。
- 绕过开放数据中的重新识别。栏目组合可以找人;总计的。
- 未明确提出异议的方式。驳回时必须写明(确认)申请方式和期限。
总之
透明度是公众信任的基础;人工智能在对信息自由请求进行分类、建议校对、起草回复以及准备公开数据以供发布方面提供了强大的帮助。但平衡至关重要:必须向公民提供他们有权获得的信息、真正的例外情况以及个人数据必须受到保护。例外的决定必须是合理且人性化的;开放数据在发布前应经过重新识别风险的审核。
应用任务
接收真实的(隐藏的)信息自由请求。使用“请求分类”模板进行预评估,将“密文”模板应用于附加文档并标记要屏蔽的区域。将“开放数据重新识别检查”模板应用于开放数据集的列,并找到至少一种有风险的组合。
清单
- [ ] 我对请求进行了分类;我并没有拒绝可以提供不必要的信息。
- [ ] 我用具体的实质内容和理由(人为决定)评估了例外情况。
- [ ] 我已编辑了要提交的文件中的个人/机密数据。
- [ ] 如遇驳回,已说明异议方式及期限(已确认)。
- [ ] 我检查了开放数据中的重识别风险。
- [ ] 我记录了审核请求、决定和理由。