Lợi nhuận:
- Ẩn danh và đánh giá sự cần thiết trước khi cung cấp dữ liệu tài chính và nhạy cảm của khách hàng cho các công cụ trí tuệ nhân tạo
- Khả năng phân biệt sự khác biệt giữa các công cụ AI công cộng và công ty về quyền riêng tư, lưu giữ dữ liệu và sử dụng trong giáo dục
- Khả năng quản lý vi phạm dữ liệu, thời gian lưu giữ và rủi ro chia sẻ của bên thứ ba trong khuôn khổ KVKK
Bảo hiểm là một trong những ngành nghề làm việc với những dữ liệu nhạy cảm nhất. Hồ sơ bảo hiểm; Nó có thể bao gồm thông tin nhận dạng, địa chỉ, thu nhập, tài khoản ngân hàng, lịch sử sức khỏe, hồ sơ thiệt hại, biển số xe, chứng thư quyền sở hữu và thậm chí cả thông tin gia đình. Một số dữ liệu này được bảo vệ ở mức cao nhất là "dữ liệu cá nhân có tính chất đặc biệt" trong KVKK (Luật bảo vệ dữ liệu cá nhân); Dữ liệu sức khỏe, sinh trắc học và tương tự là những ví dụ điển hình cho điều này. Việc chia sẻ không kiểm soát dữ liệu này khi sử dụng các công cụ trí tuệ nhân tạo (đặc biệt là các công cụ dựa trên đám mây) có nguy cơ vi phạm và mất lòng tin nghiêm trọng. Một khi bị rò rỉ, dữ liệu không thể lấy lại được. Trong phần này, bạn sẽ tìm hiểu cách ẩn danh dữ liệu khách hàng (xóa thông tin nhận dạng cá nhân) trước khi cung cấp cho trí tuệ nhân tạo, sự khác biệt về quyền riêng tư giữa các công cụ của công ty và công cộng cũng như cách quản lý rủi ro vi phạm dữ liệu, lưu trữ và chia sẻ bên thứ ba trong khuôn khổ KVKK. Đơn vị này không phải là tư vấn pháp luật; Giải thích các nguyên tắc chung, tham khảo ý kiến của bộ phận tuân thủ/pháp lý trong trường hợp cụ thể.
Tại sao quyền riêng tư lại quan trọng: loại dữ liệu
Trong bảo hiểm cần phân tách dữ liệu theo mức độ bảo vệ:
- Dữ liệu nhận dạng: Tên, họ, số ID TR, ngày sinh, liên hệ. Nó trực tiếp xác định người đó.
- Dữ liệu tài chính: Thu nhập, tài khoản ngân hàng, lịch sử thanh toán. Cá nhân và nhạy cảm.
- Dữ liệu chất lượng đặc biệt: Dữ liệu sức khỏe, sinh trắc học. Bảo vệ cao nhất; Cần có các điều kiện chặt chẽ hơn (sự đồng ý rõ ràng hoặc ngoại lệ theo luật định) để xử lý.
- Dữ liệu tập tin: Số hợp đồng, biển số xe, chứng thư quyền sở hữu, chi tiết thiệt hại. Khi kết hợp với những người khác, nó có thể tiết lộ danh tính.
Mối nguy hiểm lớn nhất là khả năng nhận dạng xảy ra khi bạn tập hợp các dữ liệu này lại với nhau. Trong khi "phụ nữ 45 tuổi" ẩn danh thì "phụ nữ 45 tuổi + biển số xe + địa chỉ nhất định" có thể tiết lộ danh tính.
Lưu ý: Việc nói “xóa” sau khi đưa dữ liệu cho công cụ trí tuệ nhân tạo không thực sự xóa dữ liệu đó. Một số công cụ lưu trữ dữ liệu đầu vào và thậm chí sử dụng nó để huấn luyện mô hình. Quy tắc: không bao giờ gửi dữ liệu nhạy cảm; Việc ẩn danh diễn ra trước khi gửi.
Ẩn danh: làm thế nào để làm điều đó
Ẩn danh là việc loại bỏ thông tin có thể nhận dạng và thay thế bằng thông tin thực tế tương đương; Mục đích là làm cho người đó không thể nhận dạng được trong khi vẫn duy trì chất lượng đầu ra. Ẩn danh tốt:
- Xóa tên, TR ID, số điện thoại, địa chỉ, số chính sách, biển số xe và thông tin chứng thư quyền sở hữu.
- Anh ấy thay thế chúng bằng một từ tương đương có ý nghĩa về mặt phân tích: "45 tuổi, nam, có hợp đồng bảo hiểm, miền Trung Anatolia, va chạm một chiều".
- Nó tránh những sự kết hợp hiếm có/khác biệt: một nghề rất cụ thể + một địa điểm rất nhỏ, chỉ riêng điều đó thôi cũng có thể mở ra danh tính.
- Giữ nguyên ý nghĩa y tế/kỹ thuật: chẳng hạn như "sức khỏe bổ sung, phẫu thuật chỉnh hình theo kế hoạch".
Mẹo: Sau khi ẩn danh, hãy tự hỏi: "Nếu một người lạ đọc văn bản này, liệu anh ta có thể tìm thấy người đó không?" Nếu câu trả lời là có, hãy khái quát hóa thêm. Sự kết hợp đặc biệt hiếm gặp (quận nhỏ + sự kiện cụ thể) rất nguy hiểm.
Doanh nghiệp và công cụ công cộng
Không phải tất cả các công cụ AI đều có mức độ riêng tư như nhau. Chúng khác nhau ở ba chiều:
- Lưu giữ dữ liệu: Nó có lưu giữ dữ liệu đầu vào không và trong bao lâu?
- Sử dụng trong đào tạo: Nó có sử dụng đầu vào để đào tạo mô hình không?
- Địa điểm và hợp đồng: Dữ liệu được xử lý ở đâu, có thỏa thuận xử lý dữ liệu của công ty không?
Các công cụ thể chế (hợp đồng của tổ chức, đảm bảo xử lý dữ liệu) thường đưa ra các giới hạn về việc không sử dụng và lưu trữ dữ liệu trong giáo dục. Các công cụ công cộng, miễn phí có thể lưu trữ đầu vào và sử dụng nó trong đào tạo. Quy tắc: dữ liệu nhạy cảm chỉ được xử lý theo các phương tiện đã được tổ chức phê duyệt, theo hợp đồng và ở dạng ẩn danh nhất có thể. Việc nhập dữ liệu khách hàng vào một công cụ chưa được phê duyệt khiến bộ xử lý dữ liệu không thể kiểm tra được.
Từng bước: Làm việc an toàn với dữ liệu bí mật
- Phân loại dữ liệu. Dữ liệu nhận dạng/tài chính/chất lượng đặc biệt/tập tin.
- Kiểm tra sự cần thiết. Dữ liệu này có thực sự cần thiết cho nhiệm vụ này không? Nếu không, đừng sử dụng nó.
- Ẩn danh. Loại bỏ các định danh, thay thế các giá trị thực tế tương đương, khái quát hóa các kết hợp hiếm.
- Chọn phương tiện. Chỉ những xe có hợp đồng, được cơ quan phê duyệt; Không có dữ liệu nhạy cảm có sẵn cho công cụ công cộng.
- Làm việc với dữ liệu tối thiểu. Chia sẻ thông tin tối thiểu cần thiết cho nhiệm vụ.
- Quản lý lưu trữ và chia sẻ. Bạn lưu trữ kết quả đầu ra ở đâu, bạn chia sẻ nó với ai; Tuân thủ thời gian lưu giữ KVKK và các quy định của bên thứ ba. Để lại dấu ấn của bạn.
ba trường hợp nhỏ
Trường hợp 1 - Bảo vệ dữ liệu nhạy cảm. Một chuyên gia yêu cầu bồi thường muốn hỏi AI về một hồ sơ bảo hiểm y tế phức tạp. Thay vì viết tên, CMND và chẩn đoán của người được bảo hiểm, anh ta tạo ra bối cảnh ẩn danh như “52 tuổi, nữ, chính sách bảo hiểm y tế bổ sung, dự kiến phẫu thuật van tim, số tiền tranh chấp”. Chất lượng đầu ra không giảm; Dữ liệu riêng tư không đi đến bất kỳ đám mây nào. Dữ liệu sức khỏe được bảo vệ ở mức cao nhất; thói quen này đã ngăn cản hành vi vi phạm.
Trường hợp 2 - Bẫy kết hợp hiếm. Một chuyên gia viết: “38 tuổi, nữ, dược sĩ duy nhất ở [quận rất nhỏ], có chính sách trách nhiệm nghề nghiệp”. Mặc dù về mặt kỹ thuật thì nó không có tên nhưng nó trực tiếp tiết lộ danh tính của anh ta vì anh ta là dược sĩ duy nhất ở quận đó. Chuyên gia nhận thấy điều này và khái quát nó là “nghề định cư nhỏ, chăm sóc sức khỏe”. Việc ẩn danh không chỉ là xóa tên mà còn phá hủy khả năng nhận dạng.
Trường hợp 3 - Lựa chọn công cụ sai. Để nhanh chóng, nhân viên sẽ tải thông tin chi tiết về khiếu nại của khách hàng lên một công cụ công cộng, miễn phí. Chính sách nhóm có hiệu lực: dữ liệu khách hàng chỉ được xử lý trong công cụ hợp đồng đã được tổ chức phê duyệt. Đầu tiên, nhân viên sẽ ẩn danh dữ liệu rồi chạy dữ liệu đó trong công cụ đã được phê duyệt. Nếu sử dụng một công cụ không được phê duyệt, nguy cơ lưu trữ và sử dụng dữ liệu trong giáo dục sẽ không thể kiểm soát được.
Bốn lời nhắc có thể sao chép
1) Trợ lý ẩn danh:
Xóa tất cả dữ liệu cá nhân và nhận dạng khỏi văn bản sau: tên, họ, ID, ngày sinh, điện thoại, địa chỉ, số hợp đồng, biển số xe, chứng thư quyền sở hữu, IBAN. Thay thế chúng bằng từ thực tế tương đương với ý nghĩa phân tích (ví dụ: "45 tuổi, nam, hợp đồng bảo hiểm, va chạm một phía"). Khái quát hóa các kết hợp hiếm/đặc biệt (địa điểm nhỏ + nghề nghiệp đặc biệt). Giữ nguyên ý nghĩa y tế/kỹ thuật.Văn bản: [dán]
2) Kiểm tra khả năng nhận biết:
Kiểm tra nhận dạng văn bản ẩn danh sau: [text]Hỏi: Người lạ có thể tìm thấy người có văn bản này không? Có sự kết hợp hiếm gặp nào (khu định cư nhỏ + nghề nghiệp/sự kiện cụ thể), ngày hoặc số tiền duy nhất không? Nêu bật từng điểm rủi ro và đề xuất cách khái quát hóa an toàn hơn.
3) Yêu cầu và phân loại dữ liệu:
Phân loại và yêu cầu kiểm tra dữ liệu cần thiết cho nhiệm vụ sau: Nhiệm vụ: [mô tả] Dữ liệu tôi có: [danh sách]Đối với mỗi dữ liệu: loại (danh tính/tài chính/đặc biệt/tệp), liệu nó có cần thiết cho nhiệm vụ này không (có/không), nếu cần, cách sử dụng ẩn danh.Đánh dấu những dữ liệu không cần thiết là "không sử dụng".
4) Danh sách kiểm tra lựa chọn phương tiện:
Tạo danh sách kiểm tra trước khi sử dụng công cụ AI với dữ liệu bảo hiểm. Bao gồm các câu hỏi: Phương tiện có được tổ chức phê duyệt không? Có thỏa thuận xử lý dữ liệu không? Nó có lưu trữ/sử dụng dữ liệu đầu vào trong quá trình đào tạo không? Dữ liệu được xử lý ở đâu? Đối với loại dữ liệu nào phù hợp/không phù hợp? Ẩn danh có đủ không?
Dấu nhắc yếu / Dấu nhắc mạnh
Yếu: "Đánh giá hồ sơ của khách hàng Ahmet Yılmaz (TC 123..., kèm theo báo cáo y tế)."
Vấn đề: Dữ liệu nhận dạng và nhạy cảm (sức khỏe) được chia sẻ trực tiếp; nguy cơ vi phạm KVKK rất lớn.
Strong: "Hãy xem xét bối cảnh ẩn danh sau: 52 tuổi, nữ, chính sách y tế bổ sung, phẫu thuật theo kế hoạch, số tiền còn tranh chấp. Không có thông tin nhận dạng."
Tại sao nó tốt: Ý nghĩa phân tích được giữ nguyên, danh tính và dữ liệu nhạy cảm không bị tiết lộ.
biểu đồ so sánh
Kiểu dữ liệu
Mức độ bảo vệ
Sử dụng trong trí tuệ nhân tạo
Tên/TC/liên hệ
cao
Xóa, đặt tương đương
Tài chính (thu nhập/IBAN)
cao
Loại bỏ/tổng quát hóa
Sức khỏe/bằng cấp đặc biệt
cao nhất
Không bao giờ thô; xe ẩn danh + được phê duyệt
Số hợp đồng/biển số/chứng thư quyền sở hữu
trung bình cao
Loại bỏ; một mình là nguy hiểm
Tổng hợp/thống kê
thấp
Có sẵn (nếu không liên hệ)
Những lỗi thường gặp
- Dán dữ liệu cá nhân/sức khỏe thô. Vi phạm thường xuyên nhất và nghiêm trọng nhất.
- Nghĩ rằng chỉ cần xóa tên là đủ. Sự kết hợp hiếm hoi vẫn có thể tiết lộ danh tính.
- Dựa vào việc nói “xóa sau”. Công cụ này có thể đang lưu trữ/sử dụng dữ liệu trong quá trình đào tạo.
- Lái xe công cộng/không được chấp thuận. Xử lý dữ liệu không được kiểm soát
- Không quản lý việc lưu trữ và chia sẻ. Lưu trữ đầu ra không giới hạn, chia sẻ không kiểm soát với bên thứ ba.
Tóm lại
Dữ liệu bảo hiểm rất nhạy cảm; Dữ liệu đặc biệt như sức khỏe phải được bảo vệ cao nhất theo KVKK. Phân loại, thách thức và ẩn danh dữ liệu trước khi đưa dữ liệu đó cho AI: loại bỏ số nhận dạng, đưa ra các giá trị tương đương thực tế, khái quát hóa các kết hợp hiếm. Chỉ xử lý dữ liệu nhạy cảm bằng các công cụ có hợp đồng, được tổ chức phê duyệt và ở mức độ tối thiểu. Quản lý thời gian lưu trữ và chia sẻ của bên thứ ba trong khuôn khổ KVKK và để lại dấu vết. Tư vấn tuân thủ/pháp lý trong trường hợp cụ thể; Dữ liệu bị rò rỉ không thể được lấy lại.
Nhiệm vụ ứng dụng
Nhận văn bản tham khảo/thiệt hại thực tế (dành cho mục đích thử nghiệm). Ẩn danh với lời nhắc số 1, sau đó kiểm tra khả năng nhận dạng bằng lời nhắc số 2: vẫn còn những sự kết hợp hiếm hoi trong văn bản có thể tiết lộ danh tính người đó? Khái quát hóa từng rủi ro bạn tìm thấy. Đồng thời đánh giá công cụ AI bạn sử dụng với danh sách kiểm tra số 4: nó có phù hợp với dữ liệu nhạy cảm không?
danh sách kiểm tra
- [ ] Tôi đã phân loại dữ liệu theo loại của chúng.
- [ ] Tôi đã áp dụng bài kiểm tra cần thiết; Tôi đã không sử dụng dữ liệu không cần thiết.
- [ ] Tôi đã xóa số nhận dạng và thay thế bằng số thực tế tương đương.
- [ ] Tôi đã khái quát hóa những sự kết hợp hiếm/đặc biệt.
- [ ] Tôi đã kiểm tra khả năng nhận dạng.
- [ ] Tôi chỉ sử dụng xe có hợp đồng và được công ty phê duyệt.
- [ ] Tôi quản lý việc lưu trữ và chia sẻ của bên thứ ba theo KVKK; Tôi đã để lại một dấu vết.