واحد 7 / 12

پردازش داده ها، ذخیره سازی، به حداقل رساندن و ناشناس سازی

سود:

  • ملاحظات هوش مصنوعی را در هر مرحله از چرخه عمر داده اعمال کنید
  • دوره های نگهداری را تنظیم کنید و تاریخچه چت هوش مصنوعی را در خط مشی تخریب قرار دهید
  • استفاده از تفاوت بین ناشناس سازی و نام مستعار

بخش "بعد" از داده ها جایی است که یک افسر حفاظت از داده ها اغلب نادیده می گیرد. هنگامی که یک متن در هوش مصنوعی وارد می شود، به نظر می رسد که کار انجام شده است. با این حال، این داده ها در جایی ذخیره می شوند، شاید در آموزش مدل استفاده شوند، شاید برای ماه ها در تاریخچه چت جمع شوند. در این بخش، چرخه عمر داده های شخصی را گام به گام مورد بحث قرار خواهیم داد. ما در مورد دوره‌های نگهداری، تخریب تاریخچه‌های چت هوش مصنوعی و تمایز بین دو تکنیک حیاتی - ناشناس سازی و نام مستعار - خواهیم آموخت. هدف مدیریت داده ها در تمام طول عمر آن است، نه فقط زمانی که وارد می شوند.

چرخه عمر داده و هوش مصنوعی

داده های شخصی یک چرخه حیات را طی می کنند. هر مرحله دارای نقاط توجه ویژه هوش مصنوعی است.

مرحله

چه اتفاقی می افتد؟

نقطه توجه هوش مصنوعی

مجموعه

داده ها به دست می آید

آیا هدف و مبنا مشخص است؟ آیا به حداقل رسیده است؟

استفاده / پردازش

وارد هوش مصنوعی شد، پردازش شد

ماسکینگ انجام شده است؟ وسیله نقلیه تایید شده؟

ذخیره سازی

داده ها حفظ می شود

تاریخچه چت چقدر طول می کشد؟

انتقال

پیش شخص دیگری می رود

سرور بین المللی؟ آیا تضمین مناسبی وجود دارد؟

تخریب

حذف/ناشناس سازی

آیا بعد از تکمیل هدف حذف شد؟ آیا لوازم یدکی گنجانده شده است؟

دو مرحله که بیشتر مورد غفلت قرار می گیرد، ذخیره سازی و دفع است. داده ها "فراموش می شوند" و همچنان در سیستم انباشته می شوند - که هم اصل KVKK را نقض می کند و هم در صورت نقض آسیب را بزرگ می کند.

زمان ذخیره سازی: چه مدت می توانید آن را نگه دارید؟

اصل حفظ KVKK روشن است: داده های شخصی را نمی توان بیش از آنچه لازم است برای هدفی که برای آن پردازش می شود نگهداری کرد. هنگامی که هدف دیگر در دسترس نیست، داده ها باید حذف، نابود یا ناشناس شوند. مؤسسه سیاست ذخیره سازی و دفع را تهیه می کند. تعیین می کند که چه مقدار برای هر دسته از داده ها نگهداری شود.

نقطه بحرانی مخصوص هوش مصنوعی: تاریخچه چت هوش مصنوعی نیز داده های ذخیره شده است. اگر کارمندی برای ماه‌ها داده‌های مشتری را در همان چت وارد کرده باشد، آن تاریخ به یک مخزن داده تبدیل می‌شود. برای این:

  • تنظیمات حفظ داده ها را در ابزارهای هوش مصنوعی سازمانی پیکربندی کنید (در صورت امکان تاریخچه را به طور خودکار حذف کنید یا استفاده در آموزش مدل را خاموش کنید).
  • تاریخچه چت را در برنامه تخریب خود قرار دهید.
  • از گزینه "در آموزش مدل استفاده نکنید" (انصراف) در قرارداد شرکت اطمینان حاصل کنید.
توجه: حذف داده ها فقط حذف آنها از صفحه نمایش نیست. پشتیبان‌گیری، گزارش‌ها و کپی‌های روی سرور ارائه‌دهنده نیز باید در نظر گرفته شود. وقتی می گویید "حذف شده"، مطمئن شوید که چیزی که حذف کرده اید واقعا غیر قابل بازیابی است.

ناشناس سازی یا نام مستعار؟

این دو اصطلاح اغلب با هم اشتباه گرفته می شوند، اما پیامدهای قانونی آنها کاملاً متضاد است.

  • ناشناس سازی: ایجاد داده ها به گونه ای که به هیچ وجه نتوان آن ها را با یک شخص مرتبط کرد. اگر به درستی انجام شود، نتیجه دیگر داده های شخصی نیست و خارج از محدوده KVKK است. مثال: حذف ردیف‌های فردی در مجموعه داده‌های 10000 نفری و باقی ماندن تنها آمارهای کل مانند "متوسط ​​هزینه در گروه سنی 25 تا 34 سال در استانبول".
  • نام مستعار: اطلاعات هویتی با یک کد/برچسب جایگزین می شود، اما می توان آن را با یک "کلید" به فرد بازگرداند. مثال: نوشتن "Customer-4471" به جای "Ahmet Yılmaz"، اما داشتن جدولی که نشان می دهد کدام کد متعلق به چه کسی است. این هنوز هم داده های شخصی است و در محدوده KVKK قرار می گیرد.

ویژگی

ناشناس سازی

نام مستعار

آیا می توان فرد را برگرداند؟

خیر (اگر درست انجام شود)

بله با کلید

آیا هنوز اطلاعات شخصی است؟

نه

بله

محدوده KVKK

خارج

در

برای ورود به هوش مصنوعی

مطمئن ترین راه

باز هم، یک مبنا/قانون مورد نیاز است

نکته: "آیا برگشت پذیر است؟" قبل از وارد کردن داده ها به هوش مصنوعی بپرسید اگر کلید/تطبیقی ​​در آن وجود داشته باشد، نام مستعار است و همچنان اطلاعات شخصی است. ناشناس سازی واقعی به اشتراک گذاری نتیجه انبوه است، نه ردیف های جداگانه.

سه کیف کوچک

مورد 1 - ناشناس بودن جعلی. یک شرکت مراقبت های بهداشتی مجموعه ای از داده ها را به هوش مصنوعی می دهد که می گوید برای تجزیه و تحلیل «ناشناس» کرده است. اما این مجموعه شامل تاریخ تولد، شهرستان و تشخیص نادر است. این سه نفر ممکن است نشان دهنده یک فرد مجرد در یک شهرستان کوچک باشد. این ناشناس سازی نیست. داده ها هنوز شخصی هستند راه درست: تبدیل تاریخ تولد به محدوده سنی، تعمیم بر اساس شهرستان، گروه بندی تشخیص های نادر - یعنی تجمع واقعی.

مورد 2 - انباشته شدن مکالمه. در یک مرکز تماس، 6 نماینده اطلاعات مشتری را به مدت 4 ماه در یک حساب هوش مصنوعی شرکتی وارد می کنند. هیچ کس گذشته را پاک نمی کند. در نهایت بیش از 12000 تعامل با مشتری در یک مکان انباشته شد. در حسابرسی، این انباشت به عنوان یک ریسک عمده مشخص می شود. راه حل: تنظیم حذف خودکار تاریخچه هر 30 روز، قانونی برای خروج از سیستم پس از اتمام کار، و یک بند باز برای سیاست حفظ.

مورد 3 - نام مستعار صحیح. هنگام تجزیه و تحلیل عملکرد کارکنان با هوش مصنوعی، یک تیم منابع انسانی نام‌هایی مانند «Employee-001» را کدگذاری می‌کند و جدول تطبیق را در یک فایل جداگانه و با محدودیت دسترسی نگه می‌دارد. این نام مستعار است. داده ها هنوز شخصی هستند، اما خطر کاهش می یابد. تیم آگاه است که این ناشناس سازی نیست و بر اساس آن مبنای قانونی و دوره نگهداری آن را تعیین می کند.

قالب های قابل کپی

الگو 1 — خط خط مشی حفظ و تخریب: "یک خط خط مشی حفظ و نابودی را برای دسته داده های زیر پیشنهاد کنید: [دسته]. زمینه ها: دوره نگهداری (توجیه شده بر اساس هدف)، روش تخریب (حذف/تخریب/ناشناس سازی)، اینکه آیا سابقه چت هوش مصنوعی گنجانده شده است، نقش مسئول. اگر الزام قانونی برای نگهداری وجود دارد یادآوری کنید."

الگو 2 — بررسی ناشناس سازی: "بررسی کنید که آیا مجموعه داده زیر واقعاً ناشناس است: [فیلدهای فهرست]. چه ترکیبی از فیلدها می تواند یک فرد را قابل شناسایی مجدد کند (مانند تاریخ تولد + کد پستی + ویژگی نادر)؟ برای تقویت ناشناس بودن برای هر زمینه خطر (مانند محدوده سنی، سطح استان) یک تعمیم پیشنهاد دهید."

الگوی 3 — جداسازی ماسک + کلید بازگشت: "نام مستعار متن زیر: رمزگذاری داده های شخصی (مانند [NAME]->K001)، اما یک جدول منطبق را جداگانه به من بدهید. هیچ هویت واقعی در خود متن باقی نمانده. توجه داشته باشید که جدول تطبیق "داده های شخصی" است و باید جداگانه ذخیره شود."

الگوی 4 - ممیزی ذخیره سازی داده ابزار هوش مصنوعی: "لیستی از سوالات را برای بررسی رفتار ذخیره سازی داده ابزار هوش مصنوعی که استفاده می کنیم آماده کنید: تاریخچه چه مدت نگهداری می شود، آیا می توان آن را حذف کرد، آیا در آموزش مدل استفاده می شود، آیا امکان انصراف وجود دارد، داده ها کجا پردازش می شوند، نسخه های پشتیبان چیست؟ پاسخ "امن" مورد انتظار را برای هر سوال بنویسید."

اعلان ضعیف / اعلان قوی

ضعیف: "این داده ها را ناشناس کنید." (نام ها را کد می کند و می گذارد) -> فقط نام های مستعار. خطرات شناسایی مجدد مانند تاریخ تولد، ویژگی نادر باقی می ماند. این توهم "ناشناس" را ایجاد می کند. GÜÇLÜ: "ترکیبی از فیلدها را در این مجموعه بیابید که می تواند فرد را دوباره شناسایی کند؛ هر یک از آنها را تعمیم دهید (محدوده سنی، سطح استان). هدف من یک رکورد واحد نیست، بلکه آمار تجمیع شده است. در نتیجه، هیچکس را نمی توان به عنوان یک فرد متمایز کرد و این را تأیید کرد." -> مدل به سمت ناشناس سازی واقعی گرایش دارد و خطر شناسایی مجدد را کاهش می دهد.

اشتباهات رایج

  • اشتباه گرفتن نام مستعار برای ناشناس سازی؛ فراموش کردن این که داده های شخصی باقی می ماند.
  • حذف نام ها و ترک ترکیب های توصیفی مانند تاریخ تولد + مکان + ویژگی نادر.
  • تاریخچه چت هوش مصنوعی را مشمول قانون حفظ/تخریب نمی کند. به طور نامحدود انباشته می شوند.
  • عدم اطمینان از بند «در آموزش مدل استفاده نشود» (انصراف) در قرارداد.
  • وقتی می‌گویم حذف، منظورم این است که صفحه را پاک کنید و پشتیبان‌گیری و گزارش‌ها را فراموش کنید.
  • نگه داشتن دوره ذخیره سازی بیشتر برای "فقط در مورد" به جای برای هدف.
  • نادیده گرفتن اینکه انتقال و ذخیره سازی نیز در سرور ارائه دهنده انجام می شود.

به طور خلاصه

  • داده های شخصی یک چرخه حیات را طی می کنند. غفلت ترین مراحل ذخیره سازی و دفع است.
  • داده‌ها را نمی‌توان برای مدت طولانی‌تر از زمان مورد نیاز نگهداری کرد. مؤسسه باید سیاست ذخیره سازی و تخریب را تعیین کند.
  • تاریخچه چت هوش مصنوعی نیز داده های ذخیره شده است. باید در برنامه دفع و تنظیمات ذخیره سازی گنجانده شود.
  • ناشناس کردن داده ها را از KVKK خارج می کند. نام مستعار همچنان داده ها را شخصی می کند.
  • حذف یک نام ناشناس نیست. همه ترکیبات در معرض خطر شناسایی مجدد باید تعمیم داده شوند.

وظیفه کاربردی

دسته ای از داده هایی را که سازمان شما با هوش مصنوعی پردازش می کند (به عنوان مثال، سوابق پشتیبانی مشتری) انتخاب کنید. خط مشی حفظ و تخریب را برای این دسته بنویسید: دوره نگهداری (توجیه)، روش تخریب، اینکه آیا سابقه چت هوش مصنوعی گنجانده شده است یا خیر، و نقش مسئول. سپس یک رکورد نمونه از همان داده‌ها بگیرید و ابتدا آن را مستعار کنید (جدول تطبیق را جدا نگه دارید)، سپس بنویسید که کدام فیلدها را تعمیم می‌دهید و چگونه این رکورد را به ناشناس‌سازی واقعی برسانید. در نهایت، پنج سوال را آماده کنید که رفتار ذخیره سازی داده های ابزار هوش مصنوعی مورد استفاده شما را کنترل می کند و پاسخ "ایمن" مورد انتظار خود را به هر یک اضافه کنید.

چک لیست

  • [ ] من دوره نگهداری و روش تخریب را برای دسته داده تعیین کرده ام.
  • [ ] من تاریخچه چت هوش مصنوعی را در برنامه تخریب گنجانده ام.
  • [ ] مورد انصراف "در آموزش مدل استفاده نشود" را علامت زدم.
  • [ ] من تفاوت بین نام مستعار و ناشناس را اجرا کردم.
  • [ ] من ترکیبات میدانی تعمیم یافته ای دارم که در خطر شناسایی مجدد قرار دارند.
  • [ ] من همچنین پشتیبان‌گیری و گزارش‌ها را در محدوده حذف قرار دادم.
  • [ ] من رفتار ذخیره سازی داده ابزار هوش مصنوعی را بررسی کردم.