المكاسب:
- القدرة على اكتشاف التمييز الخفي من خلال فهم أن التحيز يأتي من البيانات (التاريخية والتمثيلية والقياس والتجميع) وتقييم النموذج على أساس المجموعات الفرعية
- القدرة على توفير التوضيح والإشراف البشري والمساءلة في القرارات عالية التأثير وتوثيق الشفافية باستخدام بطاقة نموذجية
- القدرة على إدارة التكاليف المالية والبيئية دون المساس بالجودة باستخدام أصغر نموذج مناسب والتقصير السريع والتخزين المؤقت والدفعة
قد يعمل النموذج بشكل مثالي من الناحية الفنية ولكنه لا يزال خاطئًا - إذا كان غير عادل لبعض الأشخاص، أو لا يمكن تفسيره، أو ينتج عنه تكاليف غير مستدامة. في هذه الوحدة، نغطي ثلاثة أبعاد "غير مرئية" ولكنها حاسمة لهندسة تعلم الآلة: التحيز والعدالة، والأخلاق والشفافية، والتكلفة والاستدامة. هذه ليست زخارف تمت إضافتها لاحقًا، ولكنها جزء لا يتجزأ من الجودة الهندسية.
من أين يأتي التحيز؟
عادةً ما يأتي تحيز النموذج (المعاملة المنهجية للنموذج لمجموعات معينة بشكل مختلف/غير عادل) من البيانات، وليس النموذج. المصادر:
- التحيز التاريخي: تعكس البيانات الظلم الماضي. إذا حصلت مجموعة معينة على قدر أقل من الائتمان في الماضي، فإن النموذج الذي تم تدريبه على تلك البيانات سوف يتعلم ويديم هذا التمييز.
- تحيز التمثيل: بعض المجموعات ممثلة تمثيلا ناقصا في البيانات؛ كان أداء النموذج ضعيفًا بالنسبة لهم (على سبيل المثال، دقة منخفضة في عينة ديموغرافية صغيرة).
- تحيز القياس: تكون التسميات نفسها متحيزة (على سبيل المثال، إذا كان تعريف "الموظف الجيد" يعتمد على قرارات الترقية السابقة).
- انحياز التجميع: نظرًا لأن البيانات تأتي من قناة محددة، فهي لا تمثل الكون.
لا يتعلم النموذج هذه التحيزات فحسب؛ توسيع النطاق عن طريق أتمتة ذلك. يؤثر القرار المتحيز الذي يتخذه شخص ما على شخص آخر؛ الحكم على النموذج المتحيز هو الملايين.
تحذير: لا تقع في خطأ قول "النموذج محايد لأنه مجرد رياضيات". يتعلم النموذج ويقوم بأتمتة التحيز البشري في البيانات. فالحياد ليس تقصيرا، بل نتيجة يجب قياسها وضمانها.
قياس العدالة
لإدارة العدالة، من الضروري قياسها أولاً. للقيام بذلك، قم بتقييم النموذج على أساس مجموعة فرعية: هل المقاييس مثل الدقة، والتذكر، والمعدل الإيجابي الخاطئ متساوية عبر المجموعات السكانية المختلفة؟ بعض مفاهيم العدالة:
- عدالة المجموعة: هل يعامل النموذج المجموعات المختلفة بشكل صحيح/غير صحيح وبمعدلات مماثلة؟
- تكافؤ الفرص: هل يلتقط النموذج الإيجابيات الحقيقية بالتساوي في جميع المجموعات (التذكر المتساوي)؟
حقيقة مهمة: قد لا يتم تلبية تعريفات مختلفة للعدالة في نفس الوقت (وهذه نتيجة رياضية). وأي تعريف للعدالة يحظى بالأولوية في هذا السياق هو قرار أخلاقي وتجاري، وليس قرارًا فنيًا، ويتم اتخاذه بالتعاون مع أصحاب المصلحة.
نهج ضعيف / نهج قوي
ضعيف: "الدقة الإجمالية للنموذج هي 88%، وهي نسبة عادلة."
غوتشلو: "كانت الدقة الإجمالية 88%، ولكن عندما قسمناها إلى مجموعات فرعية، كانت نسبة الاسترجاع 91% في مجموعة واحدة و67% في مجموعة أخرى - كان النموذج يفتقد تلك المجموعة بشكل منهجي. قمنا بتوثيق السبب (نقص التمثيل)، وجمعنا البيانات لتلك المجموعة وأعدنا تقييمها بهدف الاستدعاء المتساوي. وقررنا مع أصحاب المصلحة تعريف العدالة الذي سنعطيه الأولوية."
الفرق: النهج القوي لا يختبئ وراء المقياس العام، فهو يفصل بين المجموعات الفرعية ويتعامل مع العدالة كقرار مفتوح.
الأخلاق والشفافية
المبادئ الأساسية للذكاء الاصطناعي المسؤول هي:
- القابلية للتفسير: هل يمكن تفسير سبب اتخاذ النموذج لهذا القرار؟ في القرارات ذات التأثير الكبير (الائتمان، والتوظيف، والرعاية الصحية) يحق للمرء الحصول على تفسير. لا ينبغي استخدام النموذج غير المفسر في هذه المجالات أو يجب دعمه بطريقة قابلة للتفسير.
- الإشراف البشري: لا ينبغي اتخاذ القرارات عالية التأثير تلقائيًا؛ النموذج يقترح، والإنسان يؤكد.
- المساءلة: يجب أن يكون واضحاً من المسؤول عندما يرتكب النموذج خطأً. "النموذج الذي تم تحديده" ليس عذرا.
- الشفافية: يجب أن يعرف المستخدم أنه يتفاعل مع الذكاء الاصطناعي وكيفية استخدام بياناته.
وفي العديد من البلدان والقطاعات، يتم تضمين هذه المبادئ أيضًا في التشريعات (الشفافية والتدقيق والتزامات الرقابة البشرية لأنظمة الذكاء الاصطناعي عالية المخاطر). المهندس مسؤول عن معرفة لوائح مجاله.
نصيحة: احتفظ بـ "بطاقة نموذجية" لكل نموذج عالي التأثير: ما يفعله النموذج، وما هي البيانات التي تم تدريبه عليها، ومدى نجاحه/ضعفه في أي مجموعة، وما هي حدوده المعروفة. تعتبر هذه الوثيقة أداة للشفافية والمساءلة.
التكلفة والاستدامة
الذكاء الاصطناعي ليس رخيصًا. تتم إدارة التكلفة في بعدين:
التكلفة المالية:
- تكلفة الرمز المميز (LLM): رموز تكاليف كل طلب واستجابة؛ مع نمو الحجم، ينمو الفاتورة. تؤدي المطالبات الطويلة غير الضرورية واختيار النماذج الكبيرة جدًا وحلقات الوكيل غير المنضبطة (الوحدة 5) إلى تضخم التكلفة.
- التدريب والاستضافة: يؤدي الضبط الدقيق وعرض النموذج إلى تحمل تكاليف الأجهزة.
- التحسين: لا تستخدم نموذجًا كبيرًا إذا كان النموذج الصغير كافيًا؛ ذاكرة التخزين المؤقت للأسئلة المتداولة؛ تقصير المطالبة؛ دفعة ما يمكن معالجتها.
التكلفة البيئية: يستهلك التدريب والاستدلال على النماذج الكبيرة طاقة كبيرة. الاستدامة تجعل تجنب الحسابات غير الضرورية (نموذج الحجم الصحيح، والهندسة المعمارية الفعالة) مسؤولية مهنية.
نصيحة: القاعدة الأولى لتحسين التكلفة: "ما هو أصغر نموذج مناسب لهذه المهمة؟" إن وضع أقوى نموذج في كل مكان يشبه دق مسمار بمطرقة ثقيلة - فهو مكلف وغير ضروري.
ثلاث حالات صغيرة
الحالة 1 - التمييز الخفي. بدا نموذج فحص التوظيف جيدًا بشكل عام. ووجد تحليل المجموعات الفرعية أن النموذج أكد بشكل منهجي على المرشحات لأن البيانات التاريخية كانت يهيمن عليها الذكور، وقد تعلم التحيز التاريخي. تم إيقاف النموذج وموازنة البيانات ومراقبة مقاييس العدالة. البر العام غطى التمييز الخفي.
الحالة 2 - الرفض غير المبرر. كان نموذج الائتمان يرفض الطلبات، لكن لم يتمكن أحد من تفسير السبب. وعندما طلب أحد العملاء توضيحًا قانونيًا، لم يتمكن الفريق من الرد. تم سحب النموذج من الاستخدام في القرارات عالية التأثير حتى تمت إضافة طريقة قابلة للتفسير وتم تقديم مبرر لكل رفض. الدرس المستفاد: إن قابلية الشرح أمر ضروري في اتخاذ القرارات ذات التأثير العالي.
الحالة 3 - صدمة بيل. كان أحد الفرق يستخدم أكبر ماجستير في القانون ومطالبات طويلة جدًا لكل طلب. زادت الفاتورة الشهرية بشكل غير متوقع. التحليل اللاحق: يمكن حل معظم الطلبات باستخدام نموذج صغير، وكانت نصف المطالبات زائدة عن الحاجة، ويمكن تخزين الأسئلة المتكررة مؤقتًا. أدت هذه التحسينات الثلاثة إلى خفض التكلفة بشكل كبير، دون المساس بالجودة. الدرس المستفاد: النموذج الأقوى ليس ضروريًا في كل مكان.
قوالب قابلة للنسخ
ساعدني في تقييم هذا النموذج من حيث التحيز/العدالة. ما هي المجموعات الفرعية (الديموغرافية/الشريحة) التي يجب أن أقوم بتقسيمها وقياسها؟ ما هي المقاييس (الدقة، والتذكر، والمعدل الإيجابي الكاذب حسب المجموعة) التي يجب أن أقارنها؟ هل يمكن أن تتعارض التعريفات المختلفة للعدالة، وما الذي يجب أن أعطيه الأولوية في هذا السياق ولماذا؟ سياق النموذج/القرار: [شرح]
قم بإنتاج مسودة بطاقة نموذجية لهذا النموذج عالي التأثير. ينبغي أن يتضمن: الغرض، وبيانات التدريب وتاريخه، والأداء في المجموعات الفرعية، والحدود المعروفة، والاستخدام المناسب/غير المناسب، وحالة التفسير، ونقطة الإشراف البشري. الموديل: [الوصف]
ساعدني في تقليل تكلفة تنفيذ LLM هذا، دون المساس بالجودة. متوفر: حجم النموذج، متوسط طول المطالبة، حجم الطلب، هل هناك ذاكرة تخزين مؤقت؟ تقييم: 1) هل النموذج الأصغر كافٍ (لأي مهام)؟ 2) هل يمكن تقصير الموجه؟ 3) هل يمكن تخزين الطلبات المتكررة مؤقتًا؟ 4) هل هناك عمل متاح للدفعة؟ اكتب التأثير المقدر لكل اقتراح.
قم بإعداد قائمة مرجعية للأخلاقيات/المسؤولية لنظام القرارات عالي التأثير هذا. - قابلية الشرح: هل يمكن تقديم مبرر للقرار؟ - الرقابة البشرية: هل يخضع القرار عالي التأثير للموافقة؟ - المساءلة: من المسؤول في حالة الخطأ؟ - الشفافية: هل يعرف المستخدم أنه يتم استخدام الذكاء الاصطناعي؟ - التنظيم: ما هي الالتزامات القانونية المعنية؟ النظام: [وصف]
جدول مصدر التحيز
المصدر
أعراض
الاحتياطات
التحيز التاريخي
التمييز الماضي لا يزال مستمرا
تدقيق البيانات + مقياس العدالة
تحيز التمثيل
دقة منخفضة في مجموعة عينة صغيرة
تحليل المجموعات الفرعية + الموازنة
انحياز القياس
تسميات متحيزة
مراجعة عملية التسمية
التحيز التجميعي
الكون غير ممثل
تنويع الموارد
الأخطاء الشائعة
- الاعتماد على المقياس الشامل. لا يمكن رؤية التمييز الخفي دون تحليل المجموعات الفرعية.
- بافتراض "نموذج محايد". يتعلم النموذج ويضخم التحيز في البيانات.
- ترك القرار عالي التأثير للنموذج غير المفسر. المخاطر القانونية والأخلاقية.
- تجاوز الإشراف البشري. "النموذج الذي قرر" ليس عذرا.
- وضع أكبر نموذج في كل مكان. التكلفة والطاقة غير الضرورية.
- لا تتبع التكلفة. مشروع القانون يتضخم بصمت.
باختصار
يظل النموذج الصحيح من الناحية الفنية فاشلاً إذا لم يكن عادلاً وقابلاً للتفسير ومستدامًا. يأتي التحيز في الغالب من البيانات ويقوم النموذج بتضخيمه على نطاق واسع؛ قم بقياس العدالة حسب المجموعات الفرعية واتفق مع أصحاب المصلحة على تعريف العدالة الذي يجب تحديد أولوياته. تعتبر القابلية للتفسير، والرقابة البشرية، والمساءلة ضرورية في القرارات عالية التأثير؛ توثيق الشفافية باستخدام بطاقة النموذج. إدارة التكلفة والطاقة: اختر أصغر نموذج مناسب، واختصر الموجه، واستخدم ذاكرة التخزين المؤقت والدفعة. وهذه الأبعاد جزء لا يتجزأ من الجودة الهندسية، وليست رتوشاً تضاف لاحقاً.
مهمة التطبيق
تقسيم النموذج إلى مجموعتين فرعيتين على الأقل ومقارنة معدل الاستدعاء والإيجابية الكاذبة على أساس المجموعة؛ إذا كان هناك فرق كبير، اكتب السبب والاحتياط. قم بصياغة بطاقة نموذجية مختصرة لنموذج عالي التأثير (الغرض، البيانات، أداء المجموعة الفرعية، الحدود، إمكانية الشرح). حدد اثنين على الأقل من التحسينات الملموسة (الحد الأدنى / الاقتطاع الفوري / ذاكرة التخزين المؤقت / الدفعة) لتقليل تكلفة تنفيذ LLM وكتابة تأثيرها المقدر.
قائمة مرجعية
- [ ] قمت بتقييم النموذج على أساس المجموعات الفرعية، ولم أعتمد على المقياس العام.
- [ ] قررت مع أصحاب المصلحة تعريف العدالة الذي سأعطيه الأولوية.
- [ ] القرار عالي التأثير قابل للتفسير ويخضع لموافقة الإنسان.
- [ ] لقد قمت بتوثيق الشفافية والحدود باستخدام بطاقة النمط.
- [ ] اخترت أصغر نموذج مناسب؛ لقد قمت بتحسين المطالبة/ذاكرة التخزين المؤقت/الدفعة.
- [ ] أقوم بمراقبة التكلفة وتأثير الطاقة.