Vahid 1 / 11

ML Mühəndisliyində Süni İntellekt: Rol, Sərhədlər, Doğrulama və Məsuliyyət

Qazanclar:

  • ML iş prosesində (kod, məlumat, sənəd) süni intellektin aşağı risklə vaxta qənaət etdiyini və tapşırıq risk səviyyəsinə uyğun olaraq metrik/məlumat/istehsal kimi qərarların insanın ixtiyarına verildiyini ayırd edə bilmək.
  • Hər bir AI çıxışını mənbəyə qoşmaqla, yenidən işə salmaqla, ölçməklə və mühəndis filtrindən keçirərək yoxlayan intizamı tətbiq etmək bacarığı.
  • Xam məxfi və şəxsi məlumatları xarici alətlərə göndərməmək, korporativ tərəfindən təsdiqlənmiş vasitələrdən istifadə etmək və yalnız müdafiə məqsədləri üçün təhlükəsizlik məsələləri ilə məşğul olmaq vərdişini əldə etmək bacarığı.

Maşın Öyrənmə Mühəndisliyində Süni İntellekt: Rol, Sərhədlər, Doğrulama və Məsuliyyət

Maşın öyrənmə mühəndisi (ML mühəndisi: verilənlərdən istehsala öyrənən modelləri dizayn edən, öyrədən və gətirən proqram təminatı mütəxəssisi) bu gün işinin hər addımında başqa bir süni intellekt aləti ilə işləyir. Kod yazarkən kodlaşdırma köməkçisi, verilənləri araşdırarkən danışıq modeli və sənədləri hazırlayarkən böyük dil modeli (LLM: mətni anlayan və istehsal edən milyardlarla parametrli neyron şəbəkəsi) qüvvədədir. Bu modul süni intellekti həm hazırlanmış məhsul, həm də ML mühəndisinin gündəlik iş aləti kimi nəzərdən keçirir. O, iki rolu qarışdırmadan məsuliyyətin sərhədlərini aydın şəkildə müəyyən etməklə fəaliyyət göstərir.

Bu birinci bölmədə biz əsas suala cavab veririk: ML mühəndisliyində harada süni intellekt real vaxta qənaət edir və qərarı insanların öhdəsinə buraxmalıyıq? Cavab mühəndislik intizamının mərkəzindədir: edən sürətlidir, yoxlayan cavabdehdir.

Süni intellekt ML mühəndisliyində harada faydalıdır?

Bir ML layihəsi təxminən aşağıdakı xətlərdən keçir: məlumatların toplanması, məlumatların təmizlənməsi, xüsusiyyət mühəndisliyi (xam məlumatların modelin başa düşə biləcəyi rəqəmsal siqnallara çevrilməsi), model təlimi, qiymətləndirmə, yerləşdirmə (yerləşdirmə: modeli real istifadəçiyə açmaq) və monitorinq. AI bu xəttdə hər dayanacaqda kömək edir, lakin onun səlahiyyət səviyyəsi dəyişir.

Yüksək mükafatlı, aşağı riskli sahələr: kod skeletinin yaradılması, məlumatların çevrilməsi funksiyasının tərtib edilməsi, jurnal mesajlarının şərh edilməsi, yığın izinin təsviri, təcrübə qeydlərinin ümumiləşdirilməsi, sənədlərin və README-lərin yazılması, test işi təklif etmək. Burada süni intellektin səhvləri ucuzdur; çünki çıxış artıq sınaqdan və baxışdan keçəcək.

Yüksək riskli sahələr: hansı məlumatların təlimə daxil olacağına qərar vermək, modelin istehsala daxil olub-olmadığını təsdiqləmək, metrikanın “kifayət qədər yaxşı” olduğunu qiymətləndirmək, şəxsi məlumatların işlənməsi qərarı, təhlükəsizlik açığını “zibil” kimi bağlamaq. Bunlar pula, məxfiliyə, hüquqi məsuliyyətə və istifadəçi etibarına təsir edir. Süni intellekt burada təkliflər verir; Qərar səlahiyyətli mühəndis və məsul komanda tərəfindən qəbul edilir.

İpucu: Tapşırığı AI-yə təhvil verməzdən əvvəl soruşun: "Bu nəticə səhvdirsə, xərc nədir və hər kəs səhvi nə qədər asanlıqla tuta bilər?" Qiymət aşağıdırsa və ələ keçirmək asandırsa, keçin. Qiymət yüksəkdirsə və ya ələ keçirmək çətindirsə, AI-dan yalnız qaralama üçün istifadə edin və siz qərar verin.

Doğrulama intizamı: üç addım

ML mühəndisliyində AI çıxışı heç vaxt “bitmiş iş” deyil; Qaralamadır. Hər çıxışı bu üç addımdan keçirin:

  1. Mənbəyə qoşun. Model rəqəm, hədd və ya “ən yaxşı təcrübə” deyirsə, bunu rəsmi sənədlərə, kod bazasındakı faktiki dəyərə və ya ölçülmüş metrikaya əsaslandırın. “Modelin uyğunlaşdırılması” (hallüsinasiya: dil modeli ilə qeyri-real məlumatın etibarlı istehsalı) burada ən çox tutulur.
  2. Yenidən başladın və ölçün. Yaradılmış kodu işə salın, öz test dəstinizdə istehsal etdiyi metrikanı yenidən hesablayın, kiçik bir nümunədə təklif olunan SQL sorğusunu təsdiqləyin. İşləməyən kod gözəl görünsə belə, dəyərsizdir.
  3. Mühəndislik filtrindən keçirin. Çıxış miqyasda saxlanılırmı? Kənar hallar (boş verilənlər, çox böyük giriş, çatışmayan sahələr) nəzərdən keçirilibmi? Təhlükəsizlik və məxfilik pozuntusu varmı? Bu addımı ancaq sahəni bilən adam edə bilər.

Zəif məlumat / Güclü göstəriş

Zəif təklif: "Mənə bir neçə model təlim kodu yazın."

Güclü göstəriş: "Scikit-learn ilə binar təsnifat üçün təlim skripti yazın. Daxil edin: data/train.parquet, hədəf sütun is_churn. Sinif balanssızlığı var (müsbət nisbət ~8%), onu class_weight ilə idarə edin. Yanlış qiymətləndirilmə üçün PR-AUC (dəqiqlik-yada salma əyrisi altındakı sahə) istifadə edin. data. Təsadüfi toxumu 42-ə düzəldin. PR-AUC kod çapının sonunda test edin."

Fərq: ikinci operativ tapşırıq məlumatların həqiqətini, düzgün metrikanı, balanssızlıq məlumatını və təkrarlanma tələbini ehtiva edir. Məhz bu kontekstdən çıxış yoxlanıla və istifadə edilə bilər.

Məxfilik və məlumat təhlükəsizliyi: mühəndisin ilk məsuliyyəti

ML mühəndisi tez-tez şirkətin ən həssas məlumatlarına toxunur: müştəri qeydləri, əməliyyat tarixi, sağlamlıq və ya maliyyə məlumatları, istehsal sistemlərinin qeydləri. Süni intellekt alətlərinə məlumat verərkən üç qayda:

  • Xaricdən şəxsi və məxfi məlumatları xarici alətlərə göndərməyin. Məsələn, müştəri e-poçtlarını sorğuya yerləşdirmək əvəzinə, sxem və saxta (sintetik) nümunələri göndərin. Real məlumat əvəzinə "məs: ahmet@example.com" kimi maskalı nümunədən istifadə edin.
  • Korporativ təsdiqlənmiş avtomobillərdən istifadə edin. Məlumatların harada işləndiyi, saxlanması, təhsil üçün istifadə edilib-edilməməsi müqavilə ilə aydın olan alətləri seçin. Korporativ məlumatların şəxsi hesabla işlənməsi əksər şirkətlərdə pozuntudur.
  • Minimum məlumat siyasəti. Tapşırığı həll etmək üçün lazım olan minimum konteksti verin. Bütün cədvəl deyil, müvafiq 5 sütun və sxem.
Diqqət: Dil modelinə verdiyiniz mətnin geri qaytarıla bilməyəcəyini düşünün. “Sonra siləcəm” düşüncəsi ilə xam şəxsi məlumatları göndərməyin; Risk göndərildiyi anda baş verdi.

Təhlükəsizlik sahəsində müdafiə istifadəsi

ML mühəndisləri tez-tez təhlükəsizlik sistemlərini quraşdırırlar: fırıldaqçılığın aşkarlanması, zərərli trafik təsnifatı, autentifikasiya. Bu modul boyunca biz yalnız müdafiə məqsədləri üçün təhlükəsizlik məsələlərini əhatə edirik: hücumun aşkar edilməsi, sistemin sərtləşdirilməsi, zəifliyin bağlanması. İcazəsiz giriş, məlumat sızması və ya başqasının sisteminə icazəsiz müdaxilə üçün süni intellektdən istifadə həm qanunsuzdur, həm də peşə etikasına ziddir. Zəiflik aşkar etdikdə, düzgün yol onu məsuliyyətlə bildirmək və onu düzəltməkdir; istismar etmə.

üç mini qutu

1-ci hal - Vaxta qənaət edildi. ML mühəndisi adətən yarım gününü 40 sütunlu məlumat dəstinin kəşfiyyat məlumatlarının təhlilinə (EDA) sərf edərdi. O, süni intellektə sxem və df.describe() çıxışını verdi və soruşdu: "Hansı sütunlarda yüksək həddi və çatışmayan nisbət var, hansı transformasiyaları tövsiyə edirsiniz?" 20 dəqiqə ərzində o, hər bir elementi öz kodu ilə yoxlayan prioritet siyahı aldı. Qənaət edin: ~3 saat, səhv riski azdır, çünki hər bir iddia ölçülür.

Case 2 - Yaxalanan xəta. "Təlim dəqiqliyi 99%, əladır" dedi model söhbət köməkçisi. Mühəndis üçüncü addımı (mühəndislik filtri) tətbiq etdi və başa düşdü: hədəf sütununda təsadüfən atributlar sızdı (məlumat sızması: model təlimdə görməməli olduğu məlumatları görür). Faktiki performans çox aşağı idi. Süni intellektin “böyük” təfsiri yox, mühəndisin skeptisizmi işi xilas etdi.

Case 3 - Məxfiliyin pozulmasının qarşısının alınması. Komanda istehsal xətası qeydlərini xarici modelə yapışdırır və "bu xətanı düzəldin" deyirdi. Jurnallarda müştərinin şəxsiyyət nömrələri var idi. Komanda əvvəlcə jurnalları maskalayan kiçik bir skript yazmaq (onların şəxsiyyət nömrələrini *** etmək) və onları bu şəkildə göndərmək qaydasını yaratdı. Pozulma riski aradan qalxdı, yardımın sürəti dəyişmədi.

Kopyalana bilən şablonlar

Tapşırıq: [nə etməli, tək cümlə]Kontekst: [məlumat sxemi, ölçüsü, məhdudiyyətlər; AKTUAL şəxsi məlumat YOXDUR]Məhdudiyyətlər: [dil/kitabxana, performans, təkrar istehsal]Metriklər: [uğur necə ölçülməlidir]Arzu olunan nəticə: [kod/təsvir/siyahı] və niyə bu formatda

Bu kodu yoxlayın. Təkcə onun işlədiyini deyil, həm də aşağıdakılar baxımından qiymətləndirin: 1) Kənar vəziyyətlər (boş daxiletmə, çatışmayan sütun, çox böyük məlumat)2) Məlumat sızması riski3) Təkrarlanma qabiliyyəti (toxum, versiya) Tapdığınız hər bir problem üçün düzəlişlər təklif edin. Əmin olmadığınız yerdə "yoxlayın" işarələyin. Kod: [kod]

Bu metrikanın nəticəsini şərh edin, lakin əvvəlcə soruşun: bu metrik bu problem üçün düzgündürmü?Problem: [balanslaşdırılmış/balanssız təsnifat, reqressiya, sıralama...]Hesablanmış metrik və dəyər: [məs. dəqiqlik 0.99]Hansı metrikanı tövsiyə edərdiniz və niyə və cari nəticədən şübhələnmək üçün hansı əlamətlərə diqqət etməliyəm?

Aşağıdakı sorğuya verəcəyim məlumatlarda şəxsi/məxfi məlumatların olub olmadığını yoxlayın. Aşağıdakı mətndə maskalanmalı olan sahələri (ad, e-poçt, şəxsiyyət nömrəsi, telefon, ünvan) qeyd edin. Mətn: [mətn]

Rol və səlahiyyət cədvəli

Quest

Süni intellektin rolu

Qərarın sahibi

Kod skeleti / çevrilmə funksiyası

qaralama generatoru

Mühəndis (rəylər)

EDA / məlumat xülasəsi

sürətləndirici

Mühəndis (ölçməklə yoxlayır)

Metrik şərh

Təklif

mühəndis

Hansı məlumatlar təlimə daxil olacaq?

Təklif

Komanda + məlumat sahibi

Modeli istehsala qoyun

Yoxlama siyahısı xatırlatma

Məsul mühəndis + komanda

Şəxsi məlumatların emalı

Yoxdur (istifadə olunmur)

Hüquqi + məlumat nəzarətçisi

Ümumi səhvlər

  • Çıxışı təsdiq etmədən istifadə etmək. Ən ümumi və ən bahalı səhv. Gözəl görünən kod və ya metrik onun düzgün olduğunu bildirmir.
  • Xam məxfi məlumatların alətə yapışdırılması. Bir dəfə göndərilsə, geri götürülə bilməz.
  • Səhv metrikaya güvənmək. Balanssız məlumatlarda dəqiqlik və sıralama problemlərində RMSE kimi uyğun olmayan ölçülər yanıltıcıdır.
  • Qərar verən kimi süni intellektlə səhv salmaq. O, təkliflər verir; Məsuliyyət imzalayanın üzərinə düşür.
  • Kontekstsiz sorğu. “Model yaz” kimi qeyri-müəyyən sorğular yoxlanılmayan nəticə çıxarır.

Xülasə

Süni intellekt həm ML mühəndisi tərəfindən hazırlanmış məhsuldur, həm də onun gündəlik replikatorudur. Onun dəyəri aşağı riskli, kod-data-sənəd kimi asan yoxlanılan tapşırıqlarda ən yüksəkdir; Pul, məxfilik və təhlükəsizliyə təsir edən qərarlar şəxslə qalır. Hər çıxışı mənbəyə qoşun, yenidən ölçün, mühəndis filtrindən keçin. Məxfi məlumatları qoruyun, təsdiq edilmiş avtomobillərdən istifadə edin, yalnız müdafiə məqsədləri üçün təhlükəsizlikdə işləyin. Bu intizam bütün sonrakı bölmələr üçün əsasdır.

Tətbiq tapşırığı

Öz layihənizdən bir tapşırıq seçin (məsələn, məlumatların təmizlənməsi funksiyasının yazılması). Əvvəlcə zəif əmr yazın, sonra bu vahiddəki şablondan istifadə edərək güclü əmr yazın. Hər iki çıxışı götürün, üç addımlı doğrulama tətbiq edin (mənbəyə keçid, təkrar icra, mühəndislik filtri). Hansı sorğunun neçə dəqiqə və neçə düzəliş saxladığını qeyd edin.

yoxlama siyahısı

  • [ ] Tapşırığımın risk səviyyəsini (aşağı/yüksək) təyin etmişəm.
  • [ ] Mən sorğuya heç bir faktiki şəxsi/məxfi məlumat qoymadım; Mən onu maskaladım və ya sintetik nümunədən istifadə etdim.
  • [ ] Mən çıxışı mənbəyə bağladım, yenidən işə saldım, mühəndislik baxımından süzdüm.
  • [ ] Düzgün metrikanı seçdiyimi yoxladım.
  • [ ] Mən kritik qərarı (istehsalata, məlumatların işlənməsinə) özüm/komanda ilə verdim, bunu süni intellektin öhdəsinə buraxmadım.
  • [ ] Mən korporativ təsdiqlənmiş avtomobildən istifadə etdim.