Unit 10 / 10

Permohonan Hujung-ke-Hujung: Penilaian, Pengesahan, Etika dan Sempadan

Keuntungan:

  • Keupayaan untuk menyediakan set ujian kecil (eval) yang menilai model dengan data anda sendiri
  • Benamkan pengesahan manusia, had dan dasar penggunaan yang bertanggungjawab ke dalam aliran kerja
  • Kenali halusinasi, privasi dan risiko etika dan laksanakan langkah mengurangkan

Anda telah memilih model yang betul; Adakah kerja itu selesai? Tidak, kerja sebenar bermula sekarang. Meletakkan model ke dalam perniagaan anda adalah untuk mengujinya terhadap data anda sendiri, mengesahkan outputnya dan membingkainya secara bertanggungjawab. Unit akhir ini mengubah keseluruhan modul menjadi aplikasi hujung ke hujung: anda akan belajar cara menyediakan suite ujian kecil (eval), membenamkan pengesahan manusia ke dalam aliran kerja, mengurus risiko halusinasi dan privasi serta melukis sempadan etika. Setelah unit selesai, anda akan dilengkapi untuk bukan sahaja memilih model tetapi juga menugaskannya dengan yakin.

Penilaian (Eval): Menguji dengan Data Anda Sendiri

Kini anda tahu bahawa hanya data sebenar anda, bukan iklan, boleh mengetahui sama ada model sesuai dengan perniagaan anda. Cara untuk mengukur ini adalah dengan menyediakan set penilaian (eval): koleksi kecil sampel daripada kerja anda yang jawapan yang betul diketahui.

Eval mudah disediakan seperti ini:

  1. Kumpul 10-30 sampel sebenar. Pilih input yang tipikal kerja anda (campurkan susah dan senang).
  2. Tentukan "output yang betul/jangkaan" untuk setiap contoh. Apa yang akan dijawab oleh pakar?
  3. Jalankan calon melalui contoh yang sama. Uji model yang anda bandingkan satu persatu dengan set yang sama.
  4. Skor keputusan. Dalam berapa banyak contoh adalah benar? Di mana silapnya? Adakah kesilapan boleh diterima?
  5. Bandingkan dan pilih. Pilih bukan skor keseluruhan tertinggi, tetapi yang paling boleh dipercayai dalam contoh paling kritikal untuk anda.
Petua: Jangan mempercayai papan pendahulu secara membuta tuli. Model mungkin menduduki tempat pertama secara global, tetapi berprestasi lebih teruk daripada model tempat kedua dalam teks undang-undang Turki khusus anda. Eval anda sendiri sebanyak 20 sampel bernilai lebih daripada ratusan ujian awam.

Halusinasi: Risiko Model Yang Paling Menyertai

Halusinasi ialah apabila model menghasilkan maklumat yang sebenarnya tidak benar, dalam bahasa yang yakin. Daripada berkata "Saya tidak tahu", model itu mungkin menghasilkan sekeping perundangan yang tidak wujud, statistik yang dibuat-buat atau tarikh palsu; Lebih-lebih lagi, dia melakukan ini dalam bahasa yang sangat meyakinkan. Ini adalah aspek AI yang paling berbahaya kerana kesilapan menyamar sebagai kebenaran.

Anda tidak boleh menghapuskan halusinasi sepenuhnya, tetapi anda boleh mengurangkannya dan menangkapnya:

  • Berdasarkan sumbernya: Minta model menjana jawapan daripada dokumen yang anda berikan, bukan daripada "memori"nya sendiri (logik RAG).
  • Minta sumber: Katakan, "Di sebelah setiap tuntutan, tulis dokumen/bahagian yang menjadi asasnya"; Jika dia tidak boleh memberi sumber, curigalah.
  • Mendapatkan orang ramai mengatakan mereka tidak pasti: Arahan "Jika anda tidak pasti, tulis 'tidak jelas'" mengurangkan pemasangan model.
  • Pengesahan manusia: Output kritikal mesti disahkan oleh manusia.
Awas: Jangan sekali-kali menggunakan output model tanpa mengesahkannya untuk keputusan undang-undang, perubatan atau kewangan. "Artikel undang-undang" atau "maklumat dos" yang dihasilkan oleh model mungkin direka sepenuhnya. Dalam bidang ini, AI ialah draf/alat awal; Orang yang cekap sentiasa mempunyai kata-kata terakhir.

Keperluan untuk Pengesahan Manusia

Kecerdasan buatan berfungsi paling baik sebagai alat yang mempercepatkan orang, bukan membuat mereka kehilangan pekerjaan. Persediaan yang betul adalah seperti berikut: menghasilkan atau pra-melayakkan draf model; ulasan manusia, membetulkan, dan meluluskan. Seberapa ketat pengesahan perlu bergantung pada kos ralat.

Pencarian

Kos ralat

pengesahan manusia

Draf penerangan produk

rendah

Kawalan sampel sudah mencukupi

Respons e-mel pelanggan

sederhana

Semakan pra penyerahan

Analisis risiko kontrak

tinggi

Artikel demi artikel pengesahan pakar

Nasihat perubatan/kewangan

sangat tinggi

Pengesahan pakar penuh, sokongan AI sahaja

Jadual ini mencapai keseimbangan antara "menyemak setiap output secara manual" dan "tidak menyemak sama sekali." Walaupun kawalan sampel mencukupi untuk kerja kos rendah, setiap output mesti disahkan untuk kerja berharga tinggi.

Penggunaan Beretika dan Bertanggungjawab

Walaupun pemilihan model mungkin kelihatan seperti keputusan teknikal, terdapat tanggungjawab etika di belakangnya:

  • Ketelusan: Beritahu pelanggan atau pekerja anda bahawa anda menggunakan AI di tempat yang sesuai. Pelanggan mempunyai hak untuk mengetahui sama ada mereka bercakap dengan manusia atau AI.
  • Bias: Model boleh mewarisi berat sebelah daripada data yang mereka dilatih. Pantau keadilan hasil dalam bidang sensitif seperti pengambilan dan penilaian kredit.
  • Privasi: Benamkan prinsip perlindungan data yang anda pelajari dalam unit 8 ke dalam aliran kerja; Jangan hantar data peribadi secara melulu.
  • Akauntabiliti: Apabila kesilapan berlaku, pertahanan "AI berjaya" tidak mencukupi. Tanggungjawab terletak pada institusi yang menggunakan kenderaan. Jadi proses pengesahan dokumen.
Petua: Tulis sedikit "dasar penggunaan yang bertanggungjawab" ke dalam aliran kerja anda: pekerjaan yang boleh menggunakan AI, data yang tidak boleh dihantar, siapa yang akan mengesahkannya dan cara ralat akan dilaporkan. Dokumen satu halaman ini menghalang masalah besar pada masa hadapan.

Tiga Kes Realistik

Kes 1 — Menyesal tanpa mewujudkan eval. Pasukan insurans mula meringkaskan tuntutan tanpa menguji model yang paling popular. Selepas dua minggu, mereka menyedari bahawa model itu kerap membuat kesilapan dalam istilah teknikal Turki dan membaca beberapa jumlah dengan salah. Apabila mereka menyediakan eval sebanyak 20 sampel dan membandingkan tiga model, mereka beralih kepada model yang tidak paling popular tetapi lebih tepat dalam teks teknikal Turki. Kerugian: dua minggu dan buruh membaca pruf. Pengajaran: eval dahulu, gunakan kemudian.

Kes 2 — Proses yang menangkap halusinasi. Paralegal melihat rujukan "keputusan Mahkamah Agung" dalam cetakan model. Memandangkan proses mereka mempunyai peraturan "sahkan setiap rujukan", dia mencari keputusan itu dan mendapati tiada keputusan sedemikian wujud; Dia membuat model. Terima kasih kepada pengesahan manusia, maklumat rekaan tidak pernah sampai kepada pelanggan. Tanpa peraturan pengesahan, kehilangan reputasi boleh menjadi serius.

Kes 3 — Amanah dengan ketelusan. Sebuah syarikat e-dagang menghasilkan respons sokongan pelanggan dengan AI, tetapi menambah nota di bawah setiap respons: "Respons ini disediakan dengan sokongan kecerdasan buatan dan telah disemak oleh salah seorang wakil kami." Pelanggan lebih berpuas hati dengan tindak balas yang cepat dan keyakinan melihat manusia bertunang. Ketelusan bukanlah kelemahan untuk disembunyikan, tetapi sumber kepercayaan.

Gesaan Lemah / Gesaan Kuat: Output Boleh Disahkan

Gesaan yang lemah:

Beritahu saya tentang klausa berisiko kontrak ini.

Boleh muat model; tiada sumber, tiada tanda ketidakpastian.

Gesaan kuat:

Peranan anda: penganalisis kontrak (keputusan muktamad adalah milik peguam). Tugas: Serlahkan klausa yang berpotensi berisiko dalam kontrak berikut. Bagi setiap penemuan: (1) nombor klausa dan petikan kata kerja, (2) mengapa ia berisiko, (3) tahap keyakinan anda (tinggi/sederhana/rendah). Bergantung hanya pada klausa dalam teks; Jangan reka apa-apa yang tiada dalam teks. Jika anda tidak pasti, tulis "pengesahan peguam diperlukan". [kontrak]

Gesaan yang kuat memautkan setiap tuntutan kepada sumber (nombor artikel + petikan), memerlukan tahap keyakinan dan melarang pemalsuan; Ini menjadikan halusinasi mudah ditangkap.

Templat Boleh Disalin

1. Reka bentuk set Eval:

Reka set penilaian untuk tugasan berikut [TUGASAN]. Cadangkan 15 input sampel (campuran mudah-sederhana-sukar), cara "output betul yang dijangkakan" akan ditakrifkan untuk setiap satu dan tentukan kriteria pemarkahan (1-5).

2. Balutan mengurangkan halusinasi:

Tulis semula gesaan berikut untuk mengurangkan fabrikasi: "[PROMPT]". Tambahkan peraturan untuk memetik sumber, menentukan tahap keyakinan dan "beritahu saya jika anda tidak pasti."

3. Reka bentuk aliran pengesahan:

Dalam aliran kerja berikut [WORKFLOW] Reka langkah pengesahan manusia untuk output AI. Tentukan betapa ketat pengesahan harus berdasarkan kos ralat; tulis siapa yang akan menyemak apa, bila.

4. Draf dasar penggunaan yang bertanggungjawab:

Draf "dasar penggunaan AI yang bertanggungjawab" satu halaman untuk pasukan dalam [INDUSTRI]. Sertakan tajuk berikut: penggunaan yang dibenarkan, data yang dilarang, tanggungjawab pengesahan, pelaporan ketelusan, pelaporan ralat.

Kesilapan biasa

  • Menggunakan tanpa Eval: Memulakan model tanpa mengujinya dengan data anda sendiri dan melihat ralat selepas ia ditunjukkan dalam pelanggan/kerja.
  • Bergantung pada halusinasi: Menggunakan bahasa yakin model sebagai kebenaran tanpa mengesahkan rujukan.
  • Melangkaui pengesahan manusia: Membiarkan output tidak disemak dalam keputusan kos tinggi; Bersandar pada pertahanan "AI melakukannya".
  • Mengelakkan ketelusan: Menyembunyikan penggunaan AI anda; mengalami kehilangan keyakinan apabila ia berlaku.
  • Mengabaikan etika dan berat sebelah: Menggunakan keputusan sensitif (pengambilan pekerja, kredit) tanpa memantau kesaksamaan output.

Secara ringkasnya

  • Sebelum menggunakan model, sediakan set eval kecil dengan data anda sendiri dan uji calon; kedudukan keseluruhan tidak mewakili perniagaan anda.
  • Halusinasi ialah pengeluaran bahasa palsu model yang yakin; Ditangkap oleh atribusi sumber, tahap kepercayaan dan pengesahan manusia.
  • Ketegasan pengesahan manusia diselaraskan mengikut kos kesilapan; Dalam bidang kritikal AI hanya sokongan, keputusan adalah hak manusia.
  • Ketelusan, kawalan berat sebelah, kerahsiaan dan akauntabiliti; adalah empat tonggak penggunaan AI yang bertanggungjawab. Polisi satu halaman menghalang risiko besar.

Tugasan permohonan

Sediakan set penilaian 15 contoh dengan templat 1 dalam unit ini (reka bentuk set eval) untuk model calon yang anda pilih sepanjang modul dan bandingkan sekurang-kurangnya dua model dengan set ini. Kemudian reka bentuk cara output akan disahkan oleh manusia dengan templat 3 (aliran pengesahan) dan draf dasar satu halaman untuk pasukan anda dengan templat 4 (dasar penggunaan bertanggungjawab). Ketiga-tiga penghantaran ini menjadikan keseluruhan modul menjadi pelan penggunaan yang boleh dilaksanakan.

senarai semak

  • [ ] Dengan data saya sendiri, saya boleh menyediakan set eval kecil dan membandingkan model.
  • [ ] Saya boleh mengenali halusinasi dan menggunakan langkah mengurangkan dan menangkap.
  • [ ] Saya boleh melaraskan ketegasan pengesahan manusia berdasarkan kos ralat.
  • [ ] Saya boleh membenamkan prinsip ketelusan, berat sebelah, kerahsiaan dan akauntabiliti ke dalam aliran kerja.
  • [ ] Saya boleh merangka dasar penggunaan AI yang bertanggungjawab satu halaman.

Peperiksaan Modul

1. Apakah perbezaan antara 'penyedia' AI dan 'keluarga model'?

  • A) Pembekal ialah syarikat yang membangunkan model dan keluarga model ialah kumpulan model syarikat itu di bawah jenama ✔
  • B) Mereka adalah perkara yang sama dan digunakan secara bergantian
  • C) Penyedia ialah harga model, keluarga model ialah kelajuan model.
  • D) Keluarga model merujuk kepada syarikat, pembekal merujuk kepada versi model tunggal

Penerangan: Pembekal ialah syarikat yang membangunkan model (cth. Anthropic); Keluarga model ialah kumpulan model yang syarikat itu kumpulkan di bawah jenama (contohnya, Claude). Versi model ialah versi khusus dalam keluarga.

2. Bagaimanakah 'berat' model boleh ditakrifkan dengan paling tepat?

  • A) Ia ialah bilangan token yang boleh dihasilkan oleh model setiap minit
  • B) Ia adalah berbilion parameter berangka yang model belajar semasa latihan dan menyimpan maklumatnya. ✔
  • C) Ia ialah yuran langganan bulanan model
  • D) Ia ialah bilangan bahasa yang disokong oleh model

Penerangan: Berat ialah berbilion parameter berangka yang model belajar semasa latihan; Di situlah 'semua yang diketahui model' disimpan. Perbezaan berat tertutup/eksplisit bergantung pada sama ada parameter ini boleh dimuat turun dan dijalankan.

3. Pernyataan yang manakah benar tentang 'open-weight' dan 'open-source'?

  • A) Mereka adalah konsep yang sama dan kedua-duanya memberikan penggunaan komersial tanpa had
  • B) Berat terbuka sentiasa menjadikan data latihan awam juga
  • C) Ia bukan perkara yang sama; Dalam wajaran terbuka, biasanya hanya parameter dikongsi dan syarat lesen mungkin mengehadkan penggunaan komersial ✔
  • D) Model sumber terbuka tidak boleh dimuat turun, model berat terbuka boleh dimuat turun

Penjelasan: Dalam wajaran terbuka, hanya parameter model dikongsi; data dan proses latihan selalunya tidak didedahkan, dan sesetengah lesen mengehadkan penggunaan komersial. Jadi 'open weight' tidak betul-betul sama dengan 'open source'.

4. Antara berikut, yang manakah ciri model yang paling menentukan untuk pasukan undang-undang yang membaca dan menganalisis kontrak panjang?

  • A) Mempunyai harga token terendah
  • B) Mempunyai keupayaan pemprosesan visual (multimodal).
  • C) Mempunyai lesen berat terbuka
  • D) Mempunyai tetingkap konteks yang luas ✔

Penjelasan: Model memerlukan tetingkap konteks yang besar untuk memproses dokumen yang panjang secara keseluruhan; Tetingkap konteks ialah jumlah jumlah token yang boleh diingat oleh model pada satu masa.

5. Yang manakah benar tentang harga token untuk model berat tertutup?

  • A) Token output biasanya jauh lebih mahal daripada token input ✔
  • B) Input dan output sentiasa harga yang sama
  • C) Hanya bayaran bulanan tetap yang dikenakan, jumlah penggunaan adalah tidak relevan
  • D) Token input sentiasa berkali-kali lebih mahal daripada output

Penjelasan: Harga dikira setiap token, dan token output yang dihasilkan oleh model biasanya beberapa kali lebih mahal daripada token input yang anda hantar. Oleh itu, cetakan yang panjang dan tidak perlu meningkatkan kos dengan cepat.

6. Ciri yang manakah dalam model yang penting untuk pasukan perakaunan yang ingin mengekstrak data secara automatik daripada imej invois?

  • A) Tetingkap konteks seluas mungkin
  • B) Multimodaliti (keupayaan pemprosesan visual) ✔
  • C) Lesen berat terbuka
  • D) Tahap penaakulan tertinggi

Penjelasan: Untuk memahami kandungan visual, model mesti boleh memproses imej dan juga teks, iaitu, ia mesti multimodal. Multimodaliti ialah keupayaan model untuk mengendalikan pelbagai jenis data, seperti teks, imej, dan kadangkala audio.

7. Apakah pilihan yang paling logik untuk tugasan bervolume tinggi dan mudah (cth. klasifikasi positif/negatif bagi beribu-ribu ulasan)?

  • A) Sentiasa model penaakulan terkuat dan paling mahal
  • B) Model yang berfungsi hanya pada berat terbuka dan pada pelayannya sendiri
  • C) Model ringan dan kos rendah, kerana tugasnya mudah dan volumnya tinggi ✔
  • D) Model dengan tetingkap konteks terluas

Penerangan: Model ringan dan kos rendah melakukan helah untuk tugasan yang mudah dan volum tinggi; Menggunakan model yang paling berkuasa dan mahal menghasilkan kos yang tidak perlu di sini. Pendekatan yang betul adalah untuk memadankan kesukaran tugasan dengan peringkat model.

8. Apakah yang mencetuskan penghantaran teks yang mengandungi data peribadi kepada pembekal AI berasaskan asing dari segi KVKK?

  • A) Ia tidak mewujudkan sebarang liabiliti undang-undang
  • B) Hanya penting jika pembekal berada di EU, tiada kes lain
  • C) Ia dilarang sama sekali dalam semua keadaan, tidak kira sama ada data itu tanpa nama atau tidak
  • D) Pemindahan data ke luar negara dipertimbangkan dan tertakluk kepada syarat khas KVKK ✔

Penjelasan: Data pengendalian pada pelayan pembekal di luar negara dianggap 'pemindahan data ke luar negara' dan tertakluk kepada syarat khas KVKK mengenai perkara ini (seperti persetujuan yang jelas, keputusan kecukupan, jaminan yang sesuai).

9. Apakah yang dilakukan oleh mod 'penaakulan' model dan bagaimana ia mempengaruhi kos?

  • A) Ia meningkatkan ketepatan dalam masalah yang kompleks, tetapi meningkatkan kos dan kelewatan kerana ia menjana lebih banyak token ✔
  • B) Sentiasa menjadikan model percuma
  • C) Hanya menambah bilangan bahasa yang disokong oleh model
  • D) Sentiasa memendekkan jawapan dan mengurangkan kos

Penerangan: Mod penaakulan membolehkan model 'berfikir' langkah demi langkah sebelum memberikan jawapan; Ia meningkatkan ketepatan dalam masalah berbilang langkah dan kompleks, tetapi ia juga meningkatkan kos dan kelewatan kerana ia menjana lebih banyak token.

10. Apakah pendekatan yang paling boleh dipercayai semasa menilai (eval) model untuk perniagaan anda sendiri?

  • A) Hanya memilih model yang paling popular dan menggunakannya tanpa ujian
  • B) Sediakan set ujian kecil tugas sebenar anda sendiri dan bandingkan model dengannya ✔
  • C) Hanya melihat markah penanda aras yang dinyatakan dalam iklan
  • D) Terima model dengan tetingkap konteks tertinggi secara automatik sebagai yang terbaik

Penjelasan: Daripada bergantung secara membuta tuli pada papan pendahulu, mencipta set ujian kecil tugas sebenar anda sendiri dan membandingkan model pada set ini akan mendedahkan set yang benar-benar sesuai dengan perniagaan anda.

11. Bagaimanakah pengetahuan bahawa output model mungkin mengandungi 'halusinasi' membentuk aliran kerja anda?

  • A) Keluaran hendaklah sentiasa dianggap betul dan diterbitkan secara langsung
  • B) Halusinasi hanya dilihat dalam model percuma, bukan dalam model berbayar
  • C) Dalam keputusan kritikal, output mesti disahkan oleh manusia dan sumber mesti disahkan ✔
  • D) Halusinasi boleh dihapuskan sepenuhnya dengan hanya menukar model

Penjelasan: Halusinasi ialah apabila model menghasilkan maklumat yang sebenarnya tidak benar, dalam bahasa yang yakin. Disebabkan risiko ini, pengesahan output oleh manusia harus diperlukan, terutamanya untuk keputusan undang-undang, perubatan dan kewangan.

12. Apakah logik asas pendekatan 'portfolio model' yang diguna pakai oleh institusi matang?

  • A) Untuk memastikan kesederhanaan dengan membuat setiap kerja dilakukan oleh satu model yang paling mahal.
  • B) Hanya menggunakan model termurah dan mengabaikan kualiti sepenuhnya
  • C) Jangan gunakan sebarang model dan lakukan semua kerja secara manual
  • D) Mengoptimumkan kos dan mengurangkan pergantungan kepada satu pembekal dengan menggunakan model yang berbeza mengikut tugas ✔

Penerangan: Portfolio model adalah menggunakan model yang berbeza mengikut tugas: model murah untuk kerja mudah dan besar, model berkuasa untuk kerja kompleks, berat terbuka/model serantau untuk data sulit. Ini mengoptimumkan kos dan mengurangkan pergantungan pada satu pembekal.

13. Mengapakah negara asal dan dasar pengekalan data boleh menjadi kriteria untuk pemilihan model?

  • A) Kerana ia memberi kesan secara langsung kepada peraturan, kedaulatan data dan keperluan privasi ✔
  • B) Hanya kerana ia menentukan kelajuan tindak balas model
  • C) Kerana ia menentukan format fail yang disokong oleh model
  • D) Kerana ia tidak mempunyai kesan praktikal, ia hanya perincian pemasaran

Penerangan: Negara tempat pembangun model berada dan tempat/berapa banyak data disimpan; Ia adalah penentu dari segi peraturan undang-undang, kedaulatan data dan privasi. Contohnya, untuk organisasi yang ingin menjadi hos dalam EU, pembekal serantau atau pilihan storan sifar menjadi penting.

14. Manakah yang paling tepat menerangkan mengapa mencari 'model terbaik tunggal' dalam tugasan adalah mengelirukan?

  • A) Semua model sebenarnya mempunyai keupayaan yang sama
  • B) Model kuat dalam saiz yang berbeza, jadi 'terbaik' bergantung pada keperluan kerja ✔
  • C) Model yang paling mahal secara automatik adalah yang terbaik pada setiap tugas
  • D) Pemilihan model hendaklah dibuat secara rawak sepenuhnya

Penerangan: Model kukuh pada dimensi berbeza seperti kelajuan, kos, konteks, pelbagai mod, privasi dan penaakulan. Model yang menjadi pemimpin pada satu dimensi mungkin lemah pada dimensi lain; jadi 'terbaik' sentiasa bergantung pada keperluan kerja.