Satuan 10 / 10

Penerapan End-to-End: Evaluasi, Validasi, Etika dan Batasan

Keuntungan:

  • Kemampuan untuk menyiapkan set pengujian kecil (eval) yang mengevaluasi model dengan data Anda sendiri
  • Sematkan verifikasi manusia, batasan, dan kebijakan penggunaan yang bertanggung jawab ke dalam alur kerja
  • Kenali risiko halusinasi, privasi, dan etika serta terapkan langkah-langkah mitigasi

Anda telah memilih model yang tepat; Apakah pekerjaannya sudah selesai? Tidak, pekerjaan sebenarnya dimulai sekarang. Memasukkan model ke dalam bisnis Anda berarti mengujinya terhadap data Anda sendiri, memvalidasi keluarannya, dan menyusunnya secara bertanggung jawab. Unit terakhir ini mengubah seluruh modul menjadi aplikasi ujung ke ujung: Anda akan mempelajari cara menyiapkan rangkaian pengujian kecil (eval), memasukkan verifikasi manusia ke dalam alur kerja, mengelola risiko halusinasi dan privasi, dan menarik batasan etika. Setelah unit selesai dibuat, Anda tidak hanya akan diperlengkapi untuk memilih model tetapi juga menugaskannya dengan percaya diri.

Evaluasi (Eval): Menguji dengan Data Anda Sendiri

Sekarang Anda tahu bahwa hanya data aktual, bukan iklan, yang dapat mengetahui apakah suatu model cocok dengan bisnis Anda. Cara mengukurnya adalah dengan menyiapkan rangkaian evaluasi (eval): kumpulan kecil sampel dari pekerjaan Anda yang jawabannya sudah diketahui.

Evaluasi sederhana diatur seperti ini:

  1. Kumpulkan 10-30 sampel nyata. Pilih masukan yang sesuai dengan pekerjaan Anda (campuran yang sulit dan mudah).
  2. Tentukan "keluaran yang benar/diharapkan" untuk setiap contoh. Apa jawaban seorang ahli?
  3. Jalankan kandidat melalui contoh yang sama. Uji model yang Anda bandingkan satu per satu dengan set yang sama.
  4. Skor hasilnya. Berapa banyak contoh yang benar? Dimana kesalahannya? Apakah kesalahan bisa diterima?
  5. Bandingkan dan pilih. Pilih bukan skor keseluruhan tertinggi, tetapi skor yang paling dapat diandalkan dalam contoh paling penting untuk Anda.
Tip: Jangan begitu saja mempercayai papan peringkat. Sebuah model mungkin menduduki peringkat pertama secara global, namun kinerjanya lebih buruk dibandingkan model peringkat kedua dalam teks hukum spesifik Turki Anda. Evaluasi Anda terhadap 20 sampel bernilai lebih dari ratusan pengujian publik.

Halusinasi: Risiko Model yang Paling Berbahaya

Halusinasi adalah ketika model menghasilkan informasi yang sebenarnya tidak benar, dengan bahasa yang percaya diri. Alih-alih mengatakan “Saya tidak tahu”, model tersebut mungkin menghasilkan undang-undang yang tidak ada, statistik yang dibuat-buat, atau tanggal yang salah; Terlebih lagi, dia melakukannya dengan bahasa yang sangat meyakinkan. Ini adalah aspek AI yang paling berbahaya karena kesalahan menyamar sebagai kebenaran.

Anda tidak dapat menghilangkan halusinasi sepenuhnya, tetapi Anda dapat menguranginya dan menangkapnya:

  • Dasarkan pada sumbernya: Minta model untuk menghasilkan jawaban dari dokumen yang Anda berikan, bukan dari "memori" miliknya sendiri (logika RAG).
  • Sumber permintaan: Katakan, "Di samping setiap klaim, tuliskan dokumen/bagian yang menjadi dasarnya"; Jika dia tidak bisa memberikan sumbernya, curigalah.
  • Membuat orang mengatakan bahwa mereka tidak yakin: Instruksi "Jika Anda tidak yakin, tulis 'tidak jelas'" mengurangi kesesuaian model.
  • Verifikasi manusia: Keluaran penting harus diverifikasi oleh manusia.
Perhatian: Jangan pernah menggunakan keluaran model tanpa memvalidasinya untuk keputusan hukum, medis, atau keuangan. Sebuah "artikel hukum" atau "informasi dosis" yang dihasilkan oleh model mungkin sepenuhnya dibuat-buat. Di bidang-bidang ini, AI merupakan rancangan/alat pendahuluan; Orang yang kompeten selalu mempunyai keputusan akhir.

Persyaratan Verifikasi Manusia

Kecerdasan buatan berfungsi paling baik sebagai alat yang mempercepat manusia, bukan membuat mereka kehilangan pekerjaan. Pengaturan yang benar adalah sebagai berikut: menghasilkan atau melakukan pra-kualifikasi rancangan model; manusia meninjau, mengoreksi, dan menyetujui. Seberapa ketat verifikasi yang diperlukan bergantung pada besarnya dampak kesalahan.

Pencarian

Biaya kesalahan

verifikasi manusia

Draf deskripsi produk

rendah

Kontrol sampel sudah cukup

Tanggapan email pelanggan

sedang

Tinjauan pra-pengajuan

Analisis risiko kontrak

tinggi

Konfirmasi ahli artikel demi artikel

Nasihat medis/keuangan

sangat tinggi

Verifikasi ahli penuh, hanya dukungan AI

Tabel ini memberikan keseimbangan antara "memeriksa setiap keluaran secara manual" dan "tidak memeriksa sama sekali". Meskipun pengendalian sampel cukup untuk pekerjaan berbiaya rendah, setiap output harus diverifikasi untuk pekerjaan berbiaya tinggi.

Penggunaan yang Etis dan Bertanggung Jawab

Meskipun pemilihan model mungkin tampak seperti keputusan teknis, terdapat tanggung jawab etis di baliknya:

  • Transparansi: Beri tahu pelanggan atau karyawan Anda bahwa Anda menggunakan AI di tempat yang tepat. Pelanggan berhak mengetahui apakah mereka sedang berbicara dengan manusia atau AI.
  • Bias: Model dapat mewarisi bias dari data yang dilatihnya. Pantau keadilan hasil di bidang sensitif seperti rekrutmen dan penilaian kredit.
  • Privasi: Tanamkan prinsip perlindungan data yang Anda pelajari di unit 8 ke dalam alur kerja; Jangan mengirimkan data pribadi secara sembarangan.
  • Akuntabilitas: Ketika terjadi kesalahan, pembelaan “AI yang berhasil” tidaklah cukup. Tanggung jawabnya ada pada institusi pengguna kendaraan tersebut. Jadi proses verifikasi dokumen.
Tip: Tulis sedikit “kebijakan penggunaan yang bertanggung jawab” ke dalam alur kerja Anda: pekerjaan apa yang dapat menggunakan AI, data apa yang tidak dapat dikirim, siapa yang akan memverifikasinya, dan bagaimana kesalahan akan dilaporkan. Dokumen satu halaman ini mencegah masalah besar di masa depan.

Tiga Kasus Realistis

Kasus 1 — Penyesalan tanpa menetapkan evaluasi. Tim asuransi mulai merangkum klaim tanpa menguji model yang paling populer. Setelah dua minggu, mereka menyadari bahwa model tersebut sering membuat kesalahan dalam istilah teknis Turki dan salah membaca beberapa jumlah. Ketika mereka melakukan evaluasi terhadap 20 sampel dan membandingkan ketiga model tersebut, mereka beralih ke model yang bukan yang paling populer tetapi lebih akurat dalam teks teknis Turki. Kerugiannya: dua minggu dan tenaga kerja proofreading. Pelajaran: evaluasi dulu, terapkan nanti.

Kasus 2 — Proses yang menangkap halusinasi. Seorang paralegal melihat referensi "Keputusan Mahkamah Agung" dalam cetakan model. Karena proses mereka memiliki aturan "verifikasi setiap referensi", dia mencari keputusan tersebut dan menemukan bahwa tidak ada keputusan seperti itu; Dia membuat model. Berkat verifikasi manusia, informasi palsu tidak pernah sampai ke klien. Tanpa aturan verifikasi, hilangnya reputasi bisa berakibat serius.

Kasus 3 — Percaya dengan transparansi. Sebuah perusahaan e-commerce menghasilkan respons dukungan pelanggan dengan AI, namun menambahkan catatan di bawah setiap respons: "Respon ini disiapkan dengan dukungan kecerdasan buatan dan ditinjau oleh salah satu perwakilan kami." Pelanggan lebih puas dengan respons cepat dan kepercayaan diri saat melihat manusia terlibat. Transparansi bukanlah kelemahan yang harus disembunyikan, namun sumber kepercayaan.

Prompt Lemah / Prompt Kuat: Output yang Dapat Diverifikasi

Perintah yang lemah:

Ceritakan tentang klausul berisiko dalam kontrak ini.

Bisa muat model; tidak ada sumber, tidak ada tanda-tanda ketidakpastian.

Perintah yang kuat:

Peran Anda: analis kontrak (keputusan akhir ada di tangan pengacara). Tugas: Soroti klausul yang berpotensi berisiko dalam kontrak berikut. Untuk setiap temuan: (1) nomor klausa dan kutipan kata demi kata, (2) mengapa hal tersebut berisiko, (3) tingkat kepercayaan Anda (tinggi/sedang/rendah). Hanya mengandalkan klausa dalam teks; Jangan mengarang apa pun yang tidak ada dalam teks. Jika Anda tidak yakin, tulis "konfirmasi pengacara diperlukan". [kontrak]

Tautan cepat yang kuat setiap klaim ke sumbernya (nomor artikel + kutipan), memerlukan tingkat kepercayaan, dan melarang pemalsuan; Hal ini membuat halusinasi dapat ditangkap.

Templat yang Dapat Disalin

1. Desain set evaluasi:

Rancanglah set evaluasi untuk tugas [TUGAS] berikut. Sarankan 15 contoh masukan (campuran mudah-sedang-sulit), bagaimana "keluaran benar yang diharapkan" akan ditentukan untuk masing-masing masukan, dan tentukan kriteria penilaian (1-5).

2. Bungkus pengurang halusinasi:

Tulis ulang perintah berikut untuk mengurangi fabrikasi: "[PROMPT]". Tambahkan aturan untuk mengutip sumber, menentukan tingkat kepercayaan, dan "beri tahu saya jika Anda tidak yakin".

3. Desain alur verifikasi:

Dalam alur kerja berikut [ALUR KERJA] Rancang langkah verifikasi manusia untuk keluaran AI. Menentukan seberapa ketat verifikasi yang harus dilakukan berdasarkan biaya kesalahan; tulis siapa yang akan memeriksa apa, kapan.

4. Draf kebijakan penggunaan yang bertanggung jawab:

Draf satu halaman "kebijakan penggunaan AI yang bertanggung jawab" untuk tim di [INDUSTRI]. Sertakan judul berikut: penggunaan yang diizinkan, data terlarang, tanggung jawab verifikasi, pelaporan transparansi, pelaporan kesalahan.

Kesalahan umum

  • Penerapan tanpa Eval: Memulai model tanpa mengujinya dengan data Anda sendiri dan menyadari kesalahan setelah kesalahan tersebut terlihat pada pelanggan/pekerjaan.
  • Mengandalkan halusinasi: Menggunakan bahasa model yang percaya diri sebagai kebenaran tanpa memverifikasi referensi.
  • Mengabaikan verifikasi manusia: Membiarkan hasil tidak terkendali dalam pengambilan keputusan berbiaya tinggi; Bersandar pada pertahanan “AI yang melakukannya”.
  • Menghindari transparansi: Menyembunyikan penggunaan AI; mengalami kehilangan kepercayaan diri ketika hal itu terjadi.
  • Mengabaikan etika dan bias: Menggunakan keputusan sensitif (perekrutan, pemberian kredit) tanpa memantau kewajaran hasilnya.

Singkatnya

  • Sebelum menerapkan model, siapkan kumpulan evaluasi kecil dengan data Anda sendiri dan uji kandidatnya; peringkat keseluruhan tidak mewakili bisnis Anda.
  • Halusinasi adalah produksi bahasa palsu yang dilakukan model dengan percaya diri; Diambil berdasarkan atribusi sumber, tingkat kepercayaan, dan verifikasi manusia.
  • Ketatnya verifikasi manusia disesuaikan dengan dampak kesalahannya; Di area kritis, AI hanyalah pendukung, dan keputusan ada di tangan manusia.
  • Transparansi, pengendalian bias, kerahasiaan dan akuntabilitas; adalah empat pilar penggunaan AI yang bertanggung jawab. Kebijakan satu halaman mencegah risiko besar.

Tugas aplikasi

Siapkan kumpulan evaluasi yang terdiri dari 15 contoh dengan templat 1 di unit ini (desain kumpulan evaluasi) untuk model kandidat yang Anda pilih di seluruh modul dan bandingkan setidaknya dua model dengan kumpulan ini. Kemudian rancang bagaimana keluaran akan diverifikasi oleh manusia dengan templat 3 (alur validasi) dan buat rancangan kebijakan satu halaman untuk tim Anda dengan templat 4 (kebijakan penggunaan yang bertanggung jawab). Ketiga hasil ini mengubah seluruh modul menjadi rencana penerapan yang bisa diterapkan.

daftar periksa

  • [ ] Dengan data saya sendiri, saya dapat menyiapkan kumpulan evaluasi kecil dan membandingkan model.
  • [ ] Saya dapat mengenali halusinasi dan menerapkan tindakan mitigasi dan penahanan.
  • [ ] Saya dapat menyesuaikan ketatnya verifikasi manusia berdasarkan akibat kesalahannya.
  • [ ] Saya dapat menanamkan prinsip transparansi, bias, kerahasiaan, dan akuntabilitas ke dalam alur kerja.
  • [ ] Saya dapat menyusun kebijakan penggunaan AI yang bertanggung jawab satu halaman.

Ujian Modul

1. Apa perbedaan antara 'penyedia' AI dan 'keluarga model'?

  • A) Penyedia adalah perusahaan yang mengembangkan model, dan keluarga model adalah grup model perusahaan tersebut di bawah suatu merek ✔
  • B) Keduanya sama persis dan digunakan secara bergantian
  • C) Penyedia adalah harga model, keluarga model adalah kecepatan model.
  • D) Keluarga model mengacu pada perusahaan, pemasok mengacu pada versi model tunggal

Deskripsi: Penyedia adalah perusahaan yang mengembangkan model (misalnya Anthropic); Keluarga model adalah grup model yang dikumpulkan oleh perusahaan di bawah suatu merek (misalnya, Claude). Versi model adalah versi spesifik dalam keluarga.

2. Bagaimana 'bobot' suatu model dapat ditentukan dengan paling akurat?

  • A) Ini adalah jumlah token yang dapat dihasilkan model per menit
  • B) Ini adalah miliaran parameter numerik yang dipelajari model selama pelatihan dan menyimpan informasinya. ✔
  • C) Ini adalah biaya berlangganan bulanan model
  • D) Ini adalah jumlah bahasa yang didukung oleh model

Deskripsi: Bobot adalah miliaran parameter numerik yang dipelajari model selama pelatihan; Di sinilah 'segala sesuatu yang diketahui model' disimpan. Perbedaan bobot tertutup/eksplisit bergantung pada apakah parameter ini dapat diunduh dan dijalankan.

3. Pernyataan manakah yang benar mengenai 'open-weight' dan 'open-source'?

  • A) Keduanya merupakan konsep yang persis sama dan keduanya memberikan penggunaan komersial yang tidak terbatas
  • B) Bobot terbuka juga selalu membuat data pelatihan menjadi publik
  • C) Ini bukanlah hal yang sama; Dalam pembobotan terbuka, biasanya hanya parameter yang dibagikan dan ketentuan lisensi dapat membatasi penggunaan komersial ✔
  • D) Model sumber terbuka tidak dapat diunduh, model bobot terbuka dapat diunduh

Penjelasan: Dalam pembobotan terbuka, hanya parameter model yang dibagikan; data dan proses pelatihan sering kali tidak diungkapkan, dan beberapa lisensi membatasi penggunaan komersial. Jadi 'open bobot' tidak persis sama dengan 'open source'.

4. Manakah dari fitur model berikut yang paling menentukan bagi tim hukum yang membaca dan menganalisis kontrak panjang?

  • A) Memiliki harga token terendah
  • B) Memiliki kemampuan pemrosesan visual (multimodal).
  • C) Memiliki lisensi bobot terbuka
  • D) Memiliki jendela konteks yang luas ✔

Penjelasan: Model memerlukan jendela konteks yang besar untuk memproses dokumen panjang secara keseluruhan; Jendela konteks adalah jumlah total token yang dapat diingat oleh model pada suatu waktu.

5. Manakah yang benar tentang penetapan harga token untuk model bobot tertutup?

  • A) Token keluaran biasanya jauh lebih mahal daripada token masukan ✔
  • B) Input dan output selalu sama harganya
  • C) Hanya dikenakan biaya bulanan tetap, jumlah pemakaian tidak relevan
  • D) Token masukan selalu berkali-kali lipat lebih mahal daripada keluaran

Penjelasan: Harga dihitung per token, dan token keluaran yang dihasilkan model biasanya beberapa kali lebih mahal daripada token masukan yang Anda kirim. Oleh karena itu, hasil cetakan yang panjang dan tidak perlu meningkatkan biaya dengan cepat.

6. Fitur manakah dalam model yang penting bagi tim akuntansi yang ingin mengekstrak data dari gambar faktur secara otomatis?

  • A) Jendela konteks seluas mungkin
  • B) Multimodalitas (kemampuan pemrosesan visual) ✔
  • C) Lisensi bobot terbuka
  • D) Tingkat penalaran tertinggi

Penjelasan: Untuk memahami konten visual, model harus mampu mengolah gambar seperti halnya teks, yaitu harus multimodal. Multimodalitas adalah kemampuan model untuk menangani berbagai jenis data, seperti teks, gambar, dan terkadang audio.

7. Apa pilihan paling logis untuk tugas sederhana dan bervolume tinggi (misalnya klasifikasi positif/negatif dari ribuan ulasan)?

  • A) Selalu merupakan model penalaran yang terkuat dan termahal
  • B) Model yang hanya berfungsi pada bobot terbuka dan di servernya sendiri
  • C) Model yang ringan dan berbiaya rendah, karena tugasnya sederhana dan volumenya tinggi ✔
  • D) Model dengan jendela konteks terluas

Deskripsi: Model yang ringan dan berbiaya rendah dapat membantu tugas-tugas sederhana dan bervolume tinggi; Menggunakan model yang paling kuat dan mahal menimbulkan biaya yang tidak perlu di sini. Pendekatan yang benar adalah mencocokkan tingkat kesulitan tugas dengan tingkat model.

8. Apa yang memicu pengiriman teks berisi data pribadi ke penyedia AI yang berbasis di luar negeri dalam kaitannya dengan KVKK?

  • A) Hal ini tidak menimbulkan tanggung jawab hukum apa pun
  • B) Hanya penting jika penyedianya berada di UE, tidak dalam kasus lain
  • C) Dilarang keras dalam keadaan apa pun, terlepas dari apakah data tersebut anonim atau tidak
  • D) Transfer data ke luar negeri dipertimbangkan dan tunduk pada ketentuan khusus KVKK ✔

Penjelasan: Pengoperasian data pada server penyedia di luar negeri dianggap 'transfer data ke luar negeri' dan tunduk pada ketentuan khusus KVKK mengenai hal ini (seperti persetujuan eksplisit, keputusan kecukupan, jaminan yang sesuai).

9. Apa yang dilakukan mode 'penalaran' suatu model dan bagaimana pengaruhnya terhadap biaya?

  • A) Ini meningkatkan akurasi dalam masalah yang kompleks, tetapi meningkatkan biaya dan penundaan karena menghasilkan lebih banyak token ✔
  • B) Selalu membuat model bebas
  • C) Hanya menambah jumlah bahasa yang didukung oleh model
  • D) Selalu mempersingkat jawaban dan mengurangi biaya

Deskripsi: Mode Penalaran memungkinkan model 'berpikir' langkah demi langkah sebelum memberikan jawaban; Hal ini meningkatkan akurasi dalam masalah multi-langkah dan kompleks, namun juga meningkatkan biaya dan penundaan karena menghasilkan lebih banyak token.

10. Pendekatan apa yang paling dapat diandalkan ketika mengevaluasi (mengevaluasi) model untuk bisnis Anda sendiri?

  • A) Hanya memilih model yang paling populer dan menggunakannya tanpa pengujian
  • B) Siapkan serangkaian tes kecil dari tugas nyata Anda sendiri dan bandingkan model dengannya ✔
  • C) Hanya melihat skor benchmark yang disebutkan dalam iklan
  • D) Secara otomatis menerima model dengan jendela konteks tertinggi sebagai yang terbaik

Penjelasan: Daripada mengandalkan papan peringkat secara membabi buta, membuat kumpulan pengujian kecil dari tugas nyata Anda sendiri dan membandingkan model pada kumpulan ini akan mengungkapkan model yang benar-benar sesuai dengan bisnis Anda.

11. Bagaimana seharusnya pengetahuan bahwa keluaran model mungkin berisi 'halusinasi' membentuk alur kerja Anda?

  • A) Outputnya harus selalu dianggap benar dan dipublikasikan secara langsung
  • B) Halusinasi hanya terlihat pada model gratis, tidak pada model berbayar
  • C) Dalam pengambilan keputusan kritis, keluarannya harus diverifikasi oleh manusia dan sumbernya harus dikonfirmasi ✔
  • D) Halusinasi dapat dihilangkan sepenuhnya hanya dengan mengubah model

Penjelasan: Halusinasi adalah ketika model menghasilkan informasi yang sebenarnya tidak benar, dengan bahasa yang percaya diri. Karena risiko ini, verifikasi keluaran oleh manusia harus dilakukan, terutama untuk keputusan hukum, medis, dan keuangan.

12. Apa logika dasar pendekatan 'model portofolio' yang diadopsi oleh institusi yang sudah matang?

  • A) Untuk memastikan kesederhanaan dengan membuat setiap pekerjaan dilakukan oleh satu model yang paling mahal.
  • B) Hanya menggunakan model termurah dan mengabaikan kualitas sama sekali
  • C) Jangan gunakan model apa pun dan lakukan semua pekerjaan secara manual
  • D) Mengoptimalkan biaya dan mengurangi ketergantungan pada satu penyedia dengan menggunakan model yang berbeda sesuai tugas ✔

Deskripsi: Portofolio model menggunakan model yang berbeda sesuai dengan tugasnya: model murah untuk pekerjaan sederhana dan besar, model kuat untuk pekerjaan kompleks, model bobot terbuka/regional untuk data rahasia. Hal ini mengoptimalkan biaya dan mengurangi ketergantungan pada satu penyedia.

13. Mengapa negara asal dan kebijakan penyimpanan data dapat menjadi kriteria pemilihan model?

  • A) Karena berdampak langsung pada peraturan, kedaulatan data, dan persyaratan privasi ✔
  • B) Hanya karena menentukan kecepatan respon model
  • C) Karena menentukan format file yang didukung oleh model
  • D) Karena tidak mempunyai dampak praktis, ini hanya detail pemasaran

Deskripsi: Negara tempat pengembang model berada dan tempat/berapa banyak data disimpan; Hal ini sangat menentukan dalam hal regulasi hukum, kedaulatan data, dan privasi. Misalnya, untuk organisasi yang ingin menjadi tuan rumah di UE, penyedia regional atau opsi penyimpanan nol menjadi penting.

14. Mana yang paling menjelaskan mengapa mencari 'model terbaik' dalam suatu tugas adalah hal yang menyesatkan?

  • A) Semua model sebenarnya memiliki kemampuan yang sama persis
  • B) Model kuat dalam berbagai ukuran, jadi 'terbaik' tergantung pada kebutuhan pekerjaan ✔
  • C) Model yang paling mahal secara otomatis menjadi yang terbaik dalam setiap tugas
  • D) Pemilihan model harus dilakukan secara acak

Deskripsi: Model kuat dalam berbagai dimensi seperti kecepatan, biaya, konteks, multimodalitas, privasi, dan alasan. Sebuah model yang unggul dalam satu dimensi mungkin lemah dalam dimensi lain; jadi 'terbaik' selalu bergantung pada kebutuhan pekerjaan.