Unit 5 / 10

Token, Tetingkap Konteks dan Multimodaliti: Cara Minda Model Berfungsi

Keuntungan:

  • Keupayaan untuk menerangkan konsep token, tetingkap konteks dan multimodaliti dalam bahasa harian
  • Diagnosis sama ada tugas memerlukan konteks yang luas atau pelbagai mod
  • Keupayaan untuk mengambil kira bagaimana konsep ini mempengaruhi kos dan pemilihan model

Setakat ini kami sudah biasa dengan pembekal dan jenis model. Walau bagaimanapun, untuk pemilihan model yang betul, ia juga perlu untuk memahami bagaimana model berfungsi "di dalam"; kerana keputusan harga, kapasiti dan ketersediaan semuanya bergantung pada tiga konsep teras: token, tetingkap konteks dan pelbagai mod. Seseorang yang tidak mengetahui konsep ini tidak boleh membaca helaian harga dan tertanya-tanya "adakah dokumen ini sesuai dengan model?" tidak dapat menjawab soalan dan tidak dapat melihat bila pemprosesan visual adalah penting. Menjelang akhir unit ini, anda akan dapat menerangkan ketiga-tiga konsep ini dalam bahasa harian, mendiagnosis sama ada pekerjaan memerlukan konteks yang luas atau multimodaliti dan mengambil kira kesannya terhadap kos.

Token: Unit Digunakan oleh Model Daripada Word

Model kecerdasan buatan memproses teks bukan perkataan demi perkataan, tetapi dalam kepingan kecil yang dipanggil token. Token; Ia boleh menjadi perkataan, sebahagian daripada perkataan, tanda baca atau ruang. Untuk membuat pengiraan kasar: Dalam bahasa Inggeris, token purata ialah kira-kira empat aksara, dan 100 perkataan adalah kira-kira 130-150 token. Dalam bahasa Turki, kadar ini mungkin lebih tinggi sedikit kerana perkataan berimbuhan dan panjang; Dalam erti kata lain, teks Turki dengan makna yang sama menggunakan lebih sedikit token daripada bahasa Inggeris.

Mengapa ini penting untuk diketahui? Kerana semuanya dicaj dan diukur dalam token. Teks (input) yang anda hantar kepada model dan respons (output) yang dihasilkan oleh model dikira sebagai token berasingan. Kedua-dua invois anda dan kapasiti model adalah dalam token.

Petua: Untuk mendapatkan anggaran kasar bilangan token yang ada pada teks, bahagikan bilangan aksara dengan empat. E-mel 4,000 aksara ialah kira-kira 1,000 token. Dalam bahasa Turki, anggap lebih tinggi sedikit untuk kekal di bahagian yang selamat.

Tetingkap Konteks: "Memori Jangka Pendek" Model

Tetingkap konteks ialah jumlah jumlah token yang boleh diingat oleh model pada satu masa. Input dan output mesti sesuai bersama dalam tetingkap ini. Fikirkan ia seperti jumlah kertas yang boleh anda bentangkan di atas meja sekaligus: Kertas yang tidak muat di atas meja berada di luar bidang penglihatan anda pada masa itu.

Jika tetingkap konteks model ialah 200,000 token, ini bersamaan dengan kira-kira 150,000 perkataan, atau beberapa buku bersaiz sederhana. 1 juta token boleh memproses dokumen yang lebih besar secara keseluruhan. Sesetengah model berkuasa hari ini (cth. Claude Opus 4.8 dan Sonnet 5) menawarkan 1 juta konteks token, manakala model ringan selalunya disertakan dengan tingkap yang lebih kecil (cth. 200,000 token untuk Haiku 4.5).

Mengapa ia penting? Kerana jika dokumen tidak sesuai dalam tetingkap konteks, model tidak dapat melihat semuanya bersama-sama. Anda tidak boleh memberikan kontrak 500 muka surat secara keseluruhannya kepada model 200,000 token; Anda sama ada membahagikan dokumen kepada bahagian (yang mungkin kehilangan hubungan antara bahagian) atau memilih model dengan konteks yang lebih luas.

Awas: Adalah tidak bijak untuk mengisi setiap dokumen kerana ia hanya kerana tetingkap konteksnya besar. Lebih banyak token yang anda masukkan ke dalam tetingkap, lebih banyak yang anda bayar, dan kadangkala model boleh terlepas butiran tengah dalam teks yang sangat panjang. Selalunya lebih murah dan lebih tepat untuk menghantar hanya bahagian yang berfungsi.

Tetingkap Konteks ialah Kriteria Keputusan

Pencarian

Anggaran konteks yang diperlukan

Tahap yang sesuai

Balasan e-mel ringkas

beberapa ratus token

ringan

Ringkasan satu halaman

beberapa ribu token

Ringan/seimbang

Analisis laporan 40 muka surat

~30,000 token

Seimbang/kuat

Semakan kontrak 300 muka surat

~250,000 token

Berkuasa dengan konteks yang luas

Memproses ratusan dokumen sekaligus

500,000+ token

Konteks yang paling luas

Jadual ini menjawab soalan "model yang mana?" Ia menunjukkan bahawa sebahagian daripada soalan dijawab secara langsung mengikut saiz dokumen. Adalah satu pembaziran untuk membeli model mahal dengan konteks yang besar untuk pekerjaan pendek; Model dengan tingkap kecil tidak mencukupi untuk dokumen besar.

Multimodaliti: Melangkaui Teks

Multimodaliti ialah keupayaan model untuk mengendalikan pelbagai jenis data (imej, audio, kadangkala video), bukan hanya teks. "Modal" di sini bermaksud "jenis data"; multimodal bermaksud "banyak jenis".

  • Model teks sahaja: Membaca dan menulis teks bertulis sahaja.
  • Model multimodal: Boleh membaca foto bil, mentafsir arah aliran pada graf, menyahkod nota tulisan tangan, kadangkala menyalin rakaman suara.

Mengapa ia penting? Kerana sifat perniagaan anda mungkin memerlukan pelbagai mod. Pasukan perakaunan yang mengekstrak amaun daripada imej invois, pasukan e-dagang yang mengklasifikasikan foto produk atau pasukan insurans yang menilai kerosakan foto tidak boleh melakukan tugas ini dengan model yang hanya membaca teks. Pemprosesan visual adalah penting untuk tugasan ini.

Tiga Kes Realistik

Kes 1 — Kejutan kos token. Pasukan kandungan juga menghantar model dokumen "panduan jenama" 20 halaman semasa mereka menghasilkan setiap catatan blog. Panduan ini adalah kira-kira 15,000 token. Mereka menghasilkan 2,000 artikel sebulan; Jadi hanya menghantar panduan berulang kali bermakna 30 juta token input. Dengan memendekkan panduan dan hanya menghantar bahagian yang berkaitan (kira-kira 2,000 token), mereka mengurangkan input kepada satu pertujuh dan mengurangkan bil dengan ketara.

Kes 2 — Tetingkap konteks tidak mencukupi. Sebuah firma guaman ingin menyemak perjanjian penggabungan setebal 280 halaman. Model pertama yang mereka cuba mempunyai pengikatan 200,000 token dan dokumen itu tidak sesuai; Apabila dokumen dikoyakkan, model tidak dapat melihat bahawa artikel di bahagian pertama bercanggah dengan artikel di bahagian terakhir. Apabila ia bertukar kepada model dengan konteks 1 juta token, ia membaca dokumen secara keseluruhan dan menangkap percanggahan. Di sini tetingkap konteks menentukan ketepatan secara langsung.

Kes 3 — Multimodaliti adalah satu kemestian. Sebuah syarikat insurans ingin membuat penilaian awal daripada gambar kerosakan kenderaan. Ini adalah mustahil dengan model yang hanya membaca teks; Model multimodal yang "melihat" gambar diperlukan. Apabila mereka beralih kepada model multimodal, mereka mewujudkan sistem pra-penyaringan yang secara kasar mengklasifikasikan lokasi dan keterukan kerosakan dalam foto dan mengarahkan pakar. Mereka perhatikan, bagaimanapun, bahawa seorang pakar manusia membuat keputusan muktamad; kerana model itu adalah alat saringan awal, bukan kata akhir.

Gesaan Lemah / Gesaan Kuat

Gesaan yang lemah:

Ringkaskan dokumen ini. [dokumen terlalu panjang ditampal]

Gesaan kuat:

Ringkaskan laporan 40 muka surat di bawah. Mula-mula anggaran bilangan token dalam laporan dan beritahu kami sama ada ia sesuai dalam tetingkap konteks model seimbang biasa. Kemudian berikan ringkasan dalam format ini: 5-item ringkasan eksekutif + 3 penemuan berisiko. Gunakan hanya maklumat dalam laporan; Tandakan bahagian yang anda tidak pasti sebagai "tidak jelas dalam laporan". [laporan]

Gesaan yang berkuasa adalah kedua-dua token/konteks sedar dan mengawal format dan pengesahan output.

Templat Boleh Disalin

1. Ramalan token:

Anggarkan anggaran bilangan token untuk teks berikut dan tafsirkan ini dari segi kos input: "[TEKS]". Bulatkan sedikit, dengan mengambil kira bahawa ia adalah bahasa Turki.

2. Semakan ketersediaan konteks:

Tugas saya ialah memproses dokumen berikut: purata [PAGES] daripada [QTY] dokumen sebulan. Apakah tetingkap konteks yang diperlukan oleh saiz ini? Antara tahap cahaya/seimbang/kuat yang manakah mencukupi? Apakah risiko yang timbul jika ia perlu dibongkar?

3. Diagnosis pelbagai mod:

Aliran kerja saya: [DESCRIPTION]. Adakah terdapat pemprosesan visual, audio atau video dalam strim ini? Jika ya, adakah model multimodal diperlukan, atau bolehkah ia ditukar kepada teks (OCR/transkripsi) dan diselesaikan dengan model teks? Bandingkan kebaikan/keburukan kedua-dua laluan.

4. Pengoptimuman konteks:

Saya menghantar dokumen kepada model dengan setiap permintaan, tetapi kebanyakannya tidak diperlukan. Bagaimanakah cara saya mengekstrak bahagian yang sebenarnya diperlukan untuk [TUGASAN] daripada dokumen ini? Cadangkan 3 cara konkrit untuk mengurangkan input dan nyatakan anggaran penjimatan token.

Kesilapan biasa

  • Tersilap token untuk perkataan: Token berbeza daripada perkataan; Invois dan kapasiti sentiasa dalam bentuk token, mengira dalam perkataan adalah mengelirukan.
  • Berfikir tetingkap konteks adalah tidak terhingga: Setiap model mempunyai had; Jika dokumen tidak sesuai, model tidak dapat melihat keseluruhannya.
  • Menggunakan konteks besar yang tidak perlu: Membeli model mahal dengan konteks besar untuk kerja singkat; atau isi dokumen besar untuk setiap permintaan dan bayar dengan sia-sia.
  • Dengan mengandaikan multimodaliti: Tidak setiap model boleh memproses visual; Untuk kerja visual, mulakan tanpa mengesahkan bahawa model adalah multimodal.
  • Melupakan beban token bahasa Turki: Teks bahasa Turki biasanya menggunakan lebih sedikit token untuk maksud yang sama; mengabaikan ini dalam anggaran kos.

Secara ringkasnya

  • Token ialah unit kecil di mana model memproses teks; input dan output diukur dan diinvois secara berasingan sebagai token.
  • Tetingkap konteks ialah jumlah token yang boleh diingat oleh model pada satu masa; saiz dokumen secara langsung mempengaruhi pemilihan model.
  • Multimodaliti ialah keupayaan model untuk memproses data bukan teks seperti visual/audio; Ia penting untuk kerja visual.
  • Ketiga-tiga konsep ini adalah relevan dengan soalan "model yang mana?" serta "berapa kosnya?" Ia menjadi asas kepada soalan.

Tugasan permohonan

Pilih tugas AI berulang dalam perniagaan anda. Minta templat pertama (ramalan token) mengira bilangan token input biasa dalam tugasan ini. Kemudian tentukan tahap mana yang mencukupi dengan templat 2 (semakan ketersediaan konteks). Jika anda mempunyai tugas visual, jelaskan sama ada model multimoda diperlukan dengan templat ke-3 (diagnosis pelbagai mod). Kami akan menggunakan anggaran token yang terhasil dalam pengiraan kos unit seterusnya.

senarai semak

  • [ ] Saya tahu konsep token dan cara menganggarkan secara kasar berapa banyak token yang ada pada teks.
  • [ ] Saya boleh menerangkan tetingkap konteks dengan analogi "jadual/memori".
  • [ ] Saya boleh menilai sama ada dokumen akan dimuatkan ke dalam model.
  • [ ] Saya boleh mendiagnosis apabila multimodaliti adalah penting.
  • [ ] Saya mengambil kira overhed token bahasa Turki dan kos konteks yang tidak perlu.