Vahid 5 / 10

Token, kontekst pəncərəsi və multimodallıq: Modelin ağlı necə işləyir

Qazanclar:

  • Gündəlik dildə token, kontekst pəncərəsi və multimodallıq anlayışlarını izah etmək bacarığı
  • Tapşırığın geniş kontekst və ya multimodallıq tələb edib-etmədiyini müəyyənləşdirin
  • Bu anlayışların qiymətə və model seçiminə necə təsir etdiyini nəzərə almaq bacarığı

İndiyə qədər provayderlər və model növləri ilə tanışıq. Bununla belə, düzgün model seçimi üçün modellərin "içəridə" necə işlədiyini də başa düşmək lazımdır; çünki qiymət, tutum və mövcudluq qərarları üç əsas konsepsiyaya əsaslanır: token, kontekst pəncərəsi və multimodallıq. Bu anlayışları bilməyən adam qiymət cədvəlini oxuya bilmir və "bu sənəd modelə uyğun olacaqmı?" sualına cavab verə bilmir və vizual emalın nə vaxt vacib olduğunu görə bilmir. Bu bölmənin sonunda siz bu üç anlayışı gündəlik dildə izah edə, işin geniş kontekst və ya multimodallıq tələb edib-etmədiyini diaqnoz edə və onların xərclərə təsirini nəzərə ala biləcəksiniz.

Token: Word əvəzinə Model tərəfindən istifadə edilən vahid

Süni intellekt modelləri mətni sözbəsöz deyil, token adlanan kiçik hissələrdə emal edir. Bir nişan; Bu söz, sözün bir hissəsi, durğu işarəsi və ya boşluq ola bilər. Kobud hesablama aparmaq üçün: İngilis dilində orta işarə təxminən dörd simvoldan ibarətdir və 100 söz təxminən 130-150 işarədir. Türk dilində bu nisbət şəkilçili və uzun sözlərə görə bir qədər yüksək ola bilər; Başqa sözlə, eyni mənanı daşıyan bir türk mətni ingilis dilindən bir qədər çox işarə istehlak edir.

Bunu bilmək niyə vacibdir? Çünki hər şey tokenlə yüklənir və ölçülür. Modelə göndərdiyiniz mətn (giriş) və model tərəfindən istehsal olunan cavab (çıxış) ayrı işarələr kimi sayılır. Həm faktura, həm də modelin tutumu tokenlərdədir.

İpucu: Mətnin neçə işarəsi olduğunu təxmini qiymətləndirmək üçün simvolların sayını dördə bölün. 4000 simvollu e-poçt təxminən 1000 tokendir. Türkcə, təhlükəsiz tərəfdə qalmaq üçün bir az yuxarı fərz edin.

Kontekst pəncərəsi: Modelin "Qısamüddətli yaddaşı"

Kontekst pəncərəsi modelin bir anda yadda saxlaya biləcəyi tokenlərin ümumi miqdarıdır. Bu pəncərədə giriş və çıxış bir-birinə uyğun olmalıdır. Bunu bir anda masanın üzərinə yaydığınız kağız miqdarı kimi düşünün: Stolun üstünə sığmayan kağız o anda sizin görmə sahənizdən kənardadır.

Modelin kontekst pəncərəsi 200.000 işarədirsə, bu, təxminən 150.000 sözə və ya bir neçə orta ölçülü kitaba bərabərdir. 1 milyon token bütövlükdə daha böyük sənədləri emal edə bilər. Bu gün bəzi güclü modellər (məsələn, Claude Opus 4.8 və Sonnet 5) 1 milyon token kontekstini təklif edir, yüngül modellər isə tez-tez daha kiçik pəncərələrlə gəlir (məsələn, Haiku 4.5 üçün 200.000 token).

Niyə vacibdir? Çünki sənəd kontekst pəncərəsinə uyğun gəlmirsə, model hamısını birlikdə görə bilməz. 200.000 token modelinə 500 səhifəlik müqaviləni tam olaraq verə bilməzsiniz; Siz ya sənədi hissələrə ayırırsınız (hissələr arasında əlaqəni itirə bilər) və ya daha geniş kontekstli model seçirsiniz.

Diqqət: Kontekst pəncərəsi böyük olduğu üçün hər sənədi doldurmaq müdrik deyil. Pəncərəyə nə qədər çox jeton qoysanız, bir o qədər çox ödəyirsiniz və bəzən model çox uzun mətnlərdə orta detalları qaçıra bilər. Çox vaxt yalnız işləyən hissəni göndərmək daha ucuz və daha dəqiq olur.

Kontekst pəncərəsi qərar meyarıdır

Quest

Təxmini tələb olunan kontekst

Müvafiq səviyyə

Qısa e-poçt cavabı

bir neçə yüz token

yüngül

Bir səhifə xülasəsi

bir neçə min token

Yüngül/balanslı

40 səhifəlik hesabat təhlili

~30.000 token

Balanslı/güclü

300 səhifəlik müqavilənin nəzərdən keçirilməsi

~250.000 token

Geniş kontekstdə güclü

Bir anda yüzlərlə sənədi emal edin

500.000+ token

Ən geniş kontekst

Bu cədvəl “hansı model?” sualına cavab verir. Sualın bir hissəsinə birbaşa sənəd ölçüsü ilə cavab verildiyini göstərir. Qısa iş yerləri üçün böyük kontekstli bahalı model almaq israfdır; Kiçik bir pəncərəsi olan bir model böyük sənədlər üçün qeyri-adekvatdır.

Multimodallıq: mətndən kənara çıxmaq

Multimodallıq modelin təkcə mətni deyil, bir neçə növ məlumatı (şəkil, audio, bəzən video) idarə etmək qabiliyyətidir. “Modal” burada “məlumat növü” deməkdir; multimodal “çox növ” deməkdir.

  • Yalnız mətn modeli: Yalnız yazılı mətni oxuyur və yazır.
  • Multimodal model: Bir qanun layihəsinin şəklini oxuya, qrafikdə trendi şərh edə, əl ilə yazılmış qeydi deşifrə edə, bəzən səs yazısını transkripsiya edə bilər.

Niyə vacibdir? Çünki biznesinizin xarakteri multimodallığı tələb edə bilər. Faktura şəkillərindən məbləğlər çıxaran mühasibat qrupu, məhsul şəkillərini təsnif edən e-ticarət qrupu və ya zədələnmiş fotoşəkilləri qiymətləndirən sığorta qrupu yalnız mətni oxuyan bir modellə bu işi görə bilməz. Vizual emal bu vəzifələr üçün vacibdir.

Üç realist hal

Case 1 - Token dəyəri sürprizi. Məzmun komandası, həmçinin hər bir bloq yazısını hazırlayarkən modelə 20 səhifəlik “marka bələdçisi” sənədi göndərir. Bu təlimat təxminən 15.000 tokendir. Ayda 2000 məqalə istehsal edirlər; Beləliklə, bələdçini təkrar-təkrar göndərmək 30 milyon token giriş deməkdir. Bələdçini qısaldaraq və yalnız müvafiq bölməni (təxminən 2000 token) göndərməklə, onlar girişi yeddidə birinə azaldır və hesabı əhəmiyyətli dərəcədə azaldır.

2-ci hal - Kontekst pəncərəsi kifayət deyil. Hüquq firması 280 səhifəlik birləşmə müqaviləsinin nəzərdən keçirilməsini istəyir. Sınaq etdikləri ilk modeldə 200.000 token bağlama var idi və sənəd uyğun gəlmədi; Sənədi parçalayanda model birinci bölmədəki məqalənin sonuncu bölmədəki məqalə ilə ziddiyyət təşkil etdiyini görə bilmir. 1 milyon token konteksti olan modelə keçdikdə, sənədi bütövlükdə oxuyur və ziddiyyəti tutur. Burada kontekst pəncərəsi birbaşa dəqiqliyi müəyyən edir.

3-cü hal – Multimodallıq mütləqdir. Sığorta şirkəti avtomobilin zədələnməsinin fotoşəkillərinə əsasən ilkin qiymətləndirmə aparmaq istəyir. Yalnız mətni oxuyan modellə bu mümkün deyil; Fotoşəkili "görən" multimodal model tələb olunur. Onlar multimodal modelə keçdikdə, fotoşəkildəki zədənin yerini və şiddətini təqribən təsnif edən və eksperti istiqamətləndirən əvvəlcədən yoxlama sistemi qururlar. Bununla belə, onlar qeyd edirlər ki, son qərarı insan ekspert verir; çünki model son söz deyil, ilkin seçim vasitəsidir.

Zəif Tələb / Güclü Tələb

Zəif çağırış:

Bu sənədi ümumiləşdirin. [çox uzun sənəd yapışdırılıb]

Güclü göstəriş:

Aşağıdakı 40 səhifəlik hesabatı ümumiləşdirin. Əvvəlcə hesabatdakı işarələrin təxmini sayını təxmin edin və onun tipik balanslaşdırılmış modelin kontekst pəncərəsinə uyğun olub-olmadığını bizə bildirin. Sonra xülasəni bu formatda verin: 5 maddəlik icra xülasəsi + 3 riskli tapıntı. Yalnız hesabatdakı məlumatlardan istifadə edin; Əmin olmadığınız hissəni "hesabatda aydın deyil" kimi qeyd edin. [hesabat]

Güclü sorğu həm token/kontekstdən xəbərdardır, həm də çıxışın formatını və yoxlanılmasını idarə edir.

Kopyalana bilən şablonlar

1. Token proqnozu:

Aşağıdakı mətn üçün tokenlərin təxmini sayını təxmin edin və bunu daxiletmə dəyəri baxımından şərh edin: "[TEXT]". Türk olduğunu nəzərə alaraq bir az yuvarlaqlaşdırın.

2. Kontekst mövcudluğunun yoxlanılması:

Mənim işim aşağıdakı sənədləri emal etməkdir: ayda orta hesabla [PAGES] [QTY] sənəd. Bu ölçü hansı kontekst pəncərəsini tələb edir? İşıq/balanslı/güclü səviyyələrdən hansı kifayət edər? Onu sökmək lazım gələrsə, hansı risk yaranır?

3. Multimodal diaqnostika:

İş axınım: [TƏSVİRİ]. Bu yayımda vizual, audio və ya video emal varmı? Əgər belədirsə, multimodal model tələb olunur, yoxsa onu mətnə ​​çevirmək (OCR/transkripsiya) və mətn modeli ilə həll etmək olar? İki yolun müsbət / mənfi cəhətlərini müqayisə edin.

4. Kontekst optimallaşdırılması:

Modelə hər sorğu ilə sənəd göndərirəm, amma çoxu lazımsızdır. [TASK] üçün həqiqətən tələb olunan hissələri bu sənəddən necə çıxara bilərəm? Daxiletməni azaltmaq üçün 3 konkret yol təklif edin və təxmini token qənaətini göstərin.

Ümumi səhvlər

  • Nişanı sözlə səhv salmaq: Token sözdən fərqlidir; Faktura və tutum həmişə tokendədir, sözlə hesablamaq yanlışdır.
  • Kontekst pəncərəsinin sonsuz olduğunu düşünmək: Hər bir modelin limiti var; Sənəd uyğun gəlmirsə, model bütünü görə bilməz.
  • Lazımsız böyük kontekstdən istifadə: Qısa bir iş üçün böyük kontekstli bahalı model almaq; və ya hər sorğu üçün böyük sənədləri doldurun və boş yerə ödəyin.
  • Multimodallığı fərz etsək: Hər model vizualları emal edə bilməz; Vizual iş üçün, modelin multimodal olduğunu təsdiqləmədən başlayın.
  • Türkcənin lətifə yükünü unudaraq: Türkcə mətnlər ümumiyyətlə eyni məna üçün bir az daha çox işarə istehlak edir; xərclərin hesablanmasında buna məhəl qoymamaq.

Xülasə

  • Token modelin mətni emal etdiyi kiçik vahiddir; giriş və çıxış əlamətlər kimi ayrıca ölçülür və faktura edilir.
  • Kontekst pəncərəsi modelin bir anda yadda saxlaya biləcəyi ümumi əlamətlərdir; sənəd ölçüsü birbaşa model seçiminə təsir göstərir.
  • Multimodallıq modelin vizual/audio kimi qeyri-mətn məlumatlarını emal etmək qabiliyyətidir; Vizual işlər üçün vacibdir.
  • Bu üç anlayışın hər ikisi “hansı model?” sualına uyğundur. eləcə də "bu nə qədərdir?" Sualların əsasını təşkil edir.

Tətbiq tapşırığı

Biznesinizdə təkrarlanan AI tapşırığı seçin. 1-ci şablondan (token proqnozu) bu tapşırıqda tipik bir girişin neçə token olduğunu hesablayın. Sonra şablon 2 ilə hansı səviyyənin kifayət olduğunu müəyyən edin (kontekstdə mövcudluğun yoxlanılması). Əgər vizual işiniz varsa, multimodal modelin 3-cü şablonla tələb olunub-olunmadığını aydınlaşdırın (multimodallıq diaqnozu). Biz növbəti vahidin maya dəyərinin hesablanmasında əldə edilən token smetasından istifadə edəcəyik.

yoxlama siyahısı

  • [ ] Mən token anlayışını bilirəm və mətndə neçə token olduğunu təxmini olaraq necə təxmin etməyi bilirəm.
  • [ ] Kontekst pəncərəsini “cədvəl/yaddaş” analogiyası ilə izah edə bilərəm.
  • [ ] Sənədin modelə uyğun olub-olmadığını qiymətləndirə bilərəm.
  • [ ] Multimodallığın vacib olduğu zaman diaqnoz qoya bilirəm.
  • [ ] Mən türkcənin token əlavə yükünü və lazımsız kontekstin qiymətini nəzərə alıram.