Njësia 5 / 10

Shenja, dritarja e kontekstit dhe multimodaliteti: Si funksionon mendja e modelit

Fitimet:

  • Aftësia për të shpjeguar konceptet e tokenit, dritares së kontekstit dhe multimodalitetit në gjuhën e përditshme
  • Diagnostifikoni nëse një detyrë kërkon një kontekst të gjerë ose multimodalitet
  • Aftësia për të marrë parasysh se si këto koncepte ndikojnë në koston dhe zgjedhjen e modelit

Deri tani jemi njohur me ofruesit dhe llojet e modeleve. Megjithatë, për zgjedhjen e duhur të modelit, është gjithashtu e nevojshme të kuptohet se si funksionojnë modelet "brenda"; sepse vendimet për çmimin, kapacitetin dhe disponueshmërinë mbështeten të gjitha në tre koncepte thelbësore: token, dritare kontekstuale dhe multimodalitet. Dikush që nuk i njeh këto koncepte nuk mund të lexojë fletën e çmimeve dhe të pyesë veten "a do të përshtatet ky dokument me modelin?" nuk mund t'i përgjigjet pyetjes dhe nuk mund të shohë kur përpunimi vizual është thelbësor. Në fund të kësaj njësie, ju do të jeni në gjendje t'i shpjegoni këto tre koncepte në gjuhën e përditshme, të diagnostikoni nëse një punë kërkon kontekst të gjerë apo multimodalitet dhe të merrni parasysh ndikimin e tyre në kosto.

Token: Njësia e përdorur nga Modeli në vend të Word

Modelet e inteligjencës artificiale përpunojnë tekstin jo fjalë për fjalë, por në copa të vogla të quajtura token. Një shenjë; Mund të jetë një fjalë, pjesë e një fjale, një shenjë pikësimi ose një hapësirë. Për të bërë një llogaritje të përafërt: Në anglisht, një shenjë mesatare është rreth katër karaktere dhe 100 fjalë janë rreth 130-150 shenja. Në turqisht, kjo normë mund të jetë pak më e lartë për shkak të fjalëve të prapashtesave dhe të gjata; Me fjalë të tjera, një tekst turk me të njëjtin kuptim konsumon pak më shumë argumente sesa anglisht.

Pse është e rëndësishme të dihet kjo? Sepse çdo gjë ngarkohet dhe matet me shenja. Teksti (hyrja) që i dërgoni modelit dhe përgjigja (dalja) e prodhuar nga modeli numërohen si shenja të veçanta. Si fatura, ashtu edhe kapaciteti i modelit janë në shenjë.

Këshillë: Për të marrë një vlerësim të përafërt se sa shenja ka një tekst, ndani numrin e karaktereve me katër. Një email me 4000 karaktere është afërsisht 1000 argumente. Në turqisht, supozoni pak më lart për të qëndruar në anën e sigurt.

Dritarja e kontekstit: "Kujtesa afatshkurtër" e modelit

Dritarja e kontekstit është sasia totale e shenjave që modeli mund të mbajë parasysh në të njëjtën kohë. Hyrja dhe dalja duhet të përshtaten së bashku në këtë dritare. Mendoni për atë si sasinë e letrës që mund të shpërndani në një tavolinë menjëherë: Letra që nuk përshtatet në tavolinë është jashtë fushës tuaj të shikimit në atë moment.

Nëse dritarja e kontekstit të një modeli është 200,000 shenja, kjo barazohet me afërsisht 150,000 fjalë, ose disa libra të përmasave të mesme. 1 milion argumente mund të përpunojnë dokumente shumë më të mëdha në tërësi. Disa modele të fuqishme sot (p.sh. Claude Opus 4.8 dhe Sonnet 5) ofrojnë 1 milion kontekste token, ndërsa modelet e lehta shpesh vijnë me dritare më të vogla (p.sh. 200,000 argumente për Haiku 4.5).

Pse është e rëndësishme? Sepse nëse një dokument nuk përshtatet në dritaren e kontekstit, modeli nuk mund t'i shohë të gjitha së bashku. Ju nuk mund t'i jepni një kontratë 500 faqesh në tërësi një modeli 200,000 token; Ju ose e ndani dokumentin në pjesë (të cilat mund të humbasin marrëdhënien midis pjesëve) ose zgjidhni një model me një kontekst më të gjerë.

Kujdes: Nuk është e mençur të plotësoni çdo dokument pasi është thjesht sepse dritarja e kontekstit është e madhe. Sa më shumë argumente të vendosni në dritare, aq më shumë paguani dhe ndonjëherë modelit mund t'i mungojnë detajet e mesme në tekste shumë të gjata. Shpesh është më e lirë dhe më e saktë të dërgosh vetëm pjesën që funksionon.

Dritarja e kontekstit është një kriter vendimi

Kërkimi

Konteksti i përafërt i kërkuar

Niveli i duhur

Përgjigje e shkurtër me email

disa qindra argumente

të lehta

Përmbledhje me një faqe

disa mijëra argumente

E lehtë/e balancuar

Analiza e raportit prej 40 faqesh

~ 30,000 argumente

E ekuilibruar/e fortë

Rishikimi i kontratës me 300 faqe

~ 250,000 argumente

I fuqishëm me kontekst të gjerë

Përpunoni qindra dokumente në të njëjtën kohë

500,000+ argumente

Konteksti më i gjerë

Kjo tabelë i përgjigjet pyetjes "cili model?" Tregon se një pjesë e pyetjes përgjigjet drejtpërdrejt nga madhësia e dokumentit. Është humbje të blesh një model të shtrenjtë me një kontekst të madh për punë të shkurtra; Një model me një dritare të vogël është i pamjaftueshëm për dokumente të mëdha.

Multimodaliteti: Duke shkuar përtej tekstit

Multimodaliteti është aftësia e një modeli për të trajtuar lloje të shumta të dhënash (imazh, audio, ndonjëherë video), jo vetëm tekst. "Modal" këtu do të thotë "lloji i të dhënave"; multimodal do të thotë "shumë lloje".

  • Modeli vetëm me tekst: Lexon dhe shkruan vetëm tekst të shkruar.
  • Modeli multimodal: Mund të lexojë një foto të një faturë, të interpretojë një prirje në një grafik, të deshifrojë një shënim të shkruar me dorë, ndonjëherë të transkriptojë një regjistrim zanor.

Pse është e rëndësishme? Sepse natyra e biznesit tuaj mund të kërkojë multimodalitet. Një ekip kontabël që nxjerr shuma nga imazhet e faturave, një ekip i tregtisë elektronike që klasifikon fotot e produkteve ose një ekip sigurimesh që vlerëson fotot e dëmtimit nuk mund ta bëjë këtë punë me një model që lexon vetëm tekst. Përpunimi vizual është thelbësor për këto detyra.

Tre raste realiste

Rasti 1 - Surpriza e kostos së shenjës. Një ekip i përmbajtjes i dërgon modelit gjithashtu një dokument "udhëzuesi i markës" me 20 faqe ndërsa prodhojnë çdo postim në blog. Ky udhëzues është rreth 15,000 argumente. Ata prodhojnë 2000 artikuj në muaj; Pra, vetëm dërgimi i udhëzuesit pa pushim do të thotë 30 milionë shenja të dhënash. Duke shkurtuar udhëzuesin dhe duke dërguar vetëm seksionin përkatës (rreth 2000 tokena), ata reduktojnë hyrjen në një të shtatën dhe ulin ndjeshëm faturën.

Rasti 2 - Dritarja e kontekstit nuk mjafton. Një firmë ligjore dëshiron të rishikojë një marrëveshje bashkimi prej 280 faqesh. Modeli i parë që ata provuan kishte një lidhje prej 200,000 tokenash dhe dokumenti nuk përshtatej; Kur dokumenti copëtohet, modeli nuk mund të vërejë se një artikull në seksionin e parë kundërshton një artikull në seksionin e fundit. Kur kalon në një model me kontekst 1 milion token, ai lexon dokumentin në tërësi dhe kap kontradiktën. Këtu dritarja e kontekstit përcakton drejtpërdrejt saktësinë.

Rasti 3 — Multimodaliteti është i domosdoshëm. Një kompani sigurimesh kërkon të bëjë një vlerësim paraprak nga fotografitë e dëmtimit të automjeteve. Kjo është e pamundur me një model që lexon vetëm tekst; Kërkohet një model multimodal që “sheh” fotografinë. Kur kalojnë në një model multimodal, ata krijojnë një sistem paraprak të shqyrtimit që klasifikon afërsisht vendndodhjen dhe ashpërsinë e dëmtimit në foto dhe drejton ekspertin. Megjithatë, ata vërejnë se një ekspert njerëzor merr vendimin përfundimtar; sepse modeli është një mjet paraprak shqyrtimi, jo fjala përfundimtare.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Përmblidheni këtë dokument. [dokumenti është ngjitur shumë i gjatë]

Njoftim i fuqishëm:

Përmblidheni raportin prej 40 faqesh më poshtë. Fillimisht vlerësoni numrin e përafërt të argumenteve në raport dhe na tregoni nëse ai përshtatet brenda dritares së kontekstit të një modeli tipik të balancuar. Më pas jepni përmbledhjen në këtë format: përmbledhje ekzekutive me 5 pika + 3 gjetje të rrezikshme. Përdorni vetëm informacionin në raport; Shënoni pjesën për të cilën nuk jeni të sigurt si "jo e qartë në raport". [raporti]

Prompti i fuqishëm është i vetëdijshëm për token/kontekstin dhe kontrollon formatin dhe verifikueshmërinë e daljes.

Modele të kopjueshme

1. Parashikimi i shenjës:

Llogaritni numrin e përafërt të argumenteve për tekstin e mëposhtëm dhe interpretojeni këtë në termat e kostos së hyrjes: "[TEXT]". Rrumbullakoseni pak, duke pasur parasysh që është turqisht.

2. Kontrolli i disponueshmërisë së kontekstit:

Detyra ime është të përpunoj dokumentet e mëposhtme: mesatarisht [FAQE] prej [QTY] dokumentesh në muaj. Çfarë dritare konteksti kërkon kjo madhësi? Cili nga nivelet e dritës/ekuilibruar/i fortë do të ishte i mjaftueshëm? Çfarë rreziku lind nëse duhet të çmontohet?

3. Diagnoza e multimodalitetit:

Rrjedha ime e punës: [DESCRIPTION]. A ka përpunim vizual, audio ose video në këtë transmetim? Nëse po, a kërkohet një model multimodal, apo mund të konvertohet në tekst (OCR/transkriptim) dhe të zgjidhet me modelin e tekstit? Krahasoni të mirat/të këqijat e dy rrugëve.

4. Optimizimi i kontekstit:

I dërgoj një dokument modelit me çdo kërkesë, por shumica e tij është e panevojshme. Si mund të nxjerr pjesët që kërkohen në të vërtetë për [DETYRË] nga ky dokument? Sugjeroni 3 mënyra konkrete për të reduktuar të dhënat dhe tregoni kursimet e vlerësuara të tokenit.

Gabimet e zakonshme

  • Gabimi i shenjës për një fjalë: Token është ndryshe nga një fjalë; Fatura dhe kapaciteti janë gjithmonë në shenjë, llogaritja me fjalë është mashtruese.
  • Mendimi se dritarja e kontekstit është e pafundme: Çdo model ka një kufi; Nëse dokumenti nuk përshtatet, modeli nuk mund ta shohë të gjithën.
  • Përdorimi i kontekstit të panevojshëm të madh: Blerja e një modeli të shtrenjtë me një kontekst të madh për një punë të shkurtër; ose plotësoni dokumente të mëdha për çdo kërkesë dhe paguani kot.
  • Duke supozuar multimodalitetin: Jo çdo model mund të përpunojë pamjet vizuale; Për punën vizuale, filloni pa konfirmuar që modeli është multimodal.
  • Harrimi i ngarkesës simbolike të turqishtes: tekstet turke në përgjithësi konsumojnë pak më shumë argumente për të njëjtin kuptim; duke e injoruar këtë në vlerësimin e kostos.

Në përmbledhje

  • Një shenjë është njësia e vogël në të cilën modeli përpunon tekstin; inputi dhe outputi maten dhe faturohen veçmas si shenja.
  • Dritarja e kontekstit është totali i shenjave që modeli mund të mbajë parasysh në të njëjtën kohë; madhësia e dokumentit ndikon drejtpërdrejt në zgjedhjen e modelit.
  • Multimodaliteti është aftësia e modelit për të përpunuar të dhëna jo-tekstore si ato vizuale/audio; Është thelbësore për veprat vizuale.
  • Këto tre koncepte janë të dyja të rëndësishme për pyetjen "cili model?" si dhe "sa kushton?" Ajo përbën bazën e pyetjeve.

Detyra e aplikimit

Zgjidhni një detyrë të përsëritur të AI në biznesin tuaj. Bëjini shabllonit të parë (parashikimi i shenjës) të llogarisë sa argumente ka një hyrje tipike në këtë detyrë. Më pas përcaktoni se cili nivel është i mjaftueshëm me shabllonin 2 (kontrolli i disponueshmërisë së kontekstit). Nëse keni një punë vizuale, sqaroni nëse kërkohet një model multimodal me shabllonin e tretë (diagnoza e multimodalitetit). Ne do të përdorim vlerësimin simbolik që rezulton në llogaritjen e kostos së njësisë së ardhshme.

listë kontrolli

  • [ ] Unë e di konceptin e tokenit dhe si të vlerësoj përafërsisht sa shenja ka një tekst.
  • [ ] Unë mund ta shpjegoj dritaren e kontekstit me një analogji "tabela/memorie".
  • [ ] Unë mund të vlerësoj nëse një dokument do të përshtatet në një model.
  • [ ] Mund të diagnostikoj kur multimodaliteti është thelbësor.
  • [ ] Unë marr parasysh koston e përgjithshme të turqishtes dhe koston e kontekstit të panevojshëm.