zisky:
- Token dokáže intuitívne vysvetliť pojmy pravdepodobnosti a predpovede
- Chápe, prečo jazykový model vytvára text „po častiach“
- Dokáže interpretovať, prečo sa model niekedy správa rozhodne a niekedy kreatívne
Keď do jazykového modelu napíšete „to najlepšie na Istanbule“, za pár sekúnd vznikne plynulý odsek. Ako sa to stane? Naozaj model „premýšľa“ alebo je za tým oveľa jednoduchší, ale výkonný mechanizmus? V tejto lekcii vysvetlíme, ako funguje generatívna AI, bez toho, aby sme zachádzali do technických rovníc, ale nastolením správnej intuície. Táto intuícia je základom pre všetko, čo nasleduje – najmä témy halucinácií, overovania a dobrého pohotového písania. Generatívna AI, teda „generatívna umelá inteligencia“, je bežný názov pre nástroje, ktoré vytvárajú text od začiatku namiesto hľadania a získavania existujúcej odpovede.
Základná myšlienka: Predpovedanie ďalšieho dielu
Prekvapivé je, že jedinou základnou úlohou, ktorú sa jazykový model učí, je „ktorá časť textu bude s najväčšou pravdepodobnosťou nasledovať?“ je odpovedať na otázku. Modelka si nepripraví celú vetu a nepredstaví ju pred vami. Namiesto toho vytvára vetu kúsok po kúsku, zľava doprava.
Krok za krokom to funguje takto:
- Prečíta text (výzvu), ktorý napíšete.
- Predpovedá, že najpravdepodobnejšia časť bude nasledovať tento text.
- Pridáva ten kúsok.
- Znovu sa pozrie na novovytvorený text a uhádne ďalší najpravdepodobnejší kus.
- Opakuje sa, kým nie je odpoveď úplná.
Príklad: Ak by ste modelke dali text „Daj si horúcu šálku, keď sa ráno zobudíš...“, najpravdepodobnejšie pokračovanie by bolo „čaj“ alebo „káva“; Nie "asfalt". Takéto pravdepodobnosti sa model naučil z miliónov textov. Potom pridá „čaj“, potom sa pozrie na novú vetu a uhádne ďalšiu najpravdepodobnejšiu časť atď.
Inými slovami, na každom kroku model urobí ďalší krok tým, že sa pozrie na to, čo napísal. Preto sa niekedy nazýva „veľmi pokročilá verzia automatického dopĺňania“. Ale táto analógia by nemala bagatelizovať talent; V správnej mierke môže táto predpoveď priniesť výsledky, ktoré vyzerajú ako zdôvodnenie.
Token: Malé kúsky slova
Model v skutočnosti nefunguje s plnými „slovami“, ale s menšími časťami nazývanými tokeny. Token; Niekedy je to celé slovo, niekedy časť slova, niekedy interpunkčné znamienko.
- „kniha“ môže byť jeden token.
- „z našich kníh“ možno rozdeliť na niekoľko tokenov ako „kniha“, „s“, „naša“, „z“.
- Medzery a interpunkčné znamienka sa tiež počítajú ako žetóny.
Pozor: Token nie je len technický detail. Väčšina nástrojov AI sa účtuje podľa počtu tokenov a dĺžka textu (kontextového okna), ktoré modely môžu naraz spracovať, je tiež obmedzená v tokenoch. Takže "ako dlho píšeš" je priamy náklad a limit.
Pravdepodobnosť a „teplo“: odhodlanie alebo kreativita?
V každom kroku model nevytvára jedinú definitívnu odpoveď, ale zoznam pravdepodobnosti možných pokračovaní. Napríklad za slovom „horký“: čaj 55 %, káva 35 %, mlieko 7 %, ostatné 3 %. Tak ktorý si vyberie?
Tu vstupuje do hry nastavenie s názvom teplota. Teplota je akýmsi gombíkom kreativity, ktorý určuje, ako veľmi bude model „riskovať“.
Nastavenie
správanie
Záver
Kde je to užitočné?
nízka teplota
Vždy zvolí najpravdepodobnejšiu možnosť
Stabilné, opakovateľné
Právne zhrnutie, technický popis, extrakcia údajov
stredná teplota
Vyvážený výber
Prirodzené, ale konzistentné
Všeobecný e-mail, návrh správy
vysoká teplota
Skúša menej pravdepodobné možnosti
Kreatívny, rôznorodý, nepredvídateľný
Brainstorming, slogan, výroba mena
To vysvetľuje aj často kladenú otázku: „Prečo dostávam rôzne odpovede, keď dvakrát položím tú istú otázku?“ Pretože v procese výberu existuje určitá náhodnosť; Model nečerpá pevnú odpoveď z databázy, ale zakaždým ju reprodukuje.
Slabá výzva / silná výzva
Vedieť, že model pracuje s „pravdepodobnosťou“, tiež mení spôsob, akým ho inštruujete. Čím viac kontextu uvediete, tým pravdepodobnejšie bude správne pokračovanie.
Slabá výzva: Napíšte úvodný text.
Výsledok: Model vytvára „najpriemernejší“ a najvšeobecnejší text, pretože nevie, ktorý produkt, aké publikum, aký tón.
Silná výzva: Napíšte reklamný text na Instagrame pre novú filtrovanú kávu v malej kaviarni. Publikum: 25-35 rokov, nadšenec kávy. Tón: priateľský, krátky. Maximálne 3 vety, 2 hashtagy na konci.
Výsledok: Použiteľný text, ktorý je relevantný, pretože kontext zužuje možnosti.
Tri mini puzdrá
Prípad 1 – Marketing, vysoká rozmanitosť. Tím chcel 30 sloganov pre nový produkt. Vďaka nastaveniu vysokej teploty ponúka tento model rôzne kreatívne možnosti; Tím vybral a vyvinul 4 z 30. Celkový čas: 10 minút. Keby sa to robilo ručne, trvalo by to pol dňa.
Prípad 2 – Zákon, vysoké odhodlanie. Právny tím tej istej spoločnosti zjednodušoval zmluvnú doložku. Chceli konzistentnosť, nie kreativitu; Pri nízkej teplote model zakaždým poskytol takmer rovnaké, konzervatívne zhrnutie. Medzi rôznymi pokusmi teda nedošlo k žiadnej nezrovnalosti.
Prípad 3 – „Prečo sa to zmenilo?“ otázka. Zamestnanec dvakrát požiadal o rovnaký koncept e-mailu a dostal dva rôzne výsledky; Myslel si, že to bola "chyba". V skutočnosti je to prirodzený dôsledok náhodnosti modelu. Keď sa zamestnanec naučil uložiť verziu, ktorá sa mu páčila, a v prípade potreby povedať „urob to ako predošlú“, nebol problém.
Modelka „dostane“?
Toto je najkurióznejšia otázka. Model sa naučil štatistické vzťahy medzi slovami tak dôkladne, že sa tvári, že mnohým úlohám rozumie. Nemá však žiadne vedomé pochopenie, zámer alebo mechanizmus ovládania reality. Vytvára „najpravdepodobnejšie pokračovanie“; Nezaručuje poskytovanie „najpresnejších informácií“. Toto rozlíšenie je základom predmetu halucinácie, o ktorom budeme diskutovať v ďalších celkoch.
Časté chyby
Časté chyby
- Zámena modelu za vyhľadávač. Model nehľadá na internete a nevyhľadáva zdroje (pokiaľ neexistuje špeciálna funkcia vyhľadávania); Generuje možný text z pamäte. Takže si vie vymyslieť zdroj/číslo.
- Zámena plynulosti za presnosť. To, že je text krásny a sebavedomý, ešte neznamená, že jeho obsah je správny.
- Zakaždým očakávať rovnakú odpoveď. Náhodnosť je prirodzená; Uložte si požadovaný výstup pre kritické úlohy.
- Vkladanie veľmi dlhého nepotrebného textu a prekračovanie limitu tokenov. Dĺžka zvyšuje náklady a môže odvrátiť pozornosť modelu; stačí uviesť potrebný kontext.
Pozor: To, že modelka hovorí plynule a sebavedomo, ešte neznamená, že hovorí správne. Plynulosť je prirodzeným dôsledkom odhadu pravdepodobnosti; Presnosť je niečo, čo sa musí kontrolovať samostatne a nezávisle.
V súhrne
- Generatívna AI generuje text krok za krokom predpovedaním ďalšieho najpravdepodobnejšieho fragmentu (tokenu); zostavuje vetu po kúskoch.
- Tokeny sú menšie časti slov a stanovujú limity ceny aj dĺžky.
- V každom kroku model vytvára zoznam možností; Nastavenie teploty určuje, ako stabilný alebo kreatívny bude výstup.
- Dôvod rôznych odpovedí na rovnakú otázku je spôsobený náhodnosťou, ktorá je tomuto procesu vlastná.
- Modelka hovorí plynule, no to nezaručuje, že hovorí pravdu; Plynulosť a presnosť sú rôzne veci.
Aplikačná úloha
Dajte svojmu nástroju AI rovnakú kreatívnu úlohu (napr. „napíšte rýchle poďakovanie“) dvakrát za sebou a sledujte, ako sa výstupy líšia. Potom zopakujte rovnakú úlohu so šablónou „Výkonná výzva“, pridajte kontext a všimnite si rozdiel v kvalite medzi týmito dvoma výsledkami.
Kontrolný zoznam
- [ ] Môžem vysvetliť, že model vytvára text „predpovedaním ďalšieho možného bloku“.
- Viem, čo je [ ] Token a prečo znamená cenu/limit.
- [ ] Viem rozlíšiť medzi prácami, ktoré si vyžadujú odhodlanie a tými, ktoré vyžadujú kreativitu.
- [ ] Viem, že je normálne dostať rôzne odpovede na rovnakú otázku.
- [ ] Uvedomil som si, že plynulosť nie je zárukou presnosti.