Fitimet:
- Aftësia për të krijuar një arkitekturë të sigurt të cloud LLM që nuk mban çelësin API në klient, por kalon përmes një përfaqësuesi të fundit
- Aftësia për të shkruar integrime të fuqishme që rrisin shpejtësinë e perceptuar me transmetim dhe për të trajtuar butësisht situata të tilla si ndërprerjet, gabimet e rrjetit dhe kufijtë e shpejtësisë
- Aftësia për të ulur koston duke shkurtuar tokenin e dërguar dhe duke vënë në dyshim domosdoshmërinë e të dhënave personale përpara se të shkojnë në re
AI në pajisje është i fuqishëm, por i kufizuar. Kur dëshironi të shtoni një "asistent bisede inteligjente", përmbledhje të gjatë teksti ose prodhim kompleks krijues në një aplikacion, ju nevojiten modele që janë shumë të mëdha për t'u përshtatur në një telefon. Këtu hyn në lojë cloud AI: aplikacioni juaj lidhet me një model të madh gjuhësor (LLM) nëpërmjet një API (Application Programming Interface – ndërfaqja standarde ku dy softuer dërgojnë dhe marrin të dhëna me njëri-tjetrin). Në këtë njësi do të mësojmë se si të integrojmë cloud LLM në një aplikacion celular në një mënyrë të sigurt, të shpejtë dhe të vetëdijshme për koston. Theksi kritik do të jetë te siguria: një integrim LLM i instaluar gabimisht mund të rrjedhë nga çelësi juaj API dhe të rezultojë në fatura me vlerë mijëra paund.
Rregulli i artë i arkitekturës: mbajeni çelësin tek klienti
Gabimi më i rrezikshëm që mund të bëhet në integrimin e AI në cloud është futja e çelësit API (fjalëkalimi sekret që autorizon përdorimin e shërbimit) direkt në kodin e aplikacionit celular. Aplikacionet celulare shkarkohen në pajisjen e përdoruesit dhe kodi mund të lexohet me inxhinieri të kundërt - duke analizuar aplikacionin e përpiluar dhe duke parë se çfarë ka brenda tij. Nëse çelësi juaj është brenda aplikacionit, dikush mund ta nxjerrë atë dhe të bëjë kërkesa të pakufizuara nga llogaria juaj.
Arkitektura e saktë është kjo: aplikacioni celular dërgon kërkesa në serverin tuaj backend (proxy server që kontrolloni); Çelësi qëndron vetëm në server; Serveri shkon te shërbimi LLM dhe kthen përgjigjen në aplikacion. Ky softuer i mesëm siguron gjithashtu kufizimin e shpejtësisë, parandalimin e abuzimit dhe kontrollin e kostos.
Qasje
ku është çelësi
Siguria
Çelësi është në aplikacion (FALSE)
Në klient, publik
Rrjedh, fatura shpërthen
Çelësi është në fund (E VËRTETË)
Në server, i fshehur
I sigurt, i kontrollueshëm
Kujdes: Kur kërkoni AI për integrimin e cloud LLM, mund të prodhojë një shembull që shkruan çelësin direkt në kodin e aplikacionit për lehtësinë tuaj. Mos e merrni kurrë këtë live. Sigurohuni që të përfshini fjalinë "Çelësi API nuk duhet të jetë tek klienti, kaloni përmes përfaqësuesit mbështetës" në kërkesë.
Transmetim: rritja e shpejtësisë së perceptuar
Përgjigjet e LLM mund të jenë të gjata dhe kërkojnë sekonda për t'u prodhuar në tërësinë e tyre. Lënia e përdoruesit në pritje në një ekran bosh është një përvojë e keqe. Zgjidhja është transmetimi - shfaqja e përgjigjes fjalë për fjalë, ndërsa krijohet. Përdoruesi monitoron drejtshkrimin e tekstit, si në ChatGPT; kjo rrit në mënyrë dramatike shpejtësinë dhe rrjedhshmërinë e perceptuar. Rrjedha në celular do të thotë shtimi i pjesëve (shenjat - pjesa e tekstit të prodhuar nga modeli) nga serveri në ndërfaqe kur ato mbërrijnë. Kërkoni në mënyrë të qartë rrjedhën kur printoni integrimin në AI.
Këshillë: Shtoni një buton "pauzë" në përgjigjen e transmetimit. Përdoruesi duhet të jetë në gjendje të ndalojë prodhimin kur të marrë përgjigjen që dëshiron; Kjo përmirëson përvojën dhe zvogëlon koston duke shkurtuar gjenerimin e panevojshëm të shenjave. Në mes të përgjigjes së gjatë, përdoruesi mund ta ketë gjetur tashmë përgjigjen e tij.
Menaxhimi i kostos, vonesave dhe gabimeve
Cloud LLM mbart koston e parave (tarifë për shenjë) dhe koston e kohës (latencën) me secilën kërkesë. Tre disiplina janë thelbësore. Cost: limit prompt and response length, do not send unnecessarily long system instructions, default to small and cheap model if possible. Vonesa: përdorni transmetimin, caktoni afatin, njoftoni përdoruesin nëse rrjeti është i ngadaltë. Gabim: ndërprerja e rrjetit, shërbimi mund të kthejë 429 (shumë kërkesa) ose 500 (gabim serveri); trajtojeni secilën me butësi, mos e prishni aplikacionin. Gjithashtu, LLM ndonjëherë jep përgjigje të pakuptimta ose të pasakta (halucinacione); Shtoni një shtresë verifikimi të përgjigjes në zonat kritike.
tre mini kuti
Rasti 1 - Çelësi i rrjedhur. Një startup futi çelësin OpenAI direkt në aplikacionin e tij React Native për të dalë shpejt. Tre javë pas lëshimit të aplikacionit, çelësi u projektua në mënyrë të kundërt dhe u përdor brenda natës me vlerë 2,400 dollarë. Ekipi duhej të revokonte çelësin dhe të konfiguronte një përfaqësues mbështetës. Mësimi: shkurtorja e marrë për lehtësi u bë rruga më e shtrenjtë.
Rasti 2 - Braktisja u zvogëlua me rrjedhën. Një aplikacion arsimor lëshoi fillimisht veçorinë e tij të pyetjeve dhe përgjigjeve pa transmetim; përdoruesit po dilnin pas 6 sekondash pritjeje boshe. Kur u shtua fluksi, fjala e parë filloi të shfaqej në 0,8 sekonda dhe shkalla e braktisjes ra nga 48% në 12%. I njëjti model, e njëjta shpejtësi - vetëm një ndryshim në prezantim.
Rasti 3 — Kontrolli i kostos. Një aplikacion po i dërgonte modelit të gjithë historikun e bisedave me çdo mesazh përdoruesi; Në biseda të gjata, një kërkesë e vetme arriti në 8000 token, duke rritur koston. Duke dërguar vetëm disa mesazhe të fundit dhe një përmbledhje, ekipi reduktoi argumentet për kërkesë me 70%, duke reduktuar faturën mujore në një të tretën. Mësimi: matni atë që dërgoni.
Prompt i dobët / Prompt i fortë
Prompt i dobët: "Shto një bisedë si ChatGPT në aplikacionin tim."
Njoftim i fuqishëm: "Shto një asistent bisede në aplikacionin tim iOS/Swift. Arkitektura: aplikacioni dërgon një kërkesë në backendin tim, çelësi LLM API NUK është në KLIENT, ai kalon përmes përfaqësuesit. - Përgjigja vjen në transmetim, shfaqet fjalë për fjalë - Butoni "Stop" ndërpret prodhimin - Trajto 5 situata të pakëndshme, 09 e rrjetit. Shkurtoni historinë e bisedës: dërgoni 6 mesazhet e fundit + përmbledhjen (kontrollin e kostos) Shpjegoni fillimisht diagramin arkitektonik, më pas jepni klientin dhe kodin e përfaqësuesit veçmas."
Modele të kopjueshme
Shablloni i sigurt i arkitekturës:"Dizajnoni integrimin e cloud LLM në aplikacionin tim [platformë]. Rregulli: çelësi API vetëm në backend. Klienti -> përfaqësuesi im -> LLM. Në përfaqësues: vërtetimi, kufiri i tarifës për përdorues, regjistrimi i kërkesave. Rendisni përgjegjësitë e klientit dhe përfaqësuesit veçmas dhe më pas eksportoni kodin."
Shablloni i transmetimit: "Shto një përgjigje transmetimi në këtë ekran të bisedës:- Shtoni fragmente në flluskën e mesazhit kur ato mbërrijnë- Shfaqni një kursor/animacion ndërsa shkruani- Kërkoni butonin 'Stop' të anulojë transmetimin- Ruani tekstin e pjesshëm dhe paralajmëroni nëse ka një gabim ndërsa transmetimi përfundon [kodi ekzistues]"
Modeli kosto-latente:"Ul koston dhe vonesën në këtë integrim LLM:- Si mund ta reduktoj tokenin e dërguar (shkurtesën e historisë, përmbledhjen)?- Në cilin rast mjafton modeli më i vogël/më i lirë?- Sugjeroni strategjinë e skadimit dhe riprovoni strategjinë[kodi]"
Shablloni i tolerancës së gabimeve: "Bëni këtë telefonatë LLM të qëndrueshme: - Sjellje e veçantë pa rrjet, afat kohor, 429 (kufi i tarifës), 500 (server) - Mesazh jo teknik, i sjellshëm për përdoruesin- Shënim verifikimi kundër rrezikut të halucinacioneve në përgjigjet kritike[kodi]"
Gabimet e zakonshme
- Futja e çelësit API në aplikacion. Defekti më i shtrenjtë dhe më i zakonshëm i sigurisë; Çelësi është padyshim në pjesën e pasme.
- Duke mos përdorur rrjedhën. Lënia e përdoruesit në pritje të përgjigjeve të gjata do ta largojë përdoruesin.
- Dërgimi i të gjithë historisë së bisedës me çdo kërkesë. Ai shumëfishon koston e shenjës dhe vonesën.
- Anashkalimi i kushteve të gabimit. Nëse 429/500/timeout nuk adresohet, aplikacioni do të rrëzohet ose do të ngrijë.
- Duke e konsideruar përgjigjen LLM si të saktë pa pyetje. Halucinacioni është real; Shto shtresë verifikimi në zonën kritike.
- Dërgimi i të dhënave të përdoruesit në LLM të panevojshëm. Pyetni nëse të dhënat personale kërkohen apo duhen maskuar përpara se të shkojnë në renë kompjuterike.
Në përmbledhje
Cloud LLM sjell aftësi të shkëlqyera që nuk përshtaten në pajisje me celularin, por kërkojnë siguri dhe disiplinë kostoje. Rregulli i artë: Çelësi API nuk është kurrë te klienti, ai kalon përmes përfaqësuesit mbështetës. Rrjedha rrit shumë shpejtësinë dhe mbajtjen e perceptuar; Mbështetur nga butoni "stop". Kostoja përcaktohet duke shkurtuar shenjën e dërguar; Rezistenca arrihet duke i trajtuar me hijeshi të gjitha rastet e gabimeve. Përgjigjet e LLM mund të përfshijnë halucinacione; Në zonat kritike, verifikimi është thelbësor dhe të dhënat personale shqyrtohen përpara se t'i dërgohen në renë kompjuterike.
Detyra e aplikimit
Kërkoni një dizajn klienti + proxy mbështetës nga AI duke përdorur "shabllonin e arkitekturës së sigurt" për një veçori "përmbledhje teksti" ose "chat". Verifikoni që çelësi API qëndron vetëm në pjesën e pasme në dizajnin e krijuar. Më pas nxirrni të paktën dy mënyra për të reduktuar tokenin e dërguar me "Modelin e vonesës së kostos" dhe shkruani mesazhin e sjellshëm që do t'i shfaqet përdoruesit për një gjendje gabimi (p.sh. 429).
listë kontrolli
- [ ] Kam verifikuar që çelësi API qëndron në backend dhe jo në klient
- [ ] Bëra transmetimin e përgjigjes dhe shtova një buton 'pauzë'
- [ ] Kam trajtuar kohëzgjatjen, gabimin e rrjetit, situatat 429 dhe 500
- [ ] E reduktova shenjën e dorëzuar me shkurtesën/përmbledhjen e kaluar
- [ ] Kam konsideruar vërtetimin kundër rrezikut të halucinacioneve në përgjigjen LLM
- [ ] Kontrollova domosdoshmërinë/ maskimin e të dhënave personale përpara se të shkoja në re