Qligħ:
- Ability to establish a secure cloud LLM architecture that does not keep the API key on the client but goes through a back-end proxy
- Kapaċità li tikteb integrazzjonijiet robusti li jżidu l-veloċità perċepita bi streaming u jimmaniġġjaw bil-mod sitwazzjonijiet bħal timeouts, żbalji tan-netwerk u limiti tal-veloċità
- Ability to reduce the cost by shortening the token sent and question the necessity of personal data before it goes to the cloud
L-AI fuq it-tagħmir hija qawwija iżda limitata. Meta trid iżżid verament "assistent ta' chat intelliġenti", sommarju ta' test twil, jew produzzjoni kreattiva kumplessa ma' app, għandek bżonn mudelli li huma kbar wisq biex jidħlu fuq it-telefon. Dan huwa fejn tidħol sħaba AI: l-applikazzjoni tiegħek tikkonnettja ma 'mudell ta' lingwa kbira (LLM) permezz ta 'API (Application Programming Interface - l-interface standard fejn żewġ softwer jibagħtu u jirċievu data lil xulxin). In this unit we will learn how to integrate cloud LLM into a mobile application in a safe, fast and cost-conscious manner. L-enfasi kritika se tkun fuq is-sigurtà: integrazzjoni LLM installata ħażin tista 'tnixxi ċ-ċavetta API tiegħek u tirriżulta f'kontijiet li jiswew eluf ta' liri.
The golden rule of architecture: keep the key on the client
L-iżball l-aktar perikoluż li jista 'jsir fl-integrazzjoni ta' l-AI tal-cloud huwa li tiġi integrata ċ-ċavetta API (il-password sigrieta li tawtorizza l-użu tas-servizz) direttament fil-kodiċi tal-applikazzjoni mobbli. L-applikazzjonijiet mobbli jitniżżlu fuq it-tagħmir tal-utent u l-kodiċi jista’ jinqara permezz ta’ reverse engineering — billi tiġi analizzata l-applikazzjoni kkumpilata u tara x’hemm ġewwa fiha. Jekk iċ-ċavetta tiegħek tinsab ġewwa l-app, xi ħadd jista 'jiġbedha u jagħmel talbiet illimitati mill-kont tiegħek.
L-arkitettura korretta hija din: l-applikazzjoni mobbli tibgħat talbiet lis-server backend tiegħek stess (is-server proxy li tikkontrolla); Iċ-ċavetta tgħix biss fuq is-server; Is-server imur għas-servizz LLM u jirritorna r-rispons għall-applikazzjoni. Dan il-middleware jipprovdi wkoll capping tal-veloċità, prevenzjoni tal-abbuż, u kontroll tal-ispejjeż.
Approċċ
fejn hi ċ-ċavetta
Sigurtà
Iċ-ċavetta tinsab fl-applikazzjoni (FALZ)
Fil-klijent, pubbliku
Tnixxi, il-kont jisplodi
Iċ-ċavetta tinsab fil-backend (VERU)
Fuq is-server, moħbi
Sikur, kontrollabbli
Attenzjoni: Meta titlob lill-AI għall-integrazzjoni ta' cloud LLM, tista' tipproduċi eżempju li jikteb iċ-ċavetta direttament fil-kodiċi tal-applikazzjoni għall-konvenjenza tiegħek. Qatt ma tieħu dan live. Kun żgur li tinkludi s-sentenza "Iċ-ċavetta API m'għandhiex tkun fuq il-klijent, tgħaddi mill-prokura backend" fil-pront.
Streaming: tiżdied il-veloċità perċepita
It-tweġibiet LLM jistgħu jkunu twal u jieħdu sekondi biex jipproduċu fl-intier tagħhom. Li tħalli lill-utent jistenna fuq skrin vojt hija esperjenza ħażina. Is-soluzzjoni hija streaming — turi t-tweġiba kelma b'kelma, hekk kif tiġi ġġenerata. L-utent jimmonitorja l-ortografija tat-test, bħal fi ChatGPT; dan iżid drammatikament il-veloċità u l-ħeffa perċepita. Il-fluss fuq il-mowbajl ifisser li żżid biċċiet (tokens — il-biċċa test prodotta mill-mudell) mis-server għall-interface hekk kif jaslu. Itlob b'mod espliċitu l-fluss meta tipprintja l-integrazzjoni għall-AI.
Tip: Żid buttuna "pawża" fir-rispons tal-istrimjar. L-utent għandu jkun jista 'jwaqqaf il-produzzjoni meta jikseb it-tweġiba li jrid; Dan kemm itejjeb l-esperjenza kif ukoll inaqqas l-ispiża billi tnaqqas il-ġenerazzjoni ta 'tokens bla bżonn. F'nofs it-tweġiba twila, l-utent jista 'jkun diġà sab it-tweġiba tiegħu.
Ġestjoni tal-ispiża, dewmien u żbalji
Cloud LLM carries money cost (fee per token) and time cost (latency) with each request. Tliet dixxiplini huma essenzjali. Cost: limit prompt and response length, do not send unnecessarily long system instructions, default to small and cheap model if possible. Latency: use streaming, set timeout, notify user if network is slow. Error: network outage, service may return 429 (too many requests) or 500 (server error); jimmaniġġjaw kull wieħed bil-mod, ma tiġġarraf l-app. Also, LLM sometimes gives meaningless or incorrect (hallucination) answers; Add a layer of verification of the answer in critical areas.
tliet każijiet żgħar
Każ 1 — Ċavetta leaked. A startup embedded the OpenAI key directly into its React Native app to get out fast. Three weeks after the app was released, the key was reverse engineered and $2,400 worth of usage was made overnight. The team had to revoke the key and set up a backend proxy. Lesson: the shortcut taken for convenience became the most expensive route.
Każ 2 — It-tluq mill-iskola naqas mal-fluss. App għall-edukazzjoni l-ewwel ħarġet il-karatteristika M&A tagħha mingħajr streaming; users were exiting after 6 seconds of idle waiting. When flow was added, the first word started appearing in 0.8 seconds, and the abandonment rate dropped from 48% to 12%. L-istess mudell, l-istess veloċità - biss differenza fil-preżentazzjoni.
Każ 3 — Kontroll tal-ispejjeż. App waħda kienet tibgħat l-istorja kollha taċ-chat lill-mudell ma 'kull messaġġ tal-utent; F'konversazzjonijiet twal, talba waħda laħqet 8,000 tokens, u nefħet l-ispiża. Billi bagħat biss l-aħħar ftit messaġġi u sommarju, it-tim naqqas it-tokens għal kull talba b'70%, u naqqas il-kont ta 'kull xahar għal terz. Lezzjoni: kejjel dak li tibgħat.
Pront dgħajjef / Pront qawwi
Pront dgħajjef: "Żid chat bħal ChatGPT mal-app tiegħi."
Prompt qawwi: "Żid chat assistent fl-applikazzjoni tiegħi iOS/Swift. Arkitettura: l-applikazzjoni tibgħat talba lill-backend tiegħi stess, iċ-ċavetta LLM API MHIX fuq il-KLIJENT, tgħaddi mill-prokura. - Ir-rispons jiġi streaming, murija kelma b'kelma - Il-buttuna 'Stop' tinterrompi l-produzzjoni - Immaniġġja timeout, żball tan-netwerk, 429 u grazzja l-istorja tal-chat ibgħat l-aħħar messaġġi. + summary (cost control)Explain the architectural diagram first, then give the client and proxy code separately."
Mudelli kopjabbli
Mudell ta' arkitettura sigura: "Integrazzjoni ta' LLM tas-sħaba tad-disinn fl-applikazzjoni [pjattaforma] tiegħi. Regola: ċavetta API biss fil-backend. Klijent -> prokura tiegħi -> LLM. Fi prokura: awtentikazzjoni, limitu ta' rata għal kull utent, illoggjar talba. Elenka r-responsabbiltajiet tal-klijent u tal-prokura separatament, imbagħad esporta l-kodiċi."
Mudell ta' Streaming: "Żid rispons ta' streaming ma' din l-iskrin taċ-chat:- Żid siltiet mal-bużżieqa tal-messaġġi hekk kif jaslu- Uri cursor/animazzjoni waqt li ttajpja- Ikollok buttuna 'Stop' tikkanċella l-fluss- Ippreserva test parzjali u twissi jekk ikun hemm żball waqt li l-fluss ikun qed jintemm[kodiċi eżistenti]"
Mudell tal-kost-latency: "Naqqas l-ispiża u l-latency f'din l-integrazzjoni LLM:- Kif innaqqas it-token mibgħut (abbrevjazzjoni tal-istorja, sommarju)?- F'liema każ huwa biżżejjed mudell iżgħar/orħos?- Issuġġerixxi timeout u erġa' pprova strateġija[kodiċi]"
Mudell tat-tolleranza tal-ħsarat: "Agħmel din is-sejħa LLM reżiljenti:- Imġieba separata għall-ebda netwerk, timeout, 429 (limitu tar-rata), 500 (server)- Messaġġ mhux tekniku u edukat lill-utent- Nota ta' verifika kontra riskju ta' alluċinazzjoni f'risposti kritiċi[kodiċi]"
Żbalji komuni
- Inkorporazzjoni taċ-ċavetta API fl-applikazzjoni. Il-bug tas-sigurtà l-aktar għali u komuni; Iċ-ċavetta definittivament tinsab fit-tarf ta 'wara.
- Mhux bl-użu tal-fluss. Li tħalli lill-utent jistenna tweġibiet twal se jkeċċi lill-utent.
- Tibgħat l-istorja kollha taċ-chat ma' kull talba. Hija timmultiplika l-ispiża tat-token u l-latenza.
- Bypassing kundizzjonijiet ta 'żball. Jekk 429/500/timeout ma jiġix indirizzat l-applikazzjoni tiġġarraf jew tiffriża.
- Meta wieħed iqis it-tweġiba tal-LLM bħala korretta mingħajr mistoqsija. L-alluċinazzjoni hija reali; Żid saff ta 'verifika fiż-żona kritika.
- Tibgħat dejta tal-utent lil LLM mhux meħtieġ. Staqsi jekk id-dejta personali hijiex meħtieġa jew għandhiex tiġi mgħottija qabel ma tmur fil-cloud.
Fil-qosor
Cloud LLM iġib kapaċitajiet kbar li ma jidħlux fuq l-apparat għall-mowbajl, iżda jeħtieġu sigurtà u dixxiplina fl-ispejjeż. Regola tad-deheb: Iċ-ċavetta API qatt ma tkun fuq il-klijent, tgħaddi mill-prokura backend. Il-fluss iżid ħafna l-veloċità u ż-żamma perċepita; Appoġġjata mill-buttuna "waqfien". L-ispiża hija determinata billi jitqassar it-token mibgħut; Ir-reżiljenza tinkiseb billi jiġu mmaniġġjati l-każijiet kollha ta 'żball b'mod grazzjuż. It-tweġibiet LLM jistgħu jinkludu alluċinazzjonijiet; F'oqsma kritiċi, il-verifika hija essenzjali u d-dejta personali tiġi riveduta qabel ma tintbagħat lill-cloud.
Kompitu ta' applikazzjoni
Itlob disinn ta' prokura klijent + backend mill-AI billi tuża l-"Mudell ta' arkitettura Sikura" għal karatteristika ta' "qosor tat-test" jew "chat". Ivverifika li ċ-ċavetta API tirrisjedi biss fil-backend fid-disinn iġġenerat. Imbagħad iġbed mill-inqas żewġ modi biex tnaqqas it-token mibgħut bil-"mudell ta 'dewmien tal-ispiża" u ikteb il-messaġġ edukat li għandu jintwera lill-utent għal kundizzjoni ta' żball (eż. 429).
lista ta' kontroll
- [ ] Ivverifikajt li ċ-ċavetta API tgħix fil-backend u mhux fuq il-klijent
- [ ] Għamilt ir-rispons streaming u żidt buttuna 'pawża'
- [ ] I mmaniġġjat timeout, żball tan-netwerk, 429 u 500 sitwazzjoni
- [ ] I reduced the submitted token with the past abbreviation/summary
- [ ] I considered validation against the risk of hallucinations in the LLM answer
- [ ] I checked the necessity/masking of personal data before going to the cloud