Yksikkö 5 / 11

Cloud AI ja LLM API -integraatio: Chat, Flow ja turvallisuus

Voitot:

  • Kyky luoda suojattu pilvi-LLM-arkkitehtuuri, joka ei pidä API-avainta asiakkaassa, vaan kulkee taustavälityspalvelimen kautta
  • Kyky kirjoittaa kestäviä integraatioita, jotka lisäävät havaittua nopeutta suoratoistolla ja käsittelevät hellästi tilanteita, kuten aikakatkaisuja, verkkovirheitä ja nopeusrajoituksia
  • Mahdollisuus alentaa kustannuksia lyhentämällä lähetettyä merkkiä ja kyseenalaistaa henkilötietojen tarpeellisuus ennen kuin ne siirtyvät pilveen

Laitteen tekoäly on tehokas mutta rajoitettu. Kun haluat lisätä sovellukseen todella "älykkään chat-avustajan, pitkän tekstin yhteenvedon tai monimutkaisen luovan tuotannon, tarvitset malleja, jotka ovat liian suuria mahtumaan puhelimeen. Tässä tulee esiin pilvi AI: sovelluksesi muodostaa yhteyden suureen kielimalliin (LLM) API:n (Application Programming Interface) kautta – vakiorajapinta, jossa kaksi ohjelmistoa lähettää ja vastaanottaa tietoja toisilleen. Tässä osiossa opimme integroimaan pilvi LLM mobiilisovellukseen turvallisesti, nopeasti ja kustannustietoisesti. Kriittinen painopiste on turvassa: väärin asennettu LLM-integraatio voi vuotaa API-avaimesi ja johtaa tuhansien puntien arvoisiin laskuihin.

Arkkitehtuurin kultainen sääntö: pidä avain asiakkaalla

Vaarallisin virhe, jonka pilvi AI-integraatiossa voi tehdä, on API-avaimen (salainen salasana, joka valtuuttaa palvelun käytön) upottaminen suoraan mobiilisovelluksen koodiin. Mobiilisovellukset ladataan käyttäjän laitteelle ja koodi voidaan lukea käänteisellä suunnittelulla eli jäsentämällä käännetty sovellus ja katsomalla, mitä sen sisällä on. Jos avaimesi on sovelluksen sisällä, joku voi purkaa sen ja tehdä rajattomasti pyyntöjä tililtäsi.

Oikea arkkitehtuuri on tämä: mobiilisovellus lähettää pyynnöt omalle taustapalvelimellesi (hallinnallesi välityspalvelimelle); Avain on vain palvelimella; Palvelin siirtyy LLM-palveluun ja palauttaa vastauksen sovellukselle. Tämä väliohjelmisto tarjoaa myös nopeusrajoituksen, väärinkäytösten ehkäisyn ja kustannusten hallinnan.

Lähestymistapa

missä on avain

Turvallisuus

Avain on sovelluksessa (FALSE)

Asiakkaalla, julkisesti

Se vuotaa, seteli räjähtää

Avain on taustajärjestelmässä (TRUE)

Palvelimella piilotettuna

Turvallinen, hallittavissa

Varoitus: Kun pyydät tekoälyä pilvi-LLM-integraatioon, se voi tuottaa esimerkin, joka kirjoittaa avaimen suoraan sovelluskoodiin avuksesi. Älä koskaan ota tätä livenä. Muista sisällyttää kehotteeseen lause "API-avaimen ei pitäisi olla asiakkaassa, käy läpi taustapalvelimen välityspalvelin".

Suoratoisto: koetun nopeuden lisääminen

LLM-vastaukset voivat olla pitkiä ja niiden kokonaisuuden tuottaminen kestää sekunteja. Käyttäjän jättäminen odottamaan tyhjälle näytölle on huono kokemus. Ratkaisu on suoratoisto – vastauksen näyttäminen sana sanalta sellaisena kuin se luodaan. Käyttäjä valvoo tekstin oikeinkirjoitusta, kuten ChatGPT:ssä; tämä lisää dramaattisesti havaittua nopeutta ja sujuvuutta. Flow mobiililaitteella tarkoittaa osien (tokenien – mallin tuottaman tekstinpalan) lisäämistä palvelimelta käyttöliittymään niiden saapuessa. Pyydä kulkua erikseen tulostettaessa integrointi tekoälyyn.

Vinkki: Lisää "tauko"-painike suoratoistovastaukseen. Käyttäjän tulee pystyä lopettamaan tuotanto, kun hän saa haluamansa vastauksen; Tämä sekä parantaa käyttökokemusta että alentaa kustannuksia vähentämällä tarpeetonta tunnuksen luomista. Pitkän vastauksen keskellä käyttäjä on saattanut jo löytää vastauksensa.

Kustannusten, viiveiden ja virheiden hallinta

Cloud LLM sisältää rahakustannukset (maksu per merkki) ja aikakustannukset (latenssi) jokaisen pyynnön yhteydessä. Kolme tieteenalaa ovat välttämättömiä. Cost: limit prompt and response length, do not send unnecessarily long system instructions, default to small and cheap model if possible. Latenssi: käytä suoratoistoa, aseta aikakatkaisu, ilmoita käyttäjälle, jos verkko on hidas. Virhe: verkkokatkos, palvelu saattaa palauttaa 429 (liian monta pyyntöä) tai 500 (palvelinvirhe); käsittele kutakin varovasti, älä kaada sovellusta. Lisäksi LLM antaa joskus merkityksettömiä tai vääriä (hallusinaatioita) vastauksia; Lisää kriittisillä alueilla vastauksen vahvistuskerros.

kolme minilaukkua

Tapaus 1 — Vuotanut avain. Käynnistysyritys upotti OpenAI-avaimen suoraan React Native -sovellukseensa päästäkseen ulos nopeasti. Kolme viikkoa sovelluksen julkaisun jälkeen avain käännettiin ja sitä käytettiin yön aikana 2 400 dollarin arvosta. Tiimin oli peruutettava avain ja määritettävä taustapalvelin. Oppitunti: mukavuussyistä käytetystä pikakuvakkeesta tuli kallein reitti.

Tapaus 2 – Pudotus väheni virtauksen myötä. Koulutussovellus julkaisi ensimmäisen kerran Q&A-ominaisuuden ilman suoratoistoa; käyttäjät poistuivat 6 sekunnin joutokäynnin jälkeen. Kun virta lisättiin, ensimmäinen sana alkoi ilmestyä 0,8 sekunnissa, ja poistumisprosentti putosi 48 prosentista 12 prosenttiin. Sama malli, sama nopeus – vain ero esittelyssä.

Tapaus 3 – Kustannusten hallinta. Yksi sovellus lähetti koko chat-historian mallille jokaisen käyttäjäviestin yhteydessä; Pitkissä keskusteluissa yksi pyyntö saavutti 8 000 merkkiä, mikä nosti kustannuksia. Lähettämällä vain viimeiset viestit ja yhteenvedon, tiimi vähensi pyyntökohtaisia ​​tokeneita 70 prosenttia, mikä pienensi kuukausittaisen laskun kolmannekseen. Oppitunti: mittaa lähettämäsi.

Heikko kehote / Vahva kehote

Heikko kehote: "Lisää sovellukseeni chat, kuten ChatGPT."

Tehokas kehote: "Lisää chat-avustaja iOS/Swift-sovellukseeni. Arkkitehtuuri: sovellus lähettää pyynnön omaan taustajärjestelmääni, LLM API -avain EI OLE ASIAKASSA, se kulkee välityspalvelimen kautta. - Vastaus tulee suoratoistona, näytetään sana sanalta - 'Stop'-painike keskeyttää tuotannon - Käsittele aikakatkaisua, verkkovirheitä ja lyhennä9, 50:0 -2 lyhennetään tilannetta9. lähetä viimeiset 6 viestiä + yhteenveto (kustannushallinta) Selitä ensin arkkitehtuurikaavio ja anna sitten asiakas- ja välityspalvelinkoodi erikseen."

Kopioitavat mallit

Suojatun arkkitehtuurin malli: "Suunnittele pilvi-LLM-integraatio [alusta]-sovellukseeni. Sääntö: API-avain vain taustajärjestelmässä. Asiakas -> välityspalvelin -> LLM. Välityspalvelimessa: todennus, käyttäjäkohtainen nopeusrajoitus, pyyntöjen kirjaaminen. Luettele asiakas- ja välityspalvelimen vastuut erikseen ja vie koodi."

Striimausmalli: "Lisää suoratoistovastaus tähän chat-näyttöön: - Lisää katkelmia viestikuplaan niiden saapuessa - Näytä kohdistin/animaatio kirjoitettaessa - Pysäytä painike - Säilytä tekstin osa ja varoittaa, jos striimin päättyessä tapahtuu virhe [olemassa oleva koodi]"

Kustannusviiveen malli: "Vähennä kustannuksia ja viivettä tässä LLM-integraatiossa:- Kuinka vähennän lähetettyä merkkiä (historian lyhenne, yhteenveto)?- Missä tapauksessa pienempi/halvempi malli riittää?- Ehdota aikakatkaisua ja yritä uudelleen strategiaa[koodi]"

Viansietomalli: "Tee tästä LLM-puhelusta kestävä: - Erillinen käyttäytyminen ilman verkkoa, aikakatkaisu, 429 (nopeusrajoitus), 500 (palvelin) - Ei-tekninen, kohtelias viesti käyttäjälle - Varmistushuomautus hallusinaatioriskin varalta kriittisissä vastauksissa[koodi]"

Yleisiä virheitä

  • API-avaimen upottaminen sovellukseen. Kallein ja yleisin tietoturvavirhe; Avain on ehdottomasti takapäässä.
  • Ei käytä virtausta. Käyttäjän jättäminen odottamaan pitkiä vastauksia ajaa käyttäjän pois.
  • Koko chat-historian lähettäminen jokaisen pyynnön yhteydessä. Se moninkertaistaa tunnuksen hinnan ja viiveen.
  • Virhetilanteiden ohittaminen. Jos 429/500/aikakatkaisua ei käsitellä, sovellus kaatuu tai jumiutuu.
  • LLM-vastauksen pitäminen oikeana ilman kysymystä. Hallusinaatiot ovat todellisia; Lisää vahvistuskerros kriittiselle alueelle.
  • Käyttäjätietojen lähettäminen tarpeettomalle LLM:lle. Kysy, tarvitaanko henkilötietoja vai pitäisikö ne peittää ennen kuin ne siirtyvät pilveen.

Yhteenvetona

Cloud LLM tuo upeita ominaisuuksia, jotka eivät sovi laitteelle mobiiliin, mutta vaativat turvallisuutta ja kustannuskuria. Kultainen sääntö: API-avain ei ole koskaan asiakkaalla, se kulkee taustavälityspalvelimen kautta. Virtaus lisää huomattavasti havaittua nopeutta ja pitoa; Tuettu "stop"-painikkeella. Hinta määräytyy lyhentämällä lähetettyä merkkiä; Joustavuus saavutetaan käsittelemällä kaikki virhetapaukset sulavasti. LLM-vastaukset voivat sisältää hallusinaatioita; Kriittisillä alueilla todentaminen on välttämätöntä ja henkilötiedot tarkistetaan ennen niiden lähettämistä pilveen.

Sovellustehtävä

Pyydä tekoälyltä asiakas- ja taustavälityspalvelinsuunnittelua käyttämällä "Suojatun arkkitehtuurin mallia" "tekstiyhteenveto"- tai "chat"-ominaisuutta varten. Varmista, että API-avain sijaitsee vain luodun suunnittelun taustajärjestelmässä. Poimi sitten vähintään kaksi tapaa pienentää "kustannusviivemallilla" lähetettyä merkkiä ja kirjoita kohtelias viesti, joka näytetään käyttäjälle virhetilanteessa (esim. 429).

tarkistuslista

  • [ ] Vahvistin, että API-avain sijaitsee taustajärjestelmässä eikä asiakkaassa
  • [ ] Lähetin vastauksen ja lisäsin "tauko"-painikkeen
  • [ ] Käsittelin aikakatkaisun, verkkovirheen, 429 ja 500 tilanteet
  • [ ] Pienensin lähetettyä tunnusta menneellä lyhenteellä/yhteenvedolla
  • [ ] Harkitsin LLM-vastauksessa validointia hallusinaatioriskiä vastaan
  • [ ] Tarkistin henkilötietojen välttämättömyyden/peittämisen ennen pilveen siirtymistä