Keuntungan:
- Kemampuan untuk membangun arsitektur cloud LLM yang aman yang tidak menyimpan kunci API pada klien tetapi melewati proxy back-end
- Kemampuan untuk menulis integrasi yang kuat yang meningkatkan kecepatan yang dirasakan dengan streaming dan menangani situasi seperti batas waktu, kesalahan jaringan, dan batas kecepatan dengan lembut
- Kemampuan untuk mengurangi biaya dengan memperpendek token yang dikirim dan mempertanyakan kebutuhan data pribadi sebelum dipindahkan ke cloud
AI pada perangkat sangat kuat namun terbatas. Saat Anda ingin menambahkan “asisten obrolan cerdas”, peringkasan teks yang panjang, atau produksi kreatif yang rumit ke suatu aplikasi, Anda memerlukan model yang terlalu besar untuk muat di ponsel. Di sinilah cloud AI berperan: aplikasi Anda terhubung ke model bahasa besar (LLM) melalui API (Application Programming Interface – antarmuka standar tempat dua perangkat lunak saling mengirim dan menerima data). Dalam unit ini kita akan mempelajari cara mengintegrasikan cloud LLM ke dalam aplikasi seluler dengan cara yang aman, cepat, dan hemat biaya. Penekanan penting adalah pada keamanan: integrasi LLM yang tidak dipasang dengan benar dapat membocorkan kunci API Anda dan mengakibatkan tagihan senilai ribuan pound.
Aturan emas arsitektur: simpan kuncinya pada klien
Kesalahan paling berbahaya yang dapat dilakukan dalam integrasi cloud AI adalah menyematkan kunci API (kata sandi rahasia yang mengizinkan penggunaan layanan) langsung ke dalam kode aplikasi seluler. Aplikasi seluler diunduh ke perangkat pengguna dan kodenya dapat dibaca dengan rekayasa balik — menguraikan aplikasi yang dikompilasi dan melihat apa yang ada di dalamnya. Jika kunci Anda ada di dalam aplikasi, seseorang dapat mengekstraknya dan membuat permintaan tak terbatas dari akun Anda.
Arsitektur yang benar adalah ini: aplikasi seluler mengirimkan permintaan ke server backend Anda sendiri (server proxy yang Anda kendalikan); Kuncinya hanya ada di server; Server pergi ke layanan LLM dan mengembalikan respons ke aplikasi. Middleware ini juga menyediakan pembatasan kecepatan, pencegahan penyalahgunaan, dan pengendalian biaya.
Pendekatan
dimana kuncinya
Keamanan
Kuncinya ada di aplikasi (SALAH)
Di klien, publik
Bocor, tagihannya meledak
Kuncinya ada di backend (BENAR)
Di server, tersembunyi
Aman, terkendali
Perhatian: Saat Anda meminta AI untuk integrasi cloud LLM, AI mungkin akan menghasilkan contoh yang menulis kunci langsung ke dalam kode aplikasi demi kenyamanan Anda. Jangan pernah menyiarkan ini secara langsung. Pastikan untuk menyertakan kalimat "Kunci API tidak boleh ada di klien, gunakan proxy backend" di prompt.
Streaming: meningkatkan kecepatan yang dirasakan
Jawaban LLM bisa panjang dan membutuhkan waktu beberapa detik untuk dihasilkan secara keseluruhan. Membiarkan pengguna menunggu di layar kosong adalah pengalaman buruk. Solusinya adalah streaming — menampilkan jawaban kata demi kata, saat dihasilkan. Pengguna memantau ejaan teks, seperti di ChatGPT; ini secara dramatis meningkatkan kecepatan dan kelancaran yang dirasakan. Aliran di seluler berarti menambahkan potongan (token — potongan teks yang dihasilkan oleh model) dari server ke antarmuka saat potongan tersebut tiba. Minta alur secara eksplisit saat mencetak integrasi ke AI.
Tip: Tambahkan tombol "jeda" di respons streaming. Pengguna harus dapat menghentikan produksi ketika dia mendapatkan jawaban yang diinginkannya; Hal ini meningkatkan pengalaman dan mengurangi biaya dengan memotong pembuatan token yang tidak diperlukan. Di tengah jawaban yang panjang, pengguna mungkin sudah menemukan jawabannya.
Manajemen biaya, penundaan dan kesalahan
Cloud LLM membawa biaya uang (biaya per token) dan biaya waktu (latensi) dengan setiap permintaan. Ada tiga disiplin ilmu yang penting. Cost: limit prompt and response length, do not send unnecessarily long system instructions, default to small and cheap model if possible. Latensi: gunakan streaming, setel batas waktu, beri tahu pengguna jika jaringan lambat. Kesalahan: pemadaman jaringan, layanan mungkin mengembalikan 429 (terlalu banyak permintaan) atau 500 (kesalahan server); tangani masing-masing dengan lembut, jangan merusak aplikasi. Selain itu, LLM terkadang memberikan jawaban (halusinasi) yang tidak berarti atau salah; Tambahkan lapisan verifikasi jawaban di area kritis.
tiga kasus mini
Kasus 1 — Kunci bocor. Sebuah startup menyematkan kunci OpenAI langsung ke dalam aplikasi React Native untuk keluar dengan cepat. Tiga minggu setelah aplikasi dirilis, kuncinya direkayasa ulang dan penggunaan senilai $2.400 dilakukan dalam semalam. Tim harus mencabut kunci dan menyiapkan proxy backend. Hikmahnya: jalan pintas yang diambil demi kenyamanan menjadi rute termahal.
Kasus 2 — Putus sekolah menurun seiring aliran. Sebuah aplikasi pendidikan pertama kali merilis fitur Tanya Jawab tanpa streaming; pengguna keluar setelah 6 detik menunggu menganggur. Saat aliran ditambahkan, kata pertama mulai muncul dalam 0,8 detik, dan tingkat pengabaian turun dari 48% menjadi 12%. Model sama, kecepatan sama — hanya perbedaan presentasinya.
Kasus 3 — Pengendalian biaya. Satu aplikasi mengirimkan seluruh riwayat obrolan ke model dengan setiap pesan pengguna; Dalam percakapan yang panjang, satu permintaan mencapai 8.000 token, sehingga meningkatkan biayanya. Dengan hanya mengirimkan beberapa pesan terakhir dan ringkasan, tim mengurangi token per permintaan sebesar 70%, sehingga mengurangi tagihan bulanan hingga sepertiganya. Pelajaran: ukur apa yang Anda kirim.
Perintah lemah / Perintah kuat
Perintah lemah: "Tambahkan obrolan seperti ChatGPT ke aplikasi saya."
Perintah yang kuat: "Tambahkan asisten obrolan ke aplikasi iOS/Swift saya. Arsitektur: aplikasi mengirimkan permintaan ke backend saya sendiri, kunci API LLM TIDAK ada di KLIEN, ia melewati proksi. - Responsnya datang secara streaming, ditampilkan kata demi kata - Tombol 'Stop' mengganggu produksi - Tangani waktu habis, kesalahan jaringan, situasi 429 dan 500 dengan baik - Persingkat riwayat obrolan: kirim 6 pesan terakhir + ringkasan (pengendalian biaya)Jelaskan diagram arsitekturnya terlebih dahulu, lalu berikan klien dan kode proxy secara terpisah."
Templat yang dapat disalin
Templat arsitektur aman: "Rancang integrasi cloud LLM ke dalam aplikasi [platform] saya. Aturan: Kunci API hanya di backend. Klien -> proksi saya -> LLM. Di proksi: autentikasi, batas tarif per pengguna, pencatatan permintaan. Cantumkan tanggung jawab klien dan proksi secara terpisah, lalu ekspor kodenya."
Templat streaming: "Tambahkan respons streaming ke layar obrolan ini:- Tambahkan cuplikan ke gelembung pesan saat cuplikan tiba- Tampilkan kursor/animasi saat mengetik- Minta tombol 'Berhenti' untuk membatalkan streaming- Pertahankan sebagian teks dan peringatkan jika ada kesalahan saat streaming berakhir[kode yang ada]"
Templat latensi biaya:"Kurangi biaya dan latensi dalam integrasi LLM ini:- Bagaimana cara mengurangi token yang dikirim (singkatan riwayat, ringkasan)?- Dalam hal apa model yang lebih kecil/murah sudah cukup?- Sarankan batas waktu dan coba lagi strategi[kode]"
Templat toleransi kesalahan: "Jadikan panggilan LLM ini tangguh: - Perilaku terpisah tanpa jaringan, batas waktu, 429 (batas kecepatan), 500 (server) - Pesan non-teknis dan sopan kepada pengguna - Catatan verifikasi terhadap risiko halusinasi dalam balasan kritis[kode]"
Kesalahan umum
- Menyematkan kunci API ke dalam aplikasi. Bug keamanan paling mahal dan umum; Kuncinya pasti terletak di bagian belakang.
- Tidak menggunakan aliran. Membiarkan pengguna menunggu jawaban yang panjang akan membuat pengguna menjauh.
- Mengirim seluruh riwayat obrolan dengan setiap permintaan. Ini melipatgandakan biaya token dan latensi.
- Melewati kondisi kesalahan. Jika 429/500/timeout tidak diatasi, aplikasi akan crash atau macet.
- Mengingat jawaban LLM benar tanpa pertanyaan. Halusinasi itu nyata; Tambahkan lapisan verifikasi di area kritis.
- Mengirim data pengguna ke LLM yang tidak perlu. Tanyakan apakah data pribadi diperlukan atau harus disembunyikan sebelum disimpan di cloud.
Singkatnya
Cloud LLM menghadirkan kemampuan luar biasa yang tidak dapat ditampung pada perangkat seluler, namun memerlukan keamanan dan disiplin biaya. Aturan utama: Kunci API tidak pernah ada di klien, melainkan melewati proxy backend. Aliran sangat meningkatkan kecepatan dan retensi yang dirasakan; Didukung oleh tombol "berhenti". Biaya ditentukan dengan memperpendek token yang dikirim; Ketahanan dicapai dengan menangani semua kasus kesalahan dengan baik. Jawaban LLM mungkin termasuk halusinasi; Di area kritis, verifikasi sangat penting dan data pribadi ditinjau sebelum dikirim ke cloud.
Tugas aplikasi
Minta desain proxy klien + backend dari AI menggunakan “Template arsitektur aman” untuk fitur “peringkasan teks” atau “obrolan”. Verifikasi bahwa kunci API hanya berada di backend dalam desain yang dihasilkan. Kemudian ekstrak setidaknya dua cara untuk mengurangi token yang dikirim dengan "Pola penundaan biaya" dan tulis pesan sopan untuk ditampilkan kepada pengguna jika terjadi kondisi kesalahan (misalnya 429).
daftar periksa
- [] Saya memverifikasi bahwa kunci API berada di backend dan bukan di klien
- [ ] Saya membuat respons streaming dan menambahkan tombol 'jeda'
- [] Saya menangani batas waktu, kesalahan jaringan, situasi 429 dan 500
- [ ] Saya mengurangi token yang dikirimkan dengan singkatan/ringkasan sebelumnya
- [ ] Saya mempertimbangkan validasi terhadap risiko halusinasi dalam jawaban LLM
- [ ] Saya memeriksa kebutuhan/penyembunyian data pribadi sebelum beralih ke cloud