ਲਾਭ:
- ਇੱਕ ਸੁਰੱਖਿਅਤ ਕਲਾਉਡ LLM ਆਰਕੀਟੈਕਚਰ ਸਥਾਪਤ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਜੋ ਕਿ API ਕੁੰਜੀ ਨੂੰ ਕਲਾਇੰਟ 'ਤੇ ਨਹੀਂ ਰੱਖਦਾ ਹੈ ਪਰ ਇੱਕ ਬੈਕ-ਐਂਡ ਪ੍ਰੌਕਸੀ ਦੁਆਰਾ ਜਾਂਦਾ ਹੈ
- ਮਜਬੂਤ ਏਕੀਕਰਣ ਲਿਖਣ ਦੀ ਸਮਰੱਥਾ ਜੋ ਸਟ੍ਰੀਮਿੰਗ ਨਾਲ ਸਮਝੀ ਗਈ ਗਤੀ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ ਅਤੇ ਸਮਾਂ ਸਮਾਪਤੀ, ਨੈਟਵਰਕ ਦੀਆਂ ਗਲਤੀਆਂ ਅਤੇ ਗਤੀ ਸੀਮਾਵਾਂ ਵਰਗੀਆਂ ਸਥਿਤੀਆਂ ਨੂੰ ਨਰਮੀ ਨਾਲ ਸੰਭਾਲਦੀਆਂ ਹਨ
- ਭੇਜੇ ਗਏ ਟੋਕਨ ਨੂੰ ਛੋਟਾ ਕਰਕੇ ਲਾਗਤ ਨੂੰ ਘਟਾਉਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਕਲਾਉਡ 'ਤੇ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਜ਼ਰੂਰਤ ਬਾਰੇ ਸਵਾਲ
ਆਨ-ਡਿਵਾਈਸ AI ਸ਼ਕਤੀਸ਼ਾਲੀ ਪਰ ਸੀਮਤ ਹੈ। ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਸੱਚਮੁੱਚ "ਸਮਾਰਟ ਚੈਟ ਸਹਾਇਕ", ਲੰਬੇ ਟੈਕਸਟ ਸੰਖੇਪ, ਜਾਂ ਇੱਕ ਐਪ ਵਿੱਚ ਗੁੰਝਲਦਾਰ ਰਚਨਾਤਮਕ ਉਤਪਾਦਨ ਸ਼ਾਮਲ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਤੁਹਾਨੂੰ ਅਜਿਹੇ ਮਾਡਲਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਜੋ ਫ਼ੋਨ 'ਤੇ ਫਿੱਟ ਹੋਣ ਲਈ ਬਹੁਤ ਵੱਡੇ ਹੁੰਦੇ ਹਨ। ਇਹ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਕਲਾਉਡ AI ਖੇਡ ਵਿੱਚ ਆਉਂਦਾ ਹੈ: ਤੁਹਾਡੀ ਐਪਲੀਕੇਸ਼ਨ ਇੱਕ API (ਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਗਰਾਮਿੰਗ ਇੰਟਰਫੇਸ - ਮਿਆਰੀ ਇੰਟਰਫੇਸ ਜਿੱਥੇ ਦੋ ਸੌਫਟਵੇਅਰ ਇੱਕ ਦੂਜੇ ਨੂੰ ਡੇਟਾ ਭੇਜਦੇ ਅਤੇ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ) ਰਾਹੀਂ ਇੱਕ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲ (LLM) ਨਾਲ ਜੁੜਦੇ ਹਨ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਾਂਗੇ ਕਿ ਕਲਾਉਡ LLM ਨੂੰ ਇੱਕ ਸੁਰੱਖਿਅਤ, ਤੇਜ਼ ਅਤੇ ਲਾਗਤ-ਸਚੇਤ ਤਰੀਕੇ ਨਾਲ ਇੱਕ ਮੋਬਾਈਲ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਕਿਵੇਂ ਏਕੀਕ੍ਰਿਤ ਕਰਨਾ ਹੈ। ਸੁਰੱਖਿਆ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਜ਼ੋਰ ਦਿੱਤਾ ਜਾਵੇਗਾ: ਇੱਕ ਗਲਤ ਤਰੀਕੇ ਨਾਲ ਸਥਾਪਿਤ LLM ਏਕੀਕਰਣ ਤੁਹਾਡੀ API ਕੁੰਜੀ ਨੂੰ ਲੀਕ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਨਤੀਜੇ ਵਜੋਂ ਹਜ਼ਾਰਾਂ ਪੌਂਡ ਦੇ ਬਿਲ ਹੋ ਸਕਦੇ ਹਨ।
ਆਰਕੀਟੈਕਚਰ ਦਾ ਸੁਨਹਿਰੀ ਨਿਯਮ: ਕਲਾਇੰਟ 'ਤੇ ਕੁੰਜੀ ਰੱਖੋ
ਸਭ ਤੋਂ ਖਤਰਨਾਕ ਗਲਤੀ ਜੋ ਕਲਾਉਡ ਏਆਈ ਏਕੀਕਰਣ ਵਿੱਚ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਉਹ ਹੈ API ਕੁੰਜੀ (ਗੁਪਤ ਪਾਸਵਰਡ ਜੋ ਸੇਵਾ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦਾ ਅਧਿਕਾਰ ਦਿੰਦਾ ਹੈ) ਨੂੰ ਸਿੱਧਾ ਮੋਬਾਈਲ ਐਪਲੀਕੇਸ਼ਨ ਕੋਡ ਵਿੱਚ ਏਮਬੇਡ ਕਰਨਾ ਹੈ। ਮੋਬਾਈਲ ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਉਪਭੋਗਤਾ ਦੇ ਡਿਵਾਈਸ 'ਤੇ ਡਾਊਨਲੋਡ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਕੋਡ ਨੂੰ ਰਿਵਰਸ ਇੰਜੀਨੀਅਰਿੰਗ ਦੁਆਰਾ ਪੜ੍ਹਿਆ ਜਾ ਸਕਦਾ ਹੈ - ਕੰਪਾਇਲ ਕੀਤੀ ਐਪਲੀਕੇਸ਼ਨ ਨੂੰ ਪਾਰਸ ਕਰਕੇ ਅਤੇ ਇਹ ਦੇਖ ਕੇ ਕਿ ਇਸ ਦੇ ਅੰਦਰ ਕੀ ਹੈ। ਜੇਕਰ ਤੁਹਾਡੀ ਕੁੰਜੀ ਐਪ ਦੇ ਅੰਦਰ ਹੈ, ਤਾਂ ਕੋਈ ਇਸਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡੇ ਖਾਤੇ ਤੋਂ ਅਸੀਮਤ ਬੇਨਤੀਆਂ ਕਰ ਸਕਦਾ ਹੈ।
ਸਹੀ ਆਰਕੀਟੈਕਚਰ ਇਹ ਹੈ: ਮੋਬਾਈਲ ਐਪਲੀਕੇਸ਼ਨ ਤੁਹਾਡੇ ਆਪਣੇ ਬੈਕਐਂਡ ਸਰਵਰ (ਪ੍ਰਾਕਸੀ ਸਰਵਰ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਕੰਟਰੋਲ ਕਰਦੇ ਹੋ) ਨੂੰ ਬੇਨਤੀਆਂ ਭੇਜਦਾ ਹੈ; ਕੁੰਜੀ ਸਿਰਫ਼ ਸਰਵਰ 'ਤੇ ਰਹਿੰਦੀ ਹੈ; ਸਰਵਰ LLM ਸੇਵਾ ਵਿੱਚ ਜਾਂਦਾ ਹੈ ਅਤੇ ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਜਵਾਬ ਵਾਪਸ ਕਰਦਾ ਹੈ। ਇਹ ਮਿਡਲਵੇਅਰ ਸਪੀਡ ਕੈਪਿੰਗ, ਦੁਰਵਿਵਹਾਰ ਦੀ ਰੋਕਥਾਮ, ਅਤੇ ਲਾਗਤ ਨਿਯੰਤਰਣ ਵੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
ਪਹੁੰਚ
ਕੁੰਜੀ ਕਿੱਥੇ ਹੈ
ਸੁਰੱਖਿਆ
ਕੁੰਜੀ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਹੈ (ਗਲਤ)
ਗਾਹਕ ਵਿੱਚ, ਜਨਤਕ
ਇਹ ਲੀਕ ਹੁੰਦਾ ਹੈ, ਬਿੱਲ ਫਟਦਾ ਹੈ
ਕੁੰਜੀ ਬੈਕਐਂਡ ਵਿੱਚ ਹੈ (TRUE)
ਸਰਵਰ 'ਤੇ, ਲੁਕਿਆ ਹੋਇਆ ਹੈ
ਸੁਰੱਖਿਅਤ, ਨਿਯੰਤਰਣਯੋਗ
ਸਾਵਧਾਨ: ਜਦੋਂ ਤੁਸੀਂ ਕਲਾਉਡ LLM ਏਕੀਕਰਣ ਲਈ AI ਨੂੰ ਪੁੱਛਦੇ ਹੋ, ਤਾਂ ਇਹ ਇੱਕ ਉਦਾਹਰਣ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਤੁਹਾਡੀ ਸਹੂਲਤ ਲਈ ਐਪਲੀਕੇਸ਼ਨ ਕੋਡ ਵਿੱਚ ਸਿੱਧਾ ਕੁੰਜੀ ਲਿਖਦਾ ਹੈ। ਇਸ ਨੂੰ ਕਦੇ ਵੀ ਲਾਈਵ ਨਾ ਲਓ। ਪ੍ਰੋਂਪਟ ਵਿੱਚ "ਏਪੀਆਈ ਕੁੰਜੀ ਕਲਾਇੰਟ 'ਤੇ ਨਹੀਂ ਹੋਣੀ ਚਾਹੀਦੀ, ਬੈਕਐਂਡ ਪ੍ਰੌਕਸੀ ਰਾਹੀਂ ਜਾਓ" ਵਾਕ ਸ਼ਾਮਲ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ।
Streaming: increasing the perceived speed
LLM ਜਵਾਬ ਲੰਬੇ ਹੋ ਸਕਦੇ ਹਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਤਿਆਰ ਕਰਨ ਵਿੱਚ ਸਕਿੰਟ ਲੱਗ ਸਕਦੇ ਹਨ। Leaving the user waiting on a blank screen is a bad experience. The solution is streaming — displaying the answer word by word, as it is generated. The user monitors the spelling of the text, as in ChatGPT; ਇਹ ਨਾਟਕੀ ਤੌਰ 'ਤੇ ਸਮਝੀ ਗਈ ਗਤੀ ਅਤੇ ਰਵਾਨਗੀ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ। ਮੋਬਾਈਲ 'ਤੇ ਵਹਾਅ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਸਰਵਰ ਤੋਂ ਇੰਟਰਫੇਸ ਵਿੱਚ ਟੁਕੜੇ (ਟੋਕਨ - ਮਾਡਲ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਟੈਕਸਟ ਦਾ ਟੁਕੜਾ) ਸ਼ਾਮਲ ਕਰਨਾ ਜਿਵੇਂ ਉਹ ਆਉਂਦੇ ਹਨ। AI ਨਾਲ ਏਕੀਕਰਣ ਪ੍ਰਿੰਟ ਕਰਦੇ ਸਮੇਂ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਪ੍ਰਵਾਹ ਦੀ ਬੇਨਤੀ ਕਰੋ।
ਸੁਝਾਅ: ਸਟ੍ਰੀਮਿੰਗ ਜਵਾਬ ਵਿੱਚ ਇੱਕ "ਰੋਕੋ" ਬਟਨ ਸ਼ਾਮਲ ਕਰੋ। The user should be able to stop production when he gets the answer he wants; This both improves the experience and reduces cost by cutting unnecessary token generation. ਲੰਬੇ ਜਵਾਬ ਦੇ ਮੱਧ ਵਿੱਚ, ਉਪਭੋਗਤਾ ਨੂੰ ਪਹਿਲਾਂ ਹੀ ਉਹਨਾਂ ਦਾ ਜਵਾਬ ਮਿਲ ਗਿਆ ਹੋ ਸਕਦਾ ਹੈ.
Cost, delay and error management
Cloud LLM carries money cost (fee per token) and time cost (latency) with each request. Three disciplines are essential. Cost: limit prompt and response length, do not send unnecessarily long system instructions, default to small and cheap model if possible. Latency: use streaming, set timeout, notify user if network is slow. ਗਲਤੀ: ਨੈੱਟਵਰਕ ਆਊਟੇਜ, ਸੇਵਾ 429 (ਬਹੁਤ ਜ਼ਿਆਦਾ ਬੇਨਤੀਆਂ) ਜਾਂ 500 (ਸਰਵਰ ਗਲਤੀ) ਵਾਪਸ ਕਰ ਸਕਦੀ ਹੈ; handle each one gently, don't crash the app. Also, LLM sometimes gives meaningless or incorrect (hallucination) answers; ਨਾਜ਼ੁਕ ਖੇਤਰਾਂ ਵਿੱਚ ਜਵਾਬ ਦੀ ਤਸਦੀਕ ਦੀ ਇੱਕ ਪਰਤ ਜੋੜੋ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਲੀਕ ਹੋਈ ਕੁੰਜੀ। A startup embedded the OpenAI key directly into its React Native app to get out fast. Three weeks after the app was released, the key was reverse engineered and $2,400 worth of usage was made overnight. The team had to revoke the key and set up a backend proxy. ਸਬਕ: ਸਹੂਲਤ ਲਈ ਲਿਆ ਗਿਆ ਸ਼ਾਰਟਕੱਟ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਰਸਤਾ ਬਣ ਗਿਆ।
Case 2 — Dropout decreased with flow. An education app first released its Q&A feature without streaming; users were exiting after 6 seconds of idle waiting. ਜਦੋਂ ਵਹਾਅ ਜੋੜਿਆ ਗਿਆ, ਤਾਂ ਪਹਿਲਾ ਸ਼ਬਦ 0.8 ਸਕਿੰਟਾਂ ਵਿੱਚ ਦਿਖਾਈ ਦੇਣਾ ਸ਼ੁਰੂ ਹੋ ਗਿਆ, ਅਤੇ ਛੱਡਣ ਦੀ ਦਰ 48% ਤੋਂ ਘਟ ਕੇ 12% ਹੋ ਗਈ। ਉਹੀ ਮਾਡਲ, ਉਹੀ ਗਤੀ — ਸਿਰਫ਼ ਪੇਸ਼ਕਾਰੀ ਵਿੱਚ ਇੱਕ ਅੰਤਰ।
ਕੇਸ 3 - ਲਾਗਤ ਨਿਯੰਤਰਣ। One app was sending the entire chat history to the model with every user message; ਲੰਮੀ ਗੱਲਬਾਤ ਵਿੱਚ, ਇੱਕ ਸਿੰਗਲ ਬੇਨਤੀ 8,000 ਟੋਕਨਾਂ ਤੱਕ ਪਹੁੰਚ ਗਈ, ਲਾਗਤ ਨੂੰ ਵਧਾਉਂਦੇ ਹੋਏ। By sending just the last few messages and a summary, the team reduced tokens per request by 70%, reducing the monthly bill to a third. Lesson: measure what you send.
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ: "ਮੇਰੀ ਐਪ ਵਿੱਚ ਚੈਟਜੀਪੀਟੀ ਵਰਗੀ ਇੱਕ ਚੈਟ ਸ਼ਾਮਲ ਕਰੋ।"
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰੋਂਪਟ: "ਮੇਰੀ iOS/ਸਵਿਫਟ ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਇੱਕ ਚੈਟ ਸਹਾਇਕ ਸ਼ਾਮਲ ਕਰੋ। ਆਰਕੀਟੈਕਚਰ: ਐਪਲੀਕੇਸ਼ਨ ਮੇਰੇ ਆਪਣੇ ਬੈਕਐਂਡ ਨੂੰ ਇੱਕ ਬੇਨਤੀ ਭੇਜਦੀ ਹੈ, LLM API ਕੁੰਜੀ ਕਲਾਇੰਟ 'ਤੇ ਨਹੀਂ ਹੈ, ਇਹ ਪ੍ਰੌਕਸੀ ਦੁਆਰਾ ਜਾਂਦੀ ਹੈ। - ਜਵਾਬ ਸਟ੍ਰੀਮਿੰਗ ਆਉਂਦਾ ਹੈ, ਸ਼ਬਦ ਦੁਆਰਾ ਪ੍ਰਦਰਸ਼ਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ - 'ਸਟਾਪ' ਬਟਨ ਉਤਪਾਦਨ ਵਿੱਚ ਵਿਘਨ ਪਾਉਂਦਾ ਹੈ - ਹੈਂਡਲ ਟਾਈਮਆਉਟ ਅਤੇ ਨੈੱਟਵਰਕ 50 ਸਥਿਤੀ, ਗਲਤੀ ਨਾਲ ਹੈਂਡਲ ਕਰੋ gr50,50 ਸਥਿਤੀ ਚੈਟ ਇਤਿਹਾਸ ਨੂੰ ਛੋਟਾ ਕਰੋ: ਆਖਰੀ 6 ਸੁਨੇਹੇ ਭੇਜੋ + ਸਾਰਾਂਸ਼ (ਲਾਗਤ ਨਿਯੰਤਰਣ) ਪਹਿਲਾਂ ਆਰਕੀਟੈਕਚਰਲ ਡਾਇਗ੍ਰਾਮ ਦੀ ਵਿਆਖਿਆ ਕਰੋ, ਫਿਰ ਕਲਾਇੰਟ ਅਤੇ ਪ੍ਰੌਕਸੀ ਕੋਡ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਦਿਓ।"
ਨਕਲ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟਸ
ਸੁਰੱਖਿਅਤ ਆਰਕੀਟੈਕਚਰ ਟੈਂਪਲੇਟ: "ਮੇਰੀ [ਪਲੇਟਫਾਰਮ] ਐਪਲੀਕੇਸ਼ਨ ਵਿੱਚ ਕਲਾਉਡ LLM ਏਕੀਕਰਣ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰੋ। ਨਿਯਮ: API ਕੁੰਜੀ ਕੇਵਲ ਬੈਕਐਂਡ ਵਿੱਚ। ਕਲਾਇੰਟ -> ਮੇਰੀ ਪ੍ਰੌਕਸੀ -> LLM। ਪ੍ਰੌਕਸੀ ਵਿੱਚ: ਪ੍ਰਮਾਣੀਕਰਨ, ਪ੍ਰਤੀ-ਉਪਭੋਗਤਾ ਦਰ ਸੀਮਾ, ਬੇਨਤੀ ਲੌਗਿੰਗ। ਸੂਚੀਬੱਧ ਕਲਾਇੰਟ ਅਤੇ ਪ੍ਰੌਕਸੀ ਜ਼ਿੰਮੇਵਾਰੀਆਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ, ਫਿਰ ਕੋਡ ਨੂੰ ਨਿਰਯਾਤ ਕਰੋ।"
ਸਟ੍ਰੀਮਿੰਗ ਟੈਮਪਲੇਟ: "ਇਸ ਚੈਟ ਸਕ੍ਰੀਨ 'ਤੇ ਇੱਕ ਸਟ੍ਰੀਮਿੰਗ ਜਵਾਬ ਸ਼ਾਮਲ ਕਰੋ:- ਸੰਦੇਸ਼ ਦੇ ਬੁਲਬੁਲੇ ਵਿੱਚ ਸਨਿੱਪਟ ਸ਼ਾਮਲ ਕਰੋ ਜਿਵੇਂ ਹੀ ਉਹ ਆਉਂਦੇ ਹਨ- ਟਾਈਪ ਕਰਦੇ ਸਮੇਂ ਇੱਕ ਕਰਸਰ/ਐਨੀਮੇਸ਼ਨ ਦਿਖਾਓ- 'ਸਟਾਪ' ਬਟਨ ਲਗਾਓ ਸਟ੍ਰੀਮ ਨੂੰ ਰੱਦ ਕਰੋ- ਅੰਸ਼ਕ ਟੈਕਸਟ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖੋ ਅਤੇ ਚੇਤਾਵਨੀ ਦਿਓ ਕਿ ਸਟ੍ਰੀਮ ਦੇ ਖਤਮ ਹੋਣ ਦੌਰਾਨ ਕੋਈ ਗਲਤੀ ਹੈ [ਮੌਜੂਦਾ ਕੋਡ]"
ਲਾਗਤ-ਲੇਟੈਂਸੀ ਟੈਂਪਲੇਟ: "ਇਸ LLM ਏਕੀਕਰਣ ਵਿੱਚ ਲਾਗਤ ਅਤੇ ਲੇਟੈਂਸੀ ਨੂੰ ਘਟਾਓ:- ਮੈਂ ਭੇਜੇ ਗਏ ਟੋਕਨ ਨੂੰ ਕਿਵੇਂ ਘਟਾਵਾਂ (ਇਤਿਹਾਸ ਦਾ ਸੰਖੇਪ, ਸੰਖੇਪ)? - ਕਿਸ ਸਥਿਤੀ ਵਿੱਚ ਛੋਟਾ/ਸਸਤਾ ਮਾਡਲ ਕਾਫ਼ੀ ਹੈ? - ਸਮਾਂ ਸਮਾਪਤ ਅਤੇ ਰਣਨੀਤੀ [ਕੋਡ] ਨੂੰ ਮੁੜ ਕੋਸ਼ਿਸ਼ ਕਰਨ ਦਾ ਸੁਝਾਅ ਦਿਓ"
ਨੁਕਸ ਸਹਿਣਸ਼ੀਲਤਾ ਟੈਮਪਲੇਟ: "ਇਸ LLM ਕਾਲ ਨੂੰ ਲਚਕੀਲਾ ਬਣਾਓ: - ਬਿਨਾਂ ਨੈੱਟਵਰਕ, ਸਮਾਂ ਸਮਾਪਤੀ, 429 (ਦਰ ਦੀ ਸੀਮਾ), 500 (ਸਰਵਰ) ਲਈ ਵੱਖਰਾ ਵਿਵਹਾਰ - ਉਪਭੋਗਤਾ ਨੂੰ ਗੈਰ-ਤਕਨੀਕੀ, ਨਿਮਰਤਾ ਵਾਲਾ ਸੁਨੇਹਾ- ਨਾਜ਼ੁਕ ਜਵਾਬਾਂ ਵਿੱਚ ਭੁਲੇਖੇ ਦੇ ਜੋਖਮ ਦੇ ਵਿਰੁੱਧ ਤਸਦੀਕ ਨੋਟ [ਕੋਡ]"
ਆਮ ਗਲਤੀਆਂ
- Embedding the API key into the application. The most expensive and common security bug; The key definitely lies at the back end.
- ਵਹਾਅ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕਰ ਰਿਹਾ। ਲੰਬੇ ਜਵਾਬਾਂ ਦੀ ਉਡੀਕ ਕਰਨ ਵਾਲੇ ਉਪਭੋਗਤਾ ਨੂੰ ਛੱਡਣ ਨਾਲ ਉਪਭੋਗਤਾ ਦੂਰ ਹੋ ਜਾਵੇਗਾ।
- ਹਰ ਬੇਨਤੀ ਦੇ ਨਾਲ ਪੂਰਾ ਚੈਟ ਇਤਿਹਾਸ ਭੇਜਿਆ ਜਾ ਰਿਹਾ ਹੈ। It multiplies token cost and latency.
- Bypassing error conditions. If 429/500/timeout is not addressed the application will crash or freeze.
- ਬਿਨਾਂ ਸਵਾਲ ਦੇ LLM ਜਵਾਬ ਨੂੰ ਸਹੀ ਮੰਨਦੇ ਹੋਏ। ਭਰਮ ਅਸਲੀ ਹੈ; Add verification layer in critical area.
- Sending user data to unnecessary LLM. ਪੁੱਛੋ ਕਿ ਕੀ ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਲੋੜ ਹੈ ਜਾਂ ਇਸ ਨੂੰ ਕਲਾਉਡ 'ਤੇ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਮਾਸਕ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਕਲਾਉਡ LLM ਬਹੁਤ ਵਧੀਆ ਸਮਰੱਥਾਵਾਂ ਲਿਆਉਂਦਾ ਹੈ ਜੋ ਮੋਬਾਈਲ ਲਈ ਡਿਵਾਈਸ 'ਤੇ ਫਿੱਟ ਨਹੀਂ ਹੁੰਦੀਆਂ, ਪਰ ਸੁਰੱਖਿਆ ਅਤੇ ਲਾਗਤ ਅਨੁਸ਼ਾਸਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਸੁਨਹਿਰੀ ਨਿਯਮ: API ਕੁੰਜੀ ਕਦੇ ਵੀ ਕਲਾਇੰਟ 'ਤੇ ਨਹੀਂ ਹੁੰਦੀ, ਇਹ ਬੈਕਐਂਡ ਪ੍ਰੌਕਸੀ ਰਾਹੀਂ ਜਾਂਦੀ ਹੈ। ਵਹਾਅ ਸਮਝੀ ਗਤੀ ਅਤੇ ਧਾਰਨ ਨੂੰ ਬਹੁਤ ਵਧਾਉਂਦਾ ਹੈ; Supported by "stop" button. ਭੇਜੇ ਗਏ ਟੋਕਨ ਨੂੰ ਛੋਟਾ ਕਰਕੇ ਲਾਗਤ ਨਿਰਧਾਰਤ ਕੀਤੀ ਜਾਂਦੀ ਹੈ; ਲਚਕੀਲਾਪਣ ਸਾਰੇ ਤਰੁੱਟੀ ਮਾਮਲਿਆਂ ਨੂੰ ਖੂਬਸੂਰਤੀ ਨਾਲ ਸੰਭਾਲਣ ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। LLM answers may include hallucinations; In critical areas, verification is essential and personal data is reviewed before sending it to the cloud.
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
"ਟੈਕਸਟ ਸੰਖੇਪ" ਜਾਂ "ਚੈਟ" ਵਿਸ਼ੇਸ਼ਤਾ ਲਈ "ਸੁਰੱਖਿਅਤ ਆਰਕੀਟੈਕਚਰ ਟੈਂਪਲੇਟ" ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ AI ਤੋਂ ਇੱਕ ਕਲਾਇੰਟ + ਬੈਕਐਂਡ ਪ੍ਰੌਕਸੀ ਡਿਜ਼ਾਈਨ ਦੀ ਬੇਨਤੀ ਕਰੋ। ਤਸਦੀਕ ਕਰੋ ਕਿ API ਕੁੰਜੀ ਸਿਰਫ ਤਿਆਰ ਕੀਤੇ ਡਿਜ਼ਾਈਨ ਵਿੱਚ ਬੈਕਐਂਡ ਵਿੱਚ ਰਹਿੰਦੀ ਹੈ। ਫਿਰ "ਕੀਮਤ-ਦੇਰੀ ਪੈਟਰਨ" ਦੇ ਨਾਲ ਭੇਜੇ ਗਏ ਟੋਕਨ ਨੂੰ ਘਟਾਉਣ ਦੇ ਘੱਟੋ-ਘੱਟ ਦੋ ਤਰੀਕੇ ਕੱਢੋ ਅਤੇ ਇੱਕ ਗਲਤੀ ਸਥਿਤੀ (ਉਦਾਹਰਨ ਲਈ 429) ਲਈ ਉਪਭੋਗਤਾ ਨੂੰ ਪ੍ਰਦਰਸ਼ਿਤ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਸੁਨੇਹੇ ਨੂੰ ਲਿਖੋ।
ਚੈੱਕਲਿਸਟ
- [ ] I verified that the API key resides in the backend and not on the client
- [ ] I made the response streaming and added a 'pause' button
- [ ] ਮੈਂ ਸਮਾਂ ਸਮਾਪਤੀ, ਨੈੱਟਵਰਕ ਗਲਤੀ, 429 ਅਤੇ 500 ਸਥਿਤੀਆਂ ਨੂੰ ਸੰਭਾਲਿਆ ਹੈ
- [ ] ਮੈਂ ਸਪੁਰਦ ਕੀਤੇ ਟੋਕਨ ਨੂੰ ਪਿਛਲੇ ਸੰਖੇਪ/ਸਾਰਾਂਸ਼ ਨਾਲ ਘਟਾ ਦਿੱਤਾ ਹੈ
- [ ] ਮੈਂ LLM ਜਵਾਬ ਵਿੱਚ ਭੁਲੇਖੇ ਦੇ ਜੋਖਮ ਦੇ ਵਿਰੁੱਧ ਪ੍ਰਮਾਣਿਕਤਾ 'ਤੇ ਵਿਚਾਰ ਕੀਤਾ
- [ ] ਮੈਂ ਕਲਾਉਡ 'ਤੇ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਲੋੜ/ਮਾਸਕਿੰਗ ਦੀ ਜਾਂਚ ਕੀਤੀ