লাভ:
- টোকেন ধারণা, ইনপুট/আউটপুট টোকেন পার্থক্য এবং টোকেনাইজেশন ব্যাখ্যা কর।
- টোকেন সংখ্যা এবং ইউনিট মূল্য থেকে একটি অনুরোধের খরচ এবং একটি মাসিক কাজের চাপ গণনা করতে পারে
- মডেল নির্বাচনের প্রভাব এবং খরচের উপর প্রম্পট দৈর্ঘ্য তুলনা করতে পারে
আপনি LLM API এর অর্থনীতি না বুঝে স্কেলে একটি সমাধান তৈরি করতে পারবেন না। একটি ডেমো একবার চলে; মূল জিনিসটি প্রতি মাসে হাজার হাজার কল করা হলে বিলটি কী হবে তা অনুমান করতে সক্ষম হওয়া। এই ইউনিটে আমরা জিনিসগুলির অর্থের দিক সেট আপ করি: একটি টোকেন কী, কেন ইনপুট এবং আউটপুট আলাদাভাবে মূল্য নির্ধারণ করা হয়, কীভাবে একটি অনুরোধের খরচ গণনা করা যায় এবং কীভাবে একটি মাসিক কাজের চাপের বাজেট করা যায়। এই তথ্য আপনাকে পরবর্তী ইউনিটগুলিতে অপ্টিমাইজেশান কৌশল (ক্যাশিং, মডেল নির্বাচন, ব্যাচ) এর রিটার্ন পরিমাপ করতে দেয়।
টোকেন কি?
টোকেন হল ক্ষুদ্রতম একক যেখানে মডেল পাঠ্য প্রক্রিয়া করে। একটি শব্দ সবসময় একটি টোকেন নয়; টোকেন সাধারণত একটি শব্দের একটি অংশ। মোটামুটিভাবে বলতে গেলে, ইংরেজিতে, 1 টোকেন হল ≈ 4 অক্ষর ≈ 0.75 শব্দ। তুর্কি এবং কোডে, অনুপাত পরিবর্তিত হয়: তুর্কি শব্দগুলি প্রায়শই এর প্রত্যয় গঠন এবং বর্ণমালার কারণে ইংরেজির চেয়ে বেশি টোকেনে বিভক্ত হয়। অতএব, চোখের দ্বারা অনুমান করার পরিবর্তে প্রদানকারীর টোকেন গণনা সরঞ্জাম দিয়ে টোকেনের সংখ্যা পরিমাপ করা প্রয়োজন।
টোকেনাইজেশন (টোকেনে পাঠ্য বিভক্ত করার প্রক্রিয়া) প্রতিটি মডেলের জন্য আলাদা হতে পারে। এর দুটি ব্যবহারিক ফলাফল রয়েছে: (1) একই পাঠ্য বিভিন্ন মডেলে বিভিন্ন সংখ্যক টোকেন প্রদান করতে পারে; (2) অন্যান্য প্রদানকারীর (যেমন, OpenAI এর tiktoken লাইব্রেরি) থেকে টোকেনাইজার দিয়ে করা ভবিষ্যদ্বাণীগুলি Claude-এর জন্য ভুল হবে — আপনি যে মডেলটি ব্যবহার করছেন তার জন্য টোকেন গণনা টিপ ব্যবহার করুন।
ইঙ্গিত: "কতটি টোকেন সম্পর্কে?" অন্ধভাবে প্রশ্নের উত্তর দেবেন না। টোকেন গণনা API এর মাধ্যমে একটি প্রতিনিধি পাঠ্য পাস করুন; পরিমাপের উপর ভিত্তি বাজেটের সিদ্ধান্ত।
ইনপুট এবং আউটপুট টোকেন
চালান দুটি আইটেম নিয়ে গঠিত:
- ইনপুট টোকেন: আপনি মডেলে যা কিছু পাঠান — সিস্টেম প্রম্পট, অতীত ট্যুর, ব্যবহারকারীর বার্তা, ডকুমেন্টেশন যদি থাকে। এই সব একবারে প্রক্রিয়া করা হয়.
- আউটপুট টোকেন: মডেল দ্বারা উত্পাদিত প্রতিক্রিয়া. প্রতিটি আউটপুট টোকেনের জন্য, মডেল ধাপে ধাপে গণনা করে।
বেশিরভাগ প্রদানকারীর সাথে, আউটপুট ইনপুট থেকে কয়েকগুণ বেশি ব্যয়বহুল। কারণটি সহজ: একবারে ইনপুট পড়া আউটপুট টোকেন-বাই-টোকেন তৈরি করার চেয়ে সস্তা। এই অসাম্যতা জানা ব্যাখ্যা করে কেন "সংক্ষিপ্ত উত্তরের প্রয়োজন" এর মতো অপ্টিমাইজেশনগুলি এত কার্যকর।
নমুনা মূল্য (প্রতি 1 মিলিয়ন টোকেন, USD)
নীচের টেবিলটি একটি রেফারেন্স; সময়ের সাথে সাথে দাম পরিবর্তন হতে পারে, অনুগ্রহ করে আপনার নিজের প্রদানকারীর বর্তমান তালিকা নিশ্চিত করুন।
মডেল ক্লাস
নমুনা মডেল
ইনপুট ($/1M)
আউটপুট ($/1M)
সাধারণ ব্যবহার
দ্রুত/সস্তা
হাইকু 4.5
1.00
5.00
শ্রেণীবিভাগ, লেবেলিং, সহজ সারাংশ
সুষম
সনেট 5
3.00
15.00
সাধারণ উদ্দেশ্য, কোডিং, এজেন্টের কাজ
শক্তিশালী
ওপাস 4.8
5.00
২৫.০০
জটিল যুক্তি, দীর্ঘ পরিসরের কাজ
প্রতিটি ক্লাসে, আউটপুট ইনপুটের 5 গুণ; তাছাড়া শক্তিশালী মডেলের ইনপুটও সস্তা মডেলের ইনপুটের 5 গুণ। এই দুটি অক্ষ (ইনপুট↔আউটপুট এবং মডেল ক্লাস) আপনার খরচ সিদ্ধান্তের কাঠামো গঠন করে।
খরচ গণনা কিভাবে?
সূত্রটি সহজ:
খরচ = (ইনপুট_টোকেন / 1,000,000) × ইনপুট_মূল্য + (আউটপুট_টোকেন / 1,000,000) × আউটপুট_মূল্য
নমুনা অ্যাকাউন্ট। সনেট 5: 1,500 ইনপুট টোকেন, 400 আউটপুট টোকেন সহ একটি অনুরোধ৷
ইনপুট = 1,500 / 1,000,000 × 3.00 = $0.0045 আউটপুট = 400 / 1,000,000 × 15.00 = $0.0060 মোট = $0.0105 (প্রায় 1 সেন্ট)
একটি কল সস্তা দেখায়. কিন্তু ভলিউম দ্বারা গুণ করুন: প্রতিদিন 20,000 কল → প্রতি দিন $210, প্রতি মাসে ~$6,300। স্কেল খেলার মধ্যে আসে যেখানে এই হয়.
মাসিক বাজেট টেমপ্লেট
কাজের চাপের মাসিক খরচ বের করতে, এই টেমপ্লেটটি ব্যবহার করুন:
1) অনুরোধ প্রতি গড় ইনপুট টোকেন: ......2) প্রতি অনুরোধের গড় আউটপুট টোকেন: ......3) প্রতিদিন অনুরোধের সংখ্যা: ......4) প্রতি মাসে কাজ করা দিন: ......5) অনুরোধ প্রতি খরচ = (1)/1M×input_price + (2)/1M×output_price6) মাসিক খরচ = (5) × (3)
এই প্যাটার্নটিকে একটি স্প্রেডশীটে ঢেলে দেওয়া এবং আপনি মডেল পরিবর্তন করার সময় যোগফল কীভাবে কার্যকর হয় তা মডেল নির্বাচন (ইউনিট 5) এবং ক্যাশে (ইউনিট 6) সিদ্ধান্তগুলিকে মূর্ত করে।
অনুলিপিযোগ্য টেমপ্লেট সহ প্রম্পট সংক্ষিপ্ত করা
বেশিরভাগ খরচ অপ্রয়োজনীয়ভাবে দীর্ঘ প্রম্পট এবং নষ্ট আউটপুট থেকে আসে। নীচের টেমপ্লেটগুলি সরাসরি সঞ্চয় প্রদান করে।
# আউটপুট দৈর্ঘ্য সীমিত করুন। সর্বোচ্চ ৩টি আইটেমের সাথে উত্তর দিন। একটি যুক্তি বা সূচনা বাক্য যোগ করুন।
# শুধুমাত্র অনুরোধ করা ক্ষেত্রটি ফেরত দিন শুধুমাত্র নিম্নলিখিত JSONটি ফেরত দিন, অন্য কোন লেখা যোগ করবেন না:{"category": "...", "urgency": "low|medium|high"}
# অপ্রয়োজনীয় প্রসঙ্গ সরাননিম্নলিখিত টেক্সট থেকে শুধুমাত্র তারিখ এবং পরিমাণ মুছে দিন। সম্পূর্ণ পাঠের পুনরাবৃত্তি করবেন না। পাঠ্য: """{{text}}"""
# দীর্ঘ বক্তৃতার সংক্ষিপ্তসার (ইনপুট সংরক্ষণ) 5টি আইটেমে এই ভাষণের সংক্ষিপ্তসার করুন। আমি পরবর্তী রাউন্ডগুলিতে সম্পূর্ণ অতীতের পরিবর্তে এই সারাংশটি ব্যবহার করব। বক্তৃতা: """{{অতীত}}"""
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট (খরচের ক্ষেত্রে)
# দুর্বল (আউটপুট প্রকাশ করে, ব্যয়বহুল) এই সমর্থন অনুরোধটি বিশ্লেষণ করুন এবং আমাকে একটি ব্যাপক পর্যালোচনা লিখুন৷
# স্ট্রং (আউটপুট সীমাবদ্ধ করে, সস্তা এবং অনুমানযোগ্য) এই সমর্থন অনুরোধটি শ্রেণীবদ্ধ করুন। শুধু নিম্নলিখিত JSON ফেরত দিন:{"category":"invoice|technical|refund| other","urgency":"low|medium|high"}কোন বিবরণ লিখবেন না।
দুর্বল সংস্করণটি সম্ভবত 500 আউটপুট টোকেন তৈরি করে; শক্তিশালী সংস্করণ ~15। যেহেতু আউটপুট ব্যয়বহুল, এটি প্রতি কলে একটি উল্লেখযোগ্য পার্থক্য এবং ভলিউমের সাথে গুণ করে।
তিনটি মিনি কেস
কেস 1 — দীর্ঘ প্রম্পটের লুকানো খরচ। অ্যাকাউন্টিং অটোমেশন প্রতিটি ইনভয়েসকে সাজানোর জন্য, এটি প্রতিটি অনুরোধে ইনপুট হিসাবে একটি 40-পৃষ্ঠার "নিয়ম বই" যোগ করেছে: প্রতি অনুরোধে ~12,000 ইনপুট টোকেন। সনেট 5 এর সাথে 12,000/1M×3 = $0.036 এইমাত্র প্রবেশ করেছে। প্রতিদিন 5,000 বিল → $180 প্রতি দিন। রুলবুক (ইউনিট 6) ক্যাশ করার মাধ্যমে ইনপুট খরচ ~90% কমে গেছে।
কেস 2 - মডেলের আকার কমানোর অর্থ। একটি দল Opus 4.8: 300 ইনপুট + 10 আউটপুট টোকেন দিয়ে সহজ "ইতিবাচক/নেতিবাচক" সেন্টিমেন্ট ট্যাগিং করছিল। Opus খরচ 300/1M×5 + 10/1M×25 = $0.00175। হাইকুতে স্যুইচ করা, 300/1M×1 + 10/1M×5 = $0.00035 — 5x সস্তা, নির্ভুলতার পার্থক্য ছিল অপরিমেয়। প্রতি মাসে 3 মিলিয়ন কলে, পার্থক্য হল $5,250 → $1,050৷
কেস 3 - আউটপুট প্রকাশ করা হচ্ছে। যখন একটি বিপণন দল একটি পণ্যের বিবরণ তৈরি করে, তখন এটি আউটপুটের কোনো সীমা নির্ধারণ করে না; মডেল কখনও কখনও 1,500 টোকেন বলে। যখন আমি "60 শব্দ সর্বাধিক" নির্দেশ যোগ করি, তখন গড় আউটপুট 900 থেকে 90 টোকেনে নেমে আসে। যেহেতু মুদ্রণ ব্যয়বহুল ছিল, তাই মাসিক বিল এক তৃতীয়াংশ কমানো হয়েছিল এবং পাঠ্যগুলি আরও উপযোগী হয়ে উঠেছে।
সাধারণ ভুল
- চোখের দ্বারা টোকেন অনুমান: আপনি বিশেষ করে তুর্কি এবং কোড ভুল হতে পারে. পরিমাপ.
- অনুমান করা হচ্ছে ইনপুট এবং আউটপুট একই: আউটপুট সাধারণত অনেক বেশি ব্যয়বহুল হয়; বেশিরভাগ অপ্টিমাইজেশান আউটপুট সংক্ষিপ্ত করার থেকে আসে।
- একটি একক কলের সস্তাতার দ্বারা প্রতারিত হবেন না: সিদ্ধান্তটি ভলিউম দ্বারা তৈরি করা হয়। $0.01 × মিলিয়ন = $10,000।
- অন্য প্রদানকারীর টোকেনাইজারের সাথে ভবিষ্যদ্বাণী: ভুল ফলাফল দেয়; মডেলের টোকেন গণনা টুল ব্যবহার করুন.
- কথোপকথনের ইতিহাসের সীমাহীন পরিবর্ধন: প্রতিটি রাউন্ড এন্ট্রিতে যোগ করা হয়; দীর্ঘ কথোপকথনে সংক্ষিপ্ত করুন।
- 'max_tokens' অপ্রয়োজনীয়ভাবে উচ্চ রাখা: বাজেট পরিকল্পনা এবং কাটা হওয়ার ঝুঁকি লুকিয়ে রাখে; একটি বাস্তবসম্মত মূল্য দিন।
গভীরতর: প্রসঙ্গ উইন্ডো এবং দীর্ঘ ইনপুট খরচ
শুধুমাত্র "প্রতি অনুরোধে" নয় বরং "কথোপকথন জুড়ে" মূল্য কীভাবে স্ট্যাক হয় তা দেখা গুরুত্বপূর্ণ। মডেলটি প্রক্রিয়া করতে পারে এমন মোট পাঠ্যকে প্রসঙ্গ উইন্ডো বলা হয়; ইনপুট এবং আউটপুটের যোগফল এই উইন্ডোতে ফিট করা আবশ্যক। আধুনিক মডেলগুলি খুব বড় উইন্ডোগুলি অফার করে (শত হাজার, এমনকি লক্ষ লক্ষ টোকেন), কিন্তু এর অর্থ এই নয় যে আপনি "অসীমভাবে এটি পূরণ করতে পারেন" — আপনি যা কিছু উইন্ডোতে রাখেন তা ইনপুট হিসাবে বিল করা হয়৷
দীর্ঘ কথোপকথনের ফাঁদ হল: প্রতিটি নতুন রাউন্ডের সাথে আপনি আবার পুরো ইতিহাস পাঠান (ইউনিট 1 এ রাষ্ট্রহীনতা)। একটি 20-রাউন্ড কথোপকথনে, 20 তম অনুরোধটি ইনপুট হিসাবে সম্পূর্ণ প্রথম 19 রাউন্ড বহন করে। এইভাবে, কথোপকথন যত দীর্ঘ হয়, অনুরোধ প্রতি খরচ রৈখিক না হয়ে ক্রমবর্ধমানভাবে বৃদ্ধি পায়। একজন এজেন্ট সহকারীর সাথে একটি 50-রাউন্ড কথোপকথন প্রথম রাউন্ডের কয়েক ডজন গুণ ইনপুট খরচ তৈরি করতে পারে।
এটি পরিচালনা করার দুটি উপায় রয়েছে। প্রথমটি হল রিক্যাপ: পুরানো রাউন্ডগুলিকে একটি একক রিক্যাপ ব্লকে সংকুচিত করা, শুধুমাত্র শেষ কয়েকটি রাউন্ড কাঁচা রাখা। দ্বিতীয়টি হল প্রম্পট ক্যাশিং (ইউনিট 6): পূর্ণ মূল্যে বারবার প্রক্রিয়াকরণের পরিবর্তে মূল্যের দশমাংশে নির্দিষ্ট প্রসঙ্গ পড়া। একসাথে, তারা দীর্ঘ, প্রসঙ্গ-নিবিড় কাজের চাপের বিল উল্লেখযোগ্যভাবে হ্রাস করে। তাই টোকেন ইকোনমিক্স পুরো সেশনের ডিজাইন সম্পর্কে, একটি অনুরোধ নয়।
সংক্ষেপে
টোকেন হল ক্ষুদ্রতম একক যেখানে পাঠ্য প্রক্রিয়া করা হয়; ইনপুট এবং আউটপুট আলাদাভাবে মূল্য নির্ধারণ করা হয়, এবং আউটপুট প্রায়ই অনেক বেশি ব্যয়বহুল। খরচ হল টোকেনের সংখ্যা একক মূল্য দ্বারা গুণিত, এবং প্রকৃত সিদ্ধান্ত ভলিউম দ্বারা করা হয়। প্রম্পট সংক্ষিপ্ত করা, আউটপুট সীমিত করা, এবং সবচেয়ে হালকা মডেল বেছে নেওয়া যা কাজটি সম্পন্ন করে তা হল সবচেয়ে সরাসরি লিভার যা খরচ অনেক গুণ কম করে।
আবেদন টাস্ক
আপনার নিজের একটি কাজ চয়ন করুন. (1) একটি প্রতিনিধি প্রম্পটের জন্য ইনপুট এবং আনুমানিক আউটপুট টোকেনের সংখ্যা নির্ধারণ করুন (সম্ভব হলে একটি টোকেন গণনা সরঞ্জাম দিয়ে পরিমাপ করুন)। (2) তিনটি মডেল ক্লাসের জন্য অনুরোধ প্রতি খরচ গণনা করুন। (3) আপনার দৈনিক অনুরোধের সংখ্যা অনুমান করুন এবং তিনটি মডেলের জন্য মাসিক বাজেট বের করুন। (4) আউটপুট সংক্ষিপ্ত করার জন্য একটি নির্দেশ যোগ করুন এবং প্রত্যাশিত সঞ্চয় নোট করুন।
চেকলিস্ট
- [ ] আমি টোকেনের ধারণা ব্যাখ্যা করতে পারি এবং টোকেনাইজেশন মডেলের উপর নির্ভর করে পরিবর্তিত হয়।
- [ ] আমি জানি কেন ইনপুট এবং আউটপুট টোকেনের দাম আলাদা।
- [ ] আমি সূত্র দিয়ে একটি অনুরোধের খরচ গণনা করতে পারি।
- [ ] আমি একটি টেমপ্লেট ব্যবহার করে কাজের চাপের জন্য একটি মাসিক বাজেট তৈরি করতে পারি।
- আউটপুট এবং মডেল হ্রাস সংক্ষিপ্ত করার সুবিধা আমি একটি উদাহরণ দিয়ে দেখাতে পারি।