יחידה 2 / 11

היגיון אסימון ותמחור

רווחים:

  • הסבר את המושג אסימון, הבחנה של אסימון קלט/פלט וטוקניזציה.
  • יכול לחשב את עלות הבקשה ועומס העבודה החודשי ממספר האסימונים ומחיר היחידה
  • יכול להשוות את ההשפעה של בחירת הדגם והאורך המהיר על העלות

אתה לא יכול לבנות פתרון בקנה מידה בלי להבין את הכלכלה של ממשקי API של LLM. הדגמה פועלת פעם אחת; העיקר להיות מסוגל לחזות מה יהיה החשבון כאשר יבוצעו אלפי שיחות בחודש. ביחידה זו אנו מגדירים את צד הכסף של העניינים: מהו אסימון, מדוע מתמחרים קלט ופלט בצורה שונה, כיצד מחשבים את עלות הבקשה וכיצד מתקצבים עומס עבודה חודשי. מידע זה מאפשר לך למדוד את ההחזר של טכניקות אופטימיזציה (מטמון, בחירת מודל, אצווה) ביחידות עוקבות.

מה זה Token?

אסימון הוא היחידה הקטנה ביותר שבה המודל מעבד טקסט. מילה היא לא תמיד אסימון; אסימון הוא בדרך כלל חלק ממילה. באופן גס, באנגלית, אסימון אחד הוא ≈ 4 תווים ≈ 0.75 מילים. בטורקית ובקוד, היחס משתנה: מילים טורקיות מחולקות לרוב ליותר אסימונים מאשר באנגלית בשל המבנה והאלפבית שלהן. לכן, יש צורך למדוד את מספר האסימונים בעזרת כלי ספירת האסימונים של הספק במקום לנחש בעין.

טוקניזציה (תהליך פיצול טקסט לאסימונים) עשוי להיות שונה עבור כל דגם. יש לכך שתי השלכות מעשיות: (1) אותו טקסט עשוי להניב מספרים שונים של אסימונים במודלים שונים; (2) תחזיות שנעשו עם טוקנייזרים מספקים אחרים (למשל ספריית הטיקטוקן של OpenAI) יהיו לא מדויקות עבור קלוד - השתמש בטיפ לספירת האסימונים עבור המודל שבו אתה משתמש.

רמז: "בערך כמה אסימונים?" אל תענה על השאלה בצורה עיוור. העבר טקסט מייצג דרך ה-API של ספירת האסימונים; לבסס החלטות תקציביות על מדידה.

אסימוני קלט ופלט

החשבונית מורכבת משני פריטים:

  • אסימוני קלט: כל מה שאתה שולח לדגם - הנחיית מערכת, סיורים קודמים, הודעת משתמש, תיעוד אם יש. אלה מעובדים בבת אחת.
  • אסימוני פלט: התגובה שמפיק המודל. עבור כל אסימון פלט, המודל מבצע את החישוב צעד אחר צעד.

אצל רוב הספקים, הפלט יקר פי כמה מהקלט. הסיבה פשוטה: קריאת הקלט בבת אחת זולה יותר מהפקת הפלט אסימון אחר אסימון. הכרת האסימטריה הזו מסבירה מדוע אופטימיזציות כמו "דורשות תשובות תמציתיות" הן כל כך יעילות.

מחירים לדוגמה (למיליון אסימונים, דולר)

הטבלה שלהלן היא הפניה; המחירים עשויים להשתנות עם הזמן, אנא אשר את הרשימה הנוכחית של הספק שלך.

כיתת מודל

דגם לדוגמה

קלט ($/1M)

פלט ($/1M)

שימוש אופייני

מהיר/זול

הייקו 4.5

1.00

5.00

סיווג, תיוג, סיכום פשוט

מאוזנת

סונטה 5

3.00

15.00

מטרה כללית, קידוד, עבודת סוכנים

חזק

אופוס 4.8

5.00

25.00

חשיבה מורכבת, משימות ארוכות טווח

בכל מחלקה, הפלט הוא פי 5 מהקלט; יתרה מכך, אפילו הקלט של הדגם החזק הוא פי 5 מהקלט מהדגם הזול. שני צירים אלה (קלט↔פלט ומחלקת מודל) מהווים את המסגרת של החלטות העלות שלך.

כיצד לחשב עלות?

הנוסחה פשוטה:

עלות = (אסימון_קלט / 1,000,000) × מחיר_קלט + (אסימון_פלט / 1,000,000) × מחיר_פלט

חשבון לדוגמה. בקשה עם Sonnet 5: 1,500 אסימוני קלט, 400 אסימוני פלט.

קלט = 1,500 / 1,000,000 × 3.00 = $0.0045 פלט = 400 / 1,000,000 × 15.00 = $0.0060 סך הכל = $0.0105 (בערך 1 סנט)

שיחה אחת נראית זולה. אבל הכפל בנפח: 20,000 שיחות ליום → 210 $ ליום, ~ 6,300 $ לחודש. כאן נכנס לתמונה קנה המידה.

תבנית תקציב חודשי

כדי לחלץ את העלות החודשית של עומס עבודה, השתמש בתבנית זו:

1) אסימון קלט ממוצע לכל בקשה: ......2) אסימון פלט ממוצע לבקשה: ......3) מספר בקשות ליום: ......4) ימי עבודה בחודש: ......5) עלות לבקשה = (1)/1M×input_price + (2)/1M×output_price6) עלות חודשית = (5) × (3) × (4)

יציקת דפוס זה לגיליון אלקטרוני ולראות כיצד הסכום מתרחש כאשר אתה משנה את המודל מגלם את החלטות בחירת הדגם (יחידה 5) והמטמון (יחידה 6).

קיצור ההנחיה באמצעות תבניות הניתנות להעתקה

רוב העלות נובעת מהנחיות ארוכות שלא לצורך ותפוקה מבוזבזת. התבניות שלהלן מספקות חיסכון ישיר.

# הגבל את אורך הפלט. ענה עם מקסימום 3 פריטים. הוסף רציונל או משפט מבוא.

# החזר רק את השדה המבוקש החזר רק את ה-JSON הבא, אל תוסיף שום טקסט אחר:{"category": "...", "urgency": "low|medium|high"}

# הסר הקשר מיותר הסר רק את התאריך והסכום מהטקסט הבא. אל תחזור על כל הטקסט. טקסט: """{{text}}"""

# סכם את הנאום הארוך (חיסכון בקלט) סכם את הנאום הזה ב-5 פריטים. אני אשתמש בסיכום הזה במקום בעבר המלא בסבבים הבאים. דיבור: """{{עבר}}"""

הנחיה חלשה / הנחיה חזקה (מבחינת עלות)

# WEAK (משחרר פלט, יקר) נתח את בקשת התמיכה הזו וכתוב לי סקירה מקיפה.

# STRONG (מגביל תפוקה, זול וצפוי) סיווג בקשת תמיכה זו. פשוט החזר את ה-JSON הבא:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}אל תכתוב תיאור.

הגרסה החלשה מייצרת אולי 500 אסימוני פלט; גרסה חזקה ~15. מכיוון שהתפוקה יקרה, זהו הבדל משמעותי לכל שיחה ומכפיל את הנפח.

שלושה מיני מארזים

מקרה 1 - העלות הנסתרת של ההנחיה הארוכה. כאשר אוטומציה חשבונאית מיינה כל חשבונית, היא הוסיפה "ספר כללים" בן 40 עמודים כקלט לכל בקשה: ~12,000 אסימוני קלט לכל בקשה. עם Sonnet 5 12,000/1M×3 = $0.036 זה עתה נכנס. 5,000 שטרות ליום → $180 ליום. על ידי שמירה במטמון של ספר החוקים (יחידה 6) עלות הקלט ירדה בכ-90%.

מקרה 2 - התמורה של צמצום הדגם. צוות אחד ביצע תיוג סנטימנט פשוט "חיובי/שלילי" עם Opus 4.8: 300 קלט + 10 אסימוני פלט. עלות אופוס 300/1M×5 + 10/1M×25 = $0.00175. מעבר להייקו, 300/1M×1 + 10/1M×5 = $0.00035 - זול פי 5, ההבדל ברמת הדיוק היה בלתי ניתן למדידה. ב-3 מיליון שיחות בחודש, ההפרש הוא $5,250 → $1,050.

מקרה 3 - שחרור הפלט. כאשר צוות שיווק הפיק תיאור מוצר, הוא לא הציב מגבלות על התפוקה; הדגם אמר לפעמים 1,500 אסימונים. כשהוספתי את ההוראה "60 מילים מקסימום", התפוקה הממוצעת ירדה מ-900 ל-90 אסימונים. מכיוון שההדפסה הייתה יקרה, החשבון החודשי הופחת בשליש, והטקסטים הפכו שימושיים יותר.

טעויות נפוצות

  • מנחש את האסימון בעין: אתה יכול לטעות במיוחד בטורקית ובקוד. לִמְדוֹד.
  • בהנחה שהקלט והפלט זהים: הפלט הוא בדרך כלל הרבה יותר יקר; רוב האופטימיזציה מגיעה מקיצור התפוקה.
  • אל תתפתו מהזול של שיחה בודדת: ההחלטה מתקבלת לפי נפח. $0.01 × מיליון = $10,000.
  • חיזוי עם אסימון של ספק אחר: נותן תוצאות שגויות; השתמש בכלי ספירת האסימונים של הדגם.
  • הגדלה בלתי מוגבלת של היסטוריית השיחה: כל סיבוב מתווסף לערך; לסכם בשיחות ארוכות.
  • שמירה על 'max_tokens' גבוה שלא לצורך: מסתיר את תוכנית התקציב ואת הסיכון לקיצוץ; תן ערך ריאלי.

עמוק יותר: חלון הקשר ועלות קלט ארוכה

זה קריטי לראות איך המחיר מסתדר "ברוחב השיחה" ולא רק "לפי בקשה". הכמות הכוללת של טקסט שהמודל יכול לעבד נקראת חלון ההקשר; סכום הקלט והפלט חייב להתאים לחלון זה. דגמים מודרניים מציעים חלונות גדולים מאוד (מאות אלפים, אפילו מיליוני אסימונים), אבל זה לא אומר שאתה יכול "למלא אותו בלי סוף" - כל מה שתכניס לחלון מחויב כקלט.

המלכודת בשיחות ארוכות היא זו: בכל סיבוב חדש אתה שולח שוב את כל ההיסטוריה (חוסר אזרחות ביחידה 1). בשיחה של 20 סיבובים, הבקשה ה-20 נושאת את כל 19 הסיבובים הראשונים כקלט. לפיכך, ככל שהשיחה מתארכת, העלות לכל בקשה גדלה באופן מצטבר ולא ליניארי. שיחה של 50 סיבובים עם עוזר סוכן יכולה לייצר עלויות תשומות עשרות מונים בסיבוב הראשון.

יש שתי דרכים לנהל את זה. הראשון הוא סיכום: דחיסה של סיבובים ישנים יותר לגוש סיכום יחיד, תוך שמירה על הסיבובים האחרונים גולמיים בלבד. השני הוא שמירת מטמון מהירה (יחידה 6): קריאת ההקשר הקבוע בעשירית מהמחיר במקום לעבד אותו שוב ושוב במחיר המלא. יחד, הם מפחיתים משמעותית את הצעת החוק על עומסי עבודה ארוכים עתירי הקשר. אז כלכלה סמלית עוסקת בעיצוב של הפגישה כולה, לא בקשה אחת.

לסיכום

Token היא היחידה הקטנה ביותר שבה מעובד טקסט; הקלט והתפוקה מתומחרים בנפרד, והתפוקה היא לרוב הרבה יותר יקרה. העלות היא מספר האסימונים כפול מחיר היחידה, וההחלטה האמיתית מתקבלת לפי נפח. קיצור ההנחיה, הגבלת התפוקה ובחירת הדגם הקל ביותר שמבצע את המשימה הם המנופים הישירים ביותר שמפחיתים את העלות פי כמה.

משימת יישום

בחר משימה משלך. (1) קבע את מספר אסימוני הקלט והפלט המשוער עבור הנחיה מייצגת (מדוד עם כלי ספירת אסימונים במידת האפשר). (2) חשב את העלות לכל בקשה עבור שלוש מחלקות הדגמים. (3) הערך את מספר הבקשות היומי שלך וגזר את התקציב החודשי עבור שלושת הדגמים. (4) הוסף הוראה לקיצור הפלט ושימו לב לחסכון הצפוי.

רשימת בדיקה

  • [ ] אני יכול להסביר את המושג אסימונים ושאסימון משתנה בהתאם למודל.
  • [ ] אני יודע מדוע אסימוני קלט ופלט מתומחרים אחרת.
  • [ ] אני יכול לחשב את העלות של בקשה באמצעות הנוסחה.
  • [ ] אני יכול ליצור תקציב חודשי עבור עומס עבודה באמצעות תבנית.
  • [ ] אני יכול להראות עם דוגמה את היתרון של קיצור התפוקה והפחתת המודל.