หน่วย
1. ระบบนิเวศของผู้ให้บริการ AI: แผนที่ แนวคิด และ 'ไม่มีโมเดลที่ดีที่สุด' 2. น้ำหนักปิดและน้ำหนักเปิด: ความสมดุลของการควบคุม ต้นทุน และความเป็นส่วนตัว 3. เจาะลึกยักษ์ใหญ่ของสหรัฐฯ: มานุษยวิทยา, OpenAI, Google 4. ผู้เล่นที่แข็งแกร่งคนอื่นๆ: Meta, Mistral, xAI, DeepSeek, Cohere 5. โทเค็น หน้าต่างบริบท และความหลากหลาย: วิธีการทำงานของจิตใจของแบบจำลอง 6. ตรรกะการกำหนดราคา: เศรษฐกิจโทเค็นและความสมดุลด้านต้นทุนและคุณภาพ 7. ระดับและความสามารถของโมเดล: การใช้เหตุผล ความเร็ว และการเลือกโมเดลขนาดเล็ก/ใหญ่ 8. อธิปไตยของข้อมูล KVKK/EU และความเป็นส่วนตัว: คุณไว้วางใจข้อมูลกับใคร? 9. การเลือกแบบจำลองที่เหมาะสม: แผนผังการตัดสินใจและผลงานแบบจำลอง 10. การประยุกต์ใช้แบบครบวงจร: การประเมิน การตรวจสอบความถูกต้อง จริยธรรม และขอบเขต
หน่วย 5 / 10

โทเค็น หน้าต่างบริบท และความหลากหลาย: วิธีการทำงานของจิตใจของแบบจำลอง

กำไร:

  • ความสามารถในการอธิบายแนวคิดของโทเค็น หน้าต่างบริบท และความหลากหลายในภาษาในชีวิตประจำวัน
  • วินิจฉัยว่างานต้องการบริบทกว้างๆ หรือมีหลายรูปแบบ
  • ความสามารถในการพิจารณาว่าแนวคิดเหล่านี้ส่งผลต่อต้นทุนและการเลือกรุ่นอย่างไร

จนถึงตอนนี้เราคุ้นเคยกับผู้ให้บริการและประเภทโมเดลแล้ว อย่างไรก็ตาม เพื่อการเลือกรุ่นที่ถูกต้อง จำเป็นต้องเข้าใจวิธีการทำงานของโมเดล "ภายใน" ด้วย เนื่องจากการตัดสินใจด้านราคา ความจุ และความพร้อมใช้งานทั้งหมดขึ้นอยู่กับแนวคิดหลักสามประการ: โทเค็น หน้าต่างบริบท และความหลากหลาย คนที่ไม่ทราบแนวคิดเหล่านี้ไม่สามารถอ่านใบราคาได้และสงสัยว่า "เอกสารนี้จะพอดีกับโมเดลหรือไม่" ไม่สามารถตอบคำถามได้และไม่สามารถมองเห็นได้เมื่อการประมวลผลภาพเป็นสิ่งจำเป็น ในตอนท้ายของหน่วยการเรียนรู้นี้ คุณจะสามารถอธิบายแนวคิดทั้งสามนี้เป็นภาษาที่ใช้ในชีวิตประจำวัน วินิจฉัยว่างานต้องมีบริบทกว้างๆ หรือมีความหลากหลาย และคำนึงถึงผลกระทบต่อต้นทุนด้วย

โทเค็น: หน่วยที่ใช้โดยโมเดลแทน Word

โมเดลปัญญาประดิษฐ์จะประมวลผลข้อความไม่ใช่คำต่อคำ แต่จะประมวลผลเป็นชิ้นเล็กๆ ที่เรียกว่าโทเค็น โทเค็น; อาจเป็นคำ ส่วนหนึ่งของคำ เครื่องหมายวรรคตอน หรือการเว้นวรรค วิธีคำนวณคร่าวๆ: ในภาษาอังกฤษ โทเค็นโดยเฉลี่ยจะมีอักขระประมาณ 4 ตัว และ 100 คำมีโทเค็นประมาณ 130-150 ตัว ในภาษาตุรกี อัตรานี้อาจสูงขึ้นเล็กน้อยเนื่องจากมีคำต่อท้ายและยาว กล่าวอีกนัยหนึ่ง ข้อความภาษาตุรกีที่มีความหมายเหมือนกันจะใช้โทเค็นมากกว่าภาษาอังกฤษเล็กน้อย

เหตุใดจึงสำคัญที่ต้องรู้? เพราะทุกอย่างถูกชาร์จและวัดเป็นโทเค็น ข้อความ (อินพุต) ที่คุณส่งไปยังโมเดลและการตอบกลับ (เอาต์พุต) ที่สร้างโดยโมเดลจะนับเป็นโทเค็นที่แยกจากกัน ทั้งใบแจ้งหนี้และความจุของแบบจำลองอยู่ในโทเค็น

เคล็ดลับ: หากต้องการประมาณคร่าวๆ ว่าข้อความมีกี่โทเค็น ให้หารจำนวนอักขระด้วยสี่ อีเมลความยาว 4,000 ตัวอักษรจะมีโทเค็นประมาณ 1,000 รายการ ในภาษาตุรกี ถือว่าสูงกว่านี้เล็กน้อยเพื่อความปลอดภัย

หน้าต่างบริบท: "หน่วยความจำระยะสั้น" ของโมเดล

หน้าต่างบริบทคือจำนวนโทเค็นทั้งหมดที่โมเดลสามารถจดจำได้ในแต่ละครั้ง อินพุตและเอาต์พุตต้องพอดีกันในหน้าต่างนี้ ลองคิดดูว่ามันเหมือนกับจำนวนกระดาษที่คุณสามารถกระจายบนโต๊ะได้ในคราวเดียว กระดาษที่ไม่พอดีกับโต๊ะนั้นอยู่นอกขอบเขตการมองเห็นของคุณในขณะนั้น

หากหน้าต่างบริบทของโมเดลมีโทเค็น 200,000 รายการ จะเท่ากับประมาณ 150,000 คำ หรือหนังสือขนาดกลางหลายเล่ม โทเค็น 1 ล้านโทเค็นสามารถประมวลผลเอกสารที่มีขนาดใหญ่กว่ามากโดยรวมได้ โมเดลที่ทรงพลังบางรุ่นในปัจจุบัน (เช่น Claude Opus 4.8 และ Sonnet 5) มีบริบทโทเค็น 1 ล้านรายการ ในขณะที่โมเดลน้ำหนักเบามักจะมาพร้อมกับหน้าต่างที่เล็กกว่า (เช่น 200,000 โทเค็นสำหรับ Haiku 4.5)

เหตุใดจึงสำคัญ? เพราะหากเอกสารไม่พอดีกับหน้าต่างบริบท โมเดลจะไม่สามารถเห็นเอกสารทั้งหมดพร้อมกันได้ คุณไม่สามารถให้สัญญา 500 หน้าทั้งหมดกับโมเดลโทเค็น 200,000 รายการได้ คุณสามารถแบ่งเอกสารออกเป็นส่วนๆ (ซึ่งอาจสูญเสียความสัมพันธ์ระหว่างส่วนต่างๆ) หรือเลือกแบบจำลองที่มีบริบทกว้างกว่า

ข้อควรระวัง: ไม่ควรกรอกเอกสารทุกฉบับเนื่องจากหน้าต่างบริบทมีขนาดใหญ่ ยิ่งคุณใส่โทเค็นลงในหน้าต่างมากเท่าไร คุณก็ยิ่งจ่ายเงินมากขึ้นเท่านั้น และบางครั้งโมเดลอาจพลาดรายละเอียดตรงกลางในข้อความที่ยาวมาก การส่งเฉพาะส่วนที่ใช้งานได้มักจะถูกกว่าและแม่นยำกว่า

หน้าต่างบริบทเป็นเกณฑ์การตัดสินใจ

ภารกิจ

บริบทที่จำเป็นโดยประมาณ

ระดับที่เหมาะสม

การตอบกลับอีเมลสั้น ๆ

หลายร้อยโทเค็น

น้ำหนักเบา

สรุปหน้าเดียว

โทเค็นหลายพันอัน

เบา/สมดุล

การวิเคราะห์รายงาน 40 หน้า

~30,000 โทเค็น

สมดุล/แข็งแกร่ง

การตรวจสอบสัญญา 300 หน้า

~250,000 โทเค็น

ทรงพลังด้วยบริบทที่กว้าง

ประมวลผลเอกสารหลายร้อยรายการในคราวเดียว

500,000+ โทเค็น

บริบทที่กว้างที่สุด

ตารางนี้ตอบคำถาม "รุ่นไหน" มันแสดงให้เห็นว่าส่วนหนึ่งของคำถามตอบโดยตรงตามขนาดเอกสาร การซื้อโมเดลราคาแพงที่มีบริบทขนาดใหญ่สำหรับงานระยะสั้นถือเป็นเรื่องเปล่าประโยชน์ โมเดลที่มีหน้าต่างเล็กไม่เพียงพอสำหรับเอกสารขนาดใหญ่

ความหลากหลาย: ก้าวไปไกลกว่าข้อความ

Multimodality คือความสามารถของโมเดลในการจัดการข้อมูลหลายประเภท (รูปภาพ เสียง บางครั้งวิดีโอ) ไม่ใช่แค่ข้อความ "Modal" ในที่นี้หมายถึง "ประเภทข้อมูล"; multimodal แปลว่า "หลายชนิด"

  • รูปแบบข้อความเท่านั้น: อ่านและเขียนเฉพาะข้อความที่เป็นลายลักษณ์อักษร
  • แบบจำลองต่อเนื่องหลายรูปแบบ: สามารถอ่านรูปถ่ายใบเรียกเก็บเงิน ตีความแนวโน้มบนกราฟ ถอดรหัสบันทึกที่เขียนด้วยลายมือ และบางครั้งก็ถอดเสียงที่บันทึกไว้

เหตุใดจึงสำคัญ? เพราะธรรมชาติของธุรกิจของคุณอาจต้องมีหลายรูปแบบ ทีมบัญชีที่ดึงจำนวนเงินจากรูปภาพในใบแจ้งหนี้ ทีมอีคอมเมิร์ซที่จัดหมวดหมู่ภาพถ่ายผลิตภัณฑ์ หรือทีมประกันภัยที่ประเมินภาพถ่ายความเสียหายไม่สามารถทำงานนี้ได้ด้วยแบบจำลองที่อ่านได้เฉพาะข้อความเท่านั้น การประมวลผลภาพถือเป็นสิ่งสำคัญสำหรับงานเหล่านี้

สามกรณีที่สมจริง

กรณีที่ 1 — Token เสียค่าใช้จ่ายอย่างน่าประหลาดใจ ทีมเนื้อหายังส่งเอกสาร “คู่มือแบรนด์” จำนวน 20 หน้าให้กับโมเดลขณะที่พวกเขาจัดทำโพสต์บล็อกแต่ละรายการ คู่มือนี้มีประมาณ 15,000 โทเค็น พวกเขาผลิตบทความ 2,000 บทความต่อเดือน ดังนั้นเพียงแค่ส่งคำแนะนำซ้ำแล้วซ้ำเล่าก็หมายถึงอินพุต 30 ล้านโทเค็น โดยการย่อคำแนะนำและส่งเฉพาะส่วนที่เกี่ยวข้อง (ประมาณ 2,000 โทเค็น) จะช่วยลดอินพุตเหลือหนึ่งในเจ็ดและลดค่าใช้จ่ายได้อย่างมาก

กรณีที่ 2 — หน้าต่างบริบทไม่เพียงพอ สำนักงานกฎหมายแห่งหนึ่งต้องการให้มีการตรวจสอบข้อตกลงการควบรวมกิจการความยาว 280 หน้า แบบจำลองแรกที่พวกเขาลองใช้มีการผูกโทเค็น 200,000 โทเค็นและเอกสารไม่พอดี เมื่อเอกสารถูกแยกออกจากกัน แบบจำลองจะไม่สามารถสังเกตได้ว่าบทความในส่วนแรกขัดแย้งกับบทความในส่วนสุดท้าย เมื่อเปลี่ยนไปใช้โมเดลที่มีบริบทโทเค็น 1 ล้านรายการ ระบบจะอ่านเอกสารโดยรวมและจับข้อขัดแย้งได้ หน้าต่างบริบทจะกำหนดความแม่นยำโดยตรงที่นี่

กรณีที่ 3 — จำเป็นต้องมีความหลากหลายหลายรูปแบบ บริษัทประกันภัยต้องการประเมินเบื้องต้นจากภาพถ่ายความเสียหายของรถยนต์ สิ่งนี้เป็นไปไม่ได้กับโมเดลที่อ่านเฉพาะข้อความเท่านั้น จำเป็นต้องมีแบบจำลองต่อเนื่องหลายรูปแบบที่ "เห็น" ภาพถ่าย เมื่อพวกเขาเปลี่ยนมาใช้โมเดลต่อเนื่องหลายรูปแบบ พวกเขาจะสร้างระบบคัดกรองล่วงหน้าที่จะจำแนกตำแหน่งและความรุนแรงของความเสียหายในภาพถ่ายอย่างคร่าว ๆ และสั่งการผู้เชี่ยวชาญ อย่างไรก็ตาม พวกเขาสังเกตว่าผู้เชี่ยวชาญที่เป็นมนุษย์เป็นผู้ตัดสินใจขั้นสุดท้าย เพราะแบบจำลองเป็นเครื่องมือคัดกรองเบื้องต้นไม่ใช่คำสุดท้าย

พรอมต์ที่อ่อนแอ / พรอมต์ที่แข็งแกร่ง

พรอมต์ที่อ่อนแอ:

สรุปเอกสารนี้ [วางเอกสารยาวเกินไป]

พรอมต์อันทรงพลัง:

สรุปรายงาน 40 หน้าด้านล่าง ขั้นแรก ให้ประมาณจำนวนโทเค็นโดยประมาณในรายงาน และแจ้งให้เราทราบว่าเหมาะกับหน้าต่างบริบทของโมเดลที่สมดุลทั่วไปหรือไม่ จากนั้นให้สรุปในรูปแบบนี้: บทสรุปผู้บริหาร 5 รายการ + การค้นพบที่มีความเสี่ยง 3 รายการ ใช้เฉพาะข้อมูลในรายงานเท่านั้น ทำเครื่องหมายส่วนที่คุณไม่แน่ใจว่า "ไม่ชัดเจนในรายงาน" [รายงาน]

พร้อมท์ที่มีประสิทธิภาพมีทั้งโทเค็น/บริบทที่รับรู้ และควบคุมรูปแบบและการตรวจสอบความถูกต้องของเอาต์พุต

เทมเพลตที่คัดลอกได้

1. การทำนายโทเค็น:

ประมาณจำนวนโทเค็นโดยประมาณสำหรับข้อความต่อไปนี้และตีความสิ่งนี้ในแง่ของต้นทุนอินพุต: "[TEXT]" ปัดเศษขึ้นเล็กน้อยโดยพิจารณาว่าเป็นภาษาตุรกี

2. การตรวจสอบความพร้อมของบริบท:

งานของฉันคือการประมวลผลเอกสารต่อไปนี้: เอกสารโดยเฉลี่ย [PAGES] จาก [QTY] ต่อเดือน ขนาดนี้ต้องการหน้าต่างบริบทใด ระดับแสง/สมดุล/แรงระดับใดจะเพียงพอ? จะมีความเสี่ยงอะไรบ้างหากจำเป็นต้องรื้อถอน?

3. การวินิจฉัยหลายรูปแบบ:

ขั้นตอนการทำงานของฉัน: [รายละเอียด] มีการประมวลผลภาพ เสียง หรือวิดีโอในสตรีมนี้หรือไม่ หากเป็นเช่นนั้น จำเป็นต้องใช้โมเดลหลายรูปแบบหรือไม่ หรือสามารถแปลงเป็นข้อความ (OCR/การถอดความ) และแก้ไขด้วยโมเดลข้อความได้หรือไม่ เปรียบเทียบข้อดี/ข้อเสียของทั้งสองเส้นทาง

4. การเพิ่มประสิทธิภาพบริบท:

ฉันส่งเอกสารไปยังโมเดลพร้อมกับทุกคำขอ แต่ส่วนใหญ่ก็ไม่จำเป็น ฉันจะแยกส่วนที่จำเป็นสำหรับ [TASK] ออกจากเอกสารนี้ได้อย่างไร แนะนำ 3 วิธีที่เป็นรูปธรรมในการลดอินพุตและระบุการประหยัดโทเค็นโดยประมาณ

ข้อผิดพลาดทั่วไป

  • โทเค็นที่เข้าใจผิดว่าเป็นคำ: โทเค็นนั้นแตกต่างจากคำ ใบแจ้งหนี้และความจุอยู่ในโทเค็นเสมอ การคำนวณเป็นคำพูดอาจทำให้เข้าใจผิด
  • การคิดว่าหน้าต่างบริบทนั้นไม่มีที่สิ้นสุด: ทุกรุ่นมีขีดจำกัด หากเอกสารไม่พอดี โมเดลจะไม่สามารถมองเห็นได้ทั้งหมด
  • การใช้บริบทขนาดใหญ่ที่ไม่จำเป็น: การซื้อโมเดลราคาแพงที่มีบริบทขนาดใหญ่สำหรับงานระยะสั้น หรือกรอกเอกสารขนาดใหญ่สำหรับทุกคำขอและชำระเงินอย่างไร้ผล
  • สมมติว่ามีหลายรูปแบบ: ไม่ใช่ทุกรุ่นที่สามารถประมวลผลภาพได้ สำหรับงานด้านภาพ ให้เริ่มต้นโดยไม่ต้องยืนยันว่าโมเดลเป็นแบบต่อเนื่องหลายรูปแบบ
  • ลืมโหลดโทเค็นของภาษาตุรกี: โดยทั่วไปแล้วข้อความภาษาตุรกีใช้โทเค็นมากกว่าเล็กน้อยสำหรับความหมายเดียวกัน โดยไม่สนใจสิ่งนี้ในการประมาณต้นทุน

โดยสรุป

  • โทเค็นคือหน่วยขนาดเล็กที่โมเดลประมวลผลข้อความ อินพุตและเอาต์พุตจะถูกวัดและออกใบแจ้งหนี้แยกกันเป็นโทเค็น
  • หน้าต่างบริบทคือโทเค็นทั้งหมดที่โมเดลสามารถจดจำได้ในแต่ละครั้ง ขนาดเอกสารส่งผลโดยตรงต่อการเลือกรุ่น
  • Multimodality คือความสามารถของโมเดลในการประมวลผลข้อมูลที่ไม่ใช่ข้อความ เช่น ภาพ/เสียง มันเป็นสิ่งจำเป็นสำหรับงานภาพ
  • แนวคิดทั้งสามนี้เกี่ยวข้องกับคำถาม "รุ่นใด" รวมทั้ง “ราคาเท่าไหร่?” เป็นพื้นฐานของคำถาม

งานสมัคร

เลือกงาน AI ที่เกิดซ้ำในธุรกิจของคุณ ให้เทมเพลตที่ 1 (การทำนายโทเค็น) คำนวณจำนวนโทเค็นที่อินพุตทั่วไปอยู่ในงานนี้ จากนั้นพิจารณาว่าระดับใดที่เพียงพอสำหรับเทมเพลต 2 (การตรวจสอบความพร้อมของบริบท) หากคุณมีงานด้านการมองเห็น ให้ชี้แจงว่าจำเป็นต้องใช้โมเดลต่อเนื่องหลายรูปแบบด้วยเทมเพลตที่ 3 (การวินิจฉัยหลายรูปแบบ) เราจะใช้การประมาณโทเค็นผลลัพธ์ในการคำนวณต้นทุนของหน่วยถัดไป

รายการตรวจสอบ

  • [ ] ฉันรู้แนวคิดของโทเค็นและวิธีประมาณคร่าวๆ ว่าข้อความมีโทเค็นจำนวนเท่าใด
  • [ ] ฉันสามารถอธิบายหน้าต่างบริบทด้วยการเปรียบเทียบ "ตาราง/หน่วยความจำ"
  • [ ] ฉันสามารถประเมินได้ว่าเอกสารจะพอดีกับแบบจำลองหรือไม่
  • [ ] ฉันสามารถวินิจฉัยได้ว่าเมื่อใดที่จำเป็นต้องมีความหลากหลายหลายรูปแบบ
  • [ ] ฉันคำนึงถึงค่าใช้จ่ายโทเค็นของภาษาตุรกีและต้นทุนของบริบทที่ไม่จำเป็น