หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในการแปลและการตีความ: บทบาท ขอบเขต การรับรองความถูกต้อง ความเป็นส่วนตัว และจริยธรรม 2. พื้นฐานการแปลด้วยเครื่อง: NMT, LLM, การเลือกเครื่องยนต์ และการประเมินล่วงหน้า 3. การแก้ไขหลังการแปลด้วยเครื่อง (MTPE): การแก้ไขภายหลังแบบน้ำหนักเบาและเต็มรูปแบบ 4. การจัดการคำศัพท์และคำศัพท์: ความสม่ำเสมอและภาษาองค์กร 5. การบูรณาการ AI กับเครื่องมือ CAT และหน่วยความจำการแปล (TM) 6. การแปลเป็นภาษาท้องถิ่น (L10n): ซอฟต์แวร์ เว็บ เกม และการปรับตัวทางวัฒนธรรม 7. คำบรรยาย การพากย์ และการแปลภาพและเสียง 8. การควบคุมคุณภาพ (QA) การวัดผลการประเมิน และ LQA 9. การเตรียมล่าม: ล่ามต่อเนื่องและพร้อมกัน 10. บริบท วัฒนธรรม น้ำเสียง และการแปลเชิงสร้างสรรค์ (การแปลงร่าง) 11. การรักษาความลับ จริยธรรม ลิขสิทธิ์ ความถูกต้อง และอนาคตของวิชาชีพ
หน่วย 2 / 11

พื้นฐานการแปลด้วยเครื่อง: NMT, LLM, การเลือกเครื่องยนต์ และการประเมินล่วงหน้า

กำไร:

  • สามารถแยกแยะจุดแข็งและจุดอ่อนของการแปลแบบ NMT และ LLM และเลือกเครื่องมือที่เหมาะสมตามประเภทธุรกิจ
  • ความสามารถในการจัดประเภทล่วงหน้าถึงความเหมาะสมของข้อความสำหรับเครื่อง และประเมินล่วงหน้าตามเวลาและราคาที่สมจริง
  • ความสามารถในการวัดคุณภาพของผลผลิตของเครื่องจักรดิบในห้ามิติอย่างรวดเร็ว และระบุความเสี่ยงโดยไม่สับสนระหว่างความราบรื่นและความแม่นยำ

ตัวเร่งที่ทรงพลังที่สุดที่คุณมีในฐานะนักแปลคือการแปลด้วยเครื่อง (MT) แต่การใช้เครื่องมืออย่างมีสติหมายถึงการนำเครื่องมือไปประยุกต์ใช้กับงานที่ถูกต้อง ในคู่ภาษาที่ถูกต้อง และด้วยความคาดหวังที่ถูกต้อง ในหน่วยนี้ คุณจะได้ทำความรู้จักกับตระกูลหลักสองตระกูลของ MT (การแปลแบบ NMT และ LLM) เรียนรู้ว่าตระกูลไหนดีกว่าสำหรับงานใด วิธีวัดคุณภาพผลลัพธ์ดิบของการแปลอย่างรวดเร็วก่อนส่งมอบ และวิธีการเลือกกลไกตามงาน จุดมุ่งหมายคือการละทิ้งแนวคิด "เหมือนกันทั้งหมด วาง-แปล" และกลายเป็นผู้เชี่ยวชาญที่สามารถคาดการณ์ได้ว่าข้อความใดที่เหมาะกับเครื่องและต้องใช้แรงงานคนมาก

สองตระกูล: การแปลตาม NMT และ LLM

NMT (การแปลด้วยเครื่องประสาทเทียม) คือระบบที่เรียนรู้จากประโยคสองภาษาหลายล้านประโยคและแปลประโยคโดยรวม Google Translate, DeepL, Microsoft Translator คือตัวอย่างของสิ่งเหล่านี้ จุดแข็ง: รวดเร็วมาก สม่ำเสมอ คล่องแคล่วในประโยคสั้นๆ จุดอ่อน: มักไม่เห็นบริบทเกินขอบเขตประโยค (ความหมายจากข้อความทั้งหมด) อาจเป็นเรื่องยากที่จะตัดสินใจว่าคำว่า "ธนาคาร" หมายถึงธนาคารหรือริมฝั่งแม่น้ำหรือไม่โดยดูจากย่อหน้าแล้วไม่ตรงกับรายการคำศัพท์ที่ให้ไว้

การแปลโดยใช้ LLM (โมเดลภาษาขนาดใหญ่) คือการใช้โมเดลที่ขับเคลื่อนด้วยคำสั่ง เช่น ChatGPT, Claude, Gemini สำหรับการแปล จุดแข็ง: รับคำแนะนำ — เข้าใจคำสั่ง เช่น “ใช้น้ำเสียงที่เป็นทางการ” “ปฏิบัติตามรายการคำศัพท์นี้” “กลุ่มเป้าหมายคือเด็ก”; มองเห็นบริบทที่กว้างขึ้น จับสำนวนและน้ำเสียงได้ดีขึ้น จุดอ่อน: บางครั้งอาจ "สร้างสรรค์เกินไป" และเพิ่มแหล่งที่มา (เสี่ยงต่อภาพหลอน) สูญเสียการเชื่อมโยงกันในข้อความยาวๆ และต้นทุน/ความเร็วจะแตกต่างกันไปขึ้นอยู่กับงาน

หลักทั่วไป: ข้อความทางเทคนิคที่ตรงไปตรงมา ซ้ำๆ กัน NMT มักจะรวดเร็วและเพียงพอ LLM มีความยืดหยุ่นมากขึ้นกับเนื้อหาที่ต้องมีวินัยทั้งน้ำเสียง บริบท คำศัพท์ และการสอน ผู้เชี่ยวชาญส่วนใหญ่ในปัจจุบันใช้ทั้งสองอย่างร่วมกัน: Quick Draft จาก NMT, Tone/Term Correction จาก LLM

เคล็ดลับ: คุณภาพเครื่องของคู่ภาษา (เช่น ตุรกี → อังกฤษ) อาจแตกต่างจากทิศทางตรงกันข้าม (อังกฤษ → ตุรกี) ภาษาที่มีไวยากรณ์ที่เชื่อมโยงและยืดหยุ่น เช่น ภาษาตุรกี โดยทั่วไปแล้วจะมีความท้าทายมากกว่าสำหรับ MT ตัดสินด้วยตัวคุณเองว่าเครื่องยนต์ไหนดีกว่าในคู่ของคุณเองด้วยข้อความตัวอย่างบางส่วน

ความเข้ากันได้ของเครื่องกับข้อความ: ถามสิ่งนี้ก่อน

ไม่ใช่ทุกข้อความจะเหมาะกับเครื่องเท่ากัน ก่อนเริ่มการแปล ให้ส่งข้อความผ่านตัวกรอง "ความเหมาะสม":

  • เหมาะสำหรับเครื่องจักร: คู่มือทางเทคนิค รายละเอียดสินค้า ข้อความอินเทอร์เฟซที่ซ้ำกัน การโต้ตอบมาตรฐาน ตาราง/รายการ ภาษาก็ธรรมดา คำศัพท์ก็ตายตัว ความคิดสร้างสรรค์ก็หายาก
  • สื่อที่เหมาะสม: ข่าว เนื้อหาองค์กร สื่อการศึกษา เครื่องจักรสร้างโครงร่างที่ดี แต่ต้องมีการแก้ไขโทนและโฟลว์หลังการแก้ไขอย่างจริงจัง
  • ไม่เหมาะกับเครื่องจักร (มีความเสี่ยงสูง): สัญญาทางกฎหมาย ข้อความทางการแพทย์ โฆษณา/สโลแกน ข้อความวรรณกรรม อารมณ์ขัน บทกวี ที่นี่เครื่องจักรให้แต่ไอเดียเท่านั้น งานส่วนใหญ่ตกอยู่กับผู้คน

หากคุณสร้างความแตกต่างนี้ตั้งแต่ต้น คุณทั้งคู่จะให้เวลา/ราคาที่เหมาะสมแก่ลูกค้า และป้องกันตัวเองจากการเชื่อใจในผลผลิตดิบอย่างสุ่มสี่สุ่มห้า

วัดคุณภาพผลผลิตดิบได้อย่างรวดเร็ว

เมื่อคุณเห็นผลลัพธ์ MT คุณจะสงสัยว่า "มันดีหรือไม่ดี" ตอบคำถามด้วยรายการตรวจสอบสั้นๆ ไม่ใช่สัญชาตญาณ ดูมิติทั้งห้านี้: ความถูกต้อง (ความหมายตรงตามแหล่งที่มาหรือไม่) ความสมบูรณ์ (ละเว้นหรือเพิ่มประโยคหรือไม่) คำศัพท์ (ถูกต้องและสอดคล้องกันหรือไม่) ความคล่องแคล่ว (เป็นธรรมชาติในภาษาเป้าหมายหรือไม่) รูปแบบ (แท็ก ตัวเลข การจัดรูปแบบถูกเก็บรักษาไว้หรือไม่) เราจะขยายมิติเหล่านี้ให้ลึกซึ้งยิ่งขึ้นในหน่วยคุณภาพถัดไป สำหรับตอนนี้ ให้มันเป็นภาพสะท้อนก่อนส่งมอบของคุณ

ข้อควรระวัง: ข้อผิดพลาดที่อันตรายที่สุดของเอาท์พุต MT คือข้อผิดพลาด "คล่องแต่ไม่ถูกต้อง" ประโยคอาจเป็นภาษาตุรกีที่สมบูรณ์แบบ แต่ "ส่วนลด 15%" ในแหล่งที่มาอาจเปลี่ยนเป็น "ส่วนลด 50%" อย่าท้อถอยกับความคล่องแคล่ว ควรพิจารณาตัวเลข ลบ และคำนามเฉพาะแยกกันเสมอ

มินิเคสสามอัน

กรณีที่ 1 — เครื่องยนต์ที่เหมาะสมสามารถลดเวลาได้ครึ่งหนึ่ง นักแปลคนหนึ่งเลือกที่จะแปลอินเทอร์เฟซซอฟต์แวร์ความยาว 12,000 คำด้วย NMT และหนังสือการตลาดเล่มเล็กด้วย LLM ความสอดคล้องของ NMT ที่อินเทอร์เฟซทำให้ทำงานเร็วขึ้น ความยืดหยุ่นด้านวรรณยุกต์ของ LLM ในหนังสือเล่มเล็กช่วยลดภาระในการเขียนใหม่ลง 40% การให้ทั้งสองงานใช้เครื่องยนต์เดียวกันจะทำให้เสียเวลา

กรณีที่ 2 — การประเมินล่วงหน้าช่วยประหยัดราคา สำนักงานแห่งหนึ่งกำลังจะเสนอข้อความทางกฎหมายเพราะ "เครื่องจักรก็สร้างได้ ราคาถูก" ในการประเมินก่อนมีการแปลตัวอย่าง 500 คำ เครื่องส่งคืนเงื่อนไขทางกฎหมายสองข้อโดยเทียบเท่ากับระบบที่ไม่ถูกต้อง สำนักงานกำหนดราคางานนี้ว่าเป็น "การโพสต์การแก้ไขอย่างหนัก" และกำหนดเส้นตายตามความเป็นจริง เขาหลีกเลี่ยงการสูญเสียเงินเนื่องจากข้อเสนอที่ไม่ถูกต้อง

กรณีที่ 3 — ความแตกต่างของคู่ภาษา ทีมงานคิดว่าเครื่องยนต์ที่ทำงานได้ดีในภาษาอังกฤษ→เยอรมันนั้นมีคุณภาพเหมือนกันในภาษาตุรกี→อารบิก การทดสอบ 300 คำแสดงให้เห็นว่าผลลัพธ์ของภาษาอาหรับจำเป็นต้องมีการแก้ไขเพิ่มเติมมาก ทีมงานจัดสรรกลไกที่แตกต่างกันและงบประมาณหลังการแก้ไขที่แตกต่างกันขึ้นอยู่กับคู่ภาษา

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) การประเมินความเหมาะสมของข้อความ:

บทบาทของคุณ: ผู้เชี่ยวชาญ MTPE อาวุโส ให้คะแนนข้อความต่อไปนี้ว่าเหมาะสมกับการแปลด้วยคอมพิวเตอร์: ตามตัวอักษร/ทางเทคนิค หรือสร้างสรรค์/ตามบริบท? จัดประเภทเป็น (1) เป็นมิตรกับเครื่องจักรมาก (2) ปานกลาง (3) มีความเสี่ยงสูง และเขียนเหตุผลของคุณ ประมาณภาระงานหลังการแก้ไขที่คาดหวังไว้เป็นเบา/ปานกลาง/หนัก ตัวอย่างข้อความ: [วาง 200-300 คำ]

2) การแปล LLM ที่แนะนำ (พร้อมคำศัพท์และการควบคุมโทนเสียง):

แปลข้อความนี้ [แหล่งที่มา]→[เป้าหมาย].ผู้ชม: [ใคร] โทนเสียง: [เช่น เป็นทางการ]. ฟิลด์: [เช่น การเงิน].รายการคำศัพท์ (โปรดใช้): [A→a, B→b].กฎ: ห้ามเติมสิ่งที่ไม่มีในแหล่งที่มา เก็บตัวเลข/วันที่/ชื่อ แทนที่แต่ละประโยคด้วยประโยค ทำเครื่องหมายจุดที่คุณไม่แน่ใจด้วย [?] ข้อความ: [...]

3) การเปรียบเทียบเครื่องยนต์สองเครื่อง:

ด้านล่างนี้คือคำแปลสองคำที่ต่างกันของประโยคต้นฉบับเดียวกัน (A และ B) เปรียบเทียบแต่ละข้อในแง่ของความถูกต้อง คำศัพท์ และความเป็นธรรมชาติ แล้วบอกฉันว่าอันไหนต้องการการแก้ไขน้อยกว่าพร้อมเหตุผล ที่มา: [...] | การแปล ก: [...] | คำแปล ข: [...]

4) การตรวจสอบผลผลิตดิบอย่างรวดเร็ว:

ด้านล่างนี้คือแหล่งที่มาและการแปลด้วยเครื่อง เพียงทำเครื่องหมายสิ่งต่อไปนี้:(1) ละเว้น/เพิ่มข้อมูล (2) หมายเลข/วันที่/ชื่อไม่ถูกต้อง (3) ข้อผิดพลาดในการปฏิเสธ (4) คำที่ไม่สอดคล้องกัน ไม่ต้องเขียนแก้ไขใดๆ เพียงระบุบริเวณที่มีความเสี่ยง ที่มา: [...] | การแปล: [...]

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ: "แปลข้อความนี้แล้วจะดี" (สำหรับเครื่องยนต์ “ดี” ไม่ได้กำหนดไว้ ไม่มีน้ำเสียง ไม่มีคำ ไม่มีมวล)

Güçlü: "แปลคำอธิบายผลิตภัณฑ์นี้จากภาษาอังกฤษเป็นภาษาตุรกี พื้นที่: อีคอมเมิร์ซ ผู้ชม: ผู้บริโภครุ่นเยาว์ น้ำเสียง: เป็นมิตรแต่มั่นใจ 'ชำระเงิน' → 'ขั้นตอนการชำระเงิน' 'สิ่งที่ปรารถนา' → 'รายการความปรารถนา' เปลี่ยนตัวเลขและชื่อแบรนด์ พูดภาษาตุรกีได้คล่องโดยไม่มีกลิ่นการแปล"

ความแตกต่าง: การตอบสนองที่แข็งแกร่งทำให้เครื่องยนต์มีเป้าหมายที่วัดได้ ผลลัพธ์จะประมาณแบบร่างหลังการแก้ไขโดยตรง

แผนภูมิเปรียบเทียบ NMT กับ LLM

ขนาด

NMT (Google, DeepL)

LLM (ChatGPT, คลอดด์)

ความเร็ว

เร็วมาก

ปานกลาง

รับคำสั่ง/โทนเสียง

อ่อนแอ

แข็งแรง

ปฏิบัติตามรายการคำศัพท์

จำกัด

ดี (พร้อมแจ้ง)

บริบทกว้างๆ

อ่อนแอ

ดี

เสี่ยงต่อการเกิดภาพหลอน

ต่ำ

ปานกลาง (ต้องมีการควบคุม)

งานที่เหมาะสมที่สุด

ตรง/ทางเทคนิค/ซ้ำๆ

โทน/บริบท/ความคิดสร้างสรรค์

ข้อผิดพลาดทั่วไป

  • ใช้เครื่องยนต์ตัวเดียวกันทุกงาน การไม่เลือกเครื่องยนต์ตามลักษณะงานทำให้เสียเวลาและคุณภาพ
  • ให้ราคา/เวลาโดยไม่ต้องประเมินล่วงหน้า การทดสอบคำศัพท์ 200-300 คำเผยให้เห็นความประหลาดใจตั้งแต่ต้น
  • เข้าใจผิดว่าคล่องเพื่อความถูกต้อง ประโยคที่สวยงามไม่ได้หมายถึงประโยคที่ถูกต้อง
  • ไม่สนใจคู่ภาษาและทิศทางที่แตกต่างกัน เครื่องยนต์ที่ดีในคู่หนึ่งอาจอ่อนแอในอีกคู่หนึ่ง
  • ไม่สังเกตเห็นการเพิ่มเติมของ LLM บางครั้ง LLM จะเพิ่มประโยคที่ไม่ได้อยู่ในแหล่งที่มา "to help"; ตรวจสอบสิ่งนี้

หน้าต่างบริบทและความสม่ำเสมอ

เมื่อแปลข้อความขนาดยาวด้วย LLM จำเป็นต้องทราบขีดจำกัดทางเทคนิคประการหนึ่ง นั่นคือ หน้าต่างบริบท — จำนวนข้อความที่โมเดลสามารถ "เห็น" และจดจำได้ในแต่ละครั้ง หากข้อความมีขนาดใหญ่กว่าหน้าต่างนี้ คุณจะต้องแบ่งออกเป็นส่วนๆ และแบบจำลองอาจ "ลืม" ในส่วนถัดไปถึงการตัดสินใจหรือน้ำเสียงที่คุณทำไว้ในส่วนก่อนหน้า ดังนั้น แทนที่จะแปลหนังสือหรือเอกสารขนาดยาวเป็นชิ้นเดียว การเตือนคำศัพท์และสรุปสไตล์แต่ละส่วนจะรักษาความสอดคล้องกัน ปัญหานี้ไม่เกิดขึ้นในข้อความสั้นๆ อย่างไรก็ตาม ในงานยาวๆ เช่น นวนิยายและคู่มือ จำเป็นต้องตรวจสอบความสม่ำเสมอของเนื้อเรื่องเพิ่มเติม วิธีแก้ปัญหาในทางปฏิบัติ: เพื่อเตรียม "หน่วยความจำโครงการ" (คำศัพท์ + อักขระ + การตัดสินใจเกี่ยวกับโทนเสียง) และเพิ่มลงในจุดเริ่มต้นของแต่ละชิ้น และสแกนหาความสอดคล้องระหว่างชิ้นส่วนต่างๆ เมื่อสิ้นสุดการแปล ใน NMT ปัญหานี้เกิดขึ้นในลักษณะที่แตกต่างออกไป เนื่องจาก NMT แปลประโยคต่อประโยค ความสอดคล้องของความยาวของย่อหน้าจึงอ่อนแออยู่แล้ว ดังนั้น termbase จึงใช้คำว่าวินัย

โดยสรุป

การแปลด้วยเครื่องมีสองกลุ่ม: NMT ซึ่งรวดเร็วและสม่ำเสมอ และ LLM ซึ่งรับคำสั่งและมองเห็นบริบทและโทนเสียงได้ดีขึ้น นักแปลผู้เชี่ยวชาญจะให้คะแนนความเหมาะสมของข้อความสำหรับเครื่องล่วงหน้า เลือกเครื่องยนต์ตามงาน วัดคุณภาพของผลลัพธ์ดิบอย่างรวดเร็วก่อนส่งมอบ และไม่สับสนระหว่างความคล่องกับความแม่นยำ การสะท้อนกลับก่อนการประเมินนี้ช่วยให้คุณทั้งให้เวลา/ราคาตามความเป็นจริงและป้องกันตัวเองจากความไว้วางใจที่มองไม่เห็น

งานสมัคร

แปลข้อความ 200 คำเดียวกันด้วยเครื่องมือ NMT และ LLM เปรียบเทียบผลลัพธ์ทั้งสองในห้ามิติ (ความถูกต้อง ความครบถ้วน คำศัพท์ ความคล่องแคล่ว รูปแบบ) และเขียนเหตุผลที่ทำให้ข้อความนี้ไม่ต้องแก้ไขภายหลังน้อยกว่า จากนั้นตั้งค่าสถานะปัญหา/เหตุฉุกเฉิน/ความเสี่ยงระยะยาวทั้งสองรายการด้วยเทมเพลต "การตรวจสอบผลลัพธ์ดิบแบบด่วน"

รายการตรวจสอบ

  • [ ] ฉันจัดประเภทความเหมาะสมของข้อความสำหรับเครื่อง (ความเสี่ยงต่ำ/ปานกลาง/สูง)
  • [ ] ฉันตัดสินใจว่าจะใช้ NMT หรือ LLM ขึ้นอยู่กับประเภทงาน
  • [ ] ฉันทำการประเมินเบื้องต้นโดยใช้ตัวอย่างเล็กๆ น้อยๆ และกำหนดระยะเวลา/ราคาตามนั้น
  • [ ] ฉันตรวจสอบเอาท์พุตดิบในห้ามิติอย่างรวดเร็ว
  • [ ] ฉันตรวจสอบหมายเลข วันที่ ชื่อ และเครื่องหมายลบแยกกันโดยไม่ถูกหลอกจากความคล่อง