หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในการแปลและการตีความ: บทบาท ขอบเขต การรับรองความถูกต้อง ความเป็นส่วนตัว และจริยธรรม 2. พื้นฐานการแปลด้วยเครื่อง: NMT, LLM, การเลือกเครื่องยนต์ และการประเมินล่วงหน้า 3. การแก้ไขหลังการแปลด้วยเครื่อง (MTPE): การแก้ไขภายหลังแบบน้ำหนักเบาและเต็มรูปแบบ 4. การจัดการคำศัพท์และคำศัพท์: ความสม่ำเสมอและภาษาองค์กร 5. การบูรณาการ AI กับเครื่องมือ CAT และหน่วยความจำการแปล (TM) 6. การแปลเป็นภาษาท้องถิ่น (L10n): ซอฟต์แวร์ เว็บ เกม และการปรับตัวทางวัฒนธรรม 7. คำบรรยาย การพากย์ และการแปลภาพและเสียง 8. การควบคุมคุณภาพ (QA) การวัดผลการประเมิน และ LQA 9. การเตรียมล่าม: ล่ามต่อเนื่องและพร้อมกัน 10. บริบท วัฒนธรรม น้ำเสียง และการแปลเชิงสร้างสรรค์ (การแปลงร่าง) 11. การรักษาความลับ จริยธรรม ลิขสิทธิ์ ความถูกต้อง และอนาคตของวิชาชีพ
หน่วย 5 / 11

การบูรณาการ AI กับเครื่องมือ CAT และหน่วยความจำการแปล (TM)

กำไร:

  • ทำความเข้าใจแนวคิดของหน่วยความจำการแปล (TM) การจับคู่และการแบ่งกลุ่มแบบคลุมเครือ และสามารถใช้ความแตกต่างในการจับคู่แบบคลุมเครือโดยการปรับเปลี่ยนแทนที่จะสุ่มสี่สุ่มห้า
  • ความสามารถในการใช้วินัยในการเขียนเฉพาะการแปลที่ได้รับอนุมัติไปยัง TM โดยแยก TM ของลูกค้าออกจากกัน และดำเนินการบำรุงรักษา TM
  • ความสามารถในการปกป้องความเป็นส่วนตัวโดยการควบคุมว่าข้อมูลจะไปอยู่ที่ไหนในการบูรณาการ MT/LLM ภายใน CAT

การแปลโดยมืออาชีพมักทำในเครื่องมือ CAT ไม่ใช่ในโปรแกรมแก้ไขข้อความธรรมดา ในหน่วยนี้ คุณจะได้เรียนรู้เครื่องมือ CAT หน่วยความจำการแปล (TM) ซึ่งเป็นหัวใจสำคัญของการแปล วิธีการทำงานร่วมกันกับการแปลด้วยเครื่องและ LLM และวิธีการใช้ระบบนิเวศนี้อย่างมีประสิทธิภาพและปลอดภัย เป้าหมายคือการเป็นผู้ใช้เทคโนโลยีการแปลที่จัดการทั้งโปรเจ็กต์ ไม่ใช่แต่ละประโยค ในลักษณะที่สอดคล้องกัน รวดเร็ว และตรวจสอบย้อนกลับได้

แนวคิดพื้นฐาน

เครื่องมือ CAT (การแปลด้วยคอมพิวเตอร์ช่วย) เป็นซอฟต์แวร์ระดับมืออาชีพ (เช่น Trados, memoQ, Phrase, MateCat) ที่จัดระเบียบประโยคการแปลตามประโยค (เซ็กเมนต์) และเชื่อมต่อหน่วยความจำการแปลและฐานคำศัพท์ แสดงแหล่งที่มาและเป้าหมายเคียงข้างกัน จับการทำซ้ำ รักษาการจัดรูปแบบ

TM (หน่วยความจำการแปล) เป็นฐานข้อมูลที่เก็บคู่ประโยคต้นทาง-เป้าหมายที่คุณได้แปลไว้ก่อนหน้านี้ เมื่อมีประโยคใหม่มาถึง หากมีประโยคที่คล้ายกันใน TM เจ้าหน้าที่จะแนะนำให้คุณ แนวคิดหลักที่นี่คือการจับคู่แบบคลุมเครือ: ความคล้ายคลึงกันของประโยคใหม่กับประโยคใน TM (100% = เหมือนกันทุกประการ, 85% = คล้ายกันมาก) การจับคู่ที่สูงจะทำให้งานเร็วขึ้นเนื่องจากคุณนำคำแปลก่อนหน้านี้มาใช้ซ้ำ

ส่วนคือหน่วยพื้นฐานของการแปล ซึ่งโดยปกติจะเป็นประโยค เครื่องมือ CAT แบ่งข้อความออกเป็นส่วนๆ และแก้ไขแต่ละส่วนแยกกัน

ความสำคัญของ TM: MT จะสร้างฉบับร่าง แต่ TM จะส่งคืนคำแปลในอดีตที่ผ่านการอนุมัติและมีคุณภาพของมนุษย์ ทั้งสองมีความแตกต่างกัน: MT คือการทำนาย TM คือความทรงจำ

Tip: Do not confuse TM and MT. โดยทั่วไปการจับคู่ TM 100% (คำแปลที่คุณอนุมัติก่อนหน้านี้) มีความน่าเชื่อถือ คำแนะนำ MT ควรได้รับการตรวจสอบเสมอ เครื่องมือ CAT แสดงทั้งสองแบบด้วยสี/ป้ายกำกับที่ต่างกัน เห็นความแตกต่างนี้เสมอ

บูรณาการ MT และ LLM เข้ากับ CAT

เครื่องมือ CAT สมัยใหม่เรียกกลไก MT และ LLM ที่เพิ่มขึ้นเป็นการภายใน: หากไม่มีการจับคู่ใน TM เอเจนต์จะส่งคืนคำแนะนำ MT สำหรับเซ็กเมนต์โดยอัตโนมัติ คุณแก้ไขภายหลัง (เช่น MTPE โฟลว์ใน CAT) เครื่องมือรุ่นล่าสุดยังรวม LLM ไว้ด้วย: คุณสามารถดำเนินการต่างๆ เช่น "เขียนส่วนนี้ใหม่ด้วยน้ำเสียงนี้" "แก้ไขคำนี้เป็น termbase" ฯลฯ ในเครื่องมือ

ข้อดีของการบูรณาการนี้: TM, termbase, MT และ LLM รวมอยู่ในหน้าจอเดียว สำหรับแต่ละประโยค จะมีการสร้างโฟลว์ "ดูที่ TM ก่อน ไม่เช่นนั้นก็แนะนำ MT คำว่า QA โดยอัตโนมัติ" ข้อเสียและข้อควรระวัง: ข้อมูลหายไปไหน? การรวม MT/LLM บนคลาวด์สามารถส่งข้อความไปยังเซิร์ฟเวอร์ภายนอกได้ ในการทำงานที่เป็นความลับ นี่อาจเป็นการละเมิดสัญญา ต้องแน่ใจว่ารถยนต์เชื่อมต่อกับเครื่องยนต์ใดและนโยบายข้อมูลใด

การป้อนและการล้างหน่วยความจำการแปล

คุณค่าของ TM นั้นมากพอๆ กับคุณภาพของการแปลในนั้น ขยะเข้าขยะออก สองสาขาวิชา:

  1. เพียงเขียนคำแปลที่ผ่านการรับรองไปที่ TM หากคุณบันทึกเอาท์พุต MT แบบดิบไปยัง TM โดยไม่ตรวจสอบความถูกต้อง มันจะกลับไปสู่งานในอนาคตของคุณด้วย "หน่วยความจำ" ที่ไม่ดี
  2. ดำเนินการบำรุงรักษา TM เมื่อเวลาผ่านไป ข้อกำหนดจะเปลี่ยนแปลงและเกิดข้อผิดพลาด ทำความสะอาด TM เป็นระยะ แก้ไขคู่ที่สวมใส่/ไม่ถูกต้อง ในงานนี้ ฉันใช้ LLM เพื่อถามว่า "มีความไม่สอดคล้องกัน/อคติด้านคำศัพท์ในคู่ TM เหล่านี้หรือไม่" คุณสามารถใช้เป็นผู้ตรวจสอบบัญชีได้
ข้อควรระวัง: การใช้ TM ของลูกค้ารายหนึ่งในธุรกิจของลูกค้าอีกรายถือเป็นการละเมิดการรักษาความลับและความเสี่ยงต่อความสับสนของคำศัพท์ TM จะถูกแยกออกจากกันตามไคลเอนต์/โปรเจ็กต์ "ทุกอย่าง TM" ที่ผสมปนเปกันจะทำลายทั้งการรักษาความลับและคุณภาพ

มินิเคสสามอัน

กรณีที่ 1 — TM บินรีเพลย์ ผู้ผลิตรายหนึ่งกำลังแปลตระกูลผลิตภัณฑ์ โดยที่ 70% ของคู่มือยังคงเหมือนเดิมปีแล้วปีเล่า ต้องขอบคุณ TM ที่ทำให้การจับคู่แบบคลุมเครือสูง 100% เกิดขึ้นโดยอัตโนมัติในทุกเวอร์ชันใหม่ มีเพียงประมาณ 9,000 คำจากทั้งหมด 30,000 คำเท่านั้นที่เป็นการแปลใหม่จริง เวลาและต้นทุนลดลงหนึ่งในสาม

กรณีที่ 2 — Dirty TM เผยแพร่ข้อผิดพลาด ทีมหนึ่งได้บันทึกเอาต์พุต MT แบบดิบลงใน TM โดยไม่มีการตรวจสอบยืนยัน หนึ่งปีต่อมา การแปลผิดแบบเดิมก็เกิดขึ้นซ้ำแล้วซ้ำเล่า โดยปรากฏว่า "เชื่อถือได้" ตรงกัน 100% ข้อผิดพลาดแพร่กระจายไปยังเอกสารต่างๆ 14 เอกสาร ทีมงานได้จัดทำกฎ "การแปลที่ผ่านการรับรองเป็น TM เท่านั้น" และทัวร์ชมการทำความสะอาด

กรณีที่ 3 — การรักษาความลับรั่วไหลในการบูรณาการ นักแปลทำงานที่เป็นความลับในโครงการ CAT ที่เชื่อมต่อกับคลาวด์ MT โดยอัตโนมัติ ข้อความส่งไปยังกลไกภายนอกซึ่งมีนโยบายข้อมูลไม่ชัดเจน เมื่อสังเกตเห็น การรวม MT สำหรับโปรเจ็กต์ลับถูกปิด และใช้เฉพาะเอ็นจิ้นระดับองค์กรที่ "ไม่จัดเก็บ/ฝึกอบรมข้อมูล" เท่านั้น

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) การประเมินการจับคู่แบบคลุมเครือ (ถึง LLM):

ด้านล่างนี้คือประโยคต้นฉบับใหม่ ประโยคที่คล้ายกันใน TM และคำแปลที่ได้รับอนุมัติ บอกฉันให้ชัดเจนถึงสิ่งที่ฉันต้องเปลี่ยนแปลงเพื่อปรับการแปล TM ให้เป็นประโยคใหม่ อย่าแนะนำการเปลี่ยนแปลงที่ไม่จำเป็น แสดงความแตกต่างในความหมายได้อย่างชัดเจน แหล่งที่มาใหม่: [...] | ที่มาของ TM: [...] | การแปล TM: [...]

2) การตรวจสอบความสอดคล้องของ TM:

ด้านล่างนี้คือคู่แหล่งที่มา-เป้าหมายจาก TM ทำเครื่องหมายความไม่สอดคล้องกันและการเบี่ยงเบนคำศัพท์ที่มีการแปลประโยคต้นฉบับที่เหมือนกันหรือคล้ายกันมากต่างกัน แค่ระบุปัญหาคู่รัก: [...]

3) การเขียนโทนเซ็กเมนต์ใหม่ (LLM ใน CAT):

สร้างกลุ่มเป้าหมายต่อไปนี้ [โทนเสียงที่ต้องการ] โดยไม่เปลี่ยนความหมาย ปฏิบัติตามรายการข้อกำหนด: [...] เก็บเบอร์และชื่อไว้.. ส่งออกเฉพาะส่วนที่เขียนใหม่เท่านั้น ส่วน: [...]

4) การตรวจสอบความเป็นส่วนตัว/การบูรณาการล่วงหน้า:

ฉันจะใช้การบูรณาการ MT/LLM ในโครงการ CAT ฉันจะอธิบายประเภทของข้อความในโครงการนี้ บอกฉันว่าเหมาะสมหรือไม่ที่จะส่งข้อความนี้ไปยังกลไกภายนอกบนคลาวด์ คำถามอะไร (การเก็บรักษาข้อมูล การฝึกอบรม สถานที่) ที่ฉันควรถามผู้ให้บริการ ประเภทข้อความ/สถานะความเป็นส่วนตัว: [...]

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ: "ใช้การแปลใน TM" (ยังไม่ชัดเจนว่าอัตราการจับคู่ใดและสิ่งใดที่ต้องปรับเปลี่ยน การคัดลอกแบบสุ่มทำให้เกิดข้อผิดพลาด)

Strong: "ประโยคใหม่นี้ตรงกับประโยคใน TM 90% สร้างขึ้นจากการแปล TM แต่สะท้อนถึงความแตกต่างนี้: แหล่งที่มามี 'รายปี' แทนที่จะเป็น 'รายเดือน' ดังนั้นจึงควรเป็น 'รายปี' แทนที่จะเป็น 'รายเดือน' อย่าเปลี่ยนแปลงสิ่งอื่นใด"

ความแตกต่าง: พรอมต์ที่แข็งแกร่งจะระบุความแตกต่างของการแข่งขัน จะช่วยป้องกันไม่ให้ "ปล่อยให้การแปลแบบเก่าเหมือนเดิม" ซึ่งเป็นข้อผิดพลาดที่พบบ่อยที่สุดของการจับคู่แบบคลุมเครือ

ตารางส่วนประกอบระบบนิเวศ CAT

ส่วนประกอบ

ทำอะไร

ความสัมพันธ์กับเอไอ

TM (หน่วยความจำคำแปล)

ส่งคืนคำแปลที่ผ่านมาที่ได้รับอนุมัติ

เชื่อถือได้; ก่อน MT

เทอมเบส

รับประกันความสม่ำเสมอของคำศัพท์

มันเป็นการแจ้งให้ LLM

คำแนะนำ MT

สเก็ตช์ภาพดิบในส่วนที่ว่างเปล่า

จะต้องมีการโพสต์แก้ไข

บูรณาการ LLM

โทน/เทอม/การเขียนใหม่

ควบคุมดูแลความเป็นส่วนตัว

โมดูลประกันคุณภาพ

ข้อผิดพลาดในการสแกนหมายเลข/คำ/แท็ก

ควบคุมอัตโนมัติ

ข้อผิดพลาดทั่วไป

  • ยอมรับการแข่งขันคลุมเครืออย่างสุ่มสี่สุ่มห้า การจับคู่ 85% สามารถซ่อนความแตกต่างในความหมายได้ 15%
  • กำลังเขียนเอาต์พุต MT แบบดิบไปยัง TM Dirty TM นำข้อผิดพลาดไปสู่อนาคตและแพร่ขยายออกไป
  • การผสมผสาน TM ของลูกค้า/โครงการ การรักษาความลับและความเสี่ยงของความสับสนของคำศัพท์
  • ไม่ทราบว่าข้อมูลการรวมไปที่ใด ข้อความที่ซ่อนอาจรั่วไหลออกมาโดยที่คุณไม่รู้ตัว
  • ลืมความแตกต่าง TM/MT MT เป็นการประมาณการ TM คือความทรงจำ ทั้งสองไม่ปลอดภัยเท่ากัน

การแปลล่วงหน้าและการจัดตำแหน่ง

สองฟังก์ชัน CAT ขั้นสูงช่วยเร่งกระบวนการทำงานในยุค AI อย่างแรกคือการแปลล่วงหน้า: ที่จุดเริ่มต้นของโปรเจ็กต์ เครื่องมือจะเติม TM และ MT ทุกเซ็กเมนต์โดยอัตโนมัติ แทนที่จะเป็นไฟล์เปล่า คุณจะเริ่มต้นด้วยไฟล์ที่อนุมัติการจับคู่ 100% การจับคู่แบบคลุมเครือกำลังรอการปรับเปลี่ยน และไฟล์ว่างคือแบบร่าง MT การดำเนินการนี้จะเปลี่ยนงานจาก "การเขียนตั้งแต่เริ่มต้น" เป็น "การตรวจสอบและแก้ไข" แต่คุณต้องประเมินแต่ละส่วน แทนที่จะอนุมัติการแปลล่วงหน้าแบบสุ่มสี่สุ่มห้า

ประการที่สองคือการจัดตำแหน่ง: หากคุณมีคู่เอกสารเป้าหมายต้นทางที่เคยแปลมาก่อนแต่ยังไม่ได้เข้าสู่ TM เครื่องมือการจัดตำแหน่งจะจับคู่เอกสารเหล่านั้นทีละเซ็กเมนต์และแปลงเป็น TM ดังนั้นการแปลในอดีตของคุณจึงถูกเพิ่มเข้าไปใน "ความทรงจำ" ข้อควรระวังในการจัดตำแหน่ง: การจับคู่อัตโนมัติไม่ถูกต้องเสมอไป การเลื่อนหลุดของส่วนใดส่วนหนึ่งขัดขวางการจัดตำแหน่งทั้งหมด การตรวจสอบคู่ที่ตรงกันก่อน TMing จะป้องกันความเสี่ยงของ TM ที่สกปรกตั้งแต่แรก ฟังก์ชันทั้งสองนี้เปลี่ยนสินทรัพย์ปัจจุบันของคุณ (การแปลในอดีต) ให้เป็นการลงทุนในธุรกิจในอนาคต

โดยสรุป

เครื่องมือกสท. โดยจะรวมหน่วยความจำคำแปล ฐานข้อมูลคำแปล เครื่องแปล และ LLM ไว้ในสายการผลิตเดียว TM คือหน่วยความจำที่ดึงคำแปลในอดีตที่ได้รับอนุมัติของคุณ และมอบความรวดเร็วในการทำงานซ้ำๆ MT คือการทำนายที่ต้องได้รับการตรวจสอบเสมอ ผู้ใช้ที่เชี่ยวชาญจะปรับความแตกต่างในการจับคู่ที่ไม่ชัดเจนอย่างระมัดระวัง เขียนเฉพาะคำแปลที่ได้รับอนุมัติไปยัง TM แยก TM ของลูกค้าออกจากกัน และปกป้องความเป็นส่วนตัวด้วยการรู้ว่าข้อมูลไปอยู่ที่ใดในการบูรณาการ

งานสมัคร

ตั้งค่าโครงการขนาดเล็กในเครื่องมือ CAT (CAT ออนไลน์ฟรีก็ใช้งานได้): เพิ่ม termbase และ TM ว่าง แปลข้อความ 10 ประโยค บันทึกคำแปลที่ได้รับอนุมัติไปที่ TM จากนั้นแปลข้อความที่สองซึ่งคล้ายกับข้อความแรกมากและปรับการจับคู่แบบคลุมเครือที่ส่งคืนโดย TM ด้วยเทมเพลต "การประเมินการจับคู่แบบคลุมเครือ" สังเกตว่าคุณจะทำผิดกี่ประโยคหากคุณยอมรับ TM อย่างสุ่มสี่สุ่มห้า

รายการตรวจสอบ

  • [ ] ฉันเชื่อมต่อ TM และ termbase กับโปรเจ็กต์
  • [ ] ฉันใช้ความแตกต่างในการแข่งขันแบบคลุมเครือในการปรับเปลี่ยนแทนที่จะสุ่มสี่สุ่มห้า
  • [ ] ฉันเขียนเฉพาะคำแปลที่ได้รับการรับรองซึ่งฉันได้ตรวจสอบแล้วถึง TM เท่านั้น
  • [ ] ฉันแยก TM ของลูกค้า/โครงการออกจากกัน
  • [ ] ฉันตรวจสอบว่าข้อมูลไปอยู่ที่ไหนในการบูรณาการ MT/LLM