กำไร:
- ทำความเข้าใจแนวคิดของหน่วยความจำการแปล (TM) การจับคู่และการแบ่งกลุ่มแบบคลุมเครือ และสามารถใช้ความแตกต่างในการจับคู่แบบคลุมเครือโดยการปรับเปลี่ยนแทนที่จะสุ่มสี่สุ่มห้า
- ความสามารถในการใช้วินัยในการเขียนเฉพาะการแปลที่ได้รับอนุมัติไปยัง TM โดยแยก TM ของลูกค้าออกจากกัน และดำเนินการบำรุงรักษา TM
- ความสามารถในการปกป้องความเป็นส่วนตัวโดยการควบคุมว่าข้อมูลจะไปอยู่ที่ไหนในการบูรณาการ MT/LLM ภายใน CAT
การแปลโดยมืออาชีพมักทำในเครื่องมือ CAT ไม่ใช่ในโปรแกรมแก้ไขข้อความธรรมดา ในหน่วยนี้ คุณจะได้เรียนรู้เครื่องมือ CAT หน่วยความจำการแปล (TM) ซึ่งเป็นหัวใจสำคัญของการแปล วิธีการทำงานร่วมกันกับการแปลด้วยเครื่องและ LLM และวิธีการใช้ระบบนิเวศนี้อย่างมีประสิทธิภาพและปลอดภัย เป้าหมายคือการเป็นผู้ใช้เทคโนโลยีการแปลที่จัดการทั้งโปรเจ็กต์ ไม่ใช่แต่ละประโยค ในลักษณะที่สอดคล้องกัน รวดเร็ว และตรวจสอบย้อนกลับได้
แนวคิดพื้นฐาน
เครื่องมือ CAT (การแปลด้วยคอมพิวเตอร์ช่วย) เป็นซอฟต์แวร์ระดับมืออาชีพ (เช่น Trados, memoQ, Phrase, MateCat) ที่จัดระเบียบประโยคการแปลตามประโยค (เซ็กเมนต์) และเชื่อมต่อหน่วยความจำการแปลและฐานคำศัพท์ แสดงแหล่งที่มาและเป้าหมายเคียงข้างกัน จับการทำซ้ำ รักษาการจัดรูปแบบ
TM (หน่วยความจำการแปล) เป็นฐานข้อมูลที่เก็บคู่ประโยคต้นทาง-เป้าหมายที่คุณได้แปลไว้ก่อนหน้านี้ เมื่อมีประโยคใหม่มาถึง หากมีประโยคที่คล้ายกันใน TM เจ้าหน้าที่จะแนะนำให้คุณ แนวคิดหลักที่นี่คือการจับคู่แบบคลุมเครือ: ความคล้ายคลึงกันของประโยคใหม่กับประโยคใน TM (100% = เหมือนกันทุกประการ, 85% = คล้ายกันมาก) การจับคู่ที่สูงจะทำให้งานเร็วขึ้นเนื่องจากคุณนำคำแปลก่อนหน้านี้มาใช้ซ้ำ
ส่วนคือหน่วยพื้นฐานของการแปล ซึ่งโดยปกติจะเป็นประโยค เครื่องมือ CAT แบ่งข้อความออกเป็นส่วนๆ และแก้ไขแต่ละส่วนแยกกัน
ความสำคัญของ TM: MT จะสร้างฉบับร่าง แต่ TM จะส่งคืนคำแปลในอดีตที่ผ่านการอนุมัติและมีคุณภาพของมนุษย์ ทั้งสองมีความแตกต่างกัน: MT คือการทำนาย TM คือความทรงจำ
Tip: Do not confuse TM and MT. โดยทั่วไปการจับคู่ TM 100% (คำแปลที่คุณอนุมัติก่อนหน้านี้) มีความน่าเชื่อถือ คำแนะนำ MT ควรได้รับการตรวจสอบเสมอ เครื่องมือ CAT แสดงทั้งสองแบบด้วยสี/ป้ายกำกับที่ต่างกัน เห็นความแตกต่างนี้เสมอ
บูรณาการ MT และ LLM เข้ากับ CAT
เครื่องมือ CAT สมัยใหม่เรียกกลไก MT และ LLM ที่เพิ่มขึ้นเป็นการภายใน: หากไม่มีการจับคู่ใน TM เอเจนต์จะส่งคืนคำแนะนำ MT สำหรับเซ็กเมนต์โดยอัตโนมัติ คุณแก้ไขภายหลัง (เช่น MTPE โฟลว์ใน CAT) เครื่องมือรุ่นล่าสุดยังรวม LLM ไว้ด้วย: คุณสามารถดำเนินการต่างๆ เช่น "เขียนส่วนนี้ใหม่ด้วยน้ำเสียงนี้" "แก้ไขคำนี้เป็น termbase" ฯลฯ ในเครื่องมือ
ข้อดีของการบูรณาการนี้: TM, termbase, MT และ LLM รวมอยู่ในหน้าจอเดียว สำหรับแต่ละประโยค จะมีการสร้างโฟลว์ "ดูที่ TM ก่อน ไม่เช่นนั้นก็แนะนำ MT คำว่า QA โดยอัตโนมัติ" ข้อเสียและข้อควรระวัง: ข้อมูลหายไปไหน? การรวม MT/LLM บนคลาวด์สามารถส่งข้อความไปยังเซิร์ฟเวอร์ภายนอกได้ ในการทำงานที่เป็นความลับ นี่อาจเป็นการละเมิดสัญญา ต้องแน่ใจว่ารถยนต์เชื่อมต่อกับเครื่องยนต์ใดและนโยบายข้อมูลใด
การป้อนและการล้างหน่วยความจำการแปล
คุณค่าของ TM นั้นมากพอๆ กับคุณภาพของการแปลในนั้น ขยะเข้าขยะออก สองสาขาวิชา:
- เพียงเขียนคำแปลที่ผ่านการรับรองไปที่ TM หากคุณบันทึกเอาท์พุต MT แบบดิบไปยัง TM โดยไม่ตรวจสอบความถูกต้อง มันจะกลับไปสู่งานในอนาคตของคุณด้วย "หน่วยความจำ" ที่ไม่ดี
- ดำเนินการบำรุงรักษา TM เมื่อเวลาผ่านไป ข้อกำหนดจะเปลี่ยนแปลงและเกิดข้อผิดพลาด ทำความสะอาด TM เป็นระยะ แก้ไขคู่ที่สวมใส่/ไม่ถูกต้อง ในงานนี้ ฉันใช้ LLM เพื่อถามว่า "มีความไม่สอดคล้องกัน/อคติด้านคำศัพท์ในคู่ TM เหล่านี้หรือไม่" คุณสามารถใช้เป็นผู้ตรวจสอบบัญชีได้
ข้อควรระวัง: การใช้ TM ของลูกค้ารายหนึ่งในธุรกิจของลูกค้าอีกรายถือเป็นการละเมิดการรักษาความลับและความเสี่ยงต่อความสับสนของคำศัพท์ TM จะถูกแยกออกจากกันตามไคลเอนต์/โปรเจ็กต์ "ทุกอย่าง TM" ที่ผสมปนเปกันจะทำลายทั้งการรักษาความลับและคุณภาพ
มินิเคสสามอัน
กรณีที่ 1 — TM บินรีเพลย์ ผู้ผลิตรายหนึ่งกำลังแปลตระกูลผลิตภัณฑ์ โดยที่ 70% ของคู่มือยังคงเหมือนเดิมปีแล้วปีเล่า ต้องขอบคุณ TM ที่ทำให้การจับคู่แบบคลุมเครือสูง 100% เกิดขึ้นโดยอัตโนมัติในทุกเวอร์ชันใหม่ มีเพียงประมาณ 9,000 คำจากทั้งหมด 30,000 คำเท่านั้นที่เป็นการแปลใหม่จริง เวลาและต้นทุนลดลงหนึ่งในสาม
กรณีที่ 2 — Dirty TM เผยแพร่ข้อผิดพลาด ทีมหนึ่งได้บันทึกเอาต์พุต MT แบบดิบลงใน TM โดยไม่มีการตรวจสอบยืนยัน หนึ่งปีต่อมา การแปลผิดแบบเดิมก็เกิดขึ้นซ้ำแล้วซ้ำเล่า โดยปรากฏว่า "เชื่อถือได้" ตรงกัน 100% ข้อผิดพลาดแพร่กระจายไปยังเอกสารต่างๆ 14 เอกสาร ทีมงานได้จัดทำกฎ "การแปลที่ผ่านการรับรองเป็น TM เท่านั้น" และทัวร์ชมการทำความสะอาด
กรณีที่ 3 — การรักษาความลับรั่วไหลในการบูรณาการ นักแปลทำงานที่เป็นความลับในโครงการ CAT ที่เชื่อมต่อกับคลาวด์ MT โดยอัตโนมัติ ข้อความส่งไปยังกลไกภายนอกซึ่งมีนโยบายข้อมูลไม่ชัดเจน เมื่อสังเกตเห็น การรวม MT สำหรับโปรเจ็กต์ลับถูกปิด และใช้เฉพาะเอ็นจิ้นระดับองค์กรที่ "ไม่จัดเก็บ/ฝึกอบรมข้อมูล" เท่านั้น
เทมเพลตที่สามารถคัดลอกได้สี่แบบ
1) การประเมินการจับคู่แบบคลุมเครือ (ถึง LLM):
ด้านล่างนี้คือประโยคต้นฉบับใหม่ ประโยคที่คล้ายกันใน TM และคำแปลที่ได้รับอนุมัติ บอกฉันให้ชัดเจนถึงสิ่งที่ฉันต้องเปลี่ยนแปลงเพื่อปรับการแปล TM ให้เป็นประโยคใหม่ อย่าแนะนำการเปลี่ยนแปลงที่ไม่จำเป็น แสดงความแตกต่างในความหมายได้อย่างชัดเจน แหล่งที่มาใหม่: [...] | ที่มาของ TM: [...] | การแปล TM: [...]
2) การตรวจสอบความสอดคล้องของ TM:
ด้านล่างนี้คือคู่แหล่งที่มา-เป้าหมายจาก TM ทำเครื่องหมายความไม่สอดคล้องกันและการเบี่ยงเบนคำศัพท์ที่มีการแปลประโยคต้นฉบับที่เหมือนกันหรือคล้ายกันมากต่างกัน แค่ระบุปัญหาคู่รัก: [...]
3) การเขียนโทนเซ็กเมนต์ใหม่ (LLM ใน CAT):
สร้างกลุ่มเป้าหมายต่อไปนี้ [โทนเสียงที่ต้องการ] โดยไม่เปลี่ยนความหมาย ปฏิบัติตามรายการข้อกำหนด: [...] เก็บเบอร์และชื่อไว้.. ส่งออกเฉพาะส่วนที่เขียนใหม่เท่านั้น ส่วน: [...]
4) การตรวจสอบความเป็นส่วนตัว/การบูรณาการล่วงหน้า:
ฉันจะใช้การบูรณาการ MT/LLM ในโครงการ CAT ฉันจะอธิบายประเภทของข้อความในโครงการนี้ บอกฉันว่าเหมาะสมหรือไม่ที่จะส่งข้อความนี้ไปยังกลไกภายนอกบนคลาวด์ คำถามอะไร (การเก็บรักษาข้อมูล การฝึกอบรม สถานที่) ที่ฉันควรถามผู้ให้บริการ ประเภทข้อความ/สถานะความเป็นส่วนตัว: [...]
พรอมต์อ่อน / พรอมต์แรง
อ่อนแอ: "ใช้การแปลใน TM" (ยังไม่ชัดเจนว่าอัตราการจับคู่ใดและสิ่งใดที่ต้องปรับเปลี่ยน การคัดลอกแบบสุ่มทำให้เกิดข้อผิดพลาด)
Strong: "ประโยคใหม่นี้ตรงกับประโยคใน TM 90% สร้างขึ้นจากการแปล TM แต่สะท้อนถึงความแตกต่างนี้: แหล่งที่มามี 'รายปี' แทนที่จะเป็น 'รายเดือน' ดังนั้นจึงควรเป็น 'รายปี' แทนที่จะเป็น 'รายเดือน' อย่าเปลี่ยนแปลงสิ่งอื่นใด"
ความแตกต่าง: พรอมต์ที่แข็งแกร่งจะระบุความแตกต่างของการแข่งขัน จะช่วยป้องกันไม่ให้ "ปล่อยให้การแปลแบบเก่าเหมือนเดิม" ซึ่งเป็นข้อผิดพลาดที่พบบ่อยที่สุดของการจับคู่แบบคลุมเครือ
ตารางส่วนประกอบระบบนิเวศ CAT
ส่วนประกอบ
ทำอะไร
ความสัมพันธ์กับเอไอ
TM (หน่วยความจำคำแปล)
ส่งคืนคำแปลที่ผ่านมาที่ได้รับอนุมัติ
เชื่อถือได้; ก่อน MT
เทอมเบส
รับประกันความสม่ำเสมอของคำศัพท์
มันเป็นการแจ้งให้ LLM
คำแนะนำ MT
สเก็ตช์ภาพดิบในส่วนที่ว่างเปล่า
จะต้องมีการโพสต์แก้ไข
บูรณาการ LLM
โทน/เทอม/การเขียนใหม่
ควบคุมดูแลความเป็นส่วนตัว
โมดูลประกันคุณภาพ
ข้อผิดพลาดในการสแกนหมายเลข/คำ/แท็ก
ควบคุมอัตโนมัติ
ข้อผิดพลาดทั่วไป
- ยอมรับการแข่งขันคลุมเครืออย่างสุ่มสี่สุ่มห้า การจับคู่ 85% สามารถซ่อนความแตกต่างในความหมายได้ 15%
- กำลังเขียนเอาต์พุต MT แบบดิบไปยัง TM Dirty TM นำข้อผิดพลาดไปสู่อนาคตและแพร่ขยายออกไป
- การผสมผสาน TM ของลูกค้า/โครงการ การรักษาความลับและความเสี่ยงของความสับสนของคำศัพท์
- ไม่ทราบว่าข้อมูลการรวมไปที่ใด ข้อความที่ซ่อนอาจรั่วไหลออกมาโดยที่คุณไม่รู้ตัว
- ลืมความแตกต่าง TM/MT MT เป็นการประมาณการ TM คือความทรงจำ ทั้งสองไม่ปลอดภัยเท่ากัน
การแปลล่วงหน้าและการจัดตำแหน่ง
สองฟังก์ชัน CAT ขั้นสูงช่วยเร่งกระบวนการทำงานในยุค AI อย่างแรกคือการแปลล่วงหน้า: ที่จุดเริ่มต้นของโปรเจ็กต์ เครื่องมือจะเติม TM และ MT ทุกเซ็กเมนต์โดยอัตโนมัติ แทนที่จะเป็นไฟล์เปล่า คุณจะเริ่มต้นด้วยไฟล์ที่อนุมัติการจับคู่ 100% การจับคู่แบบคลุมเครือกำลังรอการปรับเปลี่ยน และไฟล์ว่างคือแบบร่าง MT การดำเนินการนี้จะเปลี่ยนงานจาก "การเขียนตั้งแต่เริ่มต้น" เป็น "การตรวจสอบและแก้ไข" แต่คุณต้องประเมินแต่ละส่วน แทนที่จะอนุมัติการแปลล่วงหน้าแบบสุ่มสี่สุ่มห้า
ประการที่สองคือการจัดตำแหน่ง: หากคุณมีคู่เอกสารเป้าหมายต้นทางที่เคยแปลมาก่อนแต่ยังไม่ได้เข้าสู่ TM เครื่องมือการจัดตำแหน่งจะจับคู่เอกสารเหล่านั้นทีละเซ็กเมนต์และแปลงเป็น TM ดังนั้นการแปลในอดีตของคุณจึงถูกเพิ่มเข้าไปใน "ความทรงจำ" ข้อควรระวังในการจัดตำแหน่ง: การจับคู่อัตโนมัติไม่ถูกต้องเสมอไป การเลื่อนหลุดของส่วนใดส่วนหนึ่งขัดขวางการจัดตำแหน่งทั้งหมด การตรวจสอบคู่ที่ตรงกันก่อน TMing จะป้องกันความเสี่ยงของ TM ที่สกปรกตั้งแต่แรก ฟังก์ชันทั้งสองนี้เปลี่ยนสินทรัพย์ปัจจุบันของคุณ (การแปลในอดีต) ให้เป็นการลงทุนในธุรกิจในอนาคต
โดยสรุป
เครื่องมือกสท. โดยจะรวมหน่วยความจำคำแปล ฐานข้อมูลคำแปล เครื่องแปล และ LLM ไว้ในสายการผลิตเดียว TM คือหน่วยความจำที่ดึงคำแปลในอดีตที่ได้รับอนุมัติของคุณ และมอบความรวดเร็วในการทำงานซ้ำๆ MT คือการทำนายที่ต้องได้รับการตรวจสอบเสมอ ผู้ใช้ที่เชี่ยวชาญจะปรับความแตกต่างในการจับคู่ที่ไม่ชัดเจนอย่างระมัดระวัง เขียนเฉพาะคำแปลที่ได้รับอนุมัติไปยัง TM แยก TM ของลูกค้าออกจากกัน และปกป้องความเป็นส่วนตัวด้วยการรู้ว่าข้อมูลไปอยู่ที่ใดในการบูรณาการ
งานสมัคร
ตั้งค่าโครงการขนาดเล็กในเครื่องมือ CAT (CAT ออนไลน์ฟรีก็ใช้งานได้): เพิ่ม termbase และ TM ว่าง แปลข้อความ 10 ประโยค บันทึกคำแปลที่ได้รับอนุมัติไปที่ TM จากนั้นแปลข้อความที่สองซึ่งคล้ายกับข้อความแรกมากและปรับการจับคู่แบบคลุมเครือที่ส่งคืนโดย TM ด้วยเทมเพลต "การประเมินการจับคู่แบบคลุมเครือ" สังเกตว่าคุณจะทำผิดกี่ประโยคหากคุณยอมรับ TM อย่างสุ่มสี่สุ่มห้า
รายการตรวจสอบ
- [ ] ฉันเชื่อมต่อ TM และ termbase กับโปรเจ็กต์
- [ ] ฉันใช้ความแตกต่างในการแข่งขันแบบคลุมเครือในการปรับเปลี่ยนแทนที่จะสุ่มสี่สุ่มห้า
- [ ] ฉันเขียนเฉพาะคำแปลที่ได้รับการรับรองซึ่งฉันได้ตรวจสอบแล้วถึง TM เท่านั้น
- [ ] ฉันแยก TM ของลูกค้า/โครงการออกจากกัน
- [ ] ฉันตรวจสอบว่าข้อมูลไปอยู่ที่ไหนในการบูรณาการ MT/LLM