กำไร:
- ความสามารถในการปรับให้เหมาะสมโดยยังคงรักษาความหมายโดยใช้กฎทางเทคนิคของคำบรรยาย (บรรทัด, ตัวอักษร, CPS)
- ความสามารถในการตรวจสอบข้อผิดพลาดของชื่อและหมายเลขที่ถูกต้องด้วยเสียง พร้อมทั้งเร่งการถอดเสียงและการเข้ารหัสเวลาอัตโนมัติด้วย ASR
- ความสามารถในการจัดการขีดจำกัดของปัญญาประดิษฐ์โดยคำนึงถึงบริบททางภาพ ความแตกต่างของโทนเสียง และลิปซิงค์ในการพากย์
การแปลภาพยนตร์ ละครโทรทัศน์ วิดีโอบริษัท หรือหลักสูตรออนไลน์แตกต่างอย่างสิ้นเชิงจากการแปลข้อความธรรมดา เวลา ความเร็วในการอ่าน รูปภาพบนหน้าจอ เสียง และการเคลื่อนไหวของริมฝีปากของตัวละครก็เป็นข้อจำกัดเช่นกัน ในหน่วยนี้ คุณจะได้เรียนรู้การแปลภาพและเสียง (คำบรรยาย การพากย์เสียง การพากย์เสียง) กฎทางเทคนิคของคำบรรยาย การถอดเสียงและการเข้ารหัสเวลาที่รองรับ AI และข้อผิดพลาดด้านคุณภาพของสาขานี้ จุดมุ่งหมายคือการทำงานเหมือนผู้เชี่ยวชาญด้านการแปลภาพและเสียงที่ "เหมาะกับตาและหูของผู้ฟัง" มากกว่า "แปลข้อความ"
แนวคิดพื้นฐาน
การแปลภาพและเสียง (AVT) คือการแปลเนื้อหาที่มีเสียงและวิดีโอ แบบฟอร์มหลักคือคำบรรยาย การพากย์ และคำอธิบายเสียง คำบรรยายเป็นการสะท้อนคำพูดในรูปแบบลายลักษณ์อักษรบนหน้าจอ การพากย์คือการพากย์เสียงต้นฉบับใหม่ในภาษาเป้าหมาย การพากย์เสียงคือการปิดเสียงต้นฉบับและมีการอ่านคำแปลอยู่ (โดยทั่วไปในสารคดี)
เงื่อนไขทางเทคนิคที่สำคัญสองประการของคำบรรยาย: CPS (อักขระต่อวินาที) จำกัดความเร็วของคำบรรยายเพื่อให้ผู้ชมสามารถอ่านได้อย่างสะดวกสบาย ขีดจำกัดสูงสุดที่ยอมรับโดยทั่วไปคือประมาณ 17 อักขระต่อวินาที (ต่ำกว่าสำหรับเนื้อหาสำหรับเด็ก) Timecode คือเวลาเริ่มต้นและสิ้นสุดที่ระบุว่าคำบรรยายจะปรากฏและหายไปบนหน้าจอเมื่อใด (เช่น 00:01:23,400)
ทำไมมันถึงยาก? เพราะมันหมายถึงการแปลคำบรรยายให้เหมาะสม สองบรรทัด ~42 อักขระต่อบรรทัด เวลาหน้าจออย่างน้อย ~1 วินาทีและสูงสุด ~6 วินาที และขีดจำกัด CPS — คุณต้องปฏิบัติตามสิ่งเหล่านี้ทั้งหมดโดยยังคงความหมายและน้ำเสียงไว้ นั่นเป็นสาเหตุที่การแปลคำบรรยายมักเป็นเรื่องของการบีบอัดและการใช้ถ้อยคำใหม่ ไม่ใช่การแปลแบบคำต่อคำ
เคล็ดลับ: หลีกเลี่ยงการสะท้อนคำว่า "แปลทุกคำ" ในคำบรรยาย ผู้ชมทั้งดูและอ่านภาพ คำบรรยายที่ยาวเกินไปไม่สามารถอ่านได้ การค้นหาการแสดงออกทางธรรมชาติที่สั้นที่สุดเพื่อรักษาความหมายคือความเชี่ยวชาญที่แท้จริงของผู้บรรยาย
บทบาทของ AI ในการแปลภาพและเสียง
AI เร่งความเร็วหลายขั้นตอนในพื้นที่นี้อย่างมีนัยสำคัญ:
- การถอดเสียง: ด้วย ASR (การรู้จำเสียงอัตโนมัติ) เสียงจะถูกถอดเสียงโดยอัตโนมัติ วิธีนี้จะแยกแหล่งที่มาของคำบรรยายภายในไม่กี่นาที
- การเข้ารหัสเวลาอัตโนมัติ: เครื่องมือแบ่งการสนทนาออกเป็นส่วนๆ และสร้างรหัสเวลาแบบร่าง
- ฉบับแปล: มีการแปลข้อความถอดเสียง
- การควบคุม CPS/ความยาว: AI สามารถทำเครื่องหมายว่าคำบรรยายใดเกินความเร็วในการอ่านและแนะนำให้ย่อให้สั้นลง
แต่ระวัง: ASR ผิดพลาดในเรื่องเสียงรบกวน สำเนียง คำพูดที่ทับซ้อนกัน ชื่อเฉพาะ และคำศัพท์ทางเทคนิค ไม่สามารถให้ "คำอธิบายเสียง"; ใครพูดอาจจะสับสน การแปลด้วย AI ไม่เห็นภาพ — ไม่สามารถรู้ได้ว่าเมื่อใดที่วัตถุที่แสดงบนหน้าจอเรียกว่า “สิ่งนั้น” ดังนั้นมนุษย์จึงตรวจสอบบริบทที่มองเห็นและถอดรหัสความแม่นยำ
ข้อควรระวัง: ข้อผิดพลาดที่พบบ่อยที่สุดคือคิดว่าเอาต์พุต ASR นั้น "ถอดรหัสแล้ว" ASR ทำผิดพลาดบ่อยครั้ง โดยเฉพาะอย่างยิ่งในชื่อที่ถูกต้อง ตัวเลข ชื่อแบรนด์ และข้อกำหนดทางเทคนิค การถอดเสียงที่ไม่ถูกต้องจะส่งผลต่อการแปลและคำบรรยาย อย่าลืมตรวจสอบพื้นที่สำคัญด้วยการฟังเสียง
กฎรูปแบบคำบรรยาย
กฎทั่วไป (แตกต่างกันไปตามแพลตฟอร์ม):
- ~37-42 อักขระต่อบรรทัด สูงสุด 2 บรรทัด
- ระยะเวลา: ~1-6 วินาที; หลีกเลี่ยงคำบรรยายแบบ "flash" ที่สั้นมาก
- CPS ไม่เกิน ~17 (เนื้อหาสำหรับผู้ใหญ่)
- แบ่งประโยคที่เหมาะสม (อย่าทิ้ง "และ" หรือ "แต่" ไว้ท้ายบรรทัด)
- หากเป็นไปได้ อย่าข้ามการตัดฉาก (เปลี่ยนช็อต)
- ปฏิบัติตามกฎของแพลตฟอร์มสำหรับรายการต่างๆ เช่น การสบถ เพลง การเขียนบท
มินิเคสสามอัน
กรณีที่ 1 — ASR + หลังการแก้ไขเร็วขึ้น 60% ในตอนแรกทีมงานได้ถอดเสียงและกำหนดเวลาสารคดีความยาว 45 นาทีด้วย ASR จากนั้นจึงแปลและแก้ไขภายหลัง เวลาลดลง 60% เมื่อเทียบกับการถอดเสียง + การเขียนโค้ดเวลาตั้งแต่เริ่มต้น แต่ชื่อและหมายเลขที่ถูกต้องทั้งหมดได้รับการแก้ไขโดยการเปรียบเทียบเสียง
กรณีที่ 2 — ตรวจสอบ CPS ความสามารถในการอ่านที่บันทึกไว้ การแปลวิดีโอการสอนพร้อมคำบรรยายครั้งแรกมีความแม่นยำ แต่ CPS เฉลี่ยอยู่ที่ 24 ผู้ชมตามไม่ทัน รอบการย่อคำบรรยายที่ขับเคลื่อนด้วย AI ให้สั้นลง 30% ลด CPS เหลือ 16 ความหมายถูกเก็บรักษาไว้ อ่านง่ายมา
กรณีที่ 3 — ข้อผิดพลาดบริบทภาพ ในการแปลตาม ASR ตัวละครชี้ไปที่ป้ายบนหน้าจอแล้วพูดว่า "อ่านนั่นสิ"; AI แปลได้ว่า "อ่านแล้ว" แต่ข้อความบนป้ายไม่ได้แปล ทำให้ผู้ชมมองไม่เห็นว่าจะอ่านอะไร คำบรรยายภาพเพิ่มคำบรรยายแยกต่างหากสำหรับคำบรรยายบนหน้าจอ คนที่เห็นภาพก็สร้างความแตกต่าง
เทมเพลตที่สามารถคัดลอกได้สี่แบบ
1) รายการตรวจสอบการถอดเสียง (ASR):
ด้านล่างนี้เป็นการถอดเสียงวิดีโออัตโนมัติ ทำเครื่องหมายข้อผิดพลาดที่อาจเกิดขึ้นในการถอดเสียง: ชื่อเฉพาะ ชื่อแบรนด์ ตัวเลข คำศัพท์ทางเทคนิค ประโยคที่คลุมเครือ/ไม่สมบูรณ์ แสดงรายการเหล่านี้เป็น "ยืนยันด้วยเสียง" อย่าแปล. ถอดเสียง: [...]
2) การแปลคำบรรยาย (CPS/ความยาวจำกัด):
แปลการถอดเสียงต่อไปนี้เป็นคำบรรยาย [ภาษาเป้าหมาย] ข้อจำกัด: แต่ละคำบรรยายต้องยาวสูงสุด 2 บรรทัด บรรทัด ~42 อักขระ CPS ไม่เกิน ~17 ย่อและทำให้เป็นธรรมชาติในขณะที่ยังคงรักษาความหมาย อย่าแปลทีละคำ รักษารหัสเวลา การถอดเสียง + รหัสเวลา: [...]
3) CPS/การตรวจสอบความสามารถในการอ่าน:
คำนวณ CPS โดยประมาณตามระยะเวลาและจำนวนอักขระสำหรับคำบรรยายแต่ละรายการต่อไปนี้ ทำเครื่องหมายข้อใดข้อหนึ่งที่เกิน 17 และเสนอทางเลือกที่สั้นกว่าเพื่อรักษาความหมายไว้ คำบรรยาย (ข้อความ | ระยะเวลาวินาที): [...]
4) การตรวจสอบข้อความบนหน้าจอ / บริบทภาพ:
ในบทสนทนาต่อไปนี้ ให้ทำเครื่องหมายสถานที่ที่อาจอ้างอิงถึงรูปภาพ (ข้อความบนหน้าจอ วัตถุปลายแหลม ป้าย) บอกว่าจำเป็นต้องมีคำบรรยาย/คำอธิบายเพิ่มเติมหรือไม่ โดยสมมติว่าผู้ชมไม่เห็นภาพ บทสนทนา: [...]
พรอมต์อ่อน / พรอมต์แรง
จุดอ่อน: "แปลคำบรรยายเหล่านี้" (ไม่มีความยาว, CPS, กฎบรรทัด; เอาต์พุตไม่พอดีกับหน้าจอ, อ่านไม่ได้)
Güçlü: "แปลบทสนทนานี้เป็นภาษาคำบรรยายภาษาตุรกี แต่ละคำบรรยายต้องมีความยาวสูงสุด 2 บรรทัด บรรทัดละ 42 ตัวอักษร ย่อให้สั้นลงโดยคงความหมายไว้เมื่อจำเป็นเพื่อความรวดเร็วในการอ่าน ให้ภาษาพูดเป็นภาษาตุรกีตามธรรมชาติ ลดคำแสลงลง อย่าแตะรหัสเวลา"
ความแตกต่าง: พรอมต์ที่ชัดเจนให้ข้อจำกัดทางเทคนิคของคำบรรยาย (บรรทัด อักขระ CPS โทน) ผลลัพธ์จะเข้าใกล้คำบรรยายที่ใช้งานได้จริง
แผนภูมิเปรียบเทียบรูปแบบ AVT
รูปแบบ
ทำอะไร
การมีส่วนร่วมของ AI
จุดวิกฤตของมนุษย์
คำบรรยาย
ถอดเสียงคำพูด
ASR, การแปล, CPS
พอดีบริบทภาพ
การทำสำเนา
การพากย์เสียงในภาษาเป้าหมาย
ร่างการแปล
ลิปซิงค์การแสดง
พากย์เสียง
อ่านคำแปลข้างบน
การแปล, การกำหนดเวลา
ไหลลื่นเป็นธรรมชาติ
คำอธิบายเสียง
อธิบายภาพพร้อมเสียง
ข้อความร่าง
การตีความด้วยภาพ (มนุษย์)
ข้อผิดพลาดทั่วไป
- การแปลบันทึก ASR โดยไม่ตรวจสอบ ข้อผิดพลาดเกี่ยวกับชื่อ/หมายเลขที่ถูกต้องจะถูกส่งต่อไปยังคำบรรยาย
- แปลคำต่อคำและเดินทางไปรอบๆ CPS ผู้ชมไม่สามารถอ่านได้ จะต้องทำให้พอดี
- ละเลยบริบทภาพ ข้อความบนหน้าจอและวัตถุปลายแหลมยังคงไม่มีการแปล
- ทำให้การแยกบรรทัดไม่มีจุดหมาย มันทำให้เสียความสามารถในการอ่าน
- ปรับโทนเสียง/รีจิสเตอร์ให้เรียบขึ้น ภาษาถิ่นและคำสแลงของตัวละครหายไป
การพากย์และลิปซิงค์
แม้ว่าข้อจำกัดของการพากย์คือความเร็วในการอ่าน แต่ข้อจำกัดของการพากย์คือเวลาและริมฝีปาก การซิงค์ในการแปลด้วยเสียงพากย์มีสามประเภทที่แตกต่างกัน: ลิปซิงค์ - โดยที่การแปลตรงกับการเคลื่อนไหวของปากของตัวละคร โดยเฉพาะอย่างยิ่งสระเปิดในระยะใกล้; isochrony - บรรทัดการแปลที่มีความยาวเท่ากับบรรทัดเดิม ไม่สั้นหรือยาวเกินไป ท่าทางซิงโครนัส - จับคู่สิ่งที่พูดกับการเคลื่อนไหวของมือและแขนของตัวละคร นั่นเป็นสาเหตุที่ผู้แปลเสียงพากย์มักจะเขียนบรรทัดที่ "ติดหู" เพื่อรักษาความหมายไว้แต่ใช้คำที่แตกต่างไปจากเดิมอย่างสิ้นเชิง ความเที่ยงตรงของคำยังน้อยกว่าคำบรรยายที่นี่ด้วยซ้ำ
AI สามารถจัดทำร่างการแปลดิบและคำเตือนเวลาพากย์ได้ ("บรรทัดนี้ยาวกว่าต้นฉบับ 40% ย่อให้สั้นลง") เทคโนโลยีใหม่ๆ ยังสามารถโคลนเสียงและสร้างเสียงพากย์อัตโนมัติได้ แต่การแสดง อารมณ์ การปรับแต่งการหายใจของตัวละคร และการลิปซิงค์ยังคงเป็นงานของนักแปลและนักพากย์ การพากย์อัตโนมัติจะแสดงโครงร่าง การตัดสินใจทางศิลปะและแบบซิงโครนัสเป็นของมนุษย์ นอกจากนี้ ความยินยอมของบุคคลที่ถูกโคลนเสียงถือเป็นประเด็นสำคัญด้านจริยธรรมและกฎหมาย
โดยสรุป
การแปลด้วยภาพและเสียงเป็นศิลปะในการปรับข้อความให้เหมาะสมภายใต้ข้อจำกัดทางสายตาและหูของผู้ดู: เส้น/อักขระ/ขอบเขตของ CPS ในการบรรยาย ลิปซิงค์ในการพากย์เสียง บริบททางภาพเป็นปัจจัยกำหนดในการแปลทั้งหมด AI เร่งความเร็วในการถอดเสียง การเข้ารหัสเวลา การร่างการแปล และการตรวจสอบ CPS ด้วย ASR แต่ ASR เข้าใจผิดว่าเป็นชื่อและสัญญาณรบกวนที่เหมาะสม ทำให้ไม่สามารถมองเห็นภาพได้ และมนุษย์เป็นผู้ตัดสินใจเรื่องโทนสีที่พอดี คำบรรยายหลักไม่ได้แปลคำต่อคำ ค้นหาสำนวนที่สั้นที่สุดและเป็นธรรมชาติที่สุดที่ยังคงความหมายไว้
งานสมัคร
เลือกคลิปวิดีโอสั้น (2-3 นาที) ถอดเสียงด้วยเครื่องมือ ASR และเปรียบเทียบและแก้ไขบริเวณที่มีความเสี่ยงด้วยเสียงด้วยเทมเพลต “การตรวจสอบการถอดเสียง” จากนั้นแปลด้วยข้อจำกัด CPS ~17 ด้วยเทมเพลต "การแปลคำบรรยาย" และย่อคำบรรยายที่เกินขีดจำกัดด้วย "การควบคุม CPS" หากมีข้อความหรือสัญลักษณ์บนหน้าจอ ให้ใช้ "การตรวจสอบบริบทด้วยภาพ"
รายการตรวจสอบ
- [ ] ฉันตรวจสอบการถอดรหัส ASR ด้วยเสียงสำหรับชื่อ/หมายเลขเฉพาะ
- [ ] ฉันกำหนดคำบรรยายให้พอดีกับบรรทัด/อักขระ/กฎ CPS
- [ ] ฉันย่อให้สั้นลงและแปลงสัญชาติ ไม่ใช่คำต่อคำ โดยคงความหมายไว้
- [ ] ฉันคำนึงถึงบริบทของภาพ (ข้อความบนหน้าจอ ลายเซ็น)
- [ ] ฉันแปลเพื่อรักษาความแตกต่างทางน้ำเสียงและลักษณะนิสัย