กำไร:
- ความสามารถในการเข้าใจแนวคิดของการถอดเสียงอัตโนมัติและการแยกผู้พูด และแปลงการบันทึกดิบเป็นข้อความที่กำหนดรหัสเวลา
- ความสามารถในการเข้าใจรูปแบบคำบรรยาย (SRT/VTT) ความเร็วในการอ่านและกฎบรรทัด ตลอดจนสร้างและแก้ไขร่างคำบรรยายหลายภาษา
- เข้าใจว่าเป็นความรับผิดชอบของบรรณาธิการในการตรวจสอบคำศัพท์ ชื่อเฉพาะ ข้อผิดพลาดในการใช้เครื่องหมายวรรคตอน และข้อผิดพลาดในการแปลในการถอดเสียงอัตโนมัติก่อนตีพิมพ์
งานหลังการผลิตที่น่าเบื่อและใช้เวลานานที่สุดคือการถอดเสียงแบบดั้งเดิม: บรรณาธิการจะฟังฟุตเทจสัมภาษณ์อย่างไม่มีที่สิ้นสุดโดยพิมพ์แต่ละประโยคด้วยมือ การบันทึกหนึ่งชั่วโมงจะใช้เวลาสี่ถึงห้าชั่วโมงในการถอดเสียงอย่างง่ายดาย ปัญญาประดิษฐ์ได้เปลี่ยนแปลงธุรกิจนี้ไปอย่างสิ้นเชิง ในปัจจุบัน การบันทึกที่มีความยาวหนึ่งชั่วโมงสามารถเปลี่ยนเป็นข้อความที่เข้ารหัสเวลาได้ภายในไม่กี่นาที สิ่งนี้จะช่วยเร่งความเร็วไปป์ไลน์การแก้ไขและเปิดใช้งานการเข้าถึง (คำบรรยายสำหรับผู้ชมที่มีความบกพร่องทางการได้ยินและการรับชมแบบไม่มีเสียง) แต่เอาต์พุตอัตโนมัติไม่เหมาะสำหรับการตีพิมพ์ในรูปแบบดิบ ในหน่วยนี้ เราจะเห็นทั้งพลังและข้อผิดพลาด
เริ่มจากเงื่อนไขกันก่อน การถอดความคือการใส่คำพูดลงในการเขียน การรู้จำเสียงอัตโนมัติ (ASR) เป็นเทคโนโลยีที่แปลเสียงเป็นข้อความ รหัสเวลาเป็นเครื่องหมายที่แสดงว่าข้อความตรงกับวินาทีใดในวิดีโอ การแยกแยะผู้พูดคือการแยกแยะ "ใครพูด" และการแบ่งข้อความเป็นผู้พูด คำบรรยาย (คำบรรยาย/คำบรรยาย) คือข้อความกำกับเวลาที่ปรากฏบนหน้าจอ SRT และ VTT เป็นรูปแบบไฟล์คำบรรยายที่ใช้บ่อยที่สุด ประกอบด้วยลำดับ เวลาเริ่มต้นสิ้นสุด และข้อความของแต่ละบรรทัด ความเร็วในการอ่าน (CPS: ตัวอักษรต่อวินาที) กำหนดระยะเวลาที่บรรทัดจะต้องอยู่บนหน้าจอเพื่อให้ผู้ชมอ่านคำบรรยายได้อย่างสะดวกสบาย
พลังและขีดจำกัดของการถอดเสียงอัตโนมัติ
การถอดเสียงด้วย AI จะถอดเสียงผู้พูดคนเดียวที่ชัดเจนซึ่งบันทึกเป็นภาษาตุรกีที่เหมาะสมด้วยความแม่นยำสูงมาก แต่มันทำให้เกิดข้อผิดพลาดในสถานการณ์ต่อไปนี้ และการรู้สิ่งเหล่านี้ทำให้คุณสามารถกำหนดเป้าหมายการยืนยันได้: ชื่อเฉพาะ (ชื่อบุคคล แบรนด์ สถานที่มักสะกดผิด) คำศัพท์ทางเทคนิคและตัวย่อ คำที่ฟังดูคล้ายกัน (“kar/kar”, “นิ่ง/นิ่ง”) คำพูดที่ทับซ้อนกัน (คนสองคนในเวลาเดียวกัน) เสียงพื้นหลังและดนตรี ความแตกต่างทางภาษาถิ่น/สำเนียง และเครื่องหมายวรรคตอน (คำถามหรือจุดสิ้นสุดประโยค) นอกจากนี้ แบบจำลองอาจ "ได้ยิน" และถอดเสียงคำที่ไม่เคยพูดในช่วงเวลาที่มีเสียงดัง นี่คือภาพหลอนของการถอดเสียง
ตารางต่อไปนี้สรุปเงื่อนไขที่แข็งแกร่งและอ่อนแอสำหรับการถอดเสียงอัตโนมัติ:
สภาพ
ความแม่นยำ
โฟกัสของบรรณาธิการ
ลำโพงตัวเดียว เสียงใส สภาพแวดล้อมเงียบ
สูงมาก
ชื่อที่ถูกต้อง เครื่องหมายวรรคตอน
แผงลำโพงหลายตัว
ปานกลาง
การแยกผู้พูด การพูดทับซ้อนกัน
การบันทึกที่มีเสียงดัง/กลางแจ้ง
ต่ำปานกลาง
คำที่สร้างขึ้นกระโดด
เนื้อหาทางเทคนิค/ศัพท์เฉพาะ
ปานกลาง
การเขียนคำและคำย่อ
คำพูดเน้นเสียง
ตัวแปร
ข้อผิดพลาดของคำความหมาย
รูปแบบคำบรรยายและกฎความสามารถในการอ่าน
คำบรรยายที่ดีไม่ใช่แค่ "ข้อความที่ถูกต้อง" เท่านั้น; จะต้องอ่านได้ มีกฎทั่วไปบางประการในทางปฏิบัติระหว่างประเทศ: โดยทั่วไปบรรทัดคำบรรยายไม่ควรเกินสองบรรทัด แต่ละบรรทัดควรมีความยาวที่เหมาะสม (ประมาณ 37-42 อักขระ) คำบรรยายจะต้องอยู่บนหน้าจอนานพอที่จะอ่านได้ (ปกติ 1-6 วินาที) ความเร็วในการอ่านไม่ควรสูงเกินไป (คำแนะนำส่วนใหญ่ถือว่า ~15-17 ตัวอักษร/วินาทีเป็นขีดจำกัด) เครื่องมือ AI จะแยกคำบรรยายโดยอัตโนมัติ แต่บางครั้งการแยกเหล่านี้จะทำให้ประโยคอยู่ในตำแหน่งที่ไม่ดี (บรรทัดที่ลงท้ายด้วย "และ" ตัวแบ่งที่แบ่งความหมาย) หน้าที่ของบรรณาธิการคือทำให้ข้อความถูกต้องและคล่องแคล่ว
บทบาทของคุณ: ผู้ช่วยแก้ไขคำบรรยาย ด้านล่างคือการถอดเสียงอัตโนมัติ ภารกิจ:1) แบ่งข้อความออกเป็นบล็อกคำบรรยายตามตรรกะ SRT2) แต่ละบล็อกควรมีความยาวสูงสุด 2 บรรทัด แต่ละบรรทัดไม่ควรเกิน ~40 ตัวอักษร3) แบ่งประโยคในตำแหน่งที่มีความหมาย บรรทัดที่ลงท้ายด้วย "และ", "แต่", "นั่น"4) ทำเครื่องหมายคำนามและคำศัพท์เฉพาะด้วยแท็ก [CHECK] เพื่อให้ฉันตรวจสอบได้ด้วยตนเอง5) อย่าเปลี่ยนข้อความ เพียงแค่แยกและทำเครื่องหมาย
แนวคิดแท็ก "[การควบคุม]" ในข้อความแจ้งนี้มีคุณค่า: การที่ AI ทำเครื่องหมายบริเวณที่ไม่แน่ใจหรือมีความเสี่ยง (ชื่อและคำศัพท์ที่เหมาะสม) จะช่วยนำทางสายตาของบรรณาธิการไปยังจุดที่ถูกต้องและป้องกันไม่ให้คนตาบอดไว้วางใจ
คำบรรยายและการแปลหลายภาษา
การเปิดวิดีโอหลายภาษาจะช่วยเพิ่มจำนวนผู้ชม AI สามารถถอดเสียง แปลเป็นภาษาเป้าหมาย และสร้างไฟล์คำบรรยายได้ นี่เป็นความสามารถที่ทรงพลัง แต่ก็มีความเสี่ยงมากที่สุด: เครื่องแปลภาษาสามารถบิดเบือนสำนวน การอ้างอิงทางวัฒนธรรม อารมณ์ขันและการเล่นสำนวน คำศัพท์ และบริบทได้ การแปลประโยค "ฝนตกทั้งแมวและสุนัข" คำต่อคำถือเป็นหายนะ นอกจากนี้ยังมีข้อจำกัดด้านพื้นที่ในการแปลคำบรรยาย: ประโยคในภาษาเป้าหมายอาจยาวกว่าและเกินความเร็วในการอ่าน ด้วยเหตุนี้ การให้คำบรรยายหลายภาษาจึงจำเป็นอย่างยิ่งที่จะต้องให้บุคคลที่รู้ภาษาเป้าหมายตรวจสอบการแปล โดยเฉพาะอย่างยิ่งสำหรับเนื้อหาที่ละเอียดอ่อน เช่น การสร้างแบรนด์ กฎหมาย หรือสุขภาพ การแปลที่ไม่ถูกต้องอาจส่งผลร้ายแรง
แปลกลุ่มคำบรรยายภาษาตุรกีต่อไปนี้เป็นภาษาอังกฤษ กฎ: - ถ่ายโอนสำนวนและเรื่องตลก ไม่ใช่คำต่อคำ แต่ยังคงรักษาความหมายไว้ - ทิ้งชื่อแบรนด์และชื่อผลิตภัณฑ์ไว้เหมือนเดิมไม่ต้องแปล - ให้แต่ละบล็อกรักษาความเร็วในการอ่านไว้ ย่อให้สั้นลงหากจำเป็น แต่อย่าบิดเบือนความหมาย - ระบุการอ้างอิงทางวัฒนธรรมหรือคำศัพท์ที่คุณไม่แน่ใจด้วย [หมายเหตุของผู้แปล]
มินิเคสสามอัน
กรณีที่ 1 — เส้นเร่งความเร็ว ทีมงานสารคดีใช้เวลาสามสัปดาห์ในการถอดความบทสัมภาษณ์ความยาว 12 ชั่วโมง ด้วยการถอดเสียงอัตโนมัติ ข้อความดิบจะถูกส่งออกในหนึ่งวัน ด้วยการค้นหาผ่านข้อความ (คำต่อคำ) ทีมงานจึงพบช่วงเวลาที่ต้องการได้ในไม่กี่วินาที จากนั้นพวกเขาก็ตัดต่อและซับไตเติลอย่างพิถีพิถันเฉพาะตอนความยาว 40 นาทีที่จะใช้เท่านั้น สามสัปดาห์กลายเป็นสี่วัน ความพยายามในการตรวจสอบมุ่งเน้นไปที่ส่วนที่ใช้
กรณีที่ 2 — คำที่สร้างขึ้น ช่องข่าวถ่ายทอดบทสัมภาษณ์บนท้องถนนที่อึกทึกครึกโครมพร้อมคำบรรยายอัตโนมัติโดยไม่ต้องตรวจสอบ นางแบบ "ได้ยิน" คำที่ไม่ได้พูดในเบื้องหลัง และคำบรรยายแทนคำที่ไม่ได้พูดไปยังผู้ให้สัมภาษณ์ มีกระแสตอบรับบนโซเชียลมีเดียและมีการเผยแพร่การแก้ไขดังกล่าว บทเรียน: ในการบันทึกเสียงที่มีเสียงดัง จะต้องเปรียบเทียบคำบรรยายอัตโนมัติกับเสียงต้นฉบับ
กรณีที่ 3 — ภัยพิบัติจากการแปล แบรนด์หนึ่งเผยแพร่คำบรรยายภาษาอังกฤษของวิดีโอโปรโมตพร้อมการแปลด้วยคอมพิวเตอร์และไม่มีการควบคุม เมื่อสำนวนภาษาตุรกี ("keep an eye out") ได้รับการแปลคำต่อคำ สำนวนนี้ดูไร้ความหมายและตลกสำหรับผู้ชมชาวอังกฤษ และความจริงจังของแบรนด์ก็ได้รับความเสียหาย วิธีที่ถูกต้อง: ให้ผู้ที่รู้ภาษาเป้าหมายตรวจสอบการแปล
พรอมต์อ่อน / พรอมต์แข็งแกร่ง
พรอมต์ที่อ่อนแอ:
บรรยายวิดีโอนี้และแปลเป็นภาษาอังกฤษ
ไม่มีการจัดรูปแบบ ไม่มีกฎการอ่าน ไม่มีเครื่องหมายตรวจสอบ ผลผลิตจะหยาบและมีความเสี่ยง
พรอมต์อันทรงพลัง:
บทบาทของคุณ: ผู้แก้ไขคำบรรยายสองภาษา ข้อมูลเข้า: การถอดเสียงแบบรหัสเวลาภาษาตุรกี งาน:1) แก้ไขคำบรรยายภาษาตุรกี 2 บรรทัด / ~40 ตัวอักษร / กฎการแบ่งส่วนที่ดี2) ทำเครื่องหมายชื่อและคำศัพท์เฉพาะด้วย [ควบคุม].3) ผลิตคำแปลภาษาอังกฤษแยกจากกัน; ถ่ายโอนวลีตามตัวอักษร รักษาชื่อแบรนด์ไว้4) ทำเครื่องหมายบล็อกที่เกินความเร็วในการอ่านด้วย [LONG].5) อย่าสร้างคำใดๆ; เขียนเสียงที่ไม่มีกำหนด [UNINDICATED]
ข้อผิดพลาดทั่วไป
- การเผยแพร่ข้อความถอดเสียงอัตโนมัติโดยไม่มีการควบคุม ข้อผิดพลาดในชื่อ คำศัพท์ เครื่องหมายวรรคตอน และคำที่แต่งขึ้นยังคงอยู่
- การแยกบรรทัดไม่ดี บรรทัดที่ลงท้ายด้วย "และ/แต่/กิ" ทำให้การอ่านยาก
- เกินความเร็วในการอ่าน คำบรรยายขนาดยาวที่สั้นเกินไปบนหน้าจอไม่สามารถอ่านได้
- ไม่ตรวจสอบการแปลด้วยเครื่อง หากสำนวน เรื่องตลก หรือคำศัพท์ผิดพลาด แบรนด์จะได้รับผลกระทบ
- ก้าวข้ามความแตกต่างของผู้พูด หากมีความสับสนว่า "ใครพูดอะไร" ในแผง คำบรรยายจะทำให้เข้าใจผิด
เคล็ดลับ: ขณะแก้ไขข้อความถอดเสียง ให้ดูวิดีโอที่ความเร็ว 1.25-1.5 และตรวจสอบว่าวิดีโอซิงโครไนซ์กับคำบรรยายหรือไม่ วิธีนี้ช่วยให้คุณจับทั้งการเลื่อนของไทม์โค้ดและคำที่แต่งขึ้น/พลาดได้อย่างรวดเร็ว
ข้อควรระวัง: ในด้านต่างๆ เช่น การดูแลสุขภาพ กฎหมาย การเงิน การใช้คำที่ถอดความไม่ถูกต้องเพียงคำเดียว (เช่น ปริมาณ หมายเลขส่วนผสม) อาจส่งผลร้ายแรงได้ ในเนื้อหาเหล่านี้ แต่ละหมายเลขและคำศัพท์จะต้องได้รับการตรวจสอบแยกกัน
โดยสรุป
การถอดเสียงและคำบรรยายอัตโนมัติช่วยประหยัดเวลาได้มากที่สุดในขั้นตอนหลังการถ่ายทำและช่วยให้เข้าถึงได้ AI ช่วยลดชั่วโมงการถอดเสียงเป็นนาทีและเปิดใช้งานการค้นหาผ่านข้อความ แต่ผลลัพธ์ไม่เหมาะสำหรับการตีพิมพ์ในรูปแบบดิบ: ชื่อที่ถูกต้อง คำศัพท์ เครื่องหมายวรรคตอน คำที่แต่งขึ้น และการขึ้นบรรทัดใหม่ที่ไม่ดีจะต้องได้รับการแก้ไข กฎความสามารถในการอ่าน (ความยาวบรรทัด ระยะเวลา ความเร็วในการอ่าน) ทำให้ผู้ดูอ่านข้อความได้คล่อง ในคำบรรยายหลายภาษา การแปลด้วยเครื่องจะต้องได้รับการตรวจสอบโดยบุคคลที่รู้ภาษาเป้าหมาย AI รินและแนะนำ ความถูกต้อง ความสามารถในการอ่าน และความหมายเป็นความรับผิดชอบของบรรณาธิการ
งานสมัคร
บันทึกเสียงการสนทนาสั้นๆ (อาจเป็นเสียงของคุณเอง 2-3 นาที) แล้วให้ถอดเสียงโดยอัตโนมัติ เปรียบเทียบผลลัพธ์กับเสียงต้นฉบับ และตั้งค่าสถานะคำนาม คำศัพท์ และข้อผิดพลาดในการใช้เครื่องหมายวรรคตอน ค้นหาข้อผิดพลาดอย่างน้อยห้าข้อ จากนั้น ให้แบ่งข้อความออกเป็นบล็อกคำบรรยายตามกฎข้างต้น แปลเป็นภาษาเดียว และแก้ไขจุดที่มีความเสี่ยงอย่างน้อยสองจุด (สำนวน/คำศัพท์) ในการแปล รายงานกระบวนการและข้อผิดพลาดใดๆ ที่คุณพบ
รายการตรวจสอบ
- [ ] ฉันได้เปรียบเทียบบทถอดเสียงกับเสียงต้นฉบับและแก้ไขข้อผิดพลาดเกี่ยวกับคำนาม/คำ/เครื่องหมายวรรคตอนที่เหมาะสมหรือไม่
- [ ] ฉันได้ตรวจสอบคำที่แต่งขึ้นหรือละเว้นหรือไม่?
- [ ] ฉันได้แก้ไขคำบรรยายตามความยาวบรรทัด ระยะเวลา และกฎความเร็วในการอ่านหรือไม่
- [ ] สำหรับคำบรรยายหลายภาษา ฉันได้ตรวจสอบคำแปลอย่างละเอียดกับผู้ที่รู้ภาษาเป้าหมายหรือไม่
- [ ] ฉันได้ตรวจสอบแต่ละหมายเลขและคำศัพท์ในเนื้อหาที่ละเอียดอ่อนแยกกันหรือไม่