กำไร:
- ความสามารถในการเข้าใจเครื่องมือการแปลงข้อความเป็นคำพูด (TTS) การโคลนเสียง และการพากย์เสียงเทียม (การพากย์/ลิปซิงค์) และสร้างร่างเสียงบรรยาย
- บรรลุการเปล่งเสียงที่เป็นธรรมชาติด้วยโทนเสียง จังหวะ ความเครียด และการออกเสียง และสามารถวางแผนเวอร์ชันหลายภาษาได้
- การโคลนเสียงของบุคคลต้องได้รับความยินยอม ลิขสิทธิ์ และสิทธิ์ส่วนบุคคล การทำความเข้าใจว่าการเลียนแบบเสียงที่ไม่ได้รับอนุญาตถือเป็นการละเมิดจริยธรรมและกฎหมาย
เสียงคือครึ่งหนึ่งของวิดีโอ ผู้ชมสามารถให้อภัยภาพลักษณ์ที่ไม่ดีได้ ไม่ให้อภัยเสียงที่ไม่ดี ในการผลิตแบบดั้งเดิม การพากย์มีราคาแพงและช้า เช่น การหาศิลปินพากย์ ตั้งสตูดิโอ บันทึกเสียง และโทรกลับหากเกิดข้อผิดพลาด ปัญญาประดิษฐ์ได้เปลี่ยนภาพนี้: เครื่องมือแปลงข้อความเป็นคำพูดสามารถแปลงข้อความให้เป็นเสียงธรรมชาติได้ภายในไม่กี่นาที การโคลนเสียงสามารถ "เรียนรู้" เสียงของบุคคลและทำให้พวกเขาพูดประโยคใหม่ได้ เครื่องมือพากย์เทียมสามารถถ่ายโอนวิดีโอไปยังภาษาอื่นให้สอดคล้องกับการเคลื่อนไหวของริมฝีปาก ความสามารถอันทรงพลังแต่ละอย่างเหล่านี้ยังมีความรับผิดชอบด้านจริยธรรมและกฎหมายที่จริงจังอีกด้วย ในหน่วยนี้เราจะครอบคลุมทั้งเทคนิคและขอบเขต
เงื่อนไข Text-to-Speech (TTS) เป็นเทคโนโลยีที่แปลงข้อความที่เขียนเป็นเสียงสังเคราะห์ การโคลนเสียงคือการสร้างแบบจำลองที่เลียนแบบเสียงของคนจริงจากตัวอย่างเสียง การพากย์เสียงเทียมคือการแปลคำพูดของวิดีโอเป็นภาษาอื่นและพากย์เป็นภาษานั้น ซึ่งมักจะทำให้เข้ากันได้กับการเคลื่อนไหวของริมฝีปาก (ลิปซิงค์) ฉันทลักษณ์เป็นรูปแบบของน้ำเสียง ความเครียด และจังหวะการพูด "อารมณ์" ของประโยคส่วนใหญ่มาจากฉันทลักษณ์ ฟอนิมเป็นหน่วยเสียงที่เล็กที่สุดในภาษา ปัญหาการออกเสียงมักจะได้รับการแก้ไขในระดับหน่วยเสียง
เสียงผ่านข้อความเป็นคำพูด
เครื่องมือ TTS เป็นธรรมชาติอย่างน่าประหลาดใจในปัจจุบัน แต่การได้เสียงพากย์ที่ "ดี" จำเป็นต้องควบคุมรถอย่างถูกต้อง การวางข้อความดิบและพูดว่า "อ่าน" จะให้ผลลัพธ์ที่ราบเรียบและเป็นหุ่นยนต์ สำหรับการแสดงด้วยเสียงที่ดี คำแนะนำ: ลักษณะเสียง (อายุ เพศ ความอบอุ่น) น้ำเสียง (จริงใจ จริงจัง ตื่นเต้น) จังหวะ (คำบรรยายช้าๆ หรือการโฆษณาที่มีพลัง) ความเครียด (คำที่ควรโดดเด่น) หยุดชั่วคราว (ลมหายใจ เครื่องหมายวรรคตอน) และการออกเสียง (ชื่อเฉพาะ ตัวย่อ คำต่างประเทศ) เครื่องมือหลายอย่างให้การควบคุมนี้โดยการเพิ่มเครื่องหมายวรรคตอนและคำแนะนำสั้นๆ ให้กับข้อความ หรือใช้มาร์กอัปพิเศษ
บทบาทของคุณ: ผู้ช่วยผู้กำกับเสียง ข้อความ: [ข้อความบรรยาย 60 วินาทีด้านล่าง] คำสั่งเสียง: - ตัวละครเสียง: เสียงผู้หญิงในวัย 30 ของเธอ อบอุ่นและมั่นใจ - น้ำเสียง: สงบ จริงใจ; งดตะโกนในเชิงพาณิชย์ - จังหวะ: ช้าปานกลาง; หายใจสั้น ๆ ในตอนท้ายของแต่ละประโยค - ความเครียด: เน้นคำว่า "ฟรี" และ "30 วัน" เล็กน้อย - การออกเสียง: "AiEdu" -> "ey-edu"; "%" -> "เปอร์เซ็นต์" งาน: เตรียมข้อความที่ทำเครื่องหมายตามคำสั่งนี้ (ระบุตำแหน่งที่การเน้น/หยุดชั่วคราวจะปรากฏ)
อย่าลืมฟังและตรวจสอบเอาต์พุต TTS: ชื่อที่ถูกต้องออกเสียงผิด ความเครียดแปลกๆ และการหยุดชั่วคราวที่ไม่เป็นธรรมชาติถือเป็นเรื่องปกติ ในภาษาตุรกี คำที่มาจากต่างประเทศ โดยเฉพาะคำ ตัวย่อ และตัวเลขทำให้เกิดปัญหา ("2024" -> "สองพันยี่สิบสี่" หรือ "ยี่สิบสี่"?)
การโคลนเสียง: พลังและความรับผิดชอบ
การโคลนเสียงจะสร้างแบบจำลองที่เลียนแบบเสียงของบุคคลจากการบันทึกเพียงไม่กี่นาที มีการใช้ที่ถูกต้องตามกฎหมาย: พากย์เสียงให้สมบูรณ์ด้วยเสียงของผู้นำเสนอโดยได้รับความยินยอมจากผู้นำเสนอในวันที่ลาป่วย การใช้ "เอกลักษณ์เสียง" ที่ได้รับอนุมัติของแบรนด์อย่างสม่ำเสมอ เพื่อให้เสียงของตนเองพูดเป็นภาษาอื่นได้ แต่อำนาจนี้เองที่วาดเส้นจริยธรรมที่ใหญ่ที่สุด: การโคลนนิ่งและการใช้เสียงของบุคคลโดยไม่ได้รับความยินยอมอย่างชัดแจ้งถือเป็นการละเมิดสิทธิส่วนบุคคลและก่อให้เกิดความรับผิดทางกฎหมายในหลายแห่ง เสียงเป็นส่วนหนึ่งของอัตลักษณ์ของบุคคล การเลียนแบบอาจนำไปสู่การฉ้อโกง การหมิ่นประมาท และความเสียหายต่อชื่อเสียง
หลักการพื้นฐานที่ต้องปฏิบัติตามในการโคลนเสียง:
หลักการ
ใบสมัคร
ความยินยอมที่ชัดเจน
ได้รับอนุญาตเป็นลายลักษณ์อักษรจากเจ้าของเสียงที่มีขอบเขตเฉพาะ
ความชัดเจนของขอบเขต
จะใช้ที่ไหน นานแค่ไหน และเพื่อวัตถุประสงค์อะไร?
ความโปร่งใส
เมื่อจำเป็นข้อมูล "เสียงนี้เป็นการผลิตเทียม"
การใช้งานที่จำกัด
ไม่เกินความยินยอม (โครงการใหม่ ผลิตภัณฑ์ที่แตกต่าง)
การหดกลับได้
สิทธิของบุคคลในการเพิกถอนความยินยอม
ข้อควรระวัง: การโคลนเสียงของคนดัง นักการเมือง หรือบุคคลที่คุณรู้จักโดยไม่ได้รับความยินยอมและสร้างเนื้อหา แม้จะตั้งใจให้เป็น "เรื่องตลก" หรือ "ทดลอง" ถือเป็นการละเมิดอย่างร้ายแรง การเผยแพร่เนื้อหาที่ผลิตขึ้นนอกเหนือการควบคุมของคุณไม่สามารถยกเลิกได้
การพากย์หลายภาษา
การพากย์สังเคราะห์เป็นวิธีที่เร็วที่สุดในการเปิดวิดีโอเป็นภาษาต่างๆ: เครื่องมือนี้แปลคำพูด พากย์เป็นภาษาเป้าหมาย และบางครั้งก็ซิงโครไนซ์การเคลื่อนไหวของริมฝีปาก ถือเป็นการปฏิวัติสำหรับผู้สร้างเนื้อหาที่ต้องการเข้าถึงผู้ชมทั่วโลก แต่มันเป็นหนึ่งในจุดที่เปราะบางที่สุดเนื่องจากมีข้อผิดพลาดสามชั้นที่แยกจากกันทับซ้อนกัน: ข้อผิดพลาดในการแปล (สำนวน คำ บริบท) ข้อผิดพลาดในการออกเสียง (โทนเสียงผิด การออกเสียง) และข้อผิดพลาดในการซิงโครไนซ์ (ริมฝีปากไม่ตรงกัน เวลาไม่ตรงกัน) ดังนั้นในการพากย์หลายภาษา จึงจำเป็นสำหรับบุคคลที่รู้ภาษาเป้าหมายในระดับเจ้าของภาษาเพื่อตรวจสอบทั้งการแปลและการพากย์ ความสมบูรณ์ของแบรนด์ ความหมาย และอารมณ์สามารถได้รับการปกป้องโดยการควบคุมของมนุษย์เท่านั้น
มินิเคสสามอัน
กรณีที่ 1 — การพากย์เสียงที่รวดเร็วและมีจริยธรรม ทีมอีเลิร์นนิงต้องอัปเดตการบรรยายของหลักสูตรวิดีโอ 40 หลักสูตร การเรียกคืนศิลปินในการอัปเดตแต่ละครั้งมีราคาแพง พวกเขาทำสัญญาเป็นลายลักษณ์อักษรกับศิลปินโดยระบุขอบเขตของเสียงของเขา/เธอที่ถูกโคลนสำหรับหลักสูตรนี้ ดังนั้นพวกเขาจึงสร้างการเปลี่ยนแปลงข้อความภายในไม่กี่นาทีด้วยเสียงและการอนุมัติของเขา ศิลปินทั้งสองได้รับค่าธรรมเนียมและรักษาการควบคุมไว้ ทีมได้รับแรงผลักดัน
กรณีที่ 2 — เรื่องอื้อฉาวโคลนโดยไม่ได้รับความยินยอม ผู้สร้างเนื้อหาคัดลอกเสียงของนักพากย์ที่มีชื่อเสียงจากวิดีโอ YouTube ของเขาและนำไปใช้ในโฆษณา ศิลปินจำเสียงของเขาได้ เริ่มกระบวนการทางกฎหมาย และมีการรายงานเหตุการณ์ดังกล่าวในสื่อ ชื่อเสียงของแบรนด์ได้รับความเสียหาย เนื้อหาถูกลบออก และการชดเชยถูกนำเข้าสู่วาระการประชุม บทเรียน: การใช้เสียงโดยไม่ได้รับความยินยอมถือเป็นหายนะทั้งด้านจริยธรรมและกฎหมาย
กรณีที่ 3 — การพากย์ที่ไม่ได้รับการยืนยัน ช่องหนึ่งพากย์วิดีโอเป็นภาษาสเปนโดยไม่ตั้งใจแต่ไม่เคยตรวจสอบเลย คำศัพท์ทางเทคนิคมีการแปลผิดและการพากย์เสียงเน้นที่ทำให้ความหมายของประโยคกลับกัน ผู้ชมชาวสเปนชี้ให้เห็นข้อผิดพลาดในความคิดเห็น ความไว้วางใจได้รับความเสียหาย วิธีที่ถูกต้องคือให้ผู้ที่รู้ภาษาเป้าหมายตรวจสอบมัน
พรอมต์อ่อน / พรอมต์แข็งแกร่ง
พรอมต์ที่อ่อนแอ:
พูดข้อความนี้
ไม่มีลักษณะเสียง น้ำเสียง จังหวะ หรือการออกเสียง เอาต์พุตจะแบนและเป็นหุ่นยนต์
พรอมต์อันทรงพลัง:
บทบาทของคุณ: ผู้กำกับพากย์เสียง วัตถุประสงค์: บรรยายการโปรโมตผลิตภัณฑ์ 45 วินาที เสียง : อายุ 35 ปี เสียงผู้ชายอบอุ่น มั่นใจ น้ำเสียง: ข้อมูล แต่จริงใจ; ไม่มีการพูดเกินจริง จังหวะ: ปานกลาง; ช้าลงเล็กน้อยในประโยคทางเทคนิค เน้น: เน้นคำว่าราคาและการรับประกัน การออกเสียง: "3D" -> "สามมิติ"; ชื่อแบรนด์ [BRAND] ตามที่เป็นอยู่ ผลลัพธ์: ข้อความพากย์เสียงที่มีการเน้นและหยุดชั่วคราว ข้อจำกัด: ใช้เสียงยินยอม/เสียงสังเคราะห์เท่านั้น แอบอ้างเป็นบุคคลจริง
ข้อผิดพลาดทั่วไป
- การอ่านข้อความดิบโดยไม่มีคำแนะนำ หากไม่ระบุน้ำเสียง จังหวะ และการเน้นเสียง เสียงนั้นจะฟังดูเป็นหุ่นยนต์
- การใช้เอาต์พุต TTS โดยไม่ฟัง การออกเสียงผิด (ชื่อเฉพาะ ตัวเลข ตัวย่อ) เป็นเรื่องปกติ
- การโคลนเสียงโดยไม่ได้รับความยินยอม การละเมิดจริยธรรมและกฎหมาย ข้อแก้ตัว "การทดลอง/เรื่องตลก" ไม่ถูกต้อง
- เกินขอบเขตความยินยอม การใช้การอนุญาตสำหรับโครงการในงานอื่นถือเป็นการละเมิด
- ไม่ตรวจสอบการพากย์ ข้อผิดพลาดการแปล + การพากย์ + การซิงโครไนซ์ซ้อนทับกัน
เคล็ดลับ: ใน TTS ให้เขียนตัวเลข ตัวย่อ และชื่อเฉพาะอย่างชัดเจนในข้อความ ("สามสิบเปอร์เซ็นต์", "สามมิติ", "ey-edu") คุณเป็นผู้กำหนดวิธีการออกเสียงแทนที่จะปล่อยให้โมเดลเดา
โดยสรุป
การพากย์สังเคราะห์ การโคลนเสียง และการพากย์จะช่วยเร่งการทำงานด้านเสียงในการผลิตวิดีโอและทำให้เข้าถึงได้ทั่วโลก เพื่อให้ได้ผลลัพธ์ที่ดี ให้แนะนำ TTS ด้วยน้ำเสียง จังหวะ ความเครียด และการออกเสียง และอย่าลืมฟังผลลัพธ์ด้วย การโคลนเสียงนั้นทรงพลัง แต่ยึดหลักจริยธรรมที่ชัดเจนที่สุด: เสียงของบุคคลสามารถใช้ได้โดยได้รับความยินยอมเป็นลายลักษณ์อักษรที่ชัดเจน มีขอบเขต และขอบเขตเท่านั้น การเลียนแบบโดยไม่ได้รับความยินยอมถือเป็นการละเมิด เนื่องจากข้อผิดพลาดในการแปล การพากย์ และการซิงโครไนซ์จะทับซ้อนกันในการพากย์หลายภาษา การตรวจสอบโดยบุคคลที่รู้ภาษาเป้าหมายจึงเป็นสิ่งจำเป็น สร้างเสียงรถยนต์ ความยินยอม ความถูกต้อง และความหมายถือเป็นความรับผิดชอบของคุณ
งานสมัคร
เขียนข้อความบรรยายความยาว 60 วินาที พูดสิ่งนี้ออกมาด้วยเครื่องมือ TTS โดยมีแนวทางโทนเสียง/จังหวะ/ความเครียด/การออกเสียงดังที่กล่าวข้างต้น ฟังผลลัพธ์และค้นหาและแก้ไขที่ออกเสียงผิดอย่างน้อยสามตำแหน่ง (หมายเลข ชื่อเฉพาะ ตัวย่อ) จากนั้นร่าง “แบบฟอร์มยินยอม” ง่ายๆ สำหรับการโคลนเสียง: เสียงของใคร โครงการไหน ระยะเวลาเท่าไร ใช้อะไร สิทธิ์ในการถอน สรุปงานของคุณ
รายการตรวจสอบ
- [ ] ฉันได้แนะนำแนวทางการออกเสียงด้วยน้ำเสียง จังหวะ ความเครียด และการออกเสียงหรือไม่?
- [ ] ฉันได้ฟังเอาต์พุต TTS และแก้ไขข้อผิดพลาดในการออกเสียง/ตัวเลข/ตัวย่อแล้วหรือยัง
- [ ] มีการยินยอมเป็นลายลักษณ์อักษรที่ชัดเจนและเฉพาะเจาะจงสำหรับเสียงที่ฉันโคลน/ใช้หรือไม่
- [ ] ฉันได้แน่ใจหรือไม่ว่าฉันไม่ได้เกินขอบเขตของความยินยอม (สถานที่ ระยะเวลา วัตถุประสงค์)
- [ ] ฉันได้ตรวจสอบเอาต์พุตเสียงพากย์สำหรับการแปล/โทนเสียง/การซิงโครไนซ์กับผู้ที่รู้ภาษาเป้าหมายแล้วหรือไม่?