หน่วย
1. ข้อมูลเบื้องต้นเกี่ยวกับ AI ในการผลิตวิดีโอ: บทบาท ขอบเขต การรับรองความถูกต้อง ลิขสิทธิ์ และความเป็นส่วนตัว 2. จากแนวคิดสู่สคริปต์: การพัฒนาแนวคิด สคริปต์ และแผนการยิง 3. การเตรียมสตอรี่บอร์ดและภาพ: พรีวิซ การอ้างอิง และการออกแบบการถ่ายทำ 4. การถอดเสียงและคำบรรยาย: คำพูดเป็นข้อความและคำบรรยายหลายภาษา 5. ผู้ช่วยตัดต่อ: การตัดต่อแบบหยาบ, การเลือกฉาก, จังหวะและการตัดต่อ 6. การพากย์เสียง การโคลนเสียง และการพากย์หลายภาษา 7. คลิปสั้นและวิดีโอที่มีประสิทธิภาพ: วิดีโอแปลงข้อความเป็นข้อความ คลิป B-roll และโซเชียลมีเดีย 8. เอฟเฟ็กต์ภาพ, สี, การทำความสะอาดเสียงและการเพิ่มประสิทธิภาพ 9. ชื่อเรื่อง ภาพขนาดย่อ ข้อมูลเมตา และการเพิ่มประสิทธิภาพการกระจาย 10. ลิขสิทธิ์ ความปลอดภัยของแบรนด์ จริยธรรมและการยินยอมของ Deepfake 11. ขั้นตอนการทำงานแบบครบวงจร: ชุดเครื่องมือ ทีม การควบคุมคุณภาพ และการส่งมอบ
หน่วย 6 / 11

การพากย์เสียง การโคลนเสียง และการพากย์หลายภาษา

กำไร:

  • ความสามารถในการเข้าใจเครื่องมือการแปลงข้อความเป็นคำพูด (TTS) การโคลนเสียง และการพากย์เสียงเทียม (การพากย์/ลิปซิงค์) และสร้างร่างเสียงบรรยาย
  • บรรลุการเปล่งเสียงที่เป็นธรรมชาติด้วยโทนเสียง จังหวะ ความเครียด และการออกเสียง และสามารถวางแผนเวอร์ชันหลายภาษาได้
  • การโคลนเสียงของบุคคลต้องได้รับความยินยอม ลิขสิทธิ์ และสิทธิ์ส่วนบุคคล การทำความเข้าใจว่าการเลียนแบบเสียงที่ไม่ได้รับอนุญาตถือเป็นการละเมิดจริยธรรมและกฎหมาย

เสียงคือครึ่งหนึ่งของวิดีโอ ผู้ชมสามารถให้อภัยภาพลักษณ์ที่ไม่ดีได้ ไม่ให้อภัยเสียงที่ไม่ดี ในการผลิตแบบดั้งเดิม การพากย์มีราคาแพงและช้า เช่น การหาศิลปินพากย์ ตั้งสตูดิโอ บันทึกเสียง และโทรกลับหากเกิดข้อผิดพลาด ปัญญาประดิษฐ์ได้เปลี่ยนภาพนี้: เครื่องมือแปลงข้อความเป็นคำพูดสามารถแปลงข้อความให้เป็นเสียงธรรมชาติได้ภายในไม่กี่นาที การโคลนเสียงสามารถ "เรียนรู้" เสียงของบุคคลและทำให้พวกเขาพูดประโยคใหม่ได้ เครื่องมือพากย์เทียมสามารถถ่ายโอนวิดีโอไปยังภาษาอื่นให้สอดคล้องกับการเคลื่อนไหวของริมฝีปาก ความสามารถอันทรงพลังแต่ละอย่างเหล่านี้ยังมีความรับผิดชอบด้านจริยธรรมและกฎหมายที่จริงจังอีกด้วย ในหน่วยนี้เราจะครอบคลุมทั้งเทคนิคและขอบเขต

เงื่อนไข Text-to-Speech (TTS) เป็นเทคโนโลยีที่แปลงข้อความที่เขียนเป็นเสียงสังเคราะห์ การโคลนเสียงคือการสร้างแบบจำลองที่เลียนแบบเสียงของคนจริงจากตัวอย่างเสียง การพากย์เสียงเทียมคือการแปลคำพูดของวิดีโอเป็นภาษาอื่นและพากย์เป็นภาษานั้น ซึ่งมักจะทำให้เข้ากันได้กับการเคลื่อนไหวของริมฝีปาก (ลิปซิงค์) ฉันทลักษณ์เป็นรูปแบบของน้ำเสียง ความเครียด และจังหวะการพูด "อารมณ์" ของประโยคส่วนใหญ่มาจากฉันทลักษณ์ ฟอนิมเป็นหน่วยเสียงที่เล็กที่สุดในภาษา ปัญหาการออกเสียงมักจะได้รับการแก้ไขในระดับหน่วยเสียง

เสียงผ่านข้อความเป็นคำพูด

เครื่องมือ TTS เป็นธรรมชาติอย่างน่าประหลาดใจในปัจจุบัน แต่การได้เสียงพากย์ที่ "ดี" จำเป็นต้องควบคุมรถอย่างถูกต้อง การวางข้อความดิบและพูดว่า "อ่าน" จะให้ผลลัพธ์ที่ราบเรียบและเป็นหุ่นยนต์ สำหรับการแสดงด้วยเสียงที่ดี คำแนะนำ: ลักษณะเสียง (อายุ เพศ ความอบอุ่น) น้ำเสียง (จริงใจ จริงจัง ตื่นเต้น) จังหวะ (คำบรรยายช้าๆ หรือการโฆษณาที่มีพลัง) ความเครียด (คำที่ควรโดดเด่น) หยุดชั่วคราว (ลมหายใจ เครื่องหมายวรรคตอน) และการออกเสียง (ชื่อเฉพาะ ตัวย่อ คำต่างประเทศ) เครื่องมือหลายอย่างให้การควบคุมนี้โดยการเพิ่มเครื่องหมายวรรคตอนและคำแนะนำสั้นๆ ให้กับข้อความ หรือใช้มาร์กอัปพิเศษ

บทบาทของคุณ: ผู้ช่วยผู้กำกับเสียง ข้อความ: [ข้อความบรรยาย 60 วินาทีด้านล่าง] คำสั่งเสียง: - ตัวละครเสียง: เสียงผู้หญิงในวัย 30 ของเธอ อบอุ่นและมั่นใจ - น้ำเสียง: สงบ จริงใจ; งดตะโกนในเชิงพาณิชย์ - จังหวะ: ช้าปานกลาง; หายใจสั้น ๆ ในตอนท้ายของแต่ละประโยค - ความเครียด: เน้นคำว่า "ฟรี" และ "30 วัน" เล็กน้อย - การออกเสียง: "AiEdu" -> "ey-edu"; "%" -> "เปอร์เซ็นต์" งาน: เตรียมข้อความที่ทำเครื่องหมายตามคำสั่งนี้ (ระบุตำแหน่งที่การเน้น/หยุดชั่วคราวจะปรากฏ)

อย่าลืมฟังและตรวจสอบเอาต์พุต TTS: ชื่อที่ถูกต้องออกเสียงผิด ความเครียดแปลกๆ และการหยุดชั่วคราวที่ไม่เป็นธรรมชาติถือเป็นเรื่องปกติ ในภาษาตุรกี คำที่มาจากต่างประเทศ โดยเฉพาะคำ ตัวย่อ และตัวเลขทำให้เกิดปัญหา ("2024" -> "สองพันยี่สิบสี่" หรือ "ยี่สิบสี่"?)

การโคลนเสียง: พลังและความรับผิดชอบ

การโคลนเสียงจะสร้างแบบจำลองที่เลียนแบบเสียงของบุคคลจากการบันทึกเพียงไม่กี่นาที มีการใช้ที่ถูกต้องตามกฎหมาย: พากย์เสียงให้สมบูรณ์ด้วยเสียงของผู้นำเสนอโดยได้รับความยินยอมจากผู้นำเสนอในวันที่ลาป่วย การใช้ "เอกลักษณ์เสียง" ที่ได้รับอนุมัติของแบรนด์อย่างสม่ำเสมอ เพื่อให้เสียงของตนเองพูดเป็นภาษาอื่นได้ แต่อำนาจนี้เองที่วาดเส้นจริยธรรมที่ใหญ่ที่สุด: การโคลนนิ่งและการใช้เสียงของบุคคลโดยไม่ได้รับความยินยอมอย่างชัดแจ้งถือเป็นการละเมิดสิทธิส่วนบุคคลและก่อให้เกิดความรับผิดทางกฎหมายในหลายแห่ง เสียงเป็นส่วนหนึ่งของอัตลักษณ์ของบุคคล การเลียนแบบอาจนำไปสู่การฉ้อโกง การหมิ่นประมาท และความเสียหายต่อชื่อเสียง

หลักการพื้นฐานที่ต้องปฏิบัติตามในการโคลนเสียง:

หลักการ

ใบสมัคร

ความยินยอมที่ชัดเจน

ได้รับอนุญาตเป็นลายลักษณ์อักษรจากเจ้าของเสียงที่มีขอบเขตเฉพาะ

ความชัดเจนของขอบเขต

จะใช้ที่ไหน นานแค่ไหน และเพื่อวัตถุประสงค์อะไร?

ความโปร่งใส

เมื่อจำเป็นข้อมูล "เสียงนี้เป็นการผลิตเทียม"

การใช้งานที่จำกัด

ไม่เกินความยินยอม (โครงการใหม่ ผลิตภัณฑ์ที่แตกต่าง)

การหดกลับได้

สิทธิของบุคคลในการเพิกถอนความยินยอม

ข้อควรระวัง: การโคลนเสียงของคนดัง นักการเมือง หรือบุคคลที่คุณรู้จักโดยไม่ได้รับความยินยอมและสร้างเนื้อหา แม้จะตั้งใจให้เป็น "เรื่องตลก" หรือ "ทดลอง" ถือเป็นการละเมิดอย่างร้ายแรง การเผยแพร่เนื้อหาที่ผลิตขึ้นนอกเหนือการควบคุมของคุณไม่สามารถยกเลิกได้

การพากย์หลายภาษา

การพากย์สังเคราะห์เป็นวิธีที่เร็วที่สุดในการเปิดวิดีโอเป็นภาษาต่างๆ: เครื่องมือนี้แปลคำพูด พากย์เป็นภาษาเป้าหมาย และบางครั้งก็ซิงโครไนซ์การเคลื่อนไหวของริมฝีปาก ถือเป็นการปฏิวัติสำหรับผู้สร้างเนื้อหาที่ต้องการเข้าถึงผู้ชมทั่วโลก แต่มันเป็นหนึ่งในจุดที่เปราะบางที่สุดเนื่องจากมีข้อผิดพลาดสามชั้นที่แยกจากกันทับซ้อนกัน: ข้อผิดพลาดในการแปล (สำนวน คำ บริบท) ข้อผิดพลาดในการออกเสียง (โทนเสียงผิด การออกเสียง) และข้อผิดพลาดในการซิงโครไนซ์ (ริมฝีปากไม่ตรงกัน เวลาไม่ตรงกัน) ดังนั้นในการพากย์หลายภาษา จึงจำเป็นสำหรับบุคคลที่รู้ภาษาเป้าหมายในระดับเจ้าของภาษาเพื่อตรวจสอบทั้งการแปลและการพากย์ ความสมบูรณ์ของแบรนด์ ความหมาย และอารมณ์สามารถได้รับการปกป้องโดยการควบคุมของมนุษย์เท่านั้น

มินิเคสสามอัน

กรณีที่ 1 — การพากย์เสียงที่รวดเร็วและมีจริยธรรม ทีมอีเลิร์นนิงต้องอัปเดตการบรรยายของหลักสูตรวิดีโอ 40 หลักสูตร การเรียกคืนศิลปินในการอัปเดตแต่ละครั้งมีราคาแพง พวกเขาทำสัญญาเป็นลายลักษณ์อักษรกับศิลปินโดยระบุขอบเขตของเสียงของเขา/เธอที่ถูกโคลนสำหรับหลักสูตรนี้ ดังนั้นพวกเขาจึงสร้างการเปลี่ยนแปลงข้อความภายในไม่กี่นาทีด้วยเสียงและการอนุมัติของเขา ศิลปินทั้งสองได้รับค่าธรรมเนียมและรักษาการควบคุมไว้ ทีมได้รับแรงผลักดัน

กรณีที่ 2 — เรื่องอื้อฉาวโคลนโดยไม่ได้รับความยินยอม ผู้สร้างเนื้อหาคัดลอกเสียงของนักพากย์ที่มีชื่อเสียงจากวิดีโอ YouTube ของเขาและนำไปใช้ในโฆษณา ศิลปินจำเสียงของเขาได้ เริ่มกระบวนการทางกฎหมาย และมีการรายงานเหตุการณ์ดังกล่าวในสื่อ ชื่อเสียงของแบรนด์ได้รับความเสียหาย เนื้อหาถูกลบออก และการชดเชยถูกนำเข้าสู่วาระการประชุม บทเรียน: การใช้เสียงโดยไม่ได้รับความยินยอมถือเป็นหายนะทั้งด้านจริยธรรมและกฎหมาย

กรณีที่ 3 — การพากย์ที่ไม่ได้รับการยืนยัน ช่องหนึ่งพากย์วิดีโอเป็นภาษาสเปนโดยไม่ตั้งใจแต่ไม่เคยตรวจสอบเลย คำศัพท์ทางเทคนิคมีการแปลผิดและการพากย์เสียงเน้นที่ทำให้ความหมายของประโยคกลับกัน ผู้ชมชาวสเปนชี้ให้เห็นข้อผิดพลาดในความคิดเห็น ความไว้วางใจได้รับความเสียหาย วิธีที่ถูกต้องคือให้ผู้ที่รู้ภาษาเป้าหมายตรวจสอบมัน

พรอมต์อ่อน / พรอมต์แข็งแกร่ง

พรอมต์ที่อ่อนแอ:

พูดข้อความนี้

ไม่มีลักษณะเสียง น้ำเสียง จังหวะ หรือการออกเสียง เอาต์พุตจะแบนและเป็นหุ่นยนต์

พรอมต์อันทรงพลัง:

บทบาทของคุณ: ผู้กำกับพากย์เสียง วัตถุประสงค์: บรรยายการโปรโมตผลิตภัณฑ์ 45 วินาที เสียง : อายุ 35 ปี เสียงผู้ชายอบอุ่น มั่นใจ น้ำเสียง: ข้อมูล แต่จริงใจ; ไม่มีการพูดเกินจริง จังหวะ: ปานกลาง; ช้าลงเล็กน้อยในประโยคทางเทคนิค เน้น: เน้นคำว่าราคาและการรับประกัน การออกเสียง: "3D" -> "สามมิติ"; ชื่อแบรนด์ [BRAND] ตามที่เป็นอยู่ ผลลัพธ์: ข้อความพากย์เสียงที่มีการเน้นและหยุดชั่วคราว ข้อจำกัด: ใช้เสียงยินยอม/เสียงสังเคราะห์เท่านั้น แอบอ้างเป็นบุคคลจริง

ข้อผิดพลาดทั่วไป

  • การอ่านข้อความดิบโดยไม่มีคำแนะนำ หากไม่ระบุน้ำเสียง จังหวะ และการเน้นเสียง เสียงนั้นจะฟังดูเป็นหุ่นยนต์
  • การใช้เอาต์พุต TTS โดยไม่ฟัง การออกเสียงผิด (ชื่อเฉพาะ ตัวเลข ตัวย่อ) เป็นเรื่องปกติ
  • การโคลนเสียงโดยไม่ได้รับความยินยอม การละเมิดจริยธรรมและกฎหมาย ข้อแก้ตัว "การทดลอง/เรื่องตลก" ไม่ถูกต้อง
  • เกินขอบเขตความยินยอม การใช้การอนุญาตสำหรับโครงการในงานอื่นถือเป็นการละเมิด
  • ไม่ตรวจสอบการพากย์ ข้อผิดพลาดการแปล + การพากย์ + การซิงโครไนซ์ซ้อนทับกัน
เคล็ดลับ: ใน TTS ให้เขียนตัวเลข ตัวย่อ และชื่อเฉพาะอย่างชัดเจนในข้อความ ("สามสิบเปอร์เซ็นต์", "สามมิติ", "ey-edu") คุณเป็นผู้กำหนดวิธีการออกเสียงแทนที่จะปล่อยให้โมเดลเดา

โดยสรุป

การพากย์สังเคราะห์ การโคลนเสียง และการพากย์จะช่วยเร่งการทำงานด้านเสียงในการผลิตวิดีโอและทำให้เข้าถึงได้ทั่วโลก เพื่อให้ได้ผลลัพธ์ที่ดี ให้แนะนำ TTS ด้วยน้ำเสียง จังหวะ ความเครียด และการออกเสียง และอย่าลืมฟังผลลัพธ์ด้วย การโคลนเสียงนั้นทรงพลัง แต่ยึดหลักจริยธรรมที่ชัดเจนที่สุด: เสียงของบุคคลสามารถใช้ได้โดยได้รับความยินยอมเป็นลายลักษณ์อักษรที่ชัดเจน มีขอบเขต และขอบเขตเท่านั้น การเลียนแบบโดยไม่ได้รับความยินยอมถือเป็นการละเมิด เนื่องจากข้อผิดพลาดในการแปล การพากย์ และการซิงโครไนซ์จะทับซ้อนกันในการพากย์หลายภาษา การตรวจสอบโดยบุคคลที่รู้ภาษาเป้าหมายจึงเป็นสิ่งจำเป็น สร้างเสียงรถยนต์ ความยินยอม ความถูกต้อง และความหมายถือเป็นความรับผิดชอบของคุณ

งานสมัคร

เขียนข้อความบรรยายความยาว 60 วินาที พูดสิ่งนี้ออกมาด้วยเครื่องมือ TTS โดยมีแนวทางโทนเสียง/จังหวะ/ความเครียด/การออกเสียงดังที่กล่าวข้างต้น ฟังผลลัพธ์และค้นหาและแก้ไขที่ออกเสียงผิดอย่างน้อยสามตำแหน่ง (หมายเลข ชื่อเฉพาะ ตัวย่อ) จากนั้นร่าง “แบบฟอร์มยินยอม” ง่ายๆ สำหรับการโคลนเสียง: เสียงของใคร โครงการไหน ระยะเวลาเท่าไร ใช้อะไร สิทธิ์ในการถอน สรุปงานของคุณ

รายการตรวจสอบ

  • [ ] ฉันได้แนะนำแนวทางการออกเสียงด้วยน้ำเสียง จังหวะ ความเครียด และการออกเสียงหรือไม่?
  • [ ] ฉันได้ฟังเอาต์พุต TTS และแก้ไขข้อผิดพลาดในการออกเสียง/ตัวเลข/ตัวย่อแล้วหรือยัง
  • [ ] มีการยินยอมเป็นลายลักษณ์อักษรที่ชัดเจนและเฉพาะเจาะจงสำหรับเสียงที่ฉันโคลน/ใช้หรือไม่
  • [ ] ฉันได้แน่ใจหรือไม่ว่าฉันไม่ได้เกินขอบเขตของความยินยอม (สถานที่ ระยะเวลา วัตถุประสงค์)
  • [ ] ฉันได้ตรวจสอบเอาต์พุตเสียงพากย์สำหรับการแปล/โทนเสียง/การซิงโครไนซ์กับผู้ที่รู้ภาษาเป้าหมายแล้วหรือไม่?