หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในการพัฒนาเกม: บทบาท ขอบเขต การตรวจสอบ ลิขสิทธิ์ และจริยธรรม 2. การออกแบบต้นแบบและกลไก: การทำซ้ำอย่างรวดเร็วจากไอเดียไปจนถึงคอร์ที่เล่นได้ 3. ระบบพฤติกรรมและบทสนทนาของ NPC: ปัญญาประดิษฐ์ที่ทำให้ตัวละครมีชีวิต 4. การสร้างเนื้อหาตามขั้นตอน (PCG): ระดับ แผนที่ ภารกิจ และการเล่าเรื่อง 5. การผลิตเนื้อหาและภาพ: แนวคิดศิลปะ 2D/3D และพื้นผิว 6. การผลิตเสียง ดนตรี และเอฟเฟกต์: โลกแห่งเกมที่ได้ยิน 7. การสร้างโค้ดและการรวมกลไก: Unity (C#) และ Unreal (Blueprint/C++) 8. ความสมดุลของเกม การจำลอง และเศรษฐกิจ: เกมที่ยุติธรรมพร้อมตัวเลข 9. การประกันคุณภาพ (QA) การดีบักและการทดสอบอัตโนมัติ 10. ลิขสิทธิ์ ความคิดริเริ่ม ใบอนุญาต และจริยธรรม: เนื้อหาที่เผยแพร่และมีความรับผิดชอบ 11. ขั้นตอนการทำงานแบบครบวงจร การบูรณาการสายการผลิต การกำกับดูแล และการบริการแบบสด
หน่วย 6 / 11

การผลิตเสียง ดนตรี และเอฟเฟกต์: โลกแห่งเกมที่ได้ยิน

กำไร:

  • ความสามารถในการเข้าใจเวิร์กโฟลว์ปัญญาประดิษฐ์ที่แตกต่างกันของเพลง เอฟเฟกต์เสียง และเลเยอร์การพากย์ และประสบการณ์ทดสอบต้นแบบด้วยการผลิตตัวยึดตำแหน่ง
  • ความสามารถในการออกแบบเทคนิคต่างๆ เช่น ชุดรูปแบบต่างๆ ในเอฟเฟกต์เสียง และแผนที่สถานะเพลงแบบปรับได้พร้อมการสนับสนุนปัญญาประดิษฐ์
  • ความสามารถในการรับรู้ขอบเขต เช่น จริยธรรมในการโคลนเสียง ข้อกำหนดการอนุญาต/สัญญา และลิขสิทธิ์เพลง และรับรู้ว่าคุณภาพขั้นสุดท้ายมักจะเป็นของศิลปินที่เป็นมนุษย์

ว่ากันว่าภาพควบคุมดวงตาและเสียงควบคุมอารมณ์ การออกแบบเสียงของเกมประกอบด้วยสามเลเยอร์: เพลง (องค์ประกอบที่กำหนดบรรยากาศและจังหวะ) เอฟเฟกต์เสียง (SFX - เอฟเฟกต์เสียง) (เสียงของเหตุการณ์ เช่น เสียงฝีเท้า ปืน ประตู การคลิกอินเทอร์เฟซ) และเสียงพากย์ (VO - การพากย์เสียง) (บรรทัดตัวละคร ผู้บรรยาย) AI ที่สร้างเสียง (โมเดลที่สร้างเพลง เอฟเฟกต์ และคำพูดจากข้อความหรือการอ้างอิง) สามารถเป็นตัวเร่งในทุกเลเยอร์เหล่านี้: เพลงต้นแบบ เอฟเฟกต์ตัวยึดตำแหน่ง ภาพร่างแนวคิด แม้แต่ภาพร่างเสียงพากย์ แต่เสียงก็เหมือนกับภาพที่มีลิขสิทธิ์ ความสม่ำเสมอ และโดยเฉพาะอย่างยิ่งในการพากย์เสียง ในมิติทางจริยธรรม

ในหน่วยการเรียนรู้นี้ คุณจะได้เรียนรู้วิธีใช้ AI ในการผลิตเสียง คุณจะได้เรียนรู้ขั้นตอนการทำงานต่างๆ ของดนตรี เอฟเฟกต์และการพากย์เสียง ดนตรีดัดแปลง ลิขสิทธิ์ และจริยธรรมในการคัดลอกเสียง

สามชั้น สามเวิร์กโฟลว์

ดนตรี. AI สามารถสร้างภาพร่างดนตรีที่จับอารมณ์ของฉากได้ เช่น ธีมเมนู เพลงต่อสู้ บรรยากาศการสำรวจ เป็นสิ่งล้ำค่าในขั้นตอนต้นแบบและตัวยึดตำแหน่ง - เวทีจะไม่ "ว่างเปล่า" จนกว่าผู้แต่งจะมาถึง แต่เพลงสุดท้ายมักเป็นผลงานของนักแต่งเพลงที่เป็นมนุษย์ เพราะธีมของแบรนด์ จุดไคลแม็กซ์ทางอารมณ์ และดนตรีที่ปรับเปลี่ยนได้ (เพลงแบบเลเยอร์ที่เปลี่ยนแปลงไปตามสถานการณ์ในเกม) จำเป็นต้องมีการควบคุมที่ดี

เอฟเฟกต์เสียง เครื่องมือ AI และเสียงขั้นตอนใช้งานได้จริงในการสร้างเอฟเฟกต์ที่มีรูปแบบต่างๆ มากมาย (เสียงฝีเท้า 10 แบบ ประตู 5 แบบ) มันทำลายความน่าเบื่อ เอฟเฟกต์ตัวยึดตำแหน่งทำให้ต้นแบบมีชีวิตชีวา

การพากย์เสียง บริเวณที่บอบบางที่สุด AI สามารถสร้าง VO แบบร่าง/ตัวยึดตำแหน่งที่รวดเร็วพร้อมข้อความเป็นคำพูด (TTS) ใช้เพื่อทดสอบประสบการณ์ของผู้เล่นในระหว่างขั้นตอนการแก้ไข แต่การโคลนเสียงมนุษย์จริงๆ (การโคลนเสียง) ต้องได้รับอนุญาต สัญญา และจริยธรรม เสียงพากย์สุดท้ายเป็นศิลปินที่เป็นมนุษย์ในโครงการส่วนใหญ่

การไหลทีละขั้นตอน:

  1. อธิบายการทำงานของเสียง (ควรรู้สึกอย่างไร, ควรเล่นในกรณีใด)
  2. ให้ข้อมูลอ้างอิง/อารมณ์ (จังหวะ ประเภท บรรยากาศ ตัวอย่าง — สูตรอาหารที่ปลอดภัยต่อลิขสิทธิ์)
  3. สร้างตัวยึดตำแหน่ง (เติมต้นแบบ ประสบการณ์ทดสอบ)
  4. ย้ายไปที่ศิลปินที่เป็นมนุษย์ (เพื่อคุณภาพและแบรนด์ขั้นสุดท้าย)
  5. การตรวจสอบลิขสิทธิ์/ใบอนุญาต/การอนุญาต (โดยเฉพาะเพลงและเสียง)
เคล็ดลับ: สร้างชุดเอฟเฟ็กต์เสียงที่หลากหลาย ไม่ใช่ตัวอย่างเดียว การเล่นตัวอย่างฝีเท้าเดียวกันซ้ำไปซ้ำมาจะให้ความรู้สึกเป็นของปลอม มันจะกลายเป็นเรื่องปกติเมื่อคุณเล่นแบบสุ่ม 6-8 รูปแบบ

ดนตรีที่ปรับเปลี่ยนได้และการบูรณาการ

ในเกมสมัยใหม่ ดนตรีไม่คงที่แต่สามารถปรับเปลี่ยนได้: สงบเมื่อผู้เล่นกำลังสำรวจ และเข้มข้นเมื่ออยู่ในการต่อสู้ AI สามารถช่วยร่างการออกแบบโครงสร้างแบบเลเยอร์นี้ (เลเยอร์ใดในสถานะใด กฎการเปลี่ยนผ่าน) การผลิตเป็นงานที่บูรณาการเข้ากับกลไกเสียง (เช่น มิดเดิลแวร์) ให้ AI แมปสถานะเพลง จากนั้นตรวจสอบการรวมทางเทคนิค

ข้อควรระวัง: จริยธรรมของการโคลนเสียง การโคลนเสียงของนักพากย์ด้วย AI โดยไม่ได้รับอนุญาตและข้อตกลงอย่างชัดแจ้งถือเป็นทั้งการละเมิดจริยธรรมและความเสี่ยงทางกฎหมาย การเลียนแบบเสียงของผู้ตายหรือคนมีชื่อเสียงยังทำให้เกิดปัญหาสิทธิบุคลิกภาพอีกด้วย ใช้ TTS ทั่วไปสำหรับตัวยึดตำแหน่ง เห็นด้วยกับศิลปินสำหรับเสียงสุดท้าย

ข้อเท็จจริงทางเทคนิคของการออกแบบเสียง

เสียงของเกมเป็นมากกว่าการเล่นไฟล์เพลง มันเป็นแบบโต้ตอบ เสียงควรตอบสนองทันที (ด้วยความหน่วงต่ำ) ต่อการกระทำของผู้เล่น สะท้อนแตกต่างกันไปขึ้นอยู่กับตำแหน่ง (เสียงสะท้อนในถ้ำ แห้งในที่โล่ง) และไม่ควรสร้างเสียงขรมเมื่อผสมกับเสียงอื่น AI ไม่ได้สร้างการออกแบบเชิงโต้ตอบนี้ขึ้นมาเอง ผลิตวัตถุดิบ (เอฟเฟกต์ เลเยอร์ดนตรี ลายเส้น) สิ่งที่เชื่อมโยงเนื้อหานี้กับเกมคือเอ็นจิ้นเสียง/มิดเดิลแวร์ (มิดเดิลแวร์ที่ทริกเกอร์และผสมเสียงตามสถานการณ์ของเกม) และผู้ออกแบบเสียงที่จัดการมัน ดังนั้นอย่าถือว่าเนื้อหาเสียงที่ผลิตโดย AI ทุกรายการ "ใช้ได้" โดยไม่ทดสอบในบริบทของเกมจริง — ในการเคลื่อนไหวพร้อมกับเสียงอื่นๆ ในตำแหน่งที่แตกต่างกัน

จุดสำคัญอีกประการหนึ่งคือระดับเสียงและความสมดุลของการผสมผสาน: เพลงไม่ควรครอบงำบทสนทนา เสียงการเล่นเกมที่สำคัญ (เช่น เสียงของศัตรูที่เข้ามาใกล้) ควรได้ยินอยู่เสมอ AI สามารถแนะนำคุณถึงโครงร่างของกลยุทธ์การมิกซ์ (เสียงใดควรโดดเด่นในสถานการณ์ใด) แต่การตัดสินใจมิกซ์ขั้นสุดท้ายเป็นเรื่องของการได้ยินและประสบการณ์ เสียงไม่เหมือนกับภาพที่เห็นได้ชัดเจน "ในพื้นหลัง"; เสียงที่ไม่ดีทำให้รู้สึกว่าคุณภาพไม่ดีจนผู้เล่นไม่สามารถเข้าใจได้อย่างมีสติว่าทำไมพวกเขาถึงถูกรบกวน ดังนั้นกฎในการผลิตเสียงก็เหมือนกัน นั่นคือ AI จะเร่งความเร็ว หูและประสบการณ์จะยืนยัน

มินิเคสสามอัน

กรณีที่ 1 — ตัวยึดตำแหน่งบันทึกประสบการณ์ ทีมหนึ่งต้องส่งต้นแบบอย่างเงียบๆ หลังจากที่สัญญาผู้แต่งล่าช้า พวกเขาผลิตเพลงประกอบสำหรับ 4 ฉากด้วย AI และทำการทดสอบการเล่นด้วยเสียง ความคิดเห็นของผู้เล่นแม่นยำมากขึ้นเพราะสามารถทดสอบบรรยากาศได้ เพลงสุดท้ายถูกผลิตร่วมกับผู้แต่ง

กรณีที่ 2 — เอฟเฟกต์ที่หลากหลายเพิ่มความเป็นธรรมชาติ ในเกมแอคชั่น เสียงดาบเดียวจะเล่นซ้ำแล้วซ้ำเล่าและให้ความรู้สึกเหมือนเป็นของปลอม เมื่อเราสร้าง 8 รูปแบบด้วย AI และเล่นแบบสุ่ม คะแนน "การต่อสู้มีชีวิตชีวามากขึ้น" ของผู้เล่นเพิ่มขึ้นอย่างมาก การผลิตใช้เวลาหลายชั่วโมง

กรณีที่ 3 — การละทิ้งหลักจริยธรรมของการโคลนเสียง ทีมหนึ่งพิจารณาการโคลนเสียงนักพากย์ชื่อดังโดยไม่ได้รับอนุญาตจากงบประมาณ กฎหมายเตือน: การโคลนเสียงโดยไม่ได้รับอนุญาตถือเป็นการละเมิดสัญญาและสิทธิส่วนบุคคล ทีมงานใช้ TTS ทั่วไปสำหรับตัวยึดตำแหน่งและศิลปินสัญญาสำหรับตอนจบ มันเป็นทั้งวิธีแก้ปัญหาที่มีจริยธรรมและปลอดภัย

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) การบรรยายสรุปอารมณ์ดนตรี:

บทบาทของคุณ: ผู้กำกับเพลงประกอบ ฉาก: [เช่น กลางคืน การสำรวจเมืองร้าง] ความรู้สึกที่ต้องการ: [ไม่สบายใจ แต่อยากรู้อยากเห็น] จังหวะ: ช้า. ภารกิจ: เขียนคำอธิบายทิศทางดนตรีสำหรับฉากนี้ (เครื่องดนตรี จังหวะ บรรยากาศ ไดนามิก) อย่าใช้ชื่อเพลง/ศิลปินที่มีลิขสิทธิ์ เพียงอธิบายพวกเขาด้วยคุณสมบัติ ระบุว่านี่คือตัวยึดตำแหน่ง

2) แผนการเปลี่ยนแปลงเอฟเฟกต์:

วางแผนชุดเอฟเฟกต์เสียงสำหรับเหตุการณ์ต่อไปนี้: [เช่น รอยเท้าบนพื้นหิน] แนะนำ 8 รูปแบบ; ต่างกันเล็กน้อย (น้ำหนัก ความเร็ว ความชื้นพื้นผิว) วัตถุประสงค์: ทำลายความรู้สึกของการทำซ้ำ แนะนำให้ตั้งชื่อให้เล่นแบบสุ่มในเครื่อง

3) แผนที่สถานะเพลงแบบปรับได้:

สร้างแผนที่สถานะเพลงที่ปรับเปลี่ยนได้สำหรับเกมต่อไปนี้: สถานะ [การสำรวจ ความตึงเครียด การต่อสู้ ชัยชนะ] เลเยอร์เพลงของแต่ละรัฐ กฎการเปลี่ยนผ่านระหว่างรัฐ และเวลาการเปลี่ยนผ่าน โปรดทราบว่านี่คือภาพร่างการออกแบบที่ต้องมีการรวมเข้ากับระบบเสียง

4) ลิขสิทธิ์เสียง/การควบคุมจริยธรรม:

ฉันวางแผนที่จะสร้างเนื้อหาเสียงต่อไปนี้: [คำอธิบาย] เตือนฉันถึง (1) ข้อควรพิจารณาด้านลิขสิทธิ์/ใบอนุญาต (2) การอนุญาตและข้อตกลงที่จำเป็นหากเกี่ยวข้องกับการแอบอ้าง/การโคลนเสียงมนุษย์ (3) ความแตกต่างระหว่างตัวยึดตำแหน่งและการผลิตขั้นสุดท้าย

พรอมต์อ่อน / พรอมต์แข็งแกร่ง

พรอมต์ที่อ่อนแอ:

ทำเพลงสงครามให้ฉันหน่อย

ไม่มีความรู้สึก ไม่มีจังหวะ ไม่มีเครื่องดนตรี ไม่มีบริบท ผลลัพธ์ทั่วไป

พรอมต์อันทรงพลัง:

ฉาก: การต่อสู้กับบอสครั้งสุดท้าย; ผู้เล่นเกือบแพ้แต่ยังมีความหวัง รู้สึก: ยิ่งใหญ่ ตึงเครียด ทะยาน จังหวะ: เร็ว เพอร์คัชชันเด่น จุดไคลแม็กซ์พร้อมคอรัส ความยาว: วนซ้ำได้ 90 วินาที โดยมีการดรอปแบบไดนามิกตรงกลาง นี่คือตัวยึดตำแหน่ง เวอร์ชันสุดท้ายจะจัดทำร่วมกับผู้แต่ง ห้ามอ้างอิงผลงานที่มีลิขสิทธิ์

ฟังก์ชั่น ส่วนโค้งทางอารมณ์ จังหวะ และความต้องการวนซ้ำเป็นตัวขับเคลื่อนเอาท์พุต

แผนภูมิเปรียบเทียบเลเยอร์เสียง

ชั้น

ความเหมาะสมของเอไอ

การผลิตขั้นสุดท้าย

ความเสี่ยงด้านลิขสิทธิ์/จริยธรรม

เพลง

ตัวยึดตำแหน่ง/แนวคิด

โดยทั่วไปแล้วนักแต่งเพลง

ปานกลาง (เลียนแบบงาน)

เอฟเฟกต์เสียง

การสร้างรูปแบบ

อาจจะเป็น AI บางส่วนก็ได้

ต่ำปานกลาง

พากย์เสียง

ตัวยึดตำแหน่ง TTS

โดยทั่วไปแล้วศิลปิน

ดัง (โคลนเสียง)

การออกแบบที่ปรับเปลี่ยนได้

แผนที่สถานการณ์

บูรณาการเครื่องยนต์

ต่ำ

ข้อผิดพลาดทั่วไป

  • การใช้ตัวอย่างเอฟเฟกต์เดียว มันรู้สึกเหมือนเป็นของปลอมอีกครั้ง จำเป็นต้องมีการเปลี่ยนแปลง
  • ตัวยึดตำแหน่งที่ผิดพลาดสำหรับสุดยอด เสียง AI นั้นไม่ชัดเจนในโปรเจ็กต์ส่วนใหญ่
  • การโคลนเสียงโดยไม่ได้รับอนุญาต ถือเป็นการละเมิดจริยธรรมและกฎหมาย
  • อ้างถึงงานอันมีลิขสิทธิ์ ความเสี่ยงของการละเมิดในข้อความแจ้ง "ชอบเพลงพอใช้ได้"
  • การสร้างดนตรีแบบปรับตัวแบบคงที่ จำเป็นต้องมีเลเยอร์ขึ้นอยู่กับสถานการณ์ของเกม

โดยสรุป

เสียงสื่อถึงอารมณ์ของเกม AI; มันช่วยเร่งสายการผลิตโดยการสร้างแนวคิดและตัวยึดตำแหน่งในเพลง เอฟเฟ็กต์ต่างๆ และร่างเสียงร้อง แต่คุณภาพขั้นสุดท้าย ธีมของแบรนด์ และการควบคุมแบบปรับตัวมักเป็นงานของมนุษย์ศิลปิน การโคลนเสียงต้องได้รับอนุญาตและมีจริยธรรม ความเป็นธรรมชาติพร้อมการเปลี่ยนแปลง ความเร็วพร้อมตัวยึดตำแหน่ง คุณภาพขั้นสูงสุดกับศิลปิน

งานสมัคร

เลือกฉากจากเกมของคุณ กำหนดทิศทางดนตรีตัวยึดตำแหน่งด้วยเทมเพลต "สรุปอารมณ์เพลง" และวางแผนชุดเอฟเฟกต์ 8 รูปแบบสำหรับกิจกรรมด้วยเทมเพลต "แผนเอฟเฟกต์รูปแบบต่างๆ" สุดท้าย ตรวจสอบแผนของคุณด้วยเทมเพลต "การตรวจสอบลิขสิทธิ์เสียง/จริยธรรม"

รายการตรวจสอบ

  • [ ] ฉันได้กำหนดฟังก์ชั่นเสียงและความรู้สึกที่ต้องการไว้อย่างชัดเจน
  • [ ] ฉันสร้างชุดเอฟเฟกต์ขึ้นมา
  • [ ] ฉันวางตำแหน่งเสียง AI ไว้เป็นตัวยึดตำแหน่ง
  • [ ] ฉันปฏิบัติตามข้อกำหนดการอนุญาต/สัญญาสำหรับการโคลนเสียง
  • [ ] ฉันไม่ได้อ้างอิงถึงงาน/ศิลปินที่มีลิขสิทธิ์ใดๆ