Zyski:
- Umiejętność zrozumienia różnych procesów sztucznej inteligencji związanych z muzyką, efektami dźwiękowymi i warstwami dubbingu oraz testowanie prototypów przy produkcji obiektów zastępczych
- Umiejętność projektowania technik takich jak zestaw wariacji efektów dźwiękowych i adaptacyjna mapa stanu muzyki ze wsparciem sztucznej inteligencji
- Umiejętność rozpoznawania granic, takich jak etyka klonowania dźwięku, wymagania dotyczące zezwoleń/umów i prawa autorskie do muzyki, a także uznania, że ostateczna jakość często należy do ludzkiego artysty
Mówi się, że wzrok kontroluje oko, a dźwięk emocje. Projekt dźwiękowy gry składa się z trzech warstw: muzyki (kompozycje określające atmosferę i tempo), efektów dźwiękowych (SFX - efekty dźwiękowe) (dźwięki zdarzeń, takie jak kroki, broń, drzwi, kliknięcia interfejsu) i lektora (VO - lektor) (linie postaci, narrator). Generacyjna sztuczna inteligencja audio (modele generujące muzykę, efekty i mowę na podstawie tekstu lub odniesienia) może być akceleratorem na wszystkich tych poziomach: prototypowa muzyka, efekty zastępcze, szkice koncepcyjne, a nawet szkice lektorskie. Jednak dźwięk, podobnie jak obraz, ma wymiar prawny, spójny i – zwłaszcza w przypadku lektora – wymiar etyczny.
W tej części dowiesz się, jak wykorzystać sztuczną inteligencję w produkcji dźwięku; Poznasz różne przepływy pracy związane z muzyką, efektami i lektorem, muzyką adaptacyjną, prawami autorskimi i etyką klonowania dźwięku.
Trzy warstwy, trzy przepływy pracy
Muzyka. Sztuczna inteligencja może tworzyć szkice muzyczne, które oddają nastrój sceny: motyw menu, muzyka bitewna, atmosfera eksploracji. Jest to nieocenione na etapie prototypu i obiektu zastępczego — scena nie jest „pusta” do czasu przybycia kompozytora. Ale ostateczna muzyka jest często dziełem ludzkiego kompozytora; ponieważ motyw marki, emocjonalny punkt kulminacyjny i muzyka adaptacyjna (muzyka warstwowa, która zmienia się w zależności od sytuacji w grze) wymagają doskonałej kontroli.
Efekty dźwiękowe. Sztuczna inteligencja i narzędzia proceduralnego dźwięku są praktyczne w tworzeniu efektów o dużej liczbie odmian (10 różnych kroków, 5 różnych drzwi); Przełamuje monotonię. Efekty zastępcze ożywiają prototyp.
Dubbingowanie. Najbardziej wrażliwy obszar. Sztuczna inteligencja może tworzyć szybkie wersje robocze/ zastępcze komunikaty głosowe z funkcją zamiany tekstu na mowę (TTS); Służy do testowania doświadczenia gracza na etapie edycji. Jednak klonowanie prawdziwego ludzkiego głosu (klonowanie głosu) wymaga pozwolenia, umów i etyki; W większości projektów ostatnim lektorem jest ludzki artysta.
Przebieg krok po kroku:
- Opisz funkcję dźwięku (jak powinien wyglądać, podczas jakiego wydarzenia powinien zagrać).
- Podaj odniesienie/nastrój (tempo, gatunek, atmosfera, próbki — przepis chroniony prawem autorskim).
- Wygeneruj symbol zastępczy (wypełnij prototyp, doświadczenie testowe).
- Przejdź do ludzkiego artysty (dla ostatecznej jakości i marki).
- Kontrola praw autorskich/licencji/pozwoleń (szczególnie w przypadku muzyki i dźwięku).
Wskazówka: Stwórz zestaw wariacji efektów dźwiękowych, a nie pojedyncze próbki. Odtwarzanie w kółko pojedynczej próbki tego samego kroku wydaje się fałszywe; Staje się to naturalne, gdy losowo grasz 6-8 odmian.
Muzyka adaptacyjna i integracja
We współczesnych grach muzyka nie jest statyczna, ale można ją dostosować: spokojna, gdy gracz eksploruje, intensywna, gdy jest zaangażowany w walkę. Sztuczna inteligencja może pomóc w opracowaniu projektu tej warstwowej struktury (która warstwa, w jakim stanie, zasady przejścia); Jego produkcja to zadanie zintegrowane z silnikiem dźwięku (np. oprogramowaniem pośredniczącym). Niech sztuczna inteligencja zamapuje stan muzyki, a następnie zweryfikuje integrację techniczną.
Uwaga: etyka klonowania głosu. Klonowanie głosu aktora głosowego za pomocą sztucznej inteligencji bez jego wyraźnej zgody i zgody stanowi zarówno naruszenie etyczne, jak i ryzyko prawne. Naśladowanie głosów zmarłych lub znanych osób wiąże się również z kwestiami praw osobistych. Użyj ogólnego TTS dla symbolu zastępczego; zgadzam się z artystą co do ostatecznego brzmienia.
Techniczne fakty dotyczące projektowania dźwięku
Dźwięk z gry to znacznie więcej niż tylko odtwarzanie pliku muzycznego; Jest interaktywny. Dźwięk powinien natychmiast (z małym opóźnieniem) reagować na działania gracza, rezonować różnie w zależności od lokalizacji (dźwięk odbija się echem w jaskini, wysycha na otwartej przestrzeni) i nie powinien tworzyć kakofonii po zmieszaniu z innymi dźwiękami. Sztuczna inteligencja sama nie tworzy tego interaktywnego projektu; produkuje surowiec (efekty, warstwy muzyczne, linie). Tym, co łączy ten materiał z grą, jest silnik dźwiękowy/oprogramowanie pośredniczące (oprogramowanie pośredniczące, które wyzwala i miksuje dźwięki w zależności od sytuacji w grze) oraz projektant dźwięku, który nim zarządza. Dlatego nie uważaj każdego zasobu dźwiękowego wyprodukowanego przez sztuczną inteligencję za „ok” bez przetestowania go w prawdziwym kontekście gry – w ruchu, z innymi dźwiękami, w różnych lokalizacjach.
Kolejną ważną kwestią są poziomy głośności i balans miksu: muzyka nie powinna przytłaczać dialogów, zawsze powinny być słyszalne krytyczne dźwięki rozgrywki (takie jak odgłosy zbliżającego się wroga). Sztuczna inteligencja może zasugerować Ci zarys strategii miksowania (które brzmienie powinno się wyróżniać w jakiej sytuacji), ale ostateczna decyzja dotycząca miksu jest kwestią słuchu i doświadczenia. Dźwięk, w przeciwieństwie do wizualizacji, jest zauważalny „w tle”; Zły dźwięk pozostawia wrażenie złej jakości, że gracz nie jest w stanie świadomie zrozumieć, dlaczego mu to przeszkadza. Zatem zasada jest taka sama w produkcji dźwięku: sztuczna inteligencja przyspiesza, potwierdza to ucho i doświadczenie.
trzy mini etui
Przypadek 1 — Obiekt zastępczy zapisał doświadczenie. Jeden zespół musiał po cichu przesłać prototyp po opóźnieniu kontraktu z kompozytorem. Wyprodukowali muzykę zastępczą do 4 scen przy użyciu sztucznej inteligencji i przeprowadzili test gry z dźwiękiem; Informacje zwrotne od graczy były znacznie dokładniejsze, ponieważ można było przetestować atmosferę. Następnie wspólnie z kompozytorem wyprodukowano ostateczną muzykę.
Przypadek 2 — Zmiana efektu dodała naturalności. W grze akcji pojedynczy dźwięk miecza odtwarzał się w kółko i wydawał się fałszywy. Kiedy stworzyliśmy 8 odmian z wykorzystaniem sztucznej inteligencji i graliśmy w nie losowo, wynik graczy w kategorii „walka jest żywsza” znacznie wzrósł; produkcja trwała kilka godzin.
Przypadek 3 — Odejście od etyki klonowania głosu. Jeden zespół rozważał sklonowanie głosu słynnego aktora głosowego bez pozwolenia na budżet. Prawo ostrzegało: nieuprawnione klonowanie głosu stanowi naruszenie umowy i dóbr osobistych. Zespół użył ogólnego TTS jako elementu zastępczego i artysty kontraktowego w finale; Było to rozwiązanie etyczne i bezpieczne.
Cztery szablony do kopiowania
1) Informacje o nastroju muzycznym:
Twoja rola: reżyser ścieżki dźwiękowej. Scena: [np. noc, eksploracja opuszczonego miasta]. Pożądane uczucie: [niepokój, ale ciekawość]. Tempo: wolne. Zadanie: napisz opis kierunku muzycznego tej sceny (instrument, tempo, atmosfera, dynamika). NIE używaj nazw utworów/wykonawców objętych prawami autorskimi; po prostu opisz je z kwalifikacjami. Określ, że jest to symbol zastępczy.
2) Plan zmian efektów:
Zaplanuj zestaw efektów dźwiękowych na następujące wydarzenie: [np. kroki na kamiennej posadzce]. Zaproponuj 8 odmian; każdy nieco inny (waga, prędkość, wilgotność powierzchni). Cel: przełamać poczucie powtarzalności. Zasugeruj losowe odtwarzanie nazw w silniku.
3) Adaptacyjna mapa stanu muzyki:
Tworzy adaptacyjną mapę stanu muzyki dla następującej gry: stany [eksploracja, napięcie, bitwa, zwycięstwo], warstwa muzyczna każdego stanu, zasady przejścia między stanami i czas przejścia. Należy pamiętać, że jest to szkic projektu, który wymaga integracji z silnikiem audio.
4) Kontrola praw autorskich/etyki dźwięku:
Planuję wyprodukować następujący zasób głosowy: [opis]. Przypomnij mi o (1) kwestiach dotyczących praw autorskich/licencji, (2) wymaganych pozwoleniach i umowach, jeśli wiąże się to z podszywaniem się/klonowaniem ludzkiego głosu, (3) rozróżnieniu między produkcją zastępczą a produkcją ostateczną.
Słaba zachęta/silna zachęta
Słaba zachęta:
Zrób mi muzykę wojenną.
Żadnego wyczucia, żadnego tempa, żadnych instrumentów, żadnego kontekstu; wynik ogólny.
Potężny monit:
Scena: finałowa walka z bossem; Gracz prawie przegrał, ale jest nadzieja. Poczucie: epickie, napięte, szybujące. Tempo: szybkie, z dominacją perkusji, kulminacja z refrenem. Długość: z możliwością pętli 90 sekund, z dynamicznym spadkiem w środku. To jest symbol zastępczy; ostateczna wersja zostanie stworzona wspólnie z kompozytorem. Nie odwołuj się do dzieł chronionych prawem autorskim.
Funkcja, łuk emocjonalny, tempo i zapotrzebowanie na pętlę napędzają wynik.
Tabela porównawcza warstw audio
warstwa
Przydatność sztucznej inteligencji
produkcja końcowa
Ryzyko związane z prawami autorskimi/etyką
muzyka
Symbol zastępczy/koncepcja
Generalnie kompozytor
Średni (imitacja pracy)
efekt dźwiękowy
Generowanie zmian
Może to być częściowo sztuczna inteligencja
nisko-średni
lektor
Symbol zastępczy TTS
Generalnie artysta
Głośno (klonowanie głosu)
Możliwość dostosowania
mapę sytuacji
Integracja silnika
niski
Typowe błędy
- Korzystanie z próbki z pojedynczym efektem. Znowu wydaje mi się to fałszywe; konieczna jest odmiana.
- Mylenie elementu zastępczego z superumiejętnością. W większości projektów dźwięk AI jest pobieżny.
- Klonowanie głosu bez pozwolenia. Jest to naruszenie etyczne i prawne.
- Cytowanie dzieła chronionego prawem autorskim. Ryzyko naruszenia w podpowiedziach „jak taka a taka piosenka”.
- Ustanawianie adaptacyjnej statyki muzycznej. Warstwy są wymagane w zależności od sytuacji w grze.
Podsumowując
Dźwięk przenosi emocje związane z grą. sztuczna inteligencja; Przyspiesza linię produkcyjną, tworząc koncepcje i symbole zastępcze w muzyce, różnice w efektach i szkice wokalizacji. Jednak ostateczna jakość, motyw marki i kontrola adaptacyjna są często zadaniem ludzkiego artysty; Klonowanie głosu wymaga pozwolenia i etyki. Naturalność ze zmiennością, szybkość z symbolem zastępczym, najwyższa jakość z artystą.
Zadanie aplikacji
Wybierz scenę ze swojej gry. Zdefiniuj zastępczy kierunek muzyczny za pomocą szablonu „Przegląd nastroju muzycznego” i zaplanuj zestaw efektów z 8 wariacjami na wydarzenie za pomocą szablonu „Plan wariacji efektów”. Na koniec sprawdź swój plan za pomocą szablonu „Kontrola praw autorskich/etyki dźwięku”.
lista kontrolna
- [ ] Jasno określiłem funkcję dźwięku i pożądane wrażenia.
- [ ] Stworzyłem wariację z zestawem efektów.
- [ ] Umieściłem głos AI jako element zastępczy.
- [ ] Przestrzegałem wymagań dotyczących pozwolenia/umowy dotyczących klonowania głosu.
- [ ] Nie wspomniałem o żadnym dziele/artyście chronionym prawem autorskim.