ユニット 6 / 11

サウンド、音楽、エフェクトの制作: 聴こえるゲームの世界

利益:

  • 音楽、サウンドエフェクト、ダビングレイヤーのさまざまな人工知能ワークフローを理解し、プレースホルダー制作でプロトタイプのエクスペリエンスをテストする能力
  • 音響効果のバリエーションセットや人工知能サポートによる適応型音楽状態マップなどのテクニックを設計する能力
  • オーディオ クローン作成の倫理、許可/契約要件、音楽著作権などの境界を認識し、最終的な品質は多くの場合人間のアーティストに属することを認識する能力

視覚は目を制御し、音は感情を制御するといわれています。ゲームのサウンドデザインは、音楽(雰囲気やテンポを決定する楽曲)、サウンドエフェクト(SFX - サウンドエフェクト)(足音、銃、ドア、インターフェイスのクリックなどのイベント音)、そしてナレーション(VO - ボイスオーバー)(キャラクターのセリフ、ナレーター)の 3 つのレイヤーで構成されます。オーディオ生成 AI (テキストまたはリファレンスから音楽、エフェクト、音声を生成するモデル) は、プロトタイプの音楽、プレースホルダー エフェクト、コンセプト スケッチ、さらにはナレーション スケッチなど、これらすべてのレイヤーでアクセラレータとして機能します。しかし、サウンドには、ビジュアルと同様に、著作権、一貫性、そして特にナレーションにおいては倫理的な側面が伴います。

この単元では、サウンド制作に AI を使用する方法を学びます。音楽のさまざまなワークフロー、エフェクトとナレーション、アダプティブ ミュージック、著作権、サウンド クローン作成の倫理について学びます。

3 つのレイヤー、3 つのワークフロー

音楽。 AI は、メニューのテーマ、戦闘音楽、探索の雰囲気など、シーンの雰囲気を捉えた音楽スケッチを作成できます。これは、プロトタイプおよびプレースホルダーの段階では非常に貴重です。作曲家が到着するまで、ステージは「空」ではありません。しかし、最終的な音楽は人間の作曲家の作品であることがよくあります。なぜなら、ブランドテーマ、感情のクライマックス、アダプティブミュージック(ゲーム状況に応じて変化するレイヤー音楽)は、細やかなコントロールを必要とするからです。

効果音。 AI およびプロシージャル オーディオ ツールは、多数のバリエーション (10 種類の足音、5 種類のドア) を持つエフェクトを作成するのに実用的です。それは単調さを打ち破ります。プレースホルダー効果はプロトタイプに命を吹き込みます。

ダビング。最も敏感な領域。 AI は、テキスト読み上げ (TTS) を使用して、ドラフト/プレースホルダー VO を高速に生成できます。これは、編集段階でプレーヤーのエクスペリエンスをテストするために使用されます。しかし、本物の人間の声を複製する (音声クローン) には、許可、契約、倫理が必要です。ほとんどのプロジェクトでは、最後のナレーションは人間のアーティストです。

段階的なフロー:

  1. サウンドの機能 (どのように感じられるべきか、どのようなイベントで再生されるべきか) を説明します。
  2. 参考/雰囲気 (テンポ、ジャンル、雰囲気、サンプル — 著作権保護されたレシピ) を提供します。
  3. プレースホルダーを生成します (プロトタイプを入力し、エクスペリエンスをテストします)。
  4. 人間のアーティストに移行します (最終的な品質とブランドのため)。
  5. 著作権/ライセンス/許可の確認 (特に音楽とオーディオ)。
ヒント: 単一のサンプルではなく、サウンドエフェクトのバリエーションのセットを作成します。同じ足音の 1 つのサンプルを何度も再生すると、偽物のように感じられます。 6〜8個のバリエーションをランダムに演奏すると自然になります。

アダプティブミュージックと統合

最近のゲームでは、音楽は静的なものではなく、順応性があります。プレイヤーが探索しているときは穏やかで、戦闘中は激しくなります。 AI は、この階層構造 (どの層がどの状態にあるのか、遷移ルール​​) の設計草案を作成するのに役立ちます。その制作はサウンド エンジン (例: ミドルウェア) と統合されたジョブです。 AIに音楽の状態をマッピングさせ、技術的な統合を検証します。

注意: 音声クローンの倫理。声優の明示的な許可と同意なしに AI を使用して声優の声を複製することは、倫理違反であると同時に法的リスクにもなります。故人や著名人の声を真似ることも、人格権の問題を引き起こします。プレースホルダーには汎用 TTS を使用します。最終的なサウンドについてはアーティストと合意します。

サウンドデザインの技術的事実

ゲームオーディオは単に音楽ファイルを再生するだけではありません。インタラクティブです。サウンドは、プレイヤーのアクションに即座に (遅延が少なく) 反応する必要があり、場所によって共鳴の仕方が異なり (洞窟では音が反響し、広場では音が乾いてしまう)、他のサウンドと混合したときに不協和音を生じないようにする必要があります。 AI はこのインタラクティブなデザイン自体を生成しません。生の素材 (エフェクト、音楽レイヤー、ライン) を生成します。この素材とゲームを結びつけるのが、サウンドエンジン・ミドルウェア(ゲームの状況に応じて音をトリガーしたりミックスしたりするミドルウェア)と、それを管理するサウンドデザイナーです。したがって、実際のゲームのコンテキスト (動き中、他のサウンドと一緒に、さまざまな場所で) でテストすることなく、AI によって生成されたすべてのサウンド アセットを「OK」と考えないでください。

もう 1 つの重要な点は、音量レベルとミックス バランスです。音楽が会話を圧倒してはならず、ゲームプレイの重要な音 (敵が近づいてくる音など) が常に聞こえるようにする必要があります。 AIはミックス戦略の概要(どの状況でどのサウンドを際立たせるべきか)を提案してくれますが、最終的なミックスの決定は聴覚と経験の問題です。音はビジュアルとは異なり、「背景」で目立ちます。オーディオの質が悪いと、プレーヤーはなぜ気になるのか意識的に理解できず、品質が悪いという印象が残ります。したがって、サウンド制作でもルールは同じです。AI が加速し、耳と経験が確認します。

ミニケース3個

ケース 1 — プレースホルダーがエクスペリエンスを保存しました。あるチームは作曲家との契約が遅れたため、黙ってプロトタイプを提出しなければならなかった。彼らは AI を使用して 4 つのシーンのプレースホルダー音楽を作成し、サウンド付きのプレイテストを行いました。雰囲気をテストできるため、プレイヤーのフィードバックがより正確になりました。その後、作曲家と一緒に最終的な音楽が制作されました。

ケース 2 — エフェクトのバリエーションで自然さを加えました。アクションゲームでは、一本の剣の音が何度も何度も再生され、それが偽物のように感じられました。 AI で 8 つのバリエーションを作成し、ランダムにプレイしたところ、プレイヤーの「戦闘が活発になった」スコアが大幅に増加しました。制作には数時間かかりました。

ケース 3 — 音声クローンの倫理から目を背ける。あるチームは、予算の都合上、有名声優の声を無断で複製することを検討した。法律は、無許可の音声クローン作成は契約と個人の権利の侵害であると警告しました。チームは、プレースホルダーには一般的な TTS を使用し、フィナーレには契約アーティストを使用しました。それは倫理的かつ安全な解決策でした。

コピー可能な 4 つのテンプレート

1) 音楽ムードの説明:

あなたの役割: サウンドトラック ディレクター。シーン: [例:夜、廃墟都市探索]。望ましい感情: [不安だけど好奇心旺盛]。テンポ:遅い。タスク: このシーンの音楽的方向性 (楽器、テンポ、雰囲気、ダイナミクス) の説明を書きます。著作権で保護されたトラック名やアーティスト名は使用しないでください。資格を付けて説明するだけです。これがプレースホルダーであることを指定します。

2)効果変動計画:

次のイベント用の効果音セットを計画します。[例:石の床を踏む足音]。 8 つのバリエーションを提案します。それぞれわずかに異なります(重量、速度、表面水分)。目的: 繰り返しの感覚を打ち破る。エンジン内でランダムに再生される名前を提案します。

3) 適応音楽状態マップ:

次のゲームの適応音楽状態マップを作成します: 状態 [探索、緊張、戦闘、勝利]、各状態の音楽レイヤー、状態間の移行ルール、および移行時間。これはオーディオ エンジンとの統合が必要な設計スケッチであることに注意してください。

4) オーディオ著作権/倫理管理:

次の音声アセットを作成する予定です: [説明]。 (1) 著作権/ライセンスに関する考慮事項、(2) 人間の声のなりすまし/複製が含まれる場合に必要な許可と同意、(3) プレースホルダと最終製品の区別について思い出してください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

戦争音楽を作ってくれ。

感触もテンポも楽器も文脈もありません。一般的な結果。

強力なプロンプト:

シーン: 最後のボスとの戦い。その選手は危うく負けるところだったが、希望はある。感触: 壮大、緊張、急上昇。テンポ: 速く、パーカッションが優勢で、クライマックスはコーラスで始まります。長さ: ループ可能な 90 秒で、途中にダイナミックなドロップがあります。これはプレースホルダーです。最終バージョンは作曲者と一緒に作成されます。著作権で保護された作品を参照しないでください。

機能、感情的な弧、テンポ、ループの要求が出力を駆動します。

オーディオレイヤー比較表

レイヤー

AI適合性

最終生産

著作権/倫理リスク

音楽

プレースホルダー/コンセプト

一般的に作曲家

中(作品の模倣)

効果音

バリエーション生成

部分的にAIかもしれない

低~中

ナレーション

TTS プレースホルダ

一般的にアーティスト

大声(音声複製)

適応性のあるデザイン

状況図

エンジンの統合

低い

よくある間違い

  • 単一のエフェクトサンプルを使用します。それはまた偽物のように感じられます。バリエーションが必要です。
  • プレースホルダーを究極のものと間違えています。 AI オーディオはほとんどのプロジェクトで大ざっぱです。
  • 許可なく音声を複製します。それは倫理的および法的違反です。
  • 著作権で保護された作品を引用する。 「○○の歌のような」プロンプトには権利侵害の危険があります。
  • 適応的な音楽の静的な確立。試合状況に応じてレイヤーが必要となります。

要約すると

サウンドはゲームの感情を伝えます。 AI;音楽のコンセプトやプレースホルダー、エフェクトのバリエーション、発声の下書きを作成することで、生産ラインをスピードアップします。しかし、最終的な品質、ブランドテーマ、適応制御は多くの場合、人間のアーティストの仕事です。音声のクローン作成には許可と倫理が必要です。バリエーションのある自然さ、プレースホルダーのあるスピード、アーティストによる究極の品質。

アプリケーションタスク

ゲームからシーンを選択します。 「ミュージック ムード ブリーフ」テンプレートを使用してプレースホルダーの音楽の方向性を定義し、「エフェクト バリエーション プラン」テンプレートを使用してイベント用の 8 バリエーションのエフェクト セットを計画します。最後に、「音声著作権・倫理チェック」テンプレートでプランをチェックします。

チェックリスト

  • [ ] サウンド機能と求められる感触を明確に定義しました。
  • [ ] エフェクトのバリエーションセットを制作しました。
  • [ ] AI音声をプレースホルダーとして配置しました。
  • [ ] 音声クローンの許可/契約要件を確認しました。
  • [ ] 著作権で保護された作品やアーティストには言及していません。