Unit 6 / 11

Alih Suara, Pengklonan Suara dan Alih Suara Berbilang Bahasa

Keuntungan:

  • Keupayaan untuk memahami alatan teks ke pertuturan (TTS), pengklonan suara dan alih suara buatan (alih suara/penyegerakkan bibir) dan menghasilkan draf alih suara
  • Mencapai penyuaraan semula jadi dengan nada, tempo, tekanan dan arahan sebutan serta dapat merancang versi berbilang bahasa
  • Pengklonan suara seseorang memerlukan persetujuan, hak cipta dan hak peribadi; Memahami bahawa peniruan suara yang tidak diluluskan adalah pelanggaran etika dan undang-undang

Audio ialah separuh daripada video. Penonton boleh memaafkan imej buruk; tidak memaafkan bunyi yang buruk. Dalam pengeluaran tradisional, alih suara adalah mahal dan lambat: mencari artis alih suara, menyediakan studio, merakam dan menghubungi semula jika kesilapan berlaku. Kecerdasan buatan telah mengubah gambar ini: alat teks ke pertuturan boleh menukar teks kepada suara semula jadi dalam beberapa minit; pengklonan suara boleh "mempelajari" suara seseorang dan membuat mereka menyebut ayat baharu; Alat alih suara buatan boleh memindahkan video ke bahasa lain selaras dengan pergerakan bibir. Setiap kebolehan berkuasa ini juga memikul tanggungjawab etika dan undang-undang yang serius. Dalam unit ini, kami akan merangkumi kedua-dua teknik dan sempadan.

Syarat. Text-to-Speech (TTS) ialah teknologi yang menukar teks bertulis kepada suara sintetik. Pengklonan suara mencipta model yang meniru suara orang sebenar daripada sampel suara. Alih suara buatan ialah menterjemahkan pertuturan video ke dalam bahasa lain dan mengalih suara dalam bahasa itu, selalunya menjadikannya serasi dengan pergerakan bibir (penyegerakan bibir). Prosodi ialah corak intonasi, tekanan, dan irama pertuturan—"emosi" sesuatu ayat sebahagian besarnya berasal daripada prosodi. Fonem ialah unit bunyi terkecil dalam sesuatu bahasa; Masalah sebutan sering diselesaikan pada peringkat fonem.

Suarakan teks ke ucapan

Alat TTS adalah sangat semulajadi hari ini; tetapi mendapatkan alih suara yang "baik" memerlukan mengarahkan kenderaan dengan betul. Menampal teks mentah dan menyebut "baca" memberikan hasil yang rata dan robotik. Untuk lakonan suara yang baik, panduan: watak suara (umur, jantina, kemesraan), nada (ikhlas, serius, teruja), tempo (penceritaan perlahan atau pengiklanan bertenaga), tekanan (perkataan mana yang harus menonjol), jeda (nafas, tanda baca) dan sebutan (nama yang betul, singkatan, perkataan asing). Banyak alatan memberi anda kawalan ini dengan menambahkan tanda baca dan arahan ringkas pada teks, atau dengan menggunakan penanda khas.

Peranan anda: penolong pengarah suara.Teks: [Teks narasi 60 saat di bawah]Arahan suara:- Watak suara: suara wanita dalam lingkungan 30-an, mesra dan meyakinkan.- Nada: tenang, ikhlas; TIADA jeritan komersial.- Tempo: sederhana perlahan; nafas pendek pada akhir setiap ayat.- Tekanan: sedikit menyerlahkan perkataan "percuma" dan "30 hari".- Sebutan: "AiEdu" -> "ey-edu"; "%" -> "peratusan".Tugas: Sediakan teks yang ditandakan mengikut arahan ini (nyatakan di mana penekanan/jeda akan muncul).

Pastikan anda mendengar dan menyemak keluaran TTS: nama betul yang salah, tekanan pelik dan jeda luar biasa adalah perkara biasa. Dalam bahasa Turki, perkataan asal asing, terutamanya perkataan, singkatan dan nombor menyebabkan masalah ("2024" -> "dua ribu dua puluh empat" atau "dua puluh empat puluh empat"?).

Pengklonan suara: kuasa dan tanggungjawab

Pengklonan suara menghasilkan model yang meniru suara seseorang dari beberapa minit rakaman. Ia mempunyai kegunaan yang sah: untuk melengkapkan alih suara dengan suara penyampai, dengan persetujuannya, pada hari sakit; penggunaan konsisten "identiti kukuh" jenama yang diluluskan; untuk membuat suara sendiri bercakap dalam bahasa lain. Tetapi kuasa inilah yang menarik garis etika terbesar: pengklonan dan menggunakan suara seseorang tanpa persetujuannya yang jelas adalah pelanggaran hak peribadi dan menimbulkan liabiliti undang-undang di banyak tempat. Suara adalah sebahagian daripada identiti seseorang; Peniruan boleh membawa kepada penipuan, fitnah dan kerosakan reputasi.

Prinsip asas yang perlu diikuti dalam pengklonan suara:

prinsip

Permohonan

Persetujuan yang jelas

Kebenaran bertulis daripada pemilik suara dengan skop tertentu

Kejelasan skop

Di mana, untuk berapa lama dan untuk tujuan apa ia akan digunakan?

ketelusan

Apabila perlu, maklumat "bunyi ini adalah pengeluaran buatan"

penggunaan terhad

Tidak melampaui persetujuan (projek baharu, produk berbeza)

kebolehunduran

Hak individu untuk menarik balik persetujuan

Awas: Mengklonkan suara selebriti, ahli politik atau seseorang yang anda kenali tanpa persetujuan mereka dan mencipta kandungan — walaupun dengan niat untuk menjadi "lawak" atau "percubaan" — adalah pelanggaran yang serius. Penyebaran kandungan yang dihasilkan di luar kawalan anda tidak boleh dibuat asal.

Alih suara berbilang bahasa

Alih suara sintetik ialah cara terpantas untuk membuka video ke dalam bahasa yang berbeza: alat itu menterjemah pertuturan, alih suara dalam bahasa sasaran dan kadangkala menyegerakkan pergerakan bibir. Ia adalah revolusioner untuk pencipta kandungan yang ingin menjangkau khalayak global. Tetapi ia adalah salah satu titik yang paling terdedah kerana tiga lapisan ralat yang berasingan bertindih: ralat terjemahan (simpulan bahasa, istilah, konteks), ralat penyiaran (nada salah, sebutan) dan ralat penyegerakan (salah padan bibir, masa tidak padan). Oleh itu, dalam alih suara berbilang bahasa, adalah perlu bagi seseorang yang mengetahui bahasa sasaran di peringkat asli untuk mengesahkan kedua-dua terjemahan dan alih suara. Integriti jenama, makna dan emosi hanya boleh dilindungi oleh kawalan manusia.

tiga kes mini

Kes 1 — Ganti suara yang pantas dan beretika. Pasukan e-pembelajaran terpaksa mengemas kini naratif kursus 40-video; Mengingat artis dengan setiap kemas kini adalah mahal. Mereka membuat kontrak bertulis dengan artis yang menyatakan skop suaranya diklon untuk kursus ini. Jadi mereka menghasilkan perubahan teks dalam beberapa minit, dengan suaranya dan persetujuannya. Artis kedua-duanya menerima bayarannya dan mengekalkan kawalan; Pasukan itu mendapat momentum.

Kes 2 — Skandal klon bukan konsensual. Seorang pencipta kandungan mengklonkan suara pelakon suara terkenal daripada video YouTubenya dan menggunakannya dalam iklan. Artis itu mengenali suaranya, memulakan proses undang-undang dan kejadian itu dilaporkan dalam akhbar. Reputasi jenama telah rosak, kandungan telah dialih keluar, dan pampasan telah dibawa ke agenda. Pengajaran: penggunaan audio tanpa persetujuan adalah bencana etika dan undang-undang.

Kes 3 — Alih suara tidak disahkan. Satu saluran mengalih suara videonya secara buatan ke dalam bahasa Sepanyol tetapi tidak pernah menyemaknya. Istilah teknikal telah disalah terjemah dan alih suara meletakkan penekanan yang menterbalikkan maksud ayat. Penonton Sepanyol menunjukkan kesilapan dalam komen, kepercayaan telah rosak. Cara yang betul ialah memastikannya disahkan oleh seseorang yang mengetahui bahasa sasaran.

Gesaan lemah / Gesaan kuat

Gesaan yang lemah:

Sebutkan teks ini.

Tiada watak vokal, nada, tempo, atau sebutan. Keluaran menjadi rata dan robotik.

Gesaan kuat:

Peranan anda: pengarah suara. Tujuan: 45 saat narasi promosi produk. Suara: 35 tahun, suara lelaki yang hangat, meyakinkan. Nada: bermaklumat tetapi ikhlas; tidak keterlaluan. Tempo: sederhana; perlahankan sedikit dalam ayat teknikal. Penekanan: serlahkan perkataan harga dan jaminan. Sebutan: "3D" -> "tiga dimensi"; nama jenama [JENAMA] sebagaimana adanya.Output: teks alih suara dengan penekanan dan jeda yang ditanda.Kekangan: gunakan suara persetujuan/sintetik sahaja; menyamar sebagai orang sebenar.

Kesilapan biasa

  • Membaca teks mentah tanpa bimbingan. Jika nada, tempo dan penekanan tidak diberikan, suara akan berbunyi robotik.
  • Menggunakan output TTS tanpa mendengarnya. Salah sebutan (nama yang betul, nombor, singkatan) adalah perkara biasa.
  • Pengklonan suara tanpa persetujuan. Pelanggaran etika dan undang-undang; Alasan "percubaan/lawak" tidak sah.
  • Melebihi skop persetujuan. Penggunaan kebenaran untuk projek dalam kerja lain adalah satu pelanggaran.
  • Tidak mengesahkan alih suara. Ralat terjemahan + alih suara + penyegerakan bertindih.
Petua: Dalam TTS, tulis nombor, singkatan dan nama khas dengan jelas dalam teks ("tiga puluh peratus", "tiga dimensi", "ey-edu"). Anda menentukan sebutan dan bukannya menyerahkannya kepada model untuk meneka.

Secara ringkasnya

Alih suara sintetik, pengklonan suara dan alih suara secara radikal mempercepatkan kerja audio dalam penghasilan video dan membolehkan capaian global. Untuk hasil yang baik, bimbing TTS dengan garis panduan nada, tempo, tekanan dan sebutan dan pastikan anda mendengar output. Pengklonan suara adalah berkuasa, tetapi ia menarik garis etika yang paling jelas: suara seseorang hanya boleh digunakan dengan persetujuan bertulis yang jelas, berskop; Meniru tanpa persetujuan adalah satu pelanggaran. Memandangkan ralat terjemahan, alih suara dan penyegerakan akan bertindih dalam alih suara berbilang bahasa, pengesahan oleh seseorang yang mengetahui bahasa sasaran adalah penting. Menghasilkan bunyi kenderaan; Persetujuan, ketepatan dan makna adalah tanggungjawab anda.

Tugasan permohonan

Tulis teks naratif 60 saat. Suarakan ini dengan alat TTS, dengan garis panduan nada/tempo/tekanan/sebutan seperti di atas. Dengar output dan cari dan betulkan sekurang-kurangnya tiga tempat yang salah sebut (nombor, nama khas, singkatan). Kemudian draf "borang persetujuan" mudah untuk pengklonan suara: suara siapa, projek mana, untuk tempoh berapa, untuk kegunaan apa, hak untuk menarik diri. Ringkaskan kerja anda.

senarai semak

  • [ ] Adakah saya telah membimbing penyuaraan dengan garis panduan nada, tempo, tekanan dan sebutan?
  • [ ] Adakah saya telah mendengar keluaran TTS dan membetulkan sebarang ralat sebutan/nombor/singkatan?
  • [ ] Adakah terdapat persetujuan bertulis yang jelas dan khusus untuk suara yang saya klon/gunakan?
  • [ ] Adakah saya telah memastikan bahawa saya tidak melebihi skop persetujuan (tempat, tempoh, tujuan)?
  • [ ] Adakah saya telah mengesahkan output alih suara untuk terjemahan/nada/penyegerakan dengan seseorang yang mengetahui bahasa sasaran?