Lợi nhuận:
- Khả năng hiểu các công cụ chuyển văn bản thành giọng nói (TTS), sao chép giọng nói và lồng tiếng nhân tạo (lồng tiếng/đồng bộ hóa môi) và tạo bản nháp lồng tiếng
- Đạt được cách phát âm tự nhiên với các hướng dẫn về giai điệu, nhịp độ, trọng âm và cách phát âm, đồng thời có thể lập kế hoạch cho một phiên bản đa ngôn ngữ
- Việc nhân bản giọng nói của một người cần có sự đồng ý, bản quyền và quyền cá nhân; Hiểu rằng việc bắt chước giọng nói không được chấp thuận là vi phạm đạo đức và pháp lý
Âm thanh là một nửa video. Người xem có thể tha thứ cho hình ảnh xấu; không tha thứ cho âm thanh xấu. Trong sản xuất truyền thống, việc lồng tiếng rất tốn kém và chậm: tìm nghệ sĩ lồng tiếng, thiết lập phòng thu, ghi âm và gọi lại nếu xảy ra sai sót. Trí tuệ nhân tạo đã thay đổi bức tranh này: các công cụ chuyển văn bản thành giọng nói có thể chuyển văn bản thành giọng nói tự nhiên trong vài phút; nhân bản giọng nói có thể "học" giọng nói của một người và khiến họ nói những câu mới; Công cụ lồng tiếng nhân tạo có thể chuyển video sang ngôn ngữ khác hài hòa với chuyển động của môi. Mỗi khả năng mạnh mẽ này cũng mang một trách nhiệm pháp lý và đạo đức nghiêm trọng. Trong phần này, chúng ta sẽ đề cập đến cả kỹ thuật và đường viền.
Điều khoản. Chuyển văn bản thành giọng nói (TTS) là công nghệ chuyển đổi văn bản viết thành giọng nói tổng hợp. Nhân bản giọng nói là tạo ra một mô hình bắt chước giọng nói của người thật từ một mẫu giọng nói. Lồng tiếng nhân tạo là dịch lời nói của video sang ngôn ngữ khác và lồng tiếng bằng ngôn ngữ đó, thường làm cho video tương thích với cử động môi (hát nhép). Thi điệu là hình mẫu của ngữ điệu, trọng âm và nhịp điệu của lời nói—“cảm xúc” của một câu phần lớn đến từ thi ca. Âm vị là đơn vị âm thanh nhỏ nhất trong ngôn ngữ; Các vấn đề về phát âm thường được giải quyết ở cấp độ âm vị.
Giọng nói chuyển văn bản thành giọng nói
Các công cụ TTS ngày nay trở nên tự nhiên một cách đáng ngạc nhiên; nhưng để có được một bản lồng tiếng "hay" đòi hỏi phải điều khiển phương tiện một cách chính xác. Dán văn bản thô và nói "đã đọc" sẽ mang lại kết quả phẳng và tự động. Để lồng tiếng tốt, cần hướng dẫn: tính chất giọng nói (tuổi, giới tính, độ ấm), giọng điệu (chân thành, nghiêm túc, phấn khích), nhịp độ (tường thuật chậm hoặc quảng cáo tràn đầy năng lượng), nhấn mạnh (từ nào nên nổi bật), ngắt quãng (thở, dấu câu) và phát âm (tên riêng, chữ viết tắt, từ nước ngoài). Nhiều công cụ cung cấp cho bạn quyền kiểm soát này bằng cách thêm dấu câu và hướng dẫn ngắn vào văn bản hoặc bằng cách sử dụng đánh dấu đặc biệt.
Vai trò của bạn: trợ lý đạo diễn lồng tiếng.Văn bản: [văn bản tường thuật dài 60 giây bên dưới]Chỉ thị bằng giọng nói:- Giọng nói: giọng nữ độ tuổi 30, ấm áp và yên tâm.- Giọng điệu: điềm tĩnh, chân thành; KHÔNG la hét mang tính thương mại.- Nhịp độ: chậm vừa phải; hơi thở ngắn ở cuối mỗi câu.- Trọng âm: nhấn nhẹ từ “free” và “30 Days”.- Phát âm: “AiEdu” -> “ey-edu”; "%" -> "percentage".Nhiệm vụ: Chuẩn bị văn bản được đánh dấu theo hướng dẫn này (chỉ định vị trí sẽ xuất hiện dấu nhấn/tạm dừng).
Hãy nhớ nghe và kiểm tra đầu ra TTS: tên riêng bị phát âm sai, trọng âm lạ và các khoảng dừng không tự nhiên là phổ biến. Trong tiếng Thổ Nhĩ Kỳ, các từ có nguồn gốc nước ngoài, đặc biệt là các từ, chữ viết tắt và số gây ra vấn đề ("2024" -> "hai nghìn hai mươi bốn" hay "hai mươi hai mươi bốn"?).
Nhân bản giọng nói: sức mạnh và trách nhiệm
Nhân bản giọng nói tạo ra một mô hình bắt chước giọng nói của một người sau vài phút ghi âm. Nó có những mục đích sử dụng hợp pháp: hoàn thành việc lồng tiếng bằng giọng của người thuyết trình, với sự đồng ý của người đó, vào một ngày ốm; sử dụng nhất quán "bản sắc âm thanh" đã được phê duyệt của thương hiệu; để làm cho giọng nói của chính mình nói bằng các ngôn ngữ khác. Nhưng chính quyền lực này đã tạo ra ranh giới đạo đức lớn nhất: nhân bản và sử dụng giọng nói của một người mà không có sự đồng ý rõ ràng của người đó là vi phạm quyền cá nhân và làm phát sinh trách nhiệm pháp lý ở nhiều nơi. Giọng nói là một phần bản sắc của một người; Sự bắt chước có thể dẫn đến gian lận, bôi nhọ và tổn hại danh tiếng.
Các nguyên tắc cơ bản cần tuân thủ khi nhân bản giọng nói:
nguyên tắc
ứng dụng
Sự đồng ý rõ ràng
Sự cho phép bằng văn bản của chủ sở hữu giọng nói với phạm vi cụ thể
Phạm vi rõ ràng
Nó sẽ được sử dụng ở đâu, trong bao lâu và cho mục đích gì?
minh bạch
Khi cần thiết, thông tin “âm thanh này là âm thanh giả tạo”
hạn chế sử dụng
Không vượt quá sự đồng ý (dự án mới, sản phẩm khác)
khả năng thu vào
Quyền rút lại sự đồng ý của cá nhân
Thận trọng: Sao chép giọng nói của người nổi tiếng, chính trị gia hoặc người nào đó mà bạn biết mà không có sự đồng ý của họ và tạo nội dung — ngay cả với mục đích là "trò đùa" hoặc "thử nghiệm" — là vi phạm nghiêm trọng. Việc phổ biến nội dung được sản xuất ngoài tầm kiểm soát của bạn không thể hoàn tác được.
Lồng tiếng đa ngôn ngữ
Lồng tiếng tổng hợp là cách nhanh nhất để mở video sang các ngôn ngữ khác nhau: công cụ dịch lời nói, lồng tiếng bằng ngôn ngữ đích và đôi khi đồng bộ hóa chuyển động môi. Đây là cuộc cách mạng dành cho những người sáng tạo nội dung muốn tiếp cận khán giả toàn cầu. Nhưng đó lại là một trong những điểm dễ bị tổn thương nhất bởi ba lớp lỗi riêng biệt chồng lên nhau: lỗi dịch thuật (thành ngữ, thuật ngữ, ngữ cảnh), lỗi phát âm (sai thanh điệu, phát âm) và lỗi đồng điệu (lời môi không khớp, lệch thời gian). Vì vậy, trong việc lồng tiếng đa ngôn ngữ, cần phải có một người biết ngôn ngữ đích ở trình độ bản xứ để xác minh cả bản dịch và lồng tiếng. Tính toàn vẹn của thương hiệu, ý nghĩa và cảm xúc chỉ có thể được bảo vệ bởi sự kiểm soát của con người.
ba trường hợp nhỏ
Trường hợp 1 - Giọng nói nhanh và có đạo đức. Một nhóm học trực tuyến đã phải cập nhật nội dung tường thuật của một khóa học dài 40 video; Việc nhớ lại nghệ sĩ sau mỗi lần cập nhật là rất tốn kém. Họ đã lập một hợp đồng bằng văn bản với nghệ sĩ trong đó nêu rõ phạm vi giọng nói của anh ấy/cô ấy được nhân bản cho khóa học này. Vì vậy, họ đã tạo ra những thay đổi văn bản trong vài phút với sự đồng ý và lên tiếng của anh ấy. Người nghệ sĩ vừa nhận được phí của mình vừa duy trì quyền kiểm soát; Đội đã đạt được động lực.
Trường hợp 2 - Vụ bê bối nhân bản không có sự đồng thuận. Một người sáng tạo nội dung đã sao chép giọng nói của một diễn viên lồng tiếng nổi tiếng từ các video trên YouTube của anh ấy và sử dụng giọng đó trong một quảng cáo. Nghệ sĩ nhận ra giọng nói của anh, bắt đầu thủ tục pháp lý và vụ việc được đưa tin trên báo chí. Danh tiếng của thương hiệu bị tổn hại, nội dung bị xóa và việc bồi thường được đưa vào chương trình nghị sự. Bài học: việc sử dụng âm thanh không có sự đồng thuận vừa là một thảm họa về mặt đạo đức vừa là pháp lý.
Trường hợp 3 - Lồng tiếng chưa được xác minh. Một kênh đã lồng tiếng giả tạo cho các video của mình sang tiếng Tây Ban Nha nhưng chưa bao giờ kiểm tra. Một thuật ngữ kỹ thuật đã bị dịch sai và phần lồng tiếng đã nhấn mạnh làm đảo ngược ý nghĩa của câu. Khán giả Tây Ban Nha chỉ ra sai sót trong bình luận, niềm tin bị tổn hại. Cách đúng đắn là nhờ một người biết ngôn ngữ đích xác minh.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Nói văn bản này.
Không có đặc điểm giọng hát, giai điệu, nhịp độ hoặc cách phát âm. Đầu ra trở nên phẳng và robot.
Lời nhắc mạnh mẽ:
Vai trò của bạn: đạo diễn lồng tiếng. Mục đích: 45 giây thuyết minh giới thiệu sản phẩm. Giọng nói: 35 tuổi, giọng nam ấm áp, yên tâm. Giọng điệu: giàu thông tin nhưng chân thành; không cường điệu. Nhịp độ: trung bình; nói chậm lại một chút trong các câu kỹ thuật. Nhấn mạnh: nhấn mạnh các từ giá cả và bảo hành. Phát âm: “3D” -> “ba chiều”; tên thương hiệu [BRAND] như hiện tại.Đầu ra: văn bản lồng tiếng có điểm nhấn và điểm dừng được đánh dấu.Ràng buộc: chỉ sử dụng sự đồng ý/giọng nói tổng hợp; mạo danh người thật.
Những lỗi thường gặp
- Đọc văn bản thô mà không cần hướng dẫn. Nếu âm sắc, nhịp độ và điểm nhấn không được cung cấp, giọng nói sẽ có vẻ như robot.
- Sử dụng đầu ra TTS mà không cần nghe nó. Phát âm sai (tên riêng, số, viết tắt) là phổ biến.
- Nhân bản giọng nói mà không có sự đồng ý. Vi phạm đạo đức và pháp lý; Lý do "thử nghiệm/đùa" là không hợp lệ.
- Vượt quá phạm vi cho phép. Việc sử dụng quyền cho một dự án trong một tác phẩm khác là vi phạm.
- Không xác minh việc lồng tiếng. Dịch + lồng tiếng + lỗi đồng bộ chồng chéo.
Mẹo: Trong TTS, hãy viết rõ ràng số, chữ viết tắt và tên riêng trong văn bản ("ba mươi phần trăm", "ba chiều", "ey-edu"). Bạn xác định cách phát âm thay vì để người mẫu đoán.
Tóm lại
Việc lồng tiếng tổng hợp, sao chép giọng nói và lồng tiếng giúp tăng tốc đáng kể công việc xử lý âm thanh trong quá trình sản xuất video và cho phép tiếp cận toàn cầu. Để có kết quả tốt, hãy hướng dẫn TTS bằng các hướng dẫn về âm điệu, nhịp độ, trọng âm và cách phát âm, đồng thời đảm bảo lắng nghe đầu ra. Nhân bản giọng nói rất mạnh mẽ, nhưng nó vạch ra ranh giới đạo đức rõ ràng nhất: giọng nói của một người chỉ có thể được sử dụng khi có sự đồng ý rõ ràng, có phạm vi và bằng văn bản; Bắt chước mà không được sự đồng ý là vi phạm. Vì các lỗi dịch thuật, lồng tiếng và đồng bộ hóa sẽ chồng chéo lên nhau khi lồng tiếng đa ngôn ngữ nên việc xác minh bởi một người biết ngôn ngữ đích là điều cần thiết. Tạo ra âm thanh xe cộ; Sự đồng ý, tính chính xác và ý nghĩa là trách nhiệm của bạn.
Nhiệm vụ ứng dụng
Viết một đoạn văn kể chuyện dài 60 giây. Nói ra điều này bằng công cụ TTS, với các nguyên tắc về âm điệu/nhịp độ/căng thẳng/phát âm như trên. Nghe đầu ra và tìm và sửa ít nhất ba vị trí phát âm sai (số, tên riêng, chữ viết tắt). Sau đó soạn thảo một “biểu mẫu đồng ý” đơn giản để nhân bản giọng nói: giọng nói của ai, dự án nào, trong thời gian bao lâu, mục đích sử dụng, quyền rút lại. Tóm tắt công việc của bạn.
danh sách kiểm tra
- [ ] Tôi đã hướng dẫn cách phát âm theo các nguyên tắc về âm điệu, nhịp độ, trọng âm và cách phát âm chưa?
- [ ] Tôi đã nghe đầu ra TTS và sửa bất kỳ lỗi phát âm/số/viết tắt nào chưa?
- [ ] Có sự đồng ý rõ ràng và cụ thể bằng văn bản đối với giọng nói mà tôi sao chép/sử dụng không?
- [ ] Tôi đã đảm bảo rằng mình không vượt quá phạm vi chấp thuận (địa điểm, thời gian, mục đích) chưa?
- [ ] Tôi đã xác minh đầu ra lồng tiếng để dịch/âm/đồng bộ hóa với người biết ngôn ngữ đích chưa?