Mga nadagdag:
- Kakayahang magkasya habang pinapanatili ang kahulugan sa pamamagitan ng paglalapat ng mga teknikal na panuntunan ng subtitle (linya, karakter, CPS)
- Kakayahang i-verify ang wastong pangalan at numero ng mga error sa pamamagitan ng boses habang pinapabilis ang transkripsyon at awtomatikong timecoding gamit ang ASR
- Kakayahang pamahalaan ang mga limitasyon ng artificial intelligence sa pamamagitan ng pagsasaalang-alang sa konteksto ng visual, pagkakaiba ng tono at pag-sync ng labi sa dubbing
Ang pagsasalin ng isang pelikula, serye sa TV, corporate video o online na kurso ay lubos na naiiba sa pagsasalin ng plain text: oras, bilis ng pagbasa, on-screen na larawan, boses at galaw ng labi ng mga karakter ay mga hadlang din. Sa unit na ito, matututunan mo ang audiovisual translation (subtitling, dubbing, voice-over), ang mga teknikal na panuntunan ng subtitling, transcription na suportado ng AI at time coding, at ang mga de-kalidad na pitfalls ng field na ito. Ang layunin ay gumana tulad ng isang audiovisual na eksperto sa pagsasalin na "angkop sa mga mata at tainga ng madla" sa halip na "pagsasalin ng teksto."
Pangunahing konsepto
Ang pagsasalin ng audiovisual (AVT) ay ang pagsasalin ng nilalamang naglalaman ng audio at video; Ang mga pangunahing form ay subtitle, dubbing at audio na paglalarawan. Ang subtitling ay ang repleksyon ng pagsasalita sa nakasulat na anyo sa screen. Ang dubbing ay ang muling pag-dubbing ng orihinal na boses sa target na wika. Ang voice-over ay kapag ang orihinal na tunog ay naka-mute at isang pagsasalin ay binasa sa ibabaw nito (karaniwan sa mga dokumentaryo).
Dalawang kritikal na teknikal na termino ng subtitling: Nililimitahan ng CPS (Characters Per Second) ang bilis ng subtitling para komportable itong basahin ng manonood; Ang karaniwang tinatanggap na limitasyon sa itaas ay humigit-kumulang 17 character bawat segundo (mas mababa para sa nilalamang pambata). Ang Timecode ay ang oras ng pagsisimula na nagsasaad kung kailan lalabas at mawawala ang subtitle sa screen (tulad ng 00:01:23,400).
Bakit mahirap? Dahil nangangahulugan ito ng angkop na pagsasalin sa mga subtitle. Dalawang linya, ~42 character bawat linya, minimum na ~1 segundo at maximum na ~6 na segundo ng tagal ng screen, at ang limitasyon ng CPS — kailangan mong sumunod sa lahat ng ito habang pinapanatili ang kahulugan at tono. Iyon ang dahilan kung bakit ang pagsasalin ng subtitle ay madalas na isang bagay ng compression at rephrasing, hindi word-for-word translation.
Tip: Iwasan ang reflex ng "pagsasalin ng bawat salita" sa mga subtitle. Ang manonood ay parehong nanonood at nagbabasa ng larawan; Hindi mababasa ang masyadong mahahabang subtitle. Ang paghahanap ng pinakamaikling natural na expression na nagpapanatili ng kahulugan ay ang tunay na kasanayan ng captioner.
Ang papel ng AI sa pagsasalin ng audiovisual
Ang AI ay makabuluhang nagpapabilis ng ilang hakbang sa lugar na ito:
- Transkripsyon: Gamit ang ASR (Automatic Speech Recognition), awtomatikong na-transcribe ang boses. Kinukuha nito ang raw source ng subtitle sa ilang minuto.
- Awtomatikong time coding: Hinahati ng mga tool ang pag-uusap sa mga segment at gumagawa ng mga draft time code.
- Translation draft: Ang transcript text ay isinalin.
- Kontrol ng CPS/haba: Maaaring markahan ng AI kung aling subtitle ang lumampas sa bilis ng pagbabasa at magmungkahi ng pagpapaikli.
Ngunit mag-ingat: Ang ASR ay nagkakamali sa ingay, impit, magkakapatong na pananalita, tamang pangalan, at teknikal na termino; hindi makapagbigay ng "audio description"; Kung sino ang nagsasalita ay maaaring malito. Ang pagsasalin ng AI ay hindi nakikita ang larawan — hindi nito malalaman kung kailan ang isang bagay na ipinapakita sa screen ay tinatawag na "iyan." Samakatuwid, bini-verify ng tao ang visual na konteksto at katumpakan ng pag-decipher.
Pag-iingat: Ang pinakakaraniwang pagkakamali ay isipin na ang output ng ASR ay "na-decode". Ang ASR ay madalas na nagkakamali, lalo na sa mga wastong pangalan, numero, pangalan ng tatak at teknikal na termino; ang isang maling transkripsyon ay dinadala sa pagsasalin at subtitling. Tiyaking i-verify ang mga kritikal na lugar sa pamamagitan ng pakikinig sa audio.
Mga panuntunan sa format ng subtitle
Mga karaniwang panuntunan (nag-iiba ayon sa platform):
- ~37-42 character bawat linya, maximum na 2 linya.
- Tagal: ~1-6 segundo; Iwasan ang napakaikling "flash" na mga subtitle.
- CPS ay hindi lalampas sa ~17 (pang-adultong nilalaman).
- Hatiin ang pangungusap kung saan ito makatuwiran (huwag mag-iwan ng "at" o "ngunit" sa dulo ng linya).
- Kung maaari, huwag laktawan ang scene cut (pagbabago ng shot).
- Sundin ang mga panuntunan sa platform para sa mga item gaya ng pagmumura, kanta, screen writing.
tatlong mini case
Case 1 — Ang ASR + post-edit ay bumilis ng 60%. Isang team ang unang nag-transcribe at nag-time-code ng isang 45 minutong dokumentaryo gamit ang ASR, pagkatapos ay isinalin at na-edit ito pagkatapos. Nabawasan ang oras ng 60% kumpara sa pag-transcribe + time coding mula sa simula. Ngunit ang lahat ng wastong pangalan at numero ay naitama sa pamamagitan ng tunog na paghahambing.
Kaso 2 — Sinuri ng CPS ang nai-save na pagiging madaling mabasa. Ang unang pagsasalin ng isang video sa pagtuturo na may mga subtitle ay tumpak, ngunit ang CPS ay nag-average ng 24 — ang madla ay hindi makasabay. Ang isang round ng AI-powered shortening ay pinaikli ng 30% ang mga subtitle, na binabawasan ang CPS sa 16; ang kahulugan ay napanatili, ang pagiging madaling mabasa ay dumating.
Kaso 3 — Error sa konteksto ng visual. Sa pagsasalin na batay sa ASR, itinuro ng isang karakter ang isang karatula sa screen at sinabing "basahin mo iyan"; Isinalin ito ng AI bilang "basahin ito", ngunit ang teksto sa karatula ay hindi isinalin, kaya hindi makita ng manonood kung ano ang babasahin. Nagdagdag ang captioner ng hiwalay na caption para sa screen caption; Ang taong nakakita ng larawan ang gumawa ng pagkakaiba.
Apat na maaaring kopyahin na mga template
1) Listahan ng pag-verify ng Transcription (ASR):
Nasa ibaba ang isang awtomatikong transkripsyon ng isang video. Markahan ang mga posibleng error sa transkripsyon: mga wastong pangalan, pangalan ng brand, numero, teknikal na termino, hindi malinaw/hindi kumpletong mga pangungusap. Ilista ang mga ito bilang "i-verify sa pamamagitan ng boses." Huwag isalin. Transcribe: [...]
2) Pagsasalin ng subtitle (limitado ang CPS/haba):
Isalin ang sumusunod na transkripsyon sa [target na wika] na mga subtitle. CONSTRAINT: bawat subtitle ay dapat na maximum na 2 linya, linya ~42 character, CPS ay hindi lalampas sa ~17. PIKILIAN at gawing natural habang pinapanatili ang kahulugan; huwag magsalin ng salita sa salita. Panatilihin ang mga code ng oras. Transkripsyon + time code: [...]
3) CPS/pagsusuri sa pagiging madaling mabasa:
Kalkulahin ang tinatayang CPS batay sa tagal at bilang ng character para sa bawat isa sa mga sumusunod na subtitle. Markahan ang alinmang lumampas sa 17 at magmungkahi ng mas maikling alternatibo na nagpapanatili ng kahulugan. Mga subtitle (teksto | tagal ng mga segundo): [...]
4) Pagsusuri ng teksto sa screen / visual na konteksto:
Sa sumusunod na dialogue, markahan ang mga lugar na maaaring sumangguni sa larawan (screen text, pointed object, sign). Sabihin kung kailangan ng mga karagdagang subtitle / paliwanag para sa mga ito, sa pag-aakalang hindi nakikita ng manonood ang larawan. Dialogue: [...]
Mahinang prompt / Malakas na prompt
Mahina: "Isalin ang mga subtitle na ito." (Walang haba, CPS, mga panuntunan sa linya; hindi magkakasya ang output sa screen, hindi nababasa.)
Güçlü: "Isalin ang transcript ng dialogue na ito sa mga Turkish subtitle. Ang bawat subtitle ay dapat na maximum na 2 linya, 42 character bawat linya; paikliin ito habang pinapanatili ang kahulugan kung kinakailangan para sa bilis ng pagbasa. Ibigay ang sinasalitang wika sa natural na Turkish, palambutin ang slang. Huwag hawakan ang mga time code."
Pagkakaiba: ang malakas na prompt ay nagbibigay ng mga teknikal na hadlang ng subtitle (linya, karakter, CPS, tono); ang output ay talagang lumalapit sa magagamit na mga subtitle.
tsart ng paghahambing ng mga format ng AVT
pormat
Ano ang ginagawa
kontribusyon ng AI
kritikal na punto ng tao
subtitle
Isinasalin ang talumpati
ASR, pagsasalin, CPS
Angkop, visual na konteksto
dubbing
Voiceover sa target na wika
Pagsasalin draft
lip sync, acting
voice-over
Basahin ang pagsasalin sa itaas
Pagsasalin, timing
Natural na daloy, tono
Paglalarawan ng audio
Inilalarawan ang larawan na may tunog
draft na teksto
Visual na interpretasyon (tao)
Mga karaniwang pagkakamali
- Pagsasalin ng transcript ng ASR nang hindi ito bini-verify. Ang mga error sa wastong pangalan/numero ay dinadala sa subtitle.
- Pagsasalin ng salita sa salita at paglibot sa CPS. Hindi makabasa ang madla; dapat gawin ang akma.
- Hindi pinapansin ang visual na konteksto. Nananatiling hindi naisasalin ang screen text at mga nakatutok na bagay.
- Ginagawang walang kabuluhan ang paghahati ng linya. Sinisira nito ang pagiging madaling mabasa.
- Pag-flatte ng tono/pagrehistro. Ang mga diyalekto at slang ng mga tauhan ay nawawala.
Dubbing at lip sync
Habang ang hadlang sa subtitling ay ang bilis ng pagbasa, ang limitasyon ng dubbing ay oras at labi. May tatlong natatanging uri ng pag-sync sa voice-over na pagsasalin: lip-sync — kung saan tumutugma ang pagsasalin sa paggalaw ng bibig ng karakter, lalo na ang mga bukas na patinig sa mga close-up; isochrony — ang linya ng pagsasalin ay kapareho ng haba ng orihinal na linya, hindi masyadong maikli o masyadong mahaba; gesture synchrony — tumutugma sa sinasabi sa mga galaw ng kamay at braso ng karakter. Kaya naman ang dubbing translator ay madalas na nagsusulat ng "catchy" na linya na nagpapanatili ng kahulugan ngunit may ganap na magkakaibang mga salita; Ang katapatan ng salita ay mas mababa pa sa subtitle dito.
Ang AI ay maaaring magbigay ng isang raw na draft ng pagsasalin at isang babala sa oras para sa pag-dubbing ("ang linyang ito ay 40% na mas mahaba kaysa sa orihinal, paikliin ito"). Ang mga bagong teknolohiya ay maaari pang mag-clone ng tunog at makagawa ng awtomatikong pag-dubbing; ngunit ang pag-arte, emosyon, pag-fine-tune ng paghinga at pag-lip-sync ng karakter ay trabaho pa rin ng tagasalin ng tao at voice actor. Ang awtomatikong pag-dubbing ay nagbibigay ng isang balangkas; Ang masining at magkasabay na desisyon ay sa tao. Bukod pa rito, ang pahintulot ng taong na-clone ang boses ay isang mahalagang isyu sa etika at legal.
Sa buod
Ang pagsasalin ng audiovisual ay ang sining ng angkop na teksto sa loob ng mga limitasyon ng mata at tenga ng manonood: mga hangganan ng linya/character/CPS sa subtitling, lip-sync sa dubbing, visual na konteksto ang tumutukoy sa salik sa lahat ng ito. Pinapabilis ng AI ang transcription, timecoding, translation drafting, at CPS checking gamit ang ASR; Ngunit ang ASR ay nagkakamali sa mga wastong pangalan at ingay, hindi nito makita ang imahe at ang mga desisyon ng fit-tone ay ginawa ng tao. Ang master subtitler ay hindi nagsasalin ng salita por salita; hinahanap ang pinakamaikling, pinaka-natural na pagpapahayag na nagpapanatili ng kahulugan.
Gawain ng aplikasyon
Pumili ng isang maikling (2-3 minuto) na video clip. Mag-transcribe gamit ang isang ASR tool at ihambing at itama ang mga mapanganib na lugar gamit ang audio gamit ang isang template na "pag-verify ng transkripsyon." Pagkatapos ay i-translate gamit ang CPS ~17 constraint na may template na "subtitle translation" at paikliin ang mga subtitle na lumampas sa limitasyon gamit ang "CPS control". Kung mayroong screen text o sign, maglapat ng "visual context check."
checklist
- [ ] Na-verify ko ang ASR decryption sa pamamagitan ng boses para sa partikular na pangalan/numero.
- [ ] Ginawa kong akma ang mga subtitle sa mga panuntunan ng linya/character/CPS.
- [ ] Pinaikli ko at ginawang natural ito, hindi salita sa salita, pinapanatili ang kahulugan.
- [ ] Isinasaalang-alang ko ang visual na konteksto (onscreen text, sign).
- [ ] Isinalin ko ito upang mapanatili ang mga pagkakaiba sa tono at karakter.