Mga nadagdag:
- Kakayahang maunawaan ang mga konsepto ng awtomatikong transkripsyon at paghihiwalay ng speaker at i-convert ang raw recording sa text na naka-time-code
- Kakayahang maunawaan ang mga format ng subtitle (SRT/VTT), bilis ng pagbasa at mga panuntunan sa linya, at gumawa at mag-edit ng mga draft ng subtitle na multilinggwal.
- Pag-unawa na responsibilidad ng editor na i-verify ang terminolohiya, mga wastong pangalan, mga pagkakamali sa bantas at mga error sa pagsasalin sa awtomatikong transcript bago i-publish.
Ang pinaka nakakapagod, nakakaubos ng oras na gawain ng post-production ay tradisyunal na transkripsyon: walang katapusang pakikinig ang isang editor sa mga oras ng footage ng panayam, tina-type ang bawat pangungusap gamit ang kamay. Ang isang oras na pag-record ay madaling umabot ng apat hanggang limang oras upang ma-transcribe. Ang artificial intelligence ay radikal na nagbago sa negosyong ito: ngayon ang isang oras na pag-record ay maaaring gawing time-coded text sa ilang minuto. Pareho nitong pinapabilis ang pipeline ng pag-edit at nagbibigay-daan sa accessibility (mga subtitle para sa mga manonood na may kapansanan sa pandinig at tahimik na panonood). Ngunit ang awtomatikong output ay hindi kailanman angkop para sa publikasyon sa hilaw na anyo nito; Sa yunit na ito makikita natin ang parehong kapangyarihan at ang mga pitfalls.
Magsimula tayo sa mga tuntunin. Ang transkripsyon ay ang paglalagay ng pananalita sa pagsulat. Ang awtomatikong speech recognition (ASR) ay teknolohiyang nagsasalin ng boses sa teksto. Ang Timecode ay ang sign na nagpapakita kung aling segundo ang katumbas ng text sa video. Ang diarization ng tagapagsalita ay ang pagkilala sa "sino ang nagsalita" at paghahati ng teksto sa mga nagsasalita. Ang subtitle (subtitle/caption) ay ang time-coded text na lumalabas sa screen. Ang SRT at VTT ay ang pinakakaraniwang mga format ng subtitle na file; Naglalaman ang mga ito ng pagkakasunud-sunod, oras ng pagsisimula, at teksto ng bawat linya. Ang bilis ng pagbabasa (CPS: characters per second) ay tumutukoy kung gaano katagal dapat manatili ang linya sa screen para mabasa ng manonood nang kumportable ang subtitle.
Ang kapangyarihan at limitasyon ng awtomatikong transkripsyon
Ang transkripsyon ng AI ay nag-transcribe ng isang malinaw, solong-speaker na boses na naitala sa wastong Turkish na may napakataas na katumpakan. Ngunit nagkakamali ito sa mga sumusunod na sitwasyon, at ang pag-alam sa mga ito ay nagbibigay-daan sa iyong i-target ang pag-verify: mga wastong pangalan (mga pangalan ng mga tao, brand, lugar ay kadalasang mali ang spelling), mga teknikal na termino at pagdadaglat, magkatulad na tunog na mga salita (“kar/kar”, “still/still”), magkakapatong na pananalita (dalawang tao nang magkasabay), ingay sa background at musika (mga pagkakaiba sa diyalekto/accent o pagtatapos ng pangungusap). Bukod pa rito, ang modelo ay maaaring "makarinig" at mag-transcribe ng isang salita na hindi pa kailanman binibigkas sa isang maingay na sandali-ito ang guni-guni ng transkripsyon.
Ang sumusunod na talahanayan ay nagbubuod sa malakas at mahinang mga kondisyon para sa awtomatikong transkripsyon:
kundisyon
katumpakan
Pokus ng editor
Single speaker, malinaw na tunog, tahimik na kapaligiran
napakataas
Mga wastong pangalan, bantas
Multi-speaker panel
daluyan
Paghihiwalay ng tagapagsalita, magkakapatong na pananalita
Maingay/outdoor na pag-record
low-medium
gawa-gawa na salita, tumalon
Nilalaman ng teknikal/jargon
daluyan
Pagsusulat ng termino at pagdadaglat
impit na pananalita
Variable
Mga pagkakamali sa salita, kahulugan
Format ng subtitle at mga panuntunan sa pagiging madaling mabasa
Ang isang magandang subtitle ay hindi lamang "tamang teksto"; dapat nababasa. Mayroong ilang mga patakaran ng thumb sa internasyonal na kasanayan: ang isang linya ng mga subtitle sa pangkalahatan ay dapat na hindi hihigit sa dalawang linya; bawat linya ay dapat panatilihin sa isang makatwirang haba (humigit-kumulang 37-42 character); Ang subtitle ay dapat manatili sa screen ng sapat na katagalan upang mabasa (karaniwan ay 1-6 na segundo); Ang bilis ng pagbabasa ay hindi dapat masyadong mataas (karamihan sa mga gabay ay itinuturing na ~15-17 character/segundo bilang limitasyon). Awtomatikong hinahati ng mga tool ng AI ang subtitle, ngunit minsan pinuputol ng mga split na ito ang pangungusap sa masasamang lugar (linya na nagtatapos sa "at", break na naghahati sa kahulugan). Ang trabaho ng editor ay gawing tumpak at matatas ang teksto.
Ang iyong tungkulin: subtitle editor assistant. Nasa ibaba ang isang awtomatikong transcript. Gawain:1) Hatiin ang teksto sa mga bloke ng subtitle ayon sa lohika ng SRT.2) Ang bawat bloke ay dapat na maximum na 2 linya, bawat linya ay hindi dapat lumampas sa ~40 character.3) Hatiin ang pangungusap sa mga makabuluhang lugar; Linya na nagtatapos sa "at", "ngunit", "na".4) Markahan ang mga wastong pangngalan at termino gamit ang tag na [CHECK] para ma-verify ko ito nang manu-mano.5) Huwag baguhin ang teksto, hatiin lamang at markahan.
Ang ideya ng "[CONTROL] tag" sa prompt na ito ay mahalaga: Ang pagkakaroon ng marka ng AI sa mga lugar kung saan ito ay hindi sigurado o mapanganib (tamang pangalan, termino) ay nagdidirekta sa mata ng editor sa mga tamang lugar at pinipigilan ang bulag na pagtitiwala.
Multilingual na mga subtitle at pagsasalin
Ang pagbubukas ng isang video sa maraming wika ay nagdaragdag sa madla. Maaaring kunin ng AI ang transcript, isalin ito sa target na wika, at gumawa ng subtitle file. Ito ay isang malakas na kakayahan, ngunit ito ang pinaka-mahina: ang machine translation ay maaaring magkamali ng mga idyoma, kultural na sanggunian, katatawanan at puns, termino, at konteksto. Ang pagsasalin ng pangungusap na "Umuulan ng mga pusa at aso" bawat salita ay isang kalamidad. Mayroon ding puwang na hadlang sa pagsasalin ng subtitle: ang pangungusap sa target na wika ay maaaring mas mahaba at lumampas sa bilis ng pagbasa. Iyon ang dahilan kung bakit napakahalaga para sa multilinggwal na subtitling na i-verify ng taong nakakaalam ng target na wika ang pagsasalin — lalo na para sa sensitibong content gaya ng pagba-brand, legal o kalusugan, maaaring magkaroon ng malubhang kahihinatnan ang maling pagsasalin.
Isalin ang sumusunod na Turkish subtitle block sa English. Panuntunan: - Ilipat ang idyoma at biro, hindi verbatim, ngunit pinapanatili ang kanilang KAHULUGAN. - Iwanan ang pangalan ng tatak at pangalan ng produkto kung ano ang mga ito, huwag isalin. - Hayaang panatilihin ng bawat bloke ang bilis ng pagbasa nito; Paikliin kung kinakailangan, ngunit huwag baluktutin ang kahulugan. - Tukuyin ang sangguniang pangkultura o terminong hindi ka sigurado sa [TALA NG TAGASALIN].
tatlong mini case
Kaso 1 — Pabilis na linya. Isang documentary crew ang gumugol ng tatlong linggong kamay sa pag-transcribe ng 12-oras na archive ng mga panayam. Gamit ang awtomatikong transkripsyon, ang raw text ay na-output sa isang araw; Sa pamamagitan ng paghahanap sa pamamagitan ng text (salita sa salita), natagpuan ng team ang mga sandali na gusto nila sa ilang segundo. Pagkatapos ay masinsinan nilang in-edit at ni-subtitle lang ang 40 minutong episode na gagamitin nila. Ang tatlong linggo ay naging apat na araw; pagsusumikap sa pag-verify na nakatuon sa seksyong ginamit.
Case 2 — gawa-gawa na salita. Isang channel ng balita ang nag-broadcast ng maingay na panayam sa kalye na may mga awtomatikong subtitle, nang hindi sinusuri. "Narinig" ng modelo ang isang hindi binibigkas na salita sa background na ugong, at ang caption ay naglagay ng hindi binibigkas na salita sa kinapanayam. Nagkaroon ng reaksyon sa social media at na-publish ang correction. Aralin: sa maingay na pag-record, ang mga awtomatikong subtitle ay dapat ihambing sa orihinal na audio.
Kaso 3 — Kapahamakan sa pagsasalin. Isang brand ang nag-publish ng mga English subtitle ng pampromosyong video nito na may machine translation at walang kontrol. Kapag ang isang Turkish na idyoma ("bantayan") ay isinalin ng salita para sa salita, ito ay tila walang kahulugan at kahit na nakakatawa sa English audience, at ang kabigatan ng tatak ay nasira. Ang tamang paraan: upang ma-verify ang pagsasalin ng isang taong nakakaalam ng target na wika.
Mahinang prompt / Malakas na prompt
Mahinang prompt:
I-subtitle ang video na ito at isalin ito sa English.
Walang pag-format, walang mga panuntunan sa pagiging madaling mabasa, walang mga marka ng pagpapatunay. Ang output ay magiging krudo at peligroso.
Napakahusay na prompt:
Ang iyong tungkulin: bilingual subtitle editor. Input: Turkish timecoded transcript.Task:1) I-edit ang Turkish subtitle sa pamamagitan ng 2 linya / ~40 character / good division rules.2) Markahan ang mga wastong pangalan at termino ng [CONTROL].3) Gumawa ng English translation nang hiwalay; Ilipat ang parirala nang literal, pangalagaan ang pangalan ng tatak.4) Markahan ang mga bloke na lumampas sa bilis ng pagbasa ng [LONG].5) Huwag gumawa ng anumang salita; Isulat ang hindi tiyak na tunog [UNINDICATED].
Mga karaniwang pagkakamali
- Pag-publish ng mga awtomatikong transcript nang walang kontrol. Nananatili ang mga pagkakamali sa wastong pangalan, termino, bantas at gawa-gawang salita.
- Hindi magandang paghahati ng linya. Ang mga linyang nagtatapos sa "at/ngunit/ki" ay nagpapahirap sa pagbabasa.
- Labis na bilis ng pagbasa. Ang mahahabang subtitle na masyadong maikli sa screen ay hindi mababasa.
- Hindi bini-verify ang pagsasalin ng machine. Kung magkamali ang isang idyoma, biro o termino, maghihirap ang tatak.
- Nilagpasan ang pagkakaiba ng speaker. Kung may pagkalito tungkol sa "sino ang nagsabi ng ano" sa panel, ang subtitle ay mapanlinlang.
Tip: Habang ine-edit ang transcript, panoorin ang video sa bilis na 1.25-1.5 at tingnan kung naka-synchronize ito sa mga subtitle. Sa ganitong paraan, mabilis mong mahuli ang timecode drift at mga gawa-gawa/na-miss na salita.
Babala: Sa mga larangan tulad ng pangangalagang pangkalusugan, batas, pananalapi, maaaring magkaroon ng malubhang kahihinatnan ang isang maling pagkaka-transcribe na salita (hal. isang dosis, isang numero ng sangkap). Sa mga nilalamang ito, ang bawat numero at termino ay dapat magkahiwalay na ma-verify.
Sa buod
Ang automated transcription at subtitling ay ang pinakamalaking time saver ng post-production at nagbibigay-daan sa accessibility. Binabawasan ng AI ang mga oras ng transkripsyon sa mga minuto at nagbibigay-daan sa paghahanap sa pamamagitan ng text. Ngunit ang output ay hindi angkop para sa paglalathala sa hilaw na anyo nito: ang mga wastong pangalan, termino, bantas, gawa-gawang salita at hindi magandang line break ay dapat itama. Ang mga panuntunan sa pagiging madaling mabasa (haba ng linya, tagal, bilis ng pagbasa) ay ginagawang matatas ang teksto para sa manonood. Sa mga multilinggwal na subtitle, ang machine translation ay dapat na ma-verify ng isang taong nakakaalam ng target na wika. Ang AI ay nagbubuhos at nagmumungkahi; Ang katumpakan, pagiging madaling mabasa at kahulugan ay responsibilidad ng editor.
Gawain ng aplikasyon
Kumuha ng maikling pag-record ng pag-uusap (marahil ang sarili mong boses, 2-3 minuto) at awtomatikong i-transcribe ito. Ihambing ang output sa orihinal na audio at i-flag ang mga wastong pangngalan, termino, at mga error sa bantas; Maghanap ng hindi bababa sa limang mga error. Pagkatapos, ipamahagi ang teksto sa mga bloke ng subtitle ayon sa mga panuntunan sa itaas, isalin sa isang wika, at iwasto ang hindi bababa sa dalawang mapanganib na punto (idioms/terms) sa pagsasalin. Iulat ang proseso at anumang mga error na makikita mo.
checklist
- [ ] Inihambing ko ba ang transcript sa orihinal na audio at naitama ang anumang wastong pangngalan/termino/mga bantas na error?
- [ ] Nagsuri ba ako ng mga gawa-gawa o tinanggal na mga salita?
- [ ] Na-edit ko ba ang subtitle ayon sa haba ng linya, tagal at mga panuntunan sa bilis ng pagbasa?
- [ ] Para sa mga multilinggwal na subtitle, maingat ko bang na-verify ang pagsasalin sa isang taong nakakaalam ng target na wika?
- [ ] Hiwalay ko bang na-verify ang bawat numero at termino sa sensitibong nilalaman?