Dobici:
- Sposobnost razumijevanja koncepata automatske transkripcije i odvajanja govornika te pretvaranje sirove snimke u vremenski kodirani tekst
- Sposobnost razumijevanja formata titlova (SRT/VTT), brzine čitanja i pravila linije, te izrade i uređivanja višejezičnih nacrta titlova
- Uz razumijevanje da je odgovornost urednika provjeriti terminologiju, vlastita imena, interpunkcijske pogreške i pogreške u prijevodu u automatskom prijepisu prije objave.
Najzamorniji zadatak postprodukcije koji je oduzimao mnogo vremena tradicionalno je bio transkripcija: montažer bi beskonačno slušao sate snimaka intervjua, rukom ispisujući svaku rečenicu. Za transkripciju jednosatne snimke lako bi bilo potrebno četiri do pet sati. Umjetna inteligencija radikalno je promijenila ovaj posao: danas se snimka od sat vremena može pretvoriti u vremenski kodirani tekst u nekoliko minuta. Ovo ubrzava proces uređivanja i omogućuje pristupačnost (titlovi za gledatelje oštećena sluha i tiho gledanje). Ali automatski ispis nikada nije prikladan za objavljivanje u svom sirovom obliku; U ovoj jedinici vidjet ćemo i snagu i zamke.
Počnimo s uvjetima. Transkripcija je zapisivanje govora. Automatsko prepoznavanje govora (ASR) tehnologija je koja prevodi glas u tekst. Timecode je znak koji pokazuje kojoj sekundi odgovara tekst u videu. Diarizacija govornika je razlikovanje "tko je govorio" i podjela teksta na govornike. Podnaslov (titl/naslov) je vremenski kodirani tekst koji se pojavljuje na ekranu. SRT i VTT su najčešći formati datoteka titlova; Sadrže redoslijed, vrijeme početka i završetka i tekst svakog retka. Brzina čitanja (CPS: znakova u sekundi) određuje koliko dugo linija mora ostati na ekranu da bi gledatelj mogao udobno čitati podnaslov.
Snaga i granica automatskog prijepisa
AI transkripcija transkribira jasan glas jednog govornika snimljen na ispravnom turskom jeziku s vrlo velikom točnošću. Ali griješi u sljedećim situacijama, a poznavanje njih vam omogućuje ciljanu provjeru: vlastita imena (imena ljudi, robnih marki, mjesta često su pogrešno napisana), tehnički izrazi i kratice, riječi sličnog zvuka ("kar/kar", "još/još"), preklapanje govora (dvije osobe u isto vrijeme), pozadinska buka i glazba, razlike u dijalektu/naglasku i interpunkcija (pitanje ili kraj rečenice). Uz to, model može "čuti" i transkribirati riječ koja nikad nije izgovorena u bučnom trenutku - ovo je halucinacija transkripcije.
Sljedeća tablica sažima jake i slabe uvjete za automatsku transkripciju:
stanje
točnost
Fokus urednika
Jedan zvučnik, čist zvuk, tiho okruženje
vrlo visoko
Vlastita imena, interpunkcija
Panel s više zvučnika
srednji
Odvajanje govornika, preklapanje govora
Bučno/snimanje na otvorenom
nisko-srednje
Izmišljena riječ, skok
Tehnički/žargonski sadržaj
srednji
Pisanje pojmova i kratica
naglašeni govor
Varijabilna
Pogreške u riječi, značenje
Format podnaslova i pravila čitljivosti
Dobar titl nije samo "ispravan tekst"; mora biti čitljiv. U međunarodnoj praksi postoji nekoliko praktičnih pravila: redak titlova općenito ne smije imati više od dva retka; svaki red treba imati razumnu duljinu (otprilike 37-42 znaka); Podnaslov mora ostati na ekranu dovoljno dugo da se može pročitati (obično 1-6 sekundi); Brzina čitanja ne smije biti previsoka (većina vodiča kao ograničenje smatra ~15-17 znakova/sekundi). Alati umjetne inteligencije automatski dijele podnaslove, ali ta podjela ponekad reže rečenicu na lošim mjestima (redak koji završava s "i", prekid koji dijeli značenje). Posao urednika je da tekst bude točan i tečan.
Vaša uloga: pomoćnik urednika titlova. Ispod je automatski prijepis. Zadatak:1) Podijelite tekst u blokove podnaslova prema SRT logici.2) Svaki blok treba imati najviše 2 retka, svaki red ne smije biti duži od ~40 znakova.3) Podijelite rečenicu na smislena mjesta; Redak koji završava s "i", "ali", "ono".4) Označite vlastite imenice i izraze oznakom [PROVJERI] kako bih ih mogao ručno provjeriti.5) Nemojte mijenjati tekst, samo razdvojite i označite.
Ideja "[CONTROL] tag" u ovom upitu je vrijedna: AI označava područja gdje je nesigurno ili rizično (pravo ime, izraz) usmjerava pogled urednika na prava mjesta i sprječava slijepo povjerenje.
Višejezični titlovi i prijevod
Otvaranje videa na više jezika povećava publiku. AI može uzeti transkript, prevesti ga na ciljni jezik i proizvesti datoteku titlova. Ovo je moćna mogućnost, ali je najosjetljivija: strojno prevođenje može krivo predstaviti idiome, kulturne reference, humor i igru riječi, pojmove i kontekst. Prevesti rečenicu "Pada kiša, mačke i psi" od riječi do riječi je katastrofa. Također postoji prostorno ograničenje u prijevodu titlova: rečenica na ciljnom jeziku može biti duža i premašiti brzinu čitanja. Zato je za višejezično titlovanje bitno da osoba koja poznaje ciljni jezik provjeri prijevod — posebno za osjetljive sadržaje kao što su robne marke, pravni ili zdravstveni, netočan prijevod može imati ozbiljne posljedice.
Prevedite sljedeće blokove turskih titlova na engleski. Pravila: - Prenesite idiom i šalu, ne doslovce, ali čuvajući njihovo ZNAČENJE. - Ostavite ime marke i naziv proizvoda kakvi jesu, nemojte prevoditi. - Neka svaki blok zadrži svoju brzinu čitanja; Skratite ako je potrebno, ali ne iskrivljujte značenje. - Navedite kulturnu referencu ili termin za koji niste sigurni pomoću [NAPOMENA PREVODITELJA].
tri mini kućišta
Slučaj 1 — linija za ubrzanje. Dokumentarna ekipa provela je tri tjedna ručno transkribirajući 12-satnu arhivu intervjua. Uz automatsku transkripciju, neobrađeni tekst izlazio je u jednom danu; Pretragom teksta (riječ po riječ) tim je u sekundi pronašao željene trenutke. Zatim su pedantno montirali i titlovali samo epizodu od 40 minuta koju bi koristili. Tri tjedna pretvorila su se u četiri dana; napor provjere usmjeren na korišteni odjeljak.
Slučaj 2 — Izmišljena riječ. Informativni kanal emitirao je razulareni ulični intervju s automatskim titlovima, bez provjere. Model je "čuo" neizgovorenu riječ u pozadinskom pjevušenju, a naslov je sugovorniku imputirao neizgovorenu riječ. Uslijedila je reakcija na društvenim mrežama te je objavljen ispravak. Pouka: u snimkama s bukom, automatski titlovi moraju se usporediti s izvornim zvukom.
Slučaj 3 — prevodilačka katastrofa. Brand je objavio engleske titlove svog promotivnog videa sa strojnim prijevodom i bez kontrole. Kada je turski idiom ("paziti") preveden od riječi do riječi, engleskoj publici se činio besmislenim, pa čak i smiješnim, a ozbiljnost brenda bila je narušena. Pravi način: da prijevod ovjeri netko tko poznaje ciljni jezik.
Slab upit / Jak upit
Slab upit:
Podnaslovite ovaj video i prevedite ga na engleski.
Nema oblikovanja, nema pravila čitljivosti, nema oznaka valjanosti. Rezultat će biti grub i riskantan.
Snažan upit:
Vaša uloga: dvojezični urednik titlova. Unos: turski vremenski kodirani prijepis. Zadatak: 1) Uredite turski titl za 2 retka / ~40 znakova / dobra pravila podjele. 2) Označite vlastita imena i pojmove s [CONTROL]. 3) Odvojeno izradite engleski prijevod; Prenesite frazu doslovno, sačuvajte ime robne marke.4) Označite blokove koji premašuju brzinu čitanja s [DUGO].5) Nemojte izmišljati riječi; Napiši neodređeni glas [UNINDICATED].
Uobičajene greške
- Objavljivanje automatskih prijepisa bez kontrole. Pogreške u vlastitim imenima, izrazima, interpunkcijskim znakovima i izmišljenim riječima ostaju.
- Loše razdvajanje linija. Redovi koji završavaju na "i/ali/ki" otežavaju čitanje.
- Prekoračenje brzine čitanja. Dugi titlovi koji su prekratki na ekranu se ne mogu čitati.
- Ne provjerava se strojni prijevod. Ako idiom, šala ili izraz pogriješe, marka trpi.
- Zaobilaženje razlikovanja zvučnika. Ako postoji zabuna oko "tko je što rekao" u ploči, podnaslov će dovesti u zabludu.
Savjet: Dok uređujete transkript, gledajte video brzinom 1,25-1,5 i provjerite je li sinkroniziran s titlovima. Na ovaj način brzo hvatate i odstupanje vremenskog koda i izmišljene/propuštene riječi.
Oprez: U područjima kao što su zdravstvo, pravo, financije, jedna netočno transkribirana riječ (npr. doza, broj sastojka) može imati ozbiljne posljedice. U ovim sadržajima svaki broj i pojam moraju biti zasebno ovjereni.
Ukratko
Automatska transkripcija i titlovi najveća su ušteda vremena u postprodukciji i omogućuju pristupačnost. AI smanjuje sate prijepisa na minute i omogućuje pretraživanje putem teksta. Ali rezultat nije prikladan za objavljivanje u svom sirovom obliku: vlastita imena, pojmovi, interpunkcija, izmišljene riječi i loši prijelomi redaka moraju se ispraviti. Pravila čitljivosti (duljina retka, trajanje, brzina čitanja) čine tekst tečnim za gledatelja. Kod višejezičnih titlova, strojni prijevod mora potvrditi osoba koja poznaje ciljni jezik. AI toči i predlaže; Za točnost, čitljivost i značenje odgovoran je urednik.
Zadatak aplikacije
Snimite kratku snimku razgovora (možda svoj vlastiti glas, 2-3 minute) i neka se automatski transkribira. Usporedite izlaz s izvornim zvukom i označite vlastite imenice, izraze i interpunkcijske pogreške; Pronađite najmanje pet pogrešaka. Zatim podijelite tekst u blokove titlova prema gore navedenim pravilima, prevedite ih na jedan jezik i ispravite barem dvije rizične točke (idioma/termina) u prijevodu. Prijavite proces i sve pogreške koje pronađete.
popis za provjeru
- [ ] Jesam li usporedio prijepis s izvornim audio zapisom i ispravio sve pogreške u vezi s vlastitim imenom/terminom/interpunkcijom?
- [ ] Jesam li provjerio ima li izmišljenih ili izostavljenih riječi?
- [ ] Jesam li uredio podnaslov u skladu s pravilima duljine retka, trajanja i brzine čitanja?
- [ ] Za višejezične titlove, jesam li pažljivo provjerio prijevod s nekim tko poznaje ciljni jezik?
- [ ] Jesam li zasebno provjerio svaki broj i izraz u osjetljivom sadržaju?