નફો:
- સ્વચાલિત ટ્રાન્સક્રિપ્શન અને સ્પીકર વિભાજનની વિભાવનાઓને સમજવાની અને કાચા રેકોર્ડિંગને સમય-કોડેડ ટેક્સ્ટમાં કન્વર્ટ કરવાની ક્ષમતા
- સબટાઈટલ ફોર્મેટ્સ (SRT/VTT), વાંચવાની ઝડપ અને રેખા નિયમો સમજવાની અને બહુભાષી ઉપશીર્ષક ડ્રાફ્ટ્સ બનાવવા અને સંપાદિત કરવાની ક્ષમતા
- એ સમજવું કે પ્રકાશન પહેલાં સ્વચાલિત ટ્રાન્સક્રિપ્ટમાં પરિભાષા, યોગ્ય નામો, વિરામચિહ્નોની ભૂલો અને અનુવાદની ભૂલો ચકાસવાની જવાબદારી સંપાદકની છે.
પોસ્ટ-પ્રોડક્શનનું સૌથી કંટાળાજનક, સમય માંગી લેતું કાર્ય પરંપરાગત રીતે ટ્રાન્સક્રિપ્શન હતું: સંપાદક દરેક વાક્યને હાથ વડે ટાઈપ કરીને, ઇન્ટરવ્યુ ફૂટેજના કલાકો સુધી અવિરતપણે સાંભળશે. એક કલાકના રેકોર્ડિંગને ટ્રાંસ્ક્રાઇબ કરવામાં ચારથી પાંચ કલાકનો સમય લાગશે. આર્ટિફિશિયલ ઇન્ટેલિજન્સે આ વ્યવસાયને ધરમૂળથી બદલી નાખ્યો છે: આજે એક કલાકના રેકોર્ડિંગને મિનિટોમાં સમય-કોડેડ ટેક્સ્ટમાં ફેરવી શકાય છે. આ બંને એડિટિંગ પાઇપલાઇનને ઝડપી બનાવે છે અને ઍક્સેસિબિલિટીને સક્ષમ કરે છે (શ્રવણ-ક્ષતિવાળા દર્શકો અને સાયલન્ટ વ્યૂઇંગ માટે સબટાઈટલ). પરંતુ સ્વચાલિત આઉટપુટ તેના કાચા સ્વરૂપમાં પ્રકાશન માટે ક્યારેય યોગ્ય નથી; આ એકમમાં આપણે પાવર અને ક્ષતિઓ બંને જોઈશું.
ચાલો શરતો સાથે શરૂ કરીએ. ટ્રાન્સક્રિપ્શન એ ભાષણને લેખિતમાં મૂકવું છે. ઓટોમેટિક સ્પીચ રેકગ્નિશન (ASR) એ ટેક્નોલોજી છે જે વૉઇસને ટેક્સ્ટમાં ટ્રાન્સલેટ કરે છે. ટાઇમકોડ એ સાઇન છે જે બતાવે છે કે વિડિઓમાં ટેક્સ્ટ કયા સેકન્ડને અનુરૂપ છે. સ્પીકર ડાયરાઇઝેશન એ "કોણ બોલ્યું" અને ટેક્સ્ટને સ્પીકર્સમાં વિભાજીત કરવાનું છે. સબટાઈટલ (સબટાઈટલ/કેપ્શન) એ સમય-કોડેડ ટેક્સ્ટ છે જે સ્ક્રીન પર દેખાય છે. SRT અને VTT સૌથી સામાન્ય સબટાઈટલ ફાઈલ ફોર્મેટ છે; તેમાં દરેક લાઇનનો ક્રમ, પ્રારંભ-અંતિમ સમય અને ટેક્સ્ટ હોય છે. રીડિંગ સ્પીડ (CPS: અક્ષરો પ્રતિ સેકન્ડ) નિર્ધારિત કરે છે કે દર્શક ઉપશીર્ષકને આરામથી વાંચી શકે તે માટે લાઇન કેટલી લાંબી સ્ક્રીન પર રહેવી જોઈએ.
સ્વચાલિત ટ્રાન્સક્રિપ્શનની શક્તિ અને મર્યાદા
AI ટ્રાંસ્ક્રિપ્શન ખૂબ જ ઉચ્ચ સચોટતા સાથે યોગ્ય ટર્કિશમાં રેકોર્ડ કરાયેલ સ્પષ્ટ, સિંગલ-સ્પીકર વૉઇસને ટ્રાંસ્ક્રાઇબ કરે છે. પરંતુ તે નીચેની પરિસ્થિતિઓમાં ભૂલો કરે છે, અને આ જાણવાથી તમે ચકાસણીને લક્ષ્યાંકિત કરી શકો છો: યોગ્ય નામો (લોકોના નામ, બ્રાન્ડ્સ, સ્થાનો ઘણીવાર ખોટી જોડણી હોય છે), તકનીકી શબ્દો અને સંક્ષિપ્ત શબ્દો, સમાન ધ્વનિ શબ્દો (“કાર/કર”, “હજુ/હજુ”), ઓવરલેપિંગ વાણી (એક જ સમયે બે લોકો), પૃષ્ઠભૂમિ અવાજ અને સંગીત, બોલી અને ઉચ્ચારનો અંત અથવા ઉચ્ચારનો તફાવત. વધુમાં, મોડેલ એવા શબ્દને "સાંભળી શકે છે" અને ટ્રાન્સક્રિપ્ટ કરી શકે છે જે ઘોંઘાટવાળી ક્ષણમાં ક્યારેય બોલાયો ન હોય - આ ટ્રાન્સક્રિપ્શનનો આભાસ છે.
નીચે આપેલ કોષ્ટક આપોઆપ ટ્રાન્સક્રિપ્શન માટે મજબૂત અને નબળી પરિસ્થિતિઓનો સારાંશ આપે છે:
સ્થિતિ
ચોકસાઈ
સંપાદકનું ધ્યાન
સિંગલ સ્પીકર, સ્પષ્ટ અવાજ, શાંત વાતાવરણ
ખૂબ ઊંચી
યોગ્ય નામો, વિરામચિહ્નો
મલ્ટી સ્પીકર પેનલ
મધ્યમ
સ્પીકર અલગ, ઓવરલેપિંગ ભાષણ
ઘોંઘાટીયા/આઉટડોર રેકોર્ડિંગ
નિમ્ન-મધ્યમ
બનાવેલ શબ્દ, જમ્પ
ટેકનિકલ/જાર્ગન સામગ્રી
મધ્યમ
શબ્દ અને સંક્ષિપ્ત લેખન
ઉચ્ચારિત ભાષણ
ચલ
શબ્દની ભૂલો, અર્થ
સબટાઈટલ ફોર્મેટ અને વાંચી શકાય તેવા નિયમો
સારું ઉપશીર્ષક માત્ર "સાચો લખાણ" નથી; વાંચી શકાય તેવું હોવું જોઈએ. આંતરરાષ્ટ્રીય પ્રેક્ટિસમાં અંગૂઠાના થોડા નિયમો છે: સબટાઈટલની લાઇન સામાન્ય રીતે બે લીટીથી વધુ ન હોવી જોઈએ; દરેક લાઇનને વાજબી લંબાઈમાં રાખવી જોઈએ (આશરે 37-42 અક્ષરો); સબટાઈટલ સ્ક્રીન પર વાંચી શકાય તેટલા લાંબા સમય સુધી રહેવું જોઈએ (સામાન્ય રીતે 1-6 સેકન્ડ); વાંચવાની ઝડપ ખૂબ ઊંચી ન હોવી જોઈએ (મોટાભાગના માર્ગદર્શિકાઓ ~15-17 અક્ષરો/સેકન્ડને મર્યાદા માને છે). AI ટૂલ્સ સબટાઈટલને આપમેળે વિભાજિત કરે છે, પરંતુ આ વિભાજન કેટલીકવાર ખરાબ જગ્યાએ વાક્યને કાપી નાખે છે ("અને" સાથે સમાપ્ત થતી લાઇન જે અર્થને વિભાજિત કરે છે). સંપાદકનું કામ લખાણને સચોટ અને અસ્ખલિત બનાવવાનું છે.
તમારી ભૂમિકા: ઉપશીર્ષક સંપાદક સહાયક. નીચે આપોઆપ ટ્રાન્સક્રિપ્ટ છે. કાર્ય:1) એસઆરટી લોજિક અનુસાર ટેક્સ્ટને સબટાઈટલ બ્લોક્સમાં વિભાજીત કરો. 2) દરેક બ્લોક મહત્તમ 2 લીટીઓનો હોવો જોઈએ, દરેક લીટી ~40 અક્ષરોથી વધુ ન હોવી જોઈએ.3) વાક્યને અર્થપૂર્ણ સ્થાનો પર વિભાજીત કરો; "અને", "પરંતુ", "તે" થી સમાપ્ત થતી લાઇન. 4) યોગ્ય સંજ્ઞાઓ અને શબ્દોને [ચેક] ટેગ વડે ચિહ્નિત કરો જેથી હું તેને જાતે ચકાસી શકું. 5) ટેક્સ્ટ બદલશો નહીં, ફક્ત વિભાજિત કરો અને ચિહ્નિત કરો.
આ પ્રોમ્પ્ટમાં "[કંટ્રોલ] ટેગ" વિચાર મૂલ્યવાન છે: AI ચિહ્નિત વિસ્તારો જ્યાં તે અનિશ્ચિત અથવા જોખમી છે (યોગ્ય નામ, શબ્દ) એ સંપાદકની આંખને યોગ્ય સ્થાનો તરફ દોરે છે અને અંધ વિશ્વાસ અટકાવે છે.
બહુભાષી ઉપશીર્ષકો અને અનુવાદ
બહુવિધ ભાષાઓમાં વિડિઓ ખોલવાથી પ્રેક્ષકો વધે છે. AI ટ્રાન્સક્રિપ્ટ લઈ શકે છે, તેને લક્ષ્ય ભાષામાં અનુવાદિત કરી શકે છે અને સબટાઈટલ ફાઈલ બનાવી શકે છે. આ એક શક્તિશાળી ક્ષમતા છે, પરંતુ તે સૌથી વધુ સંવેદનશીલ છે: મશીન અનુવાદ રૂઢિપ્રયોગો, સાંસ્કૃતિક સંદર્ભો, રમૂજ અને શબ્દો, શબ્દો અને સંદર્ભને ખોટી રીતે રજૂ કરી શકે છે. "બિલાડીઓ અને કૂતરાઓનો વરસાદ પડી રહ્યો છે" વાક્યનો શબ્દ માટે અનુવાદ કરવો એ આપત્તિ છે. ઉપશીર્ષક અનુવાદમાં જગ્યાની મર્યાદા પણ છે: લક્ષ્ય ભાષામાં વાક્ય વધુ લાંબું હોઈ શકે છે અને વાંચન ઝડપ કરતાં વધી શકે છે. એટલા માટે બહુભાષી ઉપશીર્ષક માટે લક્ષ્ય ભાષા જાણતી વ્યક્તિ અનુવાદની ચકાસણી કરે તે જરૂરી છે — ખાસ કરીને બ્રાંડિંગ, કાનૂની અથવા આરોગ્ય જેવી સંવેદનશીલ સામગ્રી માટે, ખોટા અનુવાદના ગંભીર પરિણામો આવી શકે છે.
નીચેના ટર્કિશ સબટાઈટલ બ્લોકનો અંગ્રેજીમાં અનુવાદ કરો. નિયમો: - રૂઢિપ્રયોગ અને મજાકને સ્થાનાંતરિત કરો, શબ્દશઃ નહીં, પરંતુ તેમના અર્થને સાચવો. - બ્રાન્ડ નેમ અને પ્રોડક્ટનું નામ જેમ છે તેમ છોડી દો, અનુવાદ કરશો નહીં. - દરેક બ્લોકને તેની વાંચન ગતિ જાળવવા દો; જો જરૂરી હોય તો ટૂંકો કરો, પરંતુ અર્થને વિકૃત કરશો નહીં. - સાંસ્કૃતિક સંદર્ભ અથવા શબ્દનો ઉલ્લેખ કરો જેના વિશે તમે ચોક્કસ નથી [ટ્રાન્સલેટરની નોંધ] સાથે.
ત્રણ નાના કેસો
કેસ 1 — પ્રવેગક રેખા. એક દસ્તાવેજી ક્રૂએ ઇન્ટરવ્યુના 12-કલાકના આર્કાઇવને ટ્રાન્સક્રિપ્ટ કરવામાં ત્રણ અઠવાડિયા પસાર કર્યા. સ્વચાલિત ટ્રાન્સક્રિપ્શન સાથે, કાચું લખાણ એક દિવસમાં આઉટપુટ હતું; ટેક્સ્ટ (શબ્દ દ્વારા શબ્દ) દ્વારા શોધ કરીને, ટીમને સેકન્ડોમાં જોઈતી ક્ષણો મળી. પછી તેઓએ માત્ર 40-મિનિટના એપિસોડનો જ તેઓ ઉપયોગ કરશે તે સાવચેતીપૂર્વક સંપાદિત અને સબટાઈટલ કર્યું. ત્રણ અઠવાડિયા ચાર દિવસમાં ફેરવાયા; ચકાસણી પ્રયાસ વપરાયેલ વિભાગ પર કેન્દ્રિત છે.
કેસ 2 - બનાવેલ શબ્દ. એક ન્યૂઝ ચેનલે ચેક કર્યા વિના, ઓટોમેટિક સબટાઈટલ સાથે સ્ટ્રીટ ઈન્ટરવ્યુ પ્રસારિત કર્યો. મોડેલે બેકગ્રાઉન્ડ હમમાં એક અસ્પષ્ટ શબ્દ "સાંભળ્યો", અને કૅપ્શનમાં ઇન્ટરવ્યુ લેનારને એક અસ્પષ્ટ શબ્દનો આરોપ લગાવ્યો. સોશિયલ મીડિયા પર પ્રતિક્રિયા આવી અને સુધારો પ્રકાશિત થયો. પાઠ: ઘોંઘાટીયા રેકોર્ડિંગમાં, ઓરિજિનલ ઑડિઓ સાથે ઑટોમેટિક સબટાઈટલની સરખામણી કરવી આવશ્યક છે.
કેસ 3 - અનુવાદ આપત્તિ. એક બ્રાન્ડે તેના પ્રમોશનલ વિડિયોના અંગ્રેજી સબટાઈટલને મશીન અનુવાદ સાથે અને નિયંત્રણ વિના પ્રકાશિત કર્યા છે. જ્યારે ટર્કિશ રૂઢિપ્રયોગ ("આંખ બહાર રાખો") શબ્દ માટે અનુવાદિત કરવામાં આવ્યો હતો, ત્યારે તે અંગ્રેજી પ્રેક્ષકોને અર્થહીન અને રમુજી પણ લાગતું હતું, અને બ્રાન્ડની ગંભીરતાને નુકસાન થયું હતું. સાચો રસ્તો: લક્ષ્ય ભાષા જાણતી વ્યક્તિ દ્વારા અનુવાદની ચકાસણી કરાવવા માટે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ વિડિયોને સબટાઈટલ કરો અને તેનો અંગ્રેજીમાં અનુવાદ કરો.
ત્યાં કોઈ ફોર્મેટિંગ નથી, કોઈ વાંચનક્ષમતા નિયમો નથી, કોઈ માન્યતા ગુણ નથી. આઉટપુટ ક્રૂડ અને જોખમી હશે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: દ્વિભાષી ઉપશીર્ષક સંપાદક. ઇનપુટ: ટર્કિશ ટાઈમકોડેડ ટ્રાન્સક્રિપ્ટ. કાર્ય:1) 2 લીટીઓ / ~40 અક્ષરો / સારા વિભાગના નિયમો દ્વારા ટર્કિશ સબટાઈટલને સંપાદિત કરો. વાક્યને શાબ્દિક રૂપે સ્થાનાંતરિત કરો, બ્રાન્ડ નેમ સાચવો. 4) વાંચન ઝડપ કરતાં વધુ [લાંબા] સાથે બ્લોક્સને ચિહ્નિત કરો. 5) કોઈપણ શબ્દો બનાવશો નહીં; અનિશ્ચિત અવાજ લખો [UNINDICATED].
સામાન્ય ભૂલો
- નિયંત્રણ વિના સ્વચાલિત ટ્રાંસ્ક્રિપ્ટ પ્રકાશિત કરવું. યોગ્ય નામો, પદો, વિરામચિહ્નો અને બનાવેલા શબ્દોમાં ભૂલો રહે છે.
- ખરાબ રેખા વિભાજન. "અને/પણ/કી" માં સમાપ્ત થતી રેખાઓ વાંચનને મુશ્કેલ બનાવે છે.
- વાંચન ઝડપ ઓળંગી. સ્ક્રીન પર ખૂબ ટૂંકા હોય તેવા લાંબા સબટાઈટલ વાંચી શકાતા નથી.
- મશીન અનુવાદની ચકાસણી કરી રહ્યાં નથી. જો કોઈ રૂઢિપ્રયોગ, મજાક અથવા શબ્દ ખોટો પડે તો બ્રાન્ડને નુકસાન થાય છે.
- વક્તા ભેદને બાયપાસ કરીને. જો પેનલમાં "કોણે શું કહ્યું" વિશે મૂંઝવણ હોય, તો સબટાઈટલ ગેરમાર્ગે દોરનારું હશે.
ટીપ: ટ્રાંસ્ક્રિપ્ટ સંપાદિત કરતી વખતે, વિડિઓને 1.25-1.5 ઝડપે જુઓ અને તપાસો કે તે સબટાઈટલ સાથે સમન્વયિત છે. આ રીતે તમે ટાઇમકોડ ડ્રિફ્ટ અને મેક-અપ/છૂટેલા શબ્દો બંનેને ઝડપથી પકડી શકશો.
સાવધાન: હેલ્થકેર, કાયદો, ફાઇનાન્સ જેવા ક્ષેત્રોમાં, એક પણ ખોટી રીતે લખાયેલ શબ્દ (દા.ત. ડોઝ, એક ઘટક નંબર) ગંભીર પરિણામો લાવી શકે છે. આ સામગ્રીઓમાં, દરેક સંખ્યા અને શબ્દ અલગથી ચકાસાયેલ હોવા જોઈએ.
સારાંશમાં
સ્વયંસંચાલિત ટ્રાન્સક્રિપ્શન અને સબટાઇટલિંગ એ પોસ્ટ-પ્રોડક્શનનો સૌથી મોટો સમય બચાવનાર છે અને ઍક્સેસિબિલિટીને સક્ષમ કરે છે. AI ટ્રાન્સક્રિપ્શનના કલાકોને મિનિટમાં ઘટાડે છે અને ટેક્સ્ટ દ્વારા શોધને સક્ષમ કરે છે. પરંતુ આઉટપુટ તેના કાચા સ્વરૂપમાં પ્રકાશન માટે યોગ્ય નથી: યોગ્ય નામો, શબ્દો, વિરામચિહ્નો, બનાવેલા શબ્દો અને ખરાબ રેખા વિરામને સુધારવું આવશ્યક છે. વાંચનક્ષમતા નિયમો (રેખાની લંબાઈ, અવધિ, વાંચનની ઝડપ) દર્શક માટે ટેક્સ્ટને અસ્ખલિત બનાવે છે. બહુભાષી ઉપશીર્ષકોમાં, લક્ષ્ય ભાષા જાણતા વ્યક્તિ દ્વારા મશીન અનુવાદની ચકાસણી કરવી આવશ્યક છે. AI રેડે છે અને સૂચવે છે; ચોકસાઈ, વાંચનક્ષમતા અને અર્થ એ સંપાદકની જવાબદારી છે.
એપ્લિકેશન કાર્ય
એક ટૂંકી વાર્તાલાપ રેકોર્ડિંગ લો (કદાચ તમારો પોતાનો અવાજ, 2-3 મિનિટ) અને તેને આપમેળે ટ્રાંસ્ક્રાઇબ કરો. મૂળ ઓડિયો અને ફ્લેગ યોગ્ય સંજ્ઞાઓ, શરતો અને વિરામચિહ્નોની ભૂલો સાથે આઉટપુટની તુલના કરો; ઓછામાં ઓછી પાંચ ભૂલો શોધો. પછી, ઉપરના નિયમો અનુસાર ટેક્સ્ટને સબટાઇટલમાં વિભાજીત કરો, એક ભાષામાં અનુવાદિત કરો અને અનુવાદમાં ઓછામાં ઓછા બે જોખમી મુદ્દાઓ (રૂઢિપ્રયોગો/શબ્દો) સુધારો. પ્રક્રિયા અને તમને મળેલી કોઈપણ ભૂલોની જાણ કરો.
ચેકલિસ્ટ
- [ ] શું મેં મૂળ ઑડિયો સાથે ટ્રાન્સક્રિપ્ટની સરખામણી કરી છે અને કોઈ યોગ્ય સંજ્ઞા/પદ/વિરામચિહ્નની ભૂલો સુધારી છે?
- [ ] શું મેં બનાવેલા અથવા અવગણવામાં આવેલા શબ્દો માટે તપાસ કરી છે?
- [ ] શું મેં લાઇનની લંબાઈ, અવધિ અને વાંચન ગતિના નિયમો અનુસાર સબટાઇટલમાં ફેરફાર કર્યો છે?
- [ ] બહુભાષી ઉપશીર્ષકો માટે, શું મેં લક્ષ્ય ભાષા જાણતી વ્યક્તિ સાથે અનુવાદને કાળજીપૂર્વક ચકાસ્યો છે?
- [ ] શું મેં સંવેદનશીલ સામગ્રીમાં દરેક નંબર અને શબ્દને અલગથી ચકાસ્યો છે?