רווחים:
- יכולת להבין את המושגים של תמלול אוטומטי והפרדת דוברים ולהמיר הקלטה גולמית לטקסט מקודד בזמן
- יכולת להבין פורמטים של כתוביות (SRT/VTT), מהירות קריאה וחוקי קו, ולהפיק ולערוך טיוטות כתוביות רב לשוניות
- הבנה כי באחריות העורך לוודא מינוח, שמות פרטיים, שגיאות פיסוק ושגיאות תרגום בתמליל האוטומטי לפני הפרסום.
המשימה המייגעת ביותר, שגוזלת זמן, של פוסט-פרודקשן הייתה באופן מסורתי תמלול: עורך היה מאזין בלי סוף לשעות של קטעי ראיונות, ומקליד כל משפט ביד. הקלטה של שעה אחת תיקח בקלות ארבע עד חמש שעות לתמלול. בינה מלאכותית שינתה את העסק הזה באופן קיצוני: כיום ניתן להפוך הקלטה של שעה לטקסט מקודד בזמן תוך דקות. זה גם מזרז את צינור העריכה וגם מאפשר נגישות (כתוביות לצופים לקויי שמיעה וצפייה שקטה). אבל פלט אוטומטי לעולם אינו מתאים לפרסום בצורתו הגולמית; ביחידה זו נראה גם את הכוח וגם את המלכודות.
נתחיל מהתנאים. תמלול הוא העלאת דיבור לכתב. זיהוי דיבור אוטומטי (ASR) היא טכנולוגיה המתרגמת קול לטקסט. Timecode הוא הסימן שמראה לאיזו שנייה הטקסט מתאים בסרטון. יומן דובר הוא הבחנה בין "מי דיבר" וחלוקת הטקסט לדוברים. כתוביות (כתוביות/כיתוב) היא הטקסט המקודד בזמן המופיע על המסך. SRT ו-VTT הם הפורמטים הנפוצים ביותר של קבצי כתוביות; הם מכילים את הסדר, שעת סיום ההתחלה והטקסט של כל שורה. מהירות הקריאה (CPS: תווים לשנייה) קובעת כמה זמן הקו חייב להישאר על המסך כדי שהצופה יקרא בנוחות את הכתובית.
הכוח והמגבלה של תמלול אוטומטי
תמלול בינה מלאכותית מתמלל קול ברור דובר יחיד שהוקלט בטורקית נכונה עם דיוק גבוה מאוד. אבל הוא עושה טעויות במצבים הבאים, והכרת אלה מאפשרת לך למקד את האימות: שמות פרטיים (שמות של אנשים, מותגים, מקומות מאויתים לעתים קרובות בצורה שגויה), מונחים טכניים וקיצורים, מילים שנשמעות דומות ("קאר/קאר", "דומם/דומם"), דיבור חופף (שני אנשים בו זמנית), רעשי רקע ומוזיקה, הבדלי ניבים/מבטא או משפט (סימני מילים). בנוסף, המודל עשוי "לשמוע" ולתמלל מילה שמעולם לא נאמרה ברגע רועש - זוהי ההזיה של התמלול.
הטבלה הבאה מסכמת את התנאים החזקים והחלשים לתמלול אוטומטי:
מצב
דיוק
מיקוד העורך
רמקול בודד, צליל ברור, סביבה שקטה
גבוה מאוד
שמות מתאימים, סימני פיסוק
פאנל מרובה רמקולים
בינוני
הפרדת דובר, דיבור חופף
הקלטה רועשת/בחוץ
נמוך-בינוני
מילה מומצאת, קפוץ
תוכן טכני/ז'רגון
בינוני
כתיבת מונח וקיצור
דיבור מודגש
משתנה
שגיאות מילים, משמעות
פורמט כתוביות וכללי קריאות
כתובית טובה היא לא רק "טקסט נכון"; חייב להיות קריא. יש כמה כללי אצבע בתרגול הבינלאומי: שורת כתוביות צריכה להיות בדרך כלל לא יותר משתי שורות; כל שורה צריכה להישמר באורך סביר (כ-37-42 תווים); הכתובית חייבת להישאר על המסך מספיק זמן כדי לקרוא אותה (בדרך כלל 1-6 שניות); מהירות הקריאה לא צריכה להיות גבוהה מדי (רוב המדריכים מחשיבים ~15-17 תווים/שנייה כמגבלה). כלי בינה מלאכותית מפצלים אוטומטית את הכתובית, אבל פיצולים אלו לפעמים חותכים את המשפט במקומות גרועים (שורה המסתיימת ב-"ו", שבר שמחלק את המשמעות). תפקידו של העורך הוא להפוך את הטקסט למדויק וקולח כאחד.
תפקידך: עוזר עורך כתוביות. להלן תמלול אוטומטי. משימה:1) חלקו את הטקסט לקוביות כתוביות לפי לוגיקה SRT.2) כל בלוק צריך להיות מקסימום 2 שורות, כל שורה לא תעלה על ~40 תווים.3) חלקו את המשפט במקומות משמעותיים; שורה המסתיימת ב-"and", "but", "that".4) סמן שמות עצם ומונחים עם התג [CHECK] כדי שאוכל לאמת אותם באופן ידני.5) אל תשנה את הטקסט, פשוט תפצל וסמן.
הרעיון של "תג [CONTROL]" בהנחיה זו הוא בעל ערך: סימון ה-AI אזורים שבהם הוא לא בטוח או מסוכן (שם תקין, מונח) מפנה את עין העורך למקומות הנכונים ומונע אמון עיוור.
כתוביות ותרגום רב לשוני
פתיחת סרטון למספר שפות מגדילה את הקהל. ה-AI יכול לקחת את התמליל, לתרגם אותו לשפת היעד ולהפיק קובץ כתוביות. זוהי יכולת רבת עוצמה, אבל היא הפגיעה ביותר: תרגום מכונה יכול להציג ניבים, הפניות תרבותיות, הומור ומשחקי מילים, מונחים והקשר שגוי. תרגום המשפט "יורד גשם חתולים וכלבים" מילה במילה הוא אסון. יש גם מגבלת מקום בתרגום כתוביות: המשפט בשפת היעד עשוי להיות ארוך יותר ולעלות על מהירות הקריאה. לכן חיוני עבור כתוביות רב-לשוניות שאדם שיודע את שפת היעד יאמת את התרגום - במיוחד עבור תוכן רגיש כמו מיתוג, משפטי או בריאותי, לתרגום שגוי עלולות להיות השלכות חמורות.
תרגם את קוביות הכתוביות הבאות בטורקית לאנגלית. כללים: - העבר את הביטוי והבדיחה, לא מילה במילה, אלא שמירה על המשמעות שלהם. - השאר את שם המותג ושם המוצר כפי שהם, אל תתרגם. - תן לכל בלוק לשמור על מהירות הקריאה שלו; קצר במידת הצורך, אך אל תעוות את המשמעות. - ציין את ההתייחסות התרבותית או המונח שאינך בטוח לגביו באמצעות [הערת המתרגם].
שלושה מיני תיקים
מקרה 1 - קו האצה. צוות דוקומנטרי בילה שלושה שבועות בתמלול ארכיון של 12 שעות של ראיונות. עם תמלול אוטומטי, הטקסט הגולמי הופק תוך יום; על ידי חיפוש באמצעות טקסט (מילה אחר מילה), הצוות מצא את הרגעים שרצו בשניות. אחר כך הם ערכו בקפידה וכתבו רק את הפרק בן 40 הדקות שהם ישתמשו בו. שלושה שבועות הפכו לארבעה ימים; מאמצי האימות התמקדו בחלק שבו נעשה שימוש.
מקרה 2 - מילה מומצאת. ערוץ חדשות שידר את ראיון הרחוב הסוער עם כתוביות אוטומטיות, בלי לבדוק. הדוגמנית "שמעה" מילה לא נאמרת ברקע המהום, והכיתוב ייחס למרואיין מילה שלא נאמרת. הייתה תגובה ברשתות החברתיות והתיקון פורסם. שיעור: בהקלטות רועשות, יש להשוות כתוביות אוטומטיות לאודיו המקורי.
מקרה 3 - אסון תרגום. מותג פרסם את הכתוביות באנגלית של סרטון התדמית שלו עם תרגום מכונה וללא שליטה. כשתורגם מילה במילה ניב טורקי ("שמרו על עין"), זה נראה חסר משמעות ואפילו מצחיק לקהל האנגלי, והרצינות של המותג נפגעה. הדרך הנכונה: לאמת את התרגום על ידי מישהו שיודע את שפת היעד.
הנחיה חלשה / הנחיה חזקה
הנחיה חלשה:
כתוביות לסרטון הזה ותרגמו אותו לאנגלית.
אין עיצוב, אין חוקי קריאות, אין סימני אימות. התפוקה תהיה גסה ומסוכנת.
הנחיה עוצמתית:
התפקיד שלך: עורך כתוביות דו לשוני. קלט: תמליל בקוד זמן טורקי. משימה: 1) ערוך כתובית טורקית ב-2 שורות / ~40 תווים / כללי חלוקה טובה.2) סמן שמות ומונחים נכונים עם [CONTROL].3) הפק תרגום לאנגלית בנפרד; העבירו את הביטוי פשוטו כמשמעו, שמרו על שם המותג.4) סמנו בלוקים החורגים ממהירות הקריאה ב-[LONG].5) אל תמציא מילה כלשהי; כתוב את הצליל הבלתי מוגדר [UNINDICATED].
טעויות נפוצות
- פרסום תמלילים אוטומטיים ללא בקרה. נותרו טעויות בשמות פרטיים, במונחים, בסימני פיסוק ובמילים מומצאות.
- פיצול קו גרוע. שורות המסתיימות ב"ו/אבל/קי" מקשות על הקריאה.
- חריגה ממהירות הקריאה. לא ניתן לקרוא כתוביות ארוכות קצרות מדי על המסך.
- לא מאמת תרגום מכונה. אם ניב, בדיחה או מונח משתבשים, המותג סובל.
- עקיפת הבחנה ברמקולים. אם יש בלבול לגבי "מי אמר מה" בפאנל, הכתובית תהיה מטעה.
טיפ: בזמן עריכת התמליל, צפו בסרטון במהירות 1.25-1.5 ובדקו שהוא מסונכרן עם הכתוביות. כך אתה תופס במהירות גם סחיפה של קוד הזמן וגם מילים מומצאות/שפספסו.
זהירות: בתחומים כמו בריאות, משפטים, פיננסים, למילה אחת שתומללה בצורה שגויה (למשל מנה, מספר מרכיב) יכולה להיות השלכות חמורות. בתכנים אלה, יש לאמת כל מספר ומונח בנפרד.
לסיכום
תמלול אוטומטי וכתוביות הם חוסך הזמן הגדול ביותר של פוסט-פרודקשן ומאפשרים נגישות. AI מפחית שעות של תמלול לדקות ומאפשר חיפוש באמצעות טקסט. אבל הפלט אינו מתאים לפרסום בצורתו הגולמית: יש לתקן שמות פרטיים, מונחים, סימני פיסוק, מילים מומצאות ומעברי שורות גרועים. כללי הקריאה (אורך שורה, משך, מהירות קריאה) הופכים את הטקסט לשוטף עבור הצופה. בכתוביות רב לשוניות, התרגום המכונה חייב להיות מאומת על ידי אדם שיודע את שפת היעד. בינה מלאכותית שופכת ומציעה; דיוק, קריאות ומשמעות הם באחריות העורך.
משימת יישום
קח הקלטת שיחה קצרה (אולי קולך, 2-3 דקות) ותמלל אותה אוטומטית. השווה את הפלט עם האודיו המקורי והדגל שמות עצם, מונחים ושגיאות פיסוק; מצא לפחות חמש שגיאות. לאחר מכן, יש לחלק את הטקסט לקוביות כתוביות לפי הכללים לעיל, לתרגם לשפה אחת ולתקן לפחות שתי נקודות מסוכנות (ניבים/מונחים) בתרגום. דווח על התהליך ועל כל שגיאה שתמצא.
רשימת בדיקה
- [ ] האם השוויתי את התמליל לשמע המקורי ותיקנתי שגיאות של שם עצם/מונח/סימני פיסוק?
- [ ] האם בדקתי אם יש מילים מומצאות או שהושמטתי?
- [ ] האם ערכתי את הכתובית לפי אורך השורה, משך וחוקי מהירות הקריאה?
- [ ] לגבי כתוביות רב לשוניות, האם אימתתי בקפידה את התרגום עם מישהו שיודע את שפת היעד?
- [ ] האם אימתתי בנפרד כל מספר ומונח בתוכן רגיש?