ትርፍ፡
- በራስ-ሰር QA እና በቋንቋ LQA ንብርብሮች መካከል የመለየት እና ሁለቱንም በትክክለኛው ቅደም ተከተል የመተግበር ችሎታ
- እንደ MQM ካሉ የስህተት ማዕቀፍ ጋር በምድብ እና በክብደት (ወሳኝ/ዋና/አነስተኛ) መሰረት ትርጉሙን በትክክል የመገምገም ችሎታ
- AI እንደ ኦዲተር ሲጠቀሙ የመጨረሻውን ውሳኔ መወሰን መቻል፣ በራሱ ትርጉም ላይ ዓይነ ስውርነቱን ማወቅ፣ ስህተቶችን የመሥራት አደጋን እና የአውቶሜትድ መለኪያዎችን ወሰን ማወቅ።
አንድ ትርጉም "ተከናውኗል" ይላሉ ቅጽበት, ይህ ግማሽ ሥራ ነው; ሌላኛው ግማሽ ትርጉም በትክክል አስተማማኝ መሆኑን ማረጋገጥ ነው. በዚህ ክፍል ውስጥ የትርጉም ጥራትን የሚለኩበት ስልታዊ መንገዶችን ይማራሉ፡ አውቶሜትድ የQA ቼኮች፣ በሰው ላይ የተመሰረቱ የLQA ስህተት ማዕቀፎች፣ የጥራት መለኪያዎች እና AI እንዴት እንደ “ተቆጣጣሪ” — እና ገደቦቹ። ዓላማው "ጥሩ ነው ብዬ አስባለሁ" ከሚለው ርዕሰ-ጉዳይ ወጥቶ ጥራትን የሚገልጽ፣ የሚለካ እና የሚያረጋግጥ ባለሙያ መሆን ነው።
ሁለት ዓይነት የጥራት ቁጥጥር: አውቶማቲክ እና ቋንቋ
QA (የጥራት ማረጋገጫ) በትርጉም በሁለት ንብርብሮች ይሰራል፡
አውቶሜትድ QA፡ የCAT መሳሪያዎች እና ስክሪፕቶች የሚይዙት የቅጥ ስህተቶች — የቁጥር አለመዛመድ፣ የጠፋ/ትርፍ ቦታ፣ ወጥ ያልሆነ ቃል፣ ያልተተረጎመ ክፍል፣ መጥፎ ቦታ ያዥ/መለያ፣ ድርብ ቦታ፣ ሥርዓተ ነጥብ። እነዚህ በፍጥነት እና ሙሉ በሙሉ በማሽን ይቃኛሉ; ከሰው ዓይን ያመልጣል, ነገር ግን ተሽከርካሪው ይይዛል.
LQA (የቋንቋ ጥራት ማረጋገጫ)፡- ይህ የሰው ልጅ ገምጋሚ ትርጉምን፣ ቃላትን፣ ዘይቤን፣ ሰዋሰውን እና የአካባቢን ተገቢነት የሚመረምርበት ንብርብር ነው። አውቶሜትድ QA "ቁጥሩ ይዛመዳል?" ጥያቄውን ይመለከታል; LQA "ትርጉሙ ትክክል ነው፣ ቃናውም ተገቢ ነው፣ በባህል ተገቢ ነው?" የሚለውን ጥያቄ ይመለከታል። ሁለቱ እርስ በርስ ይደጋገፋሉ; አንዱ ሌላውን አይተካም።
ጠቃሚ ምክር: ሁልጊዜ መጀመሪያ ራስ-QA ያሂዱ; መደበኛ ስህተቶችን ማጽዳት የሰው ገምጋሚው ለትክክለኛ የቋንቋ ችግሮች ትኩረት እንዲሰጥ ያስችለዋል. በቁጥር ስህተቱ የሚጨነቅ ገምጋሚ የቃና ስህተቱን ያጣል።
የስህተት ፍሬሞች፡ MQM እና DQF
መደበኛ የስህተት ዓይነቶች ጥራትን ከ"ጥሩ/መጥፎ" ይልቅ ለመለካት ጥቅም ላይ ይውላሉ። በጣም የተለመደው MQM (ባለብዙ የጥራት መለኪያዎች) ነው፡ እያንዳንዱን ስህተት ወደ ምድብ (ትክክለኝነት፣ ቅልጥፍና፣ የቃላት አገባብ፣ ዘይቤ፣ አካባቢ፣ ቅርጸት) እና ክብደት (ወሳኝ፣ ዋና፣ ትንሽ) ይመድባል። ሌላው ማዕቀፍ DQF (ተለዋዋጭ የጥራት ማዕቀፍ) እና ከMQM ጋር ተጠቅሷል።
ለምን አስፈላጊ ነው? ምክንያቱም በዚህ ማዕቀፍ ለትርጉም ስህተት ነጥብ መስጠት፣ የተለያዩ ተርጓሚዎችን/ሞተሮችን በትክክል ማወዳደር እና "ይህ ጽሑፍ ሊደርስ ይችላል?" ጥያቄውን በቁጥር ገደብ ይመልሳሉ። ለምሳሌ: ወሳኝ ስህተት = 10 ነጥቦች, ዋና = 5, ጥቃቅን = 1; በተወሰነ ቃል ከተወሰነ ገደብ በታች ያለው ጽሑፍ።
ወሳኝ ስህተት፡ ትርጉምን የሚገለብጥ፣ ደህንነት/ህጋዊ አደጋን የሚፈጥር፣ የምርት ስምን የሚጎዳ ስህተት (የተሳሳተ መጠን፣ “ተጠያቂ አይደለም” ከማለት ይልቅ)። ዋና፡ የሚረብሽ ግን ምንም ጉዳት የሌለው። አናሳ፡ የሚታይ ነገር ግን ከትርጉሙ የማይቀንስ (ትንሽ ዘይቤ/ሥርዓተ-ነጥብ)።
AI እንደ መቆጣጠሪያ መጠቀም - እና ገደቦቹ
AI ፈጣን እና ከስህተቱ ማዕቀፉ አንጻር ትርጉሙን ለማጣራት አጋዥ ነው፡- “በዚህ ትርጉም ውስጥ ትክክለኛነትን፣ የቃላት አጠቃቀምን፣ የቅልጥፍና ስህተቶችን ከMQM ምድቦች ጋር ምልክት አድርግ” ማለት ትችላለህ። የዓይነ ስውራን ነጥቦችን ይቀንሳል እና ፈጣን "ሁለተኛ ዓይን" ይሰጥዎታል.
ነገር ግን ሶስት ወሳኝ ገደቦች አሉ፡ (1) AI የሚሰራውን ትርጉም ሲፈተሽ ዓይነ ስውር ሊሆን ይችላል - ሁለቱም ተመሳሳይ ስህተት መስራት እና ማረጋገጥ; በተለየ ሞዴል መሻገር ወይም ወደ ምንጩ ይመለሱ። (2) AI እንዲሁ ምናባዊ “ስህተቶችን” ሊፈጥር ይችላል - የሌለ ስህተት ሪፖርት ያድርጉ። እያንዳንዱን ማስጠንቀቂያ ያረጋግጡ። (3) AI የወሳኝ ስህተትን የገሃዱ ዓለም ክብደት ሙሉ በሙሉ ላይረዳ ይችላል (የመጠን ስህተት ገዳይ ሊሆን ይችላል)። ኤክስፐርቱ ክብደቱን ይሠራል. ስለዚህ AI QA ን ያፋጥናል, ነገር ግን የመጨረሻው የጥራት ውሳኔ እና የመላኪያ ፍቃድ በሰው ላይ ነው.
ጥንቃቄ፡- “AI QA አልፏል፣ ንጹህ ነው” ማለት የውሸት የመተማመን ስሜት ነው። AI ኦዲቲንግ የሰው LQA ምትክ አይደለም እና ምንጭ ጋር ንጽጽር; ወደ ፍጥነት የሚያመጣቸው ቅድመ ማጣሪያ ንብርብር ነው።
ሶስት ጥቃቅን ጉዳዮች
ጉዳይ 1 - አውቶሜትድ QA 40 የቁጥር ስህተቶችን አግኝቷል። በፋይናንሺያል ሪፖርት ትርጉም፣ አውቶሜትድ QA ከምንጩ እና ከዒላማው (በሺህ መለያየት፣ አስርዮሽ፣ ምንዛሬ) መካከል 40 ቁጥር/ቅርጸት አለመዛመጃዎችን አግኝቷል። የሰው ዓይን ከእነዚህ ውስጥ አብዛኞቹ ይናፍቀኛል; ተሽከርካሪ በሰከንዶች ውስጥ ተዘርዝሯል.
ጉዳይ 2 — MQM ነጥብ ወደ ሞተር ምርጫ መርቷል። አንድ ቢሮ MQM-የሁለት የተለያዩ MT ሞተሮችን ውጤት በ2,000 ቃላት ደረጃ ሰጥቶታል፡ ሞተር ሀ 12 የስህተት ነጥቦች፣ ሞተር ቢ 31. የዓላማ ልኬት “የትኛው የተሻለ ነው” የሚለውን ክርክር በውጤት ፈታ; ቢሮው ኤንጂን ኤ ደረጃውን የጠበቀ ሲሆን ከክለሳ በኋላ በጀቱንም በዚሁ አቅዷል።
ጉዳይ 3 - AI ኦዲት የራሱን ስህተት አምልጦታል። አንድ ተርጓሚ የኤል.ኤም.ኤም. ትርጉምን በተመሳሳይ LLM ይቆጣጠር ነበር፤ ሞዴሉ "ችግር የለም" አለች፣ የቃላት አገባብ ስህተት ራሷን ፈጠረች። ስህተቱ የተገለጠው ተርጓሚው በተለየ ሞዴል እና ምንጭ ሲፈተሽ; ቡድኑ "ተመሳሳይ ሞዴል እራሱን መቆጣጠር የለበትም" የሚለውን ህግ ተቀብሏል.
አራት ሊገለበጡ የሚችሉ አብነቶች
1) በMQM ላይ የተመሠረተ የስህተት ማረጋገጫ
የእርስዎ ሚና፡ LQA ገምጋሚ። ከዚህ በታች ያለውን ምንጭ እና ትርጉም ያወዳድሩ። ያገኙትን እያንዳንዱን ስህተት በሚከተለው ፎርማት ያቅርቡ፡ [ምድብ፡ ትክክለኛነት/ቃላት/ ቅልጥፍና/ ዘይቤ/ቅርጸት[ክብደት፡ ወሳኝ/ዋና/ትንሽ] [ቦታ] [አስተያየት] [ማስተካከያ]። እርግጠኛ ያልሆኑትን ማስጠንቀቂያ እንደ "ማረጋገጫ እንደሚያስፈልግ" ምልክት ያድርጉበት፤ errorfabrication.ምንጭ፡ [...] | ትርጉም፡ [...]
2) ወሳኝ የስህተት ቅኝት (ከፍተኛ አደጋ)
ወሳኝ ስህተቶችን ከዚህ በታች ባለው ትርጉም ብቻ ይፈልጉ፡- ትርጉም የተገላቢጦሽ፣ የቁጥር/የመጠን/የቀን ስህተት፣ የአቅም ማጣት፣ የህግ ግዴታ መተካት፣ የደህንነት ማስጠንቀቂያ ስህተት ማለት ነው። ጥቃቅን የቅጥ ችግሮችን ችላ ይበሉ። ለእያንዳንዱ ወሳኝ ግኝት ምንጩን ጥቀስ።ምንጭ፡ [...] | ትርጉም፡ [...]
3) ራስ-ሰር የ QA ተጨማሪ ቁጥጥር;
በሚከተሉት የምንጭ-ዒላማ ጥንዶች ውስጥ መደበኛ አለመጣጣሞችን ይዘርዝሩ፡ የቁጥር አለመዛመድ፣ የጠፋ/ተጨማሪ ቦታ ያዥ ወይም መለያ፣ ወጥ ያልሆነ ቃል፣ ያልተተረጎመ ክፍል፣ ክፍል/ምንዛሪ ልዩነት። ችግሮቹን በአካባቢያቸው ብቻ ይስጡ. ጥንዶች፡ [...]
4) ራሱን የቻለ ሁለተኛ አይን (መስቀል-ቼክ):
ይህን ትርጉም ያለ ጭፍን ጥላቻ ገምግመው; የጻፍከው እንዳይመስልህ። ምንጩን ለታማኝነት፣ ቃላቶች እና ተፈጥሯዊነት የጥራት ደረጃ ይስጡ (1-5) እና ዋና ዋናዎቹን 3 ችግሮች ዘርዝር። መወሰን የኔ ነው። ምንጭ፡ [...] | ትርጉም፡ [...]
ደካማ ጥያቄ / ጠንካራ ጥያቄ
ደካማ፡ "ይህ ትርጉም ጥሩ ነው?" (ምንም መስፈርት የለም፣ AI እንደ “በአጠቃላይ ጥሩ” ያለ የማይጠቅም መልስ ይመልሳል።)
ጠንካራ፡ "ይህን ትርጉም ከምንጩ ጋር ያረጋግጡ። እያንዳንዱን ስህተት በምድብ (ትክክለኝነት/ቃላት/ ቅልጥፍና) እና ከባድነት (ወሳኝ/ዋና/አነስተኛ) ሰይፉ። በተለይ በቁጥር፣ በንግግሮች እና በቃላት ስህተቶች ላይ ያተኩሩ። ስህተቶችን አይፍጠሩ፤ እርግጠኛ ካልሆኑ 'ማረጋገጫ ያስፈልጋል' የሚል ምልክት ያድርጉ።"
ልዩነት: ጠንካራ ጥያቄ የስህተት ፍሬም እና ትኩረት ይሰጣል; ውጤቱ ተመጣጣኝ እና ሊተገበር የሚችል የጥራት ሪፖርት ነው።
ጥራት ያለው የንብርብሮች ጠረጴዛ
ንብርብር
የሚይዘው
ማን/ ምን ያደርጋል
ራስ-ሰር QA
ቁጥር፣ መለያ፣ ወጥነት
መሳሪያ/ስክሪፕት
AI ቁጥጥር
ሊሆኑ የሚችሉ የትርጉም / የቃላት ስህተቶች
LLM (ከማረጋገጫ ጋር)
የሰው LQA
ትርጉም ፣ ቃና ፣ ባህል ፣ ክብደት
ኤክስፐርት ገምጋሚ
MQM/DQF ነጥብ
የዓላማ ስህተት ውጤት
ፍሬም ያለው ሰው
የማስረከቢያ ማረጋገጫ
የመጨረሻ ኃላፊነት
ብቃት ያለው ተርጓሚ
የተለመዱ ስህተቶች
- አውቶሜትድ የሆነውን QA መዝለል እና በቀጥታ ወደ ንባብ መግባት። የስታስቲክስ ስህተቶች ትኩረትን ይሰርዛሉ.
- የ AI ፍተሻን በሰው LQA መተካት። AI ቅድመ-ስክሪኖች, አያጸድቅም.
- ተመሳሳይ ሞዴል መኖሩ የራሱን ትርጉም ያረጋግጡ. ዓይነ ስውር ቦታ; መሻገር ያስፈልጋል።
- የክብደት ስህተቶች አይደሉም። ወሳኝ እና አናሳዎችን በተመሳሳይ መልኩ ማየት ቅድሚያውን ያበላሻል።
- እነሱን ሳያረጋግጡ በ AI የተሰሩ "ስህተቶችን" ማረም። ትክክለኛውን ዓረፍተ ነገር ማዛባት ይችላሉ.
ራስ-ሰር መለኪያዎች፡ BLEU፣ COMET እና ገደቦች
በጥራት መለኪያ ውስጥ አውቶሜትድ ሜትሪክስ አለምም አለ። BLEU (የሁለት ቋንቋ ምዘና ትምህርት) የማሽን ትርጉምን ከሰው ማጣቀሻ ትርጉም ጋር በማነፃፀር በቃላት መደራረብ ላይ በመመስረት ከ0-100 ነጥብ ይሰጣል። የ MT ስርዓቶችን ለረጅም ጊዜ ለማነፃፀር መስፈርት ነበር. አዲስ ሜትሪክ COMET የነርቭ አውታረ መረብ ላይ የተመሰረተ እና ከBLEU በተሻለ የትርጉም መመሳሰልን ይይዛል። እነዚህ መለኪያዎች በትልቁ ዳታ ላይ ሁለት ሞተሮችን በፍጥነት እና በራስ-ሰር ለማወዳደር ዋጋ አላቸው።
ነገር ግን ወሰኖቹ ግልጽ ናቸው፡ እንደ BLEU ያሉ መለኪያዎች የቃላት መደራረብን ይመለከታሉ እንጂ ትርጉሙን በትክክል አይረዱም። ከማጣቀሻው የተለየ ነገር ግን ትክክለኛ ትርጉም ዝቅተኛ ነጥብ ሊቀበል ይችላል; ከማጣቀሻው ጋር ተመሳሳይ የሆነ ነገር ግን የተሳሳተ ትርጉም ከፍተኛ ነጥብ ሊቀበል ይችላል። ወሳኝ አሉታዊ ስህተት አንድ ቃል ነው ስለዚህ በመለኪያው ላይ ትንሽ ተጽእኖ ይኖረዋል, ነገር ግን በእውነቱ አስከፊ ነው. ለዚያም ነው አውቶሜትድ ሜትሪክስ በስርአት ደረጃ ያሉትን አዝማሚያዎች ይለካሉ እንጂ የግለሰብን ጽሑፍ መላክን አይወስኑም። በMQM ላይ የተመሰረተ የሰው ልጅ ግምገማ እና የባለሙያዎች ፍርድ አንድ ትርጉም ወደ ደንበኛው ይሄድ እንደሆነ ይወስናሉ እንጂ አውቶማቲክ ነጥብ አይደለም። መለኪያዎችን እንደ ኮምፓስ ተጠቀም እንጂ እንደ ዳኛ አይደለም።
በማጠቃለያው
የትርጉም ጥራት ተጨባጭ ስሜት አይደለም, ሊለካ የሚችል ነገር ነው. አውቶማቲክ QA ለመደበኛ ስህተቶች በደንብ ይፈትሻል; የሰው LQA ትርጉም, ቃና እና ባህል ይገመግማል; እንደ MQM ያሉ የስህተት ማዕቀፎች ጥራትን በምድብ እና በክብደት ይለካሉ፣ ይህም የዓላማ ንጽጽርን ያስችላል። AI ይህን ቁጥጥር የሚያፋጥነው ኃይለኛ ሁለተኛ ዓይን ነው, ነገር ግን የራሱን ትርጉም ማየት ሊታወር, ስህተት ሊሠራ እና የእውነተኛውን ዓለም ክብደት ሙሉ በሙሉ አለመረዳት; ስለዚህ የመጨረሻው የጥራት ውሳኔ፣ የክብደት እና የአቅርቦት ማፅደቅ ብቃት ያለው ተርጓሚ ነው።
የመተግበሪያ ተግባር
የማሽን የትርጉም ውጤት ያግኙ። በመጀመሪያ መደበኛ ስህተቶችን በ"አውቶማቲክ QA ማሟያ" ይዘርዝሩ፣ በመቀጠል የቋንቋ ስህተቶችን በምድብ እና በክብደት "MQM ላይ የተመሰረተ የስህተት ማረጋገጫ" ይዘርዝሩ። እያንዳንዱን ስህተት (ወሳኝ 10፣ ዋና 5፣ ጥቃቅን 1) በየቃል ደረጃ ሰጥቼ "ማድረስ ይቻላል?" ጥያቄውን መልሱ። በመጨረሻም፣ በአይአይኤ የተጠቆሙት ስህተቶች ምን ያህል እውነት እንደሆኑ እና ምን ያህል እንደተፈጠሩ ከምንጩ ጋር ያረጋግጡ።
የማረጋገጫ ዝርዝር
- [ ] አውቶማቲክ QA ን አስኬድኩ እና ማንኛውንም መደበኛ ስህተቶችን አጸዳሁ።
- [] የቋንቋ ስህተቶችን በሳጥን (ምድብ + ክብደት) ምልክት አድርጌያለሁ።
- [] ወሳኝ ስህተቶችን በተለየ፣ ቅድሚያ በተሰጠው ዙር ቃኘሁ።
- [] የ AI መቆጣጠሪያውን አመጣሁ እና አስፈላጊ ከሆነ በተለየ ሞዴል አጣራሁት።
- [ ] የመላኪያ ውሳኔውን የወሰንኩት በቁጥር ገደብ እና በራሴ የባለሞያ ፍርድ መሰረት ነው።