Faida:
- Kuelewa dhana za kumbukumbu ya tafsiri (TM), mechi zisizoeleweka na sehemu, na kuweza kutumia tofauti katika mechi zisizoeleweka kwa kuzirekebisha badala ya upofu.
- Uwezo wa kutumia nidhamu ya kuandika tafsiri zilizoidhinishwa tu kwa TM, kuweka TM za mteja tofauti, na kufanya matengenezo ya TM.
- Uwezo wa kulinda faragha kwa kudhibiti data inapoenda katika ujumuishaji wa MT/LLM ndani ya CAT
Tafsiri ya kitaalamu mara nyingi hufanywa katika zana ya CAT, si katika kihariri cha maandishi wazi. Katika kitengo hiki, utajifunza zana za CAT, kumbukumbu ya tafsiri (TM) katika kiini cha utafsiri, jinsi zinavyofanya kazi pamoja na utafsiri wa mashine na LLM, na jinsi ya kutumia mfumo huu wa ikolojia kwa ufanisi na usalama. Lengo ni kuwa mtumiaji wa teknolojia ya utafsiri ambaye anasimamia mradi mzima, si sentensi binafsi, kwa njia thabiti, haraka na inayoweza kufuatiliwa.
Dhana za kimsingi
Zana ya CAT (Tafsiri Inayosaidiwa na Kompyuta) ni programu ya kitaalamu (kama vile Trados, memoQ, Phrase, MateCat) ambayo hupanga sentensi ya utafsiri kwa sentensi (sehemu) na kuunganisha kumbukumbu ya tafsiri na neno la msingi. Huonyesha chanzo na lengwa bega kwa bega, kunasa marudio, huhifadhi umbizo.
TM (Kumbukumbu ya Tafsiri) ni hifadhidata inayohifadhi jozi za sentensi lengwa ambazo umetafsiri hapo awali. Sentensi mpya inapofika, ikiwa kuna sentensi sawa katika TM, wakala anakupendekezea. Wazo kuu hapa ni ulinganifu wa fuzzy: kufanana kwa sentensi mpya na sentensi katika TM (100% = sawa kabisa, 85% = sawa kwa kiasi kikubwa). Ulinganifu wa juu huharakisha kazi kwa sababu unatumia tena tafsiri yako ya awali.
Sehemu ni sehemu ya msingi ya tafsiri-kawaida sentensi. Zana ya CAT hugawanya maandishi katika sehemu na kuhariri kila moja tofauti.
Umuhimu wa TM: MT hutoa rasimu ghafi, lakini TM hurejesha tafsiri zako za zamani zilizoidhinishwa, zenye ubora wa kibinadamu. Mbili ni tofauti: MT ni utabiri, TM ni kumbukumbu.
Kidokezo: Usichanganye TM na MT. 100% TM inayolingana (tafsiri yako iliyoidhinishwa hapo awali) inaaminika kwa ujumla; Pendekezo la MT linapaswa kuthibitishwa kila wakati. Zana za CAT zinaonyesha hizo mbili zenye rangi/lebo tofauti; daima kuona tofauti hii.
Ujumuishaji wa MT na LLM katika CAT
Zana za kisasa za CAT huita injini za MT na LLM zinazozidi kuongezeka ndani: ikiwa hakuna mechi katika TM, wakala hurejesha kiotomati pendekezo la MT kwa sehemu; unaichapisha (yaani, MTPE inapita katika CAT). Zana za kizazi cha hivi punde pia huunganisha LLM: unaweza kufanya shughuli kama "andika upya sehemu hii kwa sauti hii", "rekebisha neno hili ili kusimamisha" n.k. kwenye zana.
Faida ya ushirikiano huu: TM, termbase, MT na LLM zimeunganishwa kwenye skrini moja; Kwa kila sentensi, mtiririko "angalia TM kwanza, vinginevyo pendekeza MT, neno QA kiotomatiki" umeanzishwa. Chini na tahadhari: data huenda wapi? Uunganisho wa MT/LLM unaotegemea wingu unaweza kutuma maandishi kwa seva za nje; Katika kazi ya siri, hii inaweza kuwa uvunjaji wa mkataba. Hakikisha unajua gari limeunganishwa kwa injini gani na sera ya data.
Kulisha na kusafisha kumbukumbu ya tafsiri
Thamani ya TM ni sawa na ubora wa tafsiri ndani yake. Taka ndani, takataka nje. Taaluma mbili:
- Andika tu tafsiri iliyoidhinishwa kwa TM. Ukihifadhi pato mbichi la MT kwa TM bila kulithibitisha, litarudi kwenye kazi zako za baadaye kama "kumbukumbu" mbaya.
- Fanya matengenezo ya TM. Baada ya muda, maneno hubadilika na makosa huingia. Safisha TM mara kwa mara, rekebisha jozi zilizovaliwa/zisizo sahihi. Katika kazi hii ninatumia LLM kuuliza "kuna kutokwenda / upendeleo wa muda katika jozi hizi za TM?" Unaweza kuitumia kama mkaguzi.
Tahadhari: Kutumia TM ya mteja mmoja katika biashara ya mteja mwingine ni ukiukaji wa usiri na hatari ya kuchanganyikiwa kwa muda. TM huwekwa tofauti kwa msingi wa mteja/mradi. Mchanganyiko wa "kila kitu TM" huharibu usiri na ubora.
kesi tatu ndogo
Kesi ya 1 — TM ilirusha marudio. Mtengenezaji alikuwa akitafsiri familia ya bidhaa ambapo 70% ya mwongozo wake ilibaki sawa mwaka baada ya mwaka. Shukrani kwa TM, 100% na mechi za hali ya juu zisizoeleweka zilikuja kiotomatiki katika kila toleo jipya; Maneno ~ 9,000 pekee ya kazi ya maneno 30,000 yalikuwa tafsiri mpya halisi. Muda na gharama zilipunguzwa kwa theluthi moja.
Kesi ya 2 - Dirty TM ilieneza hitilafu. Timu moja ilikuwa imehifadhi pato ghafi la MT kwenye TM bila uthibitishaji. Mwaka mmoja baadaye tafsiri hiyo hiyo potofu ilirudi tena na tena, ikionekana "kutegemewa" kama mechi ya 100%; Hitilafu ilisambazwa katika hati 14 tofauti. Timu ilianzisha sheria ya "tafsiri iliyoidhinishwa kwa TM pekee" na ziara ya kusafisha.
Kesi ya 3 - Usiri umevuja kwa kuunganishwa. Mtafsiri alifanya kazi ya siri katika mradi wa CAT ambao uliunganishwa kiotomatiki kwenye MT ya wingu; Maandishi yalikwenda kwa injini ya nje ambayo sera ya data haiko wazi. Mara tu ilipogunduliwa, ujumuishaji wa MT kwa miradi ya siri ulizimwa na injini za biashara pekee ambazo "hazihifadhi/data ya treni" zilitumika.
Violezo vinne vinavyoweza kunakiliwa
1) Tathmini ya mechi isiyoeleweka (kwa LLM):
Ifuatayo ni sentensi mpya ya chanzo, sentensi sawa katika TM na tafsiri yake iliyoidhinishwa. Niambie ni nini hasa ninachohitaji kubadilisha ili kurekebisha tafsiri ya TM kwa sentensi mpya; Usipendekeze mabadiliko yasiyo ya lazima. Onyesha tofauti ya maana kwa uwazi. Chanzo kipya: [...] | Chanzo cha TM: [...] | Tafsiri ya TM: [...]
2) ukaguzi wa uthabiti wa TM:
Zifuatazo ni jozi za lengwa kutoka kwa TM. Weka alama kwenye kutofautiana na mikengeuko ya istilahi ambapo sentensi chanzo sawa au zinazofanana sana zimetafsiriwa TOFAUTI. Orodhesha tu matatizo. Wanandoa: [...]
3) Kuandika upya toni ya sehemu (LLM katika CAT):
Tengeneza sehemu lengwa ifuatayo [toni inayotakikana] BILA KUBADILI maana. Zingatia orodha ya masharti: [...]. Weka nambari na majina. Hamisha tu sehemu iliyoandikwa upya. Sehemu: [...]
4) Ukaguzi wa mapema wa faragha/muunganisho:
Nitatumia ujumuishaji wa MT/LLM katika mradi wa CAT. Nitaelezea aina ya maandishi katika mradi huu; Niambie ikiwa inafaa kutuma maandishi haya kwa injini ya nje inayotegemea wingu, ni maswali gani (uhifadhi wa data, mafunzo, eneo) ninapaswa kumuuliza mtoa huduma. Aina ya maandishi/hali ya faragha: [...]
Mwongozo dhaifu / Mwongozo thabiti
Dhaifu: "Tumia tafsiri katika TM." (Haijulikani ni kiwango gani cha mechi na nini cha kurekebisha; kunakili bila upofu huleta makosa.)
Nguvu: "Sentensi hii mpya inalingana na sentensi katika TM 90% ya wakati huo. Jenga juu ya tafsiri ya TM lakini onyesha tofauti hii: chanzo kina 'mwaka' badala ya 'kila mwezi', kwa hivyo inapaswa kuwa 'kila mwaka' badala ya 'kila mwezi'. Usibadilishe chochote kingine."
Tofauti: haraka haraka hubainisha tofauti ya mechi; Inazuia "kuacha tafsiri ya zamani kama ilivyo", ambayo ni makosa ya kawaida ya kulinganisha kwa fuzzy.
Jedwali la vipengele vya mfumo ikolojia wa CAT
sehemu
Je!
uhusiano na AI
TM (kumbukumbu ya tafsiri)
Hurejesha tafsiri zilizopita zilizoidhinishwa
Kutegemewa; inatangulia MT
Termbase
Inahakikisha uthabiti wa neno
Inatolewa kama haraka kwa LLM
Mapendekezo ya MT
Mchoro mbichi katika sehemu tupu
Lazima ibadilishwe
Ushirikiano wa LLM
Toni/muda/kuandika upya
Kudhibitiwa, makini na faragha
Moduli ya QA
Hitilafu ya kuchanganua nambari/ neno/ lebo
udhibiti wa moja kwa moja
Makosa ya kawaida
- Kukubali kwa upofu mechi isiyoeleweka. Mechi ya 85% inaweza kuficha tofauti ya 15% ya maana.
- Kuandika pato ghafi la MT kwa TM. Dirty TM hubeba hitilafu katika siku zijazo na kuieneza.
- Kuchanganya TM za mteja/mradi. Usiri na hatari ya kuchanganyikiwa kwa muda.
- Bila kujua data ya ujumuishaji inakwenda wapi. Maandishi yaliyofichwa yanaweza kuvuja bila wewe kufahamu.
- Kusahau tofauti ya TM/MT. MT ni makadirio; TM ni kumbukumbu. Wawili hawa sio salama sawa.
Tafsiri ya awali na upatanishi
Vitendaji viwili vya hali ya juu vya CAT huharakisha zaidi mtiririko wa kazi katika enzi ya AI. Ya kwanza ni tafsiri ya awali: mwanzoni mwa mradi, chombo kinajaza moja kwa moja sehemu zote na TM na MT; Badala ya faili tupu, unaanza na faili ambapo 100% mechi zimeidhinishwa, mechi zisizo na maana zinangoja kubadilishwa, na tupu ni rasimu za MT. Hii inabadilisha kazi kutoka "kuandika kutoka mwanzo" hadi "kukagua na kuhariri" - lakini unahitaji kutathmini kila sehemu badala ya kuidhinisha utafsiri wa mapema bila uwazi.
Ya pili ni upatanishi: ikiwa una jozi ya hati ya lengwa ambayo imetafsiriwa hapo awali lakini haijaingia kwenye TM, zana ya upatanishi inalingana nazo sehemu kwa sehemu na kuzibadilisha kuwa TM. Kwa hivyo, tafsiri zako za zamani zinaongezwa kwenye "kumbukumbu". Tahadhari katika upatanishi: kulinganisha kiotomatiki sio sahihi kila wakati; utelezi wa sehemu moja huvuruga mpangilio mzima. Kupitia upya jozi zilizopangiliwa kabla ya TMing huzuia hatari ya TM chafu mara ya kwanza. Vipengele hivi viwili hugeuza mali yako ya sasa (tafsiri za zamani) kuwa uwekezaji katika biashara za siku zijazo.
Kwa muhtasari
Vyombo vya CAT; Inachanganya kumbukumbu ya tafsiri, termbase, tafsiri ya mashine na LLM katika mstari mmoja wa uzalishaji. TM ni kumbukumbu inayorejesha tafsiri zako za zamani zilizoidhinishwa na kutoa kasi kubwa katika kazi zinazorudiwa; MT ni utabiri ambao unahitaji kuthibitishwa kila wakati. Mtumiaji mahiri hurekebisha kwa uangalifu tofauti katika ulinganifu usioeleweka, huandika tafsiri zilizoidhinishwa tu kwa TM, hutenganisha TM za wateja, na hulinda faragha kwa kujua data inapoenda katika ujumuishaji.
Jukumu la maombi
Sanidi mradi mdogo katika zana ya CAT (CAT ya mtandaoni ya bure pia inafanya kazi): ongeza termbase na TM tupu. Tafsiri maandishi ya sentensi 10, hifadhi tafsiri zilizoidhinishwa kwa TM. Kisha tafsiri maandishi ya pili yanayofanana sana na maandishi ya kwanza na urekebishe ulinganifu usioeleweka uliorejeshwa na TM kwa kiolezo cha "tathmini ya mechi isiyoeleweka"; Kumbuka ni sentensi ngapi ungefanya makosa ikiwa utakubali TM kwa upofu.
orodha ya ukaguzi
- [ ] Niliunganisha TM na kituo kwenye mradi.
- [ ] Nilitumia tofauti katika mechi zisizoeleweka kwa urahisi badala ya upofu.
- [ ] Niliandikia TM tu tafsiri iliyoidhinishwa ambayo nimeithibitisha.
- [ ] Nilitenga TM za mteja/mradi.
- [ ] Niliangalia ambapo data huenda katika muunganisho wa MT/LLM.