Mga nadagdag:
- Kakayahang makilala ang mga kalakasan at kahinaan ng pagsasalin na nakabatay sa NMT at LLM at piliin ang tamang makina ayon sa uri ng negosyo
- Kakayahang i-pre-classify ang pagiging angkop ng isang text para sa machine at pre-evaluate ito para sa makatotohanang oras at presyo
- Kakayahang mabilis na sukatin ang kalidad ng output ng raw machine sa limang dimensyon at i-flag ang mga panganib nang hindi nakakalito sa kinis sa katumpakan
Ang pinakamakapangyarihang accelerator na mayroon ka bilang isang tagasalin ay ang machine translation (MT) — ngunit ang paggamit ng isang tool ay sinasadya na nangangahulugan ng paglalapat nito sa tamang trabaho, sa tamang pares ng wika, at sa tamang mga inaasahan. Sa unit na ito, makikilala mo ang dalawang pangunahing pamilya ng MT (NMT at LLM-based translation), matutunan kung alin ang mas mahusay para sa aling trabaho, kung paano mabilis na sukatin ang hilaw na kalidad ng output ng isang pagsasalin bago ihatid, at kung paano pipiliin ang makina ayon sa trabaho. Ang layunin ay lumayo sa ideya ng "all the same, paste-translate" at maging isang dalubhasa na maaaring mahulaan kung aling teksto ang angkop para sa makina at kung saan nangangailangan ng masinsinang paggawa.
Dalawang pamilya: NMT at LLM-based na pagsasalin
Ang NMT (Neural Machine Translation) ay mga sistema na natuto mula sa milyun-milyong bilingual na pangungusap at isinasalin ang pangungusap sa kabuuan; Ang Google Translate, DeepL, Microsoft Translator ay mga halimbawa nito. Mga Lakas: napakabilis, pare-pareho, matatas sa maikling pangungusap. Kahinaan: madalas na hindi nakikita ang konteksto na lampas sa hangganan ng pangungusap (ibig sabihin mula sa buong teksto); Maaaring mahirap magpasya kung ang salitang "bangko" ay nangangahulugang bangko o pampang ng ilog sa pamamagitan ng pagtingin sa talata at hindi ito akma sa listahan ng mga terminong ibinigay.
Ang pagsasaling batay sa LLM (Malaking Modelo ng Wika) ay ang paggamit ng mga modelong hinimok ng pagtuturo gaya ng ChatGPT, Claude, Gemini para sa pagsasalin. Lakas: kumukuha ng mga tagubilin — nauunawaan ang mga tagubilin tulad ng "gumamit ng pormal na tono," "sundin ang listahan ng mga terminong ito," "mga bata ang target na madla"; nakikita ang mas malawak na konteksto; mas nakakakuha ng idyoma at tono. Kahinaan: minsan ay maaaring "masyadong malikhain" at idagdag sa pinagmulan (panganib ng mga guni-guni), nawawalan ng pagkakaugnay-ugnay sa mahahabang teksto, at ang mga gastos/bilis ay nag-iiba depende sa trabaho.
Panuntunan ng hinlalaki: sa tuwid, paulit-ulit, teknikal na mga teksto Ang NMT ay kadalasang mabilis at sapat; Ang LLM ay mas nababaluktot sa mga tekstong nangangailangan ng disiplina sa tono, konteksto, bokabularyo, at pagtuturo. Karamihan sa mga propesyonal ngayon ay gumagamit ng pareho: mabilis na draft mula sa NMT, tono/term na pagwawasto mula sa LLM.
Tip: Ang kalidad ng makina ng isang pares ng wika (hal. Turkish→English) ay maaaring mag-iba sa kabilang direksyon (English→Turkish). Ang mga wikang may agglutinative, flexible syntax, gaya ng Turkish, ay karaniwang mas mahirap para sa MT. Maghusga para sa iyong sarili kung aling makina ang mas mahusay sa iyong sariling pares na may ilang mga sample na teksto.
Compatibility ng text sa makina: tanungin muna ito
Hindi lahat ng teksto ay pantay na angkop para sa makina. Bago simulan ang pagsasalin, ipasa ang teksto sa pamamagitan ng filter na "kaangkupan":
- Tamang-tama sa makina: teknikal na manwal, paglalarawan ng produkto, paulit-ulit na teksto ng interface, karaniwang sulat, talahanayan/listahan. Ang wika ay payak, ang terminolohiya ay naayos, ang pagkamalikhain ay mahirap makuha.
- Katamtamang angkop: balita, nilalaman ng kumpanya, materyal na pang-edukasyon. Ang makina ay gumagawa ng magagandang balangkas ngunit nangangailangan ng seryosong post-editing para sa tono at daloy.
- Hindi angkop para sa makina (mataas na panganib): legal na kontrata, tekstong medikal, patalastas/slogan, tekstong pampanitikan, katatawanan, tula. Dito nagbibigay lamang ang makina ng mga ideya; Ang trabaho ay higit na nahuhulog sa mga tao.
Kung gagawin mo ang pagkakaibang ito sa simula, pareho mong bibigyan ang customer ng tamang oras/presyo at protektahan ang iyong sarili mula sa walang taros na pagtitiwala sa hilaw na output.
Mabilis na sukatin ang hilaw na kalidad ng output
Kapag nakakita ka ng isang MT na output nagtataka ka "mabuti ba o masama?" Sagutin ang tanong gamit ang isang mabilis na checklist, hindi intuwisyon. Tingnan ang limang dimensyong ito: katumpakan (tapat ba ang kahulugan sa pinagmulan?), pagkakumpleto (inalis o idinagdag ba ang pangungusap?), terminolohiya (tama at pare-pareho ba ito?), katatasan (natural ba ito sa target na wika?), format (napanatili ba ang mga tag, numero, pag-format?). Papalalimin natin ang mga sukat na ito sa susunod na yunit ng kalidad; Sa ngayon, hayaan itong maging iyong pre-delivery reflex.
Babala: Ang pinaka-mapanganib na mga error ng MT output ay ang mga "mahusay ngunit hindi tama" na mga error. Ang pangungusap ay maaaring nasa perpektong Turkish, ngunit ang "15% na diskwento" sa pinagmulan ay maaaring nabago sa "50% na diskwento." Huwag ipagpaliban ng katatasan; Palaging tingnan nang hiwalay ang bilang, negatibo, at wastong pangngalan.
tatlong mini case
Case 1 — Pinutol ng tamang makina ang oras sa kalahati. Pinili ng isang tagasalin na isalin ang isang 12,000-salitang software interface sa NMT at isang marketing booklet ng parehong volume sa LLM. Ang pagkakapare-pareho ng NMT sa interface ay nagpabilis ng trabaho; Ang tonal flexibility ng LLM sa buklet ay nagbawas ng pasanin sa muling pagsulat ng 40%. Ang pagbibigay ng parehong trabaho sa parehong makina ay mag-aaksaya ng oras.
Kaso 2 — Na-save ng pre-appraisal ang presyo. Ang isang opisina ay nag-aalok ng isang legal na teksto dahil "ito ay maaaring gawin sa pamamagitan ng mga makina, ito ay magiging mura". Sa pre-evaluation, isang 500-salitang sample ang isinalin; Nagbalik ang makina ng dalawang legal na termino na may katumbas na maling sistema. Ang opisina ay nagpresyo sa trabaho bilang "mabigat na post-editing" at nagbigay ng makatotohanang deadline; Iniwasan niyang mawalan ng pera dahil sa maling alok.
Case 3 — Pagkakaiba ng pares ng wika. Naisip ng isang team na ang isang makina na gumagana nang mahusay sa English→German ay may parehong kalidad sa Turkish→Arabic. Ang 300-salitang pagsubok ay nagpakita na ang Arabic na output ay nangangailangan ng higit pang pagwawasto. Ang koponan ay naglaan ng iba't ibang mga makina at iba't ibang mga badyet pagkatapos ng pag-edit depende sa pares ng wika.
Apat na maaaring kopyahin na mga template
1) Pagsusuri sa pagiging angkop sa teksto:
Ang iyong tungkulin: senior MTPE specialist. I-rate ang sumusunod na teksto para sa pagiging angkop para sa pagsasalin ng makina: literal/teknikal o malikhain/konteksto? Uriin ito bilang (1) very machine-friendly, (2) medium, (3) high risk at isulat ang iyong katwiran. Tantyahin ang inaasahang post-editing load bilang magaan/medium/heavy.Text na halimbawa: [paste 200-300 words]
2) Inutusang pagsasalin ng LLM (na may terminolohiya at kontrol sa tono):
Isalin ang text na ito [source]→[target].Audience: [sino]. Tono: [hal. opisyal]. Patlang: [hal. pananalapi].Listahan ng mga termino (siguraduhing gamitin): [A→a, B→b].Mga Panuntunan: huwag magdagdag ng wala sa pinagmulan, panatilihin ang mga numero/petsa/pangalan, palitan ang bawat pangungusap ng pangungusap. Markahan kung saan hindi ka sigurado sa [?]. Teksto: [...]
3) Dalawang paghahambing ng makina:
Nasa ibaba ang dalawang magkaibang pagsasalin ng parehong pinagmulang pangungusap (A at B). Ihambing ang bawat isa sa mga tuntunin ng kawastuhan, terminolohiya at pagiging natural, at sabihin sa akin kung alin ang mangangailangan ng mas kaunting pagwawasto, kasama ang katwiran. Pinagmulan: [...] | Pagsasalin A: [...] | Pagsasalin B: [...]
4) Raw output mabilis na inspeksyon:
Nasa ibaba ang source at machine translation. Markahan lamang ang sumusunod:(1) tinanggal/nadagdag na impormasyon, (2) maling numero/petsa/pangalan, (3) error sa negation, (4) hindi tugmang termino. Huwag sumulat ng anumang pagwawasto, ilista lamang ang mga mapanganib na lugar. Pinagmulan: [...] | Pagsasalin: [...]
Mahinang prompt / Malakas na prompt
Mahina: "Isalin ang tekstong ito at magiging maganda ito." (Para sa makina, ang "mabuti" ay hindi natukoy; walang tono, walang termino, walang masa.)
Güçlü: "Isalin ang paglalarawan ng produkto na ito mula sa English patungo sa Turkish. Lugar: e-commerce. Audience: batang mamimili. Tono: magiliw ngunit nakakapanatag. 'checkout' → 'checkout step', 'wishlist' → 'wish list'. Baguhin ang mga numero at pangalan ng brand. Fluent Turkish na walang amoy sa pagsasalin."
Pagkakaiba: ang malakas na prompt ay nagbibigay sa makina ng isang masusukat na target; ang output ay direktang tinatantya ang post-edited draft.
tsart ng paghahambing ng NMT vs LLM
Sukat
NMT (Google, DeepL)
LLM (ChatGPT, Claude)
bilis
napakabilis
daluyan
Tumanggap ng pagtuturo/tono
mahina
malakas
Sumunod sa listahan ng termino
limitado
Mabuti (na may prompt)
Malawak na konteksto
mahina
mabuti
Panganib ng mga guni-guni
mababa
Katamtaman (kailangan ng kontrol)
pinakaangkop na trabaho
Tuwid/teknikal/paulit-ulit
Tono/konteksto/malikhain
Mga karaniwang pagkakamali
- Gamit ang parehong makina para sa bawat trabaho. Ang hindi pagpili ng makina ayon sa uri ng trabaho ay nagdudulot ng pagkawala ng oras at kalidad.
- Pagbibigay ng presyo/oras nang walang paunang pagsusuri. Ang isang 200-300 salita na pagsubok ay nagpapakita ng mga sorpresa mula sa simula.
- Napagkakamalang katatasan para sa katumpakan. Ang magandang pangungusap ay hindi nangangahulugan ng tamang pangungusap.
- Hindi pinapansin ang pares ng wika at pagkakaiba ng direksyon. Ang isang mahusay na makina sa isang pares ay maaaring mahina sa isa pa.
- Hindi napapansin ang mga karagdagan ng LLM. Minsan nagdaragdag ang LLM ng mga pangungusap na wala sa pinagmulang "upang tumulong"; suriin ito.
window ng konteksto at pagkakapare-pareho
Kapag nagsasalin ng mahabang text gamit ang LLM, kailangang malaman ang isang teknikal na limitasyon: ang window ng konteksto — ang dami ng text na "makikita" ng modelo at mananatili sa isip sa isang pagkakataon. Kung mas malaki ang text kaysa sa window na ito, kakailanganin mong hatiin ito sa mga chunks, at maaaring "makalimutan" ng modelo sa susunod na chunk ang term na desisyon o tono na ginawa mo sa mga nakaraang chunks. Kaya, sa halip na isalin ang isang mahabang libro o dokumento sa isang piraso, ang pagpapaalala sa bawat piraso ng termbase at buod ng istilo ay nagpapanatili ng pagkakapare-pareho. Ang problemang ito ay hindi nangyayari sa mga maikling teksto; Gayunpaman, sa mahabang mga gawa tulad ng mga nobela at mga manwal, kinakailangan na dagdagan na suriin ang pagkakapare-pareho sa mga sipi. Praktikal na solusyon: upang maghanda ng "memorya ng proyekto" (mga termino + mga character + mga desisyon sa tono) at idagdag ito sa simula ng bawat piraso at i-scan para sa pagkakapare-pareho sa pagitan ng mga piraso sa dulo ng pagsasalin. Sa NMT, ang problemang ito ay nararanasan sa ibang paraan: Dahil ang NMT ay nagsasalin ng pangungusap sa pamamagitan ng pangungusap, mahina na ang pagkakapare-pareho ng haba ng talata, kaya ang termbase ay nagsasagawa ng terminong disiplina.
Sa buod
Mayroong dalawang pamilya ng machine translation: NMT, na mabilis at pare-pareho, at LLM, na kumukuha ng pagtuturo at mas nakikita ang konteksto at tono. Ang master translator ay namarkahan ang pagiging angkop ng teksto para sa makina nang maaga, pinipili ang makina ayon sa trabaho, mabilis na sinusukat ang kalidad ng hilaw na output bago ihatid, at hindi kailanman nalilito ang katatasan sa katumpakan. Ang pre-evaluation reflex na ito ay nagbibigay-daan sa iyong parehong magbigay ng makatotohanang oras/presyo at protektahan ang iyong sarili mula sa bulag na pagtitiwala.
Gawain ng aplikasyon
Isalin ang parehong 200-salitang teksto gamit ang parehong NMT tool at LLM. Ihambing ang dalawang output sa limang dimensyon (katumpakan, pagkakumpleto, terminolohiya, katatasan, format) at isulat ang mga dahilan kung saan ang isa ay nangangailangan ng mas kaunting post-edit para sa tekstong ito. Pagkatapos ay i-flag ang isyu/contingency/term na mga panganib sa pareho gamit ang template na "raw output quick check".
checklist
- [ ] Inuri ko ang pagiging angkop ng teksto para sa makina (mababa/medium/mataas na panganib).
- [ ] Depende sa uri ng trabaho, nagpasya ako kung gagamit ng NMT o LLM.
- [ ] Gumawa ako ng paunang pagsusuri na may maliit na sample at tinukoy ang tagal/presyo nang naaayon.
- [ ] Mabilis kong siniyasat ang hilaw na output sa limang dimensyon.
- [ ] Sinuri ko nang hiwalay ang numero, petsa, pangalan at mga negatibo nang hindi nalinlang ng katatasan.