Yunit 12 / 12

End-to-End Project: Pagproseso ng Archive Collection gamit ang Artificial Intelligence

Mga nadagdag:

  • Kakayahang magproseso ng isang koleksyon sa isang 7-stage na daloy ng trabaho, mula sa etikal na screening hanggang sa paglalathala, na may checkpoint ng tao sa bawat yugto
  • Unawain kung paano pinipigilan ng mga maagang checkpoint ang isang error (maling petsa/pangalan) mula sa pagpapalaganap sa buong chain
  • Kakayahang ilapat ang mga prinsipyo ng pagpapanatili ng master file, hindi pag-save sa pag-verify, at pagdedeklara ng paggamit ng AI sa isang holistic na proyekto

Sinasaklaw ng mga naunang unit ang mga indibidwal na kasanayan: digitization, transcription, metadata, scanning, translation, verification, pattern analysis, retrieval, preservation, at ethics. Pinagsasama ng huling yunit na ito ang lahat. Ang isang tunay na proyekto sa archive ay nakakaranas ng mga hakbang na ito hindi hiwalay ngunit bilang isang magkakaugnay na daloy ng trabaho. Dito, makikita natin kung paano mo mapoproseso ang isang koleksyon mula simula hanggang matapos gamit ang isang prosesong sinusuportahan ng AI ngunit kinokontrol ng tao, hakbang-hakbang at may control chain.

Ang layunin ay iposisyon ang AI bilang isang kasosyo na "nagpapabilis sa bawat hakbang ngunit walang huling say sa anumang hakbang." Kapag natapos mo ang unit na ito, maiiwan ka sa isang holistic na pamamaraan na nagbabago ng isang magulo na tumpok ng mga dokumento sa isang koleksyon na handa sa pananaliksik, na-verify, malinis sa etika.

Scenario: kung ano ang meron tayo

Sabihin nating nakatanggap ka ng koleksyon ng 250 na dokumento: ang ilan ay naka-print (naka-print na sulat, mga advertisement), ilang manuskrito (mga liham, notebook), mula sa iba't ibang petsa, ang ilan ay naglalaman ng sensitibong personal na data. Layunin: i-digitize, i-transcribe, i-catalog at gawing available ang koleksyong ito sa mga mananaliksik. Hatiin natin ang proseso sa pitong yugto.

Pitong hakbang na daloy ng trabaho

Phase 1 — Pagsusuri at etikal na pagsusuri. Kilalanin muna ang koleksyon. Aling mga dokumento ang naglalaman ng sensitibong personal na data? Ano ang status ng copyright? Mayroon bang cultural sensitivity? Tinutukoy ng pag-scan na ito kung aling mga dokumento ang maaaring ibigay sa cloud-based na mga tool ng AI at kung alin ang ipoproseso lamang sa isang sarado/naaprubahang kapaligiran. Kung ang yugtong ito ay lalaktawan, ang buong proyekto ay nasa etikal na panganib.

Stage 2 — Digitization. I-scan ang mga dokumento sa mataas na resolution (hindi bababa sa 300-400 DPI, magandang contrast). Panatilihing hindi nagalaw ang orihinal (master) na mga file; Ang lahat ng pagproseso ay gagawin sa mga kopya.

Stage 3 — Pagkuha ng teksto. Mag-apply ng OCR para sa mga hardcopy na dokumento at HTR para sa manuscript. Ipalinis sa AI ang hilaw na output gamit ang "safe proofreading" na pagtuturo — optical/recognition error lang, walang content comment, hindi nababasang mga lugar [?]. Alternatibong pagbabasa at kontrol ng paleographer para sa Ottoman/manuscript.

Stage 4 — Metadata at pag-catalog. Magkaroon ng standard (Dublin Core/ISAD(G)) metadata na naka-draft para sa bawat dokumento; Na may pahintulot mula sa "iwang blangko ang hindi umiiral na field". I-map ang mga tuntunin ng paksa sa kinokontrol na listahan. I-verify ang mga petsa at pangalan na may dokumentasyon.

Stage 5 - Pagpapayaman at patterning. I-extract ang mga entity (tao/lugar/organisasyon), gawing normal, gumawa ng mga balangkas ng relasyon at timeline. I-verify ang bawat pattern sa dokumento; Walang contrived connections at walang chronology.

Stage 6 — I-access ang mga tool. Gumawa ng outline ng paghahanap ng tulong para sa koleksyon; Ibase lamang ang seksyon ng kasaysayan sa mga na-verify na tala. Malinaw na markahan ang mga paghihigpit sa pag-access (privacy/copyright).

Stage 7 — Pagpapatunay, deklarasyon at publikasyon. I-verify ang mga kritikal na field (petsa, pangalan, quote, sanggunian) sa huling pagkakataon. Ipahayag ang paggamit ng AI. Ang eksperto ay nagbibigay ng pangwakas na pag-apruba; Binuksan ang koleksyon para sa pananaliksik.

Tip: Maglagay ng "human checkpoint" sa bawat yugto: Pinapatunayan ng isang eksperto ang output ng AI bago lumipat sa susunod na yugto. Kung wala ang mga checkpoint na ito, ang isang error sa unang yugto (isang petsa ng maling pagkabasa) ay laganap sa buong chain at kalaunan ay tumutulo sa catalog, pattern, at gabay.

Control chain table

entablado

trabaho ng AI

checkpoint ng tao

1. Etikal na pagsusuri

Pagmamarka ng sensitibong data

Desisyon sa pag-install

2. Digitization

(Pagpapahusay ng larawan)

Kalidad, master na proteksyon

3. Pagkuha ng teksto

OCR/HTR + secure na pagwawasto

Pangalan/petsa/pagbabasa ng pagpapatunay

4. Metadata

karaniwang burador

Pagkumpirma sa field, pagtutugma ng termino

5. Huwaran

entidad, relasyon, timeline

Pagpapatunay sa dokumento

6. Access tool

Paghahanap ng aid draft

Kasaysayan at pag-apruba ng hadlang

7. Bitawan

Panghuling pag-apruba, deklarasyon

tatlong mini case

Case 1 — Nahuli ang chain error. Sa isang proyekto, sa phase 3, ang petsa ng isang dokumento ay nabasa na "1868" sa halip na "1888". Kung ang stage 3 checkpoint ay hindi nakuha ang error na ito, ang petsa ay maaaring kumalat sa catalog (4), ang timeline (5), at ang gabay (6). Salamat sa checkpoint, naayos ang bug sa isang lugar. Aralin: pinipigilan ng maagang pagsusuri ang error sa pagpapalaganap ng chain.

Kaso 2 — Na-save ng etikal na screening ang proyekto. 18 sa 250 na dokumento ay naglalaman ng sensitibong data ng mga buhay na tao. Na-flag ito ng etikal na screening sa phase 1; ang 18 dokumentong ito ay naproseso sa isang saradong kapaligiran, ang iba ay may mga karaniwang tool. Ito ay magiging isang malubhang paglabag kung ang pag-scan ay nilaktawan at ang lahat ng ito ay na-upload sa cloud. Aralin: ang pagsusuri sa etika ay ang unang hakbang, hindi isang pag-aayos na idinagdag sa ibang pagkakataon.

Kaso 3 — Oras at pagsisikap. Gamit ang tradisyunal na pamamaraan, aabutin ng humigit-kumulang 8-10 buwan upang ganap na maproseso ang isang koleksyon ng 250 na mga dokumento. Sa suportado ng AI, checkpoint workflow, ang proseso ay nabawasan sa humigit-kumulang 3 buwan. Ngunit ang pagtitipid ay hindi nagmula sa "Ginawa ng AI ang lahat," ngunit mula sa "ginawa ng AI ang gawaing mekanikal, na nakatuon sa pag-verify ng tao." Ang oras na inilaan sa pag-verify ay hindi nabawasan; Ang oras na inilaan sa mekanikal na trabaho ay nabawasan.

Apat na maaaring kopyahin na mga template

1) Paunang plano ng proyekto:

Mayroon akong koleksyon ng [number] na mga dokumento: [mix of print/manuscript], [period], ang ilan sa mga ito ay maaaring naglalaman ng sensitibong data. Gumawa ng 7-step na workflow plan para i-digitize at i-catalog ang koleksyong ito: tukuyin ang gawain ng AI at ang HUMAN checkpoint sa bawat yugto. Unahin ang pagsusuri sa etika.

2) Checklist ng paglipat ng yugto:

Natapos ko ang stage [stage name]. Gumawa ng checklist ng mga kritikal na punto na kailangan kong i-verify bago magpatuloy sa susunod na yugto: anong mga katotohanan (petsa/pangalan/sanggunian) ang kailangang ma-verify, anong mga error ang maaaring magpalaganap sa chain? Mayroon akong huling pag-apruba; Ibigay mo sa akin ang checklist.

3) End-to-end na kontrol sa kalidad:

Nasa ibaba ang lahat ng mga layer ng isang naprosesong dokumento: transkripsyon, metadata, mga na-extract na asset. FIGURE INCONCEPTS between layers: tumutugma ba ang isang petsa sa transkripsyon sa metadata, umiiral ba talaga ang mga entity sa text? Pagpapataw ng pagwawasto; Bumuo ng isang listahan ng mga hindi pagkakapare-pareho. Mga layer: [dito]

4) Pagsara at deklarasyon ng proyekto:

Sa koleksyong proyektong ito, ginamit ko ang AI sa mga sumusunod na yugto: [listahan]. Para sa dokumentasyon ng proyekto: (1) anong suporta ng AI ang ginamit sa kung anong yugto, (2) paano ginawa ang pag-verify ng tao, (3) anong mga limitasyon/mga hadlang ang naroon — sumulat ng isang matapat na tala sa pagsasara at bumalangkas ng pahayag sa paggamit ng AI na kinabibilangan ng mga ito.

Mahinang prompt / Malakas na prompt

mahina:

Iproseso nang maigi ang koleksyong ito gamit ang AI at ihanda ito para sa pagsasaliksik.

Ang isang "gawin ang kahit ano" na pagtuturo ay lumalampas sa etikal na screening, mga checkpoint, at pag-verify; ang mga pagkakamali ay kumakalat sa kahabaan ng kadena.

malakas:

Mag-set up ng 7-stage na daloy ng trabaho para sa koleksyon na ito, na may checkpoint ng tao sa bawat yugto. Hayaang ang 1st stage ay ethics/privacy screening. Ang output na ginawa ng AI sa bawat yugto ay mabe-verify bago lumipat sa susunod na yugto; markahan ang mga kritikal na katotohanan (petsa/pangalan/sanggunian). Sa anumang yugto ay ang AI ang may huling say.

Ang pagkakaiba: phased structure, ethics priority, checkpoints at ang “people have the final say” na prinsipyo ay ginagawang ligtas at mapagtatanggol ang buong proyekto.

Mga karaniwang pagkakamali

  • Iniiwan ang etikal na screening hanggang sa dulo. Ang pag-scan sa privacy/copyright ay ang unang hakbang; Kung idadagdag ito sa ibang pagkakataon, nangyari na ang paglabag.
  • Pag-bypass sa mga checkpoint. Kumakalat sa buong chain ang isang error na hindi na-verify.
  • Hindi pinoprotektahan ang master file. Kung ang orihinal ay hindi pinananatiling hindi nagalaw, ang pagbabalik ay magiging imposible.
  • Pagtitipid sa pag-verify. Pinaikli ng AI ang gawaing mekanikal; Kung paikliin ang oras ng pag-verify, bababa ang kalidad.
  • Hindi nagdedeklara ng paggamit ng AI. Ang transparency ay bahagi ng siyentipikong kredibilidad ng koleksyon.

Sa buod

Ang isang end-to-end na proyekto sa archive ay nag-uugnay sa mga indibidwal na kasanayan sa isang hanay ng kontrol: etikal na pag-scan, digitization, pagkuha ng teksto, metadata, pattern, tool sa pagkuha, at paglalathala. Sa bawat yugto, pinapabilis ng AI ang gawaing mekanikal; Sa bawat yugto, isang checkpoint ng tao ang may huling say. Ang etikal na screening ay ang unang yugto, ang master file ay protektado, ang mga error ay nahuhuli nang maaga upang hindi ito kumalat sa kadena, at ang paggamit ng AI ay idineklara nang tapat. Ang pagtitipid ay hindi nagmumula sa AI na ginagawa ang lahat, ngunit mula sa taong pinalaya mula sa mekanikal na trabaho at nakatuon sa pag-verify. Bumibilis ang AI; Tinitiyak ng tao ang katumpakan at integridad ng kasaysayan.

Gawain ng aplikasyon

Pumili ng maliit na koleksyon (10-20 na dokumento; sarili mong materyal o sample set). Gumawa ng 7-step na workflow gamit ang template na "project startup plan." Magpatakbo ng hindi bababa sa dalawang dokumento sa daloy na ito: etikal na pag-scan, pagkuha ng teksto, metadata, at isang layer ng pattern. I-verify ang bawat yugto gamit ang isang "checklist ng paglipat ng yugto." Panghuli, idokumento ang iyong paggamit ng AI gamit ang template na "pagsasara at pahayag ng proyekto." Tandaan kung aling mga error ang nahuli sa mga maagang checkpoint.

checklist

  • [ ] Ginawa ko ang ethics/privacy screening sa unang yugto.
  • [ ] Iningatan ko ang mga master file na hindi ginalaw.
  • [ ] Naglalagay ako ng checkpoint ng tao sa bawat yugto.
  • [ ] Na-verify ko ang mga kritikal na katotohanan bago sila ipalaganap sa kadena.
  • [ ] Idineklara ko ang paggamit ng AI sa pagsasara ng proyekto.

Pagsusulit sa Module

1. Ano ang pinakaangkop na pagpoposisyon para sa artificial intelligence sa kasaysayan at pag-archive?

  • A) Ang AI ay isang buod, tool sa pag-edit at pagbalangkas; Ang komento, pagpuna sa pinagmulan at panghuling responsibilidad ay pagmamay-ari ng eksperto ✔
  • B) Ang artificial intelligence ay maaaring magpasya sa pagiging tunay at kahulugan ng dokumento sa sarili nitong, tulad ng isang mananalaysay
  • C) Gumagana lamang ang artificial intelligence para sa pagsasalin ng teksto, wala itong kinalaman sa iba pang mga gawain sa archive
  • D) Dahil ang artificial intelligence ay palaging mas walang kinikilingan kaysa sa mga tao, ang makasaysayang interpretasyon ay dapat na iwan dito.

Paglalarawan: Artipisyal na katalinuhan; Ito ay isang katulong na nag-e-edit, nag-scan, nagsasalin at gumagawa ng mga draft ng teksto. Ang pagpuna sa pinagmulan, interpretasyon, pagtatatag ng sanhi-epekto at panghuling desisyon ay pagmamay-ari ng eksperto; Ang isang hindi na-verify na output ay maaaring humantong sa isang gawa-gawang pinagmulan, isang maling petsa, o isang anachronism.

2. Ano ang guni-guni na ginawa ng artificial intelligence sa historical research?

  • A) Ang artificial intelligence ay nagpoproseso ng isang dokumento nang napakabagal
  • B) Ang artificial intelligence ay gumagawa ng hindi umiiral na pinagmulan, quote o kaganapan bilang tunay ✔
  • C) Ang isang dokumento ay pisikal na nasira
  • D) Ang isang archive catalog ay hindi napapanahon

Paliwanag: Ang hallucination ay kapag ang artificial intelligence ay may kumpiyansa na gumagawa ng impormasyon, pinagmumulan, mga quote o mga kaganapan na hindi aktwal na umiiral. Bagama't mukhang perpekto ang anyo nito, hindi totoo ang nilalaman nito; Samakatuwid, sa bawat katalogo ng sanggunian, ang bawat pagsipi ay dapat ma-verify sa orihinal na pinagmulan.

3. Ano ang pinakamahusay na diskarte sa pagkakaroon ng OCR output na naitama ng artificial intelligence?

  • A) Pagtatanong sa teksto na maging matatas at maganda at lohikal na kumpletuhin ang mga nawawalang bahagi.
  • B) Pinapayagan itong itama ang lahat ng numero at petsa batay sa konteksto
  • C) Paghiling sa kanya na itama ang mga error sa optical recognition lamang, iwanan ang mga lugar na hindi nababasa [?] at huwag baguhin ang mga numero/petsa ✔
  • D) Pagtatanong sa mag-aaral na punan ang mga hindi nababasang salita ng pinakamalamang na hula.

Paliwanag: Ang ginintuang tuntunin sa pagwawasto ng OCR ay upang itama lamang ang mga halatang optical na error sa pagkilala (tulad ng rn hanggang m, l hanggang 1); hindi pagbibigay kahulugan o pagkumpleto ng nilalaman ng teksto. Ang mga lugar na hindi nababasa ay minarkahan ng [?]; Ang mga numero at petsa ay hindi binago, na-verify ang mga ito gamit ang larawan.

4. Ano ang dapat itanong mula sa artificial intelligence pagdating sa pagbabasa ng isang salita na ang patinig ay hindi nakasulat sa isang Ottoman text?

  • A) Magbigay ng isang solong, tumpak na pagbabasa, upang mapabilis ang trabaho
  • B) Pagpili ng salita na magpapahusay sa kahulugan at pinupunan ang mga patlang
  • C) Pagkumpleto ng hindi nababasang mga bahagi mula sa kanyang sariling pangkalahatang kaalaman.
  • D) Nag-aalok ng mga posibleng alternatibo sa pagbabasa at pagmamarka ng mga lugar na hindi maliwanag sa halip na magpataw ng tiyak na pagbabasa ✔

Paliwanag: Sa Ottoman Turkish, ang mga maikling patinig ay kadalasang hindi nakasulat; Ang isang pagkakaiba ng patinig/titik (abul at kabul, wali at vali) ay ganap na nagbabago ng kahulugan. Samakatuwid, sa halip na magpataw ng isang tiyak na pagbabasa, ang mga posibleng alternatibo ay dapat itanong, ang mga lugar na hindi nababasa ay dapat pangalagaan, at ang huling desisyon ay dapat ipaubaya sa paleographer.

5. Ano ang pinakamabisang paraan upang maiwasan ang guni-guni kapag ang pagkakaroon ng AI ay gumawa ng draft metadata (catalog record)?

  • A) Tahasang magbigay ng pahintulot na iwanang blangko ang field na iyon kung hindi ito kasama sa dokumento ✔
  • B) Paghiling na ang bawat patlang ay punan at huwag hayaang hindi kumpleto.
  • C) Pagtatantya ng petsa batay sa nilalaman ng mga walang petsang dokumento
  • D) Pagpapahintulot sa artificial intelligence na bumuo ng reference code

Paglalarawan: Pinipilit ng fill-in pressure ang AI na buuin ang dokumento sa pamamagitan ng paghula sa petsa o creator na wala sa dokumento. Ang pinakamatibay na kalasag laban dito ay ang tahasang magbigay ng pahintulot na iwanang blangko ang field kung wala ito sa dokumento; Bukod pa rito, ang mga termino ng paksa ay nakamapa sa kinokontrol na bokabularyo.

6. Paano dapat iposisyon ang isang buod ng dokumento na ginawa ng artificial intelligence sa makasaysayang pananaliksik?

  • A) Bilang maaasahang ebidensya na maaaring direktang banggitin
  • B) Bilang isang mapa ng pagtuklas na nagdidirekta sa iyo sa aktwal na dokumento; Ang ebidensya ay kinuha mula sa orihinal na dokumento ✔
  • C) Bilang isang sapat na mapagkukunan na maaaring palitan ang mismong dokumento
  • D) Bilang isang teksto na maaaring gamitin sa pag-aaral nang hindi bumabalik sa dokumento

Paglalarawan: Ang buod ay isang mapa ng pagtuklas, hindi isang patunay. Mayroong ganito sa dokumentong ito, ang sabi ay pumunta at tingnan; Hindi nito eksaktong sinasabi kung ano ang sinasabi nito sa dokumento. Kung ang isang kaganapan, quote o data ay isasama sa pag-aaral, dapat itong kunin sa verbatim mula sa orihinal na dokumento.

7. Ano ang wastong paraan upang maiwasan ang mga anachronism kapag nagsasalin ng isang makasaysayang dokumento para sa publikasyon?

  • A) Pinapalitan ang lahat ng termino ng panahon ng pinakamalapit na katumbas ngayon
  • B) Upang maihatid ang teksto bilang matatas at moderno hangga't maaari
  • C) Iwanan ang mga pamagat ng panahon at mga pangalan ng institusyon na natatangi at magdagdag ng paliwanag ✔
  • D) Pag-aangkop ng mga wastong pangalan sa kanilang kasalukuyang paggamit

Paliwanag: Ang anachronism ay ang maling paglipat ng mga elemento mula sa isang panahon patungo sa ibang panahon. Ang pagpapalit ng mga pamagat ng panahon, mga pangalan ng institusyon at mga personal na pangalan sa mga termino ngayon ay nagdadala ng mambabasa sa isang mundo na hindi kabilang sa panahon. Ang tamang paraan ay panatilihin ang termino ng panahon at magdagdag ng paliwanag sa tabi nito.

8. Paano makasigurado na ang isang archive reference (pangalan ng pondo, file number) na ibinigay ng artificial intelligence ay totoo?

  • A) Pagtitiwala sa sanggunian dahil mukhang tama ang format nito
  • B) Sa pamamagitan ng pagtatanong muli sa AI kung tama ang sanggunian
  • C) Pagtanggap sa sanggunian bilang totoo dahil ito ay nakakumbinsi at detalyado
  • D) Sa pamamagitan ng personal na paghahanap at pag-verify ng reference sa archive catalog o mapagkakatiwalaang source ✔

Paglalarawan: Ang artificial intelligence ay maaaring gumawa ng mga sanggunian na perpekto sa anyo ngunit hindi aktwal na umiiral; Ang isang kathang-isip na sanggunian ay nasa parehong anyo ng isang tunay na sanggunian. Ang tanging paraan upang patunayan na mayroong isang sanggunian ay ang hanapin ito kung saan matatagpuan ang orihinal na pinagmulan (archive catalogue, library).

9. Paano dapat suriin ang isang pattern na makikita kapag nagsasagawa ng pagsusuri ng pattern (NER, network, timeline) na may artificial intelligence?

  • A) Bilang hypothesis na kailangang ma-verify sa dokumento; panimulang punto, hindi kinalabasan ✔
  • B) Bilang isang tiyak na paghahanap na hindi nangangailangan ng pagpapatunay
  • C) Ito ay isang hindi mapag-aalinlanganang layunin na katotohanan dahil ito ay numerical.
  • D) Bilang resulta na maaaring ilagay sa direktang pag-aaral dahil nakahanap ito ng artificial intelligence

Paliwanag: Ang bawat pattern ay isang hypothesis, hindi ebidensya. Dapat na naka-link ang mga entity sa pinagmulan, dapat gawing normal ang iba't ibang spelling (ng iisang tao/lugar) nang may pag-apruba ng tao, dapat tanungin ang mga numero para sa nawawalang data at bias sa pag-sample, at hindi dapat i-chronologize ang mga walang petsang kaganapan.

10. Bakit nangangailangan ng espesyal na atensyon ang seksyong kasaysayan ng talambuhay/institusyon sa isang paghahanap ng tulong?

  • A) Ang seksyong ito ay hindi mahalaga at maaaring mai-publish nang walang pag-verify
  • B) Dahil ang artificial intelligence ay maaaring magdagdag ng mga gawa-gawang kaganapan, maling petsa at mga pamagat sa seksyong ito, dapat lang itong umasa sa mga na-verify na pinagmulan ✔
  • C) Ang artificial intelligence ay maaaring gamitin nang ligtas dahil hindi ito nagkakamali sa pagsulat ng kasaysayan.
  • D) Ang mga mananaliksik lamang ang pumupuno sa seksyong ito, ang archivist ay hindi interesado

Paglalarawan: Ang seksyon ng kasaysayan ay kung saan madalas na gumagapang ang guni-guni: ang AI ay maaaring magpasok ng mga hindi umiiral na kaganapan, maling petsa, at mga gawa-gawang pamagat habang nagsusulat ng matatas na teksto mula sa pangkalahatang impormasyon tungkol sa isang tao o institusyon. Ang seksyong ito ay dapat na nakabatay sa mga na-verify na mapagkukunan lamang.

11. Paano dapat sagutin ng artificial intelligence ang katotohanang tanong ng isang mananaliksik sa isang serbisyo ng sanggunian (konsultasyon)?

  • A) Ang sagot sa tanong ay dapat ibigay nang direkta at bilang isang tiyak na katotohanan.
  • B) Kailangang gumawa ng isang mapaniniwalaang petsa o pangalan at ihatid ito sa mananaliksik.
  • C) Sa halip na direktang magbigay ng mga katotohanan, dapat nitong idirekta ang mananaliksik sa nauugnay na koleksyon at pinagmulan ✔
  • D) Dapat itong magbigay ng kumpletong sagot upang hindi na kailangan pang pumunta ng mananaliksik sa pinanggalingan.

Paliwanag: Sa serbisyo ng sanggunian, ang artificial intelligence ay hindi dapat magbigay ng direktang katotohanang sagot, ngunit dapat idirekta ang mananaliksik sa pinagmulan. Dahil ang direktang makatotohanang sagot na ibinigay ng artificial intelligence ay maaaring gawa-gawa at ang mananaliksik ay maaaring mapagkamalang ito ang pinagmulan. Sa halip na sabihing "Ang sagot ay ito", dapat itong sabihing "Tingnan ang mga dokumentong ito sa koleksyong ito".

12. Aling mga operasyon ang katanggap-tanggap at hindi kanais-nais kapag nagpoproseso ng nasirang larawan ng dokumento gamit ang artificial intelligence?

  • A) Lahat ng uri ng operasyon ay libre, kabilang ang pagpuno sa mga nawawalang bahagi.
  • B) Walang aksyon na dapat gawin, ang imahe ay hindi dapat hawakan
  • C) Ang pagpuno sa mga nawawalang seksyon ay ang pinakamahalagang aksyon dahil kinukumpleto nito ang dokumento.
  • D) Ang mga manipulasyon sa pagiging madaling mabasa tulad ng contrast/ingay ay katanggap-tanggap; Ito ay hindi maginhawa upang punan ang mga nawawalang bahagi ng mga hula ✔

Paliwanag: Ang mga prosesong nagpapahusay sa pagiging madaling mabasa (contrast, lighting, noise reduction) ay katanggap-tanggap dahil hindi nila binabago ang content; Gayunpaman, ang pagpuno sa mga nawawala/hindi nababasang bahagi na may hula ay ang panganib na makagawa ng wala sa dokumento, iyon ay, makasaysayang pamemeke. Ang orihinal ay napanatili, ang mga transaksyon ay naitala.

13. Ano ang kailangang gawin bago iproseso ang isang archive na dokumento na naglalaman ng sensitibong personal na data?

  • A) Pag-scan sa privacy at pag-anonymize kung kinakailangan o gamit ang isang saradong/naaprubahang tool ✔
  • B) Direktang pag-upload ng dokumento sa isang pampublikong sasakyan nang hindi man lang ito iniisip
  • C) Hindi pinapansin ang mga alalahanin sa privacy para sa kahusayan
  • D) Pagtagumpayan ang mga paghihigpit sa pag-access para sa mga dahilan ng kahusayan

Pagsisiwalat: Ang pag-upload ng mga dokumentong naglalaman ng sensitibong data na tumutukoy sa mga buhay na tao (kalusugan, relihiyon, etnisidad, address) sa mga pampublikong tool na nakabatay sa ulap ay maaaring isang malubhang paglabag sa privacy. Dapat gawin muna ang pag-screen sa privacy, dapat gamitin ang anonymization o isang sarado/naaprubahang tool kung kinakailangan.

14. Ano ang pangunahing layunin ng isang checkpoint ng tao sa isang end-to-end archive project?

  • A) Pagpabagal sa gawain ng artificial intelligence at pagkaantala sa proyekto
  • B) Upang maiwasan ang isang error (maling petsa/pangalan) sa isang yugto mula sa pagkakadena sa lahat ng kasunod na yugto ✔
  • C) Pagdaragdag ng paggawa ng tao at ganap na isuko ang automation
  • D) Pagtiyak na ang artificial intelligence ang may huling salita

Paglalarawan: Tinitiyak ng isang checkpoint ng tao sa bawat yugto na ang output ng AI ay na-verify bago lumipat sa susunod na yugto. Kung wala ito, ang isang error sa unang yugto (isang petsa ng maling pagkabasa) ay magpapalaganap sa chain sa pamamagitan ng catalog, pattern, at gabay. Tinitiyak ng maagang pagsusuri na ang error ay naitama sa isang lugar.

15. Ano ang kailangan ng transparency at authenticity sa paggamit ng artificial intelligence sa humanities at social sciences?

  • A) Pagpapanatiling lihim ang paggamit ng artificial intelligence, tinitiyak na walang nakakaalam
  • B) Upang ipakita ang bawat tekstong ginawa ng artificial intelligence bilang sarili nitong orihinal na ideya
  • C) Upang matapat na ideklara ang paggamit ng artificial intelligence at hindi upang ipakita ang output nito bilang sariling orihinal na gawa ✔
  • D) Ibinabahagi lamang ang mga resulta nang hindi ipinapaliwanag ang mga pamamaraan

Paglalarawan: Kasama sa transparency ang pagtatala na ang isang transkripsyon, metadata o pagsasalin ay ginawa sa tulong ng artificial intelligence; Ang orihinal ay nangangailangan ng hindi paglalahad ng komentong ginawa ng artificial intelligence bilang sariling orihinal na ideya. Ito ay mahalaga para sa pagpapatunay ng mga susunod na mananaliksik at para sa akademikong integridad.