Mga nadagdag:
- Kakayahang ipaliwanag ang konsepto, lohikal at pisikal na mga modelo ng data at mga konsepto ng normalisasyon at gumawa ng mga draft ng relasyon sa entity na may suporta ng artificial intelligence
- Kakayahang mag-draft ng diksyunaryo ng data, panuntunan sa negosyo at mga relasyon sa talahanayan na may mga structured na prompt at i-verify ang mga ito laban sa totoong system
- Kakayahang kritikal na suriin ang mga suhestyon ng schema na binuo ng AI sa mga tuntunin ng integridad, kaisahan at pagsunod sa panuntunan ng negosyo.
Ang isang sistema ng impormasyon ay mahalagang isang istraktura na nagpapanatili sa data na nakaayos. Ang pagmomodelo ng data ay ang gawain ng pagdidisenyo ng mga katotohanan ng isang negosyo (customer, order, produkto, invoice) at ang kanilang relasyon sa isa't isa sa isang structured na paraan. Ang isang mahusay na modelo ng data ay ang pundasyon ng tumpak na pag-uulat, mabilis na mga query, at pare-parehong data; Ang isang masamang modelo ay ang pinagmulan ng mga taon ng hindi pagkakapare-pareho at paulit-ulit na pagwawasto. Kadalasan, hindi kino-code ng MIS professional ang modelo mula sa simula, ngunit bini-verify nito na sumusunod ang modelo sa mga panuntunan ng negosyo at isinasalin ang modelo sa pagitan ng business unit at IT.
Ang pagmomodelo ng data ay nagpapatuloy sa tatlong antas ng abstraction. Ang konseptwal na modelo (Ingles na konsepto) ay ang pinakamataas na antas: anong mga pangunahing entity ang umiiral at paano sila nauugnay? "Nag-order ang customer, kasama sa order ang produkto." Walang mga teknikal na detalye. Tinutukoy ng lohikal na modelo ang mga katangian (mga patlang), mga susi, at mga uri ng relasyon ng bawat entity; ngunit hindi pa rin ito nakatali sa isang partikular na produkto ng database. Ang pisikal na modelo (Ingles na pisikal) ay ang kongkretong bersyon ng mga talahanayan, mga uri ng data at mga index sa isang partikular na database (hal. SQL Server, PostgreSQL). Ang tatlong antas na ito ay lalong detalyadong mga bersyon ng parehong ideya.
Entity-Relasyon at Mga Susi
Ang pangunahing wika ng modelo ng data ay ang modelo ng Entity-Relationship (ER). Maaaring ituring ang entity bilang isang talahanayan: Customer, Order. Ang katangian ay ang column ng talahanayan: pangalan, email, halaga. Ang relasyon ay kung paano konektado ang mga entity: maaaring magkaroon ng maraming order ang isang customer (one-to-many na relasyon).
Mayroong dalawang kritikal na pangunahing konsepto. Ang pangunahing susi ay ang field na natatanging tumutukoy sa bawat row sa isang talahanayan; halimbawa CustomerID. Ang foreign key ay isang field sa isang table na tumuturo sa primary key ng isa pang table; Ang CustomerID sa talahanayan ng order ay nagkokonekta kung aling order ng customer ito. Tinitiyak ng mga koneksyon na ito ang integridad ng referential: hindi maaaring maglagay ng order para sa isang customer na wala.
Tip: Kapag nagkakaroon ang AI ng isang draft ng ER, ginagawang mas madali ang tahasang paghiling ng pangunahing key para sa bawat talahanayan at ang foreign key para sa bawat relasyon. Ngunit i-verify ang bawat foreign key na iminungkahi ng modelo laban sa aktwal na panuntunan ng negosyo: minsan ang relasyon na sa tingin mo ay "isa-sa-marami" ay talagang "marami-sa-marami".
Normalization: Pag-iwas sa Pag-ulit
Ang normalisasyon ay ang proseso ng pagbabawas ng redundancy at pagpapanatili ng integridad sa pamamagitan ng paghahati ng data sa mga lohikal na talahanayan. Ang layunin ay panatilihin ang parehong impormasyon sa isang lugar. Halimbawa, sa halip na i-type ang address ng customer nang paulit-ulit sa bawat linya ng order, itatago mo ang address nang isang beses sa talahanayan ng Customer at i-link ito sa isang foreign key mula sa order. Sa ganitong paraan, kapag nagbago ang address, ina-update mo ito sa isang lugar; Kung hindi, magkakaroon ng iba't ibang address ang daan-daang mga order. Ito ay tinatawag na anomalya sa pag-update.
Ang kabaligtaran ng normalisasyon ay ang denormalisasyon: sadyang pinapayagan ang ilang pag-uulit para sa kapakanan ng bilis ng pag-uulat. Sa mga sistema ng negosyo (operational database), ang normalisasyon ay karaniwang ginustong, at sa mga sistema ng pag-uulat (data warehouse), ang denormalisasyon ay kadalasang ginusto. Kaya "ang normalisasyon ay hindi palaging mabuti"; Ang desisyon ay ginawa ayon sa layunin.
Diksyunaryo ng Data: Karaniwang Wika
Ang diksyunaryo ng data ay isang dokumento na tumutukoy kung ano ang ibig sabihin ng bawat field, uri nito, mga hadlang at panuntunan sa negosyo. Ano ang ibig sabihin ng field na "status"? Anong mga halaga ang maaaring tumagal (Nakabinbin, Naaprubahan, Kinansela)? Sapilitan ba ito? Kung wala ang dokumentong ito, ang parehong field ay iba-iba ang interpretasyon ng iba't ibang team at ang ulat ay mababaluktot. Ang diksyunaryo ng data ay ang lingua franca ng organisasyon at isa sa pinakamahahalagang maihahatid ng propesyonal sa MIS. Mabilis na makakapag-extract ang AI ng paunang draft ng diksyunaryo ng data mula sa kasalukuyang istraktura ng talahanayan; Ngunit ang unit lang na gumagamit ng data na iyon ang nagbe-verify sa totoong kahulugan ng negosyo ng bawat field.
Tatlong Mini Cases: By the Numbers
Kaso 1 — Ang halaga ng pag-uulit. Sa isang kumpanya ng pamamahagi, ang address ng customer ay itinago nang hiwalay sa parehong mga talahanayan ng order at invoice. Kapag lumipat ang isang customer, ang address ay na-update sa isang talahanayan lamang; 1,400 invoice ang napunta sa lumang address at na-refund. Kung ang address ay na-normalize sa isang talahanayan, isang solong pag-update ay magiging sapat. Ang proyekto sa remediation ay nagkakahalaga ng 2 linggo.
Kaso 2 — Maling uri ng relasyon. Kinikilala ng isang dalubhasa sa MIS sa isang institusyong pang-edukasyon ang (isa-sa-marami) na relasyon na "Ang mag-aaral ay kabilang sa isang Klase" sa modelong binuo ng AI. Gayunpaman, ang mga mag-aaral ay maaaring magpatala sa higit sa isang elektibong klase; Ang relasyon ay talagang marami-sa-marami at isang intermediate na talahanayan (Record) ay kinakailangan. Ang pagkakamali ay nahayag sa larangan nang ang isang mag-aaral ay nabigo sa pag-enroll sa ikalawang baitang. Kung ang mungkahi ng AI ay nakumpirma, ito ay nakuha mula sa simula.
Case 3 — Halaga ng diksyunaryo ng data. Natukoy na ang field na "policy_status" sa isang kompanya ng seguro ay naiiba ang interpretasyon ng 5 magkakaibang team, kaya ang parehong KPI ay nagbigay ng 3 magkakaibang resulta sa mga ulat. Sa pamamagitan ng pag-draft ng diksyunaryo ng data na pinapagana ng AI at pagkamit ng pare-parehong kasunduan sa unit ng negosyo, inalis ang hindi pagkakapare-pareho ng ulat at binawasan ng 60% ang oras ng pagpupulong ng buwanang pagkakasundo.
Mahina Prompt / Malakas na Prompt
Mahinang prompt:
Magdisenyo ng database ng e-commerce.
Napakahusay na prompt:
Ang iyong tungkulin: Isa kang makaranasang data modeler.DRAFT ng LOGICAL data model ayon sa mga sumusunod na panuntunan sa negosyo.Mga Panuntunan:- Para sa bawat entity: mga field, pangunahing key, mga kinakailangang field.- Para sa bawat relasyon: uri (isa-sa-marami / marami-sa-marami) at foreign key.- Magmungkahi ng intermediate table sa marami-sa-maraming relasyon.- Normalize ang form hanggang sa 3rd Kung inirerekumenda mo ang intensyonal na denormalization, isulat ang katwiran.- Lagyan ng label ang [KINAKAILANGANG KUMPIRMASYO] anumang tuntunin sa negosyo na hindi mo sigurado. Mga panuntunan sa negosyo:- Maaaring maglagay ng maraming order ang customer.- Ang isang order ay naglalaman ng maraming produkto; Ang isang produkto ay nangyayari sa maraming order.- Ang mga produkto ay may mga kategorya.[iba pang mga panuntunan...]
Nililinaw ng malakas na prompt ang antas ng modelo (lohikal), susi at mga panuntunan sa relasyon, target ng normalisasyon, at mga puntong nangangailangan ng kumpirmasyon.
Apat na Nakokopyang Template
1) draft ng diksyunaryo ng data:
Ang isang balangkas ng diksyunaryo ng data ay sumusunod mula sa kahulugan ng talahanayan. Para sa bawat field: pangalan, uri, mandatory ba ito, posibleng mga halaga, kahulugan ng negosyo (label [PREDICTION] kung ito ay isang hula). Talahanayan: [DDL o listahan ng field]
2) Pagsusuri sa normalisasyon:
Mayroon bang anumang panganib ng duplicate na data, pag-update ng anomalya, at pagkakataon para sa normalisasyon sa istraktura ng talahanayan sa ibaba? Para sa bawat paghahanap, isulat kung aling normal na anyo ang nilalabag nito at ang iyong mungkahi. Istraktura: [teksto]
3) ER draft mula sa panuntunan ng negosyo:
Isalin ang mga sumusunod na panuntunan sa negosyo sa mga entity, katangian, at relasyon. Tukuyin ang uri ng bawat relasyon (1-1, 1-N, N-N) at kung N-N, magmungkahi ng intermediate table. Markahan ang hindi malinaw na mga panuntunan. Mga Panuntunan: [teksto]
4) Mga tanong sa pag-verify ng uri ng relasyon:
Para sa bawat relasyon sa modelo ng data sa ibaba, bumuo ng "oo/hindi" na tanong sa negosyo na susubok sa kawastuhan ng uri nito (hal., "Maaari bang mag-enroll ang isang mag-aaral sa higit sa isang klase nang sabay-sabay?"). Modelo: [teksto]
Tsart ng Paghahambing: Mga Antas ng Modelo
tampok
konseptwal
lohikal
pisikal
Detalye
kahit man lang
daluyan
karamihan
susi/relasyon
Pangunahing ari-arian
Tinukoy ang mga susi
Kasama ang index/uri
Depende sa database
hindi
hindi
Oo
target na madla
yunit ng negosyo
analyst
Developer/DBA
Kontribusyon ng AI
burador
malakas na draft
Draft, kumpirmasyon ng DBA
Mga karaniwang pagkakamali
- Iniisip ang isang many-to-many na relasyon bilang one-to-many. Ito ang pinakakaraniwang error sa pagmomodelo; Kung ang intermediate table ay nakalimutan, ang system ay hindi maaaring panatilihin ang aktwal na estado.
- Inilalagay ang lahat sa isang mesa. Ang pagsasama-sama ng lahat ng mga patlang sa isang talahanayan para sa kapakanan ng "pagiging simple" ay nagbubunga ng pagdoble at pag-update ng mga anomalya.
- Hindi nagsusulat ng diksyunaryo ng data. Ang parehong KPI ay nagbibigay ng iba't ibang mga resulta kapag ang kahulugan ng mga patlang ay nananatili sa isip.
- Blindly pagtitiwala sa rekomendasyon ng AI ng mga uri ng data at mga hadlang. Ang modelo ay maaaring magmungkahi ng isang "sapat na malaking" lugar; Tinutukoy ng panuntunan ng negosyo ang mga aktwal na limitasyon (hal. TR ID 11 digit).
- Absolutizing normalization. Ang sobrang normalisasyon sa layer ng pag-uulat ay nagpapabagal sa query; Ang layunin ay nag-iiba depende sa konteksto.
Babala: Ang artificial intelligence ay maaaring gumawa ng mga modelong mukhang maganda ngunit lumalabag sa mga panuntunan sa negosyo. Para sa bawat relasyon na iminungkahi ng modelo, ang tanong na "ganito ba talaga?" Magtanong ng negosyo. Ang modelo ng data ay ang balangkas ng system; Ang bali sa balangkas ay napakahirap ayusin sa ibang pagkakataon.
Sa buod
Ang pagmomodelo ng data ay ang proseso ng pag-istruktura ng mga katotohanan ng negosyo sa mga entity, katangian at relasyon at nagpapatuloy sa mga antas ng konsepto, lohikal at pisikal. Tinitiyak ng mga pangunahing at dayuhang susi ang integridad ng referential; Binabawasan ng normalisasyon ang pag-uulit, ngunit lehitimo rin ang denormalisasyon depende sa layunin. Ang diksyunaryo ng data ay ang karaniwang wika ng organisasyon. Nagbibigay ang AI ng makabuluhang bilis sa paggawa ng mga draft ng ER, mga diksyunaryo ng data, at mga pagsusuri sa normalisasyon; gayunpaman, ang mga uri ng relasyon, uri ng data, at semantika ng negosyo ay dapat kumpirmahin laban sa aktwal na panuntunan ng negosyo. Hindi ibig sabihin na ang modelo ay maganda ang hitsura nito.
Gawain ng aplikasyon
Isaalang-alang ang isang "sistema ng pautang sa aklatan": mga miyembro, aklat, mga talaan ng pautang. (1) Magkaroon ng draft ng lohikal na modelo na ginawa ng malakas na prompt. (2) Subukan ang uri ng bawat relasyon na iminumungkahi ng modelo (partikular, "maaari bang magkaroon ang isang miyembro ng higit sa isang kopya ng parehong libro?") na may isang tanong tungkol sa negosyo. (3) Maghanap ng hindi bababa sa isang many-to-many na relasyon at tukuyin ang isang intermediate table. (4) Sumulat ng mga linya ng diksyunaryo ng data para sa hindi bababa sa 4 na field (pangalan, uri, mandatory, kahulugan ng negosyo). (5) I-highlight ang isang hadlang na maaaring nilagyan ng modelo at ipaliwanag kung paano mo ito ibe-verify.
checklist
- [ ] Ang pangunahing susi ng bawat talahanayan ay tinukoy.
- [ ] Na-verify ko ang uri ng bawat relasyon sa tanong ng negosyo.
- [ ] Tinukoy ko ang isang intermediate table para sa marami-sa-maraming relasyon.
- [ ] Na-normalize o nabigyang-katwiran ko ang denormalization ng duplicate na data.
- [ ] Sumulat ako ng linya ng diksyunaryo ng data para sa mga kritikal na field.
- [ ] Kinumpirma ko ang uri ng data ng AI/mga mungkahi sa pagpilit laban sa panuntunan ng negosyo.