యూనిట్లు
1. ML ఇంజనీరింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్ర, సరిహద్దులు, ధ్రువీకరణ మరియు బాధ్యత 2. డేటా పైప్‌లైన్: సేకరణ, శుభ్రపరచడం, ట్యాగింగ్ మరియు సంస్కరణ 3. మోడల్ శిక్షణ మరియు మూల్యాంకనం: ఖచ్చితమైన కొలమానాలు, నిజాయితీ బెంచ్‌మార్కింగ్ 4. LLM అప్లికేషన్: RAGతో మీ స్వంత డేటా ఆధారంగా సమాధానాలు 5. LLM అప్లికేషన్: ఏజెంట్లు, టూలింగ్ మరియు సురక్షిత ఆటోమేషన్ 6. ఫైన్-ట్యూనింగ్ బేసిస్: ఎప్పుడు, ఎలా మరియు ఏ ప్రమాదంతో 7. MLOps మరియు విస్తరణ: మోడల్‌ను ల్యాబ్ నుండి ఉత్పత్తికి తరలించడం 8. ఈవల్ మరియు మానిటరింగ్: ఉత్పత్తిలో మోడల్ నిజంగా ఏమి చేస్తుందో తెలుసుకోవడం 9. భద్రత మరియు గోప్యత: డిఫెండింగ్ AI సిస్టమ్స్ 10. బయాస్, ఎథిక్స్ అండ్ కాస్ట్: రెస్పాన్సిబుల్ అండ్ సస్టైనబుల్ AI ఇంజనీరింగ్ 11. పునరుత్పత్తి మరియు ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ప్రతిదీ కలపడం
యూనిట్ 11 / 11

పునరుత్పత్తి మరియు ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ప్రతిదీ కలపడం

లాభాలు:

  • నాలుగు స్తంభాలతో పునరుత్పత్తిని నిర్ధారించే సామర్థ్యం (సీడ్ ఫిక్సేషన్, డేటా వెర్షన్, మీడియా ఫ్రీజింగ్, ఎక్స్‌పెరిమెంట్ మానిటరింగ్) మరియు అదే పరుగును పునరావృతం చేసినప్పుడు అదే ఫలితాన్ని ఉత్పత్తి చేస్తుంది
  • మాడ్యూల్ యొక్క అన్ని స్టాప్‌లను (కొలమానాలు, డేటా, మోడల్, LLM భాగాలు, ఎవాల్, ఫెయిర్‌నెస్, సెక్యూరిటీ, డిస్ట్రిబ్యూషన్, మానిటరింగ్) ఎండ్-టు-ఎండ్ చైన్‌లో కలపగల సామర్థ్యం
  • ప్రతి స్టాప్‌లో కీలకమైన నిర్ణయం మానవుని వద్దనే ఉందని ధృవీకరించగల సామర్థ్యం మరియు ప్రాజెక్ట్‌ను ఆడిట్ పద్ధతిలో డాక్యుమెంట్ చేయడం

ML ప్రాజెక్ట్ యొక్క అత్యంత కృత్రిమ వైఫల్యం క్రాష్ కాదు; "మళ్ళీ అదే ఫలితాన్ని పొందడం లేదు." మీరు మూడు నెలల క్రితం ఉత్పత్తిలో ఉంచిన మోడల్ యొక్క స్కోర్‌ను ఈ రోజు పునరుత్పత్తి చేయలేకపోతే, మీరు నిజంగా ఆ మోడల్‌ని నియంత్రించలేరు. ఈ ముగింపు యూనిట్‌లో, మేము పునరుత్పత్తి సామర్థ్యాన్ని మరింత లోతుగా చేస్తాము: అదే ఇన్‌పుట్‌లతో అదే ఫలితాన్ని విశ్వసనీయంగా పొందగల సామర్థ్యం మరియు మొత్తం మాడ్యూల్‌ను ఎండ్-టు-ఎండ్ ప్రాజెక్ట్ క్రమశిక్షణలో కలపడం.

పునరుత్పత్తి ఎందుకు కష్టం

సాధారణ సాఫ్ట్‌వేర్‌లో, అదే కోడ్ అదే అవుట్‌పుట్‌ను ఇస్తుంది. MLలో ఫలితాన్ని నిర్ణయించే అనేక వేరియబుల్స్ ఉన్నాయి:

  • యాదృచ్ఛికత: డేటా షఫులింగ్, బరువు ప్రారంభించడం, డేటా విభజన — అన్నీ యాదృచ్ఛికతపై ఆధారపడతాయి.
  • డేటా: ఒకే కోడ్ విభిన్న డేటా వెర్షన్‌తో విభిన్న మోడల్‌ను ఉత్పత్తి చేస్తుంది.
  • పర్యావరణం: లైబ్రరీ సంస్కరణలు, హార్డ్‌వేర్ (CPU/GPU), ఆపరేటింగ్ సిస్టమ్ కూడా ఫలితాన్ని మార్చగలదు.
  • దాచిన సందర్భం: సేవ్ చేయని హైపర్‌పారామీటర్, మాన్యువల్ ప్రిప్రాసెసింగ్ స్టెప్, గుర్తించబడని ఎంపిక.

పునరుత్పత్తి అనేది "ఉండటం ఆనందంగా ఉంది" కానీ శాస్త్రీయ మరియు ఇంజనీరింగ్ అత్యవసరం. పునరుత్పత్తి చేయలేని ఫలితం నిరూపించబడని దావా.

పునరుత్పత్తికి నాలుగు స్తంభాలు

1. యాదృచ్ఛికతను పరిష్కరించండి. అన్ని యాదృచ్ఛిక విత్తనాలను ఒకే చోట సెట్ చేయండి: డేటా విభజన, మోడల్ ప్రారంభించడం, డేటా షఫులింగ్. స్థిర విత్తనం "మీరు అదే పరుగును పునరావృతం చేసినప్పుడు అదే ఫలితం" హామీకి ఆధారం.

2. డేటాను వెర్షన్ చేయండి. ప్రతి ప్రయోగం ఏ డేటా వెర్షన్‌తో నిర్వహించబడిందో రికార్డ్ చేయండి (యూనిట్ 2లో డేటా వెర్షన్). "తాజా డేటా" అస్పష్టంగా ఉంది; "డేటా వెర్షన్ v3, హాష్ abc123" ఖచ్చితమైనది.

3. మాధ్యమాన్ని స్తంభింపజేయండి. అన్ని డిపెండెన్సీలను వాటి ఖచ్చితమైన సంస్కరణలకు పిన్ చేయండి (ఉదా. numpy==1.26.4 వంటి ఖచ్చితమైన వెర్షన్‌లు requirements.txt లేదా కంటైనర్ ఇమేజ్). "తాజా వెర్షన్" ఒక రోజు ప్రతిదీ విచ్ఛిన్నం చేస్తుంది.

4. ప్రతిదీ ట్రాక్ చేయండి (ప్రయోగం ట్రాకింగ్). ప్రతి ప్రయోగం కోసం స్వయంచాలకంగా సేవ్ చేయండి: కోడ్ వెర్షన్ (git కమిట్), డేటా వెర్షన్, అన్ని హైపర్‌పారామీటర్‌లు, మెట్రిక్‌లు మరియు అవుట్‌పుట్ నిర్మాణాలు. MLflow, Weights & Biases వంటి ప్రయోగాత్మక ట్రాకింగ్ సాధనాలు దీన్ని క్రమపద్ధతిలో చేస్తాయి. నమోదు లేకుండా, "ఏ సెట్టింగ్ ఉత్తమమైనది" అనే ప్రశ్నకు సమాధానం లేదు.

జాగ్రత్త: "నేను తరువాత గుర్తుంచుకుంటాను" అనేది అత్యంత ఖరీదైన తప్పు. రెండు వారాల తర్వాత మీరు ఏ సీడ్, ఏ డేటా, ఏ హైపర్‌పారామీటర్ ఉపయోగించారో మీకు గుర్తుండదు. ఆటోమేటిక్ ట్రాకింగ్ మెమరీపై ఆధారపడటాన్ని తొలగిస్తుంది.

బలహీనమైన విధానం / బలమైన విధానం

బలహీనమైనది: "నేను ఉత్తమ మోడల్‌ను కనుగొన్నాను, ఇది నోట్‌బుక్‌లో ఉంది, దాని స్కోర్ 89% అని నేను భావిస్తున్నాను."

బలమైనది: "ప్రయోగం ట్రాకింగ్ సాధనంలో #147ని అమలు చేయండి: git commit a3f9c, డేటా వెర్షన్ v3 (hash abc123), సీడ్ 42, అన్ని హైపర్‌పారామీటర్‌లు నమోదు చేయబడ్డాయి, PR-AUC 0.887ని పరీక్షించండి. నేను అదే కమాండ్‌ని మళ్లీ అమలు చేసినప్పుడు, నేను బిట్‌బైట్‌గా అదే ఫలితాన్ని పొందుతాను. మోడల్ రెజిస్ట్రీలో ఈ రన్‌పై ఆధారపడి ఉంటుంది."

వ్యత్యాసం: బలమైన విధానంలో ఫలితం మెమరీపై ఆధారపడి ఉండదు, కానీ స్థిరమైన మరియు పర్యవేక్షించబడే గొలుసుపై ఆధారపడి ఉంటుంది. ప్రతి ఒక్కరూ ప్రతిసారీ ఒకే ఫలితాన్ని ఇవ్వగలరు.

ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: మాడ్యూల్ కలయిక

ఇప్పుడు మొత్తం మాడ్యూల్‌ను ఒకే ప్రాజెక్ట్ ఫ్లోగా మిళితం చేద్దాం. నిజమైన ML సిస్టమ్ ఈ స్టాప్‌ల గుండా వెళుతుంది మరియు ప్రతి స్టాప్ మునుపటిదానిపై ఆధారపడి ఉంటుంది:

  1. సమస్య నిర్వచనం: మేము ఏమి పరిష్కరిస్తున్నాము, విజయాన్ని ఎలా కొలవాలి (యూనిట్ 3: సరైన మెట్రిక్, వ్యాపార సందర్భం). మెట్రిక్ మరియు థ్రెషోల్డ్ ప్రారంభం నుండి స్పష్టంగా ఉన్నాయి.
  2. డేటా పైప్‌లైన్: సేకరణ, ధ్రువీకరణ, శుభ్రపరచడం, లీక్-రహిత విభజన, సంస్కరణ (యూనిట్ 2).
  3. మోడల్ అభివృద్ధి: శిక్షణ, బేస్‌లైన్ పోలిక, క్రాస్ ధ్రువీకరణ, హార్డ్ సీడ్ (యూనిట్ 3 + ఈ యూనిట్).
  4. LLM భాగాలు (వర్తిస్తే): RAG (యూనిట్ 4) మరియు/లేదా ఏజెంట్లు (యూనిట్ 5); అవసరమైతే ఫైన్-ట్యూనింగ్ (యూనిట్ 6).
  5. మూల్యాంకనం: ఎడ్జ్ మరియు సెక్యూరిటీ కేసులతో కూడిన ఎవాల్ క్లస్టర్, LLM సిస్టమ్‌లలో బహుళ-లేయర్ ఎవాల్ (యూనిట్ 8).
  6. న్యాయం మరియు నీతి ఆడిట్: ఉప సమూహ విశ్లేషణ, మోడల్ కార్డ్, వివరణాత్మకత (యూనిట్ 10).
  7. సెక్యూరిటీ ఆడిట్: ప్రాంప్ట్ ఇంజెక్షన్, గోప్యత, సరఫరా గొలుసు (యూనిట్ 9).
  8. పంపిణీ: ప్యాకేజింగ్, క్రమంగా పంపిణీ, రోల్‌బ్యాక్, మోడల్ రిజిస్ట్రీ (యూనిట్ 7).
  9. పర్యవేక్షణ: మూడు-పొర పర్యవేక్షణ, డ్రిఫ్ట్ అలారాలు (యూనిట్ 8).
  10. పునరుత్పత్తి: మొత్తం గొలుసు (ఈ యూనిట్) అంతటా సీడ్, డేటా వెర్షన్, మీడియా మరియు ప్రయోగం ట్రాకింగ్.

ఈ ప్రవాహంలో, AI అనేది ప్రతి స్టాప్ వద్ద యాక్సిలరేటర్ మరియు బ్లూప్రింట్ జనరేటర్; కానీ మెట్రిక్ ఎంపిక, డేటా నిర్ణయాలు, సరసమైన ప్రాధాన్యత, విస్తరణ థ్రెషోల్డ్ మరియు విడుదల ఆమోదం - క్లిష్టమైన నిర్ణయాలు మానవునితో ఉంటాయి. ఇది మాడ్యూల్ యొక్క సారాంశం.

డాక్యుమెంటేషన్: భవిష్యత్తు మీకు కృతజ్ఞతలు తెలుపుతుంది

ఒక మంచి ML ప్రాజెక్ట్ పత్రాలు. కనీసం, కింది వాటిని వ్రాయాలి: సమస్య మరియు విజయ ప్రమాణాలు, డేటా మూలం మరియు సంస్కరణ, మోడల్ ఎంపికలు మరియు సమర్థనలు, మూల్యాంకన ఫలితాలు (ఉప సమూహాలతో సహా), తెలిసిన పరిమితులు మరియు నష్టాలు, విస్తరణ మరియు తిరిగి పొందే విధానం, పర్యవేక్షణ ప్రణాళిక. ఈ పత్రం ఆరు నెలల తర్వాత ప్రాజెక్ట్‌కి తిరిగి వచ్చే వ్యక్తికి (బహుశా అది మీరే కావచ్చు) బెస్ట్ ఫ్రెండ్.

మూడు చిన్న కేసులు

కేసు 1 - కోల్పోయిన ఫలితం. ఒక ఇంజనీర్ గొప్ప మోడల్‌కు శిక్షణ ఇచ్చాడు, కానీ అతను సీడ్‌ను సరిచేయలేదు మరియు డేటా వెర్షన్‌ను సేవ్ చేయలేదు. అతను ఉద్యోగాన్ని విడిచిపెట్టినప్పుడు, ఆ ఫలితాన్ని ఎవరూ పునరుత్పత్తి చేయలేరు; మోడల్ "బ్లాక్ బాక్స్ లెజెండ్"గా మారింది మరియు చివరికి మొదటి నుండి నిర్మించబడింది. వారాలు వృథా అయ్యాయి. పాఠం: పునరుత్పత్తి కాని ఫలితం ఉనికిలో లేని ఫలితం.

కేసు 2 - పర్యావరణ పతనం. ఒక బృందం డిపెండెన్సీలను పరిష్కరించలేదు. లైబ్రరీ స్వయంచాలకంగా నవీకరించబడినప్పుడు, మోడల్ అవుట్‌పుట్‌లు నిశ్శబ్దంగా మారతాయి మరియు ఉత్పత్తికి అంతరాయం ఏర్పడుతుంది. సమస్యను కనుగొనడానికి చాలా రోజులు పట్టింది. డిపెండెన్సీలు స్తంభింపజేయబడినప్పుడు మరియు ఖచ్చితమైన సంస్కరణలతో కంటెయినరైజ్ చేయబడినప్పుడు, సమస్య మళ్లీ సంభవించలేదు. పాఠం: పర్యావరణాన్ని స్తంభింపజేయండి.

కేసు 3 - పర్యవేక్షణ యొక్క శక్తి. ప్రతి ప్రయోగాన్ని ఒక బృందం స్వయంచాలకంగా పర్యవేక్షిస్తుంది. మూడు నెలల తరువాత, రెగ్యులేటరీ ఆడిట్ సమయంలో, వారు "ఏ డేటాతో, ఏ సెట్టింగ్‌లతో, ఏ సమూహాలలో ఏ పనితీరును పొందారు?" అనే ప్రశ్నకు సమాధానమిచ్చారు. నిమిషాల్లో పూర్తి రికార్డింగ్‌తో. తనిఖీ సజావుగా సాగింది. పాఠం: పర్యవేక్షణ అనేది ఒక సమ్మతి సాధనం, కేవలం ఇంజనీరింగ్ మాత్రమే కాదు.

కాపీ చేయగల టెంప్లేట్లు

ఈ ML ప్రాజెక్ట్ కోసం పునరుత్పత్తిని తనిఖీ చేయండి.- అన్ని యాదృచ్ఛిక విత్తనాలు స్థిరంగా ఉన్నాయా (విభజన, ప్రారంభించడం, షఫుల్ చేయడం)?- డేటా వెర్షన్ చేయబడిందా?- డిపెండెన్సీలు ఖచ్చితమైన సంస్కరణలకు స్తంభింపజేయబడ్డాయా?- ప్రతి ప్రయోగం (కోడ్ కమిట్, డేటా, హైపర్‌పారామీటర్, మెట్రిక్) ట్రాక్ చేయబడుతుందా? తప్పిపోయిన ప్రతి నిలువు వరుస కోసం దాన్ని ఎలా పరిష్కరించాలో నిర్దిష్ట దశలను వ్రాయండి. ప్రాజెక్ట్ నిర్మాణం: [వివరణ]

ఈ ఎండ్-టు-ఎండ్ ML ప్రాజెక్ట్ కోసం ప్లాన్ స్కెలిటన్‌ను రూపొందించండి. సమస్య: [వివరణ] కింది స్టాప్‌లను కవర్ చేయండి మరియు ప్రతి స్టాప్‌లో మానవ నిర్ణయం ఎక్కడ ఉందో గుర్తించండి: సమస్య/మెట్రిక్, పైప్‌లైన్, మోడల్, (RAG/ఏజెంట్/ఫైన్-ట్యూన్?), ఎవాల్, ఫెయిర్‌నెస్, సెక్యూరిటీ, డిస్ట్రిబ్యూషన్, మానిటరింగ్, పునరుత్పత్తి. ప్రతి స్టాప్ కోసం ప్రధాన ప్రమాదం మరియు ధృవీకరణ దశను వ్రాయండి.

ఈ ప్రాజెక్ట్ కోసం సాంకేతిక డాక్యుమెంటేషన్ టెంప్లేట్‌ను రూపొందించండి. విభాగాలు: సమస్య+విజయ ప్రమాణాలు, డేటా (మూలం+వెర్షన్), మోడల్ ఎంపికలు+జస్టిఫికేషన్, మూల్యాంకనం (ఉప సమూహాలతో సహా), తెలిసిన పరిమితులు+రిస్క్‌లు, విస్తరణ+రోల్‌బ్యాక్, మానిటరింగ్ ప్లాన్. ప్రతి విభాగానికి పూరించాల్సిన ఫీల్డ్‌లను ప్రశ్నలుగా ఇవ్వండి.

నా ప్రయోగ పర్యవేక్షణ సెటప్‌ని తనిఖీ చేయండి: ప్రతి రన్‌లో ఇది స్వయంచాలకంగా సేవ్ చేయబడిందా: git కమిట్, డేటా వెర్షన్/హాష్, అన్ని హైపర్‌పారామీటర్‌లు, అన్ని మెట్రిక్‌లు, పర్యావరణం (లైబ్రరీ వెర్షన్‌లు)? నేను అదే పరుగును మళ్లీ అమలు చేసినప్పుడు అదే ఫలితం పొందగలనా? సెటప్: [వివరణ]. లోపాలు మరియు దిద్దుబాటును జాబితా చేయండి.

పునరుత్పత్తి నిలువు పట్టిక

కాలమ్

ఏది స్థిరంగా ఉంది

వాహన ఉదాహరణ

యాదృచ్ఛికత

అన్ని విత్తనాలు

సీడ్ సెట్టింగ్

డేటా

డేటా వెర్షన్/హాష్

DVC

పర్యావరణం

లైబ్రరీ సంస్కరణలు

అవసరాలు పిన్, డాకర్

మానిటరింగ్

కోడ్+డేటా+సెట్టింగ్+మెట్రిక్

MLflow, W&B

సాధారణ తప్పులు

  • విత్తనాన్ని సరిచేయడం లేదు. ఫలితం పునరావృతం కాదు.
  • డేటా సంస్కరణను సేవ్ చేయడం లేదు. "ఏ డేటాతో?" సమాధానం లేకుండానే ఉంది.
  • వ్యసనాలను స్తంభింపజేయడం కాదు. నవీకరణ నిశ్శబ్దంగా ప్రతిదీ విచ్ఛిన్నం చేస్తుంది.
  • ప్రయోగాలను జ్ఞాపకశక్తికి వదిలివేయడం. రెండు వారాల తర్వాత ఏమీ గుర్తులేదు.
  • కృత్రిమ మేధస్సుకు క్లిష్టమైన నిర్ణయాలను వదిలివేయడం. కొలమానాలు, న్యాయం మరియు పంపిణీ నిర్ణయాలు ప్రజల వద్ద ఉండాలి.
  • డాక్యుమెంటేషన్‌ను వాయిదా వేస్తోంది. భవిష్యత్తు బృందం (మరియు మీరు) ధర చెల్లిస్తారు.

సారాంశంలో

పునరుత్పత్తి అనేది తీవ్రమైన ML ఇంజనీరింగ్ యొక్క సంతకం: పునరుత్పత్తి చేయలేని ఫలితం నిరూపించలేని దావా. ఇది నాలుగు నిలువు వరుసలతో వస్తుంది - యాదృచ్ఛికతను పరిష్కరించండి, సంస్కరణ డేటా, ఫ్రీజ్ ఎన్విరాన్మెంట్, ప్రతి ప్రయోగాన్ని ట్రాక్ చేయండి. ఎండ్-టు-ఎండ్ ప్రాజెక్ట్ ఈ మాడ్యూల్ యొక్క అన్ని స్టాప్‌లను (మెట్రిక్, డేటా, మోడల్, LLM భాగాలు, ఎవాల్, ఫెయిర్‌నెస్, సెక్యూరిటీ, డిస్ట్రిబ్యూషన్, మానిటరింగ్) ఇంటర్‌కనెక్టడ్ చైన్‌లో మిళితం చేస్తుంది; ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ ప్రతి స్టాప్‌లో యాక్సిలరేటర్, కానీ క్లిష్టమైన నిర్ణయాలు మానవుని వద్ద ఉంటాయి. భవిష్యత్ బృందం మరియు ఆడిట్‌ల కోసం ప్రతిదీ డాక్యుమెంట్ చేయండి. ఈ క్రమశిక్షణ అనేది మీరు మాడ్యూల్ అంతటా నేర్చుకునే ప్రతిదానిని కొనసాగించే ఫ్రేమ్‌వర్క్.

అప్లికేషన్ టాస్క్

నాలుగు పునరుత్పత్తి స్తంభాలకు వ్యతిరేకంగా ML ప్రాజెక్ట్‌ను తనిఖీ చేయండి: విత్తనాలు మారకుండా ఉన్నాయా, డేటా వెర్షన్‌లో ఉందా, పర్యావరణం స్తంభింపబడిందా, ప్రయోగాలు ట్రాక్ చేయబడిందా? ఏవైనా తప్పిపోయిన నిలువు వరుసలను పరిష్కరించండి మరియు మీరు ఒకే రన్‌ను రెండుసార్లు అమలు చేయగలరని నిరూపించండి మరియు అదే ఫలితాన్ని పొందండి. ఆపై ఒక పేజీలో ప్రాజెక్ట్ యొక్క ఎండ్-టు-ఎండ్ ఫ్లో (10 స్టాప్‌లు) అవుట్‌పుట్ చేయండి మరియు ప్రతి స్టాప్‌లో "మానవ నిర్ణయం ఎక్కడ ఉంది" అని గుర్తు పెట్టండి. చివరగా, ఒక చిన్న సాంకేతిక డాక్యుమెంటేషన్ డ్రాఫ్ట్ వ్రాయండి.

చెక్లిస్ట్

  • [ ] అన్ని యాదృచ్ఛిక విత్తనాలు పరిష్కరించబడ్డాయి.
  • [ ] ప్రతి ప్రయోగంతో డేటా వెర్షన్/హాష్ రికార్డ్ చేయబడుతుంది.
  • [ ] డిపెండెన్సీలు ఫర్మ్ వెర్షన్‌లకు స్తంభింపజేయబడతాయి (పిన్/కంటైనర్).
  • [ ] ప్రతి ప్రయోగం స్వయంచాలకంగా పర్యవేక్షించబడుతుంది (కోడ్+డేటా+సెట్టింగ్+మెట్రిక్).
  • [ ] నేను అదే పరుగును పునరావృతం చేసినప్పుడు, నేను అదే ఫలితాన్ని పొందుతాను.
  • [ ] ఎండ్-టు-ఎండ్ ఫ్లోలో కీలకమైన నిర్ణయాలు మనుషులు తీసుకుంటారని నేను ధృవీకరించాను మరియు డాక్యుమెంట్ చేసాను.

మాడ్యూల్ పరీక్ష

1. ML ఇంజనీర్‌గా, వర్క్‌ఫ్లో కృత్రిమ మేధస్సును ఉంచేటప్పుడు ఉత్తమమైన విధానం ఏమిటి?

  • ఎ) AI అనేది తక్కువ-రిస్క్ వ్యాపారాలలో యాక్సిలరేటర్; కొలమానాలు, డేటా మరియు ఉత్పత్తి వంటి క్లిష్టమైన నిర్ణయాలు ధృవీకరించబడతాయి మరియు మానవునికి వదిలివేయబడతాయి ✔
  • బి) AI అవుట్‌పుట్‌లు బాగున్నంత వరకు, ధృవీకరణ అవసరం లేదు
  • సి) మోడల్‌ను ఉత్పత్తిలో పెట్టాలనే నిర్ణయాన్ని కృత్రిమ మేధస్సుకు వదిలివేయడం వల్ల సమయం ఆదా అవుతుంది.
  • డి) ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ టెక్స్ట్ రాయడానికి మాత్రమే ఉపయోగపడుతుంది, దీనికి డేటా మరియు మోడల్ వర్క్‌తో సంబంధం లేదు

వివరణ: AI అనేది కోడ్, డేటా డైజెస్ట్‌లు మరియు పత్రాలు వంటి తక్కువ-రిస్క్, సులభంగా ధృవీకరించబడిన పనుల కోసం శక్తివంతమైన యాక్సిలరేటర్; ఏది ఏమైనప్పటికీ, డబ్బు, గోప్యత మరియు చట్టపరమైన బాధ్యతలను ప్రభావితం చేసే నిర్ణయాల బాధ్యత, మెట్రిక్ ఎంపిక, శిక్షణకు సంబంధించిన డేటా మరియు మోడల్‌ను ఉత్పత్తిలో ఉంచడం వంటివి అర్హత కలిగిన ఇంజనీర్ మరియు బృందంపై ఉంటాయి. ప్రతి అవుట్‌పుట్ ధృవీకరణ లేకుండా ఉపయోగించరాదు.

2. డేటా పైప్‌లైన్ ప్రారంభంలో స్కీమా ధ్రువీకరణ ఎందుకు ఉంచబడుతుంది?

  • ఎ) ఎందుకంటే ఇది నేరుగా మోడల్ యొక్క ఖచ్చితత్వాన్ని పెంచుతుంది
  • బి) ఎందుకంటే ఇది డేటా సంస్కరణను అనవసరం చేస్తుంది
  • సి) ఎందుకంటే ఇది పాడైన డేటాను ప్రారంభ మరియు చౌకైన పాయింట్‌లో పట్టుకుంటుంది మరియు తదుపరి దశల్లోకి లీక్ కాకుండా నిరోధిస్తుంది ✔
  • D) ఎందుకంటే ఇది లేబులింగ్ అవసరాన్ని తొలగిస్తుంది

వివరణ: ఇంతకుముందు అవినీతి డేటా పట్టుబడితే, దాన్ని సరిదిద్దడం చౌకగా ఉంటుంది. స్కీమా ధ్రువీకరణ పంక్తి ప్రారంభంలో ఊహించిన రకం మరియు పరిధికి వెలుపల డేటాను తిరస్కరించడం ద్వారా శిక్షణ లేదా ఉత్పత్తికి నిశ్శబ్దంగా లీక్ కాకుండా అవినీతి డేటాను నిరోధిస్తుంది (ఉదా. యూనిట్ మార్పుతో ధర 100x మారడం); ఉత్పత్తిలో పట్టుకున్న అదే లోపం చాలా రెట్లు ఎక్కువ ఖరీదైనది.

3. సమయం (సమయ శ్రేణి)తో కూడిన సమస్యలో డేటాను శిక్షణ మరియు పరీక్షగా విభజించేటప్పుడు సరైన విధానం ఏమిటి?

  • ఎ) యాదృచ్ఛిక విభజనను ఉపయోగించడం ఎందుకంటే ఇది ఎల్లప్పుడూ సరసమైన పద్ధతి
  • బి) తాత్కాలిక విభజనను ఉపయోగించడం: గతంతో శిక్షణ ఇవ్వడం మరియు భవిష్యత్తులో పరీక్షించడం ద్వారా లీకేజీని నిరోధించండి ✔
  • సి) శిక్షణ మరియు పరీక్ష రెండూగా మొత్తం డేటాను ఉపయోగించడం
  • D) శిక్షణకు ముందు స్కేలింగ్ పారామితులలో పరీక్ష డేటాను చేర్చడం

వివరణ: సమయ శ్రేణిలో యాదృచ్ఛిక విభజన మోడల్‌కు 'భవిష్యత్తును చూసే' ప్రయోజనాన్ని ఇస్తుంది, అది ఉత్పత్తిలో ఎప్పుడూ జరగదు మరియు కృత్రిమంగా కొలమానాలను (తాత్కాలిక లీకేజీ) పెంచుతుంది. సరైనది తాత్కాలిక విభజన: గతంతో శిక్షణ, భవిష్యత్తులో పరీక్షించండి. ఇది ఉత్పత్తిలో ఉంచే వాస్తవ పనితీరును కొలుస్తుంది.

4. 1.5% సానుకూల తరగతి రేటుతో మోసం గుర్తింపు మోడల్‌లో ఖచ్చితత్వం ఎందుకు తప్పుదారి పట్టిస్తోంది?

  • ఎ) ఎందుకంటే అసమతుల్య డేటాపై ఖచ్చితత్వం ఎల్లప్పుడూ తక్కువగా ఉంటుంది
  • బి) ఎందుకంటే రిగ్రెషన్ సమస్యలపై మాత్రమే ఖచ్చితత్వం ఉపయోగించబడుతుంది
  • సి) ఎందుకంటే ఖచ్చితత్వ గణనకు చాలా ప్రాసెసింగ్ శక్తి అవసరం
  • D) మెజారిటీ తరగతిని అంచనా వేసే ఒక చిన్న మోడల్ కూడా చాలా ఖచ్చితమైనదిగా ఉంటుంది, తద్వారా నిజమైన విజయాన్ని దాచిపెడుతుంది ✔

వివరణ: అసమతుల్య డేటాపై, 'ప్రతిదీ ప్రతికూలంగా కాల్ చేయండి' అని చెప్పే ప్రాథమిక మోడల్ కూడా దాదాపు 98.5% ఖచ్చితత్వాన్ని పొందుతుంది, కానీ ఒక్క మోసాన్ని కూడా పట్టుకోదు. అందువల్ల, అసమతుల్య వర్గీకరణలో, ఖచ్చితత్వానికి బదులుగా ఖచ్చితత్వం, రీకాల్, F1 లేదా PR-AUC ఉపయోగించబడతాయి మరియు ప్రతి మెట్రిక్ బేస్ మోడల్ ప్రకారం వివరించబడుతుంది.

5. మోడల్ మెట్రిక్ గురించి మాట్లాడేటప్పుడు బేస్‌లైన్ పోలిక ఎందుకు అవసరం?

  • ఎ) ఎందుకంటే బేస్ మోడల్ ఎల్లప్పుడూ నిజమైన మోడల్ కంటే మెరుగ్గా ఉంటుంది
  • బి) ఎందుకంటే సాధారణ బేస్‌లైన్ మోడల్‌తో పోల్చినప్పుడు మాత్రమే మెట్రిక్ అర్థవంతంగా ఉందా లేదా అనేది స్పష్టంగా ఉంటుంది ✔
  • సి) ఎందుకంటే బేస్ మోడల్ క్రాస్ ధ్రువీకరణను అనవసరంగా చేస్తుంది
  • D) ఎందుకంటే ప్రతి నివేదికలో ప్రాథమిక నమూనా చట్టబద్ధంగా అవసరం

వివరణ: మెట్రిక్ స్వతహాగా మంచిది లేదా చెడు కాదు; ప్రాథమిక నమూనా ప్రకారం ఇది మంచి లేదా చెడు. '85% సరైనది' అనే వాక్యం అంటే బేస్ మోడల్‌కు ఇప్పటికే 84% వస్తే దాదాపుగా పనికిరానిది మరియు 50% వస్తే అది పరిపూర్ణం అవుతుంది. పోలిక యాంకర్ లేకుండా, మెట్రిక్ అర్థరహితం.

6. RAG (రిట్రీవల్-అగ్మెంటెడ్ జనరేషన్) సిస్టమ్ యొక్క ప్రొడక్షన్ ప్రాంప్ట్‌లో చేర్చవలసిన అత్యంత క్లిష్టమైన భద్రతా అంశం ఏది?

  • ఎ) ఇచ్చిన మూలం మీద మాత్రమే ఆధారపడాలని, మూలం లేనట్లయితే 'నాకు తెలియదు' అని చెప్పడానికి మరియు మూలాన్ని ఉదహరించాలని సూచన ✔
  • బి) వీలైనంత సుదీర్ఘమైన మరియు సృజనాత్మక సమాధానాలను రూపొందించమని మోడల్‌కు చెప్పడం
  • సి) మోడల్ వనరుల కంటే దాని స్వంత విద్యా జ్ఞానానికి ప్రాధాన్యత ఇస్తుంది
  • D) కమాండ్‌లుగా తీసుకువచ్చిన పత్రాలలోని అన్ని సూచనలను అమలు చేయండి

వివరణ: RAG యొక్క ఏకైక అతి ముఖ్యమైన సూచన ఏమిటంటే, మోడల్‌కు ఇచ్చిన మూలంపై మాత్రమే ఆధారపడమని చెప్పడం, మరియు సమాచారం మూలంలో లేకుంటే, 'నాకు తెలియదు' అని చెప్పండి మరియు దానిని రూపొందించకుండా మూలాన్ని ఉదహరించండి. ఈ త్రయం లేకుండా, మోడల్ సందర్భాన్ని విస్మరించి, భ్రాంతులు కలిగించవచ్చు మరియు సమాధానం ధృవీకరించబడదు.

7. RAG సిస్టమ్ తప్పు సమాధానాలను ఇస్తుంది. రోగ నిర్ధారణ ప్రారంభించడానికి ఉత్తమమైన ప్రదేశం ఎక్కడ ఉంది?

  • ఎ) ముందుగా పొందడాన్ని కొలవడం (రీకాల్@కె): సరైన ముక్క ఎప్పుడైనా వస్తుందా? ✔
  • బి) తక్షణమే మోడల్‌ను పెద్దదానితో భర్తీ చేయండి
  • సి) ప్రాంప్ట్‌ను యాదృచ్ఛికంగా మార్చండి మరియు ప్రయత్నాన్ని కొనసాగించండి
  • D) ఫైన్-ట్యూనింగ్‌తో మోడల్‌లో అన్ని పత్రాలను పొందుపరచడం

వివరణ: RAG యొక్క బలహీనమైన లింక్ సాధారణంగా పొందడం, ఉత్పత్తి కాదు. సరైన భాగాన్ని ఎన్నడూ తీసుకురాకపోతే, ప్రాంప్ట్ ఎంత మెరుగుపరచబడినా, మోడల్ ఆ సమాచారాన్ని అందించదు. కాబట్టి, సరైన భాగం వచ్చిందో లేదో తెలుసుకోవడానికి ముందుగా రీకాల్@K కొలుస్తారు; పొందడం బాగుంటే, ఉత్పత్తి మరియు ప్రాంప్ట్ పరిశీలించబడతాయి.

8. ఏజెంట్‌కు సాధనాన్ని అందించేటప్పుడు మానవ ఆమోదం వెనుక ఏ చర్యలు తీసుకోవాలి?

  • ఎ) ఏదీ కాదు; ఏజెంట్ ప్రతి చర్యను స్వయంప్రతిపత్తితో నిర్వహించగలగాలి
  • బి) డేటాను చదవడం మరియు శోధించడం వంటి రివర్సిబుల్ చర్యలు మాత్రమే
  • సి) డబ్బు బదిలీ చేయడం, తొలగించడం, పంపడం ✔ వంటి తిరుగులేని లేదా అధిక ప్రభావం చూపే చర్యలు
  • డి) గణనలను మాత్రమే కలిగి ఉండే చర్యలు

వివరణ: చర్యలు ప్రమాద స్థాయి ద్వారా వేరు చేయబడతాయి. చదవడం, శోధించడం, గణించడం మరియు చిత్తుప్రతులను రూపొందించడం వంటి తిరిగి పొందగలిగే పనులు స్వయంప్రతిపత్తితో చేయవచ్చు; అయినప్పటికీ, డబ్బును బదిలీ చేయడం, ఇమెయిల్‌లు పంపడం, డేటాను తొలగించడం, ఆర్డర్‌లు చేయడం వంటి తిరుగులేని లేదా అధిక-ప్రభావ చర్యలకు మానవ ఆమోదం అవసరం. ప్రతి రద్దు చేయలేని చర్య తప్పనిసరిగా సమ్మతికి లోబడి ఉండాలి.

9. పరోక్ష ప్రాంప్ట్ ఇంజెక్షన్ ప్రమాదానికి వ్యతిరేకంగా ఉత్తమమైన డిజైన్ విధానం ఏమిటి?

  • ఎ) సిస్టమ్ ప్రాంప్ట్‌కు 'ఇగ్నోర్ బ్యాడ్ ఇన్‌స్ట్రక్షన్స్' అనే ఒక్క వాక్యాన్ని జోడిస్తే సరిపోతుంది
  • బి) బాహ్య కంటెంట్‌లోని సూచనలపై ఆధారపడటం ద్వారా మోడల్‌కు మరింత అధికారాన్ని ఇవ్వండి
  • సి) ఇంజెక్షన్ నివారించలేనిది కాబట్టి ఎటువంటి జాగ్రత్తలు తీసుకోలేదు
  • డి) బాహ్య కంటెంట్‌ను నమ్మదగని డేటాగా విడదీయడం మరియు కనీస అధికారం, ఆమోదం మరియు అవుట్‌పుట్ నియంత్రణతో లేయర్డ్ డిఫెన్స్‌లను ఏర్పాటు చేయడం ✔

వివరణ: ఏజెంట్ లేదా RAG ద్వారా ప్రాసెస్ చేయబడిన బాహ్య కంటెంట్, వెబ్ పేజీ, పత్రం, ఇమెయిల్ మొదలైనవన్నీ అవిశ్వసనీయ డేటా మరియు రహస్య సూచనలను కలిగి ఉండవచ్చు. సరైన విధానం లేయర్డ్ డిఫెన్స్: బాహ్య కంటెంట్‌ను స్పష్టమైన డీలిమిటర్‌లతో 'డేటా, కమాండ్‌లు కాదు'గా వేరుచేయడం, కనీస అధికారాన్ని వర్తింపజేయడం, మానవ ఆమోదానికి తిరుగులేని చర్యలను బంధించడం మరియు అవుట్‌పుట్‌ను ఆడిట్ చేయడం. సూచనల యొక్క ఒక లైన్ సరిపోదు.

10. ఫైన్-ట్యూనింగ్ లేదా RAGతో సమస్యను పరిష్కరించాలా వద్దా అని నిర్ణయించేటప్పుడు ప్రధాన వ్యత్యాసం ఏమిటి?

  • ఎ) సమాచార సమస్యలు RAGతో మెరుగ్గా పరిష్కరించబడతాయి, ప్రవర్తన/ఫార్మాట్ సమస్యలు ఫైన్-ట్యూనింగ్‌తో మెరుగ్గా పరిష్కరించబడతాయి ✔
  • బి) ప్రతి సమస్య ఎల్లప్పుడూ చక్కటి ట్యూనింగ్ ద్వారా పరిష్కరించబడాలి
  • సి) RAG కోడ్ ఉత్పత్తికి మాత్రమే ఉపయోగించబడుతుంది, ఫైన్-ట్యూనింగ్ అనువాదం కోసం మాత్రమే ఉపయోగించబడుతుంది
  • D) ఫైన్-ట్యూనింగ్ ఎల్లప్పుడూ RAG కంటే చౌకగా మరియు వేగంగా నవీకరించబడుతుంది

వివరణ: మోడల్‌కు కొత్త సమాచారాన్ని బోధించడంలో ఫైన్-ట్యూనింగ్ బలహీనమైనది మరియు ప్రమాదకరం; కానీ ప్రవర్తన, ఆకృతి, టోన్ మరియు శైలిని బోధించడంలో శక్తివంతమైనది. 'మోడల్ కంపెనీకి మా డేటా తెలియదు' అనేది సమాచార సమస్య మరియు RAGకి చెందినది. 'మోడల్ ఎల్లప్పుడూ మా కఠినమైన ఆకృతిలో అవుట్‌పుట్ చేయనివ్వండి' అనేది ప్రవర్తనా సమస్య మరియు చక్కటి ట్యూనింగ్ కోసం అభ్యర్థి. అదనంగా, ఫైన్-ట్యూనింగ్ చేయడానికి ముందు ప్రాంప్ట్ మరియు కొన్ని-షాట్‌లను వినియోగించాలి.

11. కొత్త మోడల్‌ను ఉత్పత్తిలో ఉంచేటప్పుడు సురక్షితమైన విస్తరణ కోసం ఏది తప్పనిసరి?

  • ఎ) టెస్టింగ్‌లో మోడల్ బాగుంటే, దాన్ని నేరుగా 100% ట్రాఫిక్‌కు తెరవండి
  • బి) విస్తరణ తర్వాత పర్యవేక్షణను అస్సలు ఏర్పాటు చేయడం లేదు
  • సి) దశలవారీ విస్తరణ (షాడో/కానరీ) మరియు ముందుగా పరీక్షించిన రోల్‌బ్యాక్ ప్లాన్ ✔
  • డి) మూల్యాంకన థ్రెషోల్డ్ చేరుకోనప్పటికీ మోడల్‌ను ప్రచురించడం

వివరణ: కొత్త మోడల్‌ను అన్ని ట్రాఫిక్‌లకు నేరుగా తెరవడం ప్రమాదకరం; అది తప్పు అయితే, ప్రతి ఒక్కరూ ప్రభావితమవుతారు. సరైన విషయం ఏమిటంటే ఇది క్రమంగా పంపిణీ (షాడో, కానరీ) మరియు ప్రతి పంపిణీకి పరీక్షించిన రోల్‌బ్యాక్ ప్లాన్ ఉంటుంది. క్లాబ్యాక్ ప్లాన్ లేకుండా పంపిణీ పూర్తి కాదు; ఉత్పత్తిలో మోడల్ ఊహించని విధంగా ప్రవర్తించినప్పుడు నిమిషాల వ్యవధిలో మునుపటి సంస్కరణకు తిరిగి వెళ్లగలగడం వినియోగదారుని రక్షిస్తుంది.

12. ML మోడల్ ఉత్పత్తిలో 'నిశ్శబ్దంగా' ఎలా విఫలమవుతుంది మరియు దీన్ని పట్టుకోవడానికి మార్గం ఏమిటి?

  • ఎ) మోడల్ కూలిపోతుంది; సర్వర్ లాగ్‌లు దీనిని చూపుతాయి
  • బి) తప్పులు చేయకుండా తప్పుడు అంచనాలను ఉత్పత్తి చేయడం ద్వారా; ✔ ఇది కార్యాచరణ, ఇన్‌పుట్ మరియు అవుట్‌పుట్ లేయర్డ్ పర్యవేక్షణను సంగ్రహిస్తుంది
  • సి) మోడల్ ఎప్పుడూ నిశ్శబ్దంగా విఫలం కాదు, ఎల్లప్పుడూ అలారం
  • డి) ఏదైనా క్షీణతను పట్టుకోవడానికి కేవలం జాప్యాన్ని పర్యవేక్షించడం సరిపోతుంది

వివరణ: క్రాష్ చేయకుండా లేదా లోపాలను అందించకుండా తప్పు అంచనాలను ఉత్పత్తి చేయడం ద్వారా మోడల్ విఫలమవుతుంది; దీనికి ప్రధాన కారణం డేటా డ్రిఫ్ట్ మరియు కాన్సెప్ట్ డ్రిఫ్ట్. కేవలం కార్యాచరణ కొలమానాలను (జాప్యం, లోపం రేటు) పర్యవేక్షించడం సరిపోదు; ఇన్‌పుట్ పంపిణీ మరియు అవుట్‌పుట్/అంచనా పంపిణీని కూడా పర్యవేక్షించాలి. అసలు ఫలితం ఆలస్యమైతే ఇన్‌పుట్ డ్రిఫ్ట్ ముందస్తు హెచ్చరికను ఇస్తుంది.

13. LLM వ్యవస్థను మూల్యాంకనం చేయడానికి LLM-గా-న్యాయమూర్తిని ఉపయోగిస్తున్నప్పుడు ఏ సూత్రం అవసరం?

  • ఎ) LLM-రిఫరీ ఎల్లప్పుడూ సరైనది, మానవ ధృవీకరణ అనవసరం
  • బి) రిఫరీ తప్పనిసరిగా సమాధానం పొడవు ఆధారంగా మాత్రమే నిర్ణయం తీసుకోవాలి.
  • సి) రిఫరీలను ఉపయోగించినప్పుడు నియమాల-ఆధారిత నియంత్రణలు మరియు మానవ మూల్యాంకనం పూర్తిగా విస్మరించబడాలి
  • D) న్యాయనిర్ణేత స్కోర్‌లను మానవ-లేబుల్ నమూనాతో క్రమాంకనం చేయాలి మరియు వాటిని విశ్వసించే ముందు వారి పక్షపాతాన్ని కొలవాలి ✔

వివరణ: LLM-రిఫరీ కూడా ఒక మోడల్; ఇది భ్రాంతి, పక్షపాతం (దీర్ఘమైన, నమ్మకంగా సమాధానాలు ఇవ్వడం) మరియు అస్థిరంగా ఉంటుంది. అందువల్ల, రిఫరీ స్కోర్‌లు తప్పనిసరిగా మానవ లేబుల్ చేయబడిన నమూనాతో క్రమాంకనం చేయాలి మరియు ఉత్పత్తి నిర్ణయం తీసుకునే ముందు వాటి క్రమబద్ధమైన పక్షపాతాన్ని తప్పనిసరిగా కొలవాలి. ధృవీకరించని రిఫరీ తప్పుడు విశ్వాసాన్ని ఇస్తాడు.

14. మోడల్ బయాస్‌ని అంచనా వేసేటప్పుడు మొత్తం ఖచ్చితత్వాన్ని చూడటం ఎందుకు సరిపోదు?

  • ఎ) మొత్తం ఖచ్చితత్వం సరిపోతుంది ఎందుకంటే ఇది ఎల్లప్పుడూ చెత్త సమూహం యొక్క పనితీరును ప్రతిబింబిస్తుంది
  • B) ఉప సమూహాల మధ్య క్రమబద్ధమైన వ్యత్యాసాన్ని (దాచిన వివక్ష) అస్పష్టం చేస్తుంది కాబట్టి మొత్తం ఖచ్చితత్వం మాత్రమే సరిపోదు ✔
  • సి) ఎందుకంటే ఖచ్చితత్వం అనేది పక్షపాతంతో సంబంధం లేని మెట్రిక్
  • డి) పక్షపాతం మోడల్ నుండి మాత్రమే వస్తుంది మరియు డేటాతో ఎటువంటి సంబంధం లేదు.

వివరణ: మొత్తం ఖచ్చితత్వం ఉప సమూహాల మధ్య క్రమబద్ధమైన తేడాలను అస్పష్టం చేస్తుంది. ఉదాహరణకు, మొత్తం ఖచ్చితత్వం 88% అయితే, రీకాల్ ఒక సమూహంలో 91% మరియు మరొక సమూహంలో 67% కావచ్చు; మోడల్ క్రమపద్ధతిలో ఆ సమూహాన్ని కోల్పోతుంది. కాబట్టి, మోడల్‌ను ఉప సమూహాల (జనాభా/విభాగం) ఆధారంగా మూల్యాంకనం చేయాలి మరియు న్యాయం యొక్క ఏ నిర్వచనానికి ప్రాధాన్యత ఇవ్వాలో వాటాదారులతో నిర్ణయించాలి.

15. ML ఫలితం పునరుత్పత్తి కావడానికి ఏ నాలుగు విషయాలు కలిసి పరిష్కరించబడాలి?

  • ఎ) మోడల్ పేరు, పరిమాణం, ధర మరియు విడుదల తేదీ మాత్రమే
  • బి) GPU బ్రాండ్ మరియు ఇంటర్నెట్ వేగం మాత్రమే
  • సి) మోడల్ యొక్క తుది ఖచ్చితత్వ స్కోర్ మాత్రమే; మిగిలిన వాటిని మెమరీలో ఉంచుకోవచ్చు
  • డి) రాండమ్‌నెస్ సీడ్, డేటా వెర్షన్, ఎన్విరాన్‌మెంట్ (డిపెండెన్సీ వెర్షన్‌లు) మరియు ఎక్స్‌పెరిమెంట్ ట్రాకింగ్ ✔

వివరణ: పునరుత్పత్తి నాలుగు స్తంభాల ద్వారా సాధించబడుతుంది: యాదృచ్ఛిక విత్తనాలను ఫిక్సింగ్ చేయడం, సంస్కరణ డేటా (వెర్షన్/హాష్), పర్యావరణాన్ని గడ్డకట్టడం (ఖచ్చితమైన లైబ్రరీ వెర్షన్లు/కంటైనర్), మరియు ప్రతి ప్రయోగాన్ని ట్రాక్ చేయడం (కోడ్ కమిట్, డేటా, హైపర్‌పారామీటర్, మెట్రిక్). ఈ గొలుసు లేకుండా అదే ఫలితాన్ని పునరుత్పత్తి చేయడం సాధ్యం కాదు; పునరుత్పత్తి చేయలేని ఫలితం అనేది నిరూపించలేని దావా.