యూనిట్లు
1. ML ఇంజనీరింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్ర, సరిహద్దులు, ధ్రువీకరణ మరియు బాధ్యత 2. డేటా పైప్‌లైన్: సేకరణ, శుభ్రపరచడం, ట్యాగింగ్ మరియు సంస్కరణ 3. మోడల్ శిక్షణ మరియు మూల్యాంకనం: ఖచ్చితమైన కొలమానాలు, నిజాయితీ బెంచ్‌మార్కింగ్ 4. LLM అప్లికేషన్: RAGతో మీ స్వంత డేటా ఆధారంగా సమాధానాలు 5. LLM అప్లికేషన్: ఏజెంట్లు, టూలింగ్ మరియు సురక్షిత ఆటోమేషన్ 6. ఫైన్-ట్యూనింగ్ బేసిస్: ఎప్పుడు, ఎలా మరియు ఏ ప్రమాదంతో 7. MLOps మరియు విస్తరణ: మోడల్‌ను ల్యాబ్ నుండి ఉత్పత్తికి తరలించడం 8. ఈవల్ మరియు మానిటరింగ్: ఉత్పత్తిలో మోడల్ నిజంగా ఏమి చేస్తుందో తెలుసుకోవడం 9. భద్రత మరియు గోప్యత: డిఫెండింగ్ AI సిస్టమ్స్ 10. బయాస్, ఎథిక్స్ అండ్ కాస్ట్: రెస్పాన్సిబుల్ అండ్ సస్టైనబుల్ AI ఇంజనీరింగ్ 11. పునరుత్పత్తి మరియు ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ప్రతిదీ కలపడం
యూనిట్ 3 / 11

మోడల్ శిక్షణ మరియు మూల్యాంకనం: ఖచ్చితమైన కొలమానాలు, నిజాయితీ బెంచ్‌మార్కింగ్

లాభాలు:

  • సమస్య రకం మరియు వ్యాపార సందర్భానికి తగిన మెట్రిక్‌ను ఎంచుకునే సామర్థ్యం (అసమతుల్య డేటాలో PR-AUC/రీకాల్, రిగ్రెషన్‌లో MAE/RMSE) మరియు ఎక్కువ/అండర్ లెర్నింగ్‌ను గుర్తించడం
  • ప్రతి మెట్రిక్‌ను బేస్‌లైన్‌కు వ్యతిరేకంగా అర్థం చేసుకోగల సామర్థ్యం మరియు విచలనం మరియు క్రాస్ ధ్రువీకరణతో పురోగతి నుండి శబ్దాన్ని వేరు చేయడం
  • ధ్రువీకరణ సెట్‌తో హైపర్‌పారామీటర్‌లను ట్యూన్ చేయడం ద్వారా మరియు చివరిలో మాత్రమే పరీక్ష సెట్‌ను ఉపయోగించడం ద్వారా ఆశాజనక ఫలితాలను నివేదించగల సామర్థ్యం

మోడల్ శిక్షణ (శిక్షణ: డేటా నుండి నమూనాలను నేర్చుకునే ప్రక్రియ) అనేది ML ఇంజినీరింగ్‌లో ఎక్కువగా కనిపించే కానీ చాలా తప్పుదారి పట్టించే దశ. ఇది "ఖచ్చితత్వం 95%" వంటి సంతృప్తికరమైన సంఖ్యను ఉత్పత్తి చేసినందున ఇది కనిపిస్తుంది. తప్పుదారి పట్టించేది ఎందుకంటే ఆ సంఖ్య తరచుగా తప్పు ప్రశ్నకు సరైన సమాధానం. ఈ యూనిట్‌లో, ఇంజనీరింగ్ విభాగంతో విద్య మరియు మూల్యాంకనం చర్చించబడతాయి; మేము ప్రయోగాత్మక రూపకల్పనలో భాగస్వామిగా కృత్రిమ మేధస్సును ఉపయోగిస్తాము మరియు కొలతపై నిర్ణయం తీసుకుంటాము.

శిక్షణ చక్రం యొక్క లాజిక్

ఒక మోడల్ లాస్ ఫంక్షన్‌ను తగ్గించడం ద్వారా డేటాలోని నమూనాను నేర్చుకుంటుంది: మోడల్ యొక్క లోపాన్ని సంఖ్యాపరంగా కొలిచే ఫంక్షన్. ఆప్టిమైజేషన్ అల్గోరిథం (ఉదా. గ్రేడియంట్ డీసెంట్) పారామితులను దశలవారీగా సర్దుబాటు చేయడం ద్వారా నష్టాన్ని తగ్గిస్తుంది. శిక్షణ డేటాను గుర్తుంచుకోవడం కాదు, అపూర్వమైన డేటాకు సాధారణీకరించడం.

రెండు ప్రధాన ప్రమాదాలు:

  • ఓవర్ ఫిట్టింగ్: మోడల్ శిక్షణ డేటాను గుర్తుంచుకుంటుంది మరియు కొత్త డేటాలో విఫలమవుతుంది. శిక్షణ విజయం ఎక్కువగా ఉంది, ధృవీకరణ విజయం తక్కువగా ఉంది.
  • అండర్ ఫిట్టింగ్: మోడల్ నమూనాను సంగ్రహించదు; శిక్షణ మరియు ధ్రువీకరణ విజయం రెండూ తక్కువ.

సమతుల్యతను కనుగొనడం విద్య యొక్క కళ. ఈ బ్యాలెన్స్‌ను పర్యవేక్షించడానికి ధ్రువీకరణ సెట్ ఉంది: శిక్షణ విజయం పెరుగుతున్నప్పుడు ధ్రువీకరణ విజయం తగ్గడం ప్రారంభిస్తే, ఓవర్‌లెర్నింగ్ ప్రారంభించబడింది.

చిట్కా: ప్రతి దశలో శిక్షణ మరియు ధ్రువీకరణ నష్టాన్ని కలిసి ప్లాట్ చేయండి. రెండు వక్రతలు వేరుచేయడం ప్రారంభించే పాయింట్ ఓవర్‌లెర్నింగ్ ప్రారంభమవుతుంది మరియు "ఎర్లీ స్టాప్"కి సరైన క్షణం.

మెట్రిక్ ఎంపిక: అత్యంత క్లిష్టమైన నిర్ణయం

తప్పు కొలమానం మంచి మోడల్‌ను చెడుగా మరియు చెడ్డ మోడల్ మంచిగా కనిపిస్తుంది. సమస్య మెట్రిక్‌ను నిర్ణయిస్తుంది:

  • అసమతుల్య వర్గీకరణ (ఒక తరగతి చాలా అరుదు, ఉదా. మోసం): ఖచ్చితత్వం తప్పుదారి పట్టించేది. "ప్రతిదీ సాధారణమైనదిగా పిలవండి" అని చెప్పే మోడల్ 99% ఖచ్చితత్వాన్ని పొందుతుంది కానీ ఒక్క మోసాన్ని కూడా పట్టుకోదు. బదులుగా, ఖచ్చితత్వం (నేను పట్టుకున్నవాటిలో వాస్తవంగా పాజిటివ్‌గా ఉంది), రీకాల్ (నేను పట్టుకున్న వాటిలో ఎంత నిజమైన పాజిటివ్) మరియు వాటి బ్యాలెన్స్ F1 లేదా PR-AUC ఉపయోగించబడతాయి.
  • సమతుల్య వర్గీకరణ: ఖచ్చితత్వం మరియు ROC-AUC సముచితంగా ఉండవచ్చు.
  • తిరోగమనం (సంఖ్య అంచనా): MAE (అంటే సంపూర్ణ లోపం), RMSE (పెద్ద దోషాలను పెనాల్టీ చేస్తుంది), MAPE (శాతం లోపం).
  • ర్యాంకింగ్/సిఫార్సు: NDCG, MRR, రీకాల్@K.

ఖచ్చితత్వం లేదా రీకాల్ ముఖ్యమా అనేది వ్యాపార సందర్భంపై ఆధారపడి ఉంటుంది. క్యాన్సర్ స్క్రీనింగ్‌లో రీకాల్ (ఏ రోగులను కోల్పోలేదు) ప్రాధాన్యత; స్పామ్ ఫిల్టర్‌లో ఖచ్చితత్వం (ముఖ్యమైన ఇ-మెయిల్‌లను స్పామ్‌కి పంపడం కాదు) ముఖ్యం. ఇది వ్యాపార నిర్ణయం, సాంకేతికమైనది కాదు మరియు ఇంజనీర్ మరియు యజమాని కలిసి తీసుకుంటారు.

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనమైన ప్రాంప్ట్: "నా మోడల్ పనితీరు, ఖచ్చితత్వం 0.97ను అంచనా వేయండి."

శక్తివంతమైన ప్రాంప్ట్: "నా దగ్గర మోసం గుర్తింపు మోడల్ ఉంది; పాజిటివ్ క్లాస్ రేట్ 1.5%. ఖచ్చితత్వం 0.97గా నివేదించబడింది. ఈ మెట్రిక్ ఎందుకు తప్పుదారి పట్టించవచ్చో వివరించండి, నేను ఏ కొలమానాలను (ఖచ్చితమైన, రీకాల్, PR-AUC) ఎంచుకోవాలి మరియు ఎందుకు చెప్పండి. అలాగే 'కాల్ ప్రతిదీ ప్రతికూలంగా చూడగలం' అనే వాస్తవ విలువను కూడా లెక్కించండి."

తేడా: శక్తివంతమైన ప్రాంప్ట్ తరగతి నిష్పత్తి మరియు వ్యాపార సందర్భాన్ని ఇస్తుంది; ఇది బేస్‌లైన్ మోడల్ పోలికను కూడా అడుగుతుంది — మెట్రిక్ అర్థవంతంగా ఉందా లేదా అనేదానికి ఇది చాలా ముఖ్యమైన యాంకర్.

బేస్‌లైన్: పోలిక లేని మెట్రిక్ అర్థరహితం

మెట్రిక్ స్వతహాగా మంచిది లేదా చెడు కాదు; ప్రాథమిక నమూనా ప్రకారం ఇది మంచి లేదా చెడు. ప్రాథమిక నమూనా అనేది మనస్సులో వచ్చే సరళమైన పరిష్కారం: "ఎల్లప్పుడూ మెజారిటీ తరగతికి చెప్పండి", "గత వారం విలువను పునరావృతం చేయండి", "సగటును అంచనా వేయండి". మీ మోడల్ ఈ సాధారణ పరిష్కారాన్ని స్పష్టంగా పాస్ చేయలేకపోతే, సంక్లిష్టత అంతా ఏమీ లేదు.

జాగ్రత్త: "నా మోడల్ 85% ఖచ్చితమైనది" అనే వాక్యం స్వయంగా ఏమీ చెప్పదు. బేస్ మోడల్ ఇప్పటికే 84% పొందినట్లయితే, మీ మోడల్ దాదాపు పనికిరానిది; బేస్ మోడల్ 50% పొందినట్లయితే, మీ మోడల్ ఖచ్చితంగా ఉంటుంది. ఎల్లప్పుడూ ప్రాథమిక నమూనా పరంగా మాట్లాడండి.

క్రాస్ ధ్రువీకరణ మరియు నమ్మకం

ఒకే శిక్షణ/పరీక్ష విభజన అవకాశం కారణంగా ఉండవచ్చు. క్రాస్ ధ్రువీకరణ: డేటాను k భాగాలుగా విభజించడం మరియు ప్రతి భాగాన్ని వరుసగా పరీక్షించడం పనితీరు ఎంత స్థిరంగా ఉందో చూపిస్తుంది. 5 రెట్లు క్రాస్ ధ్రువీకరణలో మీరు ఐదు వేర్వేరు స్కోర్‌లను పొందుతారు; వాటి సగటు మరియు ప్రామాణిక విచలనం ముఖ్యమైనవి. సగటు 80% అయితే విచలనం ±12% అయితే, మీ మోడల్ అస్థిరంగా ఉంటుంది - తదుపరి బ్యాచ్ డేటాలో ఇది చాలా భిన్నంగా ప్రవర్తించవచ్చు.

ఇది "రెండు మోడల్ పోలిక"కి కూడా కీలకం. మోడల్ Aకి 81% మరియు మోడల్ Bకి 82% వచ్చినట్లయితే, B నిజంగా మంచిదేనా? విచలనం ± 3% అయితే, ఈ వ్యత్యాసం శబ్దం కావచ్చు. నిర్ణయించే ముందు వ్యత్యాసం ముఖ్యమైనదా అని పరిగణించండి.

హైపర్‌పారామీటర్ ట్యూనింగ్: ధ్రువీకరణతో, పరీక్ష కాదు

హైపర్‌పారామీటర్‌లు (శిక్షణకు ముందు మాన్యువల్‌గా నిర్ణయించబడిన సెట్టింగ్‌లు-అభ్యాస రేటు, చెట్టు లోతు మొదలైనవి) ధ్రువీకరణ సెట్‌తో సెట్ చేయబడతాయి. పరీక్ష సెట్ చివరిలో, ఒకసారి మాత్రమే ఉపయోగించబడుతుంది. మీరు పరీక్ష సెట్‌ను చూడటం ద్వారా హైపర్‌పారామీటర్‌లను ఎంచుకుంటే, పరీక్ష సెట్ కలుషితమవుతుంది మరియు మీరు నివేదించే పనితీరు ఆశాజనకంగా ఉంటుంది, ఇది వాస్తవంగా ఉండదు.

కృత్రిమ మేధస్సు అనేది హైపర్‌పారామీటర్ శోధన స్థలాన్ని రూపొందించడంలో మరియు శోధన కోడ్‌ను (గ్రిడ్ శోధన, యాదృచ్ఛిక శోధన, బయేసియన్ ఆప్టిమైజేషన్) వ్రాయడంలో మంచి సహాయకుడు. కానీ మీరు ఇప్పటికీ "మేము ఏ మెట్రిక్‌ను ఆప్టిమైజ్ చేయాలి?"

మూడు చిన్న కేసులు

కేస్ 1 - ఖచ్చితత్వ ఉచ్చు. అరుదైన వ్యాధిని గుర్తించిన మోడల్ గురించి వైద్య బృందం గర్వపడింది: 98% ఖచ్చితత్వం. ప్రాథమిక నమూనా పోలిక చేసినప్పుడు, నిజం బయటపడింది: వ్యాధి రేటు 2% కాబట్టి, "అందరినీ ఆరోగ్యంగా పిలవండి" అని చెప్పిన మోడల్ కూడా 98% పొందింది. మోడల్ రీకాల్ 11% మాత్రమే - చాలా మంది రోగులు తప్పిపోయారు. మెట్రిక్ PR-AUCకి మార్చబడిన తర్వాత, వాస్తవ పనితీరును కొలుస్తారు మరియు మోడల్ పునఃరూపకల్పన చేయబడింది.

కేసు 2 - పురోగతి కోసం తప్పుగా శబ్దం. ఒక బృందం మోడల్‌ను 86.2% నుండి 86.9%కి మెరుగుపరచడానికి నెలల తరబడి గడిపింది. క్రాస్ ధ్రువీకరణ పక్షపాతం ± 1.4% అని చూపించింది - కాబట్టి 0.7 పాయింట్ "అభివృద్ధి" అనేది గణాంక శబ్దం. అవాస్తవ ఆదాయాల కోసం జట్టు మూడు వారాలు వృధా చేసింది. పాఠం: విచలనం కంటే మెరుగుదల ఎక్కువ అని ధృవీకరించకుండా విజయాన్ని ప్రకటించవద్దు.

కేసు 3 - పరీక్ష సెట్ యొక్క కాలుష్యం. ఒక ఇంజనీర్ అత్యుత్తమ హైపర్‌పారామీటర్‌లను ఎంచుకోవడానికి పరీక్ష సెట్‌ను పదేపదే చూశాడు. అది నివేదించిన 91% ఉత్పత్తిలో 83%కి పడిపోయింది. ఎందుకు: అతను పరీక్ష సెట్‌ను పదే పదే చూస్తూ (పరీక్ష సెట్‌లో ఓవర్‌లెర్నింగ్) తదనుగుణంగా మోడల్‌ని ఎంపిక చేసుకున్నాడు. ప్రత్యేక ధ్రువీకరణ సెట్‌ను ఉపయోగించినప్పుడు నివేదించబడిన మరియు వాస్తవ పనితీరు అతివ్యాప్తి చెందుతుంది.

కాపీ చేయగల టెంప్లేట్లు

ఈ వర్గీకరణ సమస్య కోసం సరైన మెట్రిక్‌ని ఎంచుకోవడానికి నాకు సహాయం చేయండి. సమస్య: [అంచనా వేయబడినది] తరగతి పంపిణీ: [సానుకూల రేటు

కింది రెండు మోడల్‌ల పోలికను మూల్యాంకనం చేయండి. మోడల్ A క్రాస్ ధ్రువీకరణ: [స్కోర్‌ల జాబితా] మోడల్ B క్రాస్ ధ్రువీకరణ: [స్కోర్‌ల జాబితా]సగటు మరియు ప్రామాణిక విచలనాన్ని లెక్కించండి. వ్యత్యాసం గణాంకపరంగా ముఖ్యమైనదా లేదా విచలనం లోపల శబ్దం మాత్రమేనా? నేను దేనిని ఎంచుకోవాలని మీరు సిఫార్సు చేస్తారు మరియు ఎందుకు?

కింది వాటి కోసం ఈ శిక్షణ కోడ్‌ని తనిఖీ చేయండి:1) పరీక్ష సెట్‌తో లేదా ధ్రువీకరణ సెట్‌తో హైపర్‌పారామీటర్‌లు ఎంపికయ్యాయా?2) సరైన సెట్‌తో ముందస్తుగా ఆపడం మానిటర్ చేయబడుతుందా?3) ఓవర్‌లెర్నింగ్ (శిక్షణ/ధృవీకరణ నష్టం తేడా) ఏవైనా సంకేతాలు ఉన్నాయా?కోడ్: [కోడ్]

ఈ రిగ్రెషన్ సమస్య కోసం నేను MAE, RMSE మరియు MAPEలో దేనిని నివేదించాలి? లక్ష్య వేరియబుల్ యొక్క స్కేల్: [పరిధి] పెద్ద లోపాలు అసమానంగా చెడ్డవా (RMSE), లేదా అవన్నీ సమానంగా ఉన్నాయా (MAE)? సున్నాకి దగ్గరగా విలువలు ఉన్నాయా (అవి MAPEని వక్రీకరిస్తాయా)? సంక్షిప్త సమర్థనతో సూచించండి.

మెట్రిక్ ఎంపిక పట్టిక

సమస్య రకం

తగిన మెట్రిక్

నివారించాలి

ఎందుకు

అసమతుల్య వర్గీకరణ

PR-AUC, F1, రీకాల్

ఖచ్చితత్వం

మెజారిటీ తరగతి మెట్రిక్‌ను పెంచుతుంది

సమతుల్య వర్గీకరణ

ఖచ్చితత్వం, ROC-AUC

సమతుల్య డేటాలో విశ్వసనీయమైనది

తిరోగమనం (ముఖ్యమైన అవుట్‌లియర్)

RMSE

MAPE (సున్నా అయితే)

పెద్ద తప్పులను శిక్షిస్తుంది

తిరోగమనం (సమాన బరువు)

MAE

అర్థం చేసుకోవడం సులభం

ర్యాంకింగ్/సిఫార్సు

NDCG, రీకాల్@K

ఖచ్చితత్వం

ఆర్డర్ ముఖ్యం

సాధారణ తప్పులు

  • అసమతుల్య డేటాపై ఖచ్చితత్వాన్ని ఉపయోగించడం. అత్యంత సాధారణ మెట్రిక్ లోపం.
  • బేస్ మోడల్ పోలికలు చేయడం లేదు. ఇది మెట్రిక్ దాని అర్థాన్ని కోల్పోయేలా చేస్తుంది.
  • హైపర్‌పారామీటర్‌ల కోసం పరీక్ష సెట్‌ను చూస్తోంది. ఆశావాద, అవాస్తవ ఫలితం.
  • ఒకే కంపార్ట్‌మెంట్‌పై ఆధారపడుతున్నారు. క్రాస్ ధ్రువీకరణ లేకుండా మీరు పక్షపాతాన్ని చూడలేరు.
  • పురోగతి కోసం శబ్దం పొరపాటు. విచలనం నుండి చిన్న "మెరుగుదలలు" ఎక్కువగా అదృష్టం.
  • వ్యాపార సందర్భాన్ని విస్మరించడం. ఖచ్చితత్వం/రీకాల్ బ్యాలెన్స్ అనేది వ్యాపార నిర్ణయం.

సారాంశంలో

మోడల్ శిక్షణలో నిజమైన నైపుణ్యం అధిక సంఖ్యను ఉత్పత్తి చేయడం కాదు, ఆ సంఖ్య అంటే ఏమిటో తెలుసుకోవడం. సమస్య మరియు వ్యాపార సందర్భం సరైన మెట్రిక్‌ని నిర్ణయిస్తుంది; ప్రతి మెట్రిక్‌ను బేస్‌లైన్ మోడల్ ప్రకారం అర్థం చేసుకోండి; క్రాస్-ధృవీకరణతో పక్షపాతాన్ని కొలవండి మరియు పురోగతి కోసం శబ్దాన్ని పొరపాటు చేయవద్దు; పరీక్ష సెట్‌ను చివరిలో మాత్రమే ఉపయోగించండి, ఒక సారి. ప్రయోగ రూపకల్పనలో AI మీ భాగస్వామి, కానీ "తగినంత మంచిది" అనే నిర్ణయం మీ ఇష్టం మరియు మీది.

అప్లికేషన్ టాస్క్

వర్గీకరణ నమూనా కోసం: (1) తరగతి పంపిణీని వ్రాయండి, (2) తగిన బేస్ మోడల్‌ను రూపొందించండి మరియు దాని స్కోర్‌ను కొలవండి, (3) 5-రెట్లు క్రాస్ ధ్రువీకరణతో మీ మోడల్‌ను అంచనా వేయండి మరియు సగటు మరియు ప్రామాణిక విచలనాన్ని నివేదించండి, (4) ఖచ్చితత్వానికి బదులుగా సమస్యకు తగిన మెట్రిక్‌ను (ఉదా. PR-AUC) లెక్కించండి. మీ మోడల్ బేస్‌లైన్ మోడల్‌ను పక్షపాతం లేకుండా పెద్ద మార్జిన్‌తో బీట్ చేస్తుందో లేదో వ్రాయండి.

చెక్లిస్ట్

  • [ ] నేను సమస్య రకం మరియు వ్యాపార సందర్భం ఆధారంగా మెట్రిక్‌ని ఎంచుకున్నాను.
  • [ ] నేను ఒక బేస్ మోడల్‌ని నిర్మించాను మరియు దానితో పోల్చాను.
  • [ ] నేను క్రాస్ ధ్రువీకరణతో సగటు మరియు విచలనాన్ని నివేదించాను.
  • [ ] నేను విచలనం కంటే మెరుగుదల ఎక్కువగా ఉందని నిర్ధారించాను.
  • [ ] నేను ధ్రువీకరణ సెట్‌తో హైపర్‌పారామీటర్‌లను ఎంచుకున్నాను.
  • [ ] నేను పరీక్ష సెట్‌ని చివరిలో ఒకసారి మాత్రమే ఉపయోగించాను.