యూనిట్లు
1. ML ఇంజనీరింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్: పాత్ర, సరిహద్దులు, ధ్రువీకరణ మరియు బాధ్యత 2. డేటా పైప్‌లైన్: సేకరణ, శుభ్రపరచడం, ట్యాగింగ్ మరియు సంస్కరణ 3. మోడల్ శిక్షణ మరియు మూల్యాంకనం: ఖచ్చితమైన కొలమానాలు, నిజాయితీ బెంచ్‌మార్కింగ్ 4. LLM అప్లికేషన్: RAGతో మీ స్వంత డేటా ఆధారంగా సమాధానాలు 5. LLM అప్లికేషన్: ఏజెంట్లు, టూలింగ్ మరియు సురక్షిత ఆటోమేషన్ 6. ఫైన్-ట్యూనింగ్ బేసిస్: ఎప్పుడు, ఎలా మరియు ఏ ప్రమాదంతో 7. MLOps మరియు విస్తరణ: మోడల్‌ను ల్యాబ్ నుండి ఉత్పత్తికి తరలించడం 8. ఈవల్ మరియు మానిటరింగ్: ఉత్పత్తిలో మోడల్ నిజంగా ఏమి చేస్తుందో తెలుసుకోవడం 9. భద్రత మరియు గోప్యత: డిఫెండింగ్ AI సిస్టమ్స్ 10. బయాస్, ఎథిక్స్ అండ్ కాస్ట్: రెస్పాన్సిబుల్ అండ్ సస్టైనబుల్ AI ఇంజనీరింగ్ 11. పునరుత్పత్తి మరియు ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ప్రతిదీ కలపడం
యూనిట్ 8 / 11

ఈవల్ మరియు మానిటరింగ్: ఉత్పత్తిలో మోడల్ నిజంగా ఏమి చేస్తుందో తెలుసుకోవడం

లాభాలు:

  • మోడల్ క్షీణతకు నిశ్శబ్ద కారణాలను గుర్తించే సామర్థ్యం (డేటా డ్రిఫ్ట్, కాన్సెప్ట్ డ్రిఫ్ట్, అప్‌స్ట్రీమ్ ఎర్రర్) మరియు మూడు-లేయర్ (ఆపరేషనల్, ఇన్‌పుట్, అవుట్‌పుట్) పర్యవేక్షణను ఏర్పాటు చేయడం
  • నియమ తనిఖీలు, LLM-రిఫరీ మరియు మానవ మూల్యాంకనంతో బహుళ లేయర్‌లలో LLM సిస్టమ్‌లను మూల్యాంకనం చేయగల సామర్థ్యం మరియు LLM-రిఫరీ హ్యూమన్ యాంకర్‌తో క్రమాంకనం చేయడం
  • ఎడ్జ్ మరియు సెక్యూరిటీ కేసులను కలిగి ఉన్న ఎవాల్ సెట్‌ని డిజైన్ చేయగల సామర్థ్యం మరియు ప్రతి క్యాచ్ ఎర్రర్‌ను శాశ్వత పరీక్ష కేసుగా మార్చడం

ఒక మోడల్ ఉత్పత్తికి వెళ్ళిన తర్వాత, మీ పని పూర్తి కాదు; అసలు బాధ్యత ఇప్పుడే ప్రారంభమవుతుంది. ఎందుకంటే ఎవరూ చూడనప్పుడు మోడల్ నిశ్శబ్దంగా విరిగిపోతుంది. ఈ యూనిట్‌లో, మేము రెండు పరిపూరకరమైన విభాగాలను కవర్ చేస్తాము: మూల్యాంకనం (మోడల్ నాణ్యతను క్రమపద్ధతిలో కొలవడం) మరియు పర్యవేక్షణ (ఉత్పత్తిలో మోడల్ యొక్క స్థిరమైన పర్యవేక్షణ). ప్రత్యేకించి LLM సిస్టమ్‌లలో, eval అనేది చాలా కష్టం మరియు క్లాసికల్ ML కంటే ఎక్కువ జాగ్రత్త అవసరం.

ఎందుకు ఉత్పత్తి నమూనా నిశ్శబ్దంగా విచ్ఛిన్నం అవుతోంది

బగ్ క్రాష్ అవుతుంది, లాగ్ ప్రింట్ అవుతుంది, అలారం ఆఫ్ అవుతుంది. మరోవైపు, ML మోడల్ లోపాలను కలిగించకుండా తప్పు కావచ్చు. క్షీణతకు మూడు ప్రధాన కారణాలు:

  • డేటా డ్రిఫ్ట్: ఇన్‌పుట్ డేటా పంపిణీ కాలానుగుణంగా మారుతుంది (కొత్త ఉత్పత్తులు, మారుతున్న వినియోగదారు ప్రవర్తన, కాలానుగుణత). మోడల్ అలాగే ఉంటుంది కానీ ప్రపంచం మారుతుంది.
  • కాన్సెప్ట్ డ్రిఫ్ట్: ఇన్‌పుట్-అవుట్‌పుట్ సంబంధం మారుతుంది. మోసపూరిత వ్యూహాలు మరియు స్పామ్ నమూనాలు అభివృద్ధి చెందుతాయి; నిన్న సరైనది నేడు తప్పు అవుతుంది.
  • అప్‌స్ట్రీమ్ అవినీతి: డేటా సోర్స్ ఆకృతిని మారుస్తుంది, ఒక ప్రాంతం ఉచితం; పాడైన ఇన్‌పుట్‌తో మోడల్ నిశ్శబ్దంగా డ్రోల్ చేస్తుంది.

ట్రేసింగ్ ఈ నిశ్శబ్ద వక్రీకరణలను వినిపించేలా చేస్తోంది.

ఏమి చూడాలి: మూడు పొరలు

మంచి పర్యవేక్షణ మూడు పొరలను కలిగి ఉంటుంది:

  1. కార్యాచరణ కొలమానాలు: జాప్యం, లోపం రేటు, అభ్యర్థన వాల్యూమ్, వనరుల వినియోగం. "వ్యవస్థ నిలబడి ఉందా?"
  2. డేటా/ఇన్‌పుట్ మెట్రిక్‌లు: ఇన్‌పుట్ పంపిణీ శిక్షణలో ఉన్నట్లే ఉందా? మిస్సింగ్ విలువ రేటు పెరిగిందా? కొత్త వర్గాలు వచ్చాయా? "మోడల్ తెలిసిన డేటాను చూస్తుందా?"
  3. మోడల్/అవుట్‌పుట్ కొలమానాలు: అంచనా పంపిణీ లాగ్? కాన్ఫిడెన్స్ స్కోర్లు పడిపోయాయా? మరియు వీలైతే, గ్రౌండ్ ట్రూత్‌తో పోలిస్తే కచ్చితత్వం ఏమిటి? "మోడల్ ఇప్పటికీ ఖచ్చితమైనదేనా?"

మూడవ పొర అత్యంత విలువైనది కానీ చాలా కష్టం; ఎందుకంటే నిజమైన ఫలితం సాధారణంగా ఆలస్యంతో వస్తుంది (రుణం తిరిగి చెల్లించబడుతుందా లేదా అనేది నెలల తర్వాత స్పష్టమవుతుంది).

చిట్కా: అసలు ఫలితం ఆలస్యం అయితే, ముందుగా ఇన్‌పుట్ మరియు ప్రిడిక్షన్ పంపిణీని పర్యవేక్షించండి. ఇన్‌పుట్ పంపిణీని మార్చడం అనేది ఖచ్చితత్వం క్షీణతకు ముందస్తు సంకేతం మరియు వాస్తవ ఫలితం కోసం వేచి ఉండకుండా అలారంను పెంచవచ్చు.

LLM వ్యవస్థలను మూల్యాంకనం చేయడం: ప్రత్యేక సవాలు

క్లాసికల్ MLలో, "సరైన సమాధానం" స్పష్టంగా ఉంటుంది (తరగతి 0 లేదా 1). మరోవైపు, LLM ఫలితం ఓపెన్-ఎండ్: ఒకే ప్రశ్నకు చాలా సరైన సమాధానాలు ఉండవచ్చు, "సరైనత" అనేది ఒకే సంఖ్యకు సరిపోదు. LLM eval విధానాలు:

  • సూచించిన కొలమానాలు: అవుట్‌పుట్‌ను ఆదర్శ సమాధానంతో పోల్చడం. పరిమిత; ఎందుకంటే ఇది విభిన్నంగా వ్యక్తీకరించబడిన సరైన సమాధానాన్ని "తప్పు"గా పరిగణించవచ్చు.
  • నియమాల ఆధారిత తనిఖీలు: అవుట్‌పుట్ చెల్లుబాటు అయ్యే JSON? నిషేధించబడిన పదాలు ఏమైనా ఉన్నాయా? ఇది కావలసిన ఫీల్డ్‌లను కలిగి ఉందా? చౌక, నమ్మదగిన, గట్టి.
  • LLM- న్యాయమూర్తి (LLM- న్యాయమూర్తి): "ఈ ప్రమాణం ప్రకారం ఈ సమాధానం మంచిదేనా?" అని మోడల్‌ను అడగవద్దు. ఇది స్కేల్ అవుతుంది, కానీ రిఫరీ స్వయంగా ధృవీకరించబడాలి.
  • మానవ సమీక్ష: గోల్డ్ స్టాండర్డ్ కానీ ఖరీదైనది మరియు నెమ్మదిగా ఉంటుంది. ఇది నమూనాలో ఉపయోగించబడుతుంది.

ఆచరణలో ఇవి కలిసి ఉపయోగించబడతాయి: ప్రతి అవుట్‌పుట్‌పై చౌక నియమాల తనిఖీలు, పెద్ద నమూనాపై LLM-న్యాయమూర్తి, చిన్నదైన కానీ కఠినమైన నమూనాపై మానవ మూల్యాంకనం.

బలహీనమైన విధానం / బలమైన విధానం

బలహీనం: "LLM-నేను రిఫరీని అడిగాను, మా సమాధానాలలో 92% బాగున్నాయి. సిస్టమ్ చాలా బాగుంది."

Güçlü: "మేము మొదట 100 ప్రింట్‌అవుట్‌లను మానవ-లేబుల్ చేసాము. మేము అదే 100 ప్రింట్‌అవుట్‌లపై LLM-జడ్జిని నడిపాము మరియు మానవ-న్యాయమూర్తి ఒప్పందాన్ని కొలిచాము - 85% ఒప్పందం, ఆమోదయోగ్యమైనది. న్యాయమూర్తి క్రమపద్ధతిలో ఎక్కడ తప్పు చేశారో (దీర్ఘ సమాధానాలను అన్యాయంగా కనుగొనే ధోరణి) మేము డాక్యుమెంట్ చేసాము మరియు న్యాయమూర్తులు అతని స్కోర్‌ను ప్రాంప్ట్ చేసాము."

తేడా: బలమైన విధానం రెఫరీని మానవ యాంకర్‌తో ధృవీకరిస్తుంది, గుడ్డిగా కాదు. ధృవీకరించబడని LLM-రిఫరీ చక్కగా కనిపించేది కాని తప్పుడు విశ్వాసాన్ని ఇస్తుంది.

శ్రద్ధ: LLM-రిఫరీ కూడా ఒక మోడల్; హాలూసినోజెనిక్, పక్షపాతం (దీర్ఘ/నమ్మకమైన సమాధానాలకు అనుకూలంగా ఉంటుంది), అస్థిరంగా ఉండవచ్చు. ఉత్పత్తి నిర్ణయాలు తీసుకునే ముందు మానవ ట్యాగ్‌లతో రిఫరీ స్కోర్‌లను క్రమాంకనం చేయండి.

మూల్యాంకన సమితి: జాగ్రత్తగా రూపొందించబడింది

మంచి ఎవాల్ సెట్ వివిధ రకాల వాస్తవ వినియోగం మరియు కష్టమైన కేసులను సూచిస్తుంది. కేవలం సులభమైన ఉదాహరణలతో నిండిన ఎవాల్ మిమ్మల్ని తప్పుడు విశ్వాసంలో ఉంచుతుంది. దీన్ని ఎవాల్ క్లస్టర్‌లో ఉంచాలని నిర్ధారించుకోండి:

  • ఎడ్జ్ కేసులు: ఖాళీ ఇన్‌పుట్, చాలా పొడవైన ఇన్‌పుట్, అసాధారణ ఆకృతి.
  • తెలిసిన కఠినమైన కేసులు: మోడల్ గతంలో తప్పులు చేసిన ఉదాహరణలు (రిగ్రెషన్ పరీక్షగా).
  • భద్రతా సంఘటనలు: ప్రాంప్ట్ ఇంజెక్షన్ ప్రయత్నాలు, హానికరమైన అభ్యర్థనలు, గోప్యతా ఉల్లంఘన ఉచ్చులు.

ఎవాల్ క్లస్టర్ కాలక్రమేణా పెరుగుతుంది: ఉత్పత్తిలో మీరు పట్టుకున్న ప్రతి కొత్త బగ్ తదుపరి మూల్యాంకనానికి పరీక్షా సందర్భం అవుతుంది.

అలారం మరియు జోక్యం

అలారం లేకుండా మానిటరింగ్ అసంపూర్తిగా ఉంటుంది. ప్రతి ముఖ్యమైన కొలమానానికి థ్రెషోల్డ్ మరియు ప్రతిస్పందన ప్రణాళిక ఉండాలి: "ఇన్‌పుట్ డ్రిఫ్ట్ X కంటే ఎక్కువగా ఉంటే ఇంజనీర్‌కు తెలియజేయండి", "ఎర్రర్ రేట్ Y కంటే ఎక్కువగా ఉంటే ఆటో రోల్ బ్యాక్". అలారాలను అర్థవంతంగా ఉంచండి - చాలా తప్పుడు అలారాలు జట్టును డీసెన్‌సిటైజ్ చేస్తాయి మరియు వారు నిజమైన అలారంను కోల్పోయేలా చేస్తాయి.

మూడు చిన్న కేసులు

కేసు 1 - ముందస్తు హెచ్చరిక. డిమాండ్ సూచన మోడల్ యొక్క నిజమైన ఖచ్చితత్వం వారం చివరిలో మాత్రమే స్పష్టంగా కనిపిస్తుంది. బృందం ఇన్‌పుట్ పంపిణీని పర్యవేక్షిస్తోంది మరియు మంగళవారం కొత్త ఉత్పత్తి వర్గం యొక్క ఆకస్మిక పెరుగుదలను చూసింది - మోడల్ ఎప్పుడూ చూడనిది. వారు ఖచ్చితత్వం తగ్గుదల కోసం వేచి ఉండకుండా మోడల్‌ను నవీకరించారు. ఇన్‌పుట్ పర్యవేక్షణ రోజులు సేవ్ చేయబడ్డాయి.

కేసు 2 - ధృవీకరించని రిఫరీ. LLM-రివ్యూయర్ ఆధారంగా "మా నాణ్యత అద్భుతమైనది" అని ఒక బృందం నివేదించింది. కస్టమర్ ఫిర్యాదులు పెరిగినప్పుడు, మానవ పర్యవేక్షణ ప్రవేశపెట్టబడింది: రిఫరీ నమ్మకంగా కానీ తప్పు సమాధానాలను "మంచిది"గా లెక్కించారు. రిఫరీని మానవ ట్యాగ్‌లతో క్రమాంకనం చేసిన తర్వాత, నిజమైన నాణ్యత బహిర్గతమైంది మరియు చాలా తక్కువగా ఉంది. పాఠం: ధృవీకరించకుండా రిఫరీని విశ్వసించవద్దు.

కేసు 3 - రిగ్రెషన్ పరీక్ష. సత్వర మార్పు ఒక సమస్యను పరిష్కరించినప్పుడు మరొక సమస్యను నిశ్శబ్దంగా విచ్ఛిన్నం చేస్తుంది. కానీ జట్టు గత బగ్‌లను ఎవాల్ బకెట్‌లో ఉంచింది; ఈ క్లస్టర్‌లో కొత్త మార్పును పరీక్షించినప్పుడు, విరిగిన కేసును వెంటనే పట్టుకుని, మార్పు పరిష్కరించబడింది. పాఠం: ప్రతి స్థిర బగ్ శాశ్వత పరీక్ష కేసుగా మారాలి.

కాపీ చేయగల టెంప్లేట్లు

ఈ ప్రొడక్షన్ మోడల్ కోసం ట్రాకింగ్ ప్లాన్‌ను రూపొందించండి. కవర్ మూడు లేయర్‌లు:1) ఆపరేషనల్ (లేటెన్సీ, ఎర్రర్ రేట్, వాల్యూమ్)2) ఇన్‌పుట్/డేటా (డిస్ట్రిబ్యూషన్ షిఫ్ట్, మిస్సింగ్ వాల్యూ, కొత్త కేటగిరీ)3) మోడల్/అవుట్‌పుట్ (అంచనా పంపిణీ, విశ్వాసం, వీలైతే ఖచ్చితత్వం) మోడల్: [వివరణ]. వాస్తవ ఫలితం రావడానికి ఎంత సమయం పడుతుంది: [వ్యవధి]ప్రతి కొలమానానికి థ్రెషోల్డ్ మరియు జోక్య సిఫార్సులను జోడించండి.

ఈ LLM సిస్టమ్ కోసం మూల్యాంకన (eval) వ్యూహాన్ని ప్రతిపాదించండి. టాస్క్: [వివరణ]లేయర్‌లను నిర్ణయించండి:- ప్రతి అవుట్‌పుట్‌పై ఏ నియమ-ఆధారిత తనిఖీలు అమలు చేయాలి?- LLM-మధ్యవర్తి ఏ ప్రమాణాలను మూల్యాంకనం చేయాలి మరియు వాటిని ఎలా ధృవీకరించాలి (హ్యూమన్ యాంకర్)?- ఏ నమూనాలో మానవ మూల్యాంకనం మరియు భద్రతను నిర్ణయించాలి.

ఈ LLM-రిఫరీ ప్రాంప్ట్‌ని తనిఖీ చేయండి:- మూల్యాంకన ప్రమాణాలు స్పష్టంగా ఉన్నాయా లేదా ఆత్మాశ్రయంగా ఉన్నాయా?- ఇది పొడవు/విశ్వాస పక్షపాతానికి గురయ్యే అవకాశం ఉందా?- నేను మానవ ట్యాగ్‌లతో రిఫరీని ఎలా క్రమాంకనం చేయాలి? రిఫరీ ప్రాంప్ట్: [ప్రాంప్ట్]

ఈ పర్యవేక్షణ అలారం కోసం ప్రతిస్పందన రన్‌బుక్‌ను వ్రాయండి. అలారం: [ఉదా. ఇన్‌పుట్ డ్రిఫ్ట్ థ్రెషోల్డ్ మించిపోయింది]తప్పక కలిగి ఉండాలి: ప్రారంభ నియంత్రణ దశలు, సాధ్యమయ్యే కారణాలు, రోల్‌బ్యాక్ ప్రమాణాలు, ఎవరికి తెలియజేయాలి.

క్షీణత కారణం పట్టిక

వక్రీకరణ

లక్షణం

ముందస్తుగా గుర్తించే మార్గం

డేటా డ్రిఫ్ట్

ఇన్‌పుట్ పంపిణీ మార్పులు

ఇన్‌పుట్ పంపిణీ పర్యవేక్షణ

భావన మార్పు

ధర్మం నిశ్శబ్దంగా పడిపోతుంది

అంచనా + వాస్తవ పోలిక

అప్‌స్ట్రీమ్ లోపం

ఫీల్డ్‌లు ఖాళీగా మారతాయి/ఫార్మాట్ మార్పులు

స్కీమా ధ్రువీకరణ + తప్పిపోయిన రేటు

మోడల్ అస్థిరత

అవుట్‌పుట్ పంపిణీ మార్పులు

అవుట్‌పుట్ పంపిణీ పర్యవేక్షణ

సాధారణ తప్పులు

  • పర్యవేక్షణ ఏర్పాటు చేయడం లేదు. మోడల్ నిశ్శబ్దంగా విచ్ఛిన్నమవుతుంది, ఎవరూ చూడరు.
  • కార్యాచరణ కొలమానాలను మాత్రమే ట్రాక్ చేయండి. సిస్టమ్ అప్‌లో ఉంది, కానీ అంచనాలు తప్పు కావచ్చు.
  • రిఫరీని ధృవీకరించకుండా LLMని ఉపయోగించడం. ఇది తప్పుడు విశ్వాసాన్ని ఇస్తుంది.
  • సులభమైన ఉదాహరణలతో Eval. ఇది నిజమైన కష్టాన్ని సూచించదు.
  • ఈవాల్‌లో గత లోపాలను చేర్చలేదు. అదే లోపం మళ్లీ మళ్లీ వస్తుంది.
  • బిగ్గరగా అలారాలు. జట్టు అసంపూర్తిగా మారుతుంది, నిజమైన అలారం లేదు.

సారాంశంలో

ఉత్పత్తిలో లోపాలను కలిగించకుండా మోడల్ సరికాదు; కాబట్టి eval మరియు పర్యవేక్షణ అభివృద్ధి ఎంత ముఖ్యమైనదో. మూడు లేయర్‌లలో పర్యవేక్షణను ఏర్పాటు చేయండి (ఆపరేషనల్, ఇన్‌పుట్, అవుట్‌పుట్); అసలు ఫలితం ఆలస్యమైతే ముందస్తు హెచ్చరికగా ఇన్‌పుట్ డ్రిఫ్ట్‌ని ఉపయోగించండి. LLM సిస్టమ్స్‌లో, ఎవాల్ ఓపెన్-ఎండ్; నియమ తనిఖీలు, LLM-రిఫరీ మరియు మానవ మూల్యాంకనాన్ని కలిసి ఉపయోగించండి - అయితే LLM-రిఫరీని మానవ యాంకర్‌తో ధృవీకరించాలని నిర్ధారించుకోండి. ఎడ్జ్ మరియు సెక్యూరిటీ కేసులతో మీ Eval క్లస్టర్‌ను మెరుగుపరచండి మరియు దొరికిన ప్రతి లోపాన్ని శాశ్వత పరీక్ష కేసుగా మార్చండి.

అప్లికేషన్ టాస్క్

ఉత్పత్తి (లేదా ఉత్పత్తికి సమీపంలో) మోడల్ కోసం మూడు-పొర పర్యవేక్షణ ప్రణాళికను వ్రాయండి మరియు కనీసం ఒక ఇన్‌పుట్-పంపిణీ మెట్రిక్ కోసం థ్రెషోల్డ్ + అలారంను నిర్వచించండి. మీకు LLM సిస్టమ్ ఉంటే: మనుషులతో 30 అవుట్‌పుట్‌లను ట్యాగ్ చేయండి, అదే అవుట్‌పుట్‌లపై LLM-రిఫరీని అమలు చేయండి మరియు మానవ-రిఫరీ ఒప్పందాన్ని కొలవండి; రిఫరీ యొక్క క్రమబద్ధమైన పక్షపాతాన్ని గమనించండి. మీ ఎవాల్ క్లస్టర్‌కి కనీసం 3 అంచులు మరియు 2 భద్రతా కేసులను జోడించండి.

చెక్లిస్ట్

  • [ ] మానిటరింగ్ మూడు పొరలను (ఆపరేషనల్, ఇన్‌పుట్, అవుట్‌పుట్) కవర్ చేస్తుంది.
  • [ ] అసలు ఫలితం ఆలస్యం అయితే నేను ముందస్తు హెచ్చరికగా ఇన్‌పుట్ డ్రిఫ్ట్‌ని ఉపయోగిస్తాను.
  • [ ] నేను మానవ లేబుల్‌లతో LLM-మధ్యవర్తిని క్రమాంకనం చేసాను.
  • [ ] Eval క్లస్టర్ అంచు మరియు భద్రతా కేసులను కలిగి ఉంది.
  • [ ] నేను పట్టుకున్న ప్రతి బగ్‌ని శాశ్వత పరీక్ష కేసుగా మార్చాను.
  • [ ] ప్రతి ముఖ్యమైన కొలమానం థ్రెషోల్డ్ మరియు ప్రతిస్పందన ప్రణాళికను కలిగి ఉంటుంది.