లాభాలు:
- మోడల్ క్షీణతకు నిశ్శబ్ద కారణాలను గుర్తించే సామర్థ్యం (డేటా డ్రిఫ్ట్, కాన్సెప్ట్ డ్రిఫ్ట్, అప్స్ట్రీమ్ ఎర్రర్) మరియు మూడు-లేయర్ (ఆపరేషనల్, ఇన్పుట్, అవుట్పుట్) పర్యవేక్షణను ఏర్పాటు చేయడం
- నియమ తనిఖీలు, LLM-రిఫరీ మరియు మానవ మూల్యాంకనంతో బహుళ లేయర్లలో LLM సిస్టమ్లను మూల్యాంకనం చేయగల సామర్థ్యం మరియు LLM-రిఫరీ హ్యూమన్ యాంకర్తో క్రమాంకనం చేయడం
- ఎడ్జ్ మరియు సెక్యూరిటీ కేసులను కలిగి ఉన్న ఎవాల్ సెట్ని డిజైన్ చేయగల సామర్థ్యం మరియు ప్రతి క్యాచ్ ఎర్రర్ను శాశ్వత పరీక్ష కేసుగా మార్చడం
ఒక మోడల్ ఉత్పత్తికి వెళ్ళిన తర్వాత, మీ పని పూర్తి కాదు; అసలు బాధ్యత ఇప్పుడే ప్రారంభమవుతుంది. ఎందుకంటే ఎవరూ చూడనప్పుడు మోడల్ నిశ్శబ్దంగా విరిగిపోతుంది. ఈ యూనిట్లో, మేము రెండు పరిపూరకరమైన విభాగాలను కవర్ చేస్తాము: మూల్యాంకనం (మోడల్ నాణ్యతను క్రమపద్ధతిలో కొలవడం) మరియు పర్యవేక్షణ (ఉత్పత్తిలో మోడల్ యొక్క స్థిరమైన పర్యవేక్షణ). ప్రత్యేకించి LLM సిస్టమ్లలో, eval అనేది చాలా కష్టం మరియు క్లాసికల్ ML కంటే ఎక్కువ జాగ్రత్త అవసరం.
ఎందుకు ఉత్పత్తి నమూనా నిశ్శబ్దంగా విచ్ఛిన్నం అవుతోంది
బగ్ క్రాష్ అవుతుంది, లాగ్ ప్రింట్ అవుతుంది, అలారం ఆఫ్ అవుతుంది. మరోవైపు, ML మోడల్ లోపాలను కలిగించకుండా తప్పు కావచ్చు. క్షీణతకు మూడు ప్రధాన కారణాలు:
- డేటా డ్రిఫ్ట్: ఇన్పుట్ డేటా పంపిణీ కాలానుగుణంగా మారుతుంది (కొత్త ఉత్పత్తులు, మారుతున్న వినియోగదారు ప్రవర్తన, కాలానుగుణత). మోడల్ అలాగే ఉంటుంది కానీ ప్రపంచం మారుతుంది.
- కాన్సెప్ట్ డ్రిఫ్ట్: ఇన్పుట్-అవుట్పుట్ సంబంధం మారుతుంది. మోసపూరిత వ్యూహాలు మరియు స్పామ్ నమూనాలు అభివృద్ధి చెందుతాయి; నిన్న సరైనది నేడు తప్పు అవుతుంది.
- అప్స్ట్రీమ్ అవినీతి: డేటా సోర్స్ ఆకృతిని మారుస్తుంది, ఒక ప్రాంతం ఉచితం; పాడైన ఇన్పుట్తో మోడల్ నిశ్శబ్దంగా డ్రోల్ చేస్తుంది.
ట్రేసింగ్ ఈ నిశ్శబ్ద వక్రీకరణలను వినిపించేలా చేస్తోంది.
ఏమి చూడాలి: మూడు పొరలు
మంచి పర్యవేక్షణ మూడు పొరలను కలిగి ఉంటుంది:
- కార్యాచరణ కొలమానాలు: జాప్యం, లోపం రేటు, అభ్యర్థన వాల్యూమ్, వనరుల వినియోగం. "వ్యవస్థ నిలబడి ఉందా?"
- డేటా/ఇన్పుట్ మెట్రిక్లు: ఇన్పుట్ పంపిణీ శిక్షణలో ఉన్నట్లే ఉందా? మిస్సింగ్ విలువ రేటు పెరిగిందా? కొత్త వర్గాలు వచ్చాయా? "మోడల్ తెలిసిన డేటాను చూస్తుందా?"
- మోడల్/అవుట్పుట్ కొలమానాలు: అంచనా పంపిణీ లాగ్? కాన్ఫిడెన్స్ స్కోర్లు పడిపోయాయా? మరియు వీలైతే, గ్రౌండ్ ట్రూత్తో పోలిస్తే కచ్చితత్వం ఏమిటి? "మోడల్ ఇప్పటికీ ఖచ్చితమైనదేనా?"
మూడవ పొర అత్యంత విలువైనది కానీ చాలా కష్టం; ఎందుకంటే నిజమైన ఫలితం సాధారణంగా ఆలస్యంతో వస్తుంది (రుణం తిరిగి చెల్లించబడుతుందా లేదా అనేది నెలల తర్వాత స్పష్టమవుతుంది).
చిట్కా: అసలు ఫలితం ఆలస్యం అయితే, ముందుగా ఇన్పుట్ మరియు ప్రిడిక్షన్ పంపిణీని పర్యవేక్షించండి. ఇన్పుట్ పంపిణీని మార్చడం అనేది ఖచ్చితత్వం క్షీణతకు ముందస్తు సంకేతం మరియు వాస్తవ ఫలితం కోసం వేచి ఉండకుండా అలారంను పెంచవచ్చు.
LLM వ్యవస్థలను మూల్యాంకనం చేయడం: ప్రత్యేక సవాలు
క్లాసికల్ MLలో, "సరైన సమాధానం" స్పష్టంగా ఉంటుంది (తరగతి 0 లేదా 1). మరోవైపు, LLM ఫలితం ఓపెన్-ఎండ్: ఒకే ప్రశ్నకు చాలా సరైన సమాధానాలు ఉండవచ్చు, "సరైనత" అనేది ఒకే సంఖ్యకు సరిపోదు. LLM eval విధానాలు:
- సూచించిన కొలమానాలు: అవుట్పుట్ను ఆదర్శ సమాధానంతో పోల్చడం. పరిమిత; ఎందుకంటే ఇది విభిన్నంగా వ్యక్తీకరించబడిన సరైన సమాధానాన్ని "తప్పు"గా పరిగణించవచ్చు.
- నియమాల ఆధారిత తనిఖీలు: అవుట్పుట్ చెల్లుబాటు అయ్యే JSON? నిషేధించబడిన పదాలు ఏమైనా ఉన్నాయా? ఇది కావలసిన ఫీల్డ్లను కలిగి ఉందా? చౌక, నమ్మదగిన, గట్టి.
- LLM- న్యాయమూర్తి (LLM- న్యాయమూర్తి): "ఈ ప్రమాణం ప్రకారం ఈ సమాధానం మంచిదేనా?" అని మోడల్ను అడగవద్దు. ఇది స్కేల్ అవుతుంది, కానీ రిఫరీ స్వయంగా ధృవీకరించబడాలి.
- మానవ సమీక్ష: గోల్డ్ స్టాండర్డ్ కానీ ఖరీదైనది మరియు నెమ్మదిగా ఉంటుంది. ఇది నమూనాలో ఉపయోగించబడుతుంది.
ఆచరణలో ఇవి కలిసి ఉపయోగించబడతాయి: ప్రతి అవుట్పుట్పై చౌక నియమాల తనిఖీలు, పెద్ద నమూనాపై LLM-న్యాయమూర్తి, చిన్నదైన కానీ కఠినమైన నమూనాపై మానవ మూల్యాంకనం.
బలహీనమైన విధానం / బలమైన విధానం
బలహీనం: "LLM-నేను రిఫరీని అడిగాను, మా సమాధానాలలో 92% బాగున్నాయి. సిస్టమ్ చాలా బాగుంది."
Güçlü: "మేము మొదట 100 ప్రింట్అవుట్లను మానవ-లేబుల్ చేసాము. మేము అదే 100 ప్రింట్అవుట్లపై LLM-జడ్జిని నడిపాము మరియు మానవ-న్యాయమూర్తి ఒప్పందాన్ని కొలిచాము - 85% ఒప్పందం, ఆమోదయోగ్యమైనది. న్యాయమూర్తి క్రమపద్ధతిలో ఎక్కడ తప్పు చేశారో (దీర్ఘ సమాధానాలను అన్యాయంగా కనుగొనే ధోరణి) మేము డాక్యుమెంట్ చేసాము మరియు న్యాయమూర్తులు అతని స్కోర్ను ప్రాంప్ట్ చేసాము."
తేడా: బలమైన విధానం రెఫరీని మానవ యాంకర్తో ధృవీకరిస్తుంది, గుడ్డిగా కాదు. ధృవీకరించబడని LLM-రిఫరీ చక్కగా కనిపించేది కాని తప్పుడు విశ్వాసాన్ని ఇస్తుంది.
శ్రద్ధ: LLM-రిఫరీ కూడా ఒక మోడల్; హాలూసినోజెనిక్, పక్షపాతం (దీర్ఘ/నమ్మకమైన సమాధానాలకు అనుకూలంగా ఉంటుంది), అస్థిరంగా ఉండవచ్చు. ఉత్పత్తి నిర్ణయాలు తీసుకునే ముందు మానవ ట్యాగ్లతో రిఫరీ స్కోర్లను క్రమాంకనం చేయండి.
మూల్యాంకన సమితి: జాగ్రత్తగా రూపొందించబడింది
మంచి ఎవాల్ సెట్ వివిధ రకాల వాస్తవ వినియోగం మరియు కష్టమైన కేసులను సూచిస్తుంది. కేవలం సులభమైన ఉదాహరణలతో నిండిన ఎవాల్ మిమ్మల్ని తప్పుడు విశ్వాసంలో ఉంచుతుంది. దీన్ని ఎవాల్ క్లస్టర్లో ఉంచాలని నిర్ధారించుకోండి:
- ఎడ్జ్ కేసులు: ఖాళీ ఇన్పుట్, చాలా పొడవైన ఇన్పుట్, అసాధారణ ఆకృతి.
- తెలిసిన కఠినమైన కేసులు: మోడల్ గతంలో తప్పులు చేసిన ఉదాహరణలు (రిగ్రెషన్ పరీక్షగా).
- భద్రతా సంఘటనలు: ప్రాంప్ట్ ఇంజెక్షన్ ప్రయత్నాలు, హానికరమైన అభ్యర్థనలు, గోప్యతా ఉల్లంఘన ఉచ్చులు.
ఎవాల్ క్లస్టర్ కాలక్రమేణా పెరుగుతుంది: ఉత్పత్తిలో మీరు పట్టుకున్న ప్రతి కొత్త బగ్ తదుపరి మూల్యాంకనానికి పరీక్షా సందర్భం అవుతుంది.
అలారం మరియు జోక్యం
అలారం లేకుండా మానిటరింగ్ అసంపూర్తిగా ఉంటుంది. ప్రతి ముఖ్యమైన కొలమానానికి థ్రెషోల్డ్ మరియు ప్రతిస్పందన ప్రణాళిక ఉండాలి: "ఇన్పుట్ డ్రిఫ్ట్ X కంటే ఎక్కువగా ఉంటే ఇంజనీర్కు తెలియజేయండి", "ఎర్రర్ రేట్ Y కంటే ఎక్కువగా ఉంటే ఆటో రోల్ బ్యాక్". అలారాలను అర్థవంతంగా ఉంచండి - చాలా తప్పుడు అలారాలు జట్టును డీసెన్సిటైజ్ చేస్తాయి మరియు వారు నిజమైన అలారంను కోల్పోయేలా చేస్తాయి.
మూడు చిన్న కేసులు
కేసు 1 - ముందస్తు హెచ్చరిక. డిమాండ్ సూచన మోడల్ యొక్క నిజమైన ఖచ్చితత్వం వారం చివరిలో మాత్రమే స్పష్టంగా కనిపిస్తుంది. బృందం ఇన్పుట్ పంపిణీని పర్యవేక్షిస్తోంది మరియు మంగళవారం కొత్త ఉత్పత్తి వర్గం యొక్క ఆకస్మిక పెరుగుదలను చూసింది - మోడల్ ఎప్పుడూ చూడనిది. వారు ఖచ్చితత్వం తగ్గుదల కోసం వేచి ఉండకుండా మోడల్ను నవీకరించారు. ఇన్పుట్ పర్యవేక్షణ రోజులు సేవ్ చేయబడ్డాయి.
కేసు 2 - ధృవీకరించని రిఫరీ. LLM-రివ్యూయర్ ఆధారంగా "మా నాణ్యత అద్భుతమైనది" అని ఒక బృందం నివేదించింది. కస్టమర్ ఫిర్యాదులు పెరిగినప్పుడు, మానవ పర్యవేక్షణ ప్రవేశపెట్టబడింది: రిఫరీ నమ్మకంగా కానీ తప్పు సమాధానాలను "మంచిది"గా లెక్కించారు. రిఫరీని మానవ ట్యాగ్లతో క్రమాంకనం చేసిన తర్వాత, నిజమైన నాణ్యత బహిర్గతమైంది మరియు చాలా తక్కువగా ఉంది. పాఠం: ధృవీకరించకుండా రిఫరీని విశ్వసించవద్దు.
కేసు 3 - రిగ్రెషన్ పరీక్ష. సత్వర మార్పు ఒక సమస్యను పరిష్కరించినప్పుడు మరొక సమస్యను నిశ్శబ్దంగా విచ్ఛిన్నం చేస్తుంది. కానీ జట్టు గత బగ్లను ఎవాల్ బకెట్లో ఉంచింది; ఈ క్లస్టర్లో కొత్త మార్పును పరీక్షించినప్పుడు, విరిగిన కేసును వెంటనే పట్టుకుని, మార్పు పరిష్కరించబడింది. పాఠం: ప్రతి స్థిర బగ్ శాశ్వత పరీక్ష కేసుగా మారాలి.
కాపీ చేయగల టెంప్లేట్లు
ఈ ప్రొడక్షన్ మోడల్ కోసం ట్రాకింగ్ ప్లాన్ను రూపొందించండి. కవర్ మూడు లేయర్లు:1) ఆపరేషనల్ (లేటెన్సీ, ఎర్రర్ రేట్, వాల్యూమ్)2) ఇన్పుట్/డేటా (డిస్ట్రిబ్యూషన్ షిఫ్ట్, మిస్సింగ్ వాల్యూ, కొత్త కేటగిరీ)3) మోడల్/అవుట్పుట్ (అంచనా పంపిణీ, విశ్వాసం, వీలైతే ఖచ్చితత్వం) మోడల్: [వివరణ]. వాస్తవ ఫలితం రావడానికి ఎంత సమయం పడుతుంది: [వ్యవధి]ప్రతి కొలమానానికి థ్రెషోల్డ్ మరియు జోక్య సిఫార్సులను జోడించండి.
ఈ LLM సిస్టమ్ కోసం మూల్యాంకన (eval) వ్యూహాన్ని ప్రతిపాదించండి. టాస్క్: [వివరణ]లేయర్లను నిర్ణయించండి:- ప్రతి అవుట్పుట్పై ఏ నియమ-ఆధారిత తనిఖీలు అమలు చేయాలి?- LLM-మధ్యవర్తి ఏ ప్రమాణాలను మూల్యాంకనం చేయాలి మరియు వాటిని ఎలా ధృవీకరించాలి (హ్యూమన్ యాంకర్)?- ఏ నమూనాలో మానవ మూల్యాంకనం మరియు భద్రతను నిర్ణయించాలి.
ఈ LLM-రిఫరీ ప్రాంప్ట్ని తనిఖీ చేయండి:- మూల్యాంకన ప్రమాణాలు స్పష్టంగా ఉన్నాయా లేదా ఆత్మాశ్రయంగా ఉన్నాయా?- ఇది పొడవు/విశ్వాస పక్షపాతానికి గురయ్యే అవకాశం ఉందా?- నేను మానవ ట్యాగ్లతో రిఫరీని ఎలా క్రమాంకనం చేయాలి? రిఫరీ ప్రాంప్ట్: [ప్రాంప్ట్]
ఈ పర్యవేక్షణ అలారం కోసం ప్రతిస్పందన రన్బుక్ను వ్రాయండి. అలారం: [ఉదా. ఇన్పుట్ డ్రిఫ్ట్ థ్రెషోల్డ్ మించిపోయింది]తప్పక కలిగి ఉండాలి: ప్రారంభ నియంత్రణ దశలు, సాధ్యమయ్యే కారణాలు, రోల్బ్యాక్ ప్రమాణాలు, ఎవరికి తెలియజేయాలి.
క్షీణత కారణం పట్టిక
వక్రీకరణ
లక్షణం
ముందస్తుగా గుర్తించే మార్గం
డేటా డ్రిఫ్ట్
ఇన్పుట్ పంపిణీ మార్పులు
ఇన్పుట్ పంపిణీ పర్యవేక్షణ
భావన మార్పు
ధర్మం నిశ్శబ్దంగా పడిపోతుంది
అంచనా + వాస్తవ పోలిక
అప్స్ట్రీమ్ లోపం
ఫీల్డ్లు ఖాళీగా మారతాయి/ఫార్మాట్ మార్పులు
స్కీమా ధ్రువీకరణ + తప్పిపోయిన రేటు
మోడల్ అస్థిరత
అవుట్పుట్ పంపిణీ మార్పులు
అవుట్పుట్ పంపిణీ పర్యవేక్షణ
సాధారణ తప్పులు
- పర్యవేక్షణ ఏర్పాటు చేయడం లేదు. మోడల్ నిశ్శబ్దంగా విచ్ఛిన్నమవుతుంది, ఎవరూ చూడరు.
- కార్యాచరణ కొలమానాలను మాత్రమే ట్రాక్ చేయండి. సిస్టమ్ అప్లో ఉంది, కానీ అంచనాలు తప్పు కావచ్చు.
- రిఫరీని ధృవీకరించకుండా LLMని ఉపయోగించడం. ఇది తప్పుడు విశ్వాసాన్ని ఇస్తుంది.
- సులభమైన ఉదాహరణలతో Eval. ఇది నిజమైన కష్టాన్ని సూచించదు.
- ఈవాల్లో గత లోపాలను చేర్చలేదు. అదే లోపం మళ్లీ మళ్లీ వస్తుంది.
- బిగ్గరగా అలారాలు. జట్టు అసంపూర్తిగా మారుతుంది, నిజమైన అలారం లేదు.
సారాంశంలో
ఉత్పత్తిలో లోపాలను కలిగించకుండా మోడల్ సరికాదు; కాబట్టి eval మరియు పర్యవేక్షణ అభివృద్ధి ఎంత ముఖ్యమైనదో. మూడు లేయర్లలో పర్యవేక్షణను ఏర్పాటు చేయండి (ఆపరేషనల్, ఇన్పుట్, అవుట్పుట్); అసలు ఫలితం ఆలస్యమైతే ముందస్తు హెచ్చరికగా ఇన్పుట్ డ్రిఫ్ట్ని ఉపయోగించండి. LLM సిస్టమ్స్లో, ఎవాల్ ఓపెన్-ఎండ్; నియమ తనిఖీలు, LLM-రిఫరీ మరియు మానవ మూల్యాంకనాన్ని కలిసి ఉపయోగించండి - అయితే LLM-రిఫరీని మానవ యాంకర్తో ధృవీకరించాలని నిర్ధారించుకోండి. ఎడ్జ్ మరియు సెక్యూరిటీ కేసులతో మీ Eval క్లస్టర్ను మెరుగుపరచండి మరియు దొరికిన ప్రతి లోపాన్ని శాశ్వత పరీక్ష కేసుగా మార్చండి.
అప్లికేషన్ టాస్క్
ఉత్పత్తి (లేదా ఉత్పత్తికి సమీపంలో) మోడల్ కోసం మూడు-పొర పర్యవేక్షణ ప్రణాళికను వ్రాయండి మరియు కనీసం ఒక ఇన్పుట్-పంపిణీ మెట్రిక్ కోసం థ్రెషోల్డ్ + అలారంను నిర్వచించండి. మీకు LLM సిస్టమ్ ఉంటే: మనుషులతో 30 అవుట్పుట్లను ట్యాగ్ చేయండి, అదే అవుట్పుట్లపై LLM-రిఫరీని అమలు చేయండి మరియు మానవ-రిఫరీ ఒప్పందాన్ని కొలవండి; రిఫరీ యొక్క క్రమబద్ధమైన పక్షపాతాన్ని గమనించండి. మీ ఎవాల్ క్లస్టర్కి కనీసం 3 అంచులు మరియు 2 భద్రతా కేసులను జోడించండి.
చెక్లిస్ట్
- [ ] మానిటరింగ్ మూడు పొరలను (ఆపరేషనల్, ఇన్పుట్, అవుట్పుట్) కవర్ చేస్తుంది.
- [ ] అసలు ఫలితం ఆలస్యం అయితే నేను ముందస్తు హెచ్చరికగా ఇన్పుట్ డ్రిఫ్ట్ని ఉపయోగిస్తాను.
- [ ] నేను మానవ లేబుల్లతో LLM-మధ్యవర్తిని క్రమాంకనం చేసాను.
- [ ] Eval క్లస్టర్ అంచు మరియు భద్రతా కేసులను కలిగి ఉంది.
- [ ] నేను పట్టుకున్న ప్రతి బగ్ని శాశ్వత పరీక్ష కేసుగా మార్చాను.
- [ ] ప్రతి ముఖ్యమైన కొలమానం థ్రెషోల్డ్ మరియు ప్రతిస్పందన ప్రణాళికను కలిగి ఉంటుంది.