లాభాలు:
- ఎండ్-టు-ఎండ్ ఎంటర్ప్రైజ్ RAG అసిస్టెంట్ యొక్క భాగాలు మరియు డేటా ఫ్లో రూపకల్పన
- బహుళ-సోర్స్ డేటా (వికీ, టికెట్, PDF, డేటాబేస్)ని ఒకే అసిస్టెంట్గా కలపడం
- స్కేలబిలిటీ, కాషింగ్ మరియు జాప్యం కోసం నిర్మాణ నిర్ణయాలు తీసుకోండి
మునుపటి యూనిట్లలో, మేము భాగాలను ఒక్కొక్కటిగా నేర్చుకున్నాము: పొందుపరచడం, వెక్టార్ డేటాబేస్, చంకింగ్, తిరిగి పొందడం. ఇప్పుడు వీటిని మిళితం చేసి, మీ స్వంత కంపెనీ డేటాతో మాట్లాడే అసిస్టెంట్ యొక్క ఎండ్-టు-ఎండ్ ఆర్కిటెక్చర్ను రూపొందిద్దాం. "మా సెలవు విధానం ఏమిటి?" అని ఒక ఉద్యోగి అడగడం లక్ష్యం. వ్యక్తులు ప్రశ్నలు అడగగలిగే వ్యవస్థ, సమాధానాలు నిజమైన అంతర్గత పత్రాలు, అనులేఖనాలు మరియు బహుళ డేటా మూలాలను కలిపి ఉంటాయి. ఈ యూనిట్ మొత్తం ఆర్కిటెక్చర్, డేటా ఫ్లో మరియు ఉత్పత్తి స్థాయి నిర్ణయాలను ప్రాసెస్ చేస్తుంది.
ఎండ్-టు-ఎండ్ భాగాలు
కార్పొరేట్ RAG అసిస్టెంట్ రెండు వేర్వేరు లైన్లను కలిగి ఉంటుంది. ఇండెక్సింగ్ లైన్ (ఆఫ్లైన్) డేటాను సిద్ధం చేస్తుంది; ప్రశ్న లైన్ (ఆన్లైన్) ప్రశ్నకు సమాధానం ఇస్తుంది.
ఇండెక్సింగ్ లైన్ భాగాలు:
- కనెక్టర్లు: మూలాధారాల నుండి డేటాను లాగే కనెక్టర్లు — వికీ, టిక్కెట్ సిస్టమ్, ఫైల్ స్టోర్, డేటాబేస్, ఇమెయిల్.
- సాధారణీకరణ: వివిధ ఫార్మాట్లను (PDF, HTML, DOCX) క్లీన్ టెక్స్ట్గా మార్చడం; హెడర్/ఫుటర్ క్లీనింగ్.
- చంకింగ్ + మెటాడేటా: చంకింగ్ మరియు ట్యాగింగ్ (మూలం, తేదీ, అధికారం).
- పొందుపరచడం + లోడింగ్: వెక్టర్ డేటాబేస్లో వెక్టర్స్ మరియు మెటాడేటా రాయడం.
ప్రశ్న పైప్లైన్ భాగాలు:
- ప్రశ్న ప్రిప్రాసెసింగ్: తిరిగి వ్రాయడం, వికేంద్రీకరణ.
- తిరిగి పొందడం: హైబ్రిడ్ శోధన + మెటాడేటా ఫిల్టర్ + రీ-ర్యాంకింగ్.
- ప్రాంప్ట్ సృష్టి: టెంప్లేట్లో సందర్భం + ప్రశ్న + సూచనలను ఉంచడం.
- జనరేషన్: మోడల్ + మూలాల నుండి గ్రౌండెడ్ (సందర్భ) సమాధానం.
- పోస్ట్-ప్రాసెసింగ్: సైటేషన్ ఫార్మాటింగ్, సెక్యూరిటీ చెక్, లాగింగ్.
చిట్కా: ప్రశ్న లైన్ నుండి ఇండెక్సింగ్ లైన్ను భౌతికంగా వేరు చేయండి. ఇండెక్సింగ్ నెమ్మదిగా మరియు కాలానుగుణంగా ఉంటుంది (రాత్రిపూట బ్యాచ్లలో నడుస్తుంది); విచారణ లైన్ తేలికగా మరియు తక్షణమే ఉండాలి. వినియోగదారు వేచి ఉన్న సమయంలో రెండు లైన్లను కలపడం వలన భారీ ప్రాసెసింగ్ జరుగుతుంది.
డేటా ఫ్లోను దృశ్యమానం చేయడం
[ఇండెక్సింగ్ - ఆఫ్లైన్]వనరులు → సాధారణీకరించండి → భాగం+మెటాడేటా → పొందుపరచండి → వెక్టర్ DB (వికీ, టికెట్, PDF, DB)[QUERY - ఆన్లైన్]యూజర్ ప్రశ్న → ప్రీ-ప్రాసెసింగ్ → తిరిగి పొందడం (హైబ్రిడ్+ఫిల్టర్+రీమ్ప్) (సందర్భం+ప్రశ్న+సూచన) → మోడల్ → సమాధానం+మూలం → వినియోగదారు
బహుళ-మూల డేటాను కలపడం
నిజమైన కంపెనీలలో, సమాధానం ఒకే చోట ఆగదు. "కస్టమర్కు రీఫండ్ ఎలా జారీ చేయాలి?" ప్రశ్నకు సమాధానాన్ని సహాయ కథనం (విధానం), టిక్కెట్ చరిత్ర (వాస్తవ ఉదాహరణలు) మరియు పాలసీ PDF (నియమాలు) రెండింటిలోనూ కనుగొనవచ్చు. సహాయకుడు వాటన్నింటినీ ఒకే కొలనులో వెతకాలి.
కీలకమైన అంశం: వనరులను ఒకే వెక్టార్ స్టోర్లో కలిపినప్పుడు, ప్రతి షార్డ్ తప్పనిసరిగా `సోర్స్_టూర్` మెటాడేటాను కలిగి ఉండాలి. కాబట్టి మీరు వాటన్నింటినీ శోధించవచ్చు మరియు అవసరమైతే "అధికారిక విధానాలను మాత్రమే తీసుకురండి" వంటి వాటిని ఫిల్టర్ చేయవచ్చు. అలాగే, వివిధ మూలాధారాలు వివిధ స్థాయిల విశ్వసనీయతను కలిగి ఉంటాయి: అధికారిక విధానం > సహాయ కథనం > ఉద్యోగి టిక్కెట్ నోట్. మీరు ఈ ప్రాధాన్యతను రీ-ర్యాంకింగ్ లేదా ప్రాంప్ట్లో పేర్కొనవచ్చు.
మూలం
కంటెంట్ రకం
నమ్మకం
అప్డేట్ ఫ్రీక్వెన్సీ
విధానం PDF
అధికారిక నియమం
అధిక
నెలవారీ
సహాయ కథనం
విధానము
మధ్యస్థ-ఎక్కువ
వారానికోసారి
టిక్కెట్ చరిత్ర
నిజమైన నమూనా
మధ్యస్థ
నిరంతర
వికీ
మిక్స్డ్/కరెంట్ నోట్
వేరియబుల్
నిరంతర
స్కేలబిలిటీ, కాష్ మరియు జాప్యం
ఉత్పత్తిలో మూడు సమస్యలు ప్రత్యేకంగా ఉన్నాయి. జాప్యం: వినియోగదారు 2 సెకన్ల కంటే ఎక్కువ వేచి ఉన్నప్పుడు అనుభవం క్షీణిస్తుంది. పరిష్కారం: స్ట్రీమింగ్ రూపంలో సమాధానాన్ని ప్రదర్శించండి - మోడల్ వ్రాసేటప్పుడు ఇది స్క్రీన్పై పోస్తారు. కాష్: తరచుగా అడిగే ప్రశ్నలు మరియు పునరావృత సందర్భాల కోసం, కాష్ రెండూ వేగాన్ని పెంచుతాయి మరియు ధరను తగ్గిస్తాయి. స్కేల్: వినియోగదారు పెరిగేకొద్దీ, తిరిగి పొందడం మరియు మోడల్ కాల్లను క్షితిజ సమాంతరంగా స్కేల్ చేయడం అవసరం.
ఖర్చు వైపు బొటనవేలు నియమం: అత్యంత ఖరీదైన దశ సాధారణంగా పెద్ద మోడల్కు వెళ్లే టోకెన్ల సంఖ్య. అందువల్ల, రీ-ర్యాంకింగ్ ద్వారా సందర్భాన్ని 4 మంచి భాగాలకు తగ్గించడం నాణ్యత మరియు ధర రెండింటినీ మెరుగుపరుస్తుంది. సాధారణ వర్గీకరణ లేదా రూటింగ్ కోసం చిన్న/వేగవంతమైన మోడల్ను ఉపయోగించడం మరియు తుది సమాధానం కోసం మరింత శక్తివంతమైన మోడల్ను ఉపయోగించడం సాధారణ రూపకల్పన (ఉదా. క్లాడ్-ఓపస్-4-8).
జాగ్రత్త: ఇండెక్సింగ్ని "ఒకసారి చేయండి, మర్చిపోండి" అని సెటప్ చేయవద్దు. పత్రాలు మార్చబడ్డాయి, తొలగించబడ్డాయి, జోడించబడ్డాయి. రీ-ఇండెక్సింగ్ వ్యూహాన్ని ఏర్పరచండి: మారిన పత్రాలను గుర్తించి వాటిని మాత్రమే రీప్రాసెస్ చేయండి. పాత సూచిక ప్రస్తుతము కనిపించే సమాధానాన్ని ఉత్పత్తి చేస్తుంది కానీ తప్పు.
బలహీనమైన నిర్మాణం / బలమైన నిర్మాణం
బలహీనం (ఒకే స్క్రిప్ట్, ప్రతిదీ మిశ్రమంగా ఉంటుంది):
వినియోగదారు అడిగినప్పుడు: ఆ సమయంలో పత్రాలను చదవండి, వాటిని ముక్కలు చేయండి, వాటిని పొందుపరచండి, వాటిని శోధించండి, వాటికి సమాధానం ఇవ్వండి.# సమస్య: ప్రతి ప్రశ్నకు అన్ని సూచికలు పునరావృతమవుతాయి; సెకన్ల ఆలస్యం, # మూలాధార విభజన లేదు, ఫిల్టర్ లేదు, రిఫ్రెష్ లేదు.
శక్తివంతమైన (స్ప్లిట్ పైపులు + మెటాడేటా + కాష్ + స్ట్రీమింగ్):
ఇండెక్సింగ్: బ్యాచ్ రాత్రిపూట నడుస్తుంది, మార్చబడిన పత్రాలను రిఫ్రెష్ చేస్తుంది. ప్రశ్న: తేలికైన లైన్ — ప్రీ-ప్రాసెసింగ్ → హైబ్రిడ్ రిట్రీవల్+ఫిల్టర్ → రీర్యాంక్ → ప్రాంప్ట్ → మోడల్ (స్ట్రీమింగ్) → citation → లాగ్. తరచుగా అడిగే ప్రశ్నలు మరియు మూలం కాష్ చేయబడతాయి.
మూడు మినీ కేసులు
కేస్ 1 - గందరగోళ పంక్తి, భారీ ఆలస్యం. ఒక స్టార్టప్ ప్రతి ప్రశ్నతో PDFలను తిరిగి ప్రాసెస్ చేసే స్క్రిప్ట్ను వ్రాసింది; ప్రతి సమాధానానికి సగటున 11 సెకన్లు పట్టింది. ఇండెక్సింగ్ లైన్ వేరు చేయబడినప్పుడు మరియు డేటా గతంలో వెక్టర్ స్టోర్కు బదిలీ చేయబడినప్పుడు, ప్రశ్న సమయం 1.3 సెకన్లకు తగ్గింది మరియు స్ట్రీమింగ్తో, "మొదటి పదం" 400 msలో కనిపించింది.
కేస్ 2 — చాలా ఎక్కువ వనరులు, తప్పు ప్రాధాన్యత. ఒక సపోర్ట్ అసిస్టెంట్ పాలసీ PDF మరియు పాత టిక్కెట్ నోట్లకు సమాన బరువును ఇచ్చారు; మోడల్ కొన్నిసార్లు అధికారిక నియమంగా రెండు సంవత్సరాల క్రితం నుండి ఉద్యోగి యొక్క తప్పు రేటింగ్ను అందించింది. source_tour మెటాడేటా మరియు "వివాదం ఉన్నట్లయితే అధికారిక విధానాన్ని పరిగణించండి" సూచనలను ప్రాంప్ట్కు జోడించినప్పుడు, తప్పుడు-ప్రాధాన్యత లోపాలు 89% తగ్గాయి.
కేసు 3 - పాత సూచిక. ఒక HR అసిస్టెంట్ 3 నెలలుగా అప్డేట్ చేయని ఇండెక్స్తో పని చేస్తున్నారు; సెలవుల విధానం మారింది, కానీ అసిస్టెంట్ పాత రోజులు చెబుతున్నాడు. మార్చబడిన ఫైల్లను గుర్తించే రోజువారీ రిఫ్రెష్ ఇన్స్టాల్ చేయబడినప్పుడు, ప్రస్తుత ప్రతిస్పందన రేటు 70% నుండి 99%కి పెరిగింది.
సాధారణ తప్పులు
- ఇండెక్సింగ్ మరియు క్వెరీ లైన్లను కలపడం: వినియోగదారు వేచి ఉన్నప్పుడు భారీ ప్రాసెసింగ్ జరుగుతుంది; ఆలస్యం పేలుతుంది.
- మెటాడేటాలో సోర్స్ రకాన్ని ఉంచడం లేదు: ప్రాధాన్యత మరియు ఫిల్టరింగ్ లేదు; అవిశ్వసనీయ మూలం అధికారికమైనదిగా కనిపిస్తుంది.
- రిఫ్రెష్ వ్యూహాన్ని ఏర్పాటు చేయడం లేదు: సూచిక పాతదిగా మారుతుంది; కరెంట్గా కనిపించే తప్పు సమాధానాలు ఉత్పత్తి చేయబడ్డాయి.
- స్ట్రీమింగ్ను దాటవేయి: వినియోగదారు ఖాళీ స్క్రీన్ని చూస్తారు; గ్రహించిన ఆలస్యం ఎక్కువ అవుతుంది.
- ప్రతి దశలో అతిపెద్ద మోడల్ను ఉపయోగించడం: ఖర్చు అనవసరంగా పెరుగుతుంది; స్టీరింగ్ను చిన్న మోడల్కు వదిలివేయండి.
సారాంశంలో
- కార్పొరేట్ RAG అసిస్టెంట్ రెండు వేర్వేరు లైన్లను కలిగి ఉంటుంది: ఆఫ్లైన్ ఇండెక్సింగ్ మరియు ఆన్లైన్ ప్రశ్న; వాటిని భౌతికంగా వేరు చేయండి.
- ఇండెక్సింగ్ = కనెక్టర్ + సాధారణీకరణ + భాగం/మెటాడేటా + పొందుపరచడం/అప్లోడ్ చేయడం; ప్రశ్న = ప్రీ-ప్రాసెస్ + రిట్రీవల్ + ప్రాంప్ట్ + జనరేట్ + పోస్ట్-ప్రాసెస్.
- మల్టీ-సోర్స్ డేటా ఒకే రిపోజిటరీగా మిళితం చేయబడింది, అయితే source_type మెటాడేటా మరియు విశ్వసనీయ ప్రాధాన్యత భద్రపరచబడ్డాయి.
- లేటెన్సీ కోసం స్ట్రీమింగ్ మరియు కాష్, కాంటెక్స్ట్ థ్రోట్లింగ్ మరియు ధర కోసం మోడల్ ఎంపిక కీలకం.
- రీ-ఇండెక్సింగ్ లేకుండా, ఇండెక్స్ పాతదిగా మారుతుంది; మారుతున్న పత్రాలను క్రమం తప్పకుండా రీప్రాసెస్ చేయండి.
అప్లికేషన్ టాస్క్
మీ స్వంత బృందం కోసం సహాయకుడి నిర్మాణ రేఖాచిత్రాన్ని గీయండి. (1) కనీసం మూడు నిజమైన డేటా మూలాధారాలను గుర్తించండి మరియు ప్రతిదానికి కనెక్టర్ అవసరం, నవీకరణ ఫ్రీక్వెన్సీ మరియు విశ్వసనీయ స్థాయిని వ్రాయండి. (2) బాక్స్-బాణం రేఖాచిత్రంతో ఇండెక్సింగ్ మరియు ప్రశ్న పంక్తులను విడిగా గీయండి. (3) “నేను ఈ అసిస్టెంట్లో జాప్యాన్ని మరియు ధరను ఎక్కడ తగ్గించాలి?” ప్రశ్నకు కనీసం రెండు నిర్దిష్ట నిర్ణయాలను వ్రాయండి. (4) మీ రిఫ్రెష్ వ్యూహాన్ని ఒక వాక్యంలో వివరించండి: ఏ వనరు రీఇండెక్స్ చేయబడుతుంది మరియు ఎంత తరచుగా?
చెక్లిస్ట్
- [ ] నేను ఇండెక్సింగ్ మరియు క్వెరీ లైన్లను విడిగా మరియు సరైన భాగాలతో గీయగలను.
- [ ] నేను source_type మరియు ట్రస్ట్ ప్రాధాన్యతతో బహుళ-మూల డేటాను కలపగలను.
- [ ] నేను జాప్యం మరియు ధర కోసం మోడల్ ఎంపిక కోసం స్ట్రీమింగ్/కాష్ నిర్ణయాలు తీసుకోగలను.
- [ ] రీ-ఇండెక్సింగ్ వ్యూహం ఎందుకు అవసరమో నాకు తెలుసు.
- [ ] నా ఆర్కిటెక్చర్లో అత్యంత ఖరీదైన దశ సాధారణంగా పెద్ద మోడల్కు వెళ్లే టోకెన్ అని నేను గుర్తుంచుకోవాలి.