Μονάδα 5 / 11

Βοηθός Αρχιτεκτονικής που μιλά με δεδομένα εταιρείας

Κέρδη:

  • Σχεδιασμός στοιχείων και ροής δεδομένων ενός βοηθού εταιρικού RAG από άκρο σε άκρο
  • Συνδυασμός δεδομένων πολλαπλών πηγών (wiki, εισιτήριο, PDF, βάση δεδομένων) σε έναν μόνο βοηθό
  • Λάβετε αρχιτεκτονικές αποφάσεις για επεκτασιμότητα, προσωρινή αποθήκευση και καθυστέρηση

Σε προηγούμενες ενότητες, μάθαμε τα μέρη ένα προς ένα: ενσωμάτωση, διανυσματική βάση δεδομένων, τεμαχισμός, ανάκτηση. Τώρα ας τα συνδυάσουμε και ας δημιουργήσουμε μια αρχιτεκτονική από άκρο σε άκρο ενός βοηθού που μιλά με τα δεδομένα της εταιρείας σας. Ο στόχος είναι να ρωτήσει ένας υπάλληλος: «Ποια είναι η πολιτική αδειών μας;» Ένα σύστημα όπου οι άνθρωποι μπορούν να κάνουν ερωτήσεις, οι απαντήσεις βασίζονται σε πραγματικά εσωτερικά έγγραφα, παραπομπές και συνδυάζουν πολλαπλές πηγές δεδομένων. Αυτή η μονάδα επεξεργάζεται ολόκληρη την αρχιτεκτονική, τη ροή δεδομένων και τις αποφάσεις για το επίπεδο παραγωγής.

Στοιχεία από άκρο σε άκρο

Ένας εταιρικός βοηθός RAG αποτελείται από δύο ξεχωριστές γραμμές. Η γραμμή ευρετηρίου (εκτός σύνδεσης) προετοιμάζει τα δεδομένα. Η γραμμή ερωτήματος (online) απαντά στην ερώτηση.

Στοιχεία γραμμής ευρετηρίου:

  1. Συνδέσεις: Συνδέσεις που αντλούν δεδομένα από πηγές — wiki, σύστημα εισιτηρίων, αποθήκευση αρχείων, βάση δεδομένων, email.
  2. Κανονικοποίηση: Μετατροπή διαφορετικών μορφών (PDF, HTML, DOCX) σε καθαρό κείμενο. καθαρισμός κεφαλίδας/υποσέλιδου.
  3. Τεμαχισμός + μεταδεδομένα: Τεμαχισμός και προσθήκη ετικετών (πηγή, ημερομηνία, αρχή).
  4. Ενσωμάτωση + φόρτωση: Εγγραφή διανυσμάτων και μεταδεδομένων στη διανυσματική βάση δεδομένων.

Ερώτηση στοιχείων αγωγού:

  1. Προεπεξεργασία ερωτήματος: Επανεγγραφή, αποκέντρωση.
  2. Ανάκτηση: Υβριδική αναζήτηση + φίλτρο μεταδεδομένων + ανακατάταξη.
  3. Προτροπή δημιουργίας: Τοποθέτηση περιβάλλοντος + ερώτησης + οδηγιών στο πρότυπο.
  4. Γενιά: Βασισμένη (με βάση τα συμφραζόμενα) απάντηση από το μοντέλο + πηγές.
  5. Μετα-επεξεργασία: Μορφοποίηση παραπομπών, έλεγχος ασφαλείας, καταγραφή.
Συμβουλή: Διαχωρίστε φυσικά τη γραμμή ευρετηρίου από τη γραμμή ερωτήματος. Η ευρετηρίαση είναι αργή και περιοδική (εκτελείται σε παρτίδες όλη τη νύχτα). Η γραμμή έρευνας πρέπει να είναι ελαφριά και άμεση. Η ανάμειξη των δύο γραμμών επιβάλλει έντονη επεξεργασία ενώ ο χρήστης περιμένει.

Οπτικοποίηση της ροής δεδομένων

[ΕΥΡΕΤΗΡΙΟ - εκτός σύνδεσης]Πόροι → Κανονικοποίηση → Τεμάχιο+Μεταδεδομένα → Ενσωμάτωση → Vector DB (wiki, δελτίο, PDF, DB)[QUERY - online]Ερώτηση χρήστη → Προεπεξεργασία → Ανάκτηση (υβριδικό+φίλτρο+ανακατάταξη) → Ερώτηση (context+Source →Σύνδεση+ερωτήσεις)

Συνδυασμός δεδομένων πολλαπλών πηγών

Στις πραγματικές εταιρείες, η απάντηση δεν σταματά σε ένα μέρος. "Πώς να εκδώσετε μια επιστροφή χρημάτων σε έναν πελάτη;" Η απάντηση στην ερώτηση μπορεί να βρεθεί τόσο στο άρθρο βοήθειας (διαδικασία), στο ιστορικό εισιτηρίων (πραγματικά παραδείγματα), όσο και στο PDF πολιτικής (κανόνες). Ο βοηθός θα πρέπει να τα ψάξει όλα σε μία πισίνα.

Κρίσιμο σημείο: όταν συνδυάζονται πόροι σε ένα ενιαίο διανυσματικό χώρο αποθήκευσης, κάθε θραύσμα πρέπει να φέρει τα μεταδεδομένα «source_tour». Έτσι, μπορείτε να τα αναζητήσετε όλα και να τα φιλτράρετε εάν είναι απαραίτητο, όπως "φέρετε μόνο επίσημες πολιτικές". Επίσης, διαφορετικές πηγές έχουν διαφορετικά επίπεδα αξιοπιστίας: επίσημη πολιτική > άρθρο βοήθειας > σημείωμα εισιτηρίου υπαλλήλου. Μπορείτε να καθορίσετε αυτήν την προτεραιότητα στην ανακατάταξη ή στην ερώτηση.

Πηγή

Τύπος περιεχομένου

εμπιστοσύνη

Συχνότητα ενημέρωσης

Πολιτική PDF

επίσημος κανόνας

ψηλά

μηνιαία

άρθρο βοήθειας

Διαδικασία

μέτρια-υψηλή

εβδομαδιαία

Ιστορικό εισιτηρίων

πραγματικό δείγμα

μεσαίο

Συνεχής

wiki

Μικτή/τρέχουσα νότα

Μεταβλητή

Συνεχής

Επεκτασιμότητα, προσωρινή μνήμη και καθυστέρηση

Τρία θέματα ξεχωρίζουν στην παραγωγή. Latency: Η εμπειρία επιδεινώνεται όταν ο χρήστης περιμένει περισσότερα από 2 δευτερόλεπτα. Λύση: εμφάνιση της απάντησης σε μορφή ροής — χύνεται στην οθόνη καθώς γράφει το μοντέλο. Προσωρινή μνήμη: Για συχνές ερωτήσεις και επαναλαμβανόμενα περιβάλλοντα, η προσωρινή μνήμη αυξάνει την ταχύτητα και μειώνει το κόστος. Κλίμακα: Καθώς ο χρήστης αυξάνεται, είναι απαραίτητο να μπορεί να κλιμακώνει την ανάκτηση και να μοντελοποιεί τις κλήσεις οριζόντια.

Εμπειρικός κανόνας στην πλευρά του κόστους: το πιο ακριβό βήμα είναι συνήθως ο αριθμός των κουπονιών που πηγαίνουν στο μεγαλύτερο μοντέλο. Επομένως, η μείωση του πλαισίου σε 4 καλά μέρη μέσω ανακατάταξης βελτιώνει τόσο την ποιότητα όσο και το κόστος. Ένας κοινός σχεδιασμός είναι η χρήση ενός μικρότερου/γρηγορότερου μοντέλου για απλή ταξινόμηση ή δρομολόγηση και ένα πιο ισχυρό μοντέλο για την τελική απάντηση (π.χ. claude-opus-4-8).

Προσοχή: Μην ρυθμίσετε τη δημιουργία ευρετηρίου ως "κάντε το μια φορά, ξεχάστε το". Τα έγγραφα αλλάζουν, διαγράφονται, προστίθενται. Καθιερώστε μια στρατηγική εκ νέου ευρετηρίασης: εντοπίστε άλλα έγγραφα και επεξεργαστείτε ξανά μόνο αυτά. Ο μπαγιάτικος δείκτης παράγει μια απάντηση που φαίνεται τρέχουσα αλλά είναι λάθος.

Αδύναμη Αρχιτεκτονική / Δυνατή Αρχιτεκτονική

Αδύναμο (μονό σενάριο, όλα ανάμεικτα):

Όταν ο χρήστης ρωτά: διαβάστε τα έγγραφα εκείνη τη στιγμή, τεμαχίστε τα, ενσωματώστε τα, αναζητήστε τα, απαντήστε τα.# Πρόβλημα: όλη η ευρετηρίαση επαναλαμβάνεται για κάθε ερώτηση. δευτερόλεπτα καθυστέρησης, # χωρίς διαχωρισμό πηγής, χωρίς φίλτρο, χωρίς ανανέωση.

Ισχυρό (split pipes + metadata + cache + streaming):

Ευρετηρίαση: παρτίδες εκτελούνται τη νύχτα, ανανέωση αλλαγμένων εγγράφων. Ερώτημα: ελαφριά γραμμή — προεπεξεργασία → υβριδική ανάκτηση+φίλτρο → ανακατάταξη → προτροπή → μοντέλο (ροή) → παραπομπή → αρχείο καταγραφής. Οι συχνές ερωτήσεις και η πηγή αποθηκεύονται στην κρυφή μνήμη.

Τρεις Μίνι Θήκες

Περίπτωση 1 — Μπερδεμένη γραμμή, μεγάλη καθυστέρηση. Μια startup έγραψε ένα σενάριο που επεξεργάζεται ξανά τα PDF με κάθε ερώτηση. Κάθε απάντηση χρειαζόταν κατά μέσο όρο 11 δευτερόλεπτα. Όταν η γραμμή ευρετηρίου διαχωρίστηκε και τα δεδομένα είχαν προηγουμένως μεταφερθεί στο vector store, ο χρόνος ερωτήματος μειώθηκε στα 1,3 δευτερόλεπτα και με τη ροή, η "πρώτη λέξη" εμφανίστηκε σε 400 ms.

Περίπτωση 2 — Πάρα πολλοί πόροι, λάθος προτεραιότητα. Ένας βοηθός υποστήριξης έδωσε την ίδια βαρύτητα στο PDF της πολιτικής και στις παλιές σημειώσεις εισιτηρίων. Το μοντέλο μερικές φορές παρουσίαζε ως επίσημο κανόνα τη λανθασμένη βαθμολογία ενός υπαλλήλου πριν από δύο χρόνια. Όταν προστέθηκαν στην προτροπή τα μεταδεδομένα source_tour και η εντολή "να εξετάσει την επίσημη πολιτική σε περίπτωση σύγκρουσης", τα σφάλματα λανθασμένης προτεραιότητας μειώθηκαν κατά 89%.

Περίπτωση 3 — Δείκτης μπαγιάτικου. Ένας βοηθός ανθρώπινου δυναμικού εργαζόταν με ένα ευρετήριο που δεν ενημερώθηκε για 3 μήνες. Η πολιτική άδειας άλλαξε, αλλά ο βοηθός έλεγε τα παλιά. Όταν εγκαταστάθηκε η ημερήσια ανανέωση, η οποία ανιχνεύει τα αλλαγμένα αρχεία, ο ρυθμός τρέχουσας απόκρισης αυξήθηκε από 70% σε 99%.

Συνήθη λάθη

  • Ανάμειξη ευρετηρίασης και γραμμών ερωτήματος: Γίνεται βαριά επεξεργασία ενώ ο χρήστης περιμένει. η καθυστέρηση εκρήγνυται.
  • Μη τοποθέτηση του τύπου πηγής στα μεταδεδομένα: Χωρίς ιεράρχηση προτεραιοτήτων και φιλτράρισμα. Η μη αξιόπιστη πηγή φαίνεται να είναι επίσημη.
  • Μη καθιέρωση στρατηγικής ανανέωσης: Ο δείκτης γίνεται μπαγιάτικος. Παράγονται λανθασμένες απαντήσεις που φαίνονται τρέχουσες.
  • Παράλειψη ροής: Ο χρήστης κοιτάζει σε μια κενή οθόνη. Η αντιληπτή καθυστέρηση γίνεται υψηλή.
  • Χρήση του μεγαλύτερου μοντέλου σε κάθε βήμα: Το κόστος αυξάνεται άσκοπα. Αφήστε το τιμόνι στο μικρότερο μοντέλο.

Συνοπτικά

  • Ο εταιρικός βοηθός RAG αποτελείται από δύο ξεχωριστές γραμμές: ευρετηρίαση εκτός σύνδεσης και διαδικτυακή ερώτηση. χωρίστε τα σωματικά.
  • Ευρετηρίαση = σύνδεσμος + κανονικοποίηση + κομμάτι/μεταδεδομένα + ενσωμάτωση/μεταφόρτωση. ερώτημα = προ-διεργασία + ανάκτηση + προτροπή + δημιουργία + μετα-διεργασία.
  • Τα δεδομένα πολλαπλών πηγών συνδυάζονται σε ένα ενιαίο χώρο αποθήκευσης, αλλά τα μεταδεδομένα source_type και η προτεραιότητα αξιοπιστίας διατηρούνται.
  • Η ροή και η κρυφή μνήμη για λανθάνουσα κατάσταση, ο περιορισμός περιβάλλοντος και η επιλογή μοντέλου για το κόστος είναι κρίσιμες.
  • Χωρίς εκ νέου ευρετηρίαση, ο δείκτης γίνεται μπαγιάτικος. Επανεπεξεργάζεστε τακτικά την αλλαγή εγγράφων.

Εργασία εφαρμογής

Σχεδιάστε ένα αρχιτεκτονικό διάγραμμα ενός βοηθού για τη δική σας ομάδα. (1) Προσδιορίστε τουλάχιστον τρεις πραγματικές πηγές δεδομένων και σημειώστε την ανάγκη σύνδεσης, τη συχνότητα ενημέρωσης και το επίπεδο εμπιστοσύνης για καθεμία. (2) Σχεδιάστε τις γραμμές ευρετηρίου και ερωτήματος χωριστά με ένα διάγραμμα πλαισίου-βέλους. (3) "Πού μπορώ να μειώσω την καθυστέρηση και το κόστος σε αυτόν τον βοηθό;" Γράψτε τουλάχιστον δύο συγκεκριμένες αποφάσεις για την ερώτηση. (4) Περιγράψτε τη στρατηγική ανανέωσης με μία πρόταση: ποιος πόρος θα αναπροσαρμόζεται και πόσο συχνά;

λίστα ελέγχου

  • [ ] Μπορώ να σχεδιάσω τις γραμμές ευρετηρίου και ερωτήματος ξεχωριστά και με τα σωστά στοιχεία.
  • [ ] Μπορώ να συνδυάσω δεδομένα πολλαπλών πηγών με τον τύπο_πηγής και την προτεραιότητα εμπιστοσύνης.
  • [ ] Μπορώ να λάβω αποφάσεις ροής/κρυφής μνήμης για καθυστέρηση και επιλογή μοντέλου για το κόστος.
  • [ ] Γνωρίζω γιατί είναι απαραίτητη μια στρατηγική αναπροσαρμογής ευρετηρίου.
  • [ ] Έχω κατά νου ότι το πιο ακριβό βήμα στην αρχιτεκτονική μου είναι συνήθως το διακριτικό που πηγαίνει στο μεγαλύτερο μοντέλο.