Μονάδα 1 / 11

Τι είναι το RAG και γιατί είναι απαραίτητο;

Κέρδη:

  • Εξηγώντας ότι το RAG εισάγει το πλαίσιο χωρίς να αλλάζει τα βάρη του μοντέλου και λειτουργεί με μια λογική «ανοιχτής εξέτασης βιβλίου»
  • Σύγκριση RAG με προσεγγίσεις λεπτομέρειας και μακροχρόνιου πλαισίου σύμφωνα με το κόστος, την επικαιρότητα και το σενάριο χρήσης
  • Καταγραφή των βημάτων ενός τυπικού αγωγού RAG που αποτελείται από φάσεις ευρετηρίασης και ερωτήματος

Ανεξάρτητα από το πόσο ισχυρό είναι ένα γλωσσικό μοντέλο (τεχνητή νοημοσύνη που κατανοεί και παράγει κείμενο· θα το ονομάζουμε εν συντομία μοντέλο από τώρα και στο εξής), δεν γνωρίζει τη σύμβαση που υπέγραψε χθες η εταιρεία σας, την εσωτερική σας σελίδα wiki (εσωτερική βάση γνώσεων) ή το σημείωμα έκδοσης που δημοσιεύτηκε σήμερα το πρωί. Το μοντέλο περιορίζεται σε γενικές γνώσεις μέχρι την ημερομηνία που εκπαιδεύτηκε. Αυτό ονομάζεται «ημερομηνία λήξης εκπαίδευσης». Το RAG (Retrieval-Augmented Generation) καλύπτει ακριβώς αυτό το κενό: βρίσκει τα έγγραφα της εταιρείας που σχετίζονται με την ερώτηση, το δίνει στο μοντέλο ως πλαίσιο (δηλαδή το πρόσθετο κείμενο που θα διαβάσει κατά την παραγωγή της απάντησης) και έχει την απάντηση που παράγεται με βάση αυτό το πλαίσιο.

Σε αυτή την ενότητα, θα δούμε ξεκάθαρα τι είναι το RAG, πότε προτιμάται από ποιες εναλλακτικές λύσεις και τα βήματα ενός τυπικού αγωγού RAG. Όλες οι επόμενες ενότητες θα εμβαθύνουν τα μέρη αυτού του χάρτη ένα προς ένα.

The Basic Idea of RAG: Open Book Exam

Ας εξηγήσουμε το RAG με μια φράση: "Πρώτα βρείτε το σχετικό έγγραφο, μετά ζητήστε από το μοντέλο να διαβάσει αυτό το έγγραφο και να εκτυπώσει την απάντηση ανάλογα."

Η πιο χρήσιμη αναλογία είναι η εξής: Το RAG μετακινεί το μοντέλο από μια «εξέταση κλειστού βιβλίου» σε μια «εξέταση ανοιχτού βιβλίου». Στην κλειστή εξέταση του βιβλίου, ο μαθητής απαντά μόνο από μνήμης. Υπάρχει μεγάλος κίνδυνος να φτιάξετε αυτό που δεν θυμάστε. Στην εξέταση ανοιχτού βιβλίου, ο μαθητής απαντά κοιτάζοντας την πηγή που βρίσκεται μπροστά του. Στο RAG το μοντέλο δεν απαντά πλέον από τη μνήμη του, αλλά από το τρέχον και συγκεκριμένο κείμενο που του δίνετε.

Κρίσιμο σημείο: Το RAG δεν αλλάζει τα βάρη του μοντέλου, δηλαδή τα δισεκατομμύρια αριθμητικές παραμέτρους που έχει μάθει το μοντέλο. Δεν επανεκπαιδεύετε το μοντέλο. Για κάθε ερώτηση, εισάγετε κομμάτια κειμένου που σχετίζονται με αυτήν την ερώτηση στην προτροπή (κείμενο οδηγιών που αποστέλλεται στο μοντέλο). Επομένως, δεν χρειάζεται να επανεκπαιδεύσετε το μοντέλο όταν ενημερώνεται ένα έγγραφο. απλά ανανεώνετε τη σχετική εγγραφή στη βάση δεδομένων αναζήτησης.

Υπόδειξη: Δύο ερωτήσεις καθορίζουν την ποιότητα του RAG: (1) Βρήκατε το σωστό έγγραφο; (2) Το μοντέλο το διάβασε σωστά; Το πρώτο είναι «ποιότητα ανάκτησης», το δεύτερο είναι «ποιότητα γενιάς». Τα δύο μετρώνται και βελτιώνονται ξεχωριστά.

RAG, Fine-Tuning ή Long Context;

Τρία μονοπάτια συχνά συγχέονται όταν ψάχνουμε για μια λύση σε ένα οργανωτικό πρόβλημα. Ας ξεκαθαρίσουμε τις διαφορές τους. Ο λεπτός συντονισμός ενημερώνει τα βάρη του μοντέλου με τα δεδομένα σας και του διδάσκει μια νέα συμπεριφορά/στυλ. Το εκτενές πλαίσιο σημαίνει τη συμπλήρωση όλων των εγγράφων απευθείας στην προτροπή χωρίς καμία επιλογή.

Προσέγγιση

Τι κάνει

Πότε είναι κατάλληλο;

Κόστος / Κίνδυνος

RAG

Εισάγει το σχετικό έγγραφο ως πλαίσιο

Συχνά μεταβαλλόμενες, εκτενείς, συγκεκριμένες πληροφορίες

Χαμηλό? εύκολο να ενημερώνεται, η πηγή μπορεί να αναφέρεται

μικρορύθμιση

Ενημερώνει τα βάρη με νέα δεδομένα

Διδασκαλία σταθερού στυλ/μορφής/γλώσσας

Υψηλό? Απαιτείται επανεκπαίδευση με κάθε ενημέρωση

Μόνο μακρύ πλαίσιο

Συμπληρώνει όλα τα έγγραφα στην προτροπή

Μικρό, σταθερό σετ εγγράφων

Το κόστος συμβολαίου και ο κίνδυνος "χάσεως του μεσαίου τμήματος" αυξάνεται

Κατά κανόνα: Η τελειοποίηση διδάσκει στο μοντέλο πώς να μιλάει. Η RAG λέει στο μοντέλο τι πρέπει να γνωρίζει. Στα περισσότερα εταιρικά σενάρια, το RAG δοκιμάζεται πρώτα επειδή είναι φθηνό, μπορεί να ενημερωθεί και μπορεί να δείξει την πηγή της απάντησης. Το μεγάλο πλαίσιο είναι λογικό εάν το σύνολο εγγράφων είναι πραγματικά μικρό και σταθερό (π.χ. ένα μόνο εγχειρίδιο 20 σελίδων). Αλλά με χιλιάδες σελίδες, είναι ακριβό και το μοντέλο μπορεί να χάσει πληροφορίες στη μέση του μεγάλου κειμένου.

Ένας τυπικός αγωγός RAG

Το RAG αποτελείται από δύο κύριες φάσεις: ευρετηρίαση (προετοιμασία, που γίνεται μία φορά ή περιοδικά) και αναζήτηση (εκτελείται σε κάθε ερώτηση χρήστη).

Ευρετηρίαση βήμα προς βήμα (εκτός σύνδεσης, χωρίς αναμονή χρήστη):

  1. Συλλογή: Τραβήξτε έγγραφα από πηγές (PDF, wiki, σύστημα εισιτηρίων, βάση δεδομένων, email).
  2. Τεμαχισμός: Σπάστε το μεγάλο κείμενο σε μικρότερα διαχειρίσιμα κομμάτια.
  3. Ενσωμάτωση: Μετατροπή κάθε μέρους σε ενσωμάτωση (το διάνυσμα αριθμού που φέρει το νόημα του κειμένου).
  4. Αποθήκευση: Γράψτε τα διανύσματα μαζί με το κείμενο και τα μεταδεδομένα (πηγή, ημερομηνία, πληροφορίες εξουσιοδότησης) στη διανυσματική βάση δεδομένων.

Ερώτημα βήμα προς βήμα (σε σύνδεση, ενώ ο χρήστης περιμένει):

  1. Μετατρέψτε την ερώτηση του χρήστη σε ενσωμάτωση.
  2. Ανακτήστε τα πιο παρόμοια μέρη από τη διανυσματική βάση δεδομένων.
  3. Τοποθετήστε αυτά τα κομμάτια + ερώτηση σε ένα πρότυπο προτροπής.
  4. Λάβετε τη συμφραζόμενη απάντηση και τις πηγές της από το μοντέλο.

# Εννοιολογική περίληψη της φάσης διερεύνησης (δεν εξαρτάται από τη γλώσσα)ερώτηση = "Πόσες ημέρες ετήσιας άδειας;"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # most similar partsprompt = f"""Απαντήστε στην ΕΡΩΤΗΣΗ δεν έχω πληροφορίες χρησιμοποιώντας το περιεχόμενο CONTEXT. αυτό." Fitting.CONTEXT:{parts}QUESTION: {question}"""answer = model.uret(prompt) # π.χ. μοντέλο: claude-opus-4-8

Αυτή η ροή είναι ένας χάρτης κάθε σταδίου, τον οποίο θα αποσυσκευάσουμε μία προς μία στις επόμενες ενότητες.

Αδύναμη προτροπή / Ισχυρή προτροπή

Ακόμη και με το ίδιο πλαίσιο RAG, η ποιότητα της προτροπής αλλάζει την απάντηση.

Αδύναμη προτροπή (ανοιχτή για τοποθέτηση μοντέλου, δεν απαιτεί πόρους):

Χρησιμοποιήστε αυτές τις πληροφορίες και πείτε ετήσια άδεια: {parts}. Ερώτηση: {ερώτηση}

Ισχυρό μήνυμα (γείωση + άδεια "Δεν ξέρω" + αίτημα πόρων):

Απαντήστε μόνο με βάση το ΠΛΑΙΣΙΟ παρακάτω. Εάν δεν υπάρχει σαφής απάντηση στο πλαίσιο, γράψτε "Δεν μπόρεσα να βρω πληροφορίες σχετικά με αυτό στην τεκμηρίωση". Μην μαντεύετε. Προσθέστε την ετικέτα [Source: file_name] του κομματιού στο οποίο βασίζεστε στο τέλος της απάντησής σας. ΠΛΑΙΣΙΟ: {pieces} ΕΡΩΤΗΣΗ: {question}

Τρεις Μίνι Θήκες

Περίπτωση 1 — Βοηθός Ανθρώπινου Δυναμικού (Ανθρώπινο Δυναμικό). Μια εταιρεία έχει ένα εγχειρίδιο HR 340 σελίδων και οι εργαζόμενοι κάνουν κατά μέσο όρο 90 ερωτήσεις την ημέρα. Δοκιμάστηκε η λεπτομέρεια, αλλά δεδομένου ότι το εγχειρίδιο ενημερώνονταν μηνιαία, απαιτούνταν επανεκπαίδευση κάθε φορά. Το κόστος έφτασε τα χιλιάδες δολάρια το μήνα. Μετά τη μετάβαση σε RAG, η ενημέρωση μειώθηκε στο βήμα "εκ νέου ευρετηρίαση του εγγράφου" (λεπτά) και το ποσοστό σωστών απαντήσεων αυξήθηκε από 71% σε 93% στη μη αυτόματη μέτρηση.

Περίπτωση 2 — Υποστήριξη πελατών. Η ομάδα υποστήριξης έχει 12.000 επιλυμένα δελτία και 800 άρθρα βοήθειας. Χρειάζονται κατά μέσο όρο 4 λεπτά για έναν εκπρόσωπο να βρει με μη αυτόματο τρόπο μια απάντηση. Όταν ο βοηθός RAG έφερε τις 5 πιο σχετικές εγγραφές και παρήγαγε μια πρόχειρη απάντηση, ο χρόνος μειώθηκε στα 40 δευτερόλεπτα. Ωστόσο, η ομάδα συνειδητοποίησε τον κίνδυνο «να φανεί αβέβαιος φέρνοντας το λάθος άρθρο» και έκανε υποχρεωτική την αναφορά της πηγής.

Περίπτωση 3 — Νόμος. Μια συμβαλλόμενη ομάδα ρώτησε "σε ποιες συμβάσεις η ρήτρα εμπιστευτικότητας διαρκεί 5 χρόνια;" κάνει την ερώτηση. Στη μακροχρόνια δοκιμή πλαισίου, 60 συμβάσεις συμπληρώθηκαν σε ένα μόνο μήνυμα. το μοντέλο παρέλειψε τα δύο μεσαία συμβόλαια. Όταν εισήχθησαν μόνο τα σχετικά στοιχεία με το RAG, το κόστος συμβολαίου μειώθηκε κατά 80% και η παράλειψη που λείπει επαναφέρθηκε.

Γιατί χρειάζεται το RAG;

  • Τρέχουσα κατάσταση: Έχετε πρόσβαση σε πληροφορίες μετά την ημερομηνία λήξης της εκπαίδευσης.
  • Ειδικές πληροφορίες: Τα εσωτερικά σας έγγραφα δεν περιλαμβάνονται στην εκπαίδευση κανενός μοντέλου. Μόνο εσύ μπορείς να δώσεις.
  • Επαληθευσιμότητα: Μπορείτε να αναφέρετε την πηγή της απάντησης (παραπομπή) — απαραίτητη για τον έλεγχο και την εμπιστοσύνη.
  • Έλεγχος ψευδαισθήσεων: Βασίζεται στο κείμενο που βρίσκεται μπροστά του αντί να δημιουργεί ένα μοντέλο.
  • Κόστος: Είναι πολύ φθηνότερο και γρηγορότερο να τεθεί σε λειτουργία από τη λεπτομέρεια.
Προσοχή: Το RAG δεν είναι μαγικό. Εάν φέρετε το λάθος κομμάτι, το μοντέλο καταλήγει σε λάθος απάντηση και δείχνει «σίγουρο». Λάβετε υπόψη τη φράση "Ποιότητα ανάκτησης = ποιότητα RAG".

Συνήθη λάθη

  • Λάθος RAG για μικρορύθμιση: Το RAG δεν αλλάζει τα βάρη. Απλώς προσθέτει το πλαίσιο. Η σύγχυση αυτών των δύο θα οδηγήσει στην επιλογή της λάθος αρχιτεκτονικής.
  • Δεν επιτρέπεται το "Δεν ξέρω": Εάν η προτροπή αφήνει το μοντέλο ελεύθερο να συμπληρώσει το κενό, θα αναπληρωθεί.
  • Χωρίς αναφορά πηγών: Μια απάντηση χωρίς πηγή δεν μπορεί να ελεγχθεί. Ο χρήστης δεν μπορεί να παρατηρήσει το λάθος.
  • Συσσωρεύοντας τα πάντα σε ένα μήνυμα: Το μακρύ πλαίσιο φαίνεται φθηνό, αλλά είναι ακριβό και δεν υπάρχουν οι μεσαίες πληροφορίες.
  • Κολλήστε στη γενιά χωρίς να μετρήσετε την ανάκτηση: Εάν η απάντηση είναι κακή, ρωτήστε πρώτα "Έφτασε το σωστό μέρος;" πρέπει να ερωτηθεί.

Συνοπτικά

  • Το RAG είναι μια προσέγγιση που εισάγει έγγραφα σχετικά με την ερώτηση στο μοντέλο ως πλαίσιο. δεν αλλάζει τα βάρη («ανοιχτή εξέταση βιβλίου»).
  • Η τελειοποίηση διδάσκει στυλ/μορφή, το RAG δίνει τρέχουσες και συγκεκριμένες πληροφορίες. Το μακρύ πλαίσιο λειτουργεί καλά για μικρά σταθερά σύνολα. Στα περισσότερα σενάρια, το RAG δοκιμάζεται πρώτα.
  • Η διοχέτευση έχει δύο φάσεις: ευρετηρίαση εκτός σύνδεσης (τεμάχιο + ενσωμάτωση + αποθήκευση) και διαδικτυακή αναζήτηση (ανάκτηση + προτροπή + δημιουργία).
  • Το RAG παρέχει επικαιρότητα, συγκεκριμένες πληροφορίες, επαληθευσιμότητα, έλεγχο παραισθήσεων και χαμηλό κόστος.
  • Η ποιότητα του συστήματος εξαρτάται άμεσα από την ποιότητα της ανάκτησης: λάθος κομμάτι σημαίνει λάθος απάντηση.

Εργασία εφαρμογής

Επιλέξτε μια γνήσια πηγή πληροφοριών από τη δική σας ομάδα (π.χ. ένα έγγραφο διαδικασίας ή σελίδα με συχνές ερωτήσεις). (1) Γράψτε 5 πραγματικές ερωτήσεις σχετικά με αυτήν την πηγή. (2) Σημειώστε ποιο μέρος του εγγράφου περιέχει τη σωστή απάντηση για κάθε ερώτηση — αυτή γίνεται η λίστα "χρυσή απάντηση" σας. (3) Χρησιμοποιώντας το πρότυπο "ισχυρή προτροπή" παραπάνω, επικολλήστε με μη αυτόματο τρόπο τη σχετική ενότητα ως πλαίσιο και ρωτήστε ένα μοντέλο. (4) Συγκρίνετε την απάντηση που έδωσε το μοντέλο με τη χρυσή απάντηση και σημειώστε ως σωστό/λάθος. Αυτή είναι η πρώτη μη αυτόματη έκδοση της αξιολόγησης που θα αυτοματοποιήσετε σε μελλοντικές μονάδες.

λίστα ελέγχου

  • [ ] Μπορώ να εξηγήσω με μια πρόταση ότι το RAG δεν αλλάζει τα βάρη, απλώς προσθέτει το πλαίσιο.
  • [ ] Μπορώ να διακρίνω ανάμεσα σε RAG, τελειοποίηση και μακρύ πλαίσιο και πότε είναι κατάλληλο.
  • [ ] Μπορώ να μετρήσω τις φάσεις δημιουργίας ευρετηρίου (συλλογή-τεμαχισμός-ενσωμάτωση-αποθήκευση) και ερωτήματος (ενσωμάτωση-ανάκτηση-προτροπή-δημιουργία) με τη σειρά.
  • [ ] Γνωρίζω γιατί πρόσθεσα τις οδηγίες "εάν δεν είναι στο πλαίσιο, πείτε ότι δεν ξέρω" και "αναφέρω πηγή" στο μήνυμα προτροπής.
  • [ ] Μπορώ να προσαρμόσω την αρχή της "Ποιότητα ανάκτησης = ποιότητα RAG" στη δική μου περίπτωση.