Μονάδες
1. Εισαγωγή στην Τεχνητή Νοημοσύνη στην Τουρκική Γλώσσα και Λογοτεχνία: Ρόλοι, Όρια, Επαλήθευση, Αυθεντικότητα και Ηθική 2. Ανάλυση κειμένου και στενή ανάγνωση: Ανάλυση ποίησης, διηγήματος και μυθιστορήματος με AI 3. Γλωσσολογία και Ανάλυση Corpus: Ανάγνωση λεξιλογίου με αριθμούς 4. Αρχαία κείμενα, απλοποίηση και μεταγραφή: Εργασία με οθωμανικά και ντιβανικά κείμενα 5. Υλικό Μαθήματος και Σχεδιασμός Εκπαίδευσης: Αποτέλεσμα, Αποτελεσματικότητα και Μέτρηση 6. Ιστορία και Έρευνα Λογοτεχνίας: Επιθεώρηση Λογοτεχνίας, Σύνθεση και Επαλήθευση 7. Επιμέλεια, διόρθωση και στοιχειοθέτηση: Προετοιμασία του κειμένου για δημοσίευση 8. Συνεργασία ανθρώπου-AI στη Δημιουργική Γραφή και Παραγωγή 9. Αξιολόγηση πρωτοτυπίας, λογοκλοπής και κειμένων που γράφτηκαν με AI 10. Επαλήθευση πηγής, ψευδαισθήσεις και πειθαρχία απόδοσης 11. Ο άνθρωπος στη λογοτεχνική ερμηνεία: αισθητική κρίση, ηθική, εμπιστευτικότητα και όρια
Μονάδα 3 / 11

Γλωσσολογία και Ανάλυση Corpus: Ανάγνωση λεξιλογίου με αριθμούς

Κέρδη:

  • Δυνατότητα σύνταξης μετρήσεων σώματος όπως συχνότητα λέξεων, συνεγκατάσταση, πλούτος λεξιλογίου και λέξεις-κλειδιά με τεχνητή νοημοσύνη
  • Γνωρίζοντας ότι η τεχνητή νοημοσύνη είναι αναξιόπιστη στην ακριβή μέτρηση και να είστε σε θέση να επαληθεύσετε κάθε μέτρηση με ένα ξεχωριστό εργαλείο
  • Ικανότητα κατανόησης ότι ένας αριθμός δεν λέει τίποτα από μόνος του και ότι η γλωσσική ερμηνεία που καθιερώνει το νόημα ανήκει στον άνθρωπο.

Η λογοτεχνία και οι γλωσσικές σπουδές δεν είναι απλώς «σχολιασμός». Έχει επίσης μια μετρήσιμη και μετρήσιμη πτυχή. Πόσες διαφορετικές λέξεις χρησιμοποιεί ένας συγγραφέας, ποιες λέξεις του αρέσει να χρησιμοποιεί με ποιες λέξεις, ποιες λέξεις γίνονται κοινές σε μια περίοδο - αυτές διερευνώνται μέσω της γλωσσολογίας (η επιστήμη που μελετά τον ήχο, τη δομή, το νόημα και τη χρήση της γλώσσας) και ιδιαίτερα τη γλωσσολογία του σώματος. Ένα corpus είναι μια συλλογή κειμένων, όπως τα πλήρη έργα ενός συγγραφέα, το ετήσιο αρχείο μιας εφημερίδας ή τα ποιήματα μιας περιόδου. Η ανάλυση Corpus αναζητά αριθμητικά μοτίβα σε αυτό το κομμάτι.

Σε αυτήν την ενότητα, θα μάθουμε να χρησιμοποιούμε την τεχνητή νοημοσύνη ως βοηθό ανάλυσης σώματος: εξαγωγή μετρήσεων όπως συχνότητα λέξεων (όσες φορές εμφανίζεται μια λέξη στο κείμενο), συνεγκατάσταση (ζεύγη λέξεων που εμφανίζονται συχνά μαζί, π.χ. "μαύρο" + "η τύχη μου"), πλούτος λεξιλογίου και εποχιακή παραλλαγή. Αλλά μια προειδοποίηση από την αρχή: Η τεχνητή νοημοσύνη μπορεί να κάνει λάθη όταν μετράει μόνη της. Απαιτούνται ειδικά εργαλεία για μεγάλες και ακριβείς μετρήσεις και εσείς είστε ο γλωσσολόγος που καθορίζει το νόημα κάθε αριθμού.

Πού είναι ισχυρή και πού αδύναμη η τεχνητή νοημοσύνη στην ανάλυση corpus;

Τα δυνατά του σημεία είναι: Αναγνώριση προτύπων σε μικρά και μεσαία κείμενα, δημιουργία υποθέσεων για το λεξιλόγιο ενός κειμένου, πρόταση υποψηφίων για συνθέσεις, ερμηνεία αποτελέσματος, περιγραφή μεθοδολογίας. Η τεχνητή νοημοσύνη ρωτά "ποιες φράσεις ξεχωρίζουν σε αυτόν τον συγγραφέα;" Δίνει μια γρήγορη έναρξη στην ερώτηση.

Αδυναμία: Ακριβής καταμέτρηση. Το AI είναι μοντέλο γλώσσας, όχι αριθμομηχανή. μπορεί να δώσει μια κατά προσέγγιση και μερικές φορές λανθασμένη απάντηση στην ερώτηση «πόσες φορές έχει συμβεί» σε ένα μεγάλο κείμενο. Για ακριβή συχνότητα, ακριβή στατιστικά στοιχεία συντοπισμού ή σάρωση μεγάλου σώματος χιλιάδων λέξεων, χρησιμοποιείται εξειδικευμένο λογισμικό (π.χ. εργαλεία σώματος όπως το AntConc ή ένα υπολογιστικό φύλλο). Η τεχνητή νοημοσύνη είναι πολύτιμη για την ερμηνεία των αποτελεσμάτων αυτών των εργαλείων. Αλλά μην τον αναγκάσετε να κάνει την ωμή καταμέτρηση στα τυφλά.

Συμβουλή: Εάν χρειάζεστε έναν ακριβή αριθμό, χρησιμοποιήστε δύο τρόπους: βάλτε ένα εργαλείο να κάνει τη μέτρηση σε μικρό κείμενο και να το ερμηνεύσει το AI. Εναλλακτικά, έχετε το μέτρημα AI και επαληθεύστε το με άλλο τρόπο. Μην χρησιμοποιείτε ποτέ την πρόταση "Η AI είπε ότι συμβαίνει 47 φορές" χωρίς επιβεβαίωση.

Μια μελέτη σώματος βήμα προς βήμα

  1. Κάντε μια ερώτηση. «Πώς κατανέμονται οι έγχρωμες λέξεις σε αυτόν τον ποιητή;» Η καταμέτρηση δεν έχει νόημα χωρίς μια σαφή ερώτηση όπως:
  2. Ορίστε το σώμα. Ποια κείμενα; Ποια έκδοση; Ποια περίοδο; Τα σύνορα πρέπει να είναι καθαρά.
  3. Επιλέξτε τη μέτρηση. Συχνότητα, συνεγκατάσταση, πλούτος λεξιλογίου;
  4. Μετρήστε και επαληθεύστε. Κάντε την καταμέτρηση και, στη συνέχεια, επιβεβαιώστε έναν δεύτερο τρόπο.
  5. Σχόλιο. Το νούμερο από μόνο του δεν λέει τίποτα? Είναι το σχόλιό σας που κάνει νόημα τη διαπίστωση ότι «οι χρωματιστές λέξεις διπλασιάστηκαν στη δεύτερη περίοδο».

Ένα συχνά χρησιμοποιούμενο μέτρο του πλούτου του λεξιλογίου είναι η αναλογία του αριθμού των διαφορετικών λέξεων προς τον συνολικό αριθμό των λέξεων (αναλογία τύπου/κουπονιού). Εάν αυτή η αναλογία είναι υψηλή, το κείμενο είναι λέξη-ποικιλία και αν είναι χαμηλή, σημαίνει ότι είναι επαναλαμβανόμενο. Αλλά αυτή η αναλογία επηρεάζεται από το μήκος του κειμένου. Να είστε προσεκτικοί όταν συγκρίνετε απευθείας μικρά και μεγάλα κείμενα.

τρεις μίνι θήκες

Περίπτωση 1 — Η συναρμολόγηση έδειξε ένα στυλ. Ένας ερευνητής εξέτασε τα ζεύγη επιθέτου-ουσιατικού σε 3 μυθιστορήματα ενός μυθιστοριογράφου. Η AI πρότεινε ότι η λέξη "χλωμό" ταιριάζει με 5 διαφορετικά ουσιαστικά. Ο ερευνητής επαλήθευσε 4 από τα κείμενα και εξάλειψε 1 ως κατασκευασμένο. Το επιβεβαιωμένο μοτίβο έγινε μια δήλωση διατριβής σχετικά με το περιγραφικό ύφος του συγγραφέα.

Περίπτωση 2 — Εντοπίστηκε σφάλμα μέτρησης. Ένας μαθητής ρώτησε την AI πόσες φορές εμφανίστηκε η λέξη «νύχτα» σε ένα κείμενο 2.000 λέξεων. Το AI είπε "23". Όταν ο μαθητής πέταξε το κείμενο σε ένα υπολογιστικό φύλλο και το έβαλε να μετρηθεί, ο πραγματικός αριθμός ήταν 17. Έχει γίνει σαφές ότι η ακατέργαστη μέτρηση της τεχνητής νοημοσύνης είναι αναξιόπιστη.

Περίπτωση 3 — Η περιοδική αλλαγή πυροδότησε διαμάχες. Μια ομάδα συνέκρινε την αναλογία των αφηρημένων λέξεων στα πρώιμα και όψιμα ποιήματα ενός ποιητή. Το πρώτο προσχέδιο της τεχνητής νοημοσύνης πρότεινε μια τάση. Όταν η ομάδα επέστρεψε στο κείμενο και επαλήθευσε την καταμέτρηση, η τάση αποδείχθηκε πραγματική, αλλά οι «αιτίες» που πρότεινε η τεχνητή νοημοσύνη ήταν μη επαληθεύσιμες εικασίες και εξαλείφθηκαν.

Τέσσερα πρότυπα με δυνατότητα αντιγραφής

1) Περίγραμμα συχνότητας λέξεων (με επαλήθευση):

Καταγράψτε τις 15 λέξεις περιεχομένου που απαντώνται πιο συχνά (εξαιρουμένων των συναρτησιακών λέξεων όπως συνδέσμους και προθέσεις) στο παρακάτω κείμενο, με τις κατά προσέγγιση συχνότητες τους. ΠΡΟΕΙΔΟΠΟΙΗΣΗ: Λάβετε υπόψη ότι οι μετρήσεις ΜΠΟΡΕΙ ΝΑ ΜΗΝ είναι ακριβείς και σημειώστε "για να είναι ακριβείς, πρέπει να επαληθεύονται με ξεχωριστό εργαλείο μέτρησης". Κείμενο: [επικολλήστε το κείμενο εδώ]

2) Υποψήφιοι για συνεγκατάσταση:

Προτείνετε ζεύγη λέξεων (συνεγκαταστάσεις) που εμφανίζονται συχνά μαζί στο παρακάτω κείμενο. Δώστε τουλάχιστον ένα απόσπασμα από το κείμενο για κάθε ζευγάρι. Διπλή κατασκευή που δεν έχει αντίστοιχο στο κείμενο. Εάν δεν είστε σίγουροι, επισημάνετε το ως "χρειάζεται επαλήθευση". Κείμενο: [επικόλληση κειμένου]

3) Σύγκριση λεξιλογίου:

Θα σας δώσω δύο κείμενα. Για καθεμία: κατά προσέγγιση σύνολο λέξεων, παρατηρήσεις σχετικά με διαφορετικές ποικιλίες λέξεων και εξέχοντες τομείς λέξεων (π.χ. χρώμα, φύση, συναίσθημα). Δηλώστε ότι οι αριθμοί είναι κατά προσέγγιση. Αφήστε την ερμηνεία της σύγκρισης στην επαλήθευση μου. Κείμενο Α: [...] Κείμενο Β: [...]

4) Ερμηνεία αποτελεσμάτων:

Πήρα τα ακόλουθα αποτελέσματα από ένα εργαλείο μέτρησης: [επικόλληση αποτελεσμάτων]. Δημιουργήστε 2-3 υποθέσεις σχετικά με το τι μπορεί να σημαίνουν αυτοί οι αριθμοί γλωσσικά. Σημειώστε κάθε υπόθεση ως «απαιτεί στοιχεία» και πείτε μου πώς μπορώ να τη δοκιμάσω. Αποφύγετε τα υπερβολικά σχόλια.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμο: "Ποια λέξη εμφανίζεται περισσότερο σε αυτό το κείμενο;"

Ισχυρό: "Παραγράψτε τις λέξεις με το πιο συχνό περιεχόμενο σε αυτό το κείμενο με την κατά προσέγγιση συχνότητά τους. Εξαιρέστε τις συναρτησιακές λέξεις. Διευκρινίστε ότι οι αριθμοί δεν είναι ακριβείς και πρέπει να επαληθευτούν με ένα ξεχωριστό εργαλείο. Δώστε μια παραδειγματική πρόταση για κάθε λέξη."

Η ισχυρή προτροπή κάνει το AI να αποδεχτεί το όριο μέτρησης και σας ενημερώνει εκ των προτέρων ότι απαιτείται επαλήθευση. Στο αδύναμο μήνυμα, το AI δίνει έναν μόνο αριθμό και δεν ξέρετε ότι μπορεί να είναι λάθος.

Πίνακας μέτρησης και αξιοπιστίας

μέτρηση

Τι δείχνει

AI μόνο

σωστό τρόπο

συχνότητα λέξης

συχνές λέξεις

Περίπου, ριψοκίνδυνο

Counter + σχολιασμός AI

συνεγκατάσταση

αυτοί που πέρασαν μαζί

Παράγει υποψηφίους

Επιβεβαίωση από το κείμενο

Αναλογία τύπου/κουπονιού

Λεκτική ποικιλομορφία

Μπορεί να είναι παραπλανητικό

Λογαριασμός με εργαλείο

εποχιακή αλλαγή

Τάση με την πάροδο του χρόνου

δημιουργεί υποθέσεις

Μετρήστε και επαληθεύστε

Τελικό σχόλιο

Σημασία

Δυνατό αλλά υπερβάλλει

ανθρώπινη κρίση

Λέξεις-κλειδιά και έννοιες n-gram

Δύο έννοιες διευκολύνουν την εργασία σας στην ανάλυση corpus. Η πρώτη είναι η λέξη-κλειδί (λέξη-κλειδί στα αγγλικά - η λέξη που εμφανίζεται σε ένα κείμενο ή συγγραφέα πολύ πιο συχνά από το αναμενόμενο σε σύγκριση με τη γενική γλώσσα, δίνοντας σε αυτό το κείμενο τον «χαρακτήρα» του). Οι λέξεις-κλειδιά ενός συγγραφέα αποκαλύπτουν τα ενδιαφέροντα και το στυλ του. Για παράδειγμα, αν η «θάλασσα» και ο «χωρισμός» συμβαίνουν συχνότερα από ό,τι αναμενόταν σε έναν ποιητή, αυτή η στατιστική προεξοχή γίνεται η αφετηρία για μια ερμηνεία. Για τον προσδιορισμό λέξεων-κλειδιών, είναι απαραίτητο να συγκρίνουμε τις συχνότητες ενός κειμένου με τις συχνότητες ενός σώματος αναφοράς (ένα γενικό, μεγάλο σώμα κειμένου που χρησιμοποιείται για σύγκριση). Αυτή η σύγκριση είναι μια οριστική δουλειά εργαλείου, είναι ένας υπολογισμός που η τεχνητή νοημοσύνη δεν μπορεί να κάνει αξιόπιστα από μόνη της.

Το δεύτερο είναι το n-gram (μια ακολουθία n διαδοχικών λέξεων σε ένα κείμενο, μια ακολουθία δύο λέξεων ονομάζεται "bigram", μια ακολουθία τριών λέξεων ονομάζεται "trigram"). Η ανάλυση N-gram αποκαλύπτει τις τυπολατρικές εκφράσεις και τις συχνά χρησιμοποιούμενες φράσεις ενός συγγραφέα. Για παράδειγμα, εάν ένας συγγραφέας χρησιμοποιεί φράσεις όπως "είδος" ή "ωστόσο" εξαιρετικά συχνά, αυτό δείχνει τη συνήθεια του να κάνει προτάσεις. Το AI μπορεί να προτείνει αυτές τις φράσεις ως υποψήφιες. αλλά για πραγματική συχνότητα και στατιστική σημασία είναι απαραίτητο να επιστρέψουμε στο εργαλείο μέτρησης.

Συμβουλή: Πείτε στην τεχνητή νοημοσύνη: "Καταχωρίστε τις αξιόλογες φράσεις (δύο ή τρεις λέξεις) σε αυτό το κείμενο ως υποψήφιες και δώστε ένα παράδειγμα από το κείμενο για καθεμία." Πάρτε τη λίστα υποψηφίων και μετρήστε την πραγματική συχνότητα με ένα ξεχωριστό εργαλείο. Τοποθετήστε το AI ως «παρατηρητή», τον πράκτορα ως «μετρητή» και τον εαυτό σας ως «διερμηνέα».

Συνήθη λάθη

  • Βασιζόμενοι στον ακατέργαστο αριθμό του AI. Το AI δεν είναι αριθμομηχανή. Επαληθεύστε τον ακριβή αριθμό με ξεχωριστό εργαλείο.
  • Παρουσίαση του αριθμού χωρίς σχόλιο. "Πέρασε 47 φορές" δεν λέει τίποτα? Εσύ δημιουργείς το νόημα.
  • Παράβλεψη μήκους κειμένου. Τα ποσοστά ποικιλομορφίας στίχων είναι ευαίσθητα στο μήκος.
  • Εκπόνηση διπλωματικής εργασίας χωρίς επαλήθευση της συνεγκατάστασης. Τα ζευγάρια που δεν είναι AI μπορεί να προτείνουν Επιβεβαίωση από το κείμενο.
  • Ακραίο σχόλιο. Μην αποδεχτείτε τους "λόγους" που προτείνει η AI χωρίς στοιχεία.

Συνοπτικά

Η ανάλυση Corpus ανοίγει την μετρήσιμη πτυχή της λογοτεχνίας: συχνότητα, συνεγκατάσταση, λεξιλόγιο, περιοδική αλλαγή. Η τεχνητή νοημοσύνη είναι ισχυρή σε αυτόν τον τομέα στην αναγνώριση προτύπων και στην ερμηνεία των αποτελεσμάτων. αλλά είναι αναξιόπιστο σε απόλυτη μέτρηση. Επαληθεύστε τον αριθμό με το ξεχωριστό εργαλείο, επιβεβαιώστε τις συνθέσεις από το κείμενο και καθορίστε μόνοι σας τη σημασία κάθε αριθμού. Ο αριθμός δεν είναι απόδειξη, είναι η πόρτα των αποδείξεων.

Εργασία εφαρμογής

Επιλέξτε ένα σύντομο κείμενο (500-1000 λέξεις). Προσδιορίστε μια λέξη περιεχομένου (π.χ. "νύχτα" ή "δρόμος"). Πρώτα, μετρήστε τον εαυτό σας στο κείμενο. Στη συνέχεια, βάλτε το AI να το μετρήσει. Συγκρίνετε τα δύο αποτελέσματα. Εάν υπάρχει διαφορά, διερευνήστε τον λόγο. Στη συνέχεια, γράψτε ένα σχόλιο μιας παραγράφου σχετικά με τη λειτουργία αυτής της λέξης στο κείμενο — μετατρέποντας τον αριθμό σε νόημα.

λίστα ελέγχου

  • [ ] Έθεσα μια ξεκάθαρη γλωσσική ερώτηση.
  • [ ] Όρισα τα όρια του corpus (κείμενο, έκδοση, τελεία).
  • [ ] Επιβεβαίωσα τον αριθμό του AI με δεύτερο τρόπο.
  • [ ] Επιβεβαίωσα τις συνθέσεις από το κείμενο.
  • [ ] Δεν άφησα τον αριθμό χωρίς σχόλιο. Το νόημα το δημιούργησα μόνος μου.