Gewinne:
- Möglichkeit, Korpusmessungen wie Worthäufigkeit, Kollokation, Wortschatzreichtum und Schlüsselwörter mit künstlicher Intelligenz zu erstellen
- Zu wissen, dass künstliche Intelligenz bei der genauen Zählung unzuverlässig ist, und die Möglichkeit, jede Zählung mit einem separaten Tool zu überprüfen
- Fähigkeit zu verstehen, dass eine Zahl für sich genommen nichts aussagt und dass die sprachliche Interpretation, die die Bedeutung festlegt, dem Menschen obliegt.
Literatur- und Sprachwissenschaft sind nicht nur „Kommentare“; Es hat auch einen messbaren und zählbaren Aspekt. Wie viele verschiedene Wörter ein Autor verwendet, welche Wörter er gerne mit welchen Wörtern verwendet, welche Wörter in einer Zeit gebräuchlich werden – dies wird durch die Linguistik (die Wissenschaft, die den Klang, die Struktur, die Bedeutung und den Gebrauch von Sprache untersucht) und insbesondere durch die Korpuslinguistik untersucht. Ein Korpus ist eine Sammlung von Texten, beispielsweise das Gesamtwerk eines Autors, das Jahresarchiv einer Zeitung oder die Gedichte einer Epoche. Die Korpusanalyse sucht in diesem Abschnitt nach numerischen Mustern.
In dieser Einheit lernen wir, KI als Assistent für die Korpusanalyse einzusetzen: schnell Metriken wie Worthäufigkeit (die Häufigkeit, mit der ein Wort im Text vorkommt), Kollokation (Wortpaare, die häufig zusammen vorkommen, z. B. „schwarz“ + „mein Vermögen“), Wortschatzreichtum und saisonale Variationen zu extrahieren. Aber eine Warnung von Anfang an: KI kann allein beim Zählen Fehler machen; Für große und präzise Zählungen sind spezielle Werkzeuge erforderlich, und Sie sind der Linguist, der die Bedeutung jeder Zahl festlegt.
Wo ist die KI in der Korpusanalyse stark und wo ist sie schwach?
Seine Stärken sind: Muster in kleinen und mittleren Texten erkennen, Hypothesen über das Vokabular eines Textes erstellen, Kandidaten für Kollokationen vorschlagen, ein Ergebnis interpretieren, eine Methodik beschreiben. AI fragt: „Welche Sätze fallen bei diesem Autor auf?“ Es gibt einen schnellen Einstieg in die Frage.
Schwäche: Genaues Zählen. KI ist ein Sprachmodell, kein Taschenrechner; kann in einem langen Text eine ungefähre und manchmal falsche Antwort auf die Frage „Wie oft ist es vorgekommen“ geben. Für eine genaue Häufigkeit, genaue Colocation-Statistiken oder das Scannen großer Korpusse von Tausenden von Wörtern wird spezielle Software (z. B. Korpus-Tools wie AntConc oder eine Tabellenkalkulation) verwendet. KI ist bei der Interpretation der Ergebnisse dieser Tools wertvoll. Aber lassen Sie ihn nicht blind zählen.
Tipp: Wenn Sie eine genaue Zahl benötigen, nutzen Sie zwei Möglichkeiten: Lassen Sie ein Tool die Zählung in kleinem Text durchführen und lassen Sie die KI es interpretieren; Oder lassen Sie die KI zählen und verifizieren Sie es auf andere Weise. Verwenden Sie niemals den Satz „KI sagte, dass es 47 Mal vorkommt“ ohne Bestätigung.
Eine schrittweise Korpusstudie
- Stellen Sie eine Frage. „Wie sind Farbwörter in diesem Dichter verteilt?“ Ohne eine klare Frage wie:
- Definieren Sie den Korpus. Welche Texte? Welche Ausgabe? Welcher Zeitraum? Die Grenze muss frei sein.
- Wählen Sie die Messung aus. Häufigkeit, Zusammenstellung, Reichtum des Wortschatzes?
- Messen und überprüfen. Führen Sie die Zählung durch und bestätigen Sie dann auf eine zweite Art und Weise.
- Kommentar. Die Zahl allein sagt noch nichts; Es ist Ihr Kommentar, der die Feststellung, dass sich „Farbwörter in der zweiten Periode verdoppelt haben“, aussagekräftig macht.
Ein häufig verwendetes Maß für den Wortschatzreichtum ist das Verhältnis der Anzahl verschiedener Wörter zur Gesamtzahl der Wörter (Typ/Token-Verhältnis). Wenn dieses Verhältnis hoch ist, weist der Text eine Wortvielfalt auf, und wenn es niedrig ist, bedeutet es, dass es sich um Wiederholungen handelt. Dieses Verhältnis wird jedoch von der Textlänge beeinflusst; Seien Sie vorsichtig, wenn Sie kurze und lange Texte direkt vergleichen.
drei Mini-Koffer
Fall 1 – Kollokation demonstrierte einen Stil. Ein Forscher untersuchte Adjektiv-Nomen-Paarungen in drei Romanen eines Schriftstellers. AI schlug vor, dass das Wort „pale“ mit 5 verschiedenen Substantiven übereinstimmt; Der Forscher überprüfte vier der Texte und eliminierte einen als erfunden. Das bestätigte Muster wurde zu einer These über den Beschreibungsstil des Autors.
Fall 2 – Zählfehler erkannt. Ein Student fragte AI, wie oft das Wort „Nacht“ in einem Text mit 2.000 Wörtern vorkommt; Die KI sagte „23“. Als der Schüler den Text in eine Tabellenkalkulation eingab und zählen ließ, betrug die tatsächliche Zahl 17. Es hat sich gezeigt, dass die Rohzählung der KI unzuverlässig ist.
Fall 3 – Regelmäßige Änderungen lösten Kontroversen aus. Eine Gruppe verglich den Anteil abstrakter Wörter in den frühen und späten Gedichten eines Dichters. Der erste Entwurf von KI deutete einen Trend an; Als die Gruppe zum Text zurückkehrte und die Zählung überprüfte, stellte sich heraus, dass der Trend real war, aber die von der KI vorgeschlagenen „Ursachen“ waren nicht überprüfbare Spekulationen und wurden eliminiert.
Vier kopierbare Vorlagen
1) Übersicht über die Worthäufigkeit (mit Überprüfung):
Listen Sie im folgenden Text die 15 am häufigsten vorkommenden Inhaltswörter (ausgenommen Funktionswörter wie Konjunktionen und Präpositionen) mit ihrer ungefähren Häufigkeit auf. WARNUNG: Beachten Sie, dass die Zählungen möglicherweise nicht genau sind, und beachten Sie: „Um genau zu sein, müssen sie mit einem separaten Zähltool überprüft werden.“ Text: [Text hier einfügen]
2) Colocation-Kandidaten:
Schlagen Sie Wortpaare (Kollokationen) vor, die im folgenden Text häufig zusammen vorkommen. Geben Sie für jedes Paar mindestens ein Zitat aus dem Text an. Doppelte Erfindung, die im Text keine Entsprechung hat; Wenn Sie sich nicht sicher sind, markieren Sie es als „Bestätigung erforderlich“.Text: [Text einfügen]
3) Vokabelvergleich:
Ich werde Ihnen zwei Texte geben. Für jedes: ungefähre Gesamtzahl der Wörter, Beobachtungen zu verschiedenen Wortvarianten und prominente Wortdomänen (z. B. Farbe, Natur, Emotion). Geben Sie an, dass es sich bei den Zahlen um Näherungswerte handelt. Überlassen Sie die Interpretation des Vergleichs meiner Überprüfung. Text A: [...] Text B: [...]
4) Ergebnisinterpretation:
Ich habe die folgenden Ergebnisse von einem Zähltool erhalten: [Ergebnisse einfügen]. Generieren Sie 2-3 Hypothesen darüber, was diese Zahlen sprachlich bedeuten könnten. Markieren Sie jede Hypothese als „Nachweis erforderlich“ und sagen Sie mir, wie ich sie testen kann. Vermeiden Sie übermäßige Kommentare.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach: „Welches Wort kommt in diesem Text am häufigsten vor?“
Stark: „Listen Sie die häufigsten Inhaltswörter in diesem Text mit ihrer ungefähren Häufigkeit auf; schließen Sie Funktionswörter aus. Machen Sie deutlich, dass die Zahlen nicht genau sind und mit einem separaten Tool überprüft werden müssen. Geben Sie für jedes Wort einen Beispielsatz an.“
Durch die leistungsstarke Eingabeaufforderung akzeptiert die KI das Zähllimit und teilt Ihnen im Voraus mit, dass eine Überprüfung erforderlich ist. Bei der schwachen Eingabeaufforderung gibt die KI eine einzelne Zahl an und Sie wissen nicht, dass sie falsch sein könnte.
Mess- und Zuverlässigkeitstabelle
Messung
Was zeigt
KI allein
richtiger Weg
Worthäufigkeit
häufige Wörter
Über, riskant
Counter + KI-Kommentar
Colocation
diejenigen, die zusammen gegangen sind
Produziert Kandidaten
Bestätigung aus dem Text
Typ/Token-Verhältnis
Verbale Vielfalt
Kann irreführend sein
Konto mit Werkzeug
saisonaler Wechsel
Trend im Laufe der Zeit
generiert Hypothesen
Messen und überprüfen
Abschließender Kommentar
Bedeutung
Kraftvoll, aber übertrieben
menschliches Urteil
Schlüsselwort- und N-Gramm-Konzepte
Zwei Konzepte erleichtern Ihnen die Arbeit in der Korpusanalyse. Das erste ist das Schlüsselwort (Schlüsselwort im Englischen – das Wort, das in einem Text oder Autor im Vergleich zur allgemeinen Sprache viel häufiger als erwartet vorkommt und diesem Text seinen „Charakter“ verleiht). Die Schlüsselwörter eines Autors verraten seine Interessen und seinen Stil; Kommen beispielsweise „Meer“ und „Trennung“ bei einem Dichter häufiger vor als erwartet, wird dieser statistische Vorsprung zum Ausgangspunkt einer Interpretation. Um Schlüsselwörter zu identifizieren, ist es notwendig, die Häufigkeiten eines Textes mit den Häufigkeiten eines Referenzkorpus (einem allgemeinen, großen Textkörper, der zum Vergleich verwendet wird) zu vergleichen; Bei diesem Vergleich handelt es sich um eine definitive Werkzeugaufgabe, es handelt sich um eine Berechnung, die die KI allein nicht zuverlässig durchführen kann.
Das zweite ist n-Gramm (eine Folge von n aufeinanderfolgenden Wörtern in einem Text; eine Folge von zwei Wörtern wird „Bigramm“ genannt, eine Folge von drei Wörtern wird „Trigramm“ genannt). Die N-Gramm-Analyse enthüllt die formelhaften Ausdrücke und häufig verwendeten Phrasen eines Autors. Wenn ein Autor beispielsweise äußerst häufig Ausdrücke wie „irgendwie“ oder „jedoch“ verwendet, deutet dies auf seine Angewohnheit hin, Sätze zu bilden. Die KI kann diese Phrasen als Kandidaten vorschlagen; Für die tatsächliche Häufigkeit und statistische Signifikanz ist es jedoch erforderlich, zum Zählwerkzeug zurückzukehren.
Hinweis: Sagen Sie der KI: „Listen Sie die bemerkenswerten Phrasen (zwei oder drei Wörter) in diesem Text als Kandidaten auf und geben Sie für jede ein Beispiel aus dem Text.“ Nehmen Sie die Kandidatenliste und messen Sie die tatsächliche Häufigkeit mit einem separaten Tool. Positionieren Sie die KI als „Beobachter“, den Agenten als „Zähler“ und Sie selbst als „Dolmetscher“.
Häufige Fehler
- Verlassen Sie sich auf die reine Zählung der KI. KI ist kein Taschenrechner; Überprüfen Sie die genaue Anzahl mit einem separaten Werkzeug.
- Präsentiere die Nummer kommentarlos. „47 Mal bestanden“ sagt nichts; Sie schaffen die Bedeutung.
- Textlänge wird ignoriert. Die Lyric-Diversity-Raten sind längenabhängig.
- Abschlussarbeit erstellen, ohne die Kollokation zu überprüfen. Nicht-KI-Paare könnten vorschlagen; Bestätigen Sie anhand des Textes.
- Extremer Kommentar. Akzeptieren Sie die von der KI vorgeschlagenen „Gründe“ nicht ohne Beweise.
Zusammenfassend
Die Korpusanalyse erschließt die zählbaren Facetten der Literatur: Häufigkeit, Kollokation, Vokabular, periodischer Wandel. KI ist in diesem Bereich leistungsstark, wenn es darum geht, Muster zu erkennen und Ergebnisse zu interpretieren; aber beim absoluten Zählen ist es unzuverlässig. Überprüfen Sie die Nummer mit dem separaten Tool, bestätigen Sie Zusammenhänge im Text und ermitteln Sie selbst die Bedeutung jeder Nummer. Zahl ist kein Beweis, sie ist die Tür zum Beweis.
Anwendungsaufgabe
Wählen Sie einen kurzen Text (500-1000 Wörter). Identifizieren Sie ein Inhaltswort (z. B. „Nacht“ oder „Straße“). Zählen Sie sich zunächst im Text ein. Dann lassen Sie es von der KI zählen. Vergleichen Sie die beiden Ergebnisse; Wenn es einen Unterschied gibt, untersuchen Sie die Ursache. Schreiben Sie dann einen Kommentar in einem Absatz über die Funktion dieses Wortes im Text – indem Sie die Zahl in eine Bedeutung umwandeln.
Checkliste
- [ ] Ich habe eine klare sprachliche Frage gestellt.
- [ ] Ich habe die Grenzen des Korpus definiert (Text, Ausgabe, Zeitraum).
- [ ] Ich habe die Anzahl der KIs auf eine zweite Art überprüft.
- [ ] Ich habe die Kollokationen aus dem Text bestätigt.
- [ ] Ich habe die Nummer nicht unkommentiert hinterlassen; Die Bedeutung habe ich selbst geschaffen.