Zyski:
- Możliwość opracowywania pomiarów korpusowych, takich jak częstotliwość słów, kolokacja, bogactwo słownictwa i słowa kluczowe, za pomocą sztucznej inteligencji
- Świadomość, że sztuczna inteligencja nie jest wiarygodna w dokładnym liczeniu i możliwość sprawdzenia każdego zliczenia za pomocą osobnego narzędzia
- Umiejętność zrozumienia, że liczba sama w sobie nic nie mówi i że interpretacja językowa ustalająca znaczenie należy do ludzi.
Literaturoznawstwo i językoznawstwo to nie tylko „komentarz”; Ma także aspekt mierzalny i policzalny. Ile różnych słów używa autor, jakich słów lubi używać z jakimi słowami, jakie słowa stają się powszechne w danym okresie – to bada językoznawstwo (nauka badająca dźwięk, strukturę, znaczenie i użycie języka), a zwłaszcza językoznawstwo korpusowe. Korpus to zbiór tekstów, takich jak kompletne dzieła danego autora, roczne archiwum gazety lub wiersze z danego okresu. Analiza korpusu szuka wzorców numerycznych w tym fragmencie.
W tej części nauczymy się wykorzystywać sztuczną inteligencję jako asystenta analizy korpusowej: szybko wyodrębniając wskaźniki, takie jak częstotliwość występowania słów (liczba wystąpień słowa w tekście), kolokacja (pary słów, które często występują razem, np. „czarny” + „moja fortuna”), bogactwo słownictwa i zmienność sezonowa. Ale ostrzeżenie od początku: sztuczna inteligencja może popełniać błędy, licząc samodzielnie; Do dużych i precyzyjnych obliczeń potrzebne są specjalne narzędzia, a Ty jesteś lingwistą, który ustala znaczenie każdej liczby.
Gdzie sztuczna inteligencja jest silna, a gdzie słaba w analizie korpusowej?
Jego mocne strony to: Rozpoznawanie wzorców w małych i średnich tekstach, generowanie hipotez na temat słownictwa tekstu, sugerowanie kandydatów do kolokacji, interpretacja wyniku, opisywanie metodologii. AI pyta: „Jakie frazy wyróżniają się u tego autora?” Umożliwia szybkie rozpoczęcie pytania.
Słabość: Dokładne liczenie. AI to model językowy, a nie kalkulator; potrafi udzielić przybliżonej, czasem błędnej odpowiedzi na pytanie „ile razy to się zdarzyło” w długim tekście. Do precyzyjnej częstotliwości, dokładnych statystyk kolokacji lub skanowania dużych korpusów liczących tysiące słów stosuje się specjalistyczne oprogramowanie (np. narzędzia korpusowe takie jak AntConc lub arkusz kalkulacyjny). Sztuczna inteligencja jest cenna w interpretowaniu wyników tych narzędzi; Ale nie zmuszaj go do ślepego liczenia.
Wskazówka: jeśli potrzebujesz dokładnej liczby, użyj dwóch sposobów: użyj narzędzia, które policzy małym tekstem i zinterpretuje to AI; Lub poproś AI o przeliczenie i zweryfikuj je w inny sposób. Nigdy nie używaj zdania „AI powiedziała, że zdarzyło się to 47 razy” bez potwierdzenia.
Badanie korpusowe krok po kroku
- Zadaj pytanie. „Jak rozmieszczone są kolorowe słowa u tego poety?” Liczenie nie ma sensu bez jasnego pytania typu:
- Zdefiniuj korpus. Które teksty? Które wydanie? Który okres? Granica musi być jasna.
- Wybierz pomiar. Częstotliwość, kolokacja, bogactwo słownictwa?
- Zmierz i sprawdź. Policz, a następnie potwierdź drugi sposób.
- Komentarz. Sama liczba nic nie mówi; To twój komentarz nadaje sens stwierdzeniu, że „kolorowe słowa podwoiły się w drugiej tercji”.
Często stosowaną miarą bogactwa słownictwa jest stosunek liczby różnych słów do całkowitej liczby słów (stosunek typu/tokenu). Jeśli ten stosunek jest wysoki, tekst jest zróżnicowany wyrazowo, a jeśli jest niski, oznacza to, że jest powtarzalny. Ale na ten stosunek ma wpływ długość tekstu; Zachowaj ostrożność przy bezpośrednim porównywaniu krótkich i długich tekstów.
trzy mini etui
Przypadek 1 — Kolokacja pokazała styl. Badacz zbadał pary przymiotnik-rzeczownik w 3 powieściach pisarza. AI zasugerowała, że słowo „blady” pasuje do 5 różnych rzeczowników; Badacz zweryfikował 4 teksty i wyeliminował 1 jako sfabrykowany. Potwierdzony wzór stał się tezą o stylu opisowym autora.
Przypadek 2 — Wykryto błąd liczenia. Uczeń zapytał AI, ile razy słowo „noc” pojawiło się w tekście liczącym 2000 słów; AI powiedziała „23”. Kiedy uczeń wrzucił tekst do arkusza kalkulacyjnego i kazał go policzyć, rzeczywista liczba wynosiła 17. Stało się jasne, że surowe obliczenia AI są niewiarygodne.
Przypadek 3 — Okresowe zmiany wywołały kontrowersje. Jedna grupa porównała proporcje słów abstrakcyjnych we wczesnych i późnych wierszach poety. Pierwszy projekt sztucznej inteligencji sugerował pewien trend; Kiedy grupa wróciła do tekstu i zweryfikowała obliczenia, trend okazał się realny, jednak „przyczyny” sugerowane przez sztuczną inteligencję były nieweryfikowalnymi spekulacjami i zostały wyeliminowane.
Cztery szablony do kopiowania
1) Zarys częstotliwości słów (z weryfikacją):
Wymień 15 najczęściej występujących słów w treści (z wyłączeniem słów funkcyjnych, takich jak spójniki i przyimki) w poniższym tekście wraz z ich przybliżoną częstotliwością. OSTRZEŻENIE: Należy pamiętać, że obliczenia MOGĄ NIE być dokładne i pamiętać, że „aby były dokładne, należy je zweryfikować za pomocą osobnego narzędzia do liczenia”. Tekst: [wklej tutaj tekst]
2) Kandydaci do kolokacji:
Zaproponuj pary słów (kolokacje), które często występują razem w poniższym tekście. Dla każdej pary podaj przynajmniej jeden cytat z tekstu. Podwójna fabrykacja, która nie ma odpowiednika w tekście; Jeśli nie jesteś pewien, oznacz go jako „wymaga weryfikacji”. Tekst: [wklej tekst]
3) Porównanie słownictwa:
Dam ci dwa teksty. Dla każdego: przybliżona liczba słów, obserwacje dotyczące różnych odmian słów i najważniejszych dziedzin słów (np. koloru, natury, emocji). Podaj, że liczby są przybliżone. Interpretację porównania zostaw mojej weryfikacji. Tekst A: [...] Tekst B: [...]
4) Interpretacja wyniku:
Otrzymałem następujące wyniki za pomocą narzędzia do liczenia: [wklej wyniki]. Wygeneruj 2–3 hipotezy na temat znaczenia językowego tych liczb. Oznacz każdą hipotezę jako „wymagającą dowodów” i powiedz, jak mogę ją przetestować. Unikaj nadmiernych komentarzy.
Słaba zachęta/silna zachęta
Słabe: „Jakie słowo występuje najczęściej w tym tekście?”
Mocne: „Wymień słowa najczęściej występujące w tym tekście wraz z ich przybliżoną częstotliwością; wyklucz słowa funkcyjne. Wyjaśnij, że liczby nie są dokładne i wymagają sprawdzenia za pomocą osobnego narzędzia. Podaj przykładowe zdanie dla każdego słowa”.
Potężny monit sprawia, że sztuczna inteligencja akceptuje limit liczby i z góry informuje, że wymagana jest weryfikacja. W słabym podpowiedzi AI podaje pojedynczą liczbę i nie wiadomo, że może się mylić.
Tabela pomiarów i niezawodności
pomiar
Co pokazuje
Sama sztuczna inteligencja
właściwy sposób
częstotliwość słów
częste słowa
O, ryzykowne
Licznik + komentarz AI
kolokacja
tych, którzy przeszli razem
Tworzy kandydatów
Potwierdzenie z tekstu
Stosunek typu/tokenu
Różnorodność werbalna
Może wprowadzać w błąd
Konto z narzędziem
zmiana sezonowa
Trend w czasie
generuje hipotezy
Zmierz i sprawdź
Komentarz końcowy
Znaczenie
Mocne, ale przesadzone
ludzki osąd
Pojęcia dotyczące słów kluczowych i n-gramów
Dwie koncepcje ułatwiają pracę w analizie korpusowej. Pierwszym z nich jest słowo kluczowe (słowo kluczowe w języku angielskim - słowo występujące w tekście lub autorze znacznie częściej niż oczekiwano w porównaniu z językiem ogólnym, nadające temu tekstowi „charakter”). Słowa kluczowe autora ujawniają jego zainteresowania i styl; Na przykład, jeśli „morze” i „oddzielenie” pojawiają się u poety częściej, niż się tego spodziewano, to to statystyczne wysunięcie staje się punktem wyjścia do interpretacji. Aby zidentyfikować słowa kluczowe, należy porównać częstość występowania tekstu z częstotliwością korpusu referencyjnego (ogólnego, dużego zbioru tekstu używanego do porównania); To porównanie jest ostatecznym zadaniem narzędzia, jest to obliczenie, którego sztuczna inteligencja nie jest w stanie samodzielnie dokonać w sposób niezawodny.
Drugi to n-gram (sekwencja n kolejnych słów w tekście; sekwencja dwóch słów nazywana jest „bigramem”, sekwencja trzech słów nazywana jest „trygramem”). Analiza N-gramów ujawnia formułowe wyrażenia autora i często używane frazy. Na przykład, jeśli pisarz niezwykle często używa wyrażeń takich jak „w pewnym sensie” lub „jednakże”, oznacza to, że ma nawyk tworzenia zdań. Sztuczna inteligencja może zasugerować te frazy jako kandydatów; ale dla prawdziwej częstotliwości i istotności statystycznej konieczne jest powrót do narzędzia liczącego.
Wskazówka: Powiedz AI: „Wymień godne uwagi wyrażenia (dwa lub trzy słowa) w tym tekście jako potencjalne i podaj przykład z tekstu dla każdego”. Weź listę kandydatów i zmierz rzeczywistą częstotliwość za pomocą osobnego narzędzia. Ustaw sztuczną inteligencję jako „obserwatora”, agenta jako „kontrahenta”, a siebie jako „tłumacza”.
Typowe błędy
- Opieram się na nieprzetworzonych obliczeniach AI. AI nie jest kalkulatorem; Sprawdź dokładną liczbę za pomocą osobnego narzędzia.
- Podaję numer bez komentarza. „Pasowało 47 razy” nic nie mówi; Ty tworzysz znaczenie.
- Ignorowanie długości tekstu. Wskaźniki różnorodności tekstów zależą od długości.
- Tworzenie pracy dyplomowej bez sprawdzania kolokacji. Pary nie posiadające sztucznej inteligencji mogą sugerować; Potwierdź z tekstu.
- Ekstremalny komentarz. Nie akceptuj „powodów” sugerowanych przez sztuczną inteligencję bez dowodów.
Podsumowując
Analiza korpusu otwiera policzalny aspekt literatury: częstotliwość, kolokację, słownictwo, okresową zmianę. Sztuczna inteligencja ma w tej dziedzinie potężną moc w rozpoznawaniu wzorców i interpretowaniu wyników; ale nie jest to wiarygodne w przypadku liczenia bezwzględnego. Zweryfikuj liczbę za pomocą osobnego narzędzia, potwierdź kolokacje z tekstu i samodzielnie ustal znaczenie każdej liczby. Liczba nie jest dowodem, jest bramą do dowodu.
Zadanie aplikacji
Wybierz krótki tekst (500-1000 słów). Zidentyfikuj słowo treści (np. „noc” lub „droga”). Najpierw policz siebie w tekście. Następnie niech AI to policzy. Porównaj oba wyniki; Jeśli jest różnica, sprawdź przyczynę. Następnie napisz jednoakapitowy komentarz na temat funkcji tego słowa w tekście — nadając liczbie znaczenie.
lista kontrolna
- [ ] Zadałem jasne pytanie językowe.
- [ ] Określiłem granice korpusu (tekst, wydanie, kropka).
- [ ] Sprawdziłem licznik AI w drugi sposób.
- [ ] Potwierdziłem kolokacje z tekstu.
- [ ] Nie pozostawiłem numeru bez komentarza; Sam stworzyłem znaczenie.