Keuntungan:
- Keupayaan untuk merangka ukuran korpus seperti kekerapan perkataan, kolokasi, kekayaan perbendaharaan kata dan kata kunci dengan kecerdasan buatan
- Mengetahui bahawa kecerdasan buatan tidak boleh dipercayai dalam pengiraan tepat dan dapat mengesahkan setiap kiraan dengan alat yang berasingan
- Keupayaan untuk memahami bahawa nombor tidak mengatakan apa-apa dengan sendirinya dan tafsiran linguistik yang menetapkan makna adalah milik manusia.
Kajian sastera dan bahasa bukan sekadar "komentar"; Ia juga mempunyai aspek yang boleh diukur dan boleh dikira. Berapa banyak perkataan berbeza yang digunakan oleh pengarang, perkataan mana yang dia suka gunakan dengan perkataan mana, perkataan mana yang menjadi biasa dalam sesuatu tempoh - ini diselidiki melalui linguistik (sains yang mengkaji bunyi, struktur, makna dan penggunaan bahasa) dan terutamanya linguistik korpus. Korpus ialah koleksi teks, seperti karya lengkap seorang pengarang, arkib tahunan akhbar, atau puisi sesuatu zaman. Analisis korpus mencari corak berangka dalam bahagian ini.
Dalam unit ini, kita akan belajar menggunakan AI sebagai pembantu analisis korpus: mengekstrak metrik dengan cepat seperti kekerapan perkataan (bilangan kali perkataan muncul dalam teks), kolokasi (pasangan perkataan yang kerap berlaku bersama, cth. "hitam" + "nasib saya"), kekayaan perbendaharaan kata dan variasi bermusim. Tetapi amaran dari awal: AI boleh membuat kesilapan apabila mengira sahaja; Alat khas diperlukan untuk kiraan yang besar dan tepat, dan anda adalah ahli bahasa yang menetapkan makna setiap nombor.
Di manakah AI kuat dan di manakah ia lemah dalam analisis korpus?
Kekuatannya ialah: Mengenal corak dalam teks kecil dan sederhana, menghasilkan hipotesis tentang perbendaharaan kata teks, mencadangkan calon untuk kolokasi, mentafsir keputusan, menerangkan metodologi. AI bertanya "apakah frasa yang menonjol dalam pengarang ini?" Ia memberikan permulaan yang cepat kepada soalan.
Kelemahan: Pengiraan yang tepat. AI ialah model bahasa, bukan kalkulator; boleh memberikan anggaran dan kadangkala jawapan yang salah kepada soalan "berapa kali ia berlaku" dalam teks yang panjang. Untuk kekerapan tepat, statistik kolokasi tepat atau pengimbasan korpus besar beribu-ribu perkataan, perisian khusus (cth. alatan korpus seperti AntConc atau hamparan) digunakan. AI adalah berharga dalam mentafsir output alat ini; Tetapi jangan buat dia melakukan kiraan mentah secara membuta tuli.
Petua: Jika anda memerlukan nombor yang tepat, gunakan dua cara: minta alat untuk mengira dalam teks kecil dan minta AI mentafsirkannya; Atau minta kiraan AI dan sahkannya dengan cara lain. Jangan sekali-kali menggunakan ayat "AI berkata ia berlaku 47 kali" tanpa pengesahan.
Kajian korpus langkah demi langkah
- Letakkan soalan. "Bagaimanakah perkataan berwarna diedarkan dalam penyair ini?" Mengira tidak bermakna tanpa soalan yang jelas seperti:
- Tentukan korpus. Teks yang mana? Edisi yang mana? tempoh yang mana? Sempadan mesti jelas.
- Pilih ukuran. Kekerapan, kolokasi, kekayaan perbendaharaan kata?
- Ukur dan sahkan. Buat kiraan, kemudian sahkan cara kedua.
- Komen. Nombor sahaja tidak mengatakan apa-apa; Komen andalah yang menjadikan penemuan bahawa "perkataan warna digandakan dalam tempoh kedua" bermakna.
Ukuran kekayaan perbendaharaan kata yang kerap digunakan ialah nisbah bilangan perkataan yang berbeza kepada jumlah bilangan perkataan (nisbah jenis/token). Jika nisbah ini tinggi, teks adalah kepelbagaian perkataan, dan jika rendah, bermakna ia berulang. Tetapi nisbah ini dipengaruhi oleh panjang teks; Berhati-hati apabila membandingkan teks pendek dan panjang secara langsung.
tiga kes mini
Kes 1 — Kolokasi menunjukkan gaya. Seorang penyelidik meneliti gandingan kata adjektif-kata nama dalam 3 buah novel seorang novelis. AI mencadangkan bahawa perkataan "pucat" sepadan dengan 5 kata nama yang berbeza; Penyelidik mengesahkan 4 teks dan menghapuskan 1 sebagai rekaan. Corak yang disahkan menjadi pernyataan tesis tentang gaya deskriptif penulis.
Kes 2 — Ralat mengira ditangkap. Seorang pelajar bertanya kepada AI berapa kali perkataan "malam" muncul dalam teks 2,000 perkataan; AI berkata "23". Apabila pelajar melemparkan teks ke dalam hamparan dan membilangnya, bilangan sebenar ialah 17. Telah menjadi jelas bahawa kiraan mentah AI tidak boleh dipercayai.
Kes 3 — Perubahan berkala mencetuskan kontroversi. Satu kumpulan membandingkan perkadaran perkataan abstrak dalam puisi awal dan akhir penyair. Draf pertama AI mencadangkan trend; Apabila kumpulan itu kembali ke teks dan mengesahkan kiraan, trend itu ternyata benar, tetapi "punca" yang dicadangkan oleh AI adalah spekulasi yang tidak dapat disahkan dan dihapuskan.
Empat templat yang boleh disalin
1) Garis kekerapan perkataan (dengan pengesahan):
Senaraikan 15 perkataan kandungan yang paling kerap berlaku (tidak termasuk perkataan fungsi seperti kata sendi dan kata depan) dalam teks di bawah, dengan kekerapan anggarannya. AMARAN: Ambil perhatian bahawa kiraan MUNGKIN TIDAK tepat dan perhatikan "untuk tepat, mereka mesti disahkan dengan alat pengiraan yang berasingan." Teks: [tampal teks di sini]
2) Calon kolokasi:
Cadangkan pasangan perkataan (kolokasi) yang kerap berlaku bersama dalam teks di bawah. Berikan sekurang-kurangnya satu petikan daripada teks untuk setiap pasangan. Pembuatan berganda yang tidak mempunyai persamaan dalam teks; Jika anda tidak pasti, tandakannya sebagai "memerlukan pengesahan".Teks: [tampal teks]
3) Perbandingan kosa kata:
Saya akan memberi anda dua teks. Untuk setiap: anggaran jumlah perkataan, pemerhatian tentang jenis perkataan yang berbeza dan domain perkataan yang menonjol (cth. warna, sifat, emosi). Nyatakan bahawa nombor adalah anggaran. Serahkan tafsiran perbandingan kepada pengesahan saya. Teks A: [...] Teks B: [...]
4) Tafsiran keputusan:
Saya mendapat keputusan berikut daripada alat pengiraan: [tampalkan hasil]. Hasilkan 2-3 hipotesis tentang maksud nombor ini secara linguistik. Tandai setiap hipotesis sebagai "memerlukan bukti" dan beritahu saya bagaimana saya boleh mengujinya. Elakkan komen yang berlebihan.
Gesaan lemah / Gesaan kuat
Lemah: "Perkataan manakah yang paling banyak terdapat dalam teks ini?"
Kuat: "Senaraikan perkataan kandungan yang paling kerap dalam teks ini dengan kekerapan anggarannya; kecualikan perkataan fungsi. Jelaskan bahawa nombor itu tidak tepat dan perlu disahkan dengan alat yang berasingan. Berikan contoh ayat untuk setiap perkataan."
Gesaan yang kuat membuatkan AI menerima had kiraan dan memberitahu anda terlebih dahulu bahawa pengesahan diperlukan. Dalam gesaan yang lemah, AI memberikan satu nombor dan anda tidak tahu bahawa ia mungkin salah.
Jadual ukuran dan kebolehpercayaan
pengukuran
Apa yang ditunjukkan
AI sahaja
cara yang betul
kekerapan perkataan
perkataan yang kerap
Mengenai, berisiko
Komen balas + AI
kolokasi
mereka yang berlalu bersama
Menghasilkan calon
Pengesahan daripada teks
Nisbah jenis/token
Kepelbagaian lisan
Boleh mengelirukan
Akaun dengan alat
perubahan bermusim
Trend mengikut masa
menghasilkan hipotesis
Ukur dan sahkan
Komen penutup
Maknanya
Berkuasa tetapi keterlaluan
penghakiman manusia
Kata kunci dan konsep n-gram
Dua konsep menjadikan kerja anda lebih mudah dalam analisis korpus. Yang pertama ialah kata kunci (kata kunci dalam bahasa Inggeris - perkataan yang terdapat dalam teks atau pengarang lebih kerap daripada yang dijangkakan berbanding dengan bahasa umum, memberikan teks itu sebagai "watak"). Kata kunci pengarang mendedahkan minat dan gayanya; Sebagai contoh, jika "laut" dan "pemisahan" berlaku lebih kerap daripada yang dijangkakan dalam penyair, tonjolan statistik ini menjadi titik permulaan untuk tafsiran. Untuk mengenal pasti kata kunci, adalah perlu untuk membandingkan frekuensi teks dengan frekuensi korpus rujukan (sebuah badan umum, besar teks yang digunakan untuk perbandingan); Perbandingan ini ialah kerja alat yang muktamad, ini adalah pengiraan yang tidak boleh dibuat oleh AI dengan pasti sendiri.
Yang kedua ialah n-gram (urutan n perkataan berturut-turut dalam teks; urutan dua perkataan dipanggil "bigram", urutan tiga perkataan dipanggil "trigram"). Analisis N-gram mendedahkan ungkapan formula pengarang dan frasa yang sering digunakan. Contohnya, jika seorang penulis menggunakan frasa seperti "macam" atau "bagaimanapun" dengan sangat kerap, ini menunjukkan tabiatnya membuat ayat. AI boleh mencadangkan frasa ini sebagai calon; tetapi untuk kekerapan sebenar dan kepentingan statistik adalah perlu untuk kembali kepada alat pengiraan.
Petunjuk: Beritahu AI, "Senaraikan frasa yang ketara (dua atau tiga perkataan) dalam teks ini sebagai calon, dan berikan contoh daripada teks untuk setiap satu." Ambil senarai calon dan ukur kekerapan sebenar dengan alat yang berasingan. Letakkan AI sebagai "pemberitahu", ejen sebagai "kaunter", dan diri anda sebagai "jurubahasa."
Kesilapan biasa
- Bergantung pada kiraan mentah AI. AI bukan kalkulator; Sahkan nombor tepat dengan alat yang berasingan.
- Membentangkan nombor tanpa komen. "Lulus 47 kali" tidak berkata apa-apa; Anda mencipta makna.
- Mengabaikan panjang teks. Kadar kepelbagaian lirik adalah sensitif panjang.
- Membuat tesis tanpa mengesahkan kolokasi. Pasangan bukan AI mungkin mencadangkan; Sahkan daripada teks.
- Komen melampau. Jangan terima "alasan" yang dicadangkan oleh AI tanpa bukti.
Secara ringkasnya
Analisis korpus membuka aspek kesusasteraan yang boleh dikira: kekerapan, kolokasi, perbendaharaan kata, perubahan berkala. AI berkuasa dalam bidang ini dalam mengenali corak dan mentafsir keputusan; tetapi ia tidak boleh dipercayai dalam pengiraan mutlak. Sahkan nombor dengan alat yang berasingan, sahkan kolokasi daripada teks, dan tentukan sendiri makna setiap nombor. Nombor bukan bukti, ia adalah pintu kepada bukti.
Tugasan permohonan
Pilih teks pendek (500-1000 patah perkataan). Kenal pasti perkataan kandungan (cth. "malam" atau "jalan"). Pertama, hitung diri anda dalam teks. Kemudian minta AI mengiranya. Bandingkan kedua-dua keputusan; Jika ada perbezaan, siasat sebabnya. Kemudian tulis ulasan satu perenggan tentang fungsi perkataan itu dalam teks — menukar nombor menjadi makna.
senarai semak
- [ ] Saya meletakkan soalan linguistik yang jelas.
- [ ] Saya mentakrifkan sempadan korpus (teks, edisi, noktah).
- [ ] Saya mengesahkan kiraan AI dengan cara kedua.
- [ ] Saya mengesahkan kolokasi daripada teks.
- [ ] Saya tidak meninggalkan nombor tanpa komen; Saya sendiri yang mencipta makna.