ユニット 3 / 11

言語学とコーパス分析: 数字を使った語彙の読み取り

利益:

  • 人工知能を使用して、単語の頻度、コロケーション、語彙の豊富さ、キーワードなどのコーパス測定を作成する機能
  • 人工知能は正確な計数において信頼性が低いことを知っており、個別のツールを使用して各計数を検証できる
  • 数字はそれ自体では何も語らず、意味を確立する言語解釈は人間に属することを理解する能力。

文学や語学は単なる「解説」ではありません。また、測定可能で数えられる側面もあります。作者がどれだけの異なる単語を使用するか、どの単語をどの単語と組み合わせて使用​​するのが好きか、ある時代にどの単語が一般的になるか - これらは、言語学 (言語の音、構造、意味、使用を研究する科学)、特にコーパス言語学を通じて調査されます。コーパスは、作家の全作品、新聞の年次アーカイブ、またはある時代の詩などのテキストのコレクションです。コーパス分析では、このチャンク内の数値パターンを探します。

この単元では、AI をコーパス分析アシスタントとして使用する方法を学びます。単語の頻度 (テキスト内で単語が出現する回数)、コロケーション (頻繁に一緒に出現する単語のペア、例: 「黒」 + 「私の幸運」)、語彙の豊富さ、季節変動などの指標を迅速に抽出します。ただし、最初から警告があります。AI は単独で数を数えるときに間違いを犯す可能性があります。大きくて正確な数を数えるには特別なツールが必要ですが、各数字の意味を確立するのは言語学者です。

コーパス分析においてAIはどこが強くてどこが弱いのでしょうか?

その強みは、小規模および中規模のテキストのパターンの認識、テキストの語彙に関する仮説の生成、連語の候補の提案、結果の解釈、方法論の説明です。 AIは「この作者のどのフレーズが際立っているか?」と尋ねます。それは質問を素早く始めます。

弱点:正確な計数。 AI は言語モデルであり、計算機ではありません。長いテキストで「何回発生しましたか」という質問に対して、おおよその、場合によっては不正確な答えを与えることができます。正確な頻度、正確なコロケーション統計、または数千の単語の大規模なコーパス スキャンには、特殊なソフトウェア (AntConc などのコーパス ツールやスプレッドシートなど) が使用されます。 AI は、これらのツールの出力を解釈するのに役立ちます。ただし、彼にやみくもに生のカウントをやらせるのはやめてください。

ヒント: 正確な数値が必要な場合は、2 つの方法を使用します。ツールに小さなテキストでカウントを実行させ、AI にそれを解釈させます。あるいはAIにカウントさせて別の方法で検証してもらいます。 「AI はそれが 47 回発生すると言いました」という文を確認せずに使用しないでください。

段階的なコーパス研究

  1. 質問をしてください。 「この詩人の中で色の言葉はどのように分布しているのでしょうか?」次のような明確な質問がなければ、数えることは無意味です。
  2. コーパスを定義します。どのテキストですか?どの版ですか?どの時代ですか?境界線は明確でなければなりません。
  3. 測定を選択します。頻度、コロケーション、語彙の豊富さ?
  4. 測定して検証します。カウントしてから、2 番目の方法を確認します。
  5. コメント。数字だけでは何も言えません。 「第 2 期ではカラーワードが 2 倍になった」という発見を意味あるものにするコメントです。

語彙の豊富さの尺度としてよく使用されるのは、単語の総数に対する異なる単語の数の比率 (タイプ/トークン比率) です。この比率が高い場合、テキストは単語が多様であることを示し、低い場合、それは繰り返しであることを意味します。ただし、この比率はテキストの長さに影響されます。短いテキストと長いテキストを直接比較する場合は注意してください。

ミニケース3個

ケース 1 — コロケーションはスタイルを示しています。研究者は、ある小説家の 3 冊の小説における形容詞と名詞の組み合わせを調べました。 AI は、「pale」という単語が 5 つの異なる名詞に一致すると示唆しました。研究者はテキストのうち 4 つを検証し、1 つを捏造として削除しました。確認されたパターンは、著者の記述スタイルに関する論文のステートメントになりました。

ケース 2 — カウントエラーが検出されました。ある学生が AI に、2,000 語のテキストの中に「夜」という単語が何回出現したかを尋ねました。 AIは「23」と言った。学生がテキストをスプレッドシートに投げ込んで数えさせたところ、実際の数は 17 でした。AI の生のカウントは信頼できないことが明らかになりました。

ケース 3 — 定期的な変更が論争を引き起こしました。あるグループは、詩人の初期の詩と後期の詩に含まれる抽象的な言葉の割合を比較しました。 AI の最初の草案は傾向を示唆していました。グループがテキストに戻ってカウントを検証したところ、その傾向は本物であることが判明しましたが、AIによって示唆された「原因」は検証不可能な推測であり、排除されました。

コピー可能な 4 つのテンプレート

1) 単語頻度の概要 (検証付き):

以下のテキストで最も頻繁に出現する 15 個の内容語 (接続詞や前置詞などの機能語を除く) を、そのおおよその頻度とともにリストします。警告: カウントは正確ではない可能性があり、「正確にするには、別のカウント ツールで検証する必要がある」ことに注意してください。テキスト: [ここにテキストを貼り付けます]

2) コロケーション候補:

以下のテキスト内で頻繁に一緒に出現する単語のペア (コロケーション) を提案してください。各ペアについて、テキストから少なくとも 1 つの引用を入力します。本文中に同等のものが存在しない二重捏造。よくわからない場合は、「検証が必要」としてマークしてください。テキスト: [テキストを貼り付け]

3) 語彙の比較:

テキストを2冊お渡しします。それぞれについて: おおよその合計単語、さまざまな単語の種類に関する観察、および顕著な単語の領域 (色、性質、感情など)。数値はおおよそであることを述べてください。比較の解釈は私の検証に任せます。テキスト A: [...] テキスト B: [...]

4) 結果の解釈:

計数ツールから次の結果が得られました: [結果を貼り付け]。これらの数字が言語的に何を意味するかについて 2 ~ 3 つの仮説を生成します。各仮説を「証拠が必要」としてマークし、それをテストする方法を教えてください。過度なコメントは避けてください。

弱いプロンプト / 強いプロンプト

弱者: 「このテキストに最も多く出現する単語はどれですか?」

Strong: 「このテキスト内で最も頻繁に使用される内容語をおおよその頻度とともにリストします。機能語は除外します。数値は正確ではなく、別のツールで検証する必要があることを明確にしてください。各語に例文を示します。」

強力なプロンプトにより、AI はカウント制限を受け入れ、検証が必要であることを事前に通知します。弱いプロンプトでは、AI は単一の数字を与えますが、それが間違っている可能性があることはわかりません。

測定と信頼性の表

測定

何を示すか

AI単体

正しい方法

単語の頻度

よく使う言葉

について、危険

カウンター+AI解説

コロケーション

一緒に通り過ぎた人たち

候補者を輩出する

本文からの確認

タイプ/トークンの比率

言葉の多様性

誤解を招く可能性があります

ツール付きアカウント

季節の変化

時間の経過に伴う傾向

仮説を生成します

測定して検証する

結びのコメント

意味

強力だが誇張している

人間の判断

キーワードと N グラムの概念

2 つの概念により、コーパス分析の作業が容易になります。 1 つ目はキーワード (英語のキーワード - 一般的な言語と比較して予想よりもはるかに頻繁にテキストまたは著者の中で出現し、そのテキストに「特徴」を与える単語) です。著者のキーワードは、彼の興味とスタイルを明らかにします。たとえば、詩人の中で「海」と「別れ」が予想以上に頻繁に出現する場合、この統計的な突出が解釈の出発点となる。キーワードを特定するには、テキストの頻度を参照コーパス (比較に使用される一般的な大量のテキスト本体) の頻度と比較する必要があります。この比較は決定的なツールの仕事であり、AI だけでは確実に行うことができない計算です。

2 つ目は n-gram (テキスト内の n 個の連続する単語のシーケンス。2 つの単語のシーケンスは「バイグラム」と呼ばれ、3 つの単語のシーケンスは「トリグラム」と呼ばれます) です。 Nグラム解析により、著者の定型表現や頻繁に使用されるフレーズが明らかになります。たとえば、作家が「なんだか」や「しかし」などのフレーズを非常に頻繁に使用する場合、これはその作家の文章作成の癖を示しています。 AI はこれらのフレーズを候補として提案できます。ただし、真の頻度と統計的有意性を得るには、カウント ツールに戻る必要があります。

ヒント: AI に「このテキスト内の注目すべきフレーズ (2 つまたは 3 つの単語) を候補としてリストし、それぞれについてテキストから例を示してください。」と指示します。候補リストを取得し、別のツールを使用して実際の頻度を測定します。 AIを「通知者」、エージェントを「カウンター」、自分を「通訳」と位置付けます。

よくある間違い

  • AI の raw カウントに依存します。 AI は計算機ではありません。正確な数値は別のツールで確認してください。
  • コメントなしで番号を提示します。 「47 回合格」では何もわかりません。意味を生み出すのはあなたです。
  • テキストの長さは無視します。歌詞の多様性率は長さに依存します。
  • コロケーションを確認せずに論文を作成する。 AI ではないカップルは次のように提案するかもしれません。本文よりご確認ください。
  • 極端なコメント。 AIが提示する「理由」を根拠もなく鵜呑みにしないでください。

要約すると

コーパス分析は、頻度、コロケーション、語彙、周期的変化など、文学の数え切れない側面を明らかにします。 AI は、パターンの認識と結果の解釈において、この分野で強力です。しかし、絶対的なカウントでは信頼できません。別のツールで数字を確認し、テキストからコロケーションを確認し、各数字の意味を自分で確立します。数字は証拠ではなく、証拠への扉です。

アプリケーションタスク

短いテキスト (500 ~ 1000 ワード) を選択します。内容の単語を特定します (「夜」や「道路」など)。まず、テキストの中に自分自身を数えてください。あとはAIにカウントしてもらいます。 2 つの結果を比較します。違いがある場合は、その理由を調査してください。次に、テキスト内のその単語の機能について 1 段落のコメントを書き、数字を意味に変えます。

チェックリスト

  • [ ] 明確な言語的な質問をしました。
  • [ ] コーパスの境界 (テキスト、エディション、時代) を定義しました。
  • [ ] 2 番目の方法で AI のカウントを検証しました。
  • [ ] 本文から連語を確認しました。
  • [ ] コメントなしで番号を残したわけではありません。意味は自分で作りました。