단위 3 / 11

언어학과 코퍼스 분석: 숫자로 어휘 읽기

이득:

  • 인공 지능을 사용하여 단어 빈도, 배열, 어휘 풍부도 및 키워드와 같은 말뭉치 측정 초안 작성 기능
  • 인공지능이 정확한 계수를 신뢰할 수 없음을 알고, 별도의 도구로 각각의 계수를 검증할 수 있음
  • 숫자 그 자체로는 아무 것도 말할 수 없으며, 그 의미를 확립하는 언어적 해석은 인간의 몫이라는 것을 이해하는 능력.

문학과 언어 연구는 단순한 "해설"이 아닙니다. 또한 측정 가능하고 셀 수 있는 측면도 있습니다. 저자가 사용하는 다양한 단어의 수, 어떤 단어와 함께 사용하기를 좋아하는 단어, 특정 기간에 어떤 단어가 일반적으로 사용되는지 등은 언어학(언어의 소리, 구조, 의미 및 사용을 연구하는 과학), 특히 말뭉치 언어학을 통해 조사됩니다. 코퍼스는 작가의 전체 작품, 신문의 연간 아카이브 또는 특정 시대의 시와 같은 텍스트 모음입니다. 코퍼스 분석은 이 청크에서 숫자 패턴을 찾습니다.

이 단원에서는 AI를 말뭉치 분석 도우미로 사용하는 방법을 배웁니다. 즉, 단어 빈도(텍스트에서 단어가 나타나는 횟수), 배열(자주 함께 나타나는 단어 쌍, 예: "black" + "my luck"), 어휘 풍부도, 계절적 변화와 같은 지표를 빠르게 추출합니다. 하지만 처음부터 경고합니다. AI는 혼자 계산할 때 실수를 할 수 있습니다. 크고 정확한 수를 계산하려면 특별한 도구가 필요하며, 각 숫자의 의미를 설정하는 언어학자는 바로 당신입니다.

코퍼스 분석에서 AI가 강한 부분은 어디이고 약한 부분은 어디인가요?

그 강점은 다음과 같습니다: 중소 텍스트의 패턴 인식, 텍스트의 어휘에 대한 가설 생성, 연어 후보 제안, 결과 해석, 방법론 설명. AI가 “이 작가의 어떤 문구가 눈에 띄나요?”라고 묻습니다. 질문에 대한 빠른 시작을 제공합니다.

약점: 정확한 계산. AI는 계산기가 아니라 언어 모델입니다. 긴 텍스트에서 "몇 번이나 발생했는지"라는 질문에 대략적이고 때로는 잘못된 답변을 제공할 수 있습니다. 정확한 빈도, 정확한 코로케이션 통계 또는 수천 단어의 대규모 코퍼스 스캐닝을 위해 특수 소프트웨어(예: AntConc 또는 스프레드시트와 같은 코퍼스 도구)가 사용됩니다. AI는 이러한 도구의 결과를 해석하는 데 유용합니다. 하지만 맹목적으로 계산을 하게 만들지 마세요.

팁: 정확한 숫자가 필요한 경우 두 가지 방법을 사용하십시오. 도구를 사용하여 작은 텍스트로 계산하고 AI가 이를 해석하도록 합니다. 아니면 AI에게 카운트를 시켜서 다른 방법으로 검증해 보세요. "AI가 47번 발생했다고 합니다"라는 문장을 확인 없이 사용하지 마세요.

단계별 코퍼스 연구

  1. 질문을 하세요. “이 시인에서는 색어가 어떻게 분포되어 있나요?” 다음과 같은 명확한 질문이 없으면 계산은 의미가 없습니다.
  2. 말뭉치를 정의합니다. 어떤 텍스트? 어느 에디션인가요? 어느 기간입니까? 경계가 명확해야 합니다.
  3. 측정을 선택합니다. 빈도, 배열, 어휘의 풍부함?
  4. 측정하고 확인하십시오. 계산한 다음 두 번째 방법을 확인하세요.
  5. 논평. 숫자만으로는 아무 말도 하지 않습니다. "두 번째 기간에 색상 단어가 두 배로 늘어났다"는 발견을 의미있게 만드는 것은 귀하의 의견입니다.

어휘 풍부도에 대해 자주 사용되는 척도는 총 단어 수에 대한 다양한 단어 수의 비율(유형/토큰 비율)입니다. 이 비율이 높으면 텍스트가 단어가 다양하다는 의미이고, 낮으면 반복적이라는 의미입니다. 그러나 이 비율은 텍스트 길이의 영향을 받습니다. 짧은 텍스트와 긴 텍스트를 직접 비교할 때는 주의하세요.

세 개의 미니 케이스

사례 1 - 배열로 스타일을 시연했습니다. 한 연구자가 소설가의 소설 3편에서 형용사-명사 쌍을 조사했습니다. AI는 "창백함"이라는 단어가 5개의 다른 명사와 일치한다고 제안했습니다. 연구자는 4개의 텍스트를 확인하고 1개를 조작된 것으로 제거했습니다. 확인된 패턴은 작가의 서술형식에 대한 논제문이 되었다.

사례 2 - 계산 오류가 발견되었습니다. 한 학생이 AI에게 2,000 단어로 된 텍스트에 "밤"이라는 단어가 몇 번이나 등장했는지 물었습니다. AI는 "23"이라고 말했다. 학생이 텍스트를 스프레드시트에 던져서 계산해 보았더니 실제 숫자는 17이었습니다. AI의 원시 계산이 신뢰할 수 없다는 것이 분명해졌습니다.

사례 3 - 주기적인 변화로 인해 논란이 촉발되었습니다. 한 그룹은 시인의 초기 시와 후기 시에서 추상적 단어의 비율을 비교했습니다. AI의 첫 번째 초안은 추세를 제시했습니다. 단체가 다시 문자로 돌아가 수치를 검증한 결과 추세는 사실로 드러났지만, AI가 제시한 '원인'은 검증할 수 없는 추측으로 삭제됐다.

복사 가능한 템플릿 4개

1) 단어 빈도 개요(검증 포함):

아래 텍스트에 가장 자주 발생하는 15개의 내용 단어(접속사, 전치사와 같은 기능 단어 제외)를 대략적인 빈도와 함께 나열하십시오. 경고: 계산이 정확하지 않을 수 있으며 "정확하려면 별도의 계산 도구를 사용하여 확인해야 합니다"라고 언급하세요. 텍스트: [여기에 텍스트 붙여넣기]

2) 코로케이션 후보:

아래 텍스트에서 자주 함께 나타나는 단어 쌍(연어)을 제안하세요. 각 쌍의 텍스트에서 최소한 하나의 인용문을 제공하십시오. 본문에 상응하는 내용이 없는 이중 제작; 확실하지 않은 경우 "확인 필요"로 표시하세요.텍스트: [텍스트 붙여넣기]

3) 어휘 비교:

문자 두 개를 드리겠습니다. 각각에 대해: 대략적인 전체 단어, 다양한 단어 종류에 대한 관찰, 주요 단어 영역(예: 색상, 자연, 감정). 숫자는 대략적인 수치임을 명시합니다. 비교의 해석은 내 검증에 맡기십시오. 텍스트 A: [...] 텍스트 B: [...]

4) 결과 해석:

계산 도구에서 다음과 같은 결과를 얻었습니다. [결과 붙여넣기]. 이 숫자가 언어적으로 무엇을 의미할지에 대한 2~3개의 가설을 생성합니다. 각 가설을 "증거 필요"로 표시하고 이를 테스트할 수 있는 방법을 알려주세요. 과도한 댓글은 자제하세요.

약한 프롬프트 / 강한 프롬프트

약함: "이 텍스트에서 가장 많이 나오는 단어는 무엇입니까?"

Strong: "이 텍스트에서 가장 빈번한 내용 단어를 대략적인 빈도와 함께 나열하십시오. 기능 단어는 제외하십시오. 숫자가 정확하지 않으며 별도의 도구로 확인해야 함을 분명히 하십시오. 각 단어에 대한 예문을 제공하십시오."

강력한 프롬프트는 AI가 카운트 제한을 수락하고 확인이 필요함을 미리 알려줍니다. 약한 프롬프트에서는 AI가 단일 숫자를 알려주는데 그것이 틀릴 수도 있다는 것을 알 수 없습니다.

측정 및 신뢰성 표

측정

무엇을 보여주나요?

AI 혼자

올바른 방법

단어 빈도

자주 사용하는 단어

약, 위험

카운터 + AI 해설

코로케이션

함께 지나간 사람들

후보자를 생산한다

문자로 확인

유형/토큰 비율

언어적 다양성

오해의 소지가 있을 수 있음

도구로 계정

계절의 변화

시간 경과에 따른 추세

가설을 생성

측정 및 검증

결론

의미

강력하지만 과장됨

인간의 판단

키워드 및 N-그램 개념

두 가지 개념을 사용하면 말뭉치 분석 작업이 더 쉬워집니다. 첫 번째는 키워드(영어로 된 키워드 - 일반 언어에 비해 예상보다 텍스트나 저자에서 훨씬 더 자주 발생하여 해당 텍스트에 "문자"를 부여하는 단어)입니다. 작가의 키워드는 그의 관심과 스타일을 드러냅니다. 예를 들어 시인에게 '바다'와 '이별'이 예상보다 자주 등장한다면, 이 통계적 돌출이 해석의 출발점이 된다. 키워드를 식별하려면 텍스트의 빈도를 참조 코퍼스(비교에 사용되는 일반적인 대규모 텍스트 본문)의 빈도와 비교해야 합니다. 이 비교는 결정적인 도구 작업이며, AI가 자체적으로 안정적으로 수행할 수 없는 계산입니다.

두 번째는 n-gram(텍스트에서 n개의 연속 단어로 구성된 시퀀스, 두 단어로 구성된 시퀀스를 "bigram", 세 단어로 구성된 시퀀스를 "trigram"이라고 함)입니다. N-gram 분석을 통해 저자의 정형화된 표현과 자주 사용되는 문구를 확인할 수 있습니다. 예를 들어, 작가가 "종류의" 또는 "그러나"와 같은 문구를 매우 자주 사용한다면 이는 그의 문장 작성 습관을 나타냅니다. AI는 이러한 문구를 후보로 제안할 수 있습니다. 그러나 실제 빈도와 통계적 유의성을 위해서는 계산 도구로 돌아가는 것이 필요합니다.

힌트: AI에게 "이 텍스트에서 주목할만한 문구(2~3개 단어)를 후보로 나열하고 각 텍스트에 대한 예를 제시하세요."라고 말하세요. 후보 목록을 가져와 별도의 도구로 실제 빈도를 측정합니다. AI를 '통지자'로, 에이전트를 '카운터'로, 자신을 '통역사'로 배치하세요.

일반적인 실수

  • AI의 원시 개수에 의존합니다. AI는 계산기가 아닙니다. 별도의 도구로 정확한 수치를 확인하세요.
  • 코멘트 없이 번호를 제시합니다. "47번 통과"는 아무 말도 하지 않습니다. 당신은 의미를 창조합니다.
  • 텍스트 길이를 무시합니다. 가사 다양성 비율은 길이에 민감합니다.
  • 배열을 확인하지 않고 논문을 작성합니다. AI가 아닌 커플이 제안할 수 있습니다. 문자로 확인하세요.
  • 극단적인 댓글입니다. 증거도 없이 AI가 제시한 '이유'를 받아들이지 마세요.

요약하면

코퍼스 분석은 빈도, 배열, 어휘, 주기적인 변화 등 문학의 셀 수 있는 측면을 열어줍니다. AI는 패턴을 인식하고 결과를 해석하는 데 있어 이 분야에서 강력합니다. 그러나 절대적인 계산에서는 신뢰할 수 없습니다. 별도의 도구를 사용하여 숫자를 확인하고, 텍스트에서 배열을 확인하고, 각 숫자의 의미를 직접 설정하세요. 숫자는 증거가 아니라 증거로 가는 문이다.

응용과제

짧은 텍스트(500~1000단어)를 선택하세요. 내용 단어를 식별합니다(예: "밤" 또는 "도로"). 먼저, 본문에서 자신의 수를 세어보세요. 그런 다음 AI가 계산하도록 하세요. 두 결과를 비교하십시오. 차이가 있는 경우 이유를 조사합니다. 그런 다음 텍스트에서 해당 단어의 기능에 대해 한 문단으로 된 설명을 작성하여 숫자를 의미로 바꾸십시오.

체크리스트

  • [ ] 명확한 언어적 질문을 던졌습니다.
  • [ ] 코퍼스(본문, 판, 기간)의 경계를 정의했습니다.
  • [ ] 두 번째 방법으로 AI의 카운트를 확인했습니다.
  • [ ] 본문에서 배열을 확인했습니다.
  • [ ] 댓글 없이 번호를 남기지 않았습니다. 그 의미는 제가 직접 만들었습니다.