이득:
- NER, 관계 추출, 타임라인 및 네트워크 분석과 같은 기술을 사용하여 대규모 텍스트 세트에서 패턴을 추출하는 기능
- 패턴을 증거가 아닌 가설로 볼 수 있고, 엔터티를 소스에 연결하고 사람의 승인을 받아 정규화할 수 있습니다.
- 누락된 데이터와 샘플링 편향으로 인해 숫자가 어떻게 오해를 불러일으킬 수 있는지 이해하고, 인위적인 관계와 연대기를 피하는 능력.
역사 연구는 단순히 개별 문서를 읽는 것이 아닙니다. 대규모 문서 세트에서 패턴을 찾는 경우가 많습니다. 수년에 걸쳐 특정 이름이 어떤 맥락에서 나타납니까? 어떤 사람들이 정착촌과 연관되어 있나요? 시간이 지남에 따라 주제가 어떻게 바뀌나요? 누가 누구와 연락하고 있나요? 이러한 질문에는 단일 문서가 아니라 수백 개의 문서를 종합적으로 살펴봐야 합니다. 이를 종종 디지털 인문학, 즉 역사, 문학 등의 분야에 계산 방법을 적용하는 학문이라고 부릅니다.
AI는 대규모 텍스트 세트에서 구조화된 정보를 추출하는 데 강력합니다. 이 단원에서는 NER(명명된 엔터티 인식), 패턴 및 관계 추출, 주제 모델링 논리 및 타임라인 생성을 학습합니다. 그러나 우리는 또한 이러한 기술의 가장 위험한 함정, 즉 AI가 존재하지 않는 패턴을 "발견"한 것처럼 스스로를 나타내는 것에 대해서도 논의할 것입니다.
기본 기술
- NER(Named Entity Recognition): 텍스트에서 사람, 장소, 기관, 날짜 등의 개체를 자동으로 추출합니다. "이 500개 문서에 언급된 모든 장소 이름"과 같은 목록을 몇 분 안에 생성합니다.
- 관계 추론: 개체 간의 관계 표시(“Y 장소에 있는 사람 X”, “A는 B와 일치합니다”).
- 주제 모델링: 대규모 텍스트 세트에서 반복되는 주제의 클러스터를 통계적으로 찾습니다. 어느 시기에 어떤 주제가 집중되어 있는지 보여줍니다.
- 타임라인 추론: 문서에 있는 날짜가 기록된 이벤트를 시간순으로 정렬합니다.
- 네트워크 분석: 사람 간/기관 관계를 네트워크(누가 중심이고, 누가 연결점인지)로 시각화합니다.
이들 모두의 공통 목표는 단일 문서에는 나타나지 않지만 컬렉션 전반에 걸쳐 나타나는 구조를 밝히는 것입니다. 이러한 기술은 읽기만으로는 결코 볼 수 없는 패턴을 눈에 띄게 만듭니다. 그러나 그것들 각각은 "증거"가 아니라 "표시"입니다. 원본 문서의 내용을 확인하는 것이 중요합니다.
이 분야에서 자주 사용되는 개념은 근접 읽기(텍스트를 한 줄씩 깊이 읽기)와 원격 읽기(수백/수천 개의 텍스트를 집합적으로, 통계적으로 보기)를 구별하는 것입니다. AI를 사용하면 원격으로 읽을 수 있습니다. 인간의 평생 동안 지속될 수 있을 만큼 큰 말뭉치의 패턴을 볼 수 있습니다. 그러나 원거리 읽기가 패턴을 가리키는 경우에는 그것을 이해하기 위해 자세히 읽기, 즉 원본 문서로 돌아가는 것이 필요합니다. 두 가지 방법은 서로 바꿔 사용할 수 없습니다. 하나는 패턴을 보여주고, 다른 하나는 그 의미를 제공합니다. 가장 강력한 연구에서는 두 가지를 함께 사용합니다.
팁: 패턴 분석을 가설 생성기로 사용하세요. "AI가 여기서 패턴을 발견했습니다. 그게 진짜인가요?" 그런 다음 문서에서 해당 패턴을 하나씩 확인하세요. 패턴은 연구의 출발점이지 결과가 아닙니다.
작업 흐름: 단계별
1. 질문을 명확히 하세요. “이 컬렉션에는 어떤 사람들이 가장 자주 함께 등장하나요?” 다음과 같은 명확한 패턴 질문입니다.
2. 데이터를 준비하고 라벨을 붙입니다. 발견된 모든 자산을 문서에 다시 연결할 수 있도록 소스 참조로 텍스트를 구성합니다.
3. 엔터티/패턴이 나타납니다. AI를 사용하여 NER, 관계 또는 타임라인 개요를 생성합니다.
4. 정규화합니다. 같은 사람/장소의 다른 철자를 결합합니다(“Istanbul / Istanbul / Kostantiniyye”는 같은 장소입니까?). 이 단계는 매우 중요합니다. 생략하면 패턴이 무너집니다.
5. 문서로 확인하세요. 플래그가 지정된 중요한 패턴이 있는지 실제 문서를 확인하세요. AI가 조작된 링크를 추가하지 않는지 확인하세요.
6. 댓글. 패턴이 의미하는 것은 역사가의 판단이다. AI는 단지 패턴을 표시할 뿐입니다.
숫자 및 통계 트랩
패턴 분석은 종종 "이름 X가 47번 나타납니다", "이 주제는 문서의 30%에 존재합니다"와 같은 숫자를 생성합니다. 이 수치는 객관적인 것처럼 보이지만 오해의 소지가 있을 수 있습니다.
- 누락된 데이터: 컬렉션이 이미 불완전한 경우(문서가 손실되었거나 그룹이 기록된 적이 없는 경우) 숫자는 실제가 아닌 남아 있는 문서를 반영합니다.
- 정규화 오류: 동일한 사람의 철자를 다르게 표기하여 별도로 계산하면 숫자가 올바르지 않게 됩니다.
- 맥락 상실: "47번 발생"은 아무 말도 하지 않습니다. 전달 방법(긍정/부정, 주체/객체)이 중요합니다.
패턴 출력
명백한 의미
실제 위험
"X는 47번 발생합니다"
중요한 사람
불완전한 컬렉션, 철자 변형
"테마 30%"
지배적인 주제
샘플링 편향
"A-B는 자주 함께해요"
친밀한 관계
우연, 맥락 누락
"타임라인"
정확한 연대기
날짜가 기재되지 않은 문서, 조작된 주문
세 개의 미니 케이스
사례 1 - 네트워크 분석을 통해 숨겨진 중개자가 발견되었습니다. 한 연구원이 800통의 편지 모음을 조사했습니다. AI로 누가 누구에게 편지를 보낼지 정하고 네트워크를 만들었습니다. 네트워크는 언뜻보기에는 하찮아 보이는 사람이 실제로 두 그룹 사이의 주요 접촉 지점임을 보여주었습니다. 연구자는 이 사람의 편지에 주목하여 새로운 사실을 발견했다. 하지만 먼저 문서의 모든 링크를 확인했습니다.
사례 2 - 정규화 오류로 인해 번호가 손상되었습니다. 한 학생에게 문서에 장소가 나타나는 횟수를 세어보라고 했습니다. AI가 같은 장소에 대해 서로 다른 철자 세 개를 따로 세었기 때문에 그 숫자는 실제 숫자의 3분의 1인 것으로 드러났다. 철자를 합쳤을 때, place는 실제로 세 번째로 가장 자주 나오는 위치에 있었습니다. 교훈: 정규화 없이는 숫자를 신뢰할 수 없습니다.
사례 3 - 타임라인을 구성했습니다. 한 연구원이 날짜가 없는 문서로 타임라인을 만들었습니다. AI는 알려지지 않은 사건을 '논리적' 순서로 정리하고 정확한 연대기를 제시했다. 하지만 이 순서는 문서에는 없었고, AI가 만들어낸 것이었습니다. 교훈: 타임라인은 문서에 날짜가 있는 이벤트로만 구성됩니다. 나머지는 "날짜가 없는" 상태로 유지됩니다.
복사 가능한 템플릿 4개
1) NER(엔티티 추론):
아래 문서에 언급된 사람, 장소, 기관 및 날짜는 별도의 목록으로 표시됩니다. 각 개체가 어떤 문서(참조)에 언급되어 있는지 표시합니다. 본문에 명확하게 명시된 것만 취하십시오. 추측으로 추가하세요. 발음이 확실하지 않으면 [?]로 표시하세요. 서류: [여기]
2) 엔터티 정규화:
아래 항목 목록에서 동일한 사람/장소일 수 있는 다양한 철자를 그룹화하세요(예: 'Istanbul / Kostantiniyye'). 각 그룹에 대해 가능한 공통 형식을 제안하지만 정확한 조합을 강요하지는 마십시오. "아마도 같을 것입니다. 사람들이 확인하도록 하세요"라는 메모를 추가합니다. 확실하지 않은 경우에는 그대로 두십시오. 목록: [여기]
3) 관계/네트워크 개요:
다음 서신/문서 세트에서 "누가 누구와 관련되어 있는지" 링크를 추출하십시오. 각 링크에 대해 어떤 문서(참조)를 기반으로 하는지 표시하세요. 문서에 명확하지 않은 관계를 구성했습니다. 모호한 링크를 [불분명]으로 표시합니다. 문서: [여기]
4) 날짜가 지정된 타임라인:
다음 문서에 명확하게 명시된 사건만 연대순으로 나열하세요. 모든 이벤트를 소스에 연결합니다. 날짜가 불확실한 이벤트는 "날짜가 표시되지 않은" 제목 아래에 별도로 나열하고 순서대로 나열하지 마십시오. 예상 날짜를 구성하지 마십시오. 문서: [여기]
약한 프롬프트 / 강한 프롬프트
약함:
이러한 문서를 분석하고 중요한 패턴, 관계 및 타임라인을 추출합니다.
"중요한 패턴 추출"은 AI가 존재하지 않는 연결과 정확한 연대기를 발명하여 정규화 없이 숫자를 표시하도록 합니다.
강한:
다음 문서에서 각각 문서 참조에 연결하여 개인/장소/기관 개체를 추출합니다. "병합될 수 있음"과 동일할 수 있지만 병합하지는 않는 다른 철자를 표시하십시오. 문서에 명확하게 명시되지 않은 관계와 날짜가 불확실한 사건은 거짓이 아닙니다. 날짜가 없는 항목은 별도로 보관하세요. 문서: [여기]
차이점: 소스에 대한 귀속, 정규화를 인간에게 맡기고 가상의 관계/역사를 금지하고 날짜가 없는 이벤트를 분리하면 패턴을 방어할 수 있게 됩니다.
일반적인 실수
- 패턴을 증거로 착각합니다. 패턴은 가설이다. 문서에서 확인됩니다.
- 정규화를 건너뛰는 중입니다. 동일한 개체의 철자가 다르면 숫자와 네트워크가 왜곡됩니다.
- 숫자에 대한 맹목적인 신뢰. 불완전한 수집과 샘플링 편향은 숫자를 오해하게 만듭니다.
- 구성된 타임라인. 날짜가 기재되지 않은 사건은 연대순에 포함되지 않습니다.
- 맥락을 무시합니다. "몇 번이나 통과됐는지"가 아니라 "어떻게 통과됐는지"가 중요하다.
요약하면
콘텐츠 분석 및 패턴 발견은 AI가 읽기만으로는 볼 수 없는 가시적인 구조(엔티티 추출, 관계 네트워크, 주제 클러스터, 타임라인)를 만드는 강력한 분야입니다. 그러나 모든 패턴은 증거가 아니라 가설입니다. 자산을 소스에 연결하고, 사람의 검증을 통해 신중하게 정규화하고, 누락된 데이터와 편향에 대한 숫자를 쿼리하고, 인위적인 관계와 연대기를 피하세요. AI가 패턴을 표시합니다. 그것이 무엇을 의미하는지, 그것이 사실인지는 역사가의 판단이다.
응용과제
최소 15개의 문서(참고자료 포함)를 수집하세요. "NER" 템플릿을 사용하여 사람과 장소 엔터티를 추출합니다. 그런 다음 "엔티티 정규화"를 사용하여 다양한 철자를 그룹화하고 그룹을 직접 확인합니다. 마지막으로 "날짜가 지정된 타임라인" 템플릿을 실행하고 "날짜가 지정되지 않은" 상태로 남아 있는 이벤트 수를 확인하세요. AI가 프롬프트가 좋지 않은 상태에서 얼마나 많은 조작된 링크나 연대기를 생성할지 비교해 보세요.
체크리스트
- [ ] 나는 패턴 질문을 명확하게 정의했습니다.
- [ ] 각 엔터티를 문서 참조에 연결했습니다.
- [ ] 엔터티 입력을 표준화하고 이를 사람의 승인과 결합했습니다.
- [ ] 나는 데이터 누락과 편향에 대해 숫자에 의문을 제기했습니다.
- [ ] 날짜가 기재되지 않은 사건은 연대순으로 넣지 않고 따로 보관했습니다.