Lợi nhuận:
- Khả năng trích xuất các mẫu từ các tập hợp văn bản lớn bằng cách sử dụng các kỹ thuật như NER, trích xuất mối quan hệ, dòng thời gian và phân tích mạng
- Có thể xem mô hình như một giả thuyết hơn là bằng chứng, liên kết các thực thể với nguồn và bình thường hóa chúng với sự chấp thuận của con người
- Khả năng hiểu làm thế nào các con số có thể gây hiểu nhầm do thiếu dữ liệu và sai lệch lấy mẫu, đồng thời tránh các mối quan hệ và trình tự thời gian giả tạo.
Nghiên cứu lịch sử không chỉ là đọc các tài liệu riêng lẻ; thường tìm kiếm các mẫu trong các bộ tài liệu lớn. Trong bối cảnh nào một cái tên cụ thể xuất hiện qua các năm? Những người nào có liên quan đến một khu định cư? Làm thế nào để một chủ đề thay đổi theo thời gian? Ai tương ứng với ai? Những câu hỏi như vậy đòi hỏi phải xem xét không chỉ một tài liệu mà là hàng trăm tài liệu cùng nhau. Điều này thường được gọi là nhân văn kỹ thuật số—việc áp dụng các phương pháp tính toán vào các lĩnh vực như lịch sử và văn học.
AI rất mạnh trong việc trích xuất thông tin có cấu trúc từ các bộ văn bản lớn. Trong phần này, bạn sẽ học NER (nhận dạng thực thể được đặt tên), trích xuất mẫu và mối quan hệ, logic lập mô hình chủ đề và tạo dòng thời gian; nhưng chúng ta cũng sẽ thảo luận về cạm bẫy nguy hiểm nhất của những kỹ thuật này—AI tự cho thấy mình đã “tìm thấy” một khuôn mẫu không tồn tại.
Kỹ thuật cơ bản
- NER (Nhận dạng thực thể được đặt tên): Tự động trích xuất các thực thể như người, địa điểm, tổ chức, ngày tháng từ văn bản. Nó tạo ra một danh sách như "Tất cả các tên địa điểm được đề cập trong 500 tài liệu này" trong vài phút.
- Suy luận mối quan hệ: Đánh dấu mối liên hệ giữa các thực thể (“Người X ở vị trí Y”, “A tương ứng với B”).
- Mô hình hóa chủ đề: Tìm kiếm thống kê các cụm chủ đề định kỳ trong một tập hợp văn bản lớn. Nó cho thấy chủ đề nào tập trung vào thời kỳ nào.
- Suy luận dòng thời gian: Sắp xếp các sự kiện ngày tháng trong tài liệu theo thứ tự thời gian.
- Phân tích mạng lưới: Trực quan hóa các mối quan hệ giữa con người/thể chế như một mạng lưới (ai là trung tâm, ai là điểm kết nối).
Mục tiêu chung của tất cả những điều này là tiết lộ các cấu trúc không xuất hiện trong một tài liệu duy nhất mà xuất hiện xuyên suốt bộ sưu tập. Những kỹ thuật này tạo ra những khuôn mẫu có thể nhìn thấy được mà chỉ đọc thôi sẽ không bao giờ có thể nhìn thấy được. Nhưng mỗi điều đó đều là một “dấu hiệu”, không phải là “bằng chứng”; Điều cần thiết là phải xác minh những gì được tìm thấy trong tài liệu gốc.
Một khái niệm thường được sử dụng trong lĩnh vực này là sự phân biệt giữa đọc gần (đọc sâu một văn bản, từng dòng một) và đọc xa (nhìn tổng thể hàng trăm/nghìn văn bản, theo thống kê). AI giúp bạn có thể đọc từ xa: bạn nhìn thấy các mẫu trong một kho văn bản đủ lớn để tồn tại trong suốt cuộc đời của một con người. Nhưng khi việc đọc từ xa trỏ đến một khuôn mẫu, cần phải quay lại đọc gần, tức là quay lại tài liệu gốc để hiểu nó. Hai phương pháp này không thể thay thế cho nhau; Một cái cho thấy mô hình, cái kia cho biết ý nghĩa của nó. Nghiên cứu mạnh mẽ nhất sử dụng cả hai cùng nhau.
Mẹo: Sử dụng phân tích mẫu làm công cụ tạo giả thuyết: “AI đã phát hiện ra một mẫu ở đây, nó có thật không?” Sau đó kiểm tra từng mẫu đó trong tài liệu. Mô hình là điểm khởi đầu của nghiên cứu của bạn, không phải là kết quả.
Quy trình làm việc: từng bước
1. Làm rõ câu hỏi. “Những người nào xuất hiện cùng nhau thường xuyên nhất trong bộ sưu tập này?” Một câu hỏi mẫu rõ ràng như thế nào.
2. Chuẩn bị và dán nhãn dữ liệu. Sắp xếp văn bản với các tài liệu tham khảo nguồn để mọi nội dung được tìm thấy đều có thể được liên kết trở lại tài liệu.
3. Thực thể/mẫu xuất hiện. Tạo phác thảo NER, mối quan hệ hoặc dòng thời gian bằng AI.
4. Bình thường hóa. Kết hợp các cách viết khác nhau của cùng một người/địa điểm (“Istanbul / Istanbul / Kostaniniyye” cùng một địa điểm?). Bước này rất quan trọng; Nếu bỏ qua, mẫu sẽ bị hỏng.
5. Xác minh bằng văn bản. Kiểm tra các tài liệu thực tế để tìm bất kỳ mẫu quan trọng nào được gắn cờ. Đảm bảo AI không thêm liên kết giả tạo.
6. Bình luận. Ý nghĩa của mô hình này là sự phán đoán của nhà sử học; AI chỉ đánh dấu mẫu.
Bẫy số và thống kê
Phân tích mẫu thường đưa ra những con số: “tên X xuất hiện 47 lần”, “chủ đề này hiện diện trong 30% tài liệu”. Những con số này có vẻ khách quan nhưng có thể gây hiểu nhầm:
- Thiếu dữ liệu: Nếu việc thu thập chưa đầy đủ (tài liệu đã bị mất, một nhóm chưa bao giờ được ghi lại), con số phản ánh các tài liệu còn sót lại chứ không phải thực tế.
- Lỗi chuẩn hóa: Nếu cùng một người được đánh vần khác nhau và được tính riêng thì số sẽ không chính xác.
- Mất ngữ cảnh: "xảy ra 47 lần" không nói lên điều gì; Nó được truyền như thế nào (tích cực/tiêu cực, chủ thể/đối tượng) là quan trọng.
đầu ra mẫu
ý nghĩa rõ ràng
rủi ro thực sự
"X xảy ra 47 lần"
người quan trọng
Bộ sưu tập chưa đầy đủ, lỗi chính tả
"Chủ đề 30%"
chủ đề chi phối
sai lệch lấy mẫu
"A-B thường xuyên ở bên nhau"
mối quan hệ thân mật
Sự trùng hợp ngẫu nhiên, thiếu bối cảnh
"dòng thời gian"
niên đại chính xác
Tài liệu không ghi ngày tháng, đơn đặt hàng bịa đặt
ba trường hợp nhỏ
Trường hợp 1 - Phân tích mạng cho thấy một trung gian ẩn. Một nhà nghiên cứu đã kiểm tra một bộ sưu tập thư từ gồm 800 lá thư. Với AI, ai viết thư cho ai đã được xác định và một mạng lưới đã được tạo ra. Mạng cho thấy một người thoạt nhìn có vẻ tầm thường thực ra lại là đầu mối liên lạc chính giữa hai nhóm. Nhà nghiên cứu tập trung vào những lá thư của người này và đạt được một phát hiện mới. Nhưng trước tiên hãy xác minh tất cả các liên kết trong tài liệu.
Trường hợp 2 - Lỗi chuẩn hóa làm hỏng số. Một sinh viên yêu cầu họ đếm số lần một địa điểm xuất hiện trong tài liệu. Vì AI đã đếm riêng ba cách viết khác nhau của cùng một địa điểm nên con số này hóa ra chỉ bằng 1/3 số thực. Khi các cách viết được kết hợp lại, vị trí thực sự nằm ở vị trí xuất hiện thường xuyên thứ ba. Bài học: không chuẩn hóa thì con số không thể tin cậy được.
Trường hợp 3 - Dòng thời gian được tạo ra. Một nhà nghiên cứu đã tạo ra dòng thời gian từ các tài liệu không ghi ngày tháng. AI sắp xếp các sự kiện chưa biết theo thứ tự “hợp lý” và trình bày trình tự thời gian chính xác. Tuy nhiên, trình tự này không có trong tài liệu, AI đã bịa ra. Bài học: dòng thời gian chỉ được xây dựng từ các sự kiện có ngày tháng trong tài liệu; phần còn lại vẫn "không ghi ngày tháng".
Bốn mẫu có thể sao chép
1) NER (suy luận thực thể):
Những người, địa điểm, tổ chức và ngày tháng được đề cập trong các tài liệu dưới đây xuất hiện dưới dạng danh sách RIÊNG. Cho biết tài liệu (tham chiếu) nào mỗi thực thể được đề cập. Chỉ lấy những gì được nêu RÕ RÀNG trong văn bản; thêm bằng cách đoán. Đánh dấu [?] nếu bạn không chắc về cách phát âm. Tài liệu: [tại đây]
2) Chuẩn hóa thực thể:
Trong danh sách thực thể bên dưới, nhóm các cách viết khác nhau có thể là cùng một người/địa điểm (ví dụ: "Istanbul / Kostantiniyye"). Đề xuất định dạng chung có thể có cho mỗi nhóm NHƯNG không áp đặt sự kết hợp chính xác; Thêm ghi chú "có thể giống nhau, để mọi người xác minh". Hãy để nó một mình nếu bạn không chắc chắn. Danh sách: [tại đây]
3) Sơ lược về mối quan hệ/mạng lưới:
Trích xuất các liên kết "ai có liên quan đến ai" từ bộ thư từ/tài liệu sau đây. Đối với mỗi liên kết, hãy chỉ ra tài liệu (tài liệu tham khảo) mà nó dựa trên. TẠO RA một mối quan hệ không RÕ RÀNG trong tài liệu. Đánh dấu các liên kết mơ hồ [không rõ ràng]. Tài liệu: [tại đây]
4) Dòng thời gian:
Chỉ liệt kê theo thứ tự thời gian những sự kiện được nêu RÕ RÀNG trong các tài liệu sau; Liên kết mọi sự kiện với nguồn của nó. Liệt kê riêng các sự kiện có ngày không chắc chắn dưới tiêu đề "không ghi ngày tháng", KHÔNG sắp xếp chúng theo thứ tự. KHÔNG lấp đầy ngày dự kiến. Tài liệu: [tại đây]
Dấu nhắc yếu / Dấu nhắc mạnh
yếu:
Phân tích các tài liệu này và trích xuất các mẫu, mối quan hệ và mốc thời gian quan trọng.
“Trích xuất các mẫu quan trọng” thúc đẩy AI phát minh ra các kết nối không tồn tại và trình tự thời gian chính xác, trình bày các con số mà không cần chuẩn hóa.
Mạnh:
Trích xuất các thực thể cá nhân/địa điểm/tổ chức từ các tài liệu sau bằng cách kết nối từng thực thể với tham chiếu tài liệu. Đánh dấu các cách viết khác nhau có thể giống nhau là "có thể được hợp nhất", nhưng không hợp nhất. Các mối quan hệ không được nêu rõ ràng trong tài liệu và các sự kiện có ngày tháng không chắc chắn KHÔNG GIẢ MẠO; giữ những thứ không có ngày tháng riêng biệt. Tài liệu: [tại đây]
Sự khác biệt: ghi nguồn, để lại sự bình thường hóa cho con người, cấm các mối quan hệ/lịch sử hư cấu và tách biệt các sự kiện không ghi ngày tháng làm cho mô hình này có thể được bảo vệ.
Những lỗi thường gặp
- Nhầm lẫn mô hình với bằng chứng. Mô hình là giả thuyết; được xác nhận trong tài liệu.
- Bỏ qua việc chuẩn hóa. Các cách viết khác nhau của cùng một thực thể làm sai lệch số lượng và mạng lưới.
- Niềm tin mù quáng vào những con số. Việc thu thập và lấy mẫu sai lệch không đầy đủ làm cho con số bị sai lệch.
- Dòng thời gian được tạo nên. Các sự kiện không ghi ngày tháng không được đưa vào niên đại.
- Bỏ qua bối cảnh. Điều quan trọng không phải là "nó đã được thông qua bao nhiêu lần", mà là "nó đã được thông qua như thế nào".
Tóm lại
Phân tích nội dung và khám phá mẫu là một lĩnh vực mạnh mẽ trong đó AI tạo ra các cấu trúc hiển thị mà chỉ đọc không thể nhìn thấy: trích xuất thực thể, mạng lưới mối quan hệ, cụm chủ đề, dòng thời gian. Nhưng mọi khuôn mẫu đều là giả thuyết, không phải bằng chứng. Liên kết nội dung với nguồn, chuẩn hóa cẩn thận và có sự xác thực của con người, số lượng truy vấn để tìm dữ liệu bị thiếu và sai lệch, tránh các mối quan hệ và trình tự thời gian giả tạo. AI đánh dấu mẫu; Ý nghĩa của nó là gì và có đúng hay không là nhận định của sử gia.
Nhiệm vụ ứng dụng
Thu thập ít nhất 15 tài liệu (có tài liệu tham khảo). Trích xuất các thực thể người và địa điểm bằng mẫu "NER". Sau đó nhóm các cách viết khác nhau bằng "chuẩn hóa thực thể" và tự mình xác minh các nhóm. Cuối cùng, chạy mẫu “dòng thời gian có ghi ngày tháng” và xem có bao nhiêu sự kiện vẫn “không ghi ngày tháng”. So sánh số lượng liên kết hoặc trình tự thời gian được sắp xếp mà AI sẽ tạo ra với khả năng nhắc nhở kém.
danh sách kiểm tra
- [ ] Tôi đã xác định rõ ràng câu hỏi mẫu của mình.
- [ ] Tôi có từng thực thể được liên kết với tài liệu tham khảo.
- [ ] Tôi đã chuẩn hóa việc nhập thực thể và kết hợp nó với sự chấp thuận của con người.
- [ ] Tôi đã đặt câu hỏi về những con số thiếu dữ liệu và sai lệch.
- [ ] Tôi không xếp các sự kiện không ghi ngày tháng vào niên đại mà giữ chúng riêng biệt.