Lợi nhuận:
- Khả năng tạo bản nháp siêu dữ liệu theo các tiêu chuẩn như ISAD(G) hoặc Dublin Core bằng trí tuệ nhân tạo
- Khả năng ngăn chặn ảo giác và ánh xạ các thuật ngữ chủ đề vào từ vựng được kiểm soát với sự cho phép để trống
- Khả năng phân biệt các trường nào, chẳng hạn như ngày tháng, tên người và mã tham chiếu, cần có sự phê duyệt của con người và trường nào chỉ được tổ chức chỉ định
Một kho lưu trữ hoặc thư viện dù phong phú đến đâu cũng không thể tìm thấy được trừ khi nó được xác định rõ ràng. Điều khiến một tài liệu trở nên “có thể tìm thấy” là thông tin mô tả về nó: ai đã viết nó, khi nào, ở đâu, chủ đề của nó là gì, nó thuộc về bộ sưu tập nào. Thông tin này được gọi là siêu dữ liệu (siêu dữ liệu - dữ liệu mô tả về một tài liệu; “dữ liệu về dữ liệu”). Biên mục là quá trình xác định các tài liệu có siêu dữ liệu này và lưu chúng vào hệ thống có thể tìm kiếm được. Phân loại là sắp xếp tài liệu theo các tiêu chí như chủ đề, loại hình hay nguồn gốc.
Việc tạo siêu dữ liệu cực kỳ tốn thời gian; Việc nhập thông tin ngày tháng, chủ đề, người và địa điểm riêng lẻ cho hàng nghìn tài liệu trong bộ sưu tập lớn có thể mất nhiều năm. AI là một công cụ tạo dự thảo mạnh mẽ trong lĩnh vực kinh doanh này. Trong phần này, chúng ta sẽ xem cách tạo siêu dữ liệu bằng AI, lập danh mục theo tiêu chuẩn (ISAD(G), Dublin Core) cũng như sức mạnh cũng như cạm bẫy của phân loại tự động.
Tiêu chuẩn lưu trữ: tại sao chúng cần thiết
Siêu dữ liệu không được nhập ngẫu nhiên; Có các tiêu chuẩn quốc tế để hồ sơ từ các cơ quan khác nhau có thể nói chuyện với nhau:
- ISAD(G) (Mô tả lưu trữ tiêu chuẩn quốc tế chung): Quy tắc mô tả tài liệu lưu trữ theo thứ bậc (ở cấp độ quỹ, cấp độ tập tin, tập tin, tài liệu). Nó chứa các trường như mã tham chiếu, tiêu đề, ngày tháng, phạm vi, người tạo.
- Dublin Core: Một tiêu chuẩn chung bao gồm 15 trường cốt lõi để mô tả tài nguyên số (tiêu đề, người sáng tạo, chủ đề, ngày tháng, thể loại, định dạng, nguồn, ngôn ngữ, v.v.).
- Fonds: Một tập hợp các hồ sơ được hình thành một cách tự nhiên do hoạt động của một cá nhân, gia đình hoặc tổ chức. Đây là đơn vị tổ chức cơ bản của việc lưu trữ.
- Nguồn gốc (nguồn gốc): Thông tin về tài liệu đến từ ai và nó được chuyển qua tay ai. Trong lưu trữ, các tài liệu được lưu giữ cùng nhau theo nguồn gốc của chúng.
Việc chỉ định rõ ràng tiêu chuẩn mục tiêu khi có siêu dữ liệu AI tạo ra đảm bảo rằng đầu ra có thể được nhập trực tiếp vào doanh nghiệp.
Một khái niệm quan trọng khác là hồ sơ thẩm quyền—một hồ sơ xác định một dạng duy nhất, tiêu chuẩn, được phê duyệt của tên của một người, địa điểm hoặc tổ chức. Trong các tài liệu lịch sử, cùng một người hoặc một địa điểm có thể xuất hiện nhưng có cách viết khác nhau; Bản ghi thẩm quyền liên kết tất cả chúng vào một định dạng được phê duyệt duy nhất để chúng không bị phân tán trong tìm kiếm. AI gợi ý tên từ một tài liệu; nhưng việc ánh xạ tên này vào dạng tiêu chuẩn trong bản ghi chính thức là công việc của con người. Việc liên kết những gì AI nói "Ahmed" với "Ahmed Bey (1840-1912)" trong hồ sơ chính thức của tổ chức sẽ duy trì tính nhất quán của danh mục.
Quy trình làm việc: từng bước
1. Chuẩn bị nguồn. Thu thập bản ghi hoặc hình ảnh của tài liệu và bất kỳ thông tin ngữ cảnh nào.
2. Xác định tiêu chuẩn và lĩnh vực. Cho AI biết tiêu chuẩn nào (ISAD(G), Dublin Core) và theo lĩnh vực nào nó sẽ tạo đầu ra.
3. Tạo siêu dữ liệu dự thảo. AI điền vào các trường có thể trích xuất từ tài liệu (ngày, người, địa điểm, chủ đề, ngôn ngữ, thể loại); Nó để trống những vùng mà nó không thể xóa được.
4. Lập bản đồ từ vựng được kiểm soát. Tên chủ đề và địa điểm không miễn phí ở hầu hết các tổ chức mà được gắn với một danh sách được xác định trước (từ vựng/từ điển đồng nghĩa được kiểm soát). Ánh xạ các thuật ngữ chủ đề được AI gợi ý vào danh sách này.
5. Xác minh và xác nhận. Mỗi lĩnh vực, đặc biệt là ngày tháng, tên và chủ đề, đều được con người so sánh với các tài liệu, hồ sơ của cơ quan có thẩm quyền.
Mẹo: Hãy rõ ràng cấp quyền cho AI "để trống". Nếu không, nó sẽ "đoán" điền ngày tháng hoặc người tạo không có trong tài liệu và chèn siêu dữ liệu giả vào danh mục của bạn. Hướng dẫn "Để trống trường này nếu nó không có trong tài liệu" là lá chắn mạnh nhất chống lại ảo giác.
Các trường và mức độ tin cậy trong một bảng
Trường siêu dữ liệu
AI đáng tin cậy đến mức nào?
xác minh
ngôn ngữ
cao
mẫu vật
Loại tài liệu
trung bình cao
kiểm soát
Tên người/địa điểm
Trung bình (lỗi đọc)
bắt buộc
ngày
Thấp-trung bình (rủi ro bịa đặt)
bắt buộc
Điều khoản chủ đề
Trung bình (tạo miễn phí)
Bản đồ tới danh sách kiểm tra
Phạm vi/tóm tắt
trung bình cao
So sánh với nguồn
Mã tham chiếu
Không có (tổ chức đưa ra)
cú ném của con người
Tóm tắt: AI nhanh và đáng tin cậy trong các lĩnh vực như ngôn ngữ và thể loại; tạo bản nháp trong các trường như ngày tháng, tên và chủ đề, nhưng cần có sự chấp thuận của con người; AI không bao giờ tạo ra các trường mang tính thể chế như mã tham chiếu.
ba trường hợp nhỏ
Trường hợp 1 - Siêu dữ liệu nháp cho 8.000 ảnh. Một kho lưu trữ của thành phố đã lập danh mục 8.000 bức ảnh lịch sử. Các ghi chú ở mặt sau của mỗi bức ảnh được sao chép và đưa cho AI; Ngày, địa điểm và đề cương chủ đề do AI tạo ra. Nhóm con người đã xác minh từng trường và ánh xạ nó vào danh sách được kiểm soát. Ước tính thời gian làm việc 10 tháng giảm xuống còn 3 tháng; nhưng mọi ngày tháng và tên địa điểm đều được kiểm tra trực quan.
Trường hợp 2 - Lịch sử bịa đặt. Một nhà lưu trữ đã nhờ AI lập danh mục một bức thư không ghi ngày tháng. YZ nhìn vào nội dung bức thư và viết chính xác ngày "1912". Tuy nhiên, không có ngày tháng trong tài liệu; AI đã dự đoán Nếu người lưu trữ không thêm hướng dẫn "để trống nếu không có trong tài liệu", thì danh mục sẽ được điền ngày tháng bịa đặt. Bài học: sự cho phép để trống là bắt buộc.
Trường hợp 3 - Các thuật ngữ chủ đề miễn phí tạo ra sự nhầm lẫn. AI gán các thuật ngữ tự do tương tự nhưng khác nhau như “nhập cư”, “di cư”, “định cư” cho các tài liệu tương tự. Khi nó không được ánh xạ tới từ vựng được kiểm soát, chủ đề tương tự sẽ được gắn thẻ với ba thuật ngữ khác nhau và nằm rải rác trong tìm kiếm. Tính nhất quán đạt được bằng cách ánh xạ các thuật ngữ vào một danh sách thẩm quyền duy nhất. Bài học: các thuật ngữ chủ đề không được phát hành, chúng được liên kết với danh sách.
Bốn mẫu có thể sao chép
1) Đề cương cốt lõi Dublin:
Trích xuất bản nháp siêu dữ liệu Dublin Core từ bản ghi tài liệu bên dưới. Các trường: Tiêu đề, Người tạo, Chủ đề, Mô tả, Ngày, Thể loại, Ngôn ngữ, Phạm vi (vị trí/thời gian). Quy tắc: (1) Chỉ sử dụng thông tin RÕ RÀNG trong văn bản. (2) Để trống trường không có trong văn bản TRỐNG, đừng đoán. (3) Đánh dấu giá trị bạn không chắc chắn bằng [?]. Phiên âm: [tại đây]
2) Định nghĩa dự thảo ISAD(G):
Tạo bản nháp cho tài liệu sau trong các trường ISAD(G): Tiêu đề, Ngày tháng, Cấp độ mô tả (tài liệu/tệp), Phạm vi và nội dung (tóm tắt ngắn), Người tạo, Ngôn ngữ. Để lại mã tham chiếu TRỐNG (cơ quan sẽ cung cấp). Không thêm bất kỳ thông tin nào không có trong văn bản; Để trống trường không tồn tại. Tài liệu: [tại đây]
3) Gợi ý thuật ngữ chủ đề (có kiểm soát):
Đề xuất 3-5 thuật ngữ chủ đề phù hợp với tài liệu dưới đây. Đầu tiên, hãy dựa vào sự thật TRONG tài liệu. Dưới đây là danh sách thuật ngữ được kiểm soát của tổ chức chúng tôi; ĐẦU TIÊN, hãy chọn nó từ danh sách này, nếu nó không có trong danh sách, hãy đánh dấu riêng đề xuất thuật ngữ mới của bạn. Danh sách: [điều khoản]. Tài liệu: [tại đây]
4) Kiểm tra tính nhất quán hàng loạt:
Dưới đây là các bản ghi siêu dữ liệu cho các tài liệu từ cùng một bộ sưu tập. Gắn cờ không nhất quán: các bản ghi đánh vần cùng một địa điểm/người khác nhau, định dạng ngày tháng khác nhau, thuật ngữ khác nhau cho cùng một chủ đề. BIỆN PHÁP SỬA CHỮA; Chỉ cần tạo ra một danh sách những điểm không nhất quán để con người xem xét. Hồ sơ: [tại đây]
Dấu nhắc yếu / Dấu nhắc mạnh
yếu:
Tạo một bản ghi danh mục hoàn chỉnh cho tài liệu này.
Hướng dẫn “hoàn chỉnh” thúc đẩy AI lấp đầy mọi khoảng trống, tức là phát minh ra lịch sử và những người sáng tạo không tồn tại.
Mạnh mẽ:
Dublin Core được soạn thảo cho tài liệu này. Chỉ sử dụng thông tin RÕ RÀNG có trong bản ghi âm; để trống trường không tồn tại, đừng đoán. Chọn thuật ngữ chủ đề từ danh sách được kiểm soát này: [danh sách]. Đánh dấu ngày và tên người bằng [?] để tôi có thể xác minh bằng tài liệu. Phiên âm: [tại đây]
Sự khác biệt: quyền "để trống" thay vì phiên bản "hoàn chỉnh", việc tuân thủ danh sách được kiểm soát và các dấu xác minh bảo vệ danh mục khỏi bịa đặt.
Những lỗi thường gặp
- Nó có nghĩa là "điền đầy đủ". Điều này dẫn đến việc khớp các trường không tồn tại; nên cho phép "để trống".
- Phát hành các điều khoản chủ đề. Các thuật ngữ không liên quan đến từ vựng được kiểm soát sẽ làm mất tập trung việc tìm kiếm.
- Có AI dự đoán lịch sử. Việc nhập một ngày tháng hư cấu vào một tài liệu không ghi ngày tháng sẽ làm ô nhiễm danh mục.
- Có mã tham chiếu do AI tạo ra. Đây là một không gian độc đáo, dành cho công ty; người ta ném.
- Không xác định tiêu chuẩn. Nếu không đề cập đến tiêu chuẩn thì đầu ra sẽ là một bản thảo lộn xộn, không thể nhập vào cơ sở được.
Tóm lại
Siêu dữ liệu và lập danh mục là cơ sở hạ tầng vô hình mở ra kho lưu trữ cho nhà nghiên cứu và nó đòi hỏi rất nhiều nỗ lực. Từ bản phiên âm, AI tạo ra một bản phác thảo nhanh chóng cho các trường như ngày tháng, người, địa điểm, chủ đề và thể loại; Nó có thể hoạt động theo các tiêu chuẩn như ISAD(G) hoặc Dublin Core. Nhưng áp lực phải “điền đầy đủ” đã thúc đẩy AI phải sáng tạo ra mọi thứ; Quyền "để trống", ánh xạ tới từ vựng được kiểm soát và xác nhận của con người về ngày/tên giúp cho danh mục trở nên đáng tin cậy. AI chuẩn bị dự thảo; Bạn chịu trách nhiệm về tính chính xác của danh mục.
Nhiệm vụ ứng dụng
Lấy bản sao tài liệu và yêu cầu siêu dữ liệu từ AI với mẫu “Dublin Core Draft”; Kiểm tra xem nó có để lại các trường trống không tồn tại không. Sau đó chạy mẫu “gợi ý thuật ngữ chủ đề” bằng danh sách kiểm tra (hoặc mẫu) của riêng bạn. Cuối cùng, kiểm tra một số bản ghi bằng “kiểm tra tính nhất quán hàng loạt”. Lưu ý có bao nhiêu trường mà AI cố gắng điền dự đoán và bao nhiêu thuật ngữ chủ đề cần được ánh xạ vào danh sách.
danh sách kiểm tra
- [ ] Tôi đã nêu rõ tiêu chuẩn mục tiêu (ISAD(G)/Dublin Core).
- [ ] Tôi đã cấp quyền "Để trống trường trống".
- [ ] Tôi đã ánh xạ các thuật ngữ chủ đề vào danh sách được kiểm soát.
- [ ] Tôi đã xác minh ngày và tên người bằng hồ sơ tài liệu/cơ quan có thẩm quyền.
- [ ] Tôi để lại mã tham chiếu cho tổ chức chứ không phải cho AI.