Đơn vị 2 / 11

Trí tuệ nhân tạo trong lập danh mục và tạo siêu dữ liệu

Lợi nhuận:

  • Khả năng rút ngắn thời gian lập danh mục bằng cách tạo ra siêu dữ liệu dự thảo theo các tiêu chuẩn như MARC và Dublin Core từ thông tin chi nhánh thực tế
  • Khả năng xác minh các trường có nguy cơ bịa đặt cao, chẳng hạn như năm xuất bản, ISBN, tên tác giả, với nguồn gốc và ánh xạ các thuật ngữ chủ đề từ từ vựng được kiểm soát
  • Khả năng tạo các định dạng tác giả và chủ đề được phê duyệt duy nhất với khả năng kiểm soát quyền hạn và duy trì tính nhất quán của danh mục

Biên mục là công việc vô hình nhưng cơ bản nhất của nghề thủ thư. Có thể phát hiện ra một tài nguyên (sách, bài viết, bản đồ, bản ghi âm, tệp kỹ thuật số) với siêu dữ liệu chính xác. Siêu dữ liệu có nghĩa là “dữ liệu về dữ liệu”: thông tin có cấu trúc mô tả tiêu đề, tác giả, năm xuất bản, chủ đề, ngôn ngữ và các thuộc tính vật lý của tài nguyên. Nếu siêu dữ liệu tốt, người dùng sẽ tìm thấy tài nguyên; Nếu nó xấu hoặc không đầy đủ, tài nguyên sẽ bị mất ngay cả khi nó tồn tại. Trong phần này, bạn sẽ học cách sử dụng trí tuệ nhân tạo trong việc tạo siêu dữ liệu dự thảo cũng như cách đảm bảo tính chính xác và tuân thủ các tiêu chuẩn.

Đầu tiên chúng ta hãy định nghĩa hai khái niệm. MARC (Danh mục có thể đọc được bằng máy) là một định dạng bản ghi mà các thư viện đã sử dụng trong nhiều thập kỷ, đặt từng phần thông tin vào các trường được đánh số; Ví dụ, trường 245 chứa tựa đề và trường 100 chứa tác giả chính. Dublin Core là một tiêu chuẩn siêu dữ liệu được đơn giản hóa cho các tài nguyên số, bao gồm 15 trường cơ bản (tiêu đề, người tạo, chủ đề, ngày tháng, thể loại, v.v.). Các tiêu chuẩn này đảm bảo rằng các hồ sơ từ các thư viện khác nhau có thể trao đổi với nhau.

Từng bước: tạo siêu dữ liệu dự thảo bằng trí tuệ nhân tạo

1. Thu thập thông tin nhận dạng của nguồn. Bìa sách, trang tiêu đề, nội dung hoặc văn bản của tệp kỹ thuật số. AI chỉ hoạt động dựa trên thông tin bạn cung cấp cho nó; Nếu bạn cung cấp thông tin không đầy đủ, thông tin đó sẽ tạo ra siêu dữ liệu không đầy đủ hoặc bịa đặt.

2. Xác định tiêu chuẩn mục tiêu. Cung cấp cho AI một mục tiêu rõ ràng, chẳng hạn như “theo các trường Dublin Core” hoặc “theo các trường MARC 245, 100, 260, 650”. Nếu bạn không chỉ định một tiêu chuẩn, nó sẽ tạo ra một định dạng tùy ý.

3. Xuất trình dự thảo. AI soạn thảo tiêu đề, tuyên bố trách nhiệm, thông tin xuất bản và đề xuất chủ đề từ thông tin bạn cung cấp.

4. Thực hiện quyền kiểm soát. Hồ sơ có thẩm quyền là hồ sơ thiết lập hình thức tiêu chuẩn, duy nhất của tên, tổ chức hoặc chủ đề của tác giả (ví dụ: "Atatürk, Mustafa Kemal, 1881-1938"). AI có thể viết tên theo nhiều cách khác nhau; Bạn kiểm tra và sửa lại định dạng thẩm quyền đã được phê duyệt.

5. Xác minh và xác nhận. So sánh từng trường với nguồn ban đầu. Đặc biệt, những thông tin chính xác như năm xuất bản, ISBN, tên tác giả rất dễ bị AI giả mạo.

Gợi ý: Cung cấp cho AI một bức ảnh hoặc văn bản về trang ghi công thực tế của nguồn; Đừng nói "đoán tên sách". Siêu dữ liệu dự đoán làm suy yếu độ tin cậy của danh mục. AI viết một cách tự tin khi đưa ra dự đoán và điều này sẽ khiến bạn hiểu lầm.

Từ vựng được kiểm soát và tính nhất quán

Tính nhất quán là tất cả mọi thứ trong việc lập danh mục. Nếu cùng một chủ đề được viết với hai thuật ngữ khác nhau trong hai bản ghi khác nhau, người dùng sẽ tìm thấy một bản ghi và bỏ sót bản ghi kia. Đó là lý do tại sao các thư viện sử dụng từ vựng được kiểm soát — một danh sách thuật ngữ tiêu chuẩn, đã được phê duyệt. Khi đề xuất các thuật ngữ từ văn bản tự do, AI có thể chọn thuật ngữ thông tục tương đương thay vì thuật ngữ chính thức trong danh sách này. Ví dụ: AI có thể viết “đau tim”; trong khi thuật ngữ được chấp thuận có thể là "nhồi máu cơ tim".

Giải pháp là cung cấp cho AI vốn từ vựng được kiểm soát và nói "chỉ cần chọn từ danh sách này". Vì vậy, thay vì tự do đưa ra các thuật ngữ, AI sẽ khớp với thuật ngữ phù hợp nhất trong danh sách được phê duyệt.

Thận trọng: Nếu thuật ngữ chủ đề do AI gợi ý không có trong từ vựng được kiểm soát thì không thêm thuật ngữ đó vào danh mục. Việc quyết định bổ sung điều khoản mới thuộc về chuyên gia chịu trách nhiệm quản lý theo thẩm quyền; Việc thêm các thuật ngữ tùy ý sẽ phá vỡ tính nhất quán của danh mục.

ba trường hợp nhỏ

Trường hợp 1 - Việc quyên góp được tăng tốc. Một thư viện công cộng đã nhận được tài trợ 1.200 cuốn sách. Chuyên gia biên mục đã nhờ AI đọc trang in của mỗi cuốn sách và tạo ra bản thảo của Dublin Core; Thời gian mỗi lần ghi giảm từ 9 phút xuống còn 3,5 phút. Chuyên gia dành thời gian còn lại cho cơ quan chức năng kiểm tra, xác minh; Tổng thời gian đã giảm khoảng 55% nhưng không có hồ sơ nào được đưa vào hệ thống mà không được xác minh.

Trường hợp 2 — ISBN giả bị bắt. Một chuyên gia đã nhờ AI tạo bản thảo gồm 30 cuốn sách. Trong quá trình kiểm tra, anh phát hiện ISBN trong 4 bản ghi là giả: AI đã viết một số gồm 13 chữ số có vẻ hợp lý, mặc dù anh không biết số thật của cuốn sổ. Bước xác minh đã ngăn bốn ISBN không chính xác tồn tại lâu dài trong danh mục.

Trường hợp 3 - Đã khắc phục sự không thống nhất về thẩm quyền. Một thư viện đã tìm thấy tác giả là "J. Smith" trong một số hồ sơ, "John Smith" ở những hồ sơ khác, "Smith, John" ở những hồ sơ khác. AI được khớp với tệp chính quyền, đưa tất cả hồ sơ vào một định dạng được phê duyệt duy nhất ("Smith, John, 1965-"); Nếu công việc này được thực hiện thủ công thì có thể mất nhiều ngày, nhưng với sự gợi ý của AI, thời gian rút ngắn xuống còn vài giờ mà mỗi trận đấu đều được chuyên gia phê duyệt.

Chuyển đổi hồi cứu và hồ sơ cũ

Nhiều thư viện có các bản ghi chưa đầy đủ hoặc lỗi thời đã được nhập cách đây nhiều năm với các quy tắc khác nhau. Việc chuyển những thứ này sang tiêu chuẩn hiện tại được gọi là chuyển đổi hồi cứu và rất tốn công sức khi thực hiện thủ công. AI có thể đọc một bản ghi cũ và tạo bản nháp để chuyển nó sang cấu trúc trường hiện tại: ví dụ: nó có thể phân tích một trích dẫn văn bản tự do và phân phối nó đến các trường chính xác. Tuy nhiên, có hai mối nguy hiểm ở đây. Đầu tiên, AI có thể bù đắp những thông tin còn thiếu để “bù đắp”; thứ hai, nó có thể gây ra lỗi trong bản ghi cũ bằng cách sao chép nó sang định dạng mới thay vì sửa nó. Do đó, trong quá trình chuyển đổi hồi cứu, đầu ra của AI cần được kiểm tra một cách có hệ thống, không phải bằng cách lấy mẫu mà bằng các trường quan trọng (tác giả, năm, số nhận dạng). Một cách thực hành tốt là hiển thị các bản ghi trước và sau chuyển đổi cạnh nhau, giúp hiển thị từng thay đổi; để chuyên gia có thể xem nhanh những gì đã được di chuyển, những gì đã thay đổi và những gì có thể đã bịa đặt.

Lưu ý: Không được chuyển siêu dữ liệu dự thảo do AI tạo ra vào hệ thống theo lô mà không xem xét từng cái một. Một lỗi hàng loạt làm hỏng hàng trăm bản ghi cùng lúc và việc truy xuất sẽ rắc rối hơn nhiều so với việc tạo ra. An toàn nhất là sản xuất và kiểm chứng theo lô nhỏ.

Bốn mẫu có thể sao chép

1) Đề cương cốt lõi Dublin:

Vai trò của bạn: trợ lý biên mục. Điền vào các trường Dublin Core từ văn bản dòng nội dung sau: Tiêu đề, Người sáng tạo, Chủ đề, Mô tả, Nhà xuất bản, Ngày, Thể loại, Định dạng, Ngôn ngữ. Chỉ sử dụng thông tin rõ ràng trong văn bản; Để trống trường còn thiếu "[không có thông tin]", đừng đoán mò. Văn bản in: [tại đây]

2) Đề cương trường MARC:

Đề xuất phác thảo cho các trường MARC sau từ thông tin sách bên dưới: 245 (tiêu đề/tín dụng), 100 (tác giả chính), 260/264 (xuất bản), 300 (mô tả vật lý), 650 (chủ đề). Đánh dấu bất kỳ trường nào bạn không chắc chắn là "[cần xác minh]". Thông tin: [tại đây]

3) Kết hợp chủ đề từ từ vựng được kiểm soát:

Dưới đây là bản tóm tắt nguồn và danh sách các thuật ngữ chủ đề đã được phê duyệt. Chỉ ghép 3-5 thuật ngữ phù hợp nhất trong danh sách với nguồn. Nếu trong danh sách không có thuật ngữ phù hợp thì ghi "không có thuật ngữ phù hợp trong danh sách", không được tạo ra thuật ngữ mới. Tóm tắt: [tại đây] / Danh sách thuật ngữ: [tại đây]

4) Kiểm soát biểu mẫu thẩm quyền:

Ghép tên tác giả bên dưới với các biểu mẫu đã được phê duyệt trong danh sách thẩm quyền mà tôi đã cung cấp. Đối với mỗi tên: định dạng trong bản ghi -> định dạng được phê duyệt. Nếu không có thông tin tương đương trong danh sách thì ghi "không có hồ sơ thẩm quyền". Tên: [tại đây] / Danh sách cơ quan có thẩm quyền: [tại đây]

Dấu nhắc yếu / Dấu nhắc mạnh

Dấu nhắc yếu:

Trích xuất thông tin danh mục cho cuốn sách sau: "Trí tuệ nhân tạo và xã hội".

Chỉ có tiêu đề được đưa ra; AI buộc phải tạo nên tác giả, năm, nhà xuất bản và ISBN. Không có tiêu chuẩn mục tiêu. Kết quả: một bản ghi có sức thuyết phục nhưng có thể là sai.

Lời nhắc mạnh mẽ:

Vai trò của bạn: trợ lý biên mục. Dưới đây là toàn văn trang in của cuốn sách. Điền vào các trường Dublin Core từ đây. Chỉ sử dụng thông tin được nêu rõ ràng trong văn bản; Để trống trường không phải văn bản và viết "[không có thông tin]". Không có ngày tháng, tên hoặc ISBN nào được tạo thành. Văn bản in: [toàn văn ở đây]

Lời nhắc mạnh mẽ giới hạn AI ở những thông tin nội tuyến thực sự và buộc nó phải để trống một cách trung thực thay vì bịa ra.

Trường siêu dữ liệu và bảng xác thực

khu vực

Rủi ro chế tạo

Cách xác minh

Tiêu đề

thấp

So sánh với trang dấu ấn

Định dạng tác giả/cơ quan có thẩm quyền

trung bình

Tìm kiếm trong tập tin thẩm quyền

Năm xuất bản

cao

Xác nhận bằng dấu ấn/colophone

ISBN

rất cao

Kiểm soát một-một với mã vạch/nguồn

Thuật ngữ chủ đề

cao

Phù hợp trong từ vựng được kiểm soát

Những lỗi thường gặp

  • Chỉ cần yêu cầu siêu dữ liệu từ tiêu đề. Thông tin không đầy đủ thúc đẩy AI sáng tạo ra mọi thứ.
  • Không xác định tiêu chuẩn mục tiêu Định dạng tùy ý làm gián đoạn sự hài hòa của hồ sơ.
  • Chấp nhận ISBN và năm mà không cần xác minh. Những khu vực này có nguy cơ bị chế tạo cao nhất.
  • Lấy thuật ngữ chủ đề từ bên ngoài từ vựng được kiểm soát. Tính nhất quán và tính sẵn có bị tổn hại.
  • Vượt qua sự kiểm soát của cơ quan có thẩm quyền. Cùng một tác giả phân tán dưới nhiều hình thức khác nhau, người dùng bỏ sót nguồn.

Tóm lại

Trong việc tạo siêu dữ liệu, AI là trợ thủ đắc lực giúp nhanh chóng trích xuất thông tin chi nhánh và rút ngắn đáng kể thời gian lập danh mục. Nhưng cái giá của năng suất là việc xác nhận nghiêm ngặt trước các rủi ro bịa đặt: làm cho tiêu chuẩn mục tiêu (MARC, Dublin Core) rõ ràng, chỉ chạy AI với kiến ​​thức từ điển thực tế, ánh xạ các thuật ngữ chủ đề từ các từ vựng được kiểm soát và xác thực các biểu mẫu thẩm quyền. Thay vì lấp đầy những khoảng trống, AI nên thành thật để trống; Bạn giữ sự chấp thuận cuối cùng.

Nhiệm vụ ứng dụng

Đưa nội dung trang dấu ấn của một cuốn sách thật mà bạn có cho AI bằng mẫu "Dublin Core Draft" và nhận bản nháp. Sau đó, tạo cùng một cuốn sách chỉ với tiêu đề ("Dấu nhắc yếu") và so sánh hai kết quả đầu ra: trường nào đã được tạo? Sau đó, với mẫu “Ánh xạ chủ đề từ từ vựng được kiểm soát”, đưa ra danh sách ngắn các thuật ngữ được phê duyệt để khớp với chủ đề và kiểm tra xem AI có nằm ngoài danh sách hay không.

danh sách kiểm tra

  • [ ] Tôi đã cung cấp thông tin nhận dạng thực sự của nguồn cho AI, tôi không để nó đoán.
  • [ ] Tôi đã chỉ định rõ ràng tiêu chuẩn siêu dữ liệu đích (MARC/Dublin Core).
  • [ ] Tôi đã xác minh năm xuất bản và nguyên văn ISBN với nguồn gốc.
  • [ ] Tôi ánh xạ các thuật ngữ chủ đề từ từ vựng được kiểm soát.
  • [ ] Tôi đã xác nhận các hình thức ủy quyền với hồ sơ đã được phê duyệt.