이득:
- 실제 임프린트 정보로부터 MARC, Dublin Core 등의 표준에 따른 초안 메타데이터를 생성하여 목록 작성 시간을 단축하는 기능
- 출판연도, ISBN, 저자명 등 위조 위험이 높은 분야를 원본 출처로 검증하고, 통제된 어휘에서 주제어를 매핑하는 능력
- 권한 제어를 통해 저자 및 주제 형식을 단일 승인하고 카탈로그 일관성을 유지하는 기능
목록화는 눈에 보이지 않지만 사서의 가장 기본적인 업무이다. 올바른 메타데이터를 사용하면 리소스(도서, 기사, 지도, 녹음, 디지털 파일)를 검색할 수 있습니다. 메타데이터는 "데이터에 관한 데이터"를 의미합니다. 즉, 리소스의 제목, 저자, 출판 연도, 주제, 언어 및 물리적 속성을 설명하는 구조화된 정보입니다. 메타데이터가 양호하면 사용자는 리소스를 찾습니다. 불량하거나 불완전한 경우 리소스가 존재하더라도 손실됩니다. 이 단원에서는 초안 메타데이터 생성에 인공 지능을 사용하는 방법과 표준 준수 및 정확성을 보장하는 방법을 배웁니다.
먼저 두 가지 개념을 정의해 보겠습니다. MARC(Machine-Readable Cataloging)는 도서관이 수십 년 동안 각 정보를 번호가 매겨진 필드에 배치하는 데 사용해 온 기록 형식입니다. 예를 들어, 필드 245에는 제목이 있고 필드 100에는 주 저자가 있습니다. 더블린코어(Dublin Core)는 디지털 자원에 대한 단순화된 메타데이터 표준으로, 15가지 기본 필드(제목, 작성자, 주제, 날짜, 장르 등)로 구성됩니다. 이러한 표준은 서로 다른 도서관의 레코드가 서로 통신할 수 있도록 보장합니다.
단계별: 인공 지능을 사용하여 초안 메타데이터 생성
1. 출처의 신원정보를 수집합니다. 책 표지, 제목 페이지, 내용 또는 디지털 파일의 텍스트입니다. AI는 사용자가 제공한 정보를 통해서만 작동합니다. 불완전한 정보를 제공하면 불완전하거나 조작된 메타데이터가 생성됩니다.
2. 대상 표준을 지정합니다. AI에 "Dublin Core 필드별" 또는 "MARC 245, 100, 260, 650 필드별"과 같은 명확한 목표를 제공합니다. 표준을 지정하지 않으면 임의의 형식이 생성됩니다.
3. 초안을 작성합니다. AI는 귀하가 제공한 정보를 바탕으로 제목, 책임 설명, 출판 정보, 주제 제안 초안을 작성합니다.
4. 권한 통제를 행사합니다. 권위 있는 기록은 저자 이름, 기관 또는 주제의 단일 표준 형식을 설정하는 기록입니다(예: "Atatürk, Mustafa Kemal, 1881-1938"). AI는 다양한 방식으로 이름을 쓸 수 있습니다. 승인된 권한 형식을 확인하고 수정합니다.
5. 확인하고 확인합니다. 각 필드를 원본 소스와 비교합니다. 특히 출판 연도, ISBN, 저자명 등 정확한 정보는 AI에 의해 위조될 가능성이 매우 높습니다.
힌트: AI에 출처의 실제 신용 페이지 사진이나 텍스트를 제공하세요. "책 이름을 맞춰보세요"라고 말하지 마세요. 예측 메타데이터는 카탈로그의 신뢰성을 약화시킵니다. AI는 예측을 할 때 자신있게 글을 쓰는데, 이는 당신을 오도할 것입니다.
통제된 어휘력과 일관성
일관성은 카탈로그 작성의 모든 것입니다. 동일한 주제가 두 개의 다른 기록에 두 개의 다른 용어로 쓰여지면 사용자는 하나를 찾고 다른 하나를 놓칠 것입니다. 이것이 바로 도서관이 승인된 표준 용어 목록인 통제된 어휘를 사용하는 이유입니다. 자유 텍스트에서 용어를 제안할 때 AI는 이 목록의 공식 용어 대신 해당 구어체를 선택할 수 있습니다. 예를 들어, AI는 "심장마비"라고 쓸 수 있습니다. 승인된 용어는 "심근경색"일 수 있습니다.
해결책은 AI에게 제어된 어휘를 제공하고 "이 목록에서 선택하세요"라고 말하는 것입니다. 그래서 AI가 자유롭게 용어를 만들어내는 것이 아니라, 승인된 목록 중 가장 적절한 용어를 AI가 매칭해 줍니다.
주의: AI가 제안한 주제어가 통제어휘에 없으면 해당 용어를 카탈로그에 추가하지 마세요. 새로운 용어를 추가하는 결정은 전거 관리를 담당하는 전문가의 몫입니다. 임의의 용어를 추가하면 카탈로그의 일관성이 손상됩니다.
세 개의 미니 케이스
사례 1 — 기부금 수집이 가속화되었습니다. 한 공공 도서관에 1,200권의 도서가 기증되었습니다. 목록 전문가는 AI가 각 책의 인쇄물 페이지를 읽고 더블린 코어의 초안을 생성하도록 했습니다. 1회 녹화 시간이 9분에서 3.5분으로 단축되었습니다. 전문가는 남은 시간을 권한 확인 및 검증에 할애했습니다. 총 시간은 약 55% 단축되었지만 확인되지 않고 시스템에 입력된 기록은 없습니다.
사례 2 - 가짜 ISBN이 적발되었습니다. 한 전문가가 AI에게 30권의 책 초안을 작성하게 했습니다. 확인 과정에서 그는 4개 기록의 ISBN이 가짜라는 사실을 발견했다. AI는 책의 실제 번호를 몰랐음에도 합리적으로 보이는 13자리 숫자를 썼다. 확인 단계에서는 4개의 잘못된 ISBN이 카탈로그에 지속되는 것을 방지했습니다.
사례 3 — 권한 불일치가 수정되었습니다. 도서관에서는 일부 기록에서는 "J. Smith", 다른 기록에서는 "John Smith", 다른 기록에서는 "Smith, John"이라는 저자를 발견했습니다. AI는 전거 파일과 일치하여 모든 기록을 승인된 단일 형식("Smith, John, 1965-")으로 가져왔습니다. 이 작업을 수동으로 했다면 며칠이 걸렸을 텐데 AI의 제안으로 몇 시간으로 단축됐지만 매 경기마다 전문가의 승인을 받았다.
회고적 전환 및 이전 기록
많은 도서관에는 수년 전에 다른 규칙으로 입력된 불완전하거나 오래된 기록이 있습니다. 이를 현재 표준으로 옮기는 것을 소급 변환이라고 하며 수동으로 수행할 경우 매우 힘든 작업입니다. AI는 이전 기록을 읽고 초안을 생성하여 현재 필드 구조로 이동할 수 있습니다. 예를 들어 자유 텍스트 인용을 구문 분석하여 올바른 필드에 배포할 수 있습니다. 그러나 여기에는 두 가지 위험이 있습니다. 첫째, AI는 누락된 정보를 '보충'할 수 있습니다. 둘째, 기존 기록을 수정하기보다는 새로운 형식으로 복사하여 기존 기록의 오류를 영속시킬 수 있습니다. 따라서 회고적 변환에서는 AI의 출력을 샘플링이 아닌 중요 필드(저자, 연도, 식별 번호)별로 체계적으로 확인해야 합니다. 전환 전 기록과 전환 후 기록을 나란히 표시하여 각 변경 사항을 눈에 띄게 하는 것이 좋습니다. 그래서 전문가는 무엇이 옮겨졌는지, 무엇이 바뀌었는지, 무엇이 조작되었는지 한 눈에 알 수 있습니다.
주의: AI가 생성한 초안 메타데이터는 하나씩 검토하지 않고 일괄적으로 시스템에 전송해서는 안 됩니다. 대량 오류는 한 번에 수백 개의 기록을 손상시키며, 생성하는 것보다 검색하는 것이 훨씬 더 번거롭습니다. 소량으로 생산하고 검증하는 것이 가장 안전합니다.
복사 가능한 템플릿 4개
1) 더블린코어 개요:
귀하의 역할: 보조 목록 작성자. 제목, 작성자, 제목, 설명, 출판사, 날짜, 장르, 형식, 언어 등의 바이라인 텍스트로 Dublin Core 필드를 작성합니다. 본문에 명확한 정보만 사용하십시오. 누락된 필드 "[정보 없음]"을 남겨두고 추측하지 마세요. 인쇄물 텍스트: [여기]
2) MARC 분야 개요:
아래 도서 정보에서 다음 MARC 필드에 대한 개요를 제안합니다: 245(제목/크레딧), 100(주 저자), 260/264(출판), 300(물리적 설명), 650(주제). 확실하지 않은 필드를 "[확인 필요]"로 표시하세요. 정보: [여기]
3) 통제된 어휘를 이용한 주제 매칭:
다음은 출처 요약과 승인된 주제 용어 목록입니다. 목록에서 가장 적합한 용어 3~5개만 소스와 연결하세요. 목록에 적합한 용어가 없으면 "목록에 적합한 용어 없음"이라고 기재하고 새로운 용어를 만들지 마십시오. 요약: [여기] / 용어 목록: [여기]
4) 권한 양식 제어:
아래의 저자 이름을 내가 제공한 권한 목록의 승인된 양식과 연결하세요. 각 이름에 대해: 기록 형식 -> 승인 형식. 목록에 이에 상응하는 항목이 없으면 "전거 기록 없음"이라고 기재합니다. 이름: [여기] / 권한 목록: [여기]
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
다음 책 "인공 지능과 사회"에 대한 목록 정보를 추출하십시오.
제목만 제공됩니다. AI가 강제로 저자, 연도, 출판사, ISBN을 구성하게 됩니다. 목표 기준이 없습니다. 결과: 설득력이 있지만 아마도 거짓 기록일 가능성이 높습니다.
강력한 프롬프트:
귀하의 역할: 보조 목록 작성자. 아래는 책의 출판물 페이지 전문입니다. 여기에서 Dublin Core 필드를 채우세요. 본문에 명확하게 명시된 정보만 사용하십시오. 텍스트가 아닌 필드는 비워두고 "[정보 없음]"이라고 작성합니다. 날짜, 이름 또는 ISBN이 구성되지 않습니다. 각인 텍스트: [전체 텍스트는 여기]
강력한 프롬프트는 AI를 실제 작성자 정보로 제한하고 공백을 구성하는 대신 정직하게 남겨 두도록 합니다.
메타데이터 필드 및 검증 테이블
지역
제작 위험
확인 방법
제목
낮음
임프린트 페이지와 비교
저자/권한 형식
중간
전거파일에서 검색
출판 연도
높다
각인/콜로폰으로 확인
ISBN
매우 높다
바코드/소스를 통한 일대일 제어
주제 용어
높다
통제된 어휘로 일치
일반적인 실수
- 제목에서 메타데이터를 요청하면 됩니다. 불완전한 정보는 AI가 상황을 만들어 내도록 유도합니다.
- 대상 표준을 지정하지 않았습니다. 임의의 형식은 레코드의 조화를 방해합니다.
- 확인하지 않고 ISBN 및 연도를 수락합니다. 이러한 영역은 제조 위험이 가장 높습니다.
- 통제된 어휘 외부에서 주제 용어를 사용합니다. 일관성과 가용성이 저하됩니다.
- 권한 통제 우회. 동일한 저자가 다른 형식으로 분산되어 사용자가 소스를 놓칩니다.
요약하면
메타데이터 생성에서 AI는 인쇄물 정보를 신속하게 추출하고 목록 작성 시간을 대폭 단축하는 강력한 도우미입니다. 그러나 생산성의 대가는 조작 위험에 대한 엄격한 검증입니다. 목표 표준(MARC, Dublin Core)을 명확하게 만들고, 실제 속어 지식으로만 AI를 실행하고, 통제된 어휘에서 주제 용어를 매핑하고, 전거 양식을 검증합니다. AI는 공백을 메우는 대신 정직하게 공백으로 남겨 두어야 합니다. 최종 승인을 유지합니다.
응용과제
가지고 있는 실제 책의 각인 페이지의 텍스트를 "Dublin Core 초안" 템플릿으로 AI에 전달하고 초안을 받으세요. 그런 다음 제목("약한 프롬프트")만 사용하여 동일한 책을 제작하고 두 출력을 비교합니다. 어떤 필드가 조작되었습니까? 그런 다음 "통제 어휘의 주제 매핑" 템플릿을 사용하여 승인된 용어의 짧은 목록을 제공하여 주제를 일치시키고 AI가 목록에서 벗어나는지 확인합니다.
체크리스트
- [ ] 출처의 실제 신원정보를 AI에게 주었고, 추측에 맡기지 않았습니다.
- [ ] 대상 메타데이터 표준(MARC/Dublin Core)을 명확하게 지정했습니다.
- [ ] 출판 연도와 ISBN을 원본 출처와 함께 그대로 확인했습니다.
- [ ] 통제된 어휘에서 주제 용어를 매핑했습니다.
- [ ] 본인은 승인기록으로 권한의 형태를 확인하였습니다.