이득:
- 실제 콘텐츠에서 주제 추출을 추출하고, 승인된 주제 목록에서 1차 주제와 2차 주제를 매핑하는 기능
- Dewey와 같은 분류 제안의 주요 클래스를 수용하고 공식 테이블을 통해 하위 수준을 확인할 수 있습니다.
- 분류의 판단적, 표현적 성격을 이해하고 오래되고 배타적인 용어에 대한 제안을 확인하는 능력.
자원이 무엇에 관한 것인지 결정하는 것은 사서직의 가장 판단적인 임무 중 하나입니다. 이를 주제 분석이라고 합니다. 문서의 내용을 읽고 이를 올바른 주제 제목 및 올바른 분류 번호와 일치시키는 것입니다. 사용자가 책장에서 관련 도서를 나란히 놓고 찾을 수 있거나, 카탈로그에서 특정 주제를 검색했을 때 정확한 결과를 얻을 수 있다면, 그 이면에는 좋은 주제 분석이 있다는 것입니다. 이번 단원에서는 주제 추천, 분류, 자동 색인 생성에 인공지능을 활용하는 방법을 배우게 됩니다. 하지만 왜 인간이 최종 주제 결정을 내려야 하는지 알게 될 것입니다.
몇 가지 개념을 정의해 보겠습니다. 분류 시스템은 주제에 따라 소스에 번호를 매기는 시스템입니다. 가장 일반적인 것은 Dewey Decimal Classification(DDC)과 Library of Congress Classification(LCC)입니다. 예를 들어 Dewey에서 500은 자연 과학을 나타내고 900은 역사와 지리를 나타냅니다. 색인화는 문서를 찾을 수 있도록 문서에 핵심 용어를 할당하는 작업입니다. 자동 인덱싱은 소프트웨어가 이 작업을 제안하는 경우입니다. AI는 세 가지 작업 모두에서 제안을 제시하지만 각 작업에 대한 최종 결정권은 전문가에게 있습니다.
단계별: 인공지능을 활용한 주제 분석
1. 문서의 요지를 AI에게 전달합니다. 전문, 초록, 목차 또는 소개. 주제 분석은 맥락을 기반으로 합니다. AI에게 제목만 붙이면 피상적이고 오해의 소지가 있는 추천을 받게 됩니다.
2. AI에게 콘텐츠 요약을 요청합니다. 첫째, “이 문서는 주로 무엇에 관한 문서입니까?” 묻다. 이를 통해 빠른 이해에 도움이 되며, AI가 주제를 올바르게 파악했는지도 보여줍니다.
3. 통제된 주제와 일치시킵니다. AI에게 승인된 주제 목록을 제공하고 “이 목록에서 가장 적절한 주제만 제안하세요”라고 말합니다. 자유로운 용어 생산을 허용하지 마십시오.
4. 분류번호를 제안합니다. AI에게 "듀이에서 이 문서는 어떤 메인 클래스에 속하나요?"라고 물어볼 수 있습니다. 단, 공식 분류표를 통해 정확한 숫자를 확인하시기 바랍니다. AI는 합리적이지만 부정확한 숫자를 생성할 수 있습니다.
5. 결정을 내리고 이를 정당화하십시오. AI의 제안을 검토하고 기관의 정책과 사용자 기반을 고려하여 선택하고 필요한 경우 거부합니다. 최종 주제 결정 및 분류에는 귀하의 서명이 포함됩니다.
팁: 문서에 여러 주제가 주어질 수 있습니다. AI로부터 “이 문서의 주요 주제는 무엇이며, 보조 주제는 무엇입니까?” 별도로 문의하세요. 기본 주제를 올바르게 선택하면 리소스가 선반의 올바른 위치에 배치됩니다. 두 번째 주제는 카탈로그에 추가 접근 지점을 제공합니다.
분류의 사법적 성격
분류는 중립적으로 보이지만 그렇지 않습니다. 문서를 '여성학' 또는 '사회학' 항목에 넣을지, 심지어 역사적 사건을 어느 지역으로 분류할지 여부는 관점을 고려한 결정입니다. 분류 시스템은 특정 시대와 문화를 가정합니다. 일부 용어는 시간이 지남에 따라 더 이상 사용되지 않거나 배타적이 됩니다. AI는 훈련된 데이터에서 이러한 편견을 그대로 상속하고 심지어 강화할 수도 있습니다.
따라서 주제 분석은 AI에게 맡길 수 없는 판단의 문제이다. AI는 어떤 제목이 "가능성이 높은"지를 나타냅니다. 그러나 어떤 제목이 출처를 가장 정확하고 공정하게 나타내는지에 대한 결정은 기관과 사용자 기반의 가치를 아는 전문가의 몫입니다.
주의: AI가 제안하는 주제가 출처를 왜곡하거나 배제하지 않도록 하세요. 특히 정체성, 민족, 종교, 성별과 같은 민감한 주제에 대해 AI가 생성한 용어를 기관의 현재 포괄적인 어휘와 비교하세요.
세 개의 미니 케이스
사례 1 - 대규모 주제 제안. 도서관은 800개 기사의 디지털 컬렉션에 주제를 할당합니다. 전문가는 각 기사의 요약을 AI에 전달하고 승인된 제목 목록에서 일치하는 항목을 요청했습니다. AI 추천은 기사당 적격 제목 3개 중 평균 2개를 정확하게 포착했습니다. 전문가는 세 번째를 추가하고 잘못된 제안을 제거했습니다. 작업은 완전히 손으로 완료했을 때보다 약 40% 더 빨리 완료되었습니다.
사례 2 — 잘못된 분류 번호. 한 전문가가 병력서 작성을 위해 AI에게 듀이 번호를 요청했습니다. YZ는 "610(의학)"을 제안했습니다. 그런데 그 책은 주로 의학사를 다룬 책이어서 정확한 위치는 '610.9(의학사)'였다. 전문가는 공식 Dewey 테이블을 보고 이를 수정했습니다. AI가 메인 클래스를 찾았지만 서브 브레이크를 놓쳤습니다.
사례 3 — 쓸모없는 용어가 발견되었습니다. AI는 시대에 뒤떨어지고 현재는 사회학 서적에서 제외되는 주제 용어로 간주되는 것을 제안했습니다. 왜냐하면 이 오래된 용어는 훈련 데이터에서 일반적이었기 때문입니다. 전문가는 기관의 현재 포괄적인 어휘에서 올바른 용어를 선택했습니다. 이는 AI가 과거의 편견을 담고 있다는 구체적인 사례였다.
깊이와 일관성: 얼마나 구체적이어야 합니까?
주제 분석에서 일반적인 결정은 할당할 용어의 구체성 수준입니다. 리소스에 너무 일반적인 제목("날짜")을 지정하면 해당 주제를 검색하는 사용자는 수백 개의 관련 없는 결과에 빠져들게 됩니다. 너무 좁은 제목을 지정하면 더 넓은 출처를 찾는 사용자가 해당 제목을 찾을 수 없습니다. 규칙은 소스를 가장 구체적이면서도 완전히 포함하는 용어를 선택하는 것입니다. 소스가 셀주크 시대 건축만을 다루는 경우 "건축"이 아닌 "셀주크 건축"이 올바른 수준입니다. AI는 종종 이 균형을 놓치곤 합니다. 너무 일반적이거나 너무 분산된 제안을 생성합니다. 따라서 “소스가 다루는 가장 구체적인 주제를 제안하고, 소스가 실제로 다루지 않는 하위 주제는 추가하지 않는다” 등 AI에게 명확한 지시를 내릴 필요가 있다. 또한, 시간이 지남에 따라 동일한 주제에 대한 리소스의 일관된 라벨링은 카탈로그의 무결성에 있어 구체성만큼 중요합니다. 어느 날은 "셀죽 건축"이라고 말하고 다음 날은 "셀죽 시대 건물"이라고 하면 유저가 나뉘게 됩니다.
팁: 리소스에 여러 제목을 지정할 때 서로의 하위 집합인 용어를 불필요하게 쌓지 마십시오. "오스만 역사"와 "역사"를 모두 제공하면 후자가 불필요해집니다. 가장 구체적인 것을 선택하고 실제로 다른 도달범위를 추가하는 제목만 포함하세요.
복사 가능한 템플릿 4개
1) 주제 추출:
아래 문서의 주요 주제를 한 문장으로 작성하고, 보조 주제를 3개 항목으로 작성합니다. 본문에만 근거하여 본문에 없는 주제를 추가하는 것입니다. 문서/요약: [여기]
2) 승인된 헤더와 일치:
다음은 문서 요약 및 승인된 주제 제목 목록입니다. 가장 적절한 것부터 시작하여 문서에 가장 적합한 목록에서 3~5개의 제목만 일치시키세요. 각 선택에 대해 한 문장으로 이유를 적어보세요. 목록에 적합한 제목이 없으면 이를 지정합니다. 요약: [여기] / 목록: [여기]
3) 분류 마스터 클래스 제안:
다음 문서의 경우 듀이 십진분류에서 가능한 주요 클래스(3자리)를 제안하고 이를 선택한 이유를 설명하십시오. 낮은 숫자는 "공식 테이블에서 확인해야 함"으로 표시하고 정확한 숫자를 제공하지 마십시오. 문서: [여기]
4) 편견과 통화 확인:
아래 주제 제안 중에 시대에 뒤떨어지거나 배타적이거나 일방적일 수 있는 용어가 있습니까? 그렇다면 표시하고 문제가 될 수 있는 이유를 설명하십시오. 제안: [여기]
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
이 책의 주제는 "오스만 제국의 상업"입니다.
AI는 제목만 보고 맥락을 모르고 일반적인 용어를 만들어내고, 통제된 어휘는 무시합니다. 결과: 제목이 일관되지 않거나 부정확할 수 있습니다.
강력한 프롬프트:
귀하의 역할: 보조 주제 분석가. 아래는 책의 소개와 내용입니다. 또한 승인된 주제 목록도 제공했습니다. (1) 책의 주요 주제를 한 문장으로 요약합니다. (2) 목록에서 가장 적절한 제목 3~5개만 근거와 연결하세요. (3) 목록에서 벗어나지 말고 조건을 만들어내지 마십시오. 텍스트: [여기] /승인된 목록: [여기]
강력한 프롬프트는 AI를 실제 콘텐츠와 통제된 어휘로 제한합니다. 정확성과 일관성을 모두 유지합니다.
주제 분석 작업 차트
퀘스트
AI의 역할
남자의 결정
내용 요약
빠른 초안
정확성 확인
제목 제안
목록에서 일치
최종 선택, 정당화
분류번호
마스터 클래스 제안
세분화 검증
바이어스 체크
마킹
포괄적 임기 결정
일반적인 실수
- 제목에서 주제를 물어보세요. 주제 분석은 맥락을 기반으로 합니다. 제목이 오해의 소지가 있습니다.
- 확인 없이 분류번호를 수락합니다. AI는 기본 클래스를 찾았지만 하위 구분선을 놓칩니다.
- 통제된 어휘를 건너뜁니다. 자유 기간은 일관성을 깨뜨립니다.
- 편견을 무시합니다. AI는 과거의 낡고 배타적인 조건을 이어받을 수도 있습니다.
- 결정을 전적으로 AI에 맡깁니다. 대표성과 정의에는 판단이 필요합니다. 결정은 그 사람에게 달려 있습니다.
요약하면
주제 분석 및 분류에서 AI는 콘텐츠 요약을 추출하고 승인된 목록에서 주제를 일치시키며 분류 마스터 클래스를 제안하는 빠른 도우미입니다. 그러나 주제 분석은 본질적으로 판단과 표현의 문제입니다. 어떤 제목이 출처, 분류 번호의 정확한 숫자 및 용어의 통용성을 가장 정확하고 공정하게 설명하는지 결정하는 것은 전문가의 몫입니다. 실제 콘텐츠와 통제된 어휘로 AI를 실행하고, 공식 테이블로 분류번호를 확인하며, 편견에 주의하세요.
응용과제
보유하고 있는 출처에 대한 소개와 승인된 주제에 대한 짧은 목록을 준비하세요. "주제 추출" 및 "승인된 주제 일치" 템플릿을 사용하여 AI 제안을 받으세요. 그런 다음 제안을 공식 분류표 및 기관의 현재 어휘와 비교하십시오. 몇 개의 제안이 맞았고, 몇 개를 수정했습니까? "편향 및 최신성 확인" 템플릿을 사용하여 오래된 용어에 대한 권장 사항을 확인하세요.
체크리스트
- [ ] 제목이 아닌 실제 내용을 토대로 주제 분석을 진행했습니다.
- [ ] 통제된 어휘로부터 제목을 매핑했습니다.
- [ ] 분류번호 하위자리를 공식표로 확인하였습니다.
- [ ] 오래되고 배타적인 용어에 대한 제안 사항을 확인했습니다.
- [ ] 최종 주제와 분류는 본인의 판단에 따라 결정되었습니다.