단위 9 / 11

RAG를 통한 기업 정보 관리

이득:

  • RAG가 기관의 실제 문서에 대한 답변을 연결 및 참조하고 깨끗한 문서 기반의 중요성을 적용하여 환각을 줄이는 방법을 이해합니다.
  • RAG 출력의 소스, 날짜 및 통화를 확인하고 충돌하는 버전을 구별하는 기능
  • 접근통제를 통해 승인되지 않은 문서에 대한 대응을 차단하여 기업의 개인정보를 보호하는 기능

조직의 기억은 보고서, 매뉴얼, 회의록, 절차, 이메일 등 분산된 수천 개의 문서에 저장됩니다. 직원은 간단한 질문("이 절차는 어떻게 진행되나요?")에 답하기 위해 몇 시간 동안 문서를 검색할 수 있습니다. 지식 관리자의 꿈은 이 기억이 직접적이면서도 소스 기반의 질문에 대한 답변을 제공하는 것입니다. 이것이 바로 RAG가 약속하는 것입니다. 이 단원에서는 RAG가 무엇인지, 기업 정보 관리에서 RAG를 사용하는 방법, 정확성, 기밀성 및 적시성 측면에서 RAG를 보호하는 방법을 배웁니다.

개념을 정의해보자. RAG(Retrieval-Augmented Generation)는 AI가 먼저 조직의 자체 문서에서 관련 부분을 찾아(검색)한 다음 해당 부분만을 기반으로 답변을 생성하여 질문에 답변하는 것입니다. 이는 메모리에서 답변을 생성하는 일반 AI와 근본적으로 다릅니다. RAG는 추적 가능한 실제 문서에 대한 답변을 연결하고 소스를 제공합니다. 따라서 AI가 기관의 "머리"가 아닌 기관의 문서에서 말하기 때문에 환각이 크게 줄어듭니다.

단계별: 엔터프라이즈 RAG 시스템 이해

1. 문서 베이스를 준비합니다. 조직의 신뢰할 수 있는 최신 문서를 수집하고 정리한 후 청크(문서의 의미 있는 작은 섹션)로 나눕니다. 불량하거나 오래되었거나 충돌하는 문서가 시스템에 입력되면 "쓰레기가 들어오면 쓰레기가 나옵니다"라는 나쁜 반응이 나타납니다.

2. 삽입 및 색인화. 각 청크는 해당 의미를 나타내는 벡터(임베딩)로 변환되어 검색 가능한 인덱스에 저장됩니다. 질문이 나오면 시스템은 의미가 가장 가까운 부분을 찾습니다.

3. 관련 부품을 가져오세요. 질문을 하면 시스템은 문서 기반에서 가장 관련성이 높은 몇 가지 부분을 가져옵니다. 이 단계는 매우 중요합니다. 잘못된 조각을 가져오면 답도 틀리게 됩니다.

4. 소스 기반 응답을 생성합니다. AI는 가져온 조각만을 기반으로 응답을 생성하고 어떤 문서에서 가져왔는지 표시합니다. 출처를 밝히지 않은 응답은 RAG의 목적에 어긋납니다.

5. 확인하고 다시 보고하세요. 사용자는 표시된 소스로 이동하여 답변을 확인할 수 있어야 합니다. 부정확하거나 불완전한 답변은 문서 기반을 개선하기 위한 피드백이 됩니다.

팁: RAG의 품질은 주로 문서 기반의 품질에 따라 달라집니다. 문서를 업데이트하고, 충돌하거나 오래된 버전을 제거하고, 각 문서를 시스템에 넣기 전에 날짜 및 출처 정보를 추가합니다. 흩어진 5,000개의 문서보다 잘 정리된 500개의 문서가 더 나은 답변을 제공합니다.

RAG의 국경 및 보안 지점

RAG는 환각을 감소시키지만 재설정하지는 않습니다. 시스템이 잘못된 조각을 반환하는 경우 AI는 해당 잘못된 조각에 "충성"을 유지하여 여전히 잘못된 대답을 제공할 수 있습니다. 또한 AI는 가져온 조각을 잘못 해석하거나 모순된 방식으로 여러 조각을 결합할 수 있습니다. 따라서 특히 중요한 결정의 경우 소스로 이동하여 RAG 출력을 확인해야 합니다.

개인 정보 보호는 기업 RAG의 핵심 문제입니다. 문서 기반에는 민감한 정보(인사, 계약, 전략)가 포함될 수 있습니다. 시스템은 사용자가 승인하지 않은 문서로부터 응답을 생성해서는 안 됩니다. 액세스 제어(누가 어떤 문서를 볼 수 있는지)도 RAG에 적용되어야 합니다. 그렇지 않으면 직원이 RAG를 통해 자신이 볼 수 없는 정보에 접근할 수도 있습니다.

주의: 문서를 인용하더라도 RAG는 해당 문서가 최신이고 정확하다는 것을 보장하지 않습니다. 시스템은 3년 전의 오래된 절차 문서에서 응답할 수 있습니다. 원본 문서의 날짜와 유효성을 확인하는 것은 사용자와 정보 관리자의 책임입니다.

세 개의 미니 케이스

사례 1 — 절차적 질문이 가속화되었습니다. 한 조직에서는 1,200페이지 분량의 내부 절차 매뉴얼을 위한 RAG 시스템을 구축했습니다. 직원들의 "어떻게 해야 하는가"에 대한 질문은 출처를 나타내는 답변과 함께 몇 초 만에 해결되었습니다. 평균 통화 시간이 25분에서 2분으로 감소했습니다. 각 응답은 해당 응답의 기반이 되는 문서 섹션과 연결되어 있으므로 직원이 이를 확인할 수 있었습니다.

사례 2 — 오래된 문서가 캡처되었습니다. RAG 시스템은 2021년 이전 문서의 허가 절차 질문에 답변했습니다. 그런데 2024년에 업데이트 버전이 나왔습니다. 출처 링크를 열어본 직원은 날짜가 오래되었다는 것을 알아차리고 업데이트된 문서를 발견했습니다. 정보 관리자가 문서 기반에서 이전 버전을 제거했습니다.

사례 3 — 무단 액세스가 방지되었습니다. 초기 설정에서 RAG는 모든 문서를 공개적으로 스캔했습니다. 직원이 볼 수 없는 급여 문서로부터 응답을 받았습니다. 팀은 RAG에 액세스 제어를 추가했습니다. 이제 시스템은 사용자에게 권한이 부여된 문서에서만 응답을 생성합니다.

평가, 피드백 및 지속적인 개선

RAG 시스템은 한 번 설치하고 잊어버리는 도구가 아닙니다. 지속적인 평가와 개선이 필요합니다. 이에 대한 기초는 실제 질문에 대한 시스템 답변을 정기적으로 측정하는 것입니다. 두 가지 질문이 중요합니다. 시스템이 올바른 문서 조각을 가져오는가(액세스 품질) 그리고 가져온 조각에서 올바른 응답을 생성합니까(생산 품질)? 이 두 계층을 별도로 평가해야 합니다. 올바른 문서를 가져와서 잘못 해석하는 것과 잘못된 문서를 가져와 충실하게 전달하는 것은 다른 문제이고 다른 솔루션이 필요하기 때문입니다. 좋은 방법은 정답이 알려진 일련의 "테스트 질문"을 유지하고 업데이트할 때마다 이 세트로 시스템을 테스트하는 것입니다. 또한 사용자의 "이 답변이 도움이 되었나요/소스가 정확했나요?" 피드백을 통해 문서 기반의 공백과 잘못 가져온 부분이 모두 드러납니다. AI는 이러한 피드백을 집계하고 가장 자주 실패하는 질문 유형을 요약하는 데 도움을 줄 수 있습니다. 그러나 어떤 문서를 추가, 업데이트 또는 제거할지에 대한 결정은 정보 관리자에게 있습니다. 시스템은 살아있는 유기체처럼 관리가 필요합니다. 방치된 RAG는 시간이 지남에 따라 오래된 문서로 인해 오해의 소지가 점점 더 많아지고 있습니다.

팁: RAG 시스템을 설정하자마자 20-30개의 실제 질문과 알려진 정답으로 구성된 작은 테스트 세트를 준비하십시오. 문서를 업데이트할 때마다 이 세트를 실행하면 변경 사항으로 인해 시스템이 개선되는지 또는 중단되는지 즉시 알 수 있습니다.

복사 가능한 템플릿 4개

1) 소스 기반 응답 프롬프트:

귀하의 역할: 기업 정보 보조원. 다음은 질문과 관련하여 제기된 문서입니다. 이러한 부분만을 토대로 답변을 제공하고 해당 정보가 어떤 문서/부분에서 나온 것인지 명시하십시오. 해당 부분에 답변이 없으면 "이 정보는 제공된 문서에 포함되어 있지 않습니다"라고 추측하지 마십시오. 질문: [여기] / 부품: [여기]

2) 모순과 통화 통제:

다음 작품들 사이에 모순이나 날짜가 다른 버전이 있나요? 그렇다면 표시하고 어느 것이 더 최신인지 표시하십시오. 부품(날짜 포함): [여기]

3) 문서 기반 정리 감사:

아래 문서 목록에서 RAG 시스템에 넣기 전에 분류해야 할 오래되었거나, 충돌하거나, 출처가 불확실한 문서가 있습니까? 체크하고 그 이유를 적어주세요. 목록(날짜/출처 포함): [여기]

4) 개인 정보 보호 및 액세스 사전 제어:

다음 문서 조각에 민감한 정보(개인 데이터, 기밀 계약, 전략)가 포함되어 있습니까? 각각을 "공개/제한된 액세스"로 분류하고 그 근거를 제시합니다. 트랙: [여기]

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

우리 기관의 허가 절차에 대해 설명해주세요.

문서가 제공되지 않으면 AI는 일반 기억이나 다른 기관의 구현을 통해 구성 절차를 생성합니다. 해당 기관의 실제 규정과 무관할 수 있습니다.

강력한 프롬프트:

귀하의 역할: 기업 정보 보조원. 다음은 해당 기관의 허가 절차에 관한 문서(날짜 포함)입니다. 각 단계의 원본 문서와 날짜를 인용하여 이러한 부분만을 기반으로 질문에 답하십시오. 부분이 충돌하는 경우 가장 최근의 부분을 사용하고 그렇다고 말합니다. 문서에 없으면 "정보 없음"이라고 말하세요. 질문: [여기] / 부품: [여기]

강력한 프롬프트; 답변을 실제 기관 문서와 연결하고 출처와 날짜를 묻고 모순과 격차를 솔직하게 해결합니다.

RAG 구성요소 및 위험 테이블

구성 요소

기능

주요 위험

보증

문서 기반

답변의 출처

오래되었거나 충돌하는 문서

청결함, 역사, 원산지

검색

해당 부분을 찾아보세요

잘못된 조각

품질 테스트, 피드백

생산

답장하다

잘못된 댓글

출처 인용, 검증

접근 통제

권한 확인

무단 공개

사용자 기반 제한

일반적인 실수

  • 더러운 문서 기반을 구축합니다. 오래되었거나 충돌하는 문서로 인해 잘못된 응답이 발생합니다.
  • 출처를 밝히지 않고 답변을 수락합니다. RAG의 목적은 추적성입니다.
  • 문서 날짜를 확인하지 않습니다. 업데이트될 것으로 생각되는 답변은 이전 버전에서 나온 것입니다.
  • 액세스 제어를 우회합니다. 승인되지 않은 사람이 민감한 정보에 접근합니다.
  • RAG가 환각에 완전히 면역되어 있다고 생각합니다. 잘못된 부분은 여전히 ​​​​잘못된 답변을 생성합니다.

요약하면

RAG는 ​​조직의 메모리를 리소스 기반 반응 시스템으로 전환하여 지식 관리에 큰 가치를 창출합니다. 일반 AI와 달리 조직의 실제 문서에 대한 답변을 링크하고 소싱해 환각 현상을 대폭 줄여준다. 그러나 성공은 깨끗하고 최신 문서 기반, 정확한 트랙 액세스, 소스 속성, 날짜/현재성 확인 및 액세스 제어에 달려 있습니다. RAG는 ​​환각을 재설정하지 않습니다. 중요한 답변은 출처를 방문하여 확인되며 처음부터 기밀이 존중됩니다.

응용과제

작은 문서 세트를 준비합니다(날짜가 포함된 실제 또는 샘플 기관 문서 5-8개). 의식적으로 하나의 이전 버전과 하나의 현재 충돌하는 버전을 넣습니다. “출처 기반 응답 프롬프트” 템플릿으로 질문하고 AI가 출처를 인용하는지 확인하세요. 그런 다음 AI가 "충돌 및 현재 버전 확인" 템플릿을 사용하여 충돌과 현재 버전을 올바르게 감지했는지 평가합니다.

체크리스트

  • [ ] 문서 기반을 업데이트하고 오래되거나 충돌하는 문서를 제거했습니다.
  • [ ] 각 답변이 원본 문서를 가리키는지 확인했습니다.
  • [ ] 원본 문서의 날짜와 유효성을 확인했습니다.
  • [ ] 접근통제를 통해 승인되지 않은 문서로부터 응답이 생성되는 것을 방지하였습니다.
  • [ ] 비판적 답변을 원본 문서로 이동하여 확인했습니다.