단위 10 / 10

엔드투엔드 애플리케이션: 평가, 검증, 윤리 및 경계

이득:

  • 자신의 데이터로 모델을 평가하는 소규모 테스트 세트(eval)를 설정하는 기능
  • 사람의 확인, 제한 및 책임 있는 사용 정책을 워크플로에 포함
  • 환각, 개인 정보 보호 및 윤리적 위험을 인식하고 완화 조치를 구현합니다.

올바른 모델을 선택하셨습니다. 작업이 완료되었나요? 아니요, 이제 실제 작업이 시작됩니다. 비즈니스에 모델을 적용하는 것은 결국 자신의 데이터에 대해 모델을 테스트하고, 출력을 검증하고, 책임감 있게 구성하는 것입니다. 이 마지막 단원은 전체 모듈을 엔드투엔드 애플리케이션으로 전환합니다. 소규모 테스트 모음(평가)을 설정하고, 사람의 확인을 워크플로에 포함하고, 환각 및 개인 정보 보호 위험을 관리하고, 윤리적 경계를 설정하는 방법을 배우게 됩니다. 장치가 완성되면 모델을 선택할 수 있을 뿐만 아니라 자신감을 가지고 시운전할 수 있게 됩니다.

평가(Eval): 자체 데이터로 테스트

이제 광고가 아닌 실제 데이터만이 모델이 귀하의 비즈니스에 적합한지 알 수 있다는 것을 알게 되었습니다. 이를 측정하는 방법은 정답이 알려진 작업의 작은 샘플 모음인 평가 세트(eval)를 설정하는 것입니다.

간단한 평가는 다음과 같이 설정됩니다.

  1. 10~30개의 실제 샘플을 수집하세요. 귀하의 작업에 일반적인 입력을 선택하십시오(어려움과 쉬움 혼합).
  2. 각 예에 대해 "올바른/예상 출력"을 결정합니다. 전문가는 뭐라고 답할까?
  3. 동일한 예를 통해 후보자를 실행하십시오. 동일한 세트로 하나씩 비교하는 모델을 테스트하십시오.
  4. 결과에 점수를 매깁니다. 얼마나 많은 예가 사실입니까? 그는 어디에서 잘못 되었습니까? 실수가 허용됩니까?
  5. 비교하고 선택하세요. 가장 높은 전체 점수를 선택하지 말고 가장 중요한 사례에서 가장 신뢰할 수 있는 점수를 선택하세요.
팁: 순위표를 맹목적으로 신뢰하지 마십시오. 모델은 전 세계적으로 1위를 차지할 수 있지만 특정 터키 법률 텍스트에서는 2위 모델보다 성능이 나쁠 수 있습니다. 20개의 샘플을 직접 평가하는 것은 수백 번의 공개 테스트보다 더 가치가 있습니다.

환각: 모델의 가장 교활한 위험

환각은 모델이 자신감 있는 언어로 실제로 사실이 아닌 정보를 생성하는 경우입니다. 모델은 "모르겠습니다"라고 말하는 대신 존재하지 않는 법안, 조작된 통계 또는 잘못된 날짜를 생성할 수 있습니다. 게다가 그는 매우 설득력 있는 언어로 이를 수행합니다. 오류가 진실인 것처럼 가장하기 때문에 이것이 AI의 가장 위험한 측면입니다.

환각을 완전히 없앨 수는 없지만 환각을 줄이고 잡을 수는 있습니다.

  • 소스 기반: 자체 "메모리"(RAG 논리)가 아닌 제공한 문서에서 답변을 생성하도록 모델에 요청하세요.
  • 요청 출처: "각 주장 옆에 주장의 근거가 되는 문서/섹션을 적으세요"라고 말합니다. 출처를 밝힐 수 없다면 의심해 보세요.
  • 사람들이 확실하지 않다고 말하게 하기: "확실하지 않으면 '명확하지 않음'이라고 쓰세요"라는 지시는 모델 피팅을 줄입니다.
  • 인간 검증: 중요한 출력은 인간이 검증해야 합니다.
주의: 법적, 의학적 또는 재정적 결정을 위해 모델 출력을 검증하지 않고 모델 출력을 사용하지 마십시오. 모델에 의해 생산된 '법조문'이나 '선량정보'는 완전히 조작될 수도 있다. 이러한 영역에서 AI는 초안/예비 도구입니다. 유능한 사람은 항상 최종 결정을 내립니다.

인간 검증 요구 사항

인공 지능은 사람들의 업무를 중단시키는 것이 아니라 속도를 높이는 도구로서 가장 잘 작동합니다. 올바른 설정은 다음과 같습니다. 모델 초안을 생성하거나 사전 검증합니다. 사람이 검토하고, 수정하고, 승인합니다. 검증이 얼마나 엄격해야 하는지는 오류로 인한 비용에 따라 다릅니다.

퀘스트

오류 비용

인간의 검증

제품 설명 초안

낮음

샘플 관리로 충분합니다

고객 이메일 응답

중간

제출 전 검토

계약 위험 분석

높다

기사별 전문가 확인

의료/재정적 조언

매우 높다

전문가 검증, AI만 지원

이 표는 "모든 출력을 수동으로 확인"과 "전혀 확인하지 않음" 사이의 균형을 유지합니다. 저비용 작업의 경우 샘플 제어로 충분하지만 고가 작업의 경우 모든 출력을 검증해야 합니다.

윤리적이고 책임 있는 사용

모델 선택이 기술적 결정처럼 보일 수 있지만 그 뒤에는 윤리적 책임이 있습니다.

  • 투명성: 적절한 장소에서 AI를 사용하고 있음을 고객이나 직원에게 알리십시오. 고객은 자신이 인간과 대화하고 있는지 AI와 대화하고 있는지 알 권리가 있습니다.
  • 편향: 모델은 훈련된 데이터로부터 편향을 상속받을 수 있습니다. 채용, 신용 평가 등 민감한 영역에서 결과의 공정성을 모니터링합니다.
  • 개인 정보 보호: 8단원에서 배운 데이터 보호 원칙을 워크플로에 포함하세요. 개인정보를 함부로 보내지 마세요.
  • 책임: 실수가 발생하면 "AI가 해냈다"는 방어만으로는 충분하지 않습니다. 책임은 차량을 이용하는 기관에 있습니다. 따라서 문서 확인 프로세스를 수행하십시오.
팁: 작업 흐름에 약간의 "책임 있는 사용 정책"을 작성하세요. AI를 사용할 수 있는 작업, 전송할 수 없는 데이터, 이를 확인할 사람, 오류가 보고되는 방법 등이 있습니다. 이 한 페이지짜리 문서는 향후에 발생할 수 있는 큰 문제를 예방합니다.

세 가지 현실적인 사례

사례 1 — 평가를 확립하지 못한 채 후회합니다. 보험팀은 가장 인기 있는 모델을 테스트하지 않고 청구 내용을 요약하기 시작합니다. 2주 후에 그들은 모델이 터키어 기술 용어에서 자주 실수를 하고 일부 금액을 잘못 읽는다는 것을 깨달았습니다. 20개의 샘플 평가를 설정하고 세 가지 모델을 비교할 때 가장 널리 사용되지는 않지만 터키 기술 문서에서 더 정확한 모델로 전환합니다. 손실: 2주 및 교정 노동. 교훈: 먼저 평가하고 나중에 배포하세요.

사례 2 - 환각을 포착하는 과정. 법률 보조원이 모델 인쇄물에서 "대법원 판결" 참조를 봅니다. 해당 프로세스에는 "모든 참조 확인" 규칙이 있으므로 그는 결정을 찾고 그러한 결정이 존재하지 않음을 발견합니다. 그는 모델을 만들었습니다. 사람의 검증 덕분에 위조된 정보는 절대로 고객에게 전달되지 않습니다. 검증규칙이 없었다면 명예훼손은 심각했을 것입니다.

사례 3 - 투명성을 갖춘 신뢰. 한 전자상거래 회사는 AI로 고객 지원 응답을 생성하지만 각 응답 아래에 "이 응답은 인공 지능 지원으로 준비되었으며 당사 담당자 중 한 명이 검토했습니다."라는 메모를 추가합니다. 고객은 빠른 응답과 사람이 참여하는 모습을 보는 자신감에 더욱 만족합니다. 투명성은 숨길 수 있는 약점이 아니라 신뢰의 원천입니다.

약한 프롬프트/강한 프롬프트: 검증 가능한 출력

약한 프롬프트:

이 계약의 위험한 조항에 대해 알려주세요.

모델에 맞을 수 있습니다. 출처도 없고, 불확실성의 흔적도 없습니다.

강력한 프롬프트:

귀하의 역할: 계약 분석가(최종 결정은 변호사에게 있음) 작업: 다음 계약에서 잠재적으로 위험한 조항을 강조하세요. 각 결과에 대해: (1) 조항 번호 및 축어적 인용문, (2) 위험한 이유, (3) 신뢰 수준(높음/중간/낮음). 본문의 조항에만 의존하십시오. 본문에 없는 내용을 조작하지 마세요. 확실하지 않은 경우에는 "변호사 확인 필요"라고 기재하세요. [계약]

강력한 프롬프트는 각 주장을 출처(논문 번호 + 인용)에 연결하고 신뢰 수준을 요구하며 위조를 금지합니다. 이것은 환각을 포착할 수 있게 만듭니다.

복사 가능한 템플릿

1. 평가 세트 디자인:

다음 작업 [TASK]에 대한 평가 세트를 설계합니다. 15개의 샘플 입력(쉬움-보통-어려움 혼합)을 제안하고 각 입력에 대해 "예상되는 올바른 출력"이 어떻게 정의되는지를 제안하고 점수 기준(1-5)을 결정합니다.

2. 환각 감소 랩:

조작을 줄이기 위해 다음 프롬프트를 다시 작성합니다: "[PROMPT]". 출처 인용, 신뢰도 지정, "확실하지 않은 경우 알려주기" 규칙을 추가하세요.

3. 검증 흐름 설계:

다음 워크플로 [워크플로]에서 AI 출력에 대한 사람 검증 단계를 설계합니다. 오류 비용을 기준으로 검증이 얼마나 엄격해야 하는지 결정합니다. 누가 무엇을, 언제 확인할 것인지 적어 보세요.

4. 책임 있는 사용 정책 초안:

[INDUSTRY] 팀을 위한 한 페이지 분량의 '책임 있는 AI 사용 정책' 초안을 작성하세요. 허용된 사용, 금지된 데이터, 검증 책임, 투명성 보고, 오류 보고 등의 제목을 포함합니다.

일반적인 실수

  • 평가 없이 배포: 자체 데이터로 테스트하지 않고 모델을 시작하고 고객/작업에 반영된 후 오류를 발견하지 않습니다.
  • 환각에 의존: 참조를 확인하지 않고 모델의 자신감 있는 언어를 진실로 사용합니다.
  • 사람의 검증을 우회: 비용이 많이 드는 결정에서 결과를 확인하지 않은 상태로 둡니다. "AI가 해냈다"는 방어에 기대어 보세요.
  • 투명성 회피: AI 사용을 숨깁니다. 그런 일이 발생하면 자신감 상실을 경험합니다.
  • 윤리 및 편견 무시: 결과의 공정성을 모니터링하지 않고 민감한 결정(고용, 신용)을 사용합니다.

요약하면

  • 모델을 배포하기 전에 자체 데이터로 작은 평가 세트를 설정하고 후보를 테스트하십시오. 전체 순위는 귀하의 비즈니스를 나타내지 않습니다.
  • 환각은 모델이 자신있게 거짓 언어를 생산하는 것입니다. 소스 속성, 신뢰 수준 및 사람의 검증을 통해 캡처됩니다.
  • 인간 검증의 엄격함은 오류 비용에 따라 조정됩니다. 중요한 영역에서 AI는 단지 지원일 뿐이며 결정은 인간의 몫입니다.
  • 투명성, 편견 통제, 기밀성 및 책임성 책임 있는 AI 사용의 네 가지 기둥입니다. 원페이지 정책으로 큰 위험을 예방합니다.

응용과제

모듈 전체에서 선택한 후보 모델에 대해 이 단원(평가 세트 디자인)의 템플릿 1을 사용하여 15개 예제의 평가 세트를 설정하고 이 세트와 최소 두 개의 모델을 비교합니다. 그런 다음 템플릿 3(검증 흐름)을 사용하여 사람이 출력을 확인하는 방법을 설계하고 템플릿 4(책임 있는 사용 정책)를 사용하여 팀을 위한 한 페이지 정책 초안을 작성합니다. 이 세 가지 결과물은 전체 모듈을 실행 가능한 배포 계획으로 전환합니다.

체크리스트

  • [ ] 내 데이터를 사용하여 소규모 평가 세트를 설정하고 모델을 비교할 수 있습니다.
  • [ ] 나는 환각을 인식하고 완화 및 체포 조치를 적용할 수 있습니다.
  • [ ] 오류 비용을 기준으로 인간 검증의 엄격성을 조정할 수 있습니다.
  • [ ] 투명성, 편견, 기밀성 및 책임 원칙을 작업 흐름에 포함시킬 수 있습니다.
  • [ ] 한 페이지 분량의 책임 있는 AI 사용 정책 초안을 작성할 수 있습니다.

모듈 시험

1. AI '공급자'와 '모델 패밀리'의 차이점은 무엇인가요?

  • A) 제공자는 모델을 개발하는 회사이고, 모델패밀리는 해당 회사의 브랜드 소속 모델그룹입니다 ✔
  • B) 그것들은 정확히 동일하며 서로 바꿔서 사용됩니다.
  • C) 공급자는 모델의 가격이고, 모델 제품군은 모델의 속도입니다.
  • D) 모델 계열은 회사를 나타내고 공급업체는 단일 모델 버전을 나타냅니다.

설명: 공급자는 모델을 개발한 회사입니다(예: Anthropic). 모델 패밀리는 해당 회사가 브랜드(예: Claude)로 수집하는 모델 그룹입니다. 모델 버전은 제품군 내의 특정 버전입니다.

2. 모델의 '가중치'를 가장 정확하게 정의할 수 있는 방법은 무엇입니까?

  • A) 모델이 분당 생산할 수 있는 토큰 수입니다.
  • B) 모델이 훈련 중에 학습하고 정보를 저장하는 것은 수십억 개의 수치 매개변수입니다. ✔
  • 다) 해당 모델의 월간 구독료입니다.
  • D) 해당 모델에서 지원하는 언어 개수입니다.

설명: 가중치는 훈련 중에 모델이 학습하는 수십억 개의 수치 매개변수입니다. '모델이 알고 있는 모든 것'이 저장되는 곳이다. 비공개/명시적 가중치 구분은 이러한 매개변수를 다운로드하고 실행할 수 있는지 여부에 따라 달라집니다.

3. '오픈 웨이트'와 '오픈 소스'에 대한 올바른 설명은 무엇입니까?

  • A) 둘 다 완전히 동일한 개념이며 둘 다 상업적으로 무제한으로 사용할 수 있습니다.
  • B) 공개 가중치는 항상 훈련 데이터도 공개합니다.
  • C) 그것은 같은 것이 아니다; 공개 가중치에서는 일반적으로 매개변수만 공유되며 라이선스 조건으로 상업적 사용이 제한될 수 있습니다 ✔
  • D) 오픈 소스 모델은 다운로드할 수 없으며, 오픈 웨이트 모델은 다운로드할 수 있습니다.

설명: 공개 가중치에서는 모델 매개변수만 공유됩니다. 훈련 데이터와 프로세스는 공개되지 않는 경우가 많으며 일부 라이선스는 상업적 사용을 제한합니다. 따라서 '오픈 웨이트'는 '오픈 소스'와 정확히 동일하지 않습니다.

4. 다음 중 장기 계약을 읽고 분석하는 법무팀에 가장 결정적인 모델 기능은 무엇입니까?

  • A) 토큰 가격이 가장 낮습니다.
  • 나) 시각적(멀티모달) 처리능력을 보유하고 있는 것
  • C) 공개 중량 라이센스 보유
  • D) 넓은 컨텍스트 창 보유 ✔

설명: 긴 문서를 전체적으로 처리하려면 모델에 큰 컨텍스트 창이 필요합니다. 컨텍스트 창은 모델이 한 번에 기억할 수 있는 토큰의 총량입니다.

5. 폐쇄 가중치 모델의 토큰 가격 책정에 대한 설명으로 옳은 것은 무엇입니까?

  • A) 출력 토큰은 일반적으로 입력 토큰보다 훨씬 비쌉니다. ✔
  • B) 투입과 산출은 항상 정확히 같은 가격이다
  • 다) 월 정액요금만 청구되며, 사용량은 무관합니다.
  • D) 입력 토큰은 항상 출력보다 몇 배 더 비쌉니다.

설명: 가격은 토큰별로 계산되며 모델이 생성하는 출력 토큰은 일반적으로 보내는 입력 토큰보다 몇 배 더 비쌉니다. 따라서 길고 불필요한 인쇄물로 인해 비용이 급격히 증가합니다.

6. 송장 이미지에서 데이터를 자동으로 추출하려는 회계팀에 필수적인 모델 기능은 무엇입니까?

  • A) 가능한 가장 넓은 컨텍스트 창
  • 나) 다중양식(시각적 처리 능력) ✔
  • C) 오픈 웨이트 라이센스
  • D) 최고 수준의 추론

설명: 시각적 콘텐츠를 이해하려면 모델이 텍스트뿐만 아니라 이미지도 처리할 수 있어야 합니다. 즉, 다중 모드여야 합니다. 다중 양식은 텍스트, 이미지, 때로는 오디오와 같은 여러 유형의 데이터를 처리하는 모델의 기능입니다.

7. 대용량의 간단한 작업(예: 수천 개의 리뷰에 대한 긍정적/부정적 분류)을 위한 가장 논리적인 선택은 무엇입니까?

  • A) 항상 가장 강력하고 가장 비용이 많이 드는 추론 모델
  • B) 오픈 웨이트와 자체 서버에서만 작동하는 모델
  • C) 작업이 간단하고 볼륨이 높기 때문에 가볍고 저렴한 모델 ✔
  • D) 가장 넓은 컨텍스트 창을 가진 모델

설명: 가볍고 저렴한 모델은 간단한 대용량 작업에 적합합니다. 가장 강력하고 값비싼 모델을 사용하면 여기서 불필요한 비용이 발생합니다. 올바른 접근 방식은 작업의 난이도를 모델 계층에 맞추는 것입니다.

8. KVKK와 관련하여 개인 데이터가 포함된 텍스트를 외국 AI 제공업체에 전송하게 된 계기는 무엇입니까?

  • 가) 어떠한 법적 책임도 발생하지 않습니다.
  • B) 공급자가 EU에 있는 경우에만 중요하며 다른 경우에는 중요하지 않습니다.
  • 다) 데이터의 익명 여부를 불문하고 모든 상황에서 엄격히 금지됩니다.
  • D) 해외 데이터 전송은 고려되며 KVKK의 특별 조건이 적용됩니다 ✔

설명: 해외 공급자 서버의 운영 데이터는 '해외 데이터 전송'으로 간주되며 이 주제에 대한 KVKK의 특수 조건(명시적 동의, 적절성 결정, 적절한 보장 등)이 적용됩니다.

9. 모델의 '추론' 모드는 어떤 역할을 하며 비용에 어떤 영향을 미치나요?

  • A) 복잡한 문제에서는 정확도가 높아지지만, 토큰이 많이 생성되므로 비용과 지연이 증가합니다 ✔
  • B) 항상 모델을 자유롭게 만듭니다.
  • C) 모델에서 지원하는 언어 수만 늘어납니다.
  • D) 항상 답변을 줄이고 비용을 절감하세요.

설명: 추론 모드에서는 모델이 답변을 제공하기 전에 단계별로 '생각'할 수 있습니다. 다단계 및 복잡한 문제의 정확성을 높이지만 더 많은 토큰을 생성하므로 비용과 지연도 증가합니다.

10. 자신의 비즈니스 모델을 평가(eval)할 때 가장 신뢰할 수 있는 접근 방식은 무엇입니까?

  • A) 그냥 가장 인기 있는 모델을 선택해서 테스트 없이 사용하는 것뿐입니다.
  • B) 실제 작업에 대한 작은 테스트 세트를 설정하고 모델과 비교 ✔
  • 다) 광고에서 언급되는 벤치마크 점수만 봐도
  • D) 가장 높은 컨텍스트 창이 있는 모델을 가장 좋은 모델로 자동 수락합니다.

설명: 맹목적으로 순위표에 의존하는 대신 실제 작업에 대한 작은 테스트 세트를 만들고 이 세트의 모델을 비교하면 귀하의 비즈니스에 실제로 적합한 테스트 세트가 드러날 것입니다.

11. 모델 출력에 '환각'이 포함될 수 있다는 지식이 작업 흐름을 어떻게 형성해야 합니까?

  • A) 출력은 항상 올바른 것으로 간주되어야 하며 직접 게시되어야 합니다.
  • B) 환각은 무료 모델에서만 보이고, 유료 모델에서는 보이지 않습니다.
  • 다) 중요한 의사결정에서는 출력물을 사람이 검증하고, 출처를 반드시 확인해야 한다 ✔
  • D) 모델만 바꾸면 환각이 완전히 해소될 수 있다

설명: 환각은 모델이 자신감 있는 언어로 실제로 사실이 아닌 정보를 생성하는 경우입니다. 이러한 위험 때문에 특히 법적, 의학적, 재정적 결정의 경우 사람의 출력 검증이 필요합니다.

12. 성숙한 기관이 채택하는 '모델 포트폴리오' 접근 방식의 기본 논리는 무엇입니까?

  • A) 가장 비싼 단일 모델로 모든 작업을 수행하여 단순성을 보장합니다.
  • B) 가장 저렴한 모델만 사용하고 품질을 완전히 무시함
  • 다) 모델을 사용하지 않고 모든 작업을 수작업으로 수행한다.
  • D) 업무에 따라 다양한 모델을 활용하여 비용 최적화 및 단일 공급자에 대한 의존도 감소 ✔

설명: 모델 포트폴리오는 작업에 따라 다양한 모델을 사용하는 것입니다: 단순하고 부피가 큰 작업을 위한 저렴한 모델, 복잡한 작업을 위한 강력한 모델, 기밀 데이터를 위한 개방형 가중치/지역 모델. 이는 비용을 최적화하고 단일 공급자에 대한 의존도를 줄입니다.

13. 원산지와 데이터 보존 정책이 모델 선택의 기준이 될 수 있는 이유는 무엇입니까?

  • A) 규제, 데이터 주권 및 개인 정보 보호 요구 사항에 직접적인 영향을 미치기 때문입니다. ✔
  • B) 모델의 응답 속도를 결정하기 때문에
  • 다) 모델에서 지원하는 파일 형식을 결정하기 때문에
  • D) 실질적인 효과가 없기 때문에 단지 마케팅적인 내용일 뿐입니다.

설명: 모델 개발자가 위치한 국가 및 데이터가 저장되는 위치/얼마나 많은지; 이는 법적 규제, 데이터 주권 및 개인 정보 보호 측면에서 결정적입니다. 예를 들어, EU 내에서 호스팅하려는 조직의 경우 지역 공급자 또는 제로 스토리지 옵션이 중요합니다.

14. 작업에서 '최고의 단일 모델'을 찾는 것이 왜 오해의 소지가 있는지 가장 잘 설명하는 것은 무엇입니까?

  • A) 모든 모델은 실제로 정확히 동일한 기능을 가지고 있습니다.
  • B) 모델은 다양한 크기에 강하므로 '최고'는 작업 요구 사항에 따라 다릅니다 ✔
  • C) 가장 비싼 모델이 자동으로 모든 작업에서 최고가 됩니다.
  • D) 모델 선택은 완전히 무작위로 이루어져야 합니다.

설명: 모델은 속도, 비용, 상황, 다중 양식, 개인 정보 보호 및 추론과 같은 다양한 차원에서 강력합니다. 한 차원에서는 리더인 모델이 다른 차원에서는 약할 수 있습니다. 그래서 '최고'는 항상 직업 요구 사항에 따라 달라집니다.