이득:
- 토큰, 컨텍스트 윈도우, 멀티모달리티의 개념을 일상 언어로 설명하는 능력
- 작업에 광범위한 컨텍스트가 필요한지 또는 다중 양식이 필요한지 진단
- 이러한 개념이 비용 및 모델 선택에 어떤 영향을 미치는지 고려하는 능력
지금까지 우리는 공급자와 모델 유형에 대해 잘 알고 있습니다. 그러나 올바른 모델을 선택하려면 모델이 "내부"에서 어떻게 작동하는지 이해하는 것도 필요합니다. 가격, 용량, 가용성 결정은 모두 토큰, 컨텍스트 창, 다중 양식이라는 세 가지 핵심 개념에 의존하기 때문입니다. 이러한 개념을 모르는 사람은 가격표를 읽고 "이 문서가 모델에 맞을까요?"라고 궁금해할 수 없습니다. 질문에 답할 수 없고 시각적 처리가 필요한 시기를 알 수 없습니다. 이 단원이 끝나면 이러한 세 가지 개념을 일상 언어로 설명하고, 작업에 광범위한 맥락이 필요한지 아니면 다중 양식이 필요한지 진단하고, 이것이 비용에 미치는 영향을 고려할 수 있게 됩니다.
토큰: Word 대신 모델에서 사용하는 단위
인공 지능 모델은 텍스트를 단어 단위로 처리하는 것이 아니라 토큰이라는 작은 조각으로 처리합니다. 토큰 단어, 단어의 일부, 구두점 또는 공백일 수 있습니다. 대략적으로 계산해 보면 영어의 경우 평균 토큰은 약 4자 정도이고, 100단어는 약 130~150개의 토큰입니다. 터키어에서는 접미사와 긴 단어로 인해 이 비율이 약간 더 높을 수 있습니다. 즉, 동일한 의미를 가진 터키어 텍스트는 영어보다 약간 더 많은 토큰을 소비합니다.
이것을 아는 것이 왜 중요합니까? 모든 것이 토큰으로 청구되고 측정되기 때문입니다. 모델에 보내는 텍스트(입력)와 모델에서 생성된 응답(출력)은 별도의 토큰으로 계산됩니다. 귀하의 청구서와 모델의 용량은 모두 토큰에 있습니다.
팁: 텍스트에 포함된 토큰 수를 대략적으로 추정하려면 문자 수를 4로 나눕니다. 4,000자 이메일은 약 1,000개의 토큰입니다. 터키어에서는 안전한 편에 머물기 위해 조금 더 높다고 가정합니다.
상황 창: 모델의 "단기 기억"
컨텍스트 창은 모델이 한 번에 기억할 수 있는 토큰의 총량입니다. 입력과 출력은 이 창에서 함께 맞아야 합니다. 테이블 위에 한 번에 펼칠 수 있는 종이의 양과 같다고 생각하세요. 테이블에 맞지 않는 종이는 그 순간 시야에서 벗어납니다.
모델의 컨텍스트 창이 200,000개 토큰인 경우 이는 약 150,000단어 또는 여러 개의 중간 크기 책에 해당합니다. 100만 개의 토큰으로 전체적으로 훨씬 더 큰 문서를 처리할 수 있습니다. 오늘날 일부 강력한 모델(예: Claude Opus 4.8 및 Sonnet 5)은 1백만 개의 토큰 컨텍스트를 제공하는 반면, 경량 모델은 종종 더 작은 창(예: Haiku 4.5의 경우 200,000개 토큰)과 함께 제공됩니다.
왜 중요합니까? 문서가 컨텍스트 창에 맞지 않으면 모델이 문서를 모두 볼 수 없기 때문입니다. 500페이지 분량의 계약서 전체를 200,000개 토큰 모델에 제공할 수는 없습니다. 문서를 여러 부분으로 나누거나(부분 간의 관계가 손실될 수 있음) 더 넓은 맥락을 가진 모델을 선택합니다.
주의: 컨텍스트 창이 크다고 모든 문서를 그대로 채우는 것은 현명하지 않습니다. 창에 더 많은 토큰을 넣을수록 더 많은 비용을 지불하게 되며 때로는 모델이 매우 긴 텍스트에서 중간 세부 사항을 놓칠 수 있습니다. 작동하는 부분만 보내는 것이 더 저렴하고 정확한 경우가 많습니다.
컨텍스트 창은 결정 기준입니다
퀘스트
대략적인 필수 컨텍스트
적절한 수준
짧은 이메일 응답
수백 개의 토큰
경량
한 페이지 요약
수천 개의 토큰
빛/균형
40페이지 분량의 보고서 분석
~30,000 토큰
균형잡힌/강한
300페이지 분량의 계약서 검토
~250,000 토큰
광범위한 컨텍스트로 강력함
수백 개의 문서를 한 번에 처리
500,000개 이상의 토큰
가장 광범위한 컨텍스트
이 표는 "어떤 모델입니까?"라는 질문에 대한 답변입니다. 문서 크기에 따라 질문의 일부가 직접 답변되는 것을 보여줍니다. 짧은 작업을 위해 큰 맥락을 갖춘 값비싼 모델을 구입하는 것은 낭비입니다. 작은 창이 있는 모델은 큰 문서에는 적합하지 않습니다.
다중양식: 텍스트를 넘어서기
다중 양식은 텍스트뿐만 아니라 여러 유형의 데이터(이미지, 오디오, 때로는 비디오)를 처리하는 모델의 기능입니다. 여기서 "모달"은 "데이터 유형"을 의미합니다. multimodal은 "많은 종류"를 의미합니다.
- 텍스트 전용 모델: 작성된 텍스트만 읽고 씁니다.
- 다중 모드 모델: 청구서 사진을 읽고, 그래프의 추세를 해석하고, 손으로 쓴 메모를 해독하고, 때로는 음성 녹음을 녹음할 수 있습니다.
왜 중요합니까? 귀하의 비즈니스 특성상 다양한 방식이 필요할 수 있기 때문입니다. 송장 이미지에서 금액을 추출하는 회계팀, 상품 사진을 분류하는 전자상거래팀, 파손 사진을 평가하는 보험팀은 텍스트만 읽는 모델로는 이 작업을 수행할 수 없습니다. 이러한 작업에는 시각적 처리가 필수적입니다.
세 가지 현실적인 사례
사례 1 — 토큰 가격이 놀랍습니다. 또한 콘텐츠 팀은 각 블로그 게시물을 작성할 때 모델에게 20페이지 분량의 '브랜드 가이드' 문서를 보냅니다. 이 가이드는 약 15,000개의 토큰입니다. 그들은 한 달에 2,000개의 기사를 생산합니다. 따라서 가이드를 계속해서 보내는 것만으로도 3천만 개의 토큰 입력을 의미합니다. 가이드를 단축하고 관련 부분(토큰 약 2,000개)만 전송함으로써 입력량을 7분의 1로 줄여 청구서를 대폭 절감합니다.
사례 2 - 컨텍스트 창이 충분하지 않습니다. 한 법률 회사에서 280페이지 분량의 합병 계약서 검토를 원합니다. 그들이 시도한 첫 번째 모델에는 200,000개의 토큰이 바인딩되어 있었는데 문서가 맞지 않았습니다. 문서가 찢어지면 모델은 첫 번째 섹션의 기사가 마지막 섹션의 기사와 모순된다는 것을 알 수 없습니다. 100만 개의 토큰 컨텍스트가 있는 모델로 전환하면 문서 전체를 읽고 모순을 파악합니다. 여기서 컨텍스트 창은 정확도를 직접적으로 결정했습니다.
사례 3 — 다중 양식은 필수입니다. 보험 회사에서는 차량 손상 사진을 바탕으로 예비 평가를 하려고 합니다. 이는 텍스트만 읽는 모델에서는 불가능합니다. 사진을 '보는' 다중모달 모델이 필요합니다. 멀티모달 모델로 전환하면 사진 속 손상 위치와 손상 정도를 대략적으로 분류해 전문가에게 지시하는 사전 심사 시스템을 구축한다. 그러나 그들은 인간 전문가가 최종 결정을 내린다고 지적합니다. 모델은 최종 단어가 아닌 예비 심사 도구이기 때문입니다.
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
이 문서를 요약하세요. [너무 긴 문서를 붙여넣었습니다.]
강력한 프롬프트:
아래에 40페이지 분량의 보고서를 요약하세요. 먼저 보고서에 있는 대략적인 토큰 수를 추정하고 그것이 일반적인 균형 모델의 컨텍스트 창에 맞는지 여부를 알려주세요. 그런 다음 요약을 다음 형식으로 제공합니다: 5개 항목 요약 요약 + 3개 위험한 결과. 보고서에 있는 정보만 사용하십시오. 확실하지 않은 부분은 "보고서에 명확하지 않음"으로 표시하세요. [보고]
강력한 프롬프트는 토큰/컨텍스트를 인식하고 출력의 형식과 검증 가능성을 제어합니다.
복사 가능한 템플릿
1. 토큰 예측:
다음 텍스트에 대한 대략적인 토큰 수를 추정하고 이를 입력 비용 측면에서 해석합니다: "[TEXT]". 터키어라는 점을 고려하여 조금 반올림하세요.
2. 컨텍스트 가용성 확인:
내 업무는 월 평균 [QTY]개의 문서 중 [PAGES]개 문서를 처리하는 것입니다. 이 크기에는 어떤 컨텍스트 창이 필요합니까? 가벼움/균형/강함 수준 중 어느 수준이 충분할까요? 해체가 필요한 경우 어떤 위험이 발생합니까?
3. 다중양식 진단:
내 작업 흐름: [설명]. 이 스트림에 시각적, 오디오 또는 비디오 처리가 있습니까? 그렇다면 다중 모드 모델이 필요한가요, 아니면 텍스트(OCR/전사)로 변환하여 텍스트 모델로 해결할 수 있나요? 두 경로의 장단점을 비교해보세요.
4. 상황 최적화:
요청할 때마다 모델에 문서를 보내지만 대부분은 불필요합니다. 이 문서에서 [TASK]에 실제로 필요한 부분을 어떻게 추출하나요? 입력을 줄이고 예상되는 토큰 절감액을 표시하는 구체적인 방법 3가지를 제안하세요.
일반적인 실수
- 토큰을 단어로 착각함: 토큰은 단어와 다릅니다. 송장과 용량은 항상 토큰으로 표시되므로 말로 계산하면 오해의 소지가 있습니다.
- 컨텍스트 창이 무한하다고 생각: 모든 모델에는 제한이 있습니다. 문서가 맞지 않으면 모델이 전체를 볼 수 없습니다.
- 불필요한 대규모 컨텍스트 사용: 짧은 작업을 위해 대규모 컨텍스트를 갖춘 값비싼 모델을 구입합니다. 또는 모든 요청에 대해 거대한 문서를 작성하고 헛된 비용을 지불할 수도 있습니다.
- 다중 양식 가정: 모든 모델이 시각적 개체를 처리할 수 있는 것은 아닙니다. 시각적 작업의 경우 모델이 다중 모드인지 확인하지 않고 시작하세요.
- 터키어의 토큰 로드 잊어버리기: 터키어 텍스트는 일반적으로 동일한 의미에 대해 약간 더 많은 토큰을 소비합니다. 비용 추정에서 이를 무시합니다.
요약하면
- 토큰은 모델이 텍스트를 처리하는 작은 단위입니다. 입력과 출력은 토큰으로 별도로 측정되고 청구됩니다.
- 컨텍스트 창은 모델이 한 번에 기억할 수 있는 총 토큰입니다. 문서 크기는 모델 선택에 직접적인 영향을 미칩니다.
- 다중 양식은 시각적/오디오와 같은 비텍스트 데이터를 처리하는 모델의 기능입니다. 시각적인 작업에는 필수적입니다.
- 이 세 가지 개념은 모두 "어떤 모델인가?"라는 질문과 관련이 있습니다. "비용은 얼마입니까?" 이는 질문의 기초를 형성합니다.
응용과제
귀하의 비즈니스에서 반복되는 AI 작업을 선택하십시오. 첫 번째 템플릿(토큰 예측)이 이 작업에서 일반적인 입력이 얼마나 많은 토큰인지 계산하도록 합니다. 그런 다음 템플릿 2(컨텍스트 가용성 확인)를 사용하여 어느 수준이 충분한지 확인합니다. 시각적 작업이 있는 경우 세 번째 템플릿(다중 진단)을 사용하여 다중 모드 모델이 필요한지 여부를 명확히 합니다. 우리는 다음 단위의 비용 계산에 결과 토큰 견적을 사용할 것입니다.
체크리스트
- [ ] 나는 토큰의 개념과 텍스트에 얼마나 많은 토큰이 있는지 대략적으로 추정하는 방법을 알고 있습니다.
- [ ] "테이블/메모리" 비유로 컨텍스트 창을 설명할 수 있습니다.
- [ ] 문서가 모델에 적합한지 평가할 수 있습니다.
- [ ] 다중 양식이 필수적인 시기를 진단할 수 있습니다.
- [ ] 터키어의 토큰 오버헤드와 불필요한 컨텍스트 비용을 고려합니다.