单位 5 / 10

令牌、上下文窗口和多模态:模型的思维如何运作

收益:

  • 能够用日常语言解释令牌、上下文窗口和多模态的概念
  • 诊断任务是否需要广泛的背景或多模态
  • 能够考虑这些概念如何影响成本和模型选择

到目前为止,我们已经熟悉了提供者和模型类型。然而,为了正确选择模型,还需要了解模型的“内部”工作原理;因为价格、容量和可用性决策都依赖于三个核心概念:代币、上下文窗口和多模态。不了解这些概念的人无法阅读价格表并想知道“这份文件适合该模型吗?”无法回答问题,也看不出视觉处理何时至关重要。在本单元结束时,您将能够用日常语言解释这三个概念,诊断工作是否需要广泛的背景或多模态,并考虑它们对成本的影响。

Token:模型使用的单位而不是单词

人工智能模型不是逐字处理文本,而是以称为标记的小块形式处理文本。一个令牌;它可以是一个单词、单词的一部分、标点符号或空格。粗略计算一下:英语中,平均一个token约为4个字符,100个单词约为130-150个token。在土耳其语中,由于单词后缀和较长,该比率可能会稍高一些;换句话说,具有相同含义的土耳其语文本比英语消耗的标记略多。

为什么知道这一点很重要?因为一切都是以代币来收费和计量的。您发送到模型的文本(输入)和模型生成的响应(输出)被视为单独的令牌。你的发票和模型的容量都是以代币为单位的。

提示:要粗略估计文本有多少个标记,请将字符数除以四。一封 4,000 个字符的电子邮件大约相当于 1,000 个令牌。在土耳其语中,为了安全起见,假设稍高一些。

上下文窗口:模型的“短期记忆”

上下文窗口是模型一次可以记住的标记总数。输入和输出必须在该窗口中组合在一起。可以将其想象为您一次可以在桌子上铺开的纸张数量:无法放在桌子上的纸张此时就超出了您的视野。

如果模型的上下文窗口为 200,000 个标记,则这相当于大约 150,000 个单词或几本中等大小的书籍。 100 万个代币可以整体处理更大的文档。如今,一些强大的模型(例如 Claude Opus 4.8 和 Sonnet 5)提供 100 万个令牌上下文,而轻量级模型通常具有较小的窗口(例如 Haiku 4.5 的 200,000 个令牌)。

为什么它很重要?因为如果文档不适合上下文窗口,模型就无法同时看到它。你不能把一份 500 页的合约全部交给一个 20 万代币的模型;您可以将文档划分为多个部分(这可能会丢失各个部分之间的关​​系),或者选择具有更广泛上下文的模型。

注意:因为上下文窗口很大,所以填写每个文档是不明智的。您在窗口中放入的令牌越多,您支付的费用就越多,有时模型可能会错过很长文本中的中间细节。仅发送有效的部分通常更便宜且更准确。

上下文窗口是一个决策标准

任务

所需的大概上下文

适当的水平

简短的电子邮件回复

数百个代币

轻量级

一页摘要

几千个代币

轻/平衡

40页报告分析

约 30,000 个代币

平衡/强劲

300页合同审查

约 250,000 个代币

功能强大,背景广泛

一次处理数百个文档

500,000+ 代币

最广泛的背景

该表回答了“哪种型号?”的问题。它表明部分问题可以直接通过文档大小来回答。对于短期工作来说,买一个昂贵的、背景大的模型是一种浪费;具有小窗口的模型不足以处理大型文档。

多模态:超越文本

多模态是指模型处理多种类型数据(图像、音频,有时是视频)而不仅仅是文本的能力。这里的“Modal”是指“数据类型”;多式联运的意思是“多种”。

  • 纯文本模型:仅读取和写入书面文本。
  • 多模式模型:可以读取账单照片、解释图表上的趋势、解码手写笔记,有时还可以转录录音。

为什么它很重要?因为您的业务性质可能需要多模式。从发票图像中提取金额的会计团队、对产品照片进行分类的电子商务团队或评估损坏照片的保险团队无法使用仅读取文本的模型来完成这项工作。视觉处理对于这些任务至关重要。

三个现实案例

案例 1——代币成本意外。内容团队在制作每篇博客文章时还会向模特发送 20 页的“品牌指南”文档。本指南大约有 15,000 个代币。他们每月生产 2,000 篇文章;因此,仅仅一遍又一遍地发送指南就意味着 3000 万代币的输入。通过缩短指南并仅发送相关部分(约 2,000 个代币),他们将输入减少到七分之一,并显着减少费用。

情况 2 — 上下文窗口不够。一家律师事务所想要审查一份 280 页的合并协议。他们尝试的第一个模型绑定了 200,000 个令牌,但文档不适合;当文档被撕开时,模型无法注意到第一部分中的文章与最后部分中的文章相矛盾。当它切换到具有 100 万个令牌上下文的模型时,它会读取整个文档并捕获矛盾。这里上下文窗口直接决定了准确性。

案例 3——多模态是必须​​的。一家保险公司希望根据车辆损坏照片进行初步评估。对于仅读取文本的模型来说这是不可能的;需要一个能够“看到”照片的多模态模型。当他们切换到多模式模型时,他们会建立一个预筛选系统,对照片中损坏的位置和严重程度进行粗略分类,并指导专家。然而,他们指出,最终决定是由人类专家做出的。因为模型只是一个初步的筛选工具,而不是最终的结论。

弱提示/强提示

弱提示:

总结一下这个文档。 [粘贴的文档太长]

强力提示:

下面总结了 40 页的报告。首先估计报告中令牌的大致数量,并告诉我们它是否适合典型平衡模型的上下文窗口。然后以这种格式给出摘要:5 项执行摘要 + 3 个有风险的发现。仅使用报告中的信息;将您不确定的部分标记为“报告中不清楚”。 [报告]

强大的提示既能感知令牌/上下文,又能控制输出的格式和可验证性。

可复制模板

1. 代币预测:

估计以下文本的标记的大致数量,并根据输入成本来解释它:“[TEXT]”。考虑到它是土耳其语,所以将其四舍五入一下。

2. 上下文可用性检查:

我的工作是处理以下文档:每月平均 [页] [数量] 个文档。这个尺寸需要什么上下文窗口?轻/平衡/强的哪个级别就足够了?如果需要拆除会有什么风险?

3.多模态诊断:

我的工作流程:[描述]。该流中是否有视觉、音频或视频处理?如果是这样,是否需要多模式模型,或者可以将其转换为文本(OCR/转录)并使用文本模型解决?比较两条路径的优缺点。

4.上下文优化:

我会根据每个请求向模型发送一份文档,但大多数都是不必要的。如何从该文档中提取[TASK]实际需要的部分?建议 3 种减少投入的具体方法并指出估计的代币节省量。

常见错误

  • 将 token 误认为单词:Token 与单词不同;发票和容量总是以代币为单位,用文字计算会产生误导。
  • 认为上下文窗口是无限的:每个模型都有一个限制;如果文档不适合,模型就无法看到整体。
  • 使用不必要的大上下文:为短期工作购买具有大上下文的昂贵模型;或者为每个请求填写大量文件并白付费用。
  • 假设多模态:并非每个模型都可以处理视觉效果;对于视觉工作,在不确认模型是多模态的情况下开始。
  • 忘记土耳其语的标记负载:对于相同的含义,土耳其语文本通常会消耗稍多的标记;在成本估算中忽略这一点。

综上所述

  • 令牌是模型处理文本的小单元;输入和输出作为代币单独测量和开具发票。
  • 上下文窗口是模型一次可以记住的总标记;文档大小直接影响模型的选择。
  • 多模态是模型处理视觉/音频等非文本数据的能力;这对于视觉作品来说是必不可少的。
  • 这三个概念都与“哪种模型?”这个问题相关。以及“要花多少钱?”它构成了问题的基础。

应用任务

选择您企业中重复出现的 AI 任务。让第一个模板(令牌预测)计算此任务中典型输入有多少个令牌。然后确定模板 2 的哪个级别足够(上下文可用性检查)。如果您有视觉工作,请澄清第三个模板(多模态诊断)是否需要多模态模型。我们将在下一个单元的成本计算中使用由此产生的代币估算。

清单

  • [ ] 我知道 token 的概念以及如何粗略估计文本有多少个 token。
  • [ ] 我可以用“表/内存”类比来解释上下文窗口。
  • [ ] 我可以评估文档是否适合模型。
  • [ ] 我可以诊断何时需要多模式治疗。
  • [ ] 我考虑了土耳其语的令牌开销和不必要的上下文的成本。