单位 5 / 11

模型选择:正确的模型适合正确的工作

收益:

  • 可以比较型号系列(快速/平衡/强大)的功能、速度和成本
  • 根据任务复杂度设计模型选择和路由策略
  • 通过一小组评估将模型选择建立在证据的基础上

决定您在 LLM 整合中获得最大收益和质量的唯一决定是您使用哪种模型。常见的反应是“选择最强的模型”;然而,这通常意味着不必要的成本和延误。正确的方法是选择完成每项任务的最轻模型,并将该选择基于测量而不是猜测。在本单元中,您将在能力/速度/成本轴上比较模型系列,根据任务复杂性建立模型路由策略,并通过一小组评估来证明选择。

了解模范家庭

提供商通常提供三类:快速/便宜、稳定和强大。它们之间的关系总结为三个轴:能力(解决困难任务的能力)、速度(延迟)、成本(代币价格)。

例子

人才

速度

成本

可用任务

俳句 4.5

中等

非常高

分类、标签、小结、定位

平衡的

十四行诗 5

中等

通用、编码、多步骤流程、大多数代理工作

作品 4.8

最高

中等

推理复杂、远程自主任务、分析困难

批判性见解:更强大的模型并不在每项工作上都表现更好。在简单的“紧急与否”标记中,强模型和快速模型给出了相同的正确答案;唯一的区别是功能强大的价格贵5倍并且速度较慢。只有当使命需要时,额外的人才才会产生价值。

一步一步:如何选择型号?

  1. 对任务进行分类。是常规/模式化(标记、推理),还是开放式/多步骤(分析、规划、代码)?
  2. 从最轻的候选者开始。尝试使用快速模型。如果够了,就停下来。
  3. 如果还不够,就升到更高的级别。如果精度低,就去平衡的,如果不够,就去强的。
  4. 测量,不要猜测。将每个候选的准确性和成本与一小部分评估进行比较(如下)。
  5. 设置重定向。不要连接到单个模型,而是使用“路由器”将任务分配给正确的模型。

模型路由

实际工作负载是混合的:大多数传入请求都很简单,有些则很困难。把它们都送去强大的模型是一种浪费;将它们全部发送到快速模型会降低质量。路由解决了这个问题:一个廉价的模型(或一个简单的规则)首先对任务进行分类,然后将作业转到适当的模型。

# 路由器提示(适用于廉价型号) 根据传入请求的难度对其进行分类。仅返回以下 JSON:{"difficulty": "simple|complex"}简单:单步、公式化、简答。复杂:需要多步推理、分析或长时间生成。请求:"""{{request}}"""

  • 转到简单→快速模型(便宜、快速)。
  • 转到复杂→强大的模型(昂贵但必要)。

这种模式显着降低了平均成本,因为大多数流量通常都很简单。

提示:转介决定并不总是需要法学硕士。像“如果文本少于 20 个单词,则转到快速模型”这样的简单规则也是一个指南,并且带来零额外的代币成本。首先尝试一下规则。

将选择与证据联系起来:小型评估集群

不要基于“它对我来说更好”来选择模型。 Eval(评估集)是一小组已知正确答案的样本;您在此集合上运行每个模型并测量准确性、成本和延迟。

# 评估设置模板 1) 收集 20-50 个真实示例,手写每个示例的“正确答案”。2) 在该集合上运行每个模型(快速/平衡/强)。3) 对于每个模型:正确数量、平均吞吐量令牌、每个请求的成本、平均时间。4) 选择“以最便宜的价格提供足够的准确度”的模型。

# Eval比较表(填写)模型|准确度|每个请求的成本|平均持续时间俳句 | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...秒

弱提示/强提示(模型选择决策)

# WEAK(没有决策依据)让我们使用最好的模型,预算并不重要。

# STRONG(基于测量的决策)在评估 50 个样本时,Haiku 的准确度为 96%,Sonnet 的准确度为 97%;从统计角度来看,差异并不显着。选择俳句是因为它便宜 5 倍,速度快 2 倍。如果准确率低于 95%,系统将自动决定升级到 Sonnet。

强大版本;将选择与数字、阈值和升级规则绑定。这既捍卫了今天的决定,又管理了未来的变化。

三个迷你箱

案例 1——逃离压倒性的模式。呼叫中心正在生成与 Opus 的所有对话摘要;每月的账单很高。在 40 个样本评估中,Sonnet 的准确度落后 Opus 1%,但成本却低三分之一。他们将摘要工作移至十四行诗;每月成本从 9,000 美元下降到 3,100 美元,并且没有质量投诉。

案例 2 — 带重定向的混合流量。法律技术团队 80% 的请求是简单的文档标记,20% 是复杂的合同分析。他们将它们全部发送给强大的模型。他们添加了一个廉价的路由器,并将简单的工作分配给 Haiku,将复杂的工作分配给 Opus;平均请求成本下降了 64%,同时保持了分析质量。

案例 3 — 未经测量而缩小规模的成本。为了降低成本,一个团队将复杂的医疗代码提取直接减少到快速模型;他们没有评价。在实时情况下,准确率从 92% 下降到 78%,导致返回错误的推断。他们必须首先进行评估:这项任务需要强大的模型。教训:降低和升高都是通过测量来完成的。

常见错误

  • “最强模型”反射:简单任务中的浪费和不必要的延迟。
  • 不测量就改变模型:没有评估,缩小和放大都是有风险的。
  • 锁定单一模型:混合流量中的路由通常更高效。
  • 总是将路由器误认为是LLM:简单的规则可以零成本发挥作用。
  • 不设置提升阈值:应提前定义如果精度下降会发生什么。
  • 不修复模型版本:记录您在生产中正在使用的模型/版本;版本更改可能会改变行为。

更深入:持续评估和增量试验

模型选择不是一次性的决定。供应商推出新型号,价格发生变化,您的工作描述也发生变化。因此,设置一次 eval 集群,不要忘记;像对待生命一样握住它。当新模型出现时,您可以对其运行相同的 20-50 个样本,更新表格,然后再次做出决定。这可以保护你免受“模式切换直觉”陷阱的影响。

第二个高级技术是后备/级联模式。你先把任务交给便宜的模型;如果输出的置信度较低或验证层(单元 11)拒绝它,则您可以升级相同的请求。因此,大部分流量都通过廉价型号解决,只有剩下的少数流量流向昂贵型号。这比固定的单一模型方法更便宜、更耐用。

第三点,评估不仅包括准确性,还包括成本和延迟。如果一个模型的准确率提高了 1%,但成本却提高了 3 倍,速度慢了 2 倍,那么对于大多数工作来说,这种权衡是不值得的。沿着三个轴(准确性、成本、延迟)做出决策并定义“充足阈值”:“如果准确性高于 95%,则选择最便宜的。”

最后,记录您在生产中使用的型号/版本。如果有一天输出质量发生变化,你首先会看的是模型版本是否发生了变化。版本追溯可以更快地找到质量问题的根本原因。

还有一点需要注意:评估集群应该代表您的实际工作负载。仅包含简单示例的评估隐藏了模型在困难情况下出错的地方,并使您陷入错误的信心。一个好的评价;它包括常见的简单示例以及您在现实中遇到的极端情况(不明确、不完整、矛盾的输入)。这个困难的少数决定了你的模型选择,因为无论如何,每个模型都会在容易的多数中取得成功。通过定期提供新的真实示例来保持您的评估的新鲜度和代表性。

综上所述

正确的型号是能够完成工作的最轻的型号;更强大并不意味着每项工作都更好,它只是更昂贵和更慢。对任务进行分类并从最轻的候选者开始,通过路由分配混合流量,并用一小组评估来证实选择,可以在保持质量的同时降低成本很多倍。

应用任务

选择工作负载。 (1) 将任务分为简单/复杂。 (2) 设计一个由 20 个真实示例组成的小型评估集(及其正确答案)。 (3) 制定计划来填充三个模型类别的准确性/成本/时间比较表。 (4) 如果有混合流量,请编写路由规则并设置升级阈值。

清单

  • [ ] 我可以在能力/速度/成本轴上比较模型系列。
  • [ ] 我可以应用“最轻的成功模式”原则。
  • [ ] 我可以根据任务复杂程度设置模型路由。
  • [ ] 通过一小组评估,我可以将选择与证据绑定起来。
  • [ ] 我可以定义升级/降级阈值。