收益:
- 匹配Claude、GPT、Gemini家族的强领域和典型用户
- 能够读取每个提供商的级别(tier)逻辑和模型命名
- 养成根据自己的测试数据进行比较的习惯,而不是营销主张
我们绘制了市场图并了解了封闭式/开放式重量的区别。现在我们将了解市场上最引人注目的三个参与者,即美国的大型提供商:Anthropic (Claude)、OpenAI (GPT) 和 Google (Gemini)。这三者是当今大多数企业人工智能决策的重要组成部分。我们的目标不是宣布“获胜者”;而是宣布“胜利者”。目的是客观地了解每个产品的闪光点、命名逻辑和典型用户。当本单元完成后,您将能够在不混淆的情况下谈论这三个家庭,并且您会内化到您应该基于自己的测试而不是广告进行比较。
通用逻辑:等级系统
这三个提供商都使用类似的逻辑:他们提供同一系列中的模型,根据速度/成本/功率平衡进行分层。通常分为三层:
- 轻型层:最快且最便宜。适用于简单、大批量的任务(分类、简报、标记)。
- 平衡阶段:中等功率和成本。大多数日常任务的“默认”选择。
- 强层:最有能力、最昂贵、最慢。对于复杂的推理、长时间的分析、困难的代码。
一旦理解了这一层逻辑,无论您选择哪个提供商,您都不会感到迷失。 “这个型号在这个家族中对应什么级别?”问一下就够了。
提示:当您听到新型号时,首先询问“哪个系列的哪个级别?”问。不要让众多的名字吓到你;每个提供商实际上以不同的名称提供相同的三层。
人类——克劳德家族
Anthropic 的 Claude 系列提供三个级别,分别为 Opus(强)、Sonnet(平衡)和 Haiku(轻)。还包括版本号;例如,这个平台使用的模型是claude-opus-4-8,即Opus阶段的4.8版本。
它的优势在于:长上下文处理(完整阅读数百页文档的能力)、编写和阅读代码以及企业使用中的安全、可预测的行为。克劳德以严格遵守指示和在敏感问题上表现得泰然自若而闻名。因此,它经常受到法律、金融和卫生等受监管部门的青睐。
典型用户:分析长文档的法律团队、审查代码的软件团队、需要安全输出的企业客户服务。
当前的人择模型和近似价格(每百万代币,输入/输出):
模型
舞台
背景
输入$/1M
产出 $/100 万美元
克劳德作品 4.8
强
100 万个代币
〜5
〜25
克劳德十四行诗 5
平衡的
100 万个代币
〜3
〜15
克劳德俳句 4.5
轻量级
200K 代币
〜1
〜5
注意:这些价格是该模块准备期间的近似价格,并且经常变化。在做出决定之前,请务必确认提供商的当前价格页面。我们将在第六单元详细讨论价格逻辑。
OpenAI — GPT 系列
OpenAI的GPT家族是市场上最受认可的品牌,拥有最大的第三方生态系统;也就是说,许多软件工具、插件和集成都是首先针对 GPT 发布的。 GPT 系列也分层次:有快速且便宜的型号(例如 GPT-4o mini 等轻量级型号)、平衡的全能型号 (GPT-4o) 和注重思考的型号,如专门专注于推理的“o 系列”。
突出的领域:多功能性和普遍性。文本、代码、图像和音频的广泛功能;成熟的车辆生态系统;和广泛的社会支持。 “工作可以用人工智能来完成吗?” GPT 通常是一个现成的起点。
典型用户:进行快速原型设计的初创公司、需要广泛集成的产品团队、希望通过单一提供商处理广泛任务的中小型企业。
谷歌——双子座家族
Google 的 Gemini 系列拥有两张强大的牌:多模态(同时处理文本、图像、音频和视频的能力)和 Google Workspace 集成(嵌入 Gmail、文档、表格等工具中的工作)。 Gemini 也分等级:有快速的“Flash”型号和更强大的“Pro”型号。
它的优势在于:视觉和视频理解、海量上下文以及为已经大量使用 Google 工具的组织提供无摩擦集成。如果一个组织在 Google Workspace 上运行所有办公室工作,那么 Gemini 就会成为自然的扩展。
典型用户:在Google生态系统中建立的公司、以图像/视频为主的内容团队、想要一次处理非常大的数据集的人。
三个家庭并肩
尺寸
人类(克劳德)
开放人工智能 (GPT)
谷歌(双子座)
最强的方面
长上下文、代码、安全行为
多功能性、广泛的生态系统
多模态、工作空间
阶段
作品/十四行诗/俳句
强/平衡/轻+推理
专业版/闪存
典型用户
受监管行业
企业和产品团队
谷歌重点关注的机构
重量型
关闭
关闭
关闭
看这张桌子时,不要问“哪一个会赢”;问“我的工作符合哪一行?”如果您要阅读 200 页的合同,那么长上下文行对您来说至关重要,如果您要从视觉上读取发票,那么多模态行对您来说至关重要。
弱提示/强提示:询问家庭选择时
弱提示:
克劳德、GPT 还是 Gemini 哪个更好?
强力提示:
你的角色:中立的人工智能顾问。我的工作:我想制作草稿来回复电子商务公司的客户电子邮件+从收到的发票图像中提取金额/日期。有两个不同的任务:(1)文本生成,(2)从图像中提取数据。任务:比较 Claude、GPT 和 Gemini 系列的两项任务。写下哪个系列在任务基础上表现突出,我应该使用哪个级别以及原因。不要给出具体的价格,给出一个范围。如有疑问,请说“测试”。
由于第二个提示将工作分为两个明确的任务,因此模型可以分别为每个任务推荐合适的家庭。这也是我们稍后将要学习的“模型投资组合”思想的基础。
可复制模板
1 级匹配:
我定义了以下任务:[TASK]。考虑到难度级别和数量,您会推荐 Claude、GPT 和 Gemini 系列的哪一层(轻/平衡/强)?为每个家庭写一行理由。
2. 生态系统兼容性:
我们当前使用的工具:[工具列表,例如Google Workspace / Microsoft 365]。哪个 AI 系列最适合此工具堆栈?为什么?评估集成的难易程度、学习曲线以及可能的锁定风险(依赖性)。
3. 优势验证:
我想针对我的任务 [任务] 测试“[模型名称] 在这方面最擅长”这一说法。我应该以自己的效率运行哪 3 个样本测试来验证这一说法?用一句话描述每项测试的成功标准。
4.名称解析:
将以下型号名称解析为系列、阶段和版本并制作表格:[型号名称]。用一个词标记每个的典型用途。
常见错误
- 根据广告做出决定:“该模型在该测试中名列第一”的公告可能没有说明您的使命。用你自己的数据测试一下。
- 选择家庭而不选择级别:仅仅说“我们将使用 GPT”是不够的;它的级别从根本上改变了成本和质量。
- 忽略生态系统锁定:对一个系列的坚定投入带来了集成的便利性,但使将来很难切换到另一个提供商。
- 错过主题:这个市场变化很快;六个月前的比较今天可能无效。根据最新信息做出决定。
- 强迫一个家庭做所有事情:当一个家庭在文字中表现出色时,另一个家庭可能在视觉上领先。逐项思考。
综上所述
- Anthropic、OpenAI 和 Google 都以不同的名称提供相同的层逻辑(轻/平衡/强)。
- 克劳德在长背景下,编码和安全的企业行为; GPT具有强大的通用性和广阔的生态系统; Gemini 擅长多模态和工作空间集成。
- “最佳”因工作而异;比较基于您自己的测试数据,而不是广告。
- 将型号名称解析为系列+级别+版本将帮助您在拥挤的市场中找到自己的出路。
应用任务
确定工作中的两项不同任务(一项以文本为主,一项以视觉或长文档为主)。使用本单元中的模板 1(层级匹配),让 AI 模型询问每个任务的三个系列的适当排名。然后,使用模板 3(优势验证),设计三个具体测试,以使用您自己的数据测试建议的模型。我们将在第 10 单元的评估研究中使用这些测试。
清单
- [ ] 我可以识别所有三个系列中的级别(轻/平衡/强)逻辑。
- [ ]克劳德,我可以匹配 GPT 和 Gemini 突出的领域。
- [ ] 我可以合理地选择合适的家族和等级来完成任务。
- [ ] 我知道用我自己的数据测试模型声明的方法。
- [ ] 我可以将模型名称解析为系列+阶段+版本。