单位 3 / 10

美国巨头深度剖析:Anthropic、OpenAI、Google

收益:

  • 匹配Claude、GPT、Gemini家族的强领域和典型用户
  • 能够读取每个提供商的级别(tier)逻辑和模型命名
  • 养成根据自己的测试数据进行比较的习惯,而不是营销主张

我们绘制了市场图并了解了封闭式/开放式重量的区别。现在我们将了解市场上最引人注目的三个参与者,即美国的大型提供商:Anthropic (Claude)、OpenAI (GPT) 和 Google (Gemini)。这三者是当今大多数企业人工智能决策的重要组成部分。我们的目标不是宣布“获胜者”;而是宣布“胜利者”。目的是客观地了解每个产品的闪光点、命名逻辑和典型用户。当本单元完成后,您将能够在不混淆的情况下谈论这三个家庭,并且您会内化到您应该基于自己的测试而不是广告进行比较。

通用逻辑:等级系统

这三个提供商都使用类似的逻辑:他们提供同一系列中的模型,根据速度/成本/功率平衡进行分层。通常分为三层:

  • 轻型层:最快且最便宜。适用于简单、大批量的任务(分类、简报、标记)。
  • 平衡阶段:中等功率和成本。大多数日常任务的“默认”选择。
  • 强层:最有能力、最昂贵、最慢。对于复杂的推理、长时间的分析、困难的代码。

一旦理解了这一层逻辑,无论您选择哪个提供商,您都不会感到迷失。 “这个型号在这个家族中对应什么级别?”问一下就够了。

提示:当您听到新型号时,首先询问“哪个系列的哪个级别?”问。不要让众多的名字吓到你;每个提供商实际上以不同的名称提供相同的三层。

人类——克劳德家族

Anthropic 的 Claude 系列提供三个级别,分别为 Opus(强)、Sonnet(平衡)和 Haiku(轻)。还包括版本号;例如,这个平台使用的模型是claude-opus-4-8,即Opus阶段的4.8版本。

它的优势在于:长上下文处理(完整阅读数百页文档的能力)、编写和阅读代码以及企业使用中的安全、可预测的行为。克劳德以严格遵守指示和在敏感问题上表现得泰然自若而闻名。因此,它经常受到法律、金融和卫生等受监管部门的青睐。

典型用户:分析长文档的法律团队、审查代码的软件团队、需要安全输出的企业客户服务。

当前的人择模型和近似价格(每百万代币,输入/输出):

模型

舞台

背景

输入$/1M

产出 $/100 万美元

克劳德作品 4.8

100 万个代币

〜5

〜25

克劳德十四行诗 5

平衡的

100 万个代币

〜3

〜15

克劳德俳句 4.5

轻量级

200K 代币

〜1

〜5

注意:这些价格是该模块准备期间的近似价格,并且经常变化。在做出决定之前,请务必确认提供商的当前价格页面。我们将在第六单元详细讨论价格逻辑。

OpenAI — GPT 系列

OpenAI的GPT家族是市场上最受认可的品牌,拥有最大的第三方生态系统;也就是说,许多软件工具、插件和集成都是首先针对 GPT 发布的。 GPT 系列也分层次:有快速且便宜的型号(例如 GPT-4o mini 等轻量级型号)、平衡的全能型号 (GPT-4o) 和注重思考的型号,如专门专注于推理的“o 系列”。

突出的领域:多功能性和普遍性。文本、代码、图像和音频的广泛功能;成熟的车辆生态系统;和广泛的社会支持。 “工作可以用人工智能来完成吗?” GPT 通常是一个现成的起点。

典型用户:进行快速原型设计的初创公司、需要广泛集成的产品团队、希望通过单一提供商处理广泛任务的中小型企业。

谷歌——双子座家族

Google 的 Gemini 系列拥有两张强大的牌:多模态(同时处理文本、图像、音频和视频的能力)和 Google Workspace 集成(嵌入 Gmail、文档、表格等工具中的工作)。 Gemini 也分等级:有快速的“Flash”型号和更强大的“Pro”型号。

它的优势在于:视觉和视频理解、海量上下文以及为已经大量使用 Google 工具的组织提供无摩擦集成。如果一个组织在 Google Workspace 上运行所有办公室工作,那么 Gemini 就会成为自然的扩展。

典型用户:在Google生态系统中建立的公司、以图像/视频为主的内容团队、想要一次处理非常大的数据集的人。

三个家庭并肩

尺寸

人类(克劳德)

开放人工智能 (GPT)

谷歌(双子座)

最强的方面

长上下文、代码、安全行为

多功能性、广泛的生态系统

多模态、工作空间

阶段

作品/十四行诗/俳句

强/平衡/轻+推理

专业版/闪存

典型用户

受监管行业

企业和产品团队

谷歌重点关注的机构

重量型

关闭

关闭

关闭

看这张桌子时,不要问“哪一个会赢”;问“我的工作符合哪一行?”如果您要阅读 200 页的合同,那么长上下文行对您来说至关重要,如果您要从视觉上读取发票,那么多模态行对您来说至关重要。

弱提示/强提示:询问家庭选择时

弱提示:

克劳德、GPT 还是 Gemini 哪个更好?

强力提示:

你的角色:中立的人工智能顾问。我的工作:我想制作草稿来回复电子商务公司的客户电子邮件+从收到的发票图像中提取金额/日期。有两个不同的任务:(1)文本生成,(2)从图像中提取数据。任务:比较 Claude、GPT 和 Gemini 系列的两项任务。写下哪个系列在任务基础上表现突出,我应该使用哪个级别以及原因。不要给出具体的价格,给出一个范围。如有疑问,请说“测试”。

由于第二个提示将工作分为两个明确的任务,因此模型可以分别为每个任务推荐合适的家庭。这也是我们稍后将要学习的“模型投资组合”思想的基础。

可复制模板

1 级匹配:

我定义了以下任务:[TASK]。考虑到难度级别和数量,您会推荐 Claude、GPT 和 Gemini 系列的哪一层(轻/平衡/强)?为每个家庭写一行理由。

2. 生态系统兼容性:

我们当前使用的工具:[工具列表,例如Google Workspace / Microsoft 365]。哪个 AI 系列最适合此工具堆栈?为什么?评估集成的难易程度、学习曲线以及可能的锁定风险(依赖性)。

3. 优势验证:

我想针对我的任务 [任务] 测试“[模型名称] 在这方面最擅长”这一说法。我应该以自己的效率运行哪 3 个样本测试来验证这一说法?用一句话描述每项测试的成功标准。

4.名称解析:

将以下型号名称解析为系列、阶段和版本并制作表格:[型号名称]。用一个词标记每个的典型用途。

常见错误

  • 根据广告做出决定:“该模型在该测试中名列第一”的公告可能没有说明您的使命。用你自己的数据测试一下。
  • 选择家庭而不选择级别:仅仅说“我们将使用 GPT”是不够的;它的级别从根本上改变了成本和质量。
  • 忽略生态系统锁定:对一个系列的坚定投入带来了集成的便利性,但使将来很难切换到另一个提供商。
  • 错过主题:这个市场变化很快;六个月前的比较今天可能无效。根据最新信息做出决定。
  • 强迫一个家庭做所有事情:当一个家庭在文字中表现出色时,另一个家庭可能在视觉上领先。逐项思考。

综上所述

  • Anthropic、OpenAI 和 Google 都以不同的名称提供相同的层逻辑(轻/平衡/强)。
  • 克劳德在长背景下,编码和安全的企业行为; GPT具有强大的通用性和广阔的生态系统; Gemini 擅长多模态和工作空间集成。
  • “最佳”因工作而异;比较基于您自己的测试数据,而不是广告。
  • 将型号名称解析为系列+级别+版本将帮助您在拥挤的市场中找到自己的出路。

应用任务

确定工作中的两项不同任务(一项以文本为主,一项以视觉或长文档为主)。使用本单元中的模板 1(层级匹配),让 AI 模型询问每个任务的三个系列的适当排名。然后,使用模板 3(优势验证),设计三个具体测试,以使用您自己的数据测试建议的模型。我们将在第 10 单元的评估研究中使用这些测试。

清单

  • [ ] 我可以识别所有三个系列中的级别(轻/平衡/强)逻辑。
  • [ ]克劳德,我可以匹配 GPT 和 Gemini 突出的领域。
  • [ ] 我可以合理地选择合适的家族和等级来完成任务。
  • [ ] 我知道用我自己的数据测试模型声明的方法。
  • [ ] 我可以将模型名称解析为系列+阶段+版本。