收益:
- 能够设置一个小型测试集 (eval),用您自己的数据评估模型
- 将人工验证、限制和负责任的使用政策嵌入工作流程中
- 认识幻觉、隐私和道德风险并实施缓解措施
您选择了正确的型号;工作完成了吗?不,真正的工作现在才开始。将模型放入您的业务中可以归结为根据您自己的数据对其进行测试、验证其输出并负责任地构建它。最后一个单元将整个模块转变为端到端应用程序:您将学习如何设置小型测试套件 (eval)、将人工验证嵌入工作流程、管理幻觉和隐私风险以及划定道德界限。设备完成后,您不仅可以选择型号,还可以放心地进行调试。
评估(Eval):用您自己的数据进行测试
现在您知道,只有您的实际数据(而不是广告)才能判断模型是否适合您的业务。衡量这一点的方法是建立一个评估集(eval):您工作中已知正确答案的一小部分样本集合。
一个简单的 eval 设置如下:
- 收集 10-30 个真实样本。选择适合您工作的典型输入(混合困难和简单)。
- 确定每个示例的“正确/预期输出”。专家会怎样回答呢?
- 让候选人通过相同的例子进行测试。测试您正在与同一组进行一一比较的模型。
- 对结果进行评分。有多少例子是正确的?他哪里错了?错误可以接受吗?
- 比较并选择。不要选择最高的总分,而是选择对您来说最关键的示例中最可靠的分数。
提示:不要盲目相信排行榜。某个模型可能在全球排名第一,但在特定的土耳其法律文本中表现却比第二名模型差。您自己对 20 个样本的评估比数百次公共测试更有价值。
幻觉:模型最隐秘的风险
幻觉是指模型以自信的语言产生实际上并不真实的信息。该模型不会说“我不知道”,而是可能会产生一项不存在的立法、捏造的统计数据或错误的日期;而且,他用一种极其令人信服的语言来做到这一点。这是人工智能最危险的方面,因为错误会伪装成真理。
你无法完全消除幻觉,但你可以减少它并捕捉它:
- 基于来源:要求模型从您提供的文档中生成答案,而不是从它自己的“记忆”(RAG 逻辑)中生成答案。
- 请求来源:说“在每个声明旁边,写下其所依据的文档/部分”;如果他不能提供来源,那就要怀疑了。
- 让人们说他们不确定:“如果你不确定,写‘不清楚’”的指令会减少模型拟合。
- 人工验证:关键输出必须由人工验证。
注意:在未对模型输出进行法律、医疗或财务决策验证之前,切勿使用模型输出。模型产生的“法律文章”或“剂量信息”可能完全是捏造的。在这些领域,人工智能是一个草案/初步工具;有能力的人总是有最后的发言权。
人工验证的要求
人工智能最适合作为一种工具,加速人们的工作,而不是让他们失业。正确的设置如下: 生成模型草案或对模型草案进行资格预审;人类审查、纠正和批准。验证的严格程度取决于错误的成本。
任务
错误成本
人工验证
产品描述草案
低
样品控制就足够了
客户电子邮件回复
中等
提交前审核
合同风险分析
高
逐条专家确认
医疗/财务建议
非常高
专家全面验证,仅AI支持
该表在“手动检查每个输出”和“根本不检查”之间取得了平衡。虽然样本控制对于低成本工作来说已经足够,但对于高价工作来说,每个输出都必须经过验证。
道德和负责任的使用
尽管模型选择看起来像是一个技术决策,但其背后存在道德责任:
- 透明度:让您的客户或员工知道您正在适当的地方使用人工智能。客户有权知道他们是在与人交谈还是与人工智能交谈。
- 偏差:模型可以从训练它们的数据中继承偏差。监控招聘和信用评估等敏感领域结果的公平性。
- 隐私:将您在第 8 单元学到的数据保护原则嵌入到工作流程中;不要鲁莽地发送个人数据。
- 问责制:当错误发生时,“人工智能造成的”辩护是不够的。责任在于使用车辆的机构。所以文件验证过程。
提示:在您的工作流程中写入一些“负责任的使用政策”:哪些工作可以使用人工智能,哪些数据不能发送,谁来验证以及如何报告错误。这份一页的文档可以防止将来出现重大问题。
三个现实案例
案例 1——后悔没有建立评估。保险团队在没有测试最流行的模型的情况下开始总结索赔。两周后,他们意识到该模型经常在土耳其语技术术语中犯错误,并且会错误地读取一些金额。当他们设置 20 个样本的评估并比较三个模型时,他们切换到不是最流行但在土耳其技术文本中更准确的模型。损失:两周和校对工作。教训:先评估,后部署。
案例 2——捕获幻觉的过程。律师助理在打印输出样本中看到了“最高法院判决”的引用。由于他们的流程有“验证每个引用”规则,因此他查找决策并发现不存在这样的决策;他做了一个模型。由于人工验证,捏造的信息永远不会到达客户。如果没有验证规则,声誉损失可能会很严重。
案例 3 — 透明的信任。一家电子商务公司利用人工智能生成客户支持回复,但在每个回复下添加了一条注释:“此回复是在人工智能支持下准备的,并由我们的一位代表进行了审核。”客户对快速响应和看到员工参与的信心更加满意。透明度不是需要隐藏的弱点,而是信任的源泉。
弱提示/强提示:可验证的输出
弱提示:
请告诉我这份合同的风险条款。
可适配模型;没有来源,没有不确定的迹象。
强力提示:
您的角色:合同分析师(最终决定权属于律师)。任务:突出显示以下合同中存在潜在风险的条款。对于每个发现:(1) 条款编号和逐字引用,(2) 为什么有风险,(3) 您的置信水平(高/中/低)。仅依赖文本中的子句;文中未提及的内容请勿编造。如果您不确定,请写“需要律师确认”。 [合同]
强烈提示将每个主张与来源联系起来(文章编号+引用),要求置信度,并禁止捏造;这使得幻觉变得容易捕捉。
可复制模板
1.评估集设计:
为以下任务 [TASK] 设计评估集。建议 15 个样本输入(简单-中等-困难混合),如何为每个输入定义“预期正确输出”,并确定评分标准 (1-5)。
2. 减少幻觉裹敷:
重写以下提示以减少伪造:“[PROMPT]”。添加引用来源、指定置信度以及“如果您不确定,请告诉我”的规则。
3、验证流程设计:
在以下工作流程中 [工作流程] 为 AI 输出设计人工验证步骤。根据错误成本确定验证的严格程度;写下谁将检查什么、何时检查。
4. 起草负责任的使用政策:
为[行业]的团队起草一页“负责任的人工智能使用政策”。包括以下标题:允许的用途、禁止的数据、验证责任、透明度报告、错误报告。
常见错误
- 无需评估即可部署:启动模型而不用您自己的数据进行测试,并在错误反映在客户/作业中后发现错误。
- 依赖幻觉:在不验证参考资料的情况下,使用模型的自信语言作为真相。
- 绕过人工验证:在高成本决策中不检查输出;依靠“人工智能做到了”的辩护。
- 避免透明度:隐藏您对人工智能的使用;当这种情况发生时,就会失去信心。
- 忽视道德和偏见:使用敏感决策(招聘、信贷)而不监控输出的公平性。
综上所述
- 在部署模型之前,用您自己的数据设置一个小型评估集并测试候选模型;总体排名并不代表您的业务。
- 幻觉是模型自信地产生虚假语言;通过来源归属、信任级别和人工验证来捕获。
- 人工验证的严格程度根据错误成本进行调整;在关键领域人工智能只是支持,决定权在人类。
- 透明度、偏见控制、保密性和问责制;是负责任地使用人工智能的四大支柱。一页政策防范重大风险。
应用任务
使用本单元中的模板 1(评估集设计)为您在整个模块中选择的候选模型设置一个由 15 个示例组成的评估集,并将至少两个模型与该集进行比较。然后设计人员如何使用模板 3(验证流程)验证输出,并使用模板 4(负责任的使用政策)为您的团队起草一页政策。这三个可交付成果将整个模块转变为可行的部署计划。
清单
- [ ] 使用我自己的数据,我可以设置一个小的评估集并比较模型。
- [ ] 我能够识别幻觉并采取缓解和阻止措施。
- [ ] 我可以根据错误成本调整人工验证的严格程度。
- [ ] 我可以将透明度、偏见、保密和问责原则嵌入到工作流程中。
- [ ] 我可以起草一份一页的负责任的人工智能使用政策。
模块考试
1.人工智能“提供者”和“模范家庭”有什么区别?
- A) 提供商是开发模型的公司,模型家族是该公司在某个品牌下的模型组✔
- B)它们是完全相同的东西并且可以互换使用
- C) Provider是模型的价格,model family是模型的速度。
- D) 型号系列指的是公司,供应商指的是单一型号版本
描述:提供者是开发模型的公司(例如 Anthropic);模特家族是该公司在某个品牌(例如克劳德)下收集的模特群体。型号版本是系列内的特定版本。
2. 如何最准确地定义模型的“权重”?
- A) 模型每分钟可以产生的代币数量
- B) 模型在训练过程中学习并存储其信息的数十亿个数值参数。 ✔
- C) 模型的每月订阅费
- D) 模型支持的语言数量
描述:权重是模型在训练过程中学习到的数十亿个数值参数;它是存储“模型知道的一切”的地方。封闭/显式权重的区别取决于这些参数是否可以下载和运行。
3. 关于“开放权重”和“开源”,哪种说法是正确的?
- A)它们是完全相同的概念,并且都提供无限的商业用途
- B)开放权重也总是公开训练数据
- C)这不是同一件事;在开放加权中,通常仅共享参数,并且许可条款可能会限制商业用途✔
- D) 开源模型无法下载,开放权重模型可以下载
说明:开放加权时,仅共享模型参数;培训数据和过程通常不公开,并且某些许可证限制商业用途。所以“开放权重”与“开源”并不完全相同。
4. 对于阅读和分析长期合同的法律团队来说,以下哪一项是最具决定性的模型特征?
- A)具有最低的代币价格
- B)具有视觉(多模态)处理能力
- C) 拥有开放重量许可证
- D) 拥有宽广的上下文窗口 ✔
说明:模型需要一个大的上下文窗口来整体处理长文档;上下文窗口是模型一次可以记住的标记总数。
5. 关于封闭权重模型的代币定价,哪一项是正确的?
- A) 输出代币通常比输入代币贵得多 ✔
- B)输入和输出的价格始终完全相同
- C) 仅收取固定月费,与使用量无关
- D) 输入代币总是比输出代币贵很多倍
说明:价格是按代币计算的,模型产生的输出代币通常比您发送的输入代币贵几倍。因此,冗长且不必要的打印输出会迅速增加成本。
6. 对于想要从发票图像中自动提取数据的会计团队来说,模型中的哪些功能至关重要?
- A)尽可能宽的上下文窗口
- B) 多模态(视觉处理能力)✔
- C) 开放重量许可证
- D) 最高水平的推理
说明:为了理解视觉内容,模型必须能够处理图像和文本,即它必须是多模态的。多模态是指模型处理多种类型数据的能力,例如文本、图像,有时还包括音频。
7. 对于大批量、简单的任务(例如,对数千条评论进行正面/负面分类),最合理的选择是什么?
- A)始终是最强大和最昂贵的推理模型
- B)仅在开放权重和自己的服务器上运行的模型
- C) 轻量且低成本的模型,因为任务简单且量大✔
- D)具有最宽上下文窗口的模型
描述:轻量级、低成本的模型可以胜任简单、大批量的任务;使用最强大和最昂贵的模型会产生不必要的成本。正确的方法是将任务的难度与模型层相匹配。
8. 是什么触发以 KVKK 方式向国外人工智能提供商发送包含个人数据的文本?
- A) 不产生任何法律责任
- B) 仅当提供商位于欧盟时才重要,其他情况下均不重要
- C) 在任何情况下都严格禁止,无论数据是否匿名
- D) 考虑将数据传输到国外并遵守 KVKK 的特殊条件 ✔
说明:国外提供商服务器上的操作数据被视为“国外数据传输”,并受 KVKK 关于此主题的特殊条件(例如明确同意、充分性决定、适当保证)的约束。
9. 模型的“推理”模式有什么作用以及它如何影响成本?
- A) 它提高了复杂问题的准确性,但由于生成更多代币而增加了成本和延迟 ✔
- B)始终使模型自由
- C) 只增加模型支持的语言数量
- D)始终缩短答案并降低成本
描述:推理模式可以让模型在给出答案之前一步步“思考”;它提高了多步骤和复杂问题的准确性,但也增加了成本和延迟,因为它会生成更多令牌。
10. 在评估(eval)您自己的业务模型时,最可靠的方法是什么?
- A) 只选择最流行的模型并使用它而不进行测试
- B) 设置一个您自己的真实任务的小型测试集,并将模型与其进行比较 ✔
- C) 只看广告中提到的基准分数
- D)自动接受具有最高上下文窗口的模型为最佳模型
说明:不要盲目依赖排行榜,而是创建一个您自己的实际任务的小型测试集并比较该组上的模型,这将揭示真正适合您业务的模型。
11. 模型输出可能包含“幻觉”的知识应该如何塑造您的工作流程?
- A)输出应始终被认为是正确的并直接发布
- B) 幻觉仅在免费模型中出现,在付费模型中没有
- C) 在关键决策中,输出必须由人工验证,并且来源必须得到确认 ✔
- D)只需改变模型即可完全消除幻觉
解释:幻觉是指模型以自信的语言产生实际上并不真实的信息。由于存在这种风险,应该需要人工验证输出,特别是对于法律、医疗和财务决策。
12、成熟机构采用的“模型组合”方式的基本逻辑是什么?
- A) 通过让每项工作都由一个最昂贵的模型来完成来确保简单性。
- B)只使用最便宜的型号,完全忽视质量
- C) 不使用任何模型并手动完成所有工作
- D) 根据任务使用不同的模型来优化成本并减少对单一提供商的依赖 ✔
描述:模型组合是根据任务使用不同的模型:用于简单和庞大工作的廉价模型,用于复杂工作的强大模型,用于机密数据的开放权重/区域模型。这既优化了成本,又减少了对单一提供商的依赖。
13. 为什么原产国和数据保留政策可能成为模型选择的标准?
- A) 因为它直接影响监管、数据主权和隐私要求 ✔
- B)只是因为它决定了模型的响应速度
- C) 因为它决定了模型支持的文件格式
- D) 因为没有实际效果,只是一个营销细节
描述:模型开发者所在国家以及数据存储位置/数量;它在法律监管、数据主权和隐私方面具有决定性作用。例如,对于想要在欧盟境内托管的组织来说,区域提供商或零存储选项变得很重要。
14.哪一项最能解释为什么在任务中寻找“单一最佳模型”会产生误导?
- A) 所有模型实际上都具有完全相同的功能
- B) 不同尺寸的模特都很强大,所以“最好”取决于工作要求✔
- C)最昂贵的模型自动在每项任务中都是最好的
- D)模型选择应该完全随机
描述:模型在速度、成本、上下文、多模态、隐私和推理等不同维度上都很强大。在一个方面处于领先地位的模型在另一个方面可能会很弱;所以“最好”总是取决于工作要求。