收益:
- 能够将自由文本和发票数据转换为根据固定模式构建的表
- 能够为费用分类、增值税退计算和异常检测设置可重复的提示
- 能够通过增值税平等和总体一致性检查来验证提取的财务字段
会计团队花费最多时间的任务之一是将分散的费用和发票数据组织到有组织的表格中。附在电子邮件中的发票、从 WhatsApp 发送的收据照片、自由文本费用单(如“安卡拉会议餐 + 出租车 840 TL”)……它们最终都应该出现在同一个位置:由类别、金额、增值税(增值税)、日期和供应商字段构成的行。
人工智能 (AI) 在这种“自由文本到结构”的转变中非常强大。但在财务数据上,哪怕是一分钱出差错都是不可接受的。因此,在本单元中,我们将一起学习两件事:让人工智能根据固定模式(预定的字段列表)生成数据,并通过聚合一致性检查来验证输出。
为什么“模式”如此重要?
架构是指您提前告知每行中的哪些字段、顺序和格式。如果您不提供架构,则模型会为每张发票生成不同的格式;如果不手动更正,那么将它们合并到一个表中将很困难。如果您提供架构,输出将是一致且可验证的。
一个好的费用图表包括以下字段:日期、供应商、描述、类别、增值税排除金额(基础)、增值税税率、增值税金额、含增值税总额、单据编号。
提示:始终使用“句点/逗号”约定定义数字字段。说“以 1234.56 格式写入金额,不带千位分隔符”将避免稍后导出到 Excel 时数小时的格式化噩梦。
一步一步:从自由文本到表格
- 修正方案。写下字段名称、顺序和格式。
- 给出类别列表。请模特从你的列表中进行选择,而不是在她的脑海中进行分类。
- 制定不确定性规则。让他将不确定的区域留白并放上“勾号”。
- 验证增值税逻辑。让模型检查方程基础 + 增值税 = 总计。
- 交叉核对总数。所有行的总和是否与您的校验和匹配?
弱提示/强提示
弱提示:将以下费用转成表格: - 安卡拉美食出租车 840 - 文具 300 含增值税 - 酒店 2 晚 3600
这会产生类别不一致、增值税混合、每行格式不同的输出。
强力提示:完全按照此方案将以下自由文本费用转换成表格:字段(按此顺序):日期|供应商|描述 |类别|基础|增值税税率 |增值税金额 |总计 |注意规则:- 仅从以下列表中选择类别:[旅行、住宿、食品、文具、交通、其他]- 以 1234.56 格式填写金额(无千位分隔符)。- 如果注明“含增值税”,请计算基数和增值税;如果您不知道增值税税率,请在备注字段中填写“税率确认”并将其留空。 - 提供税基+增值税金额=每行总计的等式;如果没有提供,请在注释字段中写上“不满足”。 - 留下您不确定的字段,在注释中添加“检查”。
此提示会计算回文具的基数,包括至 250 的增值税和至 50 的增值税,标记税率不明确的项目,并生成可合并到单个表格中的干净输出。
增值税反计算逻辑
从包含增值税的金额中查找税基是会计中经常需要的程序。公式:基数=总量/(1+比率)。例如,对于包含 20% 增值税的 300 TL,基数 = 300 / 1.20 = 250,增值税 = 50。如果您明确地将这个公式提供给模型,则误差幅度会减小。
交易
公式
样品(20%)
不含增值税 → 含增值税
总计 = 基数 × (1 + 比率)
250 × 1.20 = 300
含增值税 → 基础
基数 = 总计 / (1 + 比率)
300 / 1.20 = 250
增值税金额
增值税 = 总额 - 基数
300 − 250 = 50
控制
基数 + 增值税 = 总计
250 + 50 = 300
使用发票照片和 OCR 打印输出
现场费用通常以收据照片或 PDF 发票的形式发送。从这些图像中提取文本的技术称为 OCR(光学字符识别)。视觉人工智能工具可以完成这项工作,但 OCR 输出总是存在缺陷:逗号可能会被读作点,“5”可能会与“S”混淆,金额的数字可能会丢失。因此,切勿将 OCR 中的金额直接纳入会计中。
从此发票图像中提取以下字段并将它们准确写入以下架构中:日期|供应商|税号 |基地|增值税税率 |增值税金额 |总规则:- 在您无法读取或不确定的任何字段中写入“UNREAD”,请勿猜测。- 基数 + vat_amount = 检查总计;如果没有,请标记“检查”。 - 以 1234.56 格式给出金额。
不让任何人猜测不确定区域是一条重要的安全规则。如果模型用“最有可能”完成一个数字,记录会默默地输入错误。 “未读”标志允许人们返回原始文档并确认它。
提示:在 OCR 打印输出中,总额通常是最可靠的读取字段,因为它以大字体书写。如果税基+增值税=总等式不成立,则可以通过该等式反推找出误差在哪个区域。
异常和重复记录检测
人工智能不只是翻译,还包括翻译。它还会发现可疑物品。例如,同一供应商在同一天两次提供几乎相同的金额,或者该类别的费用异常高。
在下面的费用表中,标记以下异常情况并写出原因:1)可能的重复记录(同一供应商+类似金额+最近日期)2)金额大于类别平均值的3倍3)增值税税率与该类别的预期不同只需标记并写出原因;不要删除或更改任何行。
注意:人工智能的“这可能是重复的”警告是一个提示,而不是一个决定。这两条记录实际上可能是两个不同的服务。删除或合并的决定始终由人类做出;该模型只是引起您的注意。
迷你箱
案例 1 — 300 个筹码堆叠。一位会计专家在图表提示下,用了大约 15 分钟将 300 行自由文本月末费用清单转换为表格。这项工作在手动完成时需要 4 小时,经过验证后减少到 40 分钟。收获的不仅仅是速度,还有速度。品类一致性也有所提高。
案例 2 — 遭遇双重付款。异常提示表明,向供应商开出的 4,720 土耳其里拉的发票已使用两个不同的单据编号输入了两次。审查显示,一份是汇票,另一份是定稿发票,且均已到期付款。没有人工智能,就会出现双重支付。
案例3——增值税税率陷阱。该模型对购买主食征收 20% 的增值税;而该项目属于较低费率组。由于“速率确认”规则,该行由专家来源进行了标记、验证和更正。教训:不要把增值税税率留给模型,从清单或文档中确认。
常见错误
- 在不提供模式的情况下转换数据。每行都有不同的格式,组合需要手动更正。
- 不提供类别列表。该模型适合自己的类别;报告变得不一致。
- 没有检查增值税平等性。税基 + 增值税 = 加起来不等于总数的行将被静默输入到表中。
- 将异常警告误认为是决定。 “可能会重复”是一个开始;人类做出删除的决定。
- 跳过校验和。依赖于输出,而不将行总数与已知的控制量进行比较。
综上所述
- 当使用人工智能处理自由文本费用/发票数据时,最可靠的方法是根据固定模式请求输出。
- 提供类别列表并澄清格式规则(句点/逗号、千位分隔符)可保持输出的一致性和可转移性。
- 将增值税退税计算公式明确赋予模型,并检查每行中的税基+增值税=总计是否相等。
- 人工智能在标记重复和异常记录方面非常强大,但删除/合并的决定始终由人类做出。
- 使用已知的校验和交叉验证行总计可以确保整个作业的安全。
应用任务
准备至少 10 行的混合费用清单(实际费用或样本);故意包含重复条目和增值税率错误的项目。使用强大的提示模板将其转换为表格,然后运行异常提示。检查模型是否捕获您设置的两个陷阱,并手动验证三行中的增值税相等性。
清单
- [ ] 我定义了一个带有字段名称、顺序和格式的固定模式。
- [ ]我把类别列表给了模型,我没有让它补。
- [ ] 我添加了数字格式(句点/逗号,无千位分隔符)规则。
- 我检查了 [ ] 税基 + 增值税 = 完全平等。
- [ ] 我进行了异常/重复扫描并以人类身份做出了决定。
- [ ] 我将行总数与已知的校验和进行了比较。