Guide · 使用教程
Parseur 发票邮件转表格教程:字段提取、金额校验、去重与人工复核
把发票邮件和 PDF 提取到待复核表,配置字段与明细,再用金额校验、业务去重、人工批准和重试控制完成可靠的台账流程。
先明确这条流程要交付什么
这篇教程把供应商通过邮件发送的发票 PDF 整理成结构化数据,先进入待复核表,通过业务校验和人工确认后再进入正式台账。Parseur 负责接收文件、识别字段和导出;金额判断、重复检测和审核状态需要在表格或外部工作流中明确实现。
这是一套配置与验收方法,并非已经在你的邮箱、财务系统中运行的连接器。示例不触发付款,也不把识别结果直接作为报税或记账依据。第一次试点可以只用 CSV 和测试表,验证数据后再连接 Make、Zapier 或自己的接口。
第一步:准备样本、字段和责任人
收集 3 家供应商的代表样本,包括清晰 PDF、扫描件、两页以上发票和带折扣的明细。建议准备 15—30 份测试文件,并用经授权或脱敏的数据。单张漂亮样本无法说明系统能处理其他版式。
确认谁负责接收文件、谁审核异常、谁维护供应商映射,以及谁有权把数据写入正式表。建立一个测试邮箱或专用转发规则,避免把整个私人邮箱自动转发过去。保留原始文件和正确答案清单,便于核对每次字段调整后的影响。
推荐先定义以下数据结构:
| 字段 | 含义与规则 |
|---|---|
| supplier_name | 发票中的供应商名称,保留原文 |
| supplier_id | 由你维护的供应商主数据映射得到,不要求 AI 猜内部编号 |
| invoice_number | 发票号码,作为文本保存,保留前导零 |
| invoice_date | 发票日期,明确原始日期格式和目标格式 |
| currency | 明确币种;只有符号且存在歧义时进入复核 |
| subtotal / tax / total | 未税金额、税额、总额;按本企业口径解释 |
| line_items | 商品说明、数量、单价和行金额组成的明细表 |
| source_document_id | 来源文档标识,方便回溯到本次上传 |
| review_status | 待复核、需补资料、已批准等业务状态,由工作流管理 |
业务状态和内部供应商编号属于后续流程字段,不应全部交给 Parseur 从文件中生成。对每个字段规定“缺失时留空还是阻止处理”,不要让模型补齐没有出现在文件里的金额、日期或币种。
第二步:创建邮箱并上传第一组样本
在 Parseur 创建 AI 辅助邮箱,按当前界面的引导上传代表文件。邮箱也可以通过邮件接收文档;首次配置建议手动上传,这样容易把每个结果和样本对应起来。
检查自动建议的字段,到 Fields 中编辑字段名称、输出格式和说明。说明尽量控制在两三句话,写清应该从哪里取值、如何区分相似字段以及缺失时如何处理。例如:
invoice_number:提取供应商标注为 Invoice number 或发票号码的值,保留字母与前导零。不要提取采购订单号;找不到时留空。
total:提取当前发票的最终应付总额,区分未税合计与税额。若文件没有明确总额,不从其他金额推测。
对确实必填的字段,可使用官方帮助中介绍的 “Fail processing if field not found” 设置。它在解析结束时检查字段是否缺失,不代表已经验证金额正确、供应商合法或单据没有重复。将失败文档送入异常队列,而不是静默丢弃。
选择账户当前可用、适合样本的解析引擎。扫描 PDF、照片和需要版面理解的内容应评估视觉解析能力;机器生成且文字清晰的 PDF 可以评估文本解析。官方帮助在核实日列有引擎版本迁移提示,不要把长期流程固定在即将停用的版本上。每次切换引擎都要用保留样本重新验收。
第三步:把发票明细设置为表格字段
只有总金额的结果通常不足以进入明细台账。在 Fields 中创建 Table Field,通过 New Table 添加商品说明、数量、单价、行金额等列,再检查表格输出是否完整。
至少测试三种情况:一页内多行明细、跨页连续明细、末页带税额或合计。逐行核对是否漏行、重复表头或把页脚说明当作商品。只检查第一行和总额容易漏掉中间行错误。
区分“一张发票有多页”和“一个 PDF 包含多张发票”。后者应先拆分,或设计清楚多单据的数据结构再试点,不应默认一组 invoice_number 和 total 可以代表全部内容。对退款、贷项通知单和负数金额单独准备样本。
Parseur 同时支持 AI 和模板,但匹配到模板时会优先使用模板,否则再使用 AI。不要把它理解成每个文件先跑模板、再由 AI 自动补齐。稳定版式可以评估模板;频繁变化的文件可以另建邮箱,减少规则与 AI 的相互影响。
第四步:统一日期、金额和币种
先保存原始值,再生成标准化值,这样复核人员可以看到识别依据。发票号不要转为数字,否则 000123 可能变成 123。日期统一为 YYYY-MM-DD,但对于 07/08/2026 这样的输入,需要先确定供应商采用日/月还是月/日,不能只靠猜测。
金额处理中明确小数点与千位分隔符,避免把 1.234,56 和 1,234.56 当成同一种字符串规则。币种最好使用明确代码;$ 可能对应多种货币,缺少上下文时应要求确认。保留金额的正负号,贷项单据不能自动转成正数。
总额校验可以从“未税金额 + 税额与总额是否一致”开始,但要先考虑运费、折扣、预付款和舍入规则。误差阈值由财务负责人设定,并记录适用币种和单据类型。数量 × 单价与行金额不一致时也要检查折扣和含税口径,不应一律判为识别错误。
识别结果有完整字段并不等于已经通过业务验收。关键金额矛盾、币种缺失、明细数量明显异常或供应商无法匹配,都应进入人工复核。
第五步:先导出到待复核表
首次验收可以下载 CSV,再导入测试表格。为每次导出记录时间、来源文档和字段配置版本,确保发生错误时能够回溯。明细表是一行一条商品,发票主表是一行一张发票,两者通过你的来源标识或业务编号关联。
如果采用官方 Google Sheets 集成,可从 Export 选择对应方式,把提供的公式粘贴到测试表;表格字段会按明细行展开。它适合读取和同步解析结果,但公式本身不提供你需要的人工批准流程。不要把这张同步表直接当作已批准台账。
导出地址、公式和 webhook 配置可能带有访问数据所需的信息,应按内部凭据处理。限定表格共享范围,不要把包含真实发票的表发布到公开网页。删除测试数据前确认原文件、审核记录和必要的业务证据已有适当保留。
第六步:在自动化中增加校验与批准分支
通过 Make、Zapier 或自己的 webhook 接收结果时,先写入待复核队列。实际连接器名称和可用动作可能变化,按账户中当前界面配置并用测试文件验证。
推荐按以下顺序处理:
- 保存来源文档标识、接收时间和原始解析字段。
- 规范化日期、币种和金额,执行供应商主数据映射。
- 检查必填字段和金额关系,把错误原因写入队列。
- 查找已有业务去重键,标记疑似重复。
- 由审核人检查原文件并确认修正后的值。
- 仅在 review_status 变为已批准后,将数据写入正式台账。
- 保存最终记录标识与写入结果,便于重试和回查。
不要只在自动化第一次收到解析结果时判断状态,然后默认以后没有变化。复核修改应触发受控的再次检查;正式表写入失败应保留可重试状态,成功后记录结果。将失败原因区分为解析失败、校验失败、外部接口失败和额度不足,便于找到负责处理的人。
这一流程需要你在外部工具中实现分支和状态,Parseur 的普通导出不会自动拥有这些控制。
第七步:设计重复检测和重试规则
文件名和邮件主题不适合作为唯一去重依据。供应商可能重发同一发票,收件人也可能把文件改名后再次上传。可以从“内部供应商 ID + 发票号码 + 币种”构造候选键,再根据业务补充开票年度或单据类型。
去重键必须由业务验证:不同供应商可能使用相同发票号码,同一供应商的不同年度也可能重新编号。发现冲突时先标记疑似重复并比对原件,不要立刻删除一份。
source_document_id 用于定位某次上传,同一业务发票重新上传可能得到另一个来源标识,因此它不能替代业务去重键。另一方面,对同一导出或 webhook 重试,应保证正式表不会重复新增行。可以在写入前查询已记录的结果标识,并在成功写入后保存映射;并发和重试仍需由你的自动化或数据库控制。
第八步:用验收表判断是否可以上线
把正确答案和输出并排比较,记录每份文件的关键字段、完整明细行数、金额一致性、重复状态和人工处理时间。
| 测试样本 | 必须检查的结果 |
|---|---|
| 正常清晰 PDF | 发票号、日期、币种、总额均正确 |
| 跨页明细 | 无漏行、无重复行,页脚不混入明细 |
| 低清扫描件 | 错误有明确复核入口,不能仅看是否处理成功 |
| 缺少币种或关键号码 | 留空或失败,未进入正式表 |
| 同一发票重复转发 | 标记重复,正式表无重复写入 |
| 贷项或折扣单据 | 正负号、税额和折扣口径正确 |
| 接口失败后重试 | 可恢复且保留日志,不重复创建正式记录 |
分开统计关键字段正确率、整张单据完全正确率和每份人工复核分钟数。上线门槛由负责业务的人批准;不要用一个总体 OCR 百分比掩盖关键金额错误。新供应商、新布局或引擎升级后,重新运行这组样本。
常见问题如何排查
**上传后结果没有按最新 AI 字段变化:**检查文件是否匹配了已有模板,核对字段配置后重处理代表样本。不要连续改多项设置,否则难以知道哪项修正有效。
**总额正确但明细缺行:**检查 Table Field 的列说明、跨页布局和是否混有多张发票。视觉引擎可以作为候选方案,但仍需逐行核对,不能保证自动解决所有扫描质量问题。
**表格看似同步但正式台账没有更新:**分别检查导出、待复核状态和最终写入动作。普通读取公式与批准后的写入是两个步骤,业务状态没有通过时不应写入正式表。
**处理停止或成本超过预期:**检查页面额度、失败文档和重处理记录。自动化重试需要次数上限和告警,避免一份异常文件反复消耗资源。外部自动化额度和存储费用也应纳入预算。
价格与数据边界
截至 2026 年 9 月 28 日核实的 Parseur USD 月付价格:Free 为 20 页/月,Micro 为 49 美元/100 页,Starter 为 129 美元/1,000 页。计费单位是页,不是邮件或发票张数;一份五页发票不能按一页预算。税费、超额规则、年付额度分配与外部自动化费用以结账和当前官方说明为准。
Parseur 官方说明数据存储在欧盟荷兰,并提供留存设置。EU 存储不等于满足每家公司的全部采购要求:上线前仍应确认访问权限、数据处理协议、子处理方、导出访问和删除策略。官方安全说明当前并不提供 HIPAA BAA,不应向需要该协议的项目承诺符合要求。
官方参考
常见问题
- Parseur 能自动完成发票审批和付款吗?
- 本教程中的 Parseur 负责解析和导出。审批状态、金额校验、去重和最终写入需要在表格或外部工作流中实现,不应根据未经审核的识别结果直接付款。
- Google Sheets 导出公式能保证只有批准的发票进入台账吗?
- 不能。官方集成适合读取和同步解析结果。先放入测试或待复核表,再由受控流程把已批准记录写入正式台账。
- 一份 PDF 有五页,是一个还是五个额度?
- Parseur 按页计费,五页 PDF 应按五页预算。具体重处理、超额和订阅分配规则以当前官方计费说明与账户记录为准。
- 发票号相同就能判定是重复吗?
- 不能。先结合内部供应商 ID、币种及业务需要的年度或单据类型生成候选键,再比对原文件;文件名和来源文档 ID 也不能单独替代业务去重键。
- AI 配置改了,为什么输出仍像旧模板?
- Parseur 对匹配模板的文档优先使用模板,否则使用 AI。检查匹配情况后重处理样本,并分别验证规则修改与 AI 字段修改的结果。
- 扫描件识别成功后还需要核对明细吗?
- 需要。处理成功只表示得到结果,仍要检查跨页漏行、金额正负号、税额和币种。用代表样本衡量整张单据正确率和人工复核时间。