银行流水解析准确率报告

面向采购与尽调场景的对外版指标摘要。完整评测集与复现脚本见仓库 python/finance_doc_demo/eval/

测试集构成

当前离线评测集共 12 份脱敏样本,覆盖工商银行、建设银行、招商银行等版式;含文本型流水、表格导出、手机银行/扫描截图、支付宝与微信账单截图,以及已知造假对照样本。

核心指标(按输入类型分档)

不报单一笼统数字;下表为各档在评测集上的平均表现。

输入类型 样本数 交易条数召回率 金额精确匹配率 日期准确率 勾稽通过率
ocr_fuzzy675.4%100.0%100.0%16.7%
扫描件 / 手机截图125.0%100.0%100.0%0.0%
表格导出 / 文本型流水5100.0%100.0%100.0%80.0%

全量加权汇总:交易召回 81.4%、金额匹配 100.0%、 勾稽通过 41.7%、造假检出 100.0%。

已知局限

失败或低置信时:保留已解析片段、标红勾稽异常,并提示上传更清晰原件或表格导出件;不会静默输出「全绿」误导结论。

复现与自带样本验证

  1. 在仓库根目录进入 python/finance_doc_demo,安装依赖后执行 PYTHONPATH=. python3 -m eval --check-baseline 对比基线。
  2. 可将脱敏后的流水放入 eval/cases/<your_case>/ 并附 expected.json,运行同一命令生成对比报告。
  3. 试用环境支持上传 1 份自有脱敏样本在线体验(匿名结果 24 小时后自动删除);商务对接后可安排私有化评测。

基线文件:python/finance_doc_demo/eval/baseline.json。本 HTML 由 eval/public_report.py 生成,应与基线同步更新。