mirror of
https://git.openapi.site/https://github.com/desirecore/market.git
synced 2026-09-07 03:03:40 +08:00
PDF 的文本层顺序由生成它的开票系统决定,不保证等于版面阅读顺序。部分模板会把 「两栏的全部标签」连续输出完,再输出「两栏的全部取值」,按「标签后紧跟的下一段 文字」配对会把字段标签本身当成取值——一次真实批量整理里,某网约车平台开具的两张 「旅客运输服务」数电票的 sellerName 被抽成了字面的「统一社会信用代码/纳税人识别号:」。 新增「名称字段的标签污染防护(PDF 文本层)」一节:名称等于或主要由已知字段标签 组成时判定为提取失败,先在同页重新定位、再退到整页视觉阅读,仍不能确定则按技能 既定的「抽不齐必填字段就隔离」处理,不得从主题/文件名/相邻税号猜公司名。 明确标注这条只针对 PDF 文本层:OFD 页面文本按坐标重建阅读顺序、模板标签与取值 已合并到同一行,结构化来源更不依赖文本顺序,均不受此问题影响,OFD 章节未改动。