Files

1.5 KiB

Step 1 跳过策略——复用已有OCR全文

适用条件

当合同文件夹中已存在 _全文.md_全文_OCR.md 文件时,Step 1 可以跳过OCR提取。

前提

  • MD文件确实是从对应PDF提取的(检查文件头注释/来源标注)
  • 文件修改日期不早于PDF修改日期(排除旧版本残留)

仍然必做

即使跳过OCR提取,以下步骤不能跳过

  1. Copy到工作目录sudo docker exec cat ... > /tmp/<workdir>/
  2. 跑 ocr-garble-detect.py:扫全文乱码
  3. 高危行 vision 核实
    • TOC页(目录页)的乱码可以标记为"非实质"忽略
    • 附件表格(租金/面积/保证金)的乱码必须核实
    • 核心条款(维修/违约/解除)的乱码必须核实
  4. 关键财务数据交叉验证
    • 单价 × 面积 = 月租总额?
    • 不含税 × 税率 = 税金?
    • 保底租金 × 月数 ≈ 保证金?

实例

世茂校区(2026-07-02):4份合同MD文件都已存在,直接复用。garble检测结果:

  • 世茂新租赁:15处高危(主要在TOC+附件表格),vision确认核心条款完整
  • 世茂物业青少:6处高危
  • 高中租赁:18处高危
  • 高中物业:2处高危

关键发现:附件三(租金表)的OCR乱码虽然触发高危,但数字部分清晰可读,经vision确认后可进入Step 2。

时间节省

跳过OCR约节省15-30分钟/份(扫描件OCR+后台处理时间)。4份合同合计节省约1-2小时。