1.5 KiB
1.5 KiB
Step 1 跳过策略——复用已有OCR全文
适用条件
当合同文件夹中已存在 _全文.md 或 _全文_OCR.md 文件时,Step 1 可以跳过OCR提取。
前提
- MD文件确实是从对应PDF提取的(检查文件头注释/来源标注)
- 文件修改日期不早于PDF修改日期(排除旧版本残留)
仍然必做
即使跳过OCR提取,以下步骤不能跳过:
- Copy到工作目录:
sudo docker exec cat ... > /tmp/<workdir>/ - 跑 ocr-garble-detect.py:扫全文乱码
- 高危行 vision 核实:
- TOC页(目录页)的乱码可以标记为"非实质"忽略
- 附件表格(租金/面积/保证金)的乱码必须核实
- 核心条款(维修/违约/解除)的乱码必须核实
- 关键财务数据交叉验证:
- 单价 × 面积 = 月租总额?
- 不含税 × 税率 = 税金?
- 保底租金 × 月数 ≈ 保证金?
实例
世茂校区(2026-07-02):4份合同MD文件都已存在,直接复用。garble检测结果:
- 世茂新租赁:15处高危(主要在TOC+附件表格),vision确认核心条款完整
- 世茂物业青少:6处高危
- 高中租赁:18处高危
- 高中物业:2处高危
关键发现:附件三(租金表)的OCR乱码虽然触发高危,但数字部分清晰可读,经vision确认后可进入Step 2。
时间节省
跳过OCR约节省15-30分钟/份(扫描件OCR+后台处理时间)。4份合同合计节省约1-2小时。