# Step 1 跳过策略——复用已有OCR全文 ## 适用条件 当合同文件夹中已存在 `_全文.md` 或 `_全文_OCR.md` 文件时,Step 1 可以跳过OCR提取。 ## 前提 - MD文件确实是从对应PDF提取的(检查文件头注释/来源标注) - 文件修改日期不早于PDF修改日期(排除旧版本残留) ## 仍然必做 即使跳过OCR提取,以下步骤**不能跳过**: 1. **Copy到工作目录**:`sudo docker exec cat ... > /tmp//` 2. **跑 ocr-garble-detect.py**:扫全文乱码 3. **高危行 vision 核实**: - TOC页(目录页)的乱码可以标记为"非实质"忽略 - 附件表格(租金/面积/保证金)的乱码必须核实 - 核心条款(维修/违约/解除)的乱码必须核实 4. **关键财务数据交叉验证**: - 单价 × 面积 = 月租总额? - 不含税 × 税率 = 税金? - 保底租金 × 月数 ≈ 保证金? ## 实例 世茂校区(2026-07-02):4份合同MD文件都已存在,直接复用。garble检测结果: - 世茂新租赁:15处高危(主要在TOC+附件表格),vision确认核心条款完整 - 世茂物业青少:6处高危 - 高中租赁:18处高危 - 高中物业:2处高危 关键发现:附件三(租金表)的OCR乱码虽然触发高危,但数字部分清晰可读,经vision确认后可进入Step 2。 ## 时间节省 跳过OCR约节省15-30分钟/份(扫描件OCR+后台处理时间)。4份合同合计节省约1-2小时。