Files

48 lines
1.7 KiB
Markdown

# OCR乱码检测与核实流程(凤凰文化0701教训固化)
## 背景教训
凤凰文化广场合同第十条10.2,OCR把:
> "提出合同解除的一方,同时应向对方承担初年年租金的【20】%作为违约金。租赁租金及其他费用结算至合同解除日。"
读成了乱码:
> "oe方,同Se【2024】年【10】月【15】日结算至合同解除日"
由于只对8.4-8.9做了vision核实,跳过了10.2的乱码段,导致:
- 整段违约金条款丢失
- 审查结论错误("无违约金"→实际"有20%违约金")
- 返工
## 强制流程
```
Step 1 OCR完成
python3 scripts/ocr-garble-detect.py <file.md>
🔴 高危乱码(无意义英文片段/中英混杂碎片)
→ 定位PDF页码(line number / 每页约50行估算)
→ vision精读对应页面
→ 记录修正内容
→ 修改OCR文本或建修正说明文件
🟡 疑似乱码(中文占比低/异常符号)
→ 区分:纯数字表格=正常;邮箱/账号=正常
→ 真正乱码→同上vision核实
全部消灭 → 进入 Step 2
```
## 关键判断:哪些看似正常实则是乱码
| 表象 | 陷阱 | 正确做法 |
|------|------|----------|
| "Se【2024】年【10】月【15】日" | 看似日期,实则是违约金条款乱码 | 发现中英混杂+不合语境→必须vision |
| "0.4 a/R 元/㎡/月" | 看似单位,"a/R"是"天"的乱码 | 金额/单位附近乱码→vision确认单位 |
| "oe方,同" | 短乱码容易被跳过 | 即使只有几个字符异常也必须核实上下文完整段落 |
## 核心原则
**不是"看哪里乱就修哪里",而是脚本扫全文自动标红,强制逐条过一遍。**
选择性核实 = 选择性遗漏 = 必然返工。