Files

1.7 KiB

OCR乱码检测与核实流程(凤凰文化0701教训固化)

背景教训

凤凰文化广场合同第十条10.2,OCR把:

"提出合同解除的一方,同时应向对方承担初年年租金的【20】%作为违约金。租赁租金及其他费用结算至合同解除日。"

读成了乱码:

"oe方,同Se【2024】年【10】月【15】日结算至合同解除日"

由于只对8.4-8.9做了vision核实,跳过了10.2的乱码段,导致:

  • 整段违约金条款丢失
  • 审查结论错误("无违约金"→实际"有20%违约金")
  • 返工

强制流程

Step 1 OCR完成
    ↓
python3 scripts/ocr-garble-detect.py <file.md>
    ↓
🔴 高危乱码(无意义英文片段/中英混杂碎片)
    → 定位PDF页码(line number / 每页约50行估算)
    → vision精读对应页面
    → 记录修正内容
    → 修改OCR文本或建修正说明文件
    ↓
🟡 疑似乱码(中文占比低/异常符号)
    → 区分:纯数字表格=正常;邮箱/账号=正常
    → 真正乱码→同上vision核实
    ↓
全部消灭 → 进入 Step 2

关键判断:哪些看似正常实则是乱码

表象 陷阱 正确做法
"Se【2024】年【10】月【15】日" 看似日期,实则是违约金条款乱码 发现中英混杂+不合语境→必须vision
"0.4 a/R 元/㎡/月" 看似单位,"a/R"是"天"的乱码 金额/单位附近乱码→vision确认单位
"oe方,同" 短乱码容易被跳过 即使只有几个字符异常也必须核实上下文完整段落

核心原则

不是"看哪里乱就修哪里",而是脚本扫全文自动标红,强制逐条过一遍。 选择性核实 = 选择性遗漏 = 必然返工。