# OCR乱码检测与核实流程(凤凰文化0701教训固化) ## 背景教训 凤凰文化广场合同第十条10.2,OCR把: > "提出合同解除的一方,同时应向对方承担初年年租金的【20】%作为违约金。租赁租金及其他费用结算至合同解除日。" 读成了乱码: > "oe方,同Se【2024】年【10】月【15】日结算至合同解除日" 由于只对8.4-8.9做了vision核实,跳过了10.2的乱码段,导致: - 整段违约金条款丢失 - 审查结论错误("无违约金"→实际"有20%违约金") - 返工 ## 强制流程 ``` Step 1 OCR完成 ↓ python3 scripts/ocr-garble-detect.py ↓ 🔴 高危乱码(无意义英文片段/中英混杂碎片) → 定位PDF页码(line number / 每页约50行估算) → vision精读对应页面 → 记录修正内容 → 修改OCR文本或建修正说明文件 ↓ 🟡 疑似乱码(中文占比低/异常符号) → 区分:纯数字表格=正常;邮箱/账号=正常 → 真正乱码→同上vision核实 ↓ 全部消灭 → 进入 Step 2 ``` ## 关键判断:哪些看似正常实则是乱码 | 表象 | 陷阱 | 正确做法 | |------|------|----------| | "Se【2024】年【10】月【15】日" | 看似日期,实则是违约金条款乱码 | 发现中英混杂+不合语境→必须vision | | "0.4 a/R 元/㎡/月" | 看似单位,"a/R"是"天"的乱码 | 金额/单位附近乱码→vision确认单位 | | "oe方,同" | 短乱码容易被跳过 | 即使只有几个字符异常也必须核实上下文完整段落 | ## 核心原则 **不是"看哪里乱就修哪里",而是脚本扫全文自动标红,强制逐条过一遍。** 选择性核实 = 选择性遗漏 = 必然返工。