feat: export core Hermes skills
This commit is contained in:
@@ -0,0 +1,47 @@
|
||||
# OCR乱码检测与核实流程(凤凰文化0701教训固化)
|
||||
|
||||
## 背景教训
|
||||
|
||||
凤凰文化广场合同第十条10.2,OCR把:
|
||||
> "提出合同解除的一方,同时应向对方承担初年年租金的【20】%作为违约金。租赁租金及其他费用结算至合同解除日。"
|
||||
|
||||
读成了乱码:
|
||||
> "oe方,同Se【2024】年【10】月【15】日结算至合同解除日"
|
||||
|
||||
由于只对8.4-8.9做了vision核实,跳过了10.2的乱码段,导致:
|
||||
- 整段违约金条款丢失
|
||||
- 审查结论错误("无违约金"→实际"有20%违约金")
|
||||
- 返工
|
||||
|
||||
## 强制流程
|
||||
|
||||
```
|
||||
Step 1 OCR完成
|
||||
↓
|
||||
python3 scripts/ocr-garble-detect.py <file.md>
|
||||
↓
|
||||
🔴 高危乱码(无意义英文片段/中英混杂碎片)
|
||||
→ 定位PDF页码(line number / 每页约50行估算)
|
||||
→ vision精读对应页面
|
||||
→ 记录修正内容
|
||||
→ 修改OCR文本或建修正说明文件
|
||||
↓
|
||||
🟡 疑似乱码(中文占比低/异常符号)
|
||||
→ 区分:纯数字表格=正常;邮箱/账号=正常
|
||||
→ 真正乱码→同上vision核实
|
||||
↓
|
||||
全部消灭 → 进入 Step 2
|
||||
```
|
||||
|
||||
## 关键判断:哪些看似正常实则是乱码
|
||||
|
||||
| 表象 | 陷阱 | 正确做法 |
|
||||
|------|------|----------|
|
||||
| "Se【2024】年【10】月【15】日" | 看似日期,实则是违约金条款乱码 | 发现中英混杂+不合语境→必须vision |
|
||||
| "0.4 a/R 元/㎡/月" | 看似单位,"a/R"是"天"的乱码 | 金额/单位附近乱码→vision确认单位 |
|
||||
| "oe方,同" | 短乱码容易被跳过 | 即使只有几个字符异常也必须核实上下文完整段落 |
|
||||
|
||||
## 核心原则
|
||||
|
||||
**不是"看哪里乱就修哪里",而是脚本扫全文自动标红,强制逐条过一遍。**
|
||||
选择性核实 = 选择性遗漏 = 必然返工。
|
||||
Reference in New Issue
Block a user