feat: export core Hermes skills

This commit is contained in:
2026-07-15 02:45:56 +00:00
parent a028b63eda
commit 54711fee2a
308 changed files with 41310 additions and 1 deletions
@@ -0,0 +1,34 @@
# Step 1 跳过策略——复用已有OCR全文
## 适用条件
当合同文件夹中已存在 `_全文.md``_全文_OCR.md` 文件时,Step 1 可以跳过OCR提取。
## 前提
- MD文件确实是从对应PDF提取的(检查文件头注释/来源标注)
- 文件修改日期不早于PDF修改日期(排除旧版本残留)
## 仍然必做
即使跳过OCR提取,以下步骤**不能跳过**:
1. **Copy到工作目录**`sudo docker exec cat ... > /tmp/<workdir>/`
2. **跑 ocr-garble-detect.py**:扫全文乱码
3. **高危行 vision 核实**
- TOC页(目录页)的乱码可以标记为"非实质"忽略
- 附件表格(租金/面积/保证金)的乱码必须核实
- 核心条款(维修/违约/解除)的乱码必须核实
4. **关键财务数据交叉验证**
- 单价 × 面积 = 月租总额?
- 不含税 × 税率 = 税金?
- 保底租金 × 月数 ≈ 保证金?
## 实例
世茂校区(2026-07-02):4份合同MD文件都已存在,直接复用。garble检测结果:
- 世茂新租赁:15处高危(主要在TOC+附件表格),vision确认核心条款完整
- 世茂物业青少:6处高危
- 高中租赁:18处高危
- 高中物业:2处高危
关键发现:附件三(租金表)的OCR乱码虽然触发高危,但数字部分清晰可读,经vision确认后可进入Step 2。
## 时间节省
跳过OCR约节省15-30分钟/份(扫描件OCR+后台处理时间)。4份合同合计节省约1-2小时。