Files
hermes-skills/skills/legal/contract-portfolio-analysis/references/ocr-persistence-rule.md
T

54 lines
2.0 KiB
Markdown

# OCR全文持久化规则(2026-07-02 Maggie明确要求)
## 核心规则
提取+校对好的合同全文**必须保存为 `<原文件名>_全文.md`**,放在原PDF同目录下(Nextcloud对应校区文件夹)。
## 目的
后续任何任务(起草函件、查条款、更新汇总表、模版比对)直接 read_file 秒读,避免重复15-20分钟的Vision/OCR工作。
## 触发时机
每次对扫描件PDF进行OCR/Vision全文提取后,在完成主任务之前,先保存全文md文件。
## 文件位置示例
```
世茂/青少/世茂新租赁合同.pdf ← 原文件
世茂/青少/世茂新租赁合同_全文.md ← 持久化的提取结果
世茂/青少/世茂物业合同.pdf
世茂/青少/世茂物业合同_全文.md
世茂/高中/3023新东方租赁合同-双签版.pdf
世茂/高中/3023新东方租赁合同-双签版_全文.md
```
## 格式
```markdown
# [文档标题] 全文
(提取方式:Vision校对 / OCR提取,来源:filename.pdf,提取日期:YYYY-MM-DD)
--- 第1页 ---
[page content]
--- 第2页 ---
[page content]
...
```
## 质量优先级
1. **Vision逐页提取**(最佳):delegate_task → vision_analyze每页 → 合并保存
2. **ocrmypdf**(次选):`ocrmypdf --force-ocr -l chi_sim+eng` → pymupdf提取
3. 不接受:仅靠tesseract raw(中文法律文本乱码率太高)
## 操作步骤
1. Vision/OCR提取完成后,写入 `/tmp/` 临时文件
2. `sudo cp /tmp/file.md /home/maggie/nextcloud/data/data/admin/files/...`
3. `sudo chown www-data:www-data <target>`
4. `sudo docker exec -u www-data nextcloud-nextcloud-1 php occ files:scan --path=<path>`
## 与汇总表的关系
- 汇总表(`*-梳理-*.xlsx`)是**结构化审查结果**(12列)
- 全文md是**原始文本存档**(逐页)
- 两者互补:汇总表用于快速查信息,全文md用于精确引用条款原文
- 后续新增校区开工时,先检查是否已有全文md,有则直接读取不必重跑Vision