54 lines
2.0 KiB
Markdown
54 lines
2.0 KiB
Markdown
# OCR全文持久化规则(2026-07-02 Maggie明确要求)
|
|
|
|
## 核心规则
|
|
提取+校对好的合同全文**必须保存为 `<原文件名>_全文.md`**,放在原PDF同目录下(Nextcloud对应校区文件夹)。
|
|
|
|
## 目的
|
|
后续任何任务(起草函件、查条款、更新汇总表、模版比对)直接 read_file 秒读,避免重复15-20分钟的Vision/OCR工作。
|
|
|
|
## 触发时机
|
|
每次对扫描件PDF进行OCR/Vision全文提取后,在完成主任务之前,先保存全文md文件。
|
|
|
|
## 文件位置示例
|
|
```
|
|
世茂/青少/世茂新租赁合同.pdf ← 原文件
|
|
世茂/青少/世茂新租赁合同_全文.md ← 持久化的提取结果
|
|
世茂/青少/世茂物业合同.pdf
|
|
世茂/青少/世茂物业合同_全文.md
|
|
世茂/高中/3023新东方租赁合同-双签版.pdf
|
|
世茂/高中/3023新东方租赁合同-双签版_全文.md
|
|
```
|
|
|
|
## 格式
|
|
```markdown
|
|
# [文档标题] 全文
|
|
|
|
(提取方式:Vision校对 / OCR提取,来源:filename.pdf,提取日期:YYYY-MM-DD)
|
|
|
|
--- 第1页 ---
|
|
|
|
[page content]
|
|
|
|
--- 第2页 ---
|
|
|
|
[page content]
|
|
...
|
|
```
|
|
|
|
## 质量优先级
|
|
1. **Vision逐页提取**(最佳):delegate_task → vision_analyze每页 → 合并保存
|
|
2. **ocrmypdf**(次选):`ocrmypdf --force-ocr -l chi_sim+eng` → pymupdf提取
|
|
3. 不接受:仅靠tesseract raw(中文法律文本乱码率太高)
|
|
|
|
## 操作步骤
|
|
1. Vision/OCR提取完成后,写入 `/tmp/` 临时文件
|
|
2. `sudo cp /tmp/file.md /home/maggie/nextcloud/data/data/admin/files/...`
|
|
3. `sudo chown www-data:www-data <target>`
|
|
4. `sudo docker exec -u www-data nextcloud-nextcloud-1 php occ files:scan --path=<path>`
|
|
|
|
## 与汇总表的关系
|
|
- 汇总表(`*-梳理-*.xlsx`)是**结构化审查结果**(12列)
|
|
- 全文md是**原始文本存档**(逐页)
|
|
- 两者互补:汇总表用于快速查信息,全文md用于精确引用条款原文
|
|
- 后续新增校区开工时,先检查是否已有全文md,有则直接读取不必重跑Vision
|