# OCR全文持久化规则(2026-07-02 Maggie明确要求) ## 核心规则 提取+校对好的合同全文**必须保存为 `<原文件名>_全文.md`**,放在原PDF同目录下(Nextcloud对应校区文件夹)。 ## 目的 后续任何任务(起草函件、查条款、更新汇总表、模版比对)直接 read_file 秒读,避免重复15-20分钟的Vision/OCR工作。 ## 触发时机 每次对扫描件PDF进行OCR/Vision全文提取后,在完成主任务之前,先保存全文md文件。 ## 文件位置示例 ``` 世茂/青少/世茂新租赁合同.pdf ← 原文件 世茂/青少/世茂新租赁合同_全文.md ← 持久化的提取结果 世茂/青少/世茂物业合同.pdf 世茂/青少/世茂物业合同_全文.md 世茂/高中/3023新东方租赁合同-双签版.pdf 世茂/高中/3023新东方租赁合同-双签版_全文.md ``` ## 格式 ```markdown # [文档标题] 全文 (提取方式:Vision校对 / OCR提取,来源:filename.pdf,提取日期:YYYY-MM-DD) --- 第1页 --- [page content] --- 第2页 --- [page content] ... ``` ## 质量优先级 1. **Vision逐页提取**(最佳):delegate_task → vision_analyze每页 → 合并保存 2. **ocrmypdf**(次选):`ocrmypdf --force-ocr -l chi_sim+eng` → pymupdf提取 3. 不接受:仅靠tesseract raw(中文法律文本乱码率太高) ## 操作步骤 1. Vision/OCR提取完成后,写入 `/tmp/` 临时文件 2. `sudo cp /tmp/file.md /home/maggie/nextcloud/data/data/admin/files/...` 3. `sudo chown www-data:www-data ` 4. `sudo docker exec -u www-data nextcloud-nextcloud-1 php occ files:scan --path=` ## 与汇总表的关系 - 汇总表(`*-梳理-*.xlsx`)是**结构化审查结果**(12列) - 全文md是**原始文本存档**(逐页) - 两者互补:汇总表用于快速查信息,全文md用于精确引用条款原文 - 后续新增校区开工时,先检查是否已有全文md,有则直接读取不必重跑Vision