2.0 KiB
2.0 KiB
OCR全文持久化规则(2026-07-02 Maggie明确要求)
核心规则
提取+校对好的合同全文必须保存为 <原文件名>_全文.md,放在原PDF同目录下(Nextcloud对应校区文件夹)。
目的
后续任何任务(起草函件、查条款、更新汇总表、模版比对)直接 read_file 秒读,避免重复15-20分钟的Vision/OCR工作。
触发时机
每次对扫描件PDF进行OCR/Vision全文提取后,在完成主任务之前,先保存全文md文件。
文件位置示例
世茂/青少/世茂新租赁合同.pdf ← 原文件
世茂/青少/世茂新租赁合同_全文.md ← 持久化的提取结果
世茂/青少/世茂物业合同.pdf
世茂/青少/世茂物业合同_全文.md
世茂/高中/3023新东方租赁合同-双签版.pdf
世茂/高中/3023新东方租赁合同-双签版_全文.md
格式
# [文档标题] 全文
(提取方式:Vision校对 / OCR提取,来源:filename.pdf,提取日期:YYYY-MM-DD)
--- 第1页 ---
[page content]
--- 第2页 ---
[page content]
...
质量优先级
- Vision逐页提取(最佳):delegate_task → vision_analyze每页 → 合并保存
- ocrmypdf(次选):
ocrmypdf --force-ocr -l chi_sim+eng→ pymupdf提取 - 不接受:仅靠tesseract raw(中文法律文本乱码率太高)
操作步骤
- Vision/OCR提取完成后,写入
/tmp/临时文件 sudo cp /tmp/file.md /home/maggie/nextcloud/data/data/admin/files/...sudo chown www-data:www-data <target>sudo docker exec -u www-data nextcloud-nextcloud-1 php occ files:scan --path=<path>
与汇总表的关系
- 汇总表(
*-梳理-*.xlsx)是结构化审查结果(12列) - 全文md是原始文本存档(逐页)
- 两者互补:汇总表用于快速查信息,全文md用于精确引用条款原文
- 后续新增校区开工时,先检查是否已有全文md,有则直接读取不必重跑Vision