Files
hermes-skills/skills/legal/contract-portfolio-analysis/references/credit-code-verification.md
T

2.4 KiB

统一社会信用代码 OCR 核实配方

适用场景

合同首页甲乙方统一社会信用代码 OCR 乱码(如 "MA INAEBX26" 应为 "MA1NAEBX26"),需要核实正确值。

核实步骤

1. tesseract 重读首页

# 渲染首页 200 DPI
python3 -c "
import fitz
doc = fitz.open('合同.pdf')
page = doc[0]
mat = fitz.Matrix(200/72, 200/72)
pix = page.get_pixmap(matrix=mat)
pix.save('page1.png')
"

# 裁剪公司名+信用代码区域(通常页面 15-30% 高度)
python3 -c "
from PIL import Image
img = Image.open('page1.png')
w, h = img.size
crop = img.crop((0, int(h*0.15), w, int(h*0.30)))
crop.save('page1_credit.jpg', 'JPEG', quality=75)
"

# tesseract 读取
tesseract page1_credit.jpg stdout -l chi_sim+eng --psm 6

2. 企查查 web 搜索交叉验证

web_search: "公司全称" 统一社会信用代码 企查查

企查查结果通常直接显示完整 18 位信用代码。

3. 校验位验证(Python)

统一社会信用代码第 18 位是校验位,可用以下脚本验证:

def verify_credit_code(code):
    if len(code) != 18:
        return False
    weights = [1,3,9,27,19,26,16,17,20,29,25,13,8,24,10,30,28]
    chars = '0123456789ABCDEFGHJKLMNPQRTUWXY'
    code_map = {c:i for i,c in enumerate(chars)}
    total = sum(code_map[code[i]] * weights[i] for i in range(17))
    check = 31 - (total % 31)
    if check == 31: check = 0
    expected = chars[check] if check < len(chars) else '?'
    return expected == code[17], expected, code[17]

OCR 常见误识模式

  • MA1NAEBX26MA INAEBX26(数字0被识别为空格)
  • MADQRFT66PMADQRFT66P(通常正确,但需验证末位校验位)
  • 数字 0 和字母 O 混淆
  • 数字 1 和字母 I 混淆

判据

  • tesseract 重读结果与企查查一致 → 采用
  • tesseract 重读结果与企查查不一致 → 以企查查为准(企查查是权威工商数据源)
  • 校验位验证不通过 → OCR 有误,回企查查取正确值

与 OCR 完整性检查脚本的关系

ocr-integrity-check.py 已修复:信用代码中的字母序列(前后有数字的)不再误报为"公司名乱码"。修复方式:检测字母序列前后是否为数字,如是则跳过。

2026-06-29 实证

  • 解放中路:甲方 "91320600MA1NAEBX26"(企查查确认)
  • 通大附:甲方 "91320600MA1NAEBX26"(企查查确认)
  • 通大附:乙方 "91320602MADQRFT66P"(校验位 P 验证通过)