Files
hermes-skills/skills/legal/contract-reviewer/references/x2t-visual-verification.md
T

3.8 KiB

x2t 视觉验证与 OOXML 文本提取

为什么用 x2t 而不是 libreoffice

Doro 使用 OnlyOffice 查看交付物。libreoffice 和 OnlyOffice 使用不同的渲染引擎,同一 docx 在两者中可能显示不同(如页数、换行位置)。x2t 是 OnlyOffice Document Server 的内置转换器,渲染结果与 Doro 看到的完全一致。

x2t 转换命令

# 1. 复制文件到 OnlyOffice 容器
docker cp /path/to/contract.docx nextcloud-onlyoffice-1:/tmp/check.docx

# 2. 创建转换任务 XML
cat > /tmp/convert_task.xml << 'XMLEOF'
<?xml version="1.0" encoding="utf-8"?>
<TaskQueueDataConvert>
  <m_sFileFrom>/tmp/check.docx</m_sFileFrom>
  <m_sFileTo>/tmp/check.pdf</m_sFileTo>
  <m_nFormatTo>513</m_nFormatTo>
  <m_sFontDir>/usr/share/fonts</m_sFontDir>
  <m_bIsNoBaseCss>false</m_bIsNoBaseCss>
</TaskQueueDataConvert>
XMLEOF

# 3. 执行转换
docker cp /tmp/convert_task.xml nextcloud-onlyoffice-1:/tmp/convert_task.xml
docker exec nextcloud-onlyoffice-1 /var/www/onlyoffice/documentserver/server/FileConverter/bin/x2t /tmp/convert_task.xml

# 4. 取回 PDF
docker cp nextcloud-onlyoffice-1:/tmp/check.pdf /tmp/contract-review/check.pdf

# 5. 转图片查看(可选)
pdftoppm -png -r 150 /tmp/contract-review/check.pdf /tmp/contract-review/page

x2t 渲染模式说明

x2t 转换时保留 track changes 标记(即"标记模式"),不会自动接受修订。这意味着:

  • 删除的文本显示为 strikethrough
  • 新增的文本显示为 underline
  • pdftotext 提取时会同时输出旧文本和新文本(因为它无法区分视觉标记)

判断方法:看到 pdftotext 输出中同时出现新旧编号(如"5.6.包装要求"),不代表合同有重复内容——这是 track changes 标记模式的正常显示。

接受修订后的文本提取(OOXML 级别)

当需要提取"接受所有修订后"的纯文本时,使用以下函数:

import zipfile
from lxml import etree

def qn(tag):
    return '{http://schemas.openxmlformats.org/wordprocessingml/2006/main}' + tag

def accept_revisions_text(p):
    """接受所有修订,返回段落纯文本"""
    result = []
    for child in p:
        tag = child.tag.split('}')[-1] if '}' in child.tag else child.tag
        if tag == 'r':
            # 跳过包含 delText 的 run(已删除文本)
            if child.find(qn('delText')) is not None:
                continue
            t = child.find(qn('t'))
            if t is not None:
                result.append(t.text or '')
        elif tag == 'del':
            continue  # 跳过整个删除元素
        elif tag == 'ins':
            # 包含插入元素中的文本
            for r in child.findall(f'.//{qn("r")}'):
                t = r.find(qn('t'))
                if t is not None:
                    result.append(t.text or '')
    return ''.join(result)

与标记模式文本提取的区别

函数 用途 输出示例
accept_revisions_text 看最终效果 "6.包装要求"
含标记的提取 看修订过程 "[DEL:5.][INS:6.]6.包装要求"
x2t pdftotext 视觉验证 "5.6.包装要求"(标记模式)

复核轮必用 accept_revisions_text:验证 editor 的修改在最终文本中是否正确,不受 track changes 标记干扰。

常见误判

  1. pdftotext 显示"重复编号":如"5.6.包装要求"——这是 DEL "5." + INS "6." 的标记模式显示,不是合同错误。用 accept_revisions_text 验证最终文本。

  2. get_text_from_element 显示重复:如果函数同时提取 INS 文本和原始文本,会导致看起来像重复。必须区分"标记模式提取"和"接受修订后提取"。

  3. x2t 转换需要容器内字体:如果 x2t 输出字体异常,检查容器内是否有中文字体(fc-list :lang=zh)。