← 返回 PDF 转 Word

Reproducible benchmark · 2026-08-28 snapshot

PDF 转 Word 能保留什么?

这是一组可下载、可重建、可由固定回归验证的结构基准。它验证可编辑表格、合并表头和独立图片与表格的阅读顺序,不是像素级视觉相似度或“1:1 原样还原”评分。

3 个 synthetic PDF公开生成脚本与 SHA-256浏览器本地转换

这个基准测什么

PDF 是固定版面,Word 是可重排文档。DocBig 当前 PDF→Word 的优先目标是让文本继续可编辑,并在证据足够时恢复结构,而不是把每个坐标复制成一个看似相同但难以编辑的页面。

表格结构

完整线框表格是否重建为真正的 Word 表格,而不是一串靠空格对齐的文本。

合并语义

缺少内部边界这一几何证据能否恢复成 Word 的横向合并单元格。

阅读顺序

低文字量页面里的独立内容图,是否仍位于正确段落和表格之间。

可复现性

输入 PDF、生成脚本和 SHA-256 同时公开;固定回归直接检查生成 DOCX 的 Open XML 结构。

隐私边界:本页只发布 DocBig 仓库内程序生成的 synthetic fixture。真实客户合同、发票、验收报告、简历和个人文档不进入公开 benchmark。

3 个固定 synthetic 样本

每个样本都有两份可下载证据:输入 PDF,以及生成该 PDF 的 Python 脚本。构建过程还会发布 manifest.json,记录文件大小、SHA-256 和对应回归合同。

样本自动化合同复现材料
完整线框三行表格
bordered-three-row-table
唯一 1 个 Word 表格;3 行;关键服务名与金额保持在表格内。 下载 PDF
查看生成脚本
合并表头
merged-header-table
至少 1 个 Word 表格、至少 3 行;横向两列合并的 w:gridSpan val=2 恰好 1 次。 下载 PDF
查看生成脚本
图片 → 表格 → 段落顺序
image-before-table-order
1 个 drawing、1 个 Word 表格、4 行;引导段 → 图片 → 表格 → 尾段顺序不变。 下载 PDF
查看生成脚本

如何复现

  1. 下载上面任一 synthetic PDF;也可以用同一行的 Python 脚本重新生成测试件。
  2. 打开 DocBig PDF 转 Word,在浏览器本地完成转换并下载 DOCX。
  3. 人工可以直接检查 Word 中的文本、表格和顺序;仓库固定回归则进一步解包 DOCX,直接检查 w:tblw:trw:gridSpanw:drawing 等 Open XML 结构。
  4. manifest.json 对照输入文件 SHA-256,确认使用的是本页同一版本的 fixture。

这套方法的好处是“通过”有明确机器合同:不是只看一张 Before / After 截图,也不是凭主观印象说“看起来差不多”。

2026-08-28 发布快照

本页创建时,DocBig 正式构建中的 PDF→Word fixed regression 为 232 / 232 tests passed。本页只公开其中 3 个完全 synthetic、适合外部复现的结构样本;其余测试还覆盖旋转、无框表格、负样本、图片筛选、错误契约和性能等内部回归场景。

运行时基础版本包括 pdfjs-dist 5.7.284。未来引擎或 fixture 发生变化时,公开资产的 SHA-256、manifest 和发布校验必须同步更新,否则构建会 fail closed。

这个基准不证明什么

  • 不证明像素级视觉一致。字体替代、行宽和 Word 重排都可能改变换行、间距和分页。
  • 不证明所有表格都能恢复。复杂嵌套、证据不足的边框、位置敏感布局可能保守降级为段落。
  • 不证明扫描 PDF 可直接转 Word。当前 PDF→Word 面向有可提取文字层的文本型 PDF;扫描件需要 OCR 工作流。
  • 不承诺浮动对象和精确坐标。三张以上图片、装饰层、密集图文页和复杂浮动版式仍可能丢失或改变位置。
  • 不把 3 个公开样本当成总体“成功率”。它们是固定结构合同,用来说明“什么证据当前可以稳定验证”,不是现实世界全部 PDF 的统计抽样。

如果你的目标是继续编辑正文、普通表格和基础结构,可以先用 PDF 转 Word 尝试;如果目标是像桌面排版软件一样复刻复杂页面,应在下载后逐页人工复核。