按页识别
扫描 PDF 转文字
逐页识别图片型 PDF,汇总成可复制文字。
本地处理:文件不会上传到服务器
工具启动后会在当前浏览器标签页内处理文件。
当前支持
- 显示逐页进度
- 保留页面边界
- 复制或下载 TXT
处理边界
- 首发建议最多 10 页
- 首次需要加载中文识别模型
使用指南
扫描 PDF 转文字怎么用
扫描 PDF 转文字会把图片型 PDF 逐页转换成可复制文本,并保留“第 N 页”边界,适合档案、票据或扫描资料的文字提取。
这是 OCR 识别,不会恢复原来的精确排版和表格结构。首发建议一次处理不超过 10 页,并在使用前确认识别结果。
操作步骤
- 选择一个扫描 PDF,建议不超过 10 页。
- 选择识别语言并开始逐页识别。
- 检查每页结果,复制全文或下载 TXT。
常见问题
文本型 PDF 也需要使用 OCR 吗?
通常不需要。文本型 PDF 可使用 PDF 转 Word;OCR 更适合无法选中文字的扫描件。
为什么识别结果会有错字?
分辨率、倾斜、污渍、字体和版面都会影响 OCR,请务必人工复核重要内容。
处理过程中 PDF 会上传吗?
不会。PDF 页面渲染和 OCR 都在当前浏览器中执行。