这款工具做不到的事
它只把图片变成文字,不会保留原始版式,其中一项功能还会与外部服务通信。
只能得到纯文本
得到的是一份纯文本文件,不是底层带扫描图的可搜索 PDF,也不是 Word 文档。像 OCRmyPDF 这样的桌面工具,才会把识别出的文字重新写回原始文件。
版式不会保留
多栏内容常常会混在一起,表格会丢失单元格结构,变成一串数字。版式复杂的页面事后通常需要手动整理。
翻译会把内容发到设备之外
打开文件、绘制页面和运行 OCR 都在本机完成。点击“翻译文字”会在弹出确认提示后,把识别出的文字发送给 MyMemory 的 API 进行翻译。涉及保密内容时请避免点击此按钮。
不支持手写体
Tesseract 是用印刷体文字训练的,识别手写体潦草字迹时会给出看似可信、实则错误的文字。
识别准确度取决于扫描质量
分辨率低、光线不均、照片倾斜或歪斜,都会降低准确度。平整、方正、光线均匀的扫描件识别效果最好。
英语有捷径,其他语言没有
文字层检查只在语言选择英语时才会进行。选择其他 OCR 语言时,工具总会先把页面绘制成图片再运行识别,即使这份 PDF 本来就有可选中的文字。
相关 PDF 工具
常见问题
文件本身不会被上传。读取文件、绘制页面和运行 OCR,都在这个标签页中通过 Tesseract.js 和 PDF.js 完成。唯一的例外是“翻译文字”按钮,使用它时会把识别出的文字(而不是文件)发送给一个外部翻译服务。
只会发送结果框中当前的文字,并按不到 500 个字符一段拆分,通过网络发送给 MyMemory 的公共翻译 API。每个页面首次使用时都会先请您确认。您的 PDF 或图片本身,从来不会包含在这个请求中。
如果您把语言保留为英语,且文件是 PDF,工具会先检查文件中是否已带有文字层,例如 Word 导出的文件,或者已经做过 OCR 的 PDF 就带有这种文字层。文字足够多时,会直接返回结果,完全跳过 OCR。选择其他语言时,则总会运行完整的识别流程。
不能。结果只是纯文本,显示在文本框中,也可以下载为 .txt 文件。想把文字重新做成 PDF,可以使用文本转 PDF;如果想保留原始扫描件并额外加上一层隐藏文字,桌面工具会更合适。
识别是按块从左到右读取的,所以多栏页面和表格常常会被重新排序,或者变成一串数字。分辨率低、光线不均、照片倾斜、字号过小或手写体,也都会降低准确度。
您的文件基本上留在您的设备上
Tesseract.js 和 PDF.js 在这个标签页中运行,用来读取文件并识别其中的文字,文件本身不会被上传。如果您点击“翻译文字”,在您确认后,识别出的文字(而不是文件)会被发送给 MyMemory 的翻译 API。