从 PDF 提取文字
把 PDF 中的文字提取为纯文本,可直接复制或下载为 txt 文件。
将 PDF 文件拖到此处,或点击选择
文件直接在浏览器中处理,不会上传到任何服务器
什么是从 PDF 提取文字?
从 PDF 中取出文字,常用于摘引一段话放进别的文档、统计字数,或只是想在长文档里快速检索。在 PDF 阅读软件里选中复制,遇到多栏排版往往会乱成一团;本工具直接读取文件里的文字层,因此顺序更完整。
使用前有一点必须先弄清:PDF 分为截然不同的两类。第一类由软件导出,内部带有真正的文字层——这类可以完整取出。第二类是扫描件,每一页只是一张纸的照片,内部根本没有文字。对于第二类,任何提取工具都只会返回空白,而本工具会明确告知,而不是让您以为自己操作错了。
两个小选项值得留意。保留换行适合诗歌、合同和表格——这些内容里断行的位置是有含义的。关掉它则每页会变成连贯的段落,读散文时更顺,粘贴到其他软件里也更方便。
页码标记会在页与页之间插入一行标注,需要回溯核对原文档时非常有用。
使用方法
- 选择 PDF 文件。
- 根据文档类型决定是否保留换行。
- 如果需要回溯核对原件,打开页码标记。
- 点击提取文字。
- 直接复制结果,或下载为 txt 文件。
常见问题
为什么结果是空的?
几乎可以肯定这是扫描件:每一页只是图像,内部没有可提取的文字。要取得文字必须先做图像文字识别,那需要几十兆的模型,因此本站不在浏览器中提供。
多栏文档为什么顺序错乱?
因为 PDF 内部并不保存栏的概念,只保存每段文字在页面上的位置。工具按文件中记录的顺序读取,而这个顺序由生成文件的软件决定。排版复杂时有时需要手动整理。
中文和带音调的文字能正确取出吗?
可以,只要文件使用标准字体和 Unicode 编码,也就是如今绝大多数文件。少数很老的文件使用私有编码,可能出现乱码,那是文件本身的问题而非工具的问题。
我的文件会被上传吗?
不会。读取由浏览器自身的 PDF 引擎在您的机器上完成。您可以在页面加载完成后断开网络来验证——工具依然正常工作。