PDF 转 TXT:提取 PDF 中的文字
要提取 PDF 中的文字,请上传文件并选择 TXT 作为输出。我们的服务器会读取 PDF 的文字层,把断开的行重新合并成段落,去掉所有格式,并保存为带字节顺序标记 (BOM) 的 UTF-8 .txt 文件,因此带音标和非拉丁字符都能正确显示。扫描版 PDF 没有文字层,而且不进行 OCR,所以无法提取到文字。
- 免费,无需注册
- 文件在 30 分钟内删除
- 最大 100 MB
文件会在 30 分钟内从我们的服务器永久删除。
如何将 PDF 转换为 TXT
上传 PDF 文件
将 PDF 文件拖到上传区域,或点击选择文件(最大 100 MB)。
保持 TXT 为目标格式
菜单中已默认选中 TXT;如有需要,也可以选择其他格式。
转换并下载
点击“转换”,转换后的文件会自动开始下载。
哪些内容会被保留?
保留
- 按阅读顺序排列的所有可提取文字
- 段落分隔
- Unicode 字符(带 BOM 的 UTF-8)
有变化
- 标题和列表项会变成普通的文字行
不会带入
- 粗体、斜体、颜色和字体
- 图片
- 表格结构
适用场景
把文字交给 AI 工具和脚本
当您想把 PDF 粘贴到聊天机器人、翻译服务或自己的脚本中时,没有版式干扰的干净文本文件是最可预测的输入,也能避免复制粘贴带来的多余字符。
搜索并比较文档版本
纯文本让 PDF 很容易用任何编辑器或命令行工具搜索,还能用标准的差异比较工具对比合同或报告的两个版本,准确看出改了什么。
需要了解的限制
- 不支持 OCR:扫描版 PDF 会返回输出为空的错误。
- 加密的 PDF 会被拒绝。
- 对于多栏页面,行的顺序遵循 PDF 内部的版面顺序。
关于这些格式
什么是 PDF?
PDF(Portable Document Format,便携式文档格式)是由 Adobe 创建、并被标准化为 ISO 32000 的固定版式文档格式。每一段文字、每一张图片和每一条线都连同它在页面上的位置一起保存,因此 PDF 在任何设备上看起来都一样,打印效果也稳定可靠。代价是不便编辑:PDF 保存的是页面上的位置,而不是段落和表格。扫描版 PDF 只包含页面图像,必须先经过 OCR(光学字符识别)才能提取文字。
什么是 TXT?
TXT 文件只包含字符,没有格式、图片,也没有页面版式信息。从记事本到代码编辑器,所有程序都能打开它,它是体积最小、通用性最强的文档类型。带音标符号的字符和非拉丁字符能否正确显示,取决于字符编码;如今的标准 UTF-8 几乎可以处理所有语言。纯文本非常适合用于搜索、归档,以及在不同系统之间转移内容。
常见问题
为什么我的 TXT 文件是空的,或者出现了错误?
您的 PDF 很可能是扫描件。由扫描仪或手机相机生成的 PDF 只包含页面图像,没有可选中的文字,而本服务不进行 OCR。如果无法用鼠标在 PDF 中选中文字,请先用 OCR 工具处理,再提取文字。
TXT 文件使用什么字符编码?
输出为带字节顺序标记 (BOM) 的 UTF-8。这样的组合可以让带音标的字母、ş 和 ğ 等土耳其语字符以及其他非拉丁文字,在 Windows 记事本、macOS 文本编辑和代码编辑器中都能正确显示,无需手动更改编码。
如果我想保留标题和列表怎么办?
纯文本无法保存标题、粗体或图片。如果您想要一个依然能标出标题和列表的轻量文件,请改为把 PDF 转换成 Markdown;如果需要格式完整、可以编辑的文档,请把 PDF 转换成 Word。
PDF 转 TXT 免费吗?
是的,完全免费。无需账号、订阅,也没有水印,只需上传文件并转换即可。
我的文件安全吗?什么时候会被删除?
您的文件通过 HTTPS 传输,并以随机代码存放在我们的服务器上。上传的文件和输出文件会在 30 分钟内被永久删除,且下载链接只对持有您唯一代码的人有效。