跳到主要内容

PDF 转 TXT:提取 PDF 中的文字

要提取 PDF 中的文字,请上传文件并选择 TXT 作为输出。我们的服务器会读取 PDF 的文字层,把断开的行重新合并成段落,去掉所有格式,并保存为带字节顺序标记 (BOM) 的 UTF-8 .txt 文件,因此带音标和非拉丁字符都能正确显示。扫描版 PDF 没有文字层,而且不进行 OCR,所以无法提取到文字。

  • 免费,无需注册
  • 文件在 30 分钟内删除
  • 最大 100 MB

文件会在 30 分钟内从我们的服务器永久删除。

如何将 PDF 转换为 TXT

  1. 上传 PDF 文件

    将 PDF 文件拖到上传区域,或点击选择文件(最大 100 MB)。

  2. 保持 TXT 为目标格式

    菜单中已默认选中 TXT;如有需要,也可以选择其他格式。

  3. 转换并下载

    点击“转换”,转换后的文件会自动开始下载。

哪些内容会被保留?

保留

  • 按阅读顺序排列的所有可提取文字
  • 段落分隔
  • Unicode 字符(带 BOM 的 UTF-8)

有变化

  • 标题和列表项会变成普通的文字行

不会带入

  • 粗体、斜体、颜色和字体
  • 图片
  • 表格结构

适用场景

把文字交给 AI 工具和脚本

当您想把 PDF 粘贴到聊天机器人、翻译服务或自己的脚本中时,没有版式干扰的干净文本文件是最可预测的输入,也能避免复制粘贴带来的多余字符。

搜索并比较文档版本

纯文本让 PDF 很容易用任何编辑器或命令行工具搜索,还能用标准的差异比较工具对比合同或报告的两个版本,准确看出改了什么。

需要了解的限制

  • 不支持 OCR:扫描版 PDF 会返回输出为空的错误。
  • 加密的 PDF 会被拒绝。
  • 对于多栏页面,行的顺序遵循 PDF 内部的版面顺序。

关于这些格式

什么是 PDF?

PDF(Portable Document Format,便携式文档格式)是由 Adobe 创建、并被标准化为 ISO 32000 的固定版式文档格式。每一段文字、每一张图片和每一条线都连同它在页面上的位置一起保存,因此 PDF 在任何设备上看起来都一样,打印效果也稳定可靠。代价是不便编辑:PDF 保存的是页面上的位置,而不是段落和表格。扫描版 PDF 只包含页面图像,必须先经过 OCR(光学字符识别)才能提取文字。

什么是 TXT?

TXT 文件只包含字符,没有格式、图片,也没有页面版式信息。从记事本到代码编辑器,所有程序都能打开它,它是体积最小、通用性最强的文档类型。带音标符号的字符和非拉丁字符能否正确显示,取决于字符编码;如今的标准 UTF-8 几乎可以处理所有语言。纯文本非常适合用于搜索、归档,以及在不同系统之间转移内容。

常见问题

为什么我的 TXT 文件是空的,或者出现了错误?

您的 PDF 很可能是扫描件。由扫描仪或手机相机生成的 PDF 只包含页面图像,没有可选中的文字,而本服务不进行 OCR。如果无法用鼠标在 PDF 中选中文字,请先用 OCR 工具处理,再提取文字。

TXT 文件使用什么字符编码?

输出为带字节顺序标记 (BOM) 的 UTF-8。这样的组合可以让带音标的字母、ş 和 ğ 等土耳其语字符以及其他非拉丁文字,在 Windows 记事本、macOS 文本编辑和代码编辑器中都能正确显示,无需手动更改编码。

如果我想保留标题和列表怎么办?

纯文本无法保存标题、粗体或图片。如果您想要一个依然能标出标题和列表的轻量文件,请改为把 PDF 转换成 Markdown;如果需要格式完整、可以编辑的文档,请把 PDF 转换成 Word。

PDF 转 TXT 免费吗?

是的,完全免费。无需账号、订阅,也没有水印,只需上传文件并转换即可。

我的文件安全吗?什么时候会被删除?

您的文件通过 HTTPS 传输,并以随机代码存放在我们的服务器上。上传的文件和输出文件会在 30 分钟内被永久删除,且下载链接只对持有您唯一代码的人有效。