跳到主要内容

PDF 转 HTML 转换器

要把 PDF 转换成 HTML,请上传文件并选择 HTML 作为输出。我们的服务器会重现每一页,把每一行文字放在原来的位置,并把图片直接嵌入文件。得到的是一个 .html 文件,在浏览器中看起来与 PDF 十分相似,但它是按位置排布的文字,而不是干净的语义化标记。

  • 免费,无需注册
  • 文件在 30 分钟内删除
  • 最大 100 MB

文件会在 30 分钟内从我们的服务器永久删除。

如何将 PDF 转换为 HTML

  1. 上传 PDF 文件

    将 PDF 文件拖到上传区域,或点击选择文件(最大 100 MB)。

  2. 保持 HTML 为目标格式

    菜单中已默认选中 HTML;如有需要,也可以选择其他格式。

  3. 转换并下载

    点击“转换”,转换后的文件会自动开始下载。

哪些内容会被保留?

保留

  • 每行文字的位置和外观
  • 字号和颜色
  • 内嵌图片,以 base64 形式保存在文件内部

有变化

  • 每一行文字都会变成一个单独的绝对定位元素

不会带入

  • 标题、列表和表格等语义结构
  • 在小屏幕上的响应式版式

适用场景

把 PDF 发布为网页

如果您希望通知、传单或简短的报告在网站或内网上像普通页面一样打开,单个 HTML 文件就不再需要 PDF 阅读器,并且可以像其他页面一样上传。

让 PDF 中的文字可以在浏览器中搜索

HTML 输出中的文字是真正的文字,而不是图片,访问者可以搜索、选中,并使用浏览器内置的翻译功能。这在快速阅读或在线分享 PDF 内容时很方便。

需要了解的限制

  • 这样的标记不适合编辑,也不适合当作干净的 HTML 复用。
  • 扫描版 PDF 不支持 OCR。
  • 加密的 PDF 会被拒绝。

关于这些格式

什么是 PDF?

PDF(Portable Document Format,便携式文档格式)是由 Adobe 创建、并被标准化为 ISO 32000 的固定版式文档格式。每一段文字、每一张图片和每一条线都连同它在页面上的位置一起保存,因此 PDF 在任何设备上看起来都一样,打印效果也稳定可靠。代价是不便编辑:PDF 保存的是页面上的位置,而不是段落和表格。扫描版 PDF 只包含页面图像,必须先经过 OCR(光学字符识别)才能提取文字。

什么是 HTML?

HTML(HyperText Markup Language,超文本标记语言)是编写网页所使用的标记语言。标题、段落、列表、表格、链接和图片都通过标签来定义,外观则由 CSS 控制。.html 文件无需额外软件即可在任何网络浏览器中打开,并且会根据屏幕宽度自动重排,而不是使用固定的页面。外部样式表、网页字体和远程图片属于独立的资源,除非已嵌入文件之中,否则不会随文件一起保存。

常见问题

生成的 HTML 干净、可编辑吗?

不太行。为了还原 PDF 的外观,每一行都被放在固定位置上,也不会生成标题、列表或表格标签。用于查看没有问题,但编辑起来很麻烦。若要得到干净、可复用的内容,请改为把 PDF 转换成 Markdown 或 Word。

图片会保存在单独的文件夹里吗?

不会。图片以 base64 数据的形式嵌入 HTML 文件,所以您只需下载一个 .html 文件,不必在旁边再保存一个配套的文件夹。对于图片很多的 PDF,这会让文件明显比原文件大。

页面在手机上显示正常吗?

页面会保持原 PDF 的固定宽度,因此在窄屏幕上读者可能需要左右滚动。输出并不是响应式网页设计。如果内容要在手机上阅读,请把它提取为 Markdown,再放进您自己的页面模板。

PDF 转 HTML 免费吗?

是的,完全免费。无需账号、订阅,也没有水印,只需上传文件并转换即可。

我的文件安全吗?什么时候会被删除?

您的文件通过 HTTPS 传输,并以随机代码存放在我们的服务器上。上传的文件和输出文件会在 30 分钟内被永久删除,且下载链接只对持有您唯一代码的人有效。