文档工具 · PDF 处理

PDF 提取文本

全文文本(保留布局)

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 59 次使用
保留布局 · 纯文本流 · 按页分段 · 本地不上传
拖入 / 点击选择 PDF

逐页提取文字图层 · 保留版面或纯文本 · 全程浏览器本地

Extracted locally — nothing uploaded
提取模式
分页
页范围
提 取 结 果
提取的文本将呈现在这里 拖入 PDF 即可逐页提取文字
隐私:PDF 的解析与文本提取全程在浏览器本地完成,原文件绝不上传服务器。仅能提取「数字版 PDF」的文本层;扫描件请先 OCR。关闭页面即清空。
就绪 · 拖入 PDF 开始提取文字
第一节

关于本工具

About

从 PDF 里复制文本,粘贴出来常常只剩一堆换行和乱码。这个工具把 PDF 的排版结构——段落、表格、分栏——还原成可编辑的纯文本,而不是简单粗暴地抽字符。后端处理,支持扫描件 OCR(Tesseract)和原生 PDF 解析,保留原文阅读顺序。适合需要批量提取合同条款、论文正文或报告摘要的办公场景。

使用场景

合同条款逐条核实

法务收到一份 80 页的 PDF 采购合同,对方只给了不可编辑的扫描件。合伙人要求逐条核对附件清单里的规格参数是否与正文一致。把 PDF 拖进工具,全文文本带布局输出,清单表格的列对齐保留,法务直接 Ctrl+F 搜索型号,10 分钟完成核对,不用对着扫描件手打。

学术论文盲审去标识

博士生投稿前需要把论文 PDF 里的作者姓名、单位、基金号全部删除,但正文里的图表标题和参考文献不能动。手动删容易漏掉页眉页脚。用本工具提取纯文本后,在 Word 里全文搜索“张三”“XX 大学”一键替换,保留的段落顺序和换行与原版一致,复审时不会因格式错乱被退修。

投标文件关键词标红

投标截止前 2 小时,商务发现标书里 30 处“工期”必须统一替换为“交付周期”,且替换后要标红高亮。PDF 无法直接批量改格式。把文件提取为文本,在编辑器中正则替换并加红色标记,再转回 PDF 提交。本工具保留了原文的段落间距和列表缩进,替换后排版不崩。

古籍整理逐字录入

出版社编辑拿到一本民国石印本的 PDF,字迹清晰但页面有虫蛀洞。OCR 工具会把缺字识别成乱码。用本工具提取文本后,编辑对照原图逐字校对,保留的换行和段首缩进与刻本一致,省去重新排版的时间。遇到缺字处直接标注缺文符号,后期排版人员能看懂原始版式。

会议纪要关键词提取

项目经理收到 3 小时会议录音转写的 PDF 纪要,60 页里混着讨论、表决、待办。需要快速摘出所有“责任人:XXX”和“截止日期:X 月 X 日”。把 PDF 扔进工具,得到纯文本后粘贴到 Excel 用公式提取,20 分钟拉出责任矩阵,比在 PDF 里逐页翻找快 5 倍。

第二节

使用指南

Getting Started

使用步骤

  1. 1上传 PDF 文件,页面顶部显示文件名与文件大小,支持多文件同时上传
  2. 2选择输出格式为「纯文本」或「带布局文本」,右侧预览区实时显示提取结果
  3. 3点击「提取」按钮,进度条从 0% 走到 100%,完成后结果区自动滚动到顶部
  4. 4在结果区选中部分或全部文本,点击「复制」按钮,提示「已复制到剪贴板」
  5. 5点击「下载」按钮,浏览器自动下载 .txt 文件,文件名与原 PDF 同名

输入输出示例

输入输出说明
这是一段包含换行的文本。 第二行内容。 第三行内容。这是一段包含换行的文本。 第二行内容。 第三行内容。常规:验证多行文本的换行符是否完整保留,不丢失行结构。
这是一段包含英文、中文、数字123和标点符号!@#的混合文本。这是一段包含英文、中文、数字123和标点符号!@#的混合文本。常规:验证多语种和特殊符号的字符完整性,不出现乱码或截断。
这是一个包含制表符 和多个空格 的文本。这是一个包含制表符 和多个空格 的文本。常规:验证空白字符(制表符、连续空格)是否原样保留,不合并或删除。
(空PDF,无任何文字)(输出为空字符串)边界:空文档处理,工具应返回空字符串而非报错或乱码。
这是一段超长文本,重复1000次“测试内容”以模拟大文件。(输出为1000次重复的“测试内容”,无截断)边界:验证大文件处理能力,不因内存限制而截断或崩溃。
这是一段包含Unicode字符的文本:😊中文日本語한국어。这是一段包含Unicode字符的文本:😊中文日本語한국어。边界:验证Emoji和多字节字符(如中文、日文、韩文)的完整保留,不出现乱码或丢失。
这是一段包含换行符、制表符和空格的混合文本: 第一行 制表符后 空格开头这是一段包含换行符、制表符和空格的混合文本: 第一行 制表符后 空格开头易错:混合空白字符(换行+制表符+空格)的布局保留,常见错误是制表符被转成空格或换行被吞。

常见错误对照

1.PDF 是扫描件,直接提取得到乱码或空文本

✗ 错误上传一个扫描版合同,点击提取后得到一堆乱码或空白
✓ 修复先确认 PDF 是否为图片型(无法选中文字),如是则需先 OCR 再提取

本工具基于文本层提取,不内置 OCR。扫描件无文本层,提取结果等于空。

2.多栏排版 PDF,提取后文字顺序错乱

✗ 错误上传双栏论文 PDF,提取结果第一段读完跳到第三段,再跳回第二段
✓ 修复提取前在工具设置中勾选「保留布局」选项(如有),或手动调整阅读顺序

PDF 文本流按物理位置排序,多栏布局会被按行切割,导致逻辑顺序混乱。

3.加密 PDF 不先解密,工具直接报错

✗ 错误上传有打开密码的 PDF,点击提取后提示「无法处理」
✓ 修复先用密码解密 PDF(如 Adobe Acrobat 或在线解密工具),再上传提取

本工具不处理加密 PDF,必须提前移除密码保护才能读取文本层。

4.提取后文本包含大量多余空格和换行

✗ 错误提取结果每行末尾都有空格,段落间空行过多,影响粘贴使用
✓ 修复提取后使用文本编辑器(如 VS Code)的替换功能,将连续空格替换为单个空格

PDF 布局引擎会为对齐插入额外空格,工具保留原始布局,不会自动清理。

5.中文 PDF 提取后出现乱码或方框

✗ 错误提取结果中「合同」显示为「合□」或「郃同」
✓ 修复确保 PDF 内嵌中文字体,或使用支持 Unicode 的 PDF 生成器重导出

PDF 未内嵌字体时,提取工具无法映射字符编码,导致乱码。

6.提取大文件时浏览器卡死或超时

✗ 错误上传 500MB 的 PDF 后,页面无响应,最终提示「提取失败」
✓ 修复将大 PDF 拆分为多个 50MB 以内的小文件分批提取

本工具在浏览器端处理(WASM),受限于浏览器内存和线程,大文件易崩溃。

7.提取后文本丢失特殊字符(如数学符号、下标)

✗ 错误PDF 中的 H₂O 提取后变成 H2O,α 变成 a
✓ 修复提取后手动校对特殊字符,或使用专业 PDF 编辑器导出为 Word 格式

PDF 文本层可能用特殊编码表示符号,通用提取工具无法正确映射所有 Unicode 字符。

8.提取结果包含隐藏文本或水印文字

✗ 错误提取结果中出现「机密」「草稿」等水印文字,干扰正文
✓ 修复提取前在 PDF 编辑器中删除水印图层,或提取后手动过滤无关文本

PDF 的水印和隐藏注释也属于文本层,工具会一并提取,无法区分主次。

第三节

工作原理

How It Works

核心公式

文本提取 = 页面对象排序 + 文本块拼接(按阅读顺序)

变量说明

  • 页面对象排序按PDF内部结构树中对象的逻辑顺序排列
  • 文本块拼接将同一行/段落的文本块按左到右、上到下合并

示例

一个PDF页面包含两个文本块:左上角(72,720)处"第一章",下方(72,680)处"引言"。工具先按坐标y值降序(720→680)排序,再按x值升序(72→72)排列,最终输出"第一章\n引言",保留原始布局。

上传 PDF支持 .pdf 格式服务端解析提取文字块保留坐标布局排序重组按阅读顺序还原段落结构纯文本输出可复制/下载格式校验去空行 / 去乱码统一换行符结果展示预览 + 一键复制
用户操作 服务端处理 逻辑处理
第五节

常见问题

Q & A
上传的 PDF 全是扫描图片,能提取出文字吗?

不能。本工具基于后端 Go 直接解析 PDF 文件内部的文本流,不包含 OCR(光学字符识别)引擎。如果 PDF 是扫描件或图片型(文字不可选中、复制),提取结果会是空或乱码。需要文字提取的扫描 PDF,建议先用 OCR 工具(如 Adobe Acrobat Pro、在线 OCR 网站)将图片转成可搜索文本后,再上传到本工具提取。

提取出来的文本顺序和 PDF 里看到的不一样,怎么回事?

PDF 内部存储文本的逻辑是按「绘制顺序」而非阅读顺序。如果原 PDF 有多栏排版、文本框嵌套、或表格,提取时可能先输出左上角一个浮动文本框,再输出右下角正文。本工具会尽量按空间位置重排(保留布局),但对复杂版式(如报纸多栏、自由文本框重叠)无法 100% 还原阅读顺序。建议提取后手动调整段落顺序。

为什么提取后有些文字连在一起,没有空格?

PDF 中每个字符的位置是独立记录的,单词间的空格可能以「偏移量」而非「空格字符」表示。本工具在重组文本时,如果检测到字符间距大于正常字距,会插入空格;但不同 PDF 生成软件(如某些老版 Word、CAD 导出)的间距规则不一致,可能导致漏加空格。遇到这种情况,可以先用「保留布局」模式尝试,或手动用文本编辑器的查找替换功能补空格。

PDF 文件超过 100MB 能提取吗?

本工具对上传文件大小有 100MB 限制,超过会拒绝处理。如果 PDF 超过 100MB,建议先用其他工具压缩(如缩小图片分辨率、删除无用页面),再上传。另外,提取结果只输出纯文本,文件大小主要影响上传耗时,处理速度取决于 PDF 页数和文本复杂度。

提取出来的文本里,表格数据全乱了,怎么处理?

PDF 本身不存储表格结构,只记录线条和文字的位置。本工具会尝试按坐标将文字分组,但对复杂表格(合并单元格、无边框表、跨页表)很难还原成行列。提取后表格数据通常是散落的文字块。建议这类需求改用专为表格提取设计的工具(如 Tabula、Camelot),或手动复制 PDF 中表格区域后粘贴到 Excel 整理。

上传的 PDF 有密码保护,能直接提取吗?

不能。本工具无法处理加密 PDF,上传后会提示「文件无法读取」。需要先用密码解锁 PDF(如使用 Adobe Acrobat 的「删除密码」功能,或在线解锁工具),再上传提取。注意:如果 PDF 只有「打开密码」而没有「编辑限制密码」,部分工具可能直接提取;但本工具出于安全考虑,对任何加密 PDF 均拒绝处理。

提取结果和我在 Word 里另存为的文本相比,哪个更准确?

如果原 PDF 是 Word/PPT 导出(非扫描),Word 另存为的文本通常更准确,因为它直接读取了文档的语义结构(段落、列表、标题)。本工具提取的是 PDF 的「物理层」文本,对复杂格式(如脚注、分栏、文本框)的还原度不如 Word 原生导出。但 Word 另存为需要安装 Office 软件,本工具在线即用,适合快速提取少量文本。

提取出来的文本里,中文和英文混排时空格特别多,能去掉吗?

这与 PDF 生成时中英文之间的间距处理有关。某些 PDF 引擎会在中英文之间插入固定宽度空格,本工具「保留布局」模式会保留这些空格。如果觉得多余,可以在提取后使用文本编辑器的正则替换(如查找 `[\u4e00-\u9fa5]\s+[a-zA-Z]` 替换为去掉中间空格),或在本工具结果区手动删除。目前工具没有内置「去多余空格」功能。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭