合同条款逐条核实
法务收到一份 80 页的 PDF 采购合同,对方只给了不可编辑的扫描件。合伙人要求逐条核对附件清单里的规格参数是否与正文一致。把 PDF 拖进工具,全文文本带布局输出,清单表格的列对齐保留,法务直接 Ctrl+F 搜索型号,10 分钟完成核对,不用对着扫描件手打。
逐页提取文字图层 · 保留版面或纯文本 · 全程浏览器本地
Extracted locally — nothing uploaded从 PDF 里复制文本,粘贴出来常常只剩一堆换行和乱码。这个工具把 PDF 的排版结构——段落、表格、分栏——还原成可编辑的纯文本,而不是简单粗暴地抽字符。后端处理,支持扫描件 OCR(Tesseract)和原生 PDF 解析,保留原文阅读顺序。适合需要批量提取合同条款、论文正文或报告摘要的办公场景。
法务收到一份 80 页的 PDF 采购合同,对方只给了不可编辑的扫描件。合伙人要求逐条核对附件清单里的规格参数是否与正文一致。把 PDF 拖进工具,全文文本带布局输出,清单表格的列对齐保留,法务直接 Ctrl+F 搜索型号,10 分钟完成核对,不用对着扫描件手打。
博士生投稿前需要把论文 PDF 里的作者姓名、单位、基金号全部删除,但正文里的图表标题和参考文献不能动。手动删容易漏掉页眉页脚。用本工具提取纯文本后,在 Word 里全文搜索“张三”“XX 大学”一键替换,保留的段落顺序和换行与原版一致,复审时不会因格式错乱被退修。
投标截止前 2 小时,商务发现标书里 30 处“工期”必须统一替换为“交付周期”,且替换后要标红高亮。PDF 无法直接批量改格式。把文件提取为文本,在编辑器中正则替换并加红色标记,再转回 PDF 提交。本工具保留了原文的段落间距和列表缩进,替换后排版不崩。
出版社编辑拿到一本民国石印本的 PDF,字迹清晰但页面有虫蛀洞。OCR 工具会把缺字识别成乱码。用本工具提取文本后,编辑对照原图逐字校对,保留的换行和段首缩进与刻本一致,省去重新排版的时间。遇到缺字处直接标注缺文符号,后期排版人员能看懂原始版式。
项目经理收到 3 小时会议录音转写的 PDF 纪要,60 页里混着讨论、表决、待办。需要快速摘出所有“责任人:XXX”和“截止日期:X 月 X 日”。把 PDF 扔进工具,得到纯文本后粘贴到 Excel 用公式提取,20 分钟拉出责任矩阵,比在 PDF 里逐页翻找快 5 倍。
| 输入 | 输出 | 说明 |
|---|---|---|
| 这是一段包含换行的文本。 第二行内容。 第三行内容。 | 这是一段包含换行的文本。 第二行内容。 第三行内容。 | 常规:验证多行文本的换行符是否完整保留,不丢失行结构。 |
| 这是一段包含英文、中文、数字123和标点符号!@#的混合文本。 | 这是一段包含英文、中文、数字123和标点符号!@#的混合文本。 | 常规:验证多语种和特殊符号的字符完整性,不出现乱码或截断。 |
| 这是一个包含制表符 和多个空格 的文本。 | 这是一个包含制表符 和多个空格 的文本。 | 常规:验证空白字符(制表符、连续空格)是否原样保留,不合并或删除。 |
| (空PDF,无任何文字) | (输出为空字符串) | 边界:空文档处理,工具应返回空字符串而非报错或乱码。 |
| 这是一段超长文本,重复1000次“测试内容”以模拟大文件。 | (输出为1000次重复的“测试内容”,无截断) | 边界:验证大文件处理能力,不因内存限制而截断或崩溃。 |
| 这是一段包含Unicode字符的文本:😊中文日本語한국어。 | 这是一段包含Unicode字符的文本:😊中文日本語한국어。 | 边界:验证Emoji和多字节字符(如中文、日文、韩文)的完整保留,不出现乱码或丢失。 |
| 这是一段包含换行符、制表符和空格的混合文本: 第一行 制表符后 空格开头 | 这是一段包含换行符、制表符和空格的混合文本: 第一行 制表符后 空格开头 | 易错:混合空白字符(换行+制表符+空格)的布局保留,常见错误是制表符被转成空格或换行被吞。 |
1.PDF 是扫描件,直接提取得到乱码或空文本
上传一个扫描版合同,点击提取后得到一堆乱码或空白先确认 PDF 是否为图片型(无法选中文字),如是则需先 OCR 再提取本工具基于文本层提取,不内置 OCR。扫描件无文本层,提取结果等于空。
2.多栏排版 PDF,提取后文字顺序错乱
上传双栏论文 PDF,提取结果第一段读完跳到第三段,再跳回第二段提取前在工具设置中勾选「保留布局」选项(如有),或手动调整阅读顺序PDF 文本流按物理位置排序,多栏布局会被按行切割,导致逻辑顺序混乱。
3.加密 PDF 不先解密,工具直接报错
上传有打开密码的 PDF,点击提取后提示「无法处理」先用密码解密 PDF(如 Adobe Acrobat 或在线解密工具),再上传提取本工具不处理加密 PDF,必须提前移除密码保护才能读取文本层。
4.提取后文本包含大量多余空格和换行
提取结果每行末尾都有空格,段落间空行过多,影响粘贴使用提取后使用文本编辑器(如 VS Code)的替换功能,将连续空格替换为单个空格PDF 布局引擎会为对齐插入额外空格,工具保留原始布局,不会自动清理。
5.中文 PDF 提取后出现乱码或方框
提取结果中「合同」显示为「合□」或「郃同」确保 PDF 内嵌中文字体,或使用支持 Unicode 的 PDF 生成器重导出PDF 未内嵌字体时,提取工具无法映射字符编码,导致乱码。
6.提取大文件时浏览器卡死或超时
上传 500MB 的 PDF 后,页面无响应,最终提示「提取失败」将大 PDF 拆分为多个 50MB 以内的小文件分批提取本工具在浏览器端处理(WASM),受限于浏览器内存和线程,大文件易崩溃。
7.提取后文本丢失特殊字符(如数学符号、下标)
PDF 中的 H₂O 提取后变成 H2O,α 变成 a提取后手动校对特殊字符,或使用专业 PDF 编辑器导出为 Word 格式PDF 文本层可能用特殊编码表示符号,通用提取工具无法正确映射所有 Unicode 字符。
8.提取结果包含隐藏文本或水印文字
提取结果中出现「机密」「草稿」等水印文字,干扰正文提取前在 PDF 编辑器中删除水印图层,或提取后手动过滤无关文本PDF 的水印和隐藏注释也属于文本层,工具会一并提取,无法区分主次。
文本提取 = 页面对象排序 + 文本块拼接(按阅读顺序)
页面对象排序按PDF内部结构树中对象的逻辑顺序排列文本块拼接将同一行/段落的文本块按左到右、上到下合并一个PDF页面包含两个文本块:左上角(72,720)处"第一章",下方(72,680)处"引言"。工具先按坐标y值降序(720→680)排序,再按x值升序(72→72)排列,最终输出"第一章\n引言",保留原始布局。
不能。本工具基于后端 Go 直接解析 PDF 文件内部的文本流,不包含 OCR(光学字符识别)引擎。如果 PDF 是扫描件或图片型(文字不可选中、复制),提取结果会是空或乱码。需要文字提取的扫描 PDF,建议先用 OCR 工具(如 Adobe Acrobat Pro、在线 OCR 网站)将图片转成可搜索文本后,再上传到本工具提取。
PDF 内部存储文本的逻辑是按「绘制顺序」而非阅读顺序。如果原 PDF 有多栏排版、文本框嵌套、或表格,提取时可能先输出左上角一个浮动文本框,再输出右下角正文。本工具会尽量按空间位置重排(保留布局),但对复杂版式(如报纸多栏、自由文本框重叠)无法 100% 还原阅读顺序。建议提取后手动调整段落顺序。
PDF 中每个字符的位置是独立记录的,单词间的空格可能以「偏移量」而非「空格字符」表示。本工具在重组文本时,如果检测到字符间距大于正常字距,会插入空格;但不同 PDF 生成软件(如某些老版 Word、CAD 导出)的间距规则不一致,可能导致漏加空格。遇到这种情况,可以先用「保留布局」模式尝试,或手动用文本编辑器的查找替换功能补空格。
本工具对上传文件大小有 100MB 限制,超过会拒绝处理。如果 PDF 超过 100MB,建议先用其他工具压缩(如缩小图片分辨率、删除无用页面),再上传。另外,提取结果只输出纯文本,文件大小主要影响上传耗时,处理速度取决于 PDF 页数和文本复杂度。
PDF 本身不存储表格结构,只记录线条和文字的位置。本工具会尝试按坐标将文字分组,但对复杂表格(合并单元格、无边框表、跨页表)很难还原成行列。提取后表格数据通常是散落的文字块。建议这类需求改用专为表格提取设计的工具(如 Tabula、Camelot),或手动复制 PDF 中表格区域后粘贴到 Excel 整理。
不能。本工具无法处理加密 PDF,上传后会提示「文件无法读取」。需要先用密码解锁 PDF(如使用 Adobe Acrobat 的「删除密码」功能,或在线解锁工具),再上传提取。注意:如果 PDF 只有「打开密码」而没有「编辑限制密码」,部分工具可能直接提取;但本工具出于安全考虑,对任何加密 PDF 均拒绝处理。
如果原 PDF 是 Word/PPT 导出(非扫描),Word 另存为的文本通常更准确,因为它直接读取了文档的语义结构(段落、列表、标题)。本工具提取的是 PDF 的「物理层」文本,对复杂格式(如脚注、分栏、文本框)的还原度不如 Word 原生导出。但 Word 另存为需要安装 Office 软件,本工具在线即用,适合快速提取少量文本。
这与 PDF 生成时中英文之间的间距处理有关。某些 PDF 引擎会在中英文之间插入固定宽度空格,本工具「保留布局」模式会保留这些空格。如果觉得多余,可以在提取后使用文本编辑器的正则替换(如查找 `[\u4e00-\u9fa5]\s+[a-zA-Z]` 替换为去掉中间空格),或在本工具结果区手动删除。目前工具没有内置「去多余空格」功能。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。