跳到主内容
Paplume
Beta 免费

OCR 文字识别(扫描件转文字)

上传扫描件 PDF 或图片,识别成可复制、可搜索的文字。支持 9 种识别语言(简繁中文/英/日/韩/德/法/西/葡),导出 txt 与可搜索 PDF,识别在你的浏览器本地完成,文件不上传。

今日免费额度已用 0 / 共 2 次 · 明日 00:00 (UTC) 恢复
  1. 上传扫描件并选识别语言
  2. 逐页识别
  3. 导出结果

正式版定价预告 $6.9/月 或 $49/年 · 开始收费前 30 天邮件通知 · Beta 期不收取任何费用

识别效果示例

扫描件原文(图片,不可选中文字)
扫描件原文(图片,不可选中文字)
会议纪要
日期: 2026 年 8 月 3 日 ”地点:上海办公室
主持人:王小明 ”记录人:李华
一、项目进度汇报
本季度产品开发已完成核心功能的百分之八十,
预计九月底前完成全部测试工作。
本站 OCR 识别结果(真实输出节选)

以上为本站 OCR 引擎对示例扫描件的真实识别输出节选,未经人工修饰。点上方「用示例 PDF 试一试」即可亲自复现。

怎么用(3 步)

1

上传扫描件并选识别语言

支持 PDF 与 JPG/PNG 图片,可选简繁中文/英/日/韩/德/法/西/葡;首次使用每种语言会下载对应识别模型(数 MB 至约 20MB,仅一次)。

2

逐页识别

任务进度实时可见,每页识别完成后即时显示文本。

3

导出结果

可复制全文,或下载 txt / 可搜索 PDF。识别失败自动退还当日额度。

适用场景

  • Chinese PDF OCR online free
  • 扫描件 PDF 转文字在线
  • 图片中文识别提取文字

常见问题

印刷体样本准确率 ≥90%;手写、模糊、倾斜的扫描件准确率会下降,结果请人工核对后再使用。请按文档实际语言选择识别语言,选错语言准确率会明显下降。

试一下 ↑

不会。OCR 引擎(Tesseract WASM)在你的浏览器内运行,文件字节不离开你的设备。需要说明:首次使用时浏览器会从第三方 CDN(jsDelivr)下载识别模型,该 CDN 能看到你的 IP(同任何脚本/字体 CDN 一样),但你的文件绝不参与这次下载。详见隐私政策。

试一下 ↑

首次使用每种识别语言需下载对应模型(西文语种数 MB,中日韩约 10-200MB),浏览器会缓存,之后无需重复下载。

试一下 ↑

OCR 是重活,免费每天 2 次、每次 ≤10 页,第二天 00:00 (UTC) 恢复(Beta 期免费)。

试一下 ↑

无效。对已签名 PDF 的任何修改(合并、压缩、加水印等)都会使原数字签名失效——这是 PDF 签名的防篡改设计,并非本站限制。如需签名有效,请先处理后再签名。

试一下 ↑

可信且可验证:基于浏览器内开源引擎(pdf-lib、pdf.js、Tesseract OCR 等)在你的设备上运行,代码公开可审计;处理时打开 DevTools → Network 即可确认没有任何文件上传请求。

试一下 ↑

相关工具