thiagotigaz/ocr-it · 上手攻略

  • 仓库:thiagotigaz/ocr-it
  • 链接:https://github.com/thiagotigaz/ocr-it
  • 分类:工具 · 浏览器扩展
  • 作者:Tom
  • 更新:2026-08-26

是什么

OCR It 是一款 Chrome / Firefox 浏览器扩展,解决一个具体问题:无法选文字的扫描文档、PDF 阅读器、幻灯片网页,用一次快捷键把页面截图 OCR 成文本。它的核心特性是本地离线 OCR——内置 Tesseract 引擎,截图片段完全在本地处理,扩展本身不发出任何网络请求,不调用任何云端 API。适合扫了整本纸质书或 PDF 后想提取全文喂给 LLM 整理的用户。

解决什么问题

当你遇到以下场景时,传统做法是手动抄录或付费 OCR API: - 学校图书馆的扫描版教材,无法复制文字 - 幻灯片网站只读模式,无法下载 - PDF 嵌入在网页阅读器里,禁止文字选择 - 老报纸、老论文影印版的数字化

OCR It 把这个流程压缩成两步:拖选一次区域 → 按快捷键逐页抓取,不需要 API key,不需要联网,不产生任何费用。

快速安装

Chrome(推荐,从商店装)

直接访问 Chrome Web Store · OCR It,点击安装,自动更新。

Chrome(开发者模式加载源码)

git clone https://github.com/thiagotigaz/ocr-it.git
cd ocr-it
# 不需要 npm run build,源码直接可用
# 打开 chrome://extensions → 开启开发者模式
# → "加载已解压的扩展程序" → 选 ocr-it 目录
# → 在工具栏固定图标
# → 检查 chrome://extensions/shortcuts 确认快捷键已注册

Firefox(临时加载,正式版等待 Mozilla 审核)

# 从 GitHub Releases 下载最新 zip
# 打开 about:debugging#/runtime/this-firefox
# → "临时加载附加组件" → 选择 ocr-it-firefox-*.zip
# 注意:Firefox 退出后临时附加组件自动卸载,需重新加载

⚠️ Firefox 永久安装:Mozilla 审核通过后从 addons.mozilla.org 安装,审核进度见 GitHub Releases

核心用法

手动逐页抓取

  1. 打开文档页面
  2. Alt+Shift+R 绘制选区(文字区域,边距留一点),按 Enter 确认
  3. Alt+Shift+S 截取当前页,OCR 结果追加到面板
  4. 手动翻页,重复第 3 步
  5. 面板内可编辑单页文本、可复制全部、可下载 .txt

全自动连续抓取(自动翻页)

  1. 先用 Alt+Shift+R 画好选区
  2. 打开扩展弹窗,点击 Pick control,再点击文档的"下一页"按钮(存储的是坐标点,不是 CSS 选择器,DOM 重渲染后仍有效)
  3. 可选:设置翻页键盘快捷键(默认发送 ArrowRight 到 iframe)
  4. 点击 Test now 测试翻页是否正常
  5. Alt+Shift+A 开始自动运行:抓图→OCR→翻页→重复,直到按 Esc 停止

核心技术机制

  • Tesseract OCR:内置在扩展包里,完整离线运行,版本随扩展更新
  • 跨域 iframe 支持:大多数嵌入式阅读器在 iframe 里,扩展通过 postMessage 把坐标传递给跨域父帧,找到实际拥有该坐标的帧并向其发送键盘事件
  • Shadow DOM 支持:坐标点查询方式不依赖 CSS 选择器,能穿透 Shadow DOM(document.querySelector 无法到达的地方)
  • 页面计数器:工具栏图标徽章显示待处理队列数,抓取后自动更新

权限说明

  • 安装时不申请任何站点权限
  • 单次抓取走 activeTab 临时权限,触发时由浏览器临时授权
  • 自动运行(跨页面保持)和 iframe 内翻页需要持久权限,扩展弹窗有 Allow 按钮申请当前站点

典型适用场景

场景 体验
扫描版教材整本提取 画一次区域 + 自动翻页,300 页约 30 分钟(取决于 CPU),结果可喂给 Claude 做问答/摘要
幻灯片逐页文字提取 手动逐页 Alt+Shift+S,配合截图留存
图书馆古籍数字化 竖排文字、古体字可切换 Tesseract 语言包(需自行下载)
网页 PDF Reader 禁止复制 与大多数主流 PDF 在线阅读器兼容,包括嵌入 iframe 的场景

坑与注意

  1. 快捷键冲突:Chrome 有时会静默忽略与其他扩展冲突的快捷键。装完要去 chrome://extensions/shortcuts 确认三个快捷键(Alt+Shift+S/A/R)都显示出来了,若空白说明被占用,换一个扩展的快捷键。

  2. Firefox 临时加载每次重启失效:这是 Firefox 对未签名附加组件的安全限制,无法绕开。长期使用等 Mozilla 审核通过,或换 Chrome。

  3. 自动翻页依赖坐标点:如果文档布局变化(如双栏变单栏),之前存储的"下一页按钮"坐标可能偏离,需要重新 Pick。

  4. 选区要覆盖整个文字区域:选区外的文字不会被 OCR,包括页眉页脚;选区可以稍大不要稍小,OCR 会自动识别。

  5. 图片质量影响 OCR 准确率:200 DPI 以上的扫描件效果最好;低分辨率截图(如手机拍屏幕)Tesseract 误识率明显上升。

  6. 语言包:默认 Tesseract 支持英文。中文、日文等语言包需要自行下载并放到扩展目录(扩展内置 Tesseract 版本可能不支持额外语言包,⚠️ 需实测确认)。

  7. 性能:每页 OCR 在后台异步执行,不会卡住浏览器;但大批量(100 页以上)建议分段处理,避免标签页内存积累。

与同类对比

工具 离线 免费 自动翻页 跨域 iframe 适用平台
OCR It(本工具) Chrome / Firefox
Adobe Acrobat Pro OCR ❌(订阅制) N/A(桌面软件) Windows / Mac
Google Keep(网页截图 OCR) 全平台
在线 OCR(iLovePDF 等) 部分免费 浏览器
Tesseract CLI 命令行

核心差异:OCR It 是唯一同时满足「离线 + 免费 + 自动翻页 + 跨域 iframe」的浏览器扩展。其他方案要么需要联网,要么是桌面软件无法对接网页阅读器。

一句话推荐结论

需要从网页版扫描文档里提取文字、又不想折腾 API 或桌面软件?OCR It 是目前最顺手的浏览器扩展方案,免费、本地运行、自动翻页,Alt+Shift 三快捷键搞定全流程。